Juneau: Data Lake Management for Jupyter

Juneau: Data Lake Management for Jupyter
复制标题

DOI:
10.14778/3352063.3352095
复制
发表时间:
2019-08
期刊:
Proc. VLDB Endow.
影响因子:
--
通讯作者:
Yi Zhang;Z. Ives
Yi Zhang;Z. Ives
中科院分区:
其他
文献类型:
--
作者:
Yi Zhang;Z. Ives

文献摘要

被引文献

相似文献

在多研究者实验室等协作环境中,数据科学家需要改进的工具来管理数据集和数据产品,而不是数据记录,以促进数据湖和文件系统中的来源跟踪和数据(和代码)重用。我们展示了Juneau系统,它扩展了计算笔记本软件(Jumeyter Notebook)作为监督和促进改进数据集使用的仪器和数据管理点,通过索引,搜索和推荐“补充”数据源,以前提取的机器学习功能和额外的训练数据。本演示重点介绍我们如何帮助用户通过搜索查找相关数据集
In collaborative settings such as multi-investigator laboratories, data scientists need improved tools to manage not their data records but rather their data sets and data products , to facilitate both provenance tracking and data (and code) reuse within their data lakes and file systems. We demonstrate the Juneau System, which extends computational notebook software (Jupyter Notebook) as an instrumentation and data management point for overseeing and facilitating improved dataset usage, through capabilities for indexing, searching, and recommending “complementary” data sources, previously extracted machine learning features, and additional training data. This demonstration focuses on how we help the user find re-lated datasets via search