Similarity Join over Array Data

Similarity Join over Array Data
复制标题

数组数据的相似性连接

DOI:
--
复制
发表时间:
2016
期刊:
SIGMOD Conference
影响因子:
--
通讯作者:
Kesheng Wu
Kesheng Wu
中科院分区:
--
文献类型:
--
作者:
Weijie Zhao;Florin Rusu;Bin Dong;Kesheng Wu

文献摘要

被引文献

相似文献

科学应用程序正在生成越来越多的多维数据,这些数据主要在分布式阵列数据库和框架内进行处理。相似性连接是跨科学工作负载的基本操作,需要对无限数量的多维点对进行复杂处理。在本文中,我们介绍了一种新的分布式相似连接操作的多维数组。不像直接扩展到数组连接和关系相似性连接,建议的运营商最大限度地减少整体数据传输和网络拥塞,同时提供负载平衡,而不完全重新分区和复制输入数组。我们正式定义了数组相似连接,并提出了设计,优化策略,并评估第一个数组相似连接操作。
Scientific applications are generating an ever-increasing volume of multi-dimensional data that are largely processed inside distributed array databases and frameworks. Similarity join is a fundamental operation across scientific workloads that requires complex processing over an unbounded number of pairs of multi-dimensional points. In this paper, we introduce a novel distributed similarity join operator for multi-dimensional arrays. Unlike immediate extensions to array join and relational similarity join, the proposed operator minimizes the overall data transfer and network congestion while providing load-balancing, without completely repartitioning and replicating the input arrays. We define formally array similarity join and present the design, optimization strategies, and evaluation of the first array similarity join operator.