Feature grouping-based parallel outlier mining of categorical data using spark
Feature grouping-based parallel outlier mining of categorical data using spark
复制标题
使用 Spark 对分类数据进行基于特征分组的并行异常值挖掘
DOI:
10.1016/j.ins.2019.07.045
复制
发表时间:
2019-12
影响因子:
8.1
通讯作者:
Xun Yaling
中科院分区:
文献类型:
--
作者:
Li Junli;Zhang Jifu;Qin Xiao;Xun Yaling
This paper proposes a feature-grouping based parallel outlier mining method calledPOSfor high-dimensional categorical datasets. Existing methods of outlier mining are inadequate to deal with datasets which are so voluminous and complex. We solve this problem by proposing a parallel framework using the Spark platform for categorical and mass data.POSis composed of two modules, which are parallel feature grouping, and parallel outlier mining. Additionally, Vertical transformation is utilized to improve the performance ofPOS. We implement ourPOSon the Spark platform and evaluate it using synthetic and real-world datasets. Our experimental results confirm thatPOSis a promising and practical parallel algorithm to mine outliers in high-dimensional categorical datasets becausePOSachieves high performance in terms of extensibility and scalability.
登录
查看更多内容
影响因子:
4.8
作者:
M. Otey;A. Ghoting;S. Parthasarathy
通讯作者:
M. Otey;A. Ghoting;S. Parthasarathy
影响因子:
8.8
作者:
Zhang Jifu;Yu Xiaolong;Li Yonghong;Zhang Sulan;Xun Yaling;Qin Xiao
通讯作者:
Qin Xiao
DOI:
10.1007/11538059_42
发表时间:
2005-03
期刊:
--
影响因子:
--
作者:
Zengyou He;S. Deng;Xiaofei Xu
通讯作者:
Zengyou He;S. Deng;Xiaofei Xu
DOI:
10.1109/tsmc.2018.2847625
发表时间:
2020-11
期刊:
IEEE Transactions on Systems, Man, and Cybernetics: Systems
影响因子:
--
作者:
Li Junli;Zhang Jifu;Pang Ning;Qin Xiao
通讯作者:
Qin Xiao
DOI:
--
发表时间:
2015-05
期刊:
J. Mach. Learn. Res.
影响因子:
--
作者:
Xiangrui Meng;Joseph K. Bradley;Burak Yavuz;Evan R. Sparks;S. Venkataraman;Davies Liu;Jeremy Freeman-Jeremy-Free
通讯作者:
Xiangrui Meng;Joseph K. Bradley;Burak Yavuz;Evan R. Sparks;S. Venkataraman;Davies Liu;Jeremy Freeman-Jeremy-Free