MapReduce Optimization Using Mapper-side Aggregation

MapReduce Optimization Using Mapper-side Aggregation
复制标题

使用 Mapper 端聚合进行 MapReduce 优化

DOI:
--
复制
发表时间:
2013
影响因子:
0.6
通讯作者:
Moriai Satoshi
Moriai Satoshi
中科院分区:
数学3区
文献类型:
--
作者:
Ozawa Tsuyoshi;Onizuka Makoto;Fukumoto Yoshifumi;Moriai Satoshi

文献摘要

被引文献

相似文献

本稿では,MapReduce で行う処理のうち,部分集約が可能な処理を高速化する手法を示す.部分 集約が可能な処理とは,集約時に結合法則と交換法則が成立する処理のことを指す.部分集約ができ る処理に対して,既存研究では特有の処理系を新たに作成することにより高速化を行っていた.しか し,これらの手法は MapReduce の仕組みを大幅に変更する必要があることから,Hadoop に組み 込むのは 困難であった.そこで本研究では,Hadoop への実装コストが低く抑え,高速化をおこな う Map Multi-Reduce の提案を行う.Map Multi-Reduce は,MapReduce に Record Reduce と Local Reduce の 2つの機能を追加した,MapReduce の拡張版である.提案手法の実装を行うにあ たり行った Hadoop への変更量は,Record Reduce で 約 200 行,LocalReduce で約 300 行と小 さい.このように少ない変更量にも関わらず,ディスク IOとネットワーク IOが削減され,実験によ り 2TB WordCount を行う際に,処理速度が 1.7 倍になることを確認した.また,100GB のデー タに対して WordCount を行った際に,最大で Map 処理と Reduce 処理間のデータの受け渡しを 50% に削減できることを確認し,より大きな入力データに対して,データの受け渡しコストをより 削減できる可能性があることを示す.