エクサスケールスーパーコンピューティングに向けたスケーラブルな耐故障技術
エクサスケールスーパーコンピューティングに向けたスケーラブルな耐故障技術
批准号:
10J55202
负责人:
LEONARDOARTURO BautistaGomez (2011)
金额:
$0.9万
依托单位国家:
日本
项目类别:
Grant-in-Aid for JSPS Fellows
财政年份:
2010
资助国家:
日本
项目状态:
已结题
起止时间:
2010 至 2011
中文摘要
大規模なアプリケーションでは高性能なスーパーコンピュータを利用した場合においても実行時間が非常に長く、アプリケーション実行中にハードウェア障害が起こる可能性を考慮する必要がある。この対策として実行中のアプリケーションイメージを定期的に集中型ストレージへ保存し、障害発生時には保存したイメージからアプリケーションの実行を再開するチェックポイント・リスタート技術が重要である。しかし、集中型ストレージとのI/Oのバンド幅性能が律速となっているためアプリケーションの大規模化によるチェックポイントの保存に費やす時間の増加が問題となっており、今日のスーパーコンピュータにおいて25%、さらに将来のスーパーコンピュータにおいては50%程度に増加することが予測されている。ディスクレスチェックポイントはスケーラブルな各計算ノード上の記憶領域にチェックポイントイメージを分散して持たせることによって従来のストレージI/Oコストによる律速の問題を解決する技術である。ディスクレスチェックポイントを拡張し、より高信頼かつ高効率なチェックポイント技術を提案しその評価を行った。提案チェックポイントでは実行環境のトポロジーに適したチェックポイント符号化グループを構成することでチェックポイントコストの削減し、またリードソロモン符号化アルゴリズムに基づき、さらに耐故障のためのスレッドを活用することで符号化オーバヘッドを隠蔽する超低オーバヘッドの耐故障インターフェイス(FTI)を開発した。FTIライブラリを地震波シミュレーションコードSPECFEM3Dに適用した結果、TSUBAME2.0の1000GPU規模の実行において6分に一度という高いチェックポイント頻度を高々8%程度のオーバヘッドで実現することができ、将来のエクサスケールの時代においても有効であることを証明した。これらの結果をACM/IEEE Supercomputing 2011において発表し、ベストペーパー賞に相当するSpecial Recognition Award for Perfect Score(論文特別賞)および日本から初となるGeorge Michael博士フェローシップHonorable Mention(奨励賞)を受賞した。
英文摘要
大規模なアプリケーションでは高性能なスーパーコンピュータを利用した場合においても実行時間が非常に長く、アプリケーション実行中にハードウェア障害が起こる可能性を考慮する必要がある。この対策として実行中のアプリケーションイメージを定期的に集中型ストレージへ保存し、障害発生時には保存したイメージからアプリケーションの実行を再開するチェックポイント・リスタート技術が重要である。しかし、集中型ストレージとのI/Oのバンド幅性能が律速となっているためアプリケーションの大規模化によるチェックポイントの保存に費やす時間の増加が問題となっており、今日のスーパーコンピュータにおいて25%、さらに将来のスーパーコンピュータにおいては50%程度に増加することが予測されている。ディスクレスチェックポイントはスケーラブルな各計算ノード上の記憶領域にチェックポイントイメージを分散して持たせることによって従来のストレージI/Oコストによる律速の問題を解決する技術である。ディスクレスチェックポイントを拡張し、より高信頼かつ高効率なチェックポイント技術を提案しその評価を行った。提案チェックポイントでは実行環境のトポロジーに適したチェックポイント符号化グループを構成することでチェックポイントコストの削減し、またリードソロモン符号化アルゴリズムに基づき、さらに耐故障のためのスレッドを活用することで符号化オーバヘッドを隠蔽する超低オーバヘッドの耐故障インターフェイス(FTI)を開発した。FTIライブラリを地震波シミュレーションコードSPECFEM3Dに適用した結果、TSUBAME2.0の1000GPU規模の実行において6分に一度という高いチェックポイント頻度を高々8%程度のオーバヘッドで実現することができ、将来のエクサスケールの時代においても有効であることを証明した。これらの結果をACM/IEEE Supercomputing 2011において発表し、ベストペーパー賞に相当するSpecial Recognition Award for Perfect Score(論文特別賞)および日本から初となるGeorge Michael博士フェローシップHonorable Mention(奨励賞)を受賞した。
期刊论文(0)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
Fast checkpoint restart for sustained petascale computing : Opportunities and directions
快速检查点重启以实现持续的千万亿级计算:机遇和方向
DOI:
--
发表时间:
2011
期刊:
影响因子:
--
作者:
[Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez]
通讯作者:
Leonardo Bautista Gomez
Fault Tolerance Interface : Over 100Tflops earthquake simulations using more than 1000 GPUs on TSUBAME2.0
容错接口:在 TSUBAME2.0 上使用 1000 多个 GPU 进行超过 100Tflops 的地震模拟
DOI:
--
发表时间:
2011
期刊:
影响因子:
--
作者:
[Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez]
通讯作者:
Leonardo Bautista Gomez
Transparent low-overhead checkpoint for GPU-accelerated clusters
GPU 加速集群的透明低开销检查点
DOI:
--
发表时间:
2010
期刊:
影响因子:
--
作者:
[Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez]
通讯作者:
Leonardo Bautista Gomez
Low-overhead checkpoint for large-scale GPU-accelerated systems
适用于大规模 GPU 加速系统的低开销检查点
DOI:
--
发表时间:
2010
期刊:
情報処理学会研究報告
影响因子:
--
作者:
[Leonardo Bautista Gomez, Leonardo Bautista Gomez, Leonardo Bautista Gomez]
通讯作者:
Leonardo Bautista Gomez
DOI:
10.1109/hipc.2010.5713163
发表时间:
2010-12
期刊:
2010 International Conference on High Performance Computing
影响因子:
--
作者:
[L. Bautista-Gomez;Akira Nukada;N. Maruyama;F. Cappello;S. Matsuoka]
通讯作者:
L. Bautista-Gomez;Akira Nukada;N. Maruyama;F. Cappello;S. Matsuoka
共 7 条
海外基金