The anachronism of whole-GPU accounting

The anachronism of whole-GPU accounting
复制标题

全 GPU 计算的时代错误

DOI:
10.1145/3491418.3535125
复制
发表时间:
2022
期刊:
Practice and Experience in Advanced Research Computing
影响因子:
--
通讯作者:
Mishin, Dmitry
Mishin, Dmitry
中科院分区:
--
文献类型:
--
作者:
Sfiligoi, Igor;Schultz, David;Würthwein, Frank;Riedel, Benedikt;Mishin, Dmitry

文献摘要

参考文献

相似文献

NVIDIA在提高其GPU的计算性能方面取得了稳步进展,多年来计算吞吐量得到了数量级的改善。由于多种GPU型号在许多部署中共存,将所有GPU视为平等的传统计费方法不再反映计算输出。此外,对于需要大量基于CPU的计算来补充基于GPU的计算的应用程序,充分利用新的GPU变得越来越困难,需要在多个应用程序之间共享这些GPU,以最大限度地提高可实现的科学输出。这进一步降低了整个GPU核算的价值,特别是在基础设施级别进行共享时。因此,我们认为,面向吞吐量的基础设施的GPU核算应该以GPU核心小时数表示,就像通常对CPU所做的那样。虽然GPU核心计算吞吐量在GPU代之间确实会发生变化,但这种变化与我们期望在CPU核心中看到的变化类似。为了验证我们的立场,我们使用本地和云资源,在14个GPU模型上对两个IceCube光子传播工作流进行了大量的运行时测量。测量还概述了GPU共享在HTCondor和Kubernetes基础设施级别的影响。
NVIDIA has been making steady progress in increasing the compute performance of its GPUs, resulting in order of magnitude compute throughput improvements over the years. With several models of GPUs coexisting in many deployments, the traditional accounting method of treating all GPUs as being equal is not reflecting compute output anymore. Moreover, for applications that require significant CPU-based compute to complement the GPU-based compute, it is becoming harder and harder to make full use of the newer GPUs, requiring sharing of those GPUs between multiple applications in order to maximize the achievable science output. This further reduces the value of whole-GPU accounting, especially when the sharing is done at the infrastructure level. We thus argue that GPU accounting for throughput-oriented infrastructures should be expressed in GPU core hours, much like it is normally done for the CPUs. While GPU core compute throughput does change between GPU generations, the variability is similar to what we expect to see among CPU cores. To validate our position, we present an extensive set of run time measurements of two IceCube photon propagation workflows on 14 GPU models, using both on-prem and Cloud resources. The measurements also outline the influence of GPU sharing at both HTCondor and Kubernetes infrastructure level.
通过延长网格环境中试点作业的生命周期,最大限度地减少排水浪费
DOI: --
发表时间: 2014
期刊:
影响因子: --
作者:
I. Sfiligoi;Thomas Martin;B. Bockelman;D. Bradley;F. Würthwein
通讯作者: F. Würthwein
IceProd 框架:IceCube 中微子观测站的分布式数据处理
DOI: --
发表时间: 2013
期刊: J. Parallel Distributed Comput.
影响因子: --
作者:
M. Aartsen;R. Abbasi;M. Ackermann;Jenni Adams;J. Aguilar;M. Ahlers;D. Altmann;C. A. A. Delgado;J. Auffenberg;X. Bai;Michael F. Baker;S. Barwick;Volker Baum;R. Bay;J. Beatty;J. Tjus;K. Becker;S. BenZvi;P. Berghaus;D. Berley;E. Bernardini;A. Bernhard;D. Besson;G. Binder;D. Bindig;M. Bissok;E. Blaufuss;J. Blumenthal;D. Boersma;C. Bohm;D. Bose;S. Böser;O. Botner;L. Brayeur;H. Bretz;A. Brown;R. Bruijn;J. Casey;M. Casier;D. Chirkin;A. Christov;B. Christy;K. Clark;L. Classen;F. Clevermann;S. Coenders;S. Cohen;D. Cowen;Angel H. Cruz Silva;M. Danninger;J. Daughhetee;James C. Davis;M. Day;C. Clercq;S. Ridder;P. Desiati;K. D. Vries;M. With;T. DeYoung;J. C. Díaz;M. Dunkman;R. Eagan;B. Eberhardt;B. Eichmann;J. Eisch;S. Euler;P. Evenson;O. Fadiran;A. Fazely;A. Fedynitch;J. Feintzeig;T. Feusels;K. Filimonov;C. Finley;T. Fischer;S. Flis;A. Franckowiak;K. Frantzen;T. Fuchs;T. Gaisser;J. Gallagher;L. Gerhardt;L. Gladstone;T. Glüsenkamp;A. Goldschmidt;G. Golup;Javier G. González;J. Goodman;D. Góra;D. Grandmont;D. Grant;P. Gretskov;J. Groh;A. Groß;C. Ha;A. H. Ismail;P. Hallen;A. Hallgren;F. Halzen;K. Hanson;D. Hebecker;D. Heereman;D. Heinen;K. Helbing;R. Hellauer;S. Hickford;G. Hill;K. Hoffman;R. Hoffmann;A. Homeier;K. Hoshina;F. Huang;W. Huelsnitz;P. O. Hulth;K. Hultqvist;S. Hussain;A. Ishihara;E. Jacobi;J. Jacobsen;K. Jagielski;G. Japaridze;K. Jero;O. Jlelati;B. Kaminsky;A. Kappes;T. Karg;A. Karle;M. Kauer;J. Kelley;J. Kiryluk;J. Kläs;S. Klein;J. Köhne;G. Kohnen;H. Kolanoski;L. Köpke;C. Kopper;S. Kopper;D. Koskinen;M. Kowalski;M. Krasberg;A. Kriesten;K. Krings;G. Kroll;J. Kunnen;N. Kurahashi;T. Kuwabara;M. Labare;H. Landsman;M. Larson;M. Lesiak;M. Leuermann;J. Leute;J. Lünemann;Oscar A. Macías;J. Madsen;G. Maggi;R. Maruyama;K. Mase;H. Matis;F. McNally;K. Meagher;M. Merck;G. Arévalo;T. Meures;S. Miarecki;E. Middell;N. Milke;John L. Miller;L. Mohrmann;T. Montaruli;R. Morse;R. Nahnhauer;U. Naumann;H. Niederhausen;S. Nowicki;D. Nygren;A. Obertacke;S. Odrowski;A. Olivas;A. Omairat;A. Murchadha;L. Paul;J. Pepper;C. D. L. Heros;C. Pfendner;D. Pieloth;E. Pinat;J. Posselt;P. Price;G. Przybylski;M. Quinnan;L. Rädel;Ian Rae;M. Rameez;K. Rawlins;P. Redl;R. Reimann;E. Resconi;W. Rhode;M. Ribordy;M. Richman;B. Riedel;J. Rodrigues;C. Rott;T. Ruhe;B. Ruzybayev;D. Ryckbosch;S. M. Saba;H. Sander;J. Santander;S. Sarkar;K. Schatto;F. Scheriau;T. Schmidt;M. Schmitz;S. Schoenen;S. Schöneberg;A. Schönwald;A. Schukraft;L. Schulte;D. Schultz;O. Schulz;D. Seckel;Yolanda Sestayo de la Cerra;S. Seunarine;R. Shanidze;C. Sheremata;Miles W. E. Smith;D. Soldin;G. Spiczak;C. Spiering;M. Stamatikos;T. Stanev;N. Stanisha;Alexander Stasik;T. Stezelberger;R. Stokstad;A. Stößl;E. Strahler;R. Ström;N. Strotjohann;G. Sullivan;H. Taavola;I. Taboada;A. Tamburro;A. Tepe;S. Ter;G. Tesic;S. Tilav;P. Toale;M. Tobin;S. Toscano;M. Tselengidou;E. Unger;M. Usner;S. Vallecorsa;N. Eijndhoven;A. Overloop;J. Santen;M. Vehring;M. Voge;M. Vraeghe;C. Walck;T. Waldenmaier;M. Wallraff;C. Weaver;M. Wellons;C. Wendt;S. Westerhoff;N. Whitehorn;K. Wiebe;C. Wiebusch;Dawn R. Williams;H. Wissing;M. Wolf;T. R. Wood;K. Woschnagg;Donglian Xu;Xianwu Xu;Juan Pablo Yáñez Garza;G. Yodh;S. Yoshida;P. Zarzhitsky;J. Ziemann;S. Zierke;M. Zoll
通讯作者: M. Zoll