Eszközök

Tencent ARGUS rendszere: valós idejű nyomkövetés és hibaelemzés 10 000+ GPU-s klasztereken

A főszereplő a Tencent és annak ARGUS nevű szoftvere, amelyet nagy léptékű AI-tréningek telemetriájának gyűjtésére és hibakeresésére fejlesztettek.

Tencent ARGUS rendszere: valós idejű nyomkövetés és hibaelemzés 10 000+ GPU-s klasztereken

A Tencent részletezte ARGUS nevű szoftverét, amelyet nagyszámú GPU-t tartalmazó klasztereknél használ a telemetria gyűjtésére és hibaelemzésre. A cég szerint az ARGUS „alacsony terhelésű, finom szemcsézettségű, mindig bekapcsolt trace és valós idejű elemző rendszer nagy méretű (large-scale) tanítási munkaterhelésekhez”.

Mire való az ARGUS

Az ARGUS célja, hogy adatokat gyűjtsön és segítsen hibákat kiküszöbölni a mesterséges intelligencia rendszerek képzése során felmerülő problémák azonosításában és diagnosztizálásában. A Tencent leírása szerint a szoftver három rétegű architektúrára épül:

  • Python réteg: ütemezéshez és adatelőkészítéshez;
  • keretrendszer (framework) réteg: a képzési fázisok koordinálásához;
  • GPU runtime réteg: a kernelvégrehajtás nyomon követéséhez.

A rendszer mindig bekapcsolt, finom felbontású nyomkövetést és valós idejű elemzést biztosít, miközben állítása szerint alacsony overheaddel jár.

Üzemeltetés és esettanulmányok

A Tencent azt írja, hogy az ARGUS-t több mint hat hónapon át futtatták egy éles (production) klaszteren, amely több mint 10 000 GPU-t tartalmazott. A dokumentáció öt valós világban előforduló esettanulmányon keresztül mutatja be a rendszer gyakorlati hasznát:

  • compute straggler-ek diagnosztizálása (lassabb GPU-k okozta problémák),
  • kommunikációs linkek teljesítményromlásának azonosítása,
  • pipeline bubble-ok felerősödésének elemzése,
  • JIT (just-in-time) fordítási blokkolás feltárása,
  • kommunikációs tünetek által elfedett compute straggler-ek diagnosztikája.

A Tencent néhány konkrét nagy léptékű képzési futtatást is megemlít: egy 4096-GPU-s videónyelvi modell képzési feladat (feltehetően a „HunyuanVideo” modell), egy 512-GPU-s hangmodell képzés, valamint egy 12 960-GPU-s Mixture-of-Experts (MoE) képzés (valószínűleg egy Hunyuan nagy nyelvi modellhez kapcsolódó munka).

Miért fontos ez

Az ARGUS-szerű rendszerek megléte arra utal, hogy a környezet és az infrastruktúra elég komplex és nagyméretű ahhoz, hogy érdemes saját eszközöket fejleszteni a telemetria és a diagnosztika terén. Maga a megoldás önmagában nem feltétlenül különleges — hasonló rendszerekre számítani lehet bármely jelentős kutató- vagy fejlesztőcsoportnál — de a részletek és a több mint 10 000 GPU-s, huzamos üzemeltetés a Tencent képzési infrastruktúrájának érettségét jelzik.

A Tencent dokumentuma szerint az ARGUS stabilan futott az éles klaszteren több mint hat hónapig, és kulcsszerepet játszott a gyors «fail-slow» (lassú hibadetektálás) és a teljesítményoptimalizálás folyamatában.

További forrás

A részletes technikai leírást a Tencent munkája kiegészíti egy arXiv közleménnyel, amely az ARGUS: Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters címet viseli.