2026. szeptember 17., csütörtök · Eszközök
AWS és NVIDIA: hibatűrő elosztott tanítás Amazon EKS-en NVRx-szel
Az AWS hivatalos gépi tanulási blogja bemutatja, hogyan lehet a NVIDIA Resiliency Extension (NVRx) nevű, pip-telepíthető PyTorch-kiegészítőt integrálni FSDP alapú elosztott tanításba Amazon EKS-fürtökön. A cikk szerint nagy léptékű, órákig-napokig futó, sok csomópontos tanítási feladatoknál a hibák (hálózati kimaradás, memóriahiba, szoftverkivétel) statisztikailag elkerülhetetlenek, egy GPU-hiba pedig láncreakciót indíthat a teljes fürtben. Az AWS állítása szerint a szinkron checkpointolás a vizsgált fürtméreteknél a teljes futásidő akár 40 százalékát is felemésztette I/O-várakozással. A bemutatott megoldás három elemből áll: aszinkron checkpointolás (async_save), folyamaton belüli újraindítás másodperceken belül, valamint ft_launcher a munkás-processzek automatikus újraindítására összeomlás esetén; a méréseket H100 GPU-kon, 2-8 csomópontos fürtökön végezték.
Miért fontos?
A cikk konkrét mérőszáma – a szinkron checkpointolás miatti akár 40%-os holtidő – rávilágít arra, mekkora GPU-óra és költség veszhet el nagy AWS-alapú tanítási fürtökben egyetlen hardverhiba miatt.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 17., csütörtök napi AI összefoglaló része.