2026. július 8., szerda · Kutatás

Az NVIDIA nemegyenletes tenzorpárhuzamossága csökkenti a GPU-kiesések hatását az LLM-tréningben

Az NVIDIA műszaki blogján bemutatott Nonuniform Tensor Parallelism (NTP) keretrendszer lehetővé teszi, hogy nagy léptékű LLM-tréningek dinamikusan alkalmazkodjanak az átmenetileg elérhetetlenné váló GPU-khoz. Az NVIDIA állítása szerint az NTP az aktív GPU-k órajelének ideiglenes növelésével (dinamikus teljesítménynöveléssel) kompenzálja a kiesést, miközben a tenzor-újrafelosztás okozta többletterhelés 1% alatt marad. A módszer a Blackwell és Blackwell Ultra rendszerek NVLink összeköttetésein akár 72 GPU-s tartományokra is skálázható. Az NTP kísérleti jellegű megközelítés, amely a meglévő rugalmas skálázási technikákat – mint az adatreplikák eldobása vagy gyors ellenőrzőpont-újraindítás – egészíti ki azzal, hogy az áteresztőképesség-veszteséget minimalizálja a csökkentett rendelkezésre állás időszakában.

Miért fontos?

A módszer a nagyszabású LLM-tréningek hasznos munkavégzési hatékonyságát (Goodput) védi GPU-kiesések esetén, csökkentve a költséges leállásokat.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 8., szerda napi AI összefoglaló része.

Kapcsolódó hírek

Nvidia: a szoftveres keret dönti el az AI-ügynök sikerét, nem a modell

Az Nvidia péntek óta ismert kutatása szerint hosszú távú, sok lépésből álló feladatoknál nem a modell, hanem a köré épített szoftveres keret (harness) a döntő tényező. A cég állítása szerint egy egyedi, memóriakezelésre optimalizált és „felügyelő” komponenssel ellátott keretben a Claude Opus 5 modell 100%-os eredményt ért el az ARC-AGI-3 benchmarkon, amely instrukció nélküli 2D-s játékokból áll. Ugyanez a modell harness nélkül csak 30%-ot ért el, ami így is a legjobb eredmény volt a tesztelt modellek között. Az Nvidia szakembere szerint az ügynök valójában nem csak a modellből áll, hanem az eszközökből, a futásidőből és a hozzáférhető könyvtárakból is, amelyek együtt adják a tényleges teljesítményt. A cikk kontrasztként megemlíti a Microsoft áprilisi kutatását is, amely szerint 19 nagy nyelvi modell mindegyike hibázott hosszú dokumentumszerkesztési feladatoknál.

NVIDIA RoboLab: új értékelési platform az általános célú robotirányítási modellek tesztelésére

Az NVIDIA Research bemutatta a RoboLab nevű platformot, amely a robotikában használt általános célú irányítási modellek (policy-k) szisztematikus értékelésére szolgál szimulált környezetben. A rendszer az NVIDIA szerint megoldja a korábbi benchmarkok fő problémáit: a vizuális és feladatbeli átfedést a tréning- és tesztadatok között, a benchmarkok telítődését, valamint a magas beállítási költséget, miközben robotfüggetlen, gyorsan skálázható feladat- és jelenetgenerálást kínál. A platform részletes diagnosztikai eszközöket integrál, köztük részleges pontszámítást, SPARC-alapú mozgásminőség-elemzést és hibaeseménynaplózást. Az NVIDIA tervei szerint a RoboLab funkcionalitása 2026 augusztusától beépül az NVIDIA Isaac Lab-Arena rendszerébe.

AI-főnök először rúgott ki emberi alkalmazottat egy san franciscói boltban

Az Andon Labs cég szerint az általuk üzemeltetett Luna nevű AI-ügynök áprilisa óta vezeti a San Franciscó-i Andon Marketet, és most először bocsátott el egy emberi dolgozót. Luna az Anthropic Claude Opus 4.8 modelljén futott, saját maga írt korábban egy szabályzatot a késésekről, ám ez az emlékezetéből kiesett, így sokáig elnézte a problémákat: a cég szerint a dolgozó 23 műszakból 17-ben késett, ebből Luna csak hatot rögzített hivatalosan. A dolgozó emellett céges kártyát is használt tiltás ellenére, és utasításokat hagyott figyelmen kívül. Az elbocsátásra végül csak azután került sor, hogy emberek emlékeztették Lunát saját szabályaira; a döntést emberek vizsgálták felül és hajtották végre. Az Andon Labs szerint hét modell tesztelésekor a képességesebb AI-modellek következetesebben javasolták a felmondást, mint a gyengébbek.

Tanulmány szerint az AI nem javíthatja, csak felszínesebbé teheti a kutatást

Egy elméleti közgazdasági modell, amelyet a Princeton, a University of Washington és más intézmények kutatói jegyeznek, azt vizsgálja, mi történik, ha a nyelvi modellek időt takarítanak meg a tudósoknak. A szerzők a mesterséges intelligenciát idealizáltan, hibamentesnek és gyakorlatilag ingyenesnek feltételezik, hogy tisztán az időmegtakarítás hatását mérhessék. A viselkedésökológiából ismert táplálékkereső modellt adaptálva azt állítják, hogy a felszabaduló idő alternatívaköltsége megnő: minden órát, amit egy meglévő projektre fordítanak, elveszítenek egy új elindításától. A modell szerint három lehetséges forgatókönyvből kettőben az AI alkalmazása felszínesebb kutatáshoz vezet, mert a kutatók inkább új projekteket indítanak, semmint elmélyülnének a meglévőkben. Ez egy nem lektorált, elméleti modellezésen alapuló állítás, nem empirikus mérés eredménye.