2026. július 23., csütörtök · Eszközök

A TensorRT motorépítés immár valós időben nyomon követhető és megszakítható

Az NVIDIA technikai blogján bemutatta, hogyan használható a TensorRT-ben több kiadás óta elérhető IProgressMonitor API a motorépítés valós idejű követésére és megszakítására Python és C++ környezetben. A cég szerint nagy modellek és mély taktikakeresés akár percekig tartó építést eredményezhet, ami felügyelet nélkül elvesztegetett GPU-órákat okozhat. Az API három metódus felülírásával fa struktúrájú fáziskövetést és Ctrl-C vagy programozott leállítási jelekre való reagálást tesz lehetővé. Az integráció révén a haladási információ terminálba, IDE-be, HTTP-szolgáltatásba vagy ügynök-futtatókörnyezetbe továbbítható, de szálbiztonság és megszakítási késleltetés gondos kezelését igényli.

Miért fontos?

A TensorRT motorépítés átláthatóbbá és megszakíthatóvá válásával csökkenthető az elvesztegetett GPU-idő és javítható a fejlesztői hatékonyság.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 23., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

NVIDIA bemutatja a modern CUDA eszköztárat: akár 300-szoros gyorsulás

Az NVIDIA hivatalos technikai blogja egy lépésről lépésre bemutatott optimalizálási példán keresztül ismerteti a modern CUDA eszköztárat egy képfeldolgozó pipeline-on. A vállalat állítása szerint a CCCL könyvtár modern indexelési modellje és a Compute Sanitizer segítségével kiszűrhetők a memóriahibák, a CUB algoritmusok bevezetése pedig a számítási időt 2,1 másodpercről 773 mikroszekundumra, azaz 2717-szeresére gyorsította képenként. Az NVIDIA szerint a pool-alapú memóriakezelés 2,6-szoros, a pinned host-memória pedig 10-szeres gyorsulást hozott az adatátvitelben, míg a stream-enkénti párhuzamosítással a teljes futásidő 6,8 másodpercről 23 milliszekundumra, összesen 300-szorosára csökkent. A cikk kódpéldákkal és Google Colab notebookkal is szolgál a bemutatott technikák kipróbálásához.

NVIDIA új eszközzel egyszerűsíti a nyílt AI-modellek C++ integrálását

Az NVIDIA saját közleménye szerint elérhetővé tette a TensorRT Model Connect nevű eszközt, amely nyílt AI-modellek natív C++ alkalmazásokba történő beépítését egyszerűsíti le. A vállalat állítása szerint a folyamat két lépésre bontható: előbb egy Python parancssori eszközzel egy Hugging Face modellazonosítóból telepítési csomag épül, majd ezt egy C++ alkalmazás futásidőben betöltve futtatja, PyTorch vagy Python interpreter nélkül. Az NVIDIA szerint két API-szint áll rendelkezésre: egy feladatszintű szemantikus felület, illetve egy modulszintű, tenzor- és komponensvezérlést lehetővé tevő verzió, továbbá TVM FFI-n keresztül egyéni GPU-kernelek is beépíthetők a pipeline-ba. A cég közlése szerint a fejlesztés AI-alapú kódolóügynökökkel és éjszakai kiadásokkal zajlik, hogy lépést tartson a nyílt modellökoszisztémával.

AWS: nyílt forráskódú AI-ügynök vezérli a SageMaker HyperPod klasztereket

Az AWS bemutatta a HyperPod InstantStart nevű nyílt forráskódú vezérlőréteget, amely az Amazon SageMaker HyperPod klaszterek – gépi tanulási modellek futtatására szolgáló, Amazon EKS-re épülő infrastruktúra – beállítását és napi üzemeltetését automatizálja. A vállalat állítása szerint a rendszer egyetlen, a felhasználó AWS-fiókjában futó menedzsment-konténerként működik, és ugyanazt a háttér-API-t szolgálja ki webes felületen és parancssoron keresztül is. Az AWS szerint egy AI-ügynök tervezi meg és futtatja a többlépcsős folyamatot – hálózat, tárhely, azonosságkezelés, node-helyreállítás, modellkiszolgálás –, és csak az elérhetőségi zóna vagy a példánytípus kiválasztásánál áll meg döntésre várva. A cég szerint a megbízhatóság kulcsa, hogy a működési szabályokat egy vezérlőréteg API-jába kódolják, nem pedig nyers parancssori hozzáférést adnak az ügynöknek.

AWS és NVIDIA: automatizált AI-gyártósor fizikai robotoknak

Az AWS hivatalos technikai blogja szerint a NVIDIA Cosmos 3 nevű nyílt, omnimodális világmodelljével és az Amazon SageMaker HyperPod infrastruktúrával úgynevezett Physical AI modellgyárat lehet építeni robotok és autonóm járművek számára. A leírás szerint a rendszer folyamatos hurokban generál szintetikus adatot, utótanítja az érzékelési és irányítási modelleket, majd zárt hurkú szimulációban értékeli őket, egyetlen Kubernetes-alapú klaszteren, elkerülve a külön GPU-kapacitást igénylő szakaszos gyakorlatot. Az AWS bemutatja a Cosmos 3 Mixture-of-Transformers architektúráját, valamint egy nyilvános DROID adathalmazon futtatott robotirányítási utótanítási példát, a kód pedig elérhető GitHubon. A cég szerint a kulcsfontosságú mutató nem az egyes feladatok csúcsteljesítménye, hanem a lefoglalt GPU-órákra vetített hasznos GPU-goodput.