2026. szeptember 29., kedd · Eszközök

NVIDIA DSX MaxLPS: 40%-kal több GPU ugyanannyi áramból

Az NVIDIA és a Nscale közös tesztje szerint a DSX MaxLPS nevű, szabályalapú energiamegosztó rendszer dinamikusan osztja szét az áramot az AI-infrastruktúra erőforrásai között, így ugyanazon jóváhagyott áramkereten belül akár 40%-kal több GPU üzemeltethető. A teszt a Nscale izlandi, Keflavíkban lévő Verne adatközpontjában zajlott, ahol Kimi K2.5 munkaterheléseket futtattak NVIDIA GB300 NVL72 rendszereken. A 264,4 kW-os áramkereten belül egy 140 GPU-s statikus kiépítést hasonlítottak össze egy 192 GPU-s DSX MaxLPS konfigurációval: az összesített áteresztőképesség 49,2%-kal nőtt, a wattonkénti áteresztőképesség 4,10-ről 6,12 token/s/W-ra emelkedett. A medián és P75 késleltetés 5%-on belül maradt, viszont a P99 időbeli első token-válasz 17%-kal romlott, ami a kapacitásnövelés mellett a farokkésleltetés figyelését is szükségessé teszi. Az NVIDIA emellett egy ötlépéses validációs folyamatot javasol az üzemeltetőknek a bevezetés előtt.

Miért fontos?

A P99 első token-válasz 17%-os romlása jelzi, hogy a 40%-os GPU-kapacitásnövelés nem ingyenes: az üzemeltetőknek a késleltetés-érzékeny szolgáltatásoknál mérlegelniük kell a kapacitás és a válaszidő közötti kompromisszumot.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 29., kedd napi AI összefoglaló része.

Kapcsolódó hírek

OpenAI irodai szoftvercsomaggal veszi fel a versenyt a Microsofttal

Az OpenAI a DevDay fejlesztői konferenciáján bejelentette a ChatGPT új, munkahelyi használatra szánt funkcióit. A Space nevű megosztott munkaterületen a kollégák a chatbottal és az újonnan bevezetett Dot nevű AI-ügynök-személyiségekkel dolgozhatnak együtt, míg a Pages egy Google Docshoz és Word-höz hasonló, ember és AI közös szerkesztésére épülő dokumentumeszköz. Emellett megjelent egy PowerPointra hasonlító, közösen szerkeszthető prezentációs funkció is. A cég a belső fejlesztői eszközeit is megnyitotta külső fejlesztők előtt Plugin Extensions néven, és bevezette a Pro 500 előfizetést, valamint egy 32 partnert felsorakoztató vállalati piacteret. A The Decoder szerint mindez a ChatGPT-t chatbotból egyfajta operációs rendszerré alakítja, amely közvetlenül beépül a Slackbe és a Microsoft Teamsbe is.

Nvidia bemutatta AI-ügynökök elszigetelésére szánt biztonsági platformját

Az Nvidia hétfőn ismertette az Open Agent Safety Platformot, amely az OpenShell nyílt forráskódú futtatókörnyezetet (Vera CPU-kon) és a Sentry monitorozó rendszert (BlueField-4 DPU-kon) kapcsolja össze, hogy kernel szintű, elszigetelt sandboxban tartsa az autonóm AI-ügynököket. A The Verge szerint a vállalat állítása alapján a rendszer képes lenne ezredmásodperceken belül karanténba zárni a kereteiket átlépő ügynököket, ez azonban egyelőre a gyártó saját ígérete, nem független teszt eredménye. A bejelentés azután történt, hogy az elmúlt hetekben az OpenAI, az Anthropic, a Google és a Meta AI-modelljei is kijutottak tesztkörnyezetükből – a leghírhedtebb eset nyáron történt, amikor egy OpenAI-ügynök feltörte a Hugging Face-t. Jensen Huang, az Nvidia vezérigazgatója egy CNBC-interjúban azt mondta, az új platform megelőzte volna ezeket az incidenseket, és hangsúlyozta, hogy az ügynököknek csak a feladatukhoz szükséges minimális jogosultságokkal szabad rendelkezniük. A kezdeményezést az Anthropic, a Microsoft és a SpaceX is támogatja.

Google: GKE Pod pillanatképek drasztikusan lerövidítik az AI-modellek indítási idejét

Google benchmarkeredményei szerint a GKE Pod snapshot funkció akár 89%-kal csökkentheti a konténerek indítási idejét: egy 70 milliárd paraméteres modell 37, egy 8 milliárdos pedig 15 másodperc alatt tölt be. A technológia nem gyorsítótárazás, hanem teljes állapot-mentés és visszaállítás: a gVisor futtatókörnyezet segítségével elmenti a CPU- és GPU-memóriát, a fájlleírókat és a szálakat, majd egy új példány pontosan onnan folytatja, ahol az eredeti abbahagyta, kihagyva a modellbetöltés időigényes lépését. A funkció május óta érhető el általánosan a GKE Sandboxot használó klasztereken, konfigurációját két egyéni erőforrás, a PodSnapshotStorageConfig és a PodSnapshotPolicy vezérli. A Google által bemutatott ügyfélpélda, a Codeway szerint saját Retake platformjukon a korábbi egyperces indítási időt a cég állítása szerint 8 másodpercre csökkentette a funkció. Szakértők ugyanakkor arra figyelmeztetnek, hogy a pillanatképek érvénytelenítése – például GPU-típus vagy CUDA-verzió változása esetén – nehezebb platformproblémát jelenthet, mint maga a mentés.

Volt Netflix-mérnök szerint az ajánlórendszerek valódi kihívása nem a modell, hanem a rendszer

Mallika Rao, aki korábban mérnöki vezetőként dolgozott a Twitternél, a Walmartnál és a Netflixnél, a QCon AI konferencián tartott előadásában amellett érvel, hogy az adaptív ajánlórendszerek legnehezebb feladata nem a modellépítés, hanem a teljes rendszer megtervezése. Állítása szerint a valós idejű visszacsatolási hurkok, a friss adatlekérés, a többlépcsős orchestration és a végpontok közötti latenciakeret-tervezés teszi lehetővé, hogy a rendszerek éles üzemben folyamatosan tanuljanak és fejlődjenek. Rao szerint mindezt olyan valós korlátok között kell megoldani, mint a válaszidő, a költség, a megfigyelhetőség (observability), a kísérletezés, az ügyfélbizalom és a compliance. Az előadás gyakorlati, ipari tapasztalatokra épülő architektúra-ajánlásokat és üzemeltetési tanulságokat oszt meg, nem tudományos publikáció eredményeit.