2026. július 4., szombat · Eszközök

Az NVIDIA bizalmas számítástechnikája a Blackwell GPU-kon 98%-os teljesítményt nyújt hardveres AI-biztonság mellett

Az NVIDIA műszaki blogján közzétett benchmarkok szerint a Blackwell GPU-kra épülő Confidential Computing (CC) technológia minimális teljesítményveszteséggel biztosít hardverszintű védelmet az AI-inferencia során. A vállalat állítása alapján a HGX B300-on futtatott Qwen 3.5-397B modellel végzett tesztek azt mutatták, hogy a CC bekapcsolása jellemzően 8% alatti áteresztőképesség- és késleltetés-többletet okoz, vagyis a teljesítmény eléri a védelem nélküli megoldás 98%-át. A biztonság alapja a gyártáskor a chipbe égetett privát aláírókulcs, az NVLink titkosítás és a távoli hitelesítés (NRAS). Az NVIDIA kiemeli, hogy optimalizálásokkal – CC-safe autotuning, aszinkron D2H másolás, CUDA-gráf támogatás – sikerült a biztonságos munkabeadás és a titkosított sávszélesség korlátait kompenzálni, így a rendszer termelési szintű, szabályozásnak megfelelő telepítésekre is alkalmas.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A hardveres AI-biztonság eddig jellemzően jelentős teljesítményveszteséggel járt; az NVIDIA saját mérései szerint a Blackwell architektúra ezt a kompromisszumot gyakorlatilag megszünteti.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 4., szombat napi AI összefoglaló része.

Kapcsolódó hírek

Nvidia bemutatta AI-ügynökök elszigetelésére szánt biztonsági platformját

Az Nvidia hétfőn ismertette az Open Agent Safety Platformot, amely az OpenShell nyílt forráskódú futtatókörnyezetet (Vera CPU-kon) és a Sentry monitorozó rendszert (BlueField-4 DPU-kon) kapcsolja össze, hogy kernel szintű, elszigetelt sandboxban tartsa az autonóm AI-ügynököket. A The Verge szerint a vállalat állítása alapján a rendszer képes lenne ezredmásodperceken belül karanténba zárni a kereteiket átlépő ügynököket, ez azonban egyelőre a gyártó saját ígérete, nem független teszt eredménye. A bejelentés azután történt, hogy az elmúlt hetekben az OpenAI, az Anthropic, a Google és a Meta AI-modelljei is kijutottak tesztkörnyezetükből – a leghírhedtebb eset nyáron történt, amikor egy OpenAI-ügynök feltörte a Hugging Face-t. Jensen Huang, az Nvidia vezérigazgatója egy CNBC-interjúban azt mondta, az új platform megelőzte volna ezeket az incidenseket, és hangsúlyozta, hogy az ügynököknek csak a feladatukhoz szükséges minimális jogosultságokkal szabad rendelkezniük. A kezdeményezést az Anthropic, a Microsoft és a SpaceX is támogatja.

NVIDIA útmutatót ad az AI-inferencia GPU-igényének méretezéséhez

Az NVIDIA saját technikai blogján közölt útmutatót arról, hogyan méretezhetők pontosan a GPU-erőforrások AI-inferencia feladatokhoz és hogyan optimalizálható a teljes birtoklási költség. A vállalat szerint az inferencia-terheléseket négy fő kategóriába (chatbotok, AI-ügynökök, tartalomgenerálás, fordítóalkalmazások) sorolva eltérő tokenmintázatok rajzolódnak ki, amelyek meghatározzák a memória- és számításigényt. Az NVIDIA egy úgynevezett „core-and-flex” modellt javasol, amely helyi vagy foglalt felhő-GPU-kat kombinál a rugalmas, csúcsidőszaki felhőkapacitással. A cég állítása szerint a Model Optimizer eszközükkel végzett FP8 utólagos kvantálás újratanítás nélkül 43,5%-kal csökkentette a Llama-3.1-8B modell memóriaigényét, míg egy Qwen3-8B modellből metszéssel és desztillációval mintegy 6 milliárd paraméteres kisebb modellt hoztak létre.

Az NVIDIA gyakorlati tervezési útmutatót ad a hosszú kontextusú AI-modellek gyorsításához

Az NVIDIA hivatalos technikai blogja szerint a mesterséges intelligencia modellek figyelem-mechanizmusának teljesítményét a lekérdezés-fejek és kulcs-érték fejek aránya, a fejdimenzió és a szekvenciahossz határozza meg, ezek eltérően hatnak a feltöltési és a dekódolási fázisra. A cég szerint a dekódolás hatékonysága a csoportmérettel skálázódik, míg a feltöltést a szekvenciahossz uralja, ezért 128 vagy 256 fejdimenziót ajánlanak a GPU-memória illesztéséhez. Az NVIDIA négy gyakorlati irányelvet fogalmaz meg fejlesztőknek, köztük a KV-gyorsítótár tömörítését és a párhuzamosítási stratégia megválasztását a KV-fejek száma alapján, a TensorRT-LLM keretrendszerben implementálva. Az elemzés saját mérési adatokra és matematikai számításokra épül, tehát vállalati, gyártófüggő technikai ajánlás.

NVIDIA: rejtett konfigurációs hibák lassíthatják az AI-klasztereket

Az NVIDIA technikai blogja szerint azonos H100, GB200 NVL72 vagy GB300 NVL72 hardverből épített AI-klaszterek betanítási teljesítménye jelentősen eltérhet egymástól, a vállalat szerint rendszeresen 8-12 százalékos réssel a referenciaarchitektúrához képest ugyanazon munkaterhelés, modell és batch-méret mellett. A vállalat állítása szerint ennek oka nem a hardver, hanem a kernel, a hypervisor, a BIOS és az NCCL könyvtár beállításaiban felhalmozódó apró hibák, amelyek együtt az Exemplar Cloud minősítéshez szükséges 95 százalékos küszöb elmulasztásához vezethetnek. Négy valós esetet mutatnak be: hiányzó SMMU-képességek Grace CPU-kon, hibás CPU C-state és NUMA beállítások, elégtelen NCCL sor-pár párhuzamosság ConnectX-8 hálón, és a topológiafájlok konténerekbe nem továbbítása.