2026. július 25., szombat · Eszközök

NVIDIA ModelExpress: modellsúlyok villámgyors elosztása GPU-k között a klaszterben

Az NVIDIA bemutatta a ModelExpress (MX) nevű platformot, amely a nagy nyelvi modellek súlyainak klaszteren belüli mozgatását gyorsítja fel. A rendszer a betöltés előtt megkeresi, hol található már kompatibilis súlymásolat, és a leggyorsabb elérhető útvonalat választja: ha egy kiszolgáló társgépen megvannak a súlyok, azokat közvetlenül GPU-ról GPU-ra másolja RDMA-n keresztül az NIXL könyvtár segítségével, elkerülve az objektumtárolót, a lemezt és a gazdagép memóriáját. Az NVIDIA szerint az MX a DeepSeek-V4 Pro súlyait és a JIT kernelgyorsítótárat kevesebb mint 10 másodperc alatt képes átvinni egy új replikába. A platform többszálú streamelést, elosztott atomi gyorsítótárazást és GPUDirect Storage támogatást alkalmaz, valamint integrálódik a vLLM, SGLang, Dynamo és llm-d keretrendszerekkel, így az éles LLM-telepítések hidegindítási és skálázási idejét jelentősen csökkenti.

Miért fontos?

A modellsúlyok mozgatása az LLM-kiszolgálás egyik fő szűk keresztmetszete, és az MX ezt a lépést GPU-közvetlen átvitellel nagyságrendileg gyorsítja.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 25., szombat napi AI összefoglaló része.

Kapcsolódó hírek

AI-ügynökök tesztelése: a demótól a termelésig

Zhou Yu, a Columbia Egyetem professzora és az Arklex AI alapítója egy InfoQ-előadásban azt állította, hogy a mai AI-ügynökök mintegy 95%-a megreked a demó fázisban, és nem jut el a valós termelési használatig. Állítása szerint ennek oka a megbízhatósági és megfelelőségi problémák, amelyeket szimulációalapú teszteléssel lehet kezelni. A bemutatott módszer szintetikus felhasználói profilokat, úgynevezett trajectory entropy metrikát és automatizált CI/CD folyamatokat alkalmaz a többfordulós, eszközhasználatot is végző párbeszéd-alapú ügynökök kiértékelésére, még a telepítés előtt felderítve a hibás eseteket. Az előadó szerint ezt a megközelítést saját kutatócsoportjában és az Arklex AI-nál alkalmazzák, célként az önmagukat tanuló munkafolyamatok skálázását nevezve meg termelési környezetben.

Google nyílt forráskódúvá tette a Mantis AI-sebezhetőségvizsgáló keretrendszert

A Google nyílt forráskódúként közzétette a Mantis nevű AI-ügynök keretrendszert, amely a vállalat állítása szerint automatizálja a szoftveres sebezhetőségek azonosítását, validálását, reprodukálását és javítását. A Google szerint a hagyományos AI-alapú kódvizsgálat gyakran hallucinált hibákat produkál, és a valós találatok aránya 7 százalék alatt marad, ezért a Mantis kritikus- és felülvizsgáló-ügynököket, valamint homokozó (sandbox) környezetben végzett reprodukciót kombinál a megbízhatóbb eredmény érdekében. A cég közlése szerint a rendszer a fájlokat hierarchikus fastruktúrába foglalja, ami 85 százalékkal csökkenti a tokenfelhasználást a szerkezeti kontextus megőrzése mellett. A Mantis moduláris felépítésű, több mint 15 eszközt tartalmaz, stratéga- és kutatóügynökökkel egészül ki, és több különböző AI-modell kombinálását is támogatja a különböző feldolgozási fázisokban.

Figma: AI-ügynökök gyorsítják a biztonsági riasztások kivizsgálását

A Figma mérnökcsapata saját beszámolója szerint AI-ügynököket épített biztonsági csapata számára, amelyek riasztásokat vizsgálnak ki, korábbi incidenseket keresnek vissza, rendszereket ellenőriznek, és kódjavításokat is előkészítenek. A rendszer Panther SIEM-re épül, az AWS, Okta, GitHub, GCP és osquery mellett száznál több forrást kérdez le, emellett AWS Bedrock Knowledge Bases, Amazon Kendra, Tines és Snowflake-alapú eszközöket is használ. A Figma állítása szerint ez mintegy 70 százalékkal csökkentette az összetett riasztások megoldási idejét, és 20 százalékkal kevesebb ügyeleti riasztást eredményezett. A cikk szerint a rendszer memóriája – korábbi esetek, viselkedési útmutatók, megtanult adatbázis-struktúrák – kulcsszerepet játszott, miközben emberi felülvizsgálat és beépített korlátok, például az alapból piszkozatként létrejövő kódjavaslatok, biztosítják a biztonságot.

Cenzúramentesített AI-modelleket árul kereskedelmi szolgáltatásként az Abliteration.ai

Az amerikai Abliteration.ai állítása szerint eltávolítja a betanított elutasítási mechanizmusokat nyílt súlyú modellekből, például a Z.AI GLM-5.3-ból, majd a módosított változatokhoz fizetős API-n keresztül ad hozzáférést. A cég szerint ez nem prompt-alapú kijátszás, hanem a modellsúlyok átalakítása, amely elnyomja a visszautasítást kiváltó aktivációs mintázatokat, miközben a kódolási és kiberbiztonsági képességek nagyrészt megmaradnak. A vállalat saját, nem független tesztjei szerint a módosított GLM-5.3 84,5 százalékot ért el a CyberGym benchmarkon, de más modellek egyes mérőszámokban jobban teljesítettek, és a cég maga is elismeri, hogy az összehasonlítások eltérő teszt-környezetből származnak. A szolgáltatás célja állítólag red teaming és sebezhetőség-elemzés, de a könnyű hozzáférés a visszaélés kockázatát is növelheti.