2026. július 25., szombat · Eszközök

NVIDIA ModelExpress: modellsúlyok villámgyors elosztása GPU-k között a klaszterben

Az NVIDIA bemutatta a ModelExpress (MX) nevű platformot, amely a nagy nyelvi modellek súlyainak klaszteren belüli mozgatását gyorsítja fel. A rendszer a betöltés előtt megkeresi, hol található már kompatibilis súlymásolat, és a leggyorsabb elérhető útvonalat választja: ha egy kiszolgáló társgépen megvannak a súlyok, azokat közvetlenül GPU-ról GPU-ra másolja RDMA-n keresztül az NIXL könyvtár segítségével, elkerülve az objektumtárolót, a lemezt és a gazdagép memóriáját. Az NVIDIA szerint az MX a DeepSeek-V4 Pro súlyait és a JIT kernelgyorsítótárat kevesebb mint 10 másodperc alatt képes átvinni egy új replikába. A platform többszálú streamelést, elosztott atomi gyorsítótárazást és GPUDirect Storage támogatást alkalmaz, valamint integrálódik a vLLM, SGLang, Dynamo és llm-d keretrendszerekkel, így az éles LLM-telepítések hidegindítási és skálázási idejét jelentősen csökkenti.

Miért fontos?

A modellsúlyok mozgatása az LLM-kiszolgálás egyik fő szűk keresztmetszete, és az MX ezt a lépést GPU-közvetlen átvitellel nagyságrendileg gyorsítja.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 25., szombat napi AI összefoglaló része.

Kapcsolódó hírek

Kígyórobotok kerestek túlélőket a venezuelai földrengés romjai között

A Carnegie Mellon Egyetem Biorobotikai Laboratóriuma kígyórobotokat vetett be a venezuelai kettős földrengés utáni mentési munkálatokban, amelyek június 24-én több mint ötezer halálos áldozatot követeltek. Az Ars Technica beszámolója szerint a körülbelül 120 centiméteres, moduláris felépítésű robotok videokamerával felszerelve képesek szűk résekbe bekúszni az összeomlott épületek romjai között, ahová sem emberek, sem gépek nem jutnak el. A robotokat egy emberi operátor irányítja játékvezérlővel, miközben szoftveralgoritmusok koordinálják a testszegmensek mozgását. Howie Choset laboratóriumvezető az Ars Technicának úgy fogalmazott, hogy a kígyórobot lényegében minimálisan invazív műtétet végez egy épületen.

Az OpenAI minden amerikai felhasználó számára elérhetővé tette a ChatGPT Health egészségügyi funkcióját

Az OpenAI csütörtökön az Egyesült Államokban minden 18 éven felüli, bejelentkezett ChatGPT-felhasználó számára megnyitotta a ChatGPT Health funkciót, amely lehetővé teszi egészségügyi adatok – többek között orvosi dokumentumok, laboreredmények, gyógyszerlisták, valamint az Apple Health, a MyFitnessPal és más szolgáltatások adatainak – összekapcsolását a chatbottal. A The Verge beszámolója szerint az OpenAI egészségügyi alelnöke azt állította, hogy modelljeik a klinikusok szintjét meghaladó következtetési képességgel rendelkeznek, ugyanakkor a cég egészségügyi vezetője ezt árnyalta, mondván, hogy egyes tanulmányok mutatnak ebbe az irányba. A funkció bevezetésével egy időben egy floridai lelkész pert indított az OpenAI ellen, azt állítva, hogy a ChatGPT veszélyes orvosi tanácsot adott neki. Az OpenAI hangsúlyozza, hogy a szolgáltatás a szakorvosi ellátást támogatja, nem helyettesíti.

Az NVIDIA bemutatta a Vera CPU-t: Olympus magokkal az ágens AI munkaterhelésekre tervezve

Az NVIDIA technikai blogján ismertette a Vera CPU architektúráját, amelyet az Olympus processzormag köré épített, kifejezetten ágens AI munkaterhelésekre. A vállalat szerint a processzor az egyszálú teljesítmény maximalizálására fókuszál, mivel az ágens rendszerek szekvenciális, elágazás-intenzív és késleltetés-érzékeny programutakat futtatnak, amelyek eltérnek a hagyományos felhős CPU-k terhelésétől. Az NVIDIA állítása alapján a chip 3,4 TB/s sávszélességű koherenciafabrikot és akár 1,2 TB/s összesített sávszélességű LPDDR5X memóriát tartalmaz. A skálázhatóságot koherens NVLink-C2C, PCIe 6.4, CXL 3.1 és bizalmas számítástechnikai megoldások támogatják.

Az NVIDIA Nemotron 3 Nano modell testreszabása percek alatt elvégezhető a Prime Intellect Lab platformon

Az NVIDIA technikai blogján közzétett útmutató szerint a Nemotron 3 Nano nyílt modell testreszabása a Prime Intellect Lab platformmal mindössze öt perc helyi beállítást igényel. A bemutatott munkafolyamat három lépésből áll: kiindulási teljesítmény mérése, megerősítéses tanulás (reinforcement learning) futtatása egy Python matematikai környezetben, majd az eredmények kiértékelése – a folyamat végén letölthető LoRA adapter jön létre. Az NVIDIA szerint a testreszabás után jelentős pontosságjavulás érhető el. A blogbejegyzés kiemeli, hogy ugyanez a folyamat alkalmazható a nagyobb Nemotron 3 Super és Ultra modellekre is, a nyílt súlyok, adatok és tanítási receptek pedig a reprodukálhatóságot és az átláthatóságot szolgálják. A megoldás lényege, hogy az infrastrukturális és szaktudásbeli akadályokat a felhőalapú platform nagymértékben csökkenti.