2026. július 15., szerda · Eszközök

Az NVIDIA Cosmos 3 modell egyetlen nap alatt 93%-os pontosságra finomhangolható automatizált ágensalapú munkafolyamattal

Az NVIDIA technikai blogján bemutatott munkafolyamat szerint a Cosmos 3 Nano alapmodellt az NVIDIA TAO ágensképességeivel és LoRA-adaptációval kombinálva a videókérdés-válaszolási pontosság 54,41%-ról 93,35%-ra emelkedett a Woven Traffic Safety adathalmazon, kevesebb mint egy nap alatt, minimális manuális beavatkozással. Az NVIDIA állítása szerint a TAO ágensképességek automatizálják az adatkezelést, a kiindulási értékelést, a LoRA-konfigurálást és a hiperparaméter-optimalizálást, ami jelentősen csökkenti a mérnöki ráfordítást. A Cosmos 3 mixture-of-transformers architektúrája egyesíti a többféle modalitás – szöveg, kép, videó, hang – feldolgozását. Az éles üzembe helyezést a Cosmos 3 Reasoner NIM mikroszolgáltatás egyszerűsíti, amely OpenAI-kompatibilis végpontként szolgálja ki a finomhangolt LoRA-adaptereket, kiküszöbölve a hagyományos infrastrukturális komplexitást.

Miért fontos?

Az automatizált, ágensalapú finomhangolás drámaian csökkentheti a domain-specifikus videóértési modellek adaptációjához szükséges időt és szakértelmet.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 15., szerda napi AI összefoglaló része.

Kapcsolódó hírek

Anthropic új szabványt indított: AI-ügynökök vezérelhetnek laboreszközöket

Az Anthropic bejelentette a Model Hardware Standard (MHS) kutatási előnézetét, amely egységes illesztőfelületet ad AI-ügynökök számára fizikai eszközök, például mikroszkópok, folyadékadagolók és robotkarok vezérléséhez. A vállalat állítása szerint a szabvány – amelyet a HHMI Janelia Research Campus kutatóival közösen fejlesztettek – a jelenleg hetekig-hónapokig tartó eszközintegrációt órákra vagy percekre csökkentheti, mivel az eszközök egyszerű „olvasás/írás” parancsokon keresztül kommunikálnak egymással és az AI-modellekkel. Az Ars Technica megerősíti, hogy a rendszer modellfüggetlen, Model Context Protocollal is használható, és a szabványt egyelőre csak szűk kör kapja tesztelésre, nyílt forráskódúvá tétele még nem történt meg.

NVIDIA új eszközzel egyszerűsíti a nyílt AI-modellek C++ integrálását

Az NVIDIA saját közleménye szerint elérhetővé tette a TensorRT Model Connect nevű eszközt, amely nyílt AI-modellek natív C++ alkalmazásokba történő beépítését egyszerűsíti le. A vállalat állítása szerint a folyamat két lépésre bontható: előbb egy Python parancssori eszközzel egy Hugging Face modellazonosítóból telepítési csomag épül, majd ezt egy C++ alkalmazás futásidőben betöltve futtatja, PyTorch vagy Python interpreter nélkül. Az NVIDIA szerint két API-szint áll rendelkezésre: egy feladatszintű szemantikus felület, illetve egy modulszintű, tenzor- és komponensvezérlést lehetővé tevő verzió, továbbá TVM FFI-n keresztül egyéni GPU-kernelek is beépíthetők a pipeline-ba. A cég közlése szerint a fejlesztés AI-alapú kódolóügynökökkel és éjszakai kiadásokkal zajlik, hogy lépést tartson a nyílt modellökoszisztémával.

AWS új funkcióval oldja meg a SageMaker AI-modellek többzónás rendelkezésre állását

Az AWS hivatalos blogbejegyzése szerint a Salesforce a SageMaker AI Inference Components (IC) technológiával nyolcszorosára csökkentette infrastruktúraköltségeit az Agentforce nevű AI-ügynök platformnál, mivel több modellt oszthat meg közös GPU-kon. A cikk szerint az alapértelmezett elhelyezési algoritmus azonban nem garantálta a Salesforce megfelelőségi elvárása szerinti kétzónás redundanciát, mivel modellpéldányok egyenetlenül oszolhattak el a zónák között, ami instancia- vagy zónaszintű meghibásodás esetén kiesést okozhatott. Az AWS ezért bevezette a CreateInferenceComponent API-ban a SchedulingConfig paramétert, amely finomhangolt kontrollt ad a modellpéldányok zónák közötti elosztására. A bejegyzés a Salesforce egy konkrét, négy instanciás, két zónás példáján mutatja be a megoldást.

NVIDIA MPS technológiával 75%-kal csökkenthető a beszédfelismerés GPU-igénye AWS-en

Az AWS, az NVIDIA és a Heidi Health közös blogbejegyzése szerint az automatikus beszédfelismerés (ASR) GPU-kihasználtsága rendkívül alacsony: egyetlen kérés a Parakeet TDT 0.6B V2 modellel az NVIDIA L40S GPU kapacitásának mindössze 15-20 százalékát használja ki, a CUDA alapértelmezett időosztásos ütemezése miatt a kapacitás 80 százaléka kihasználatlan marad. A vállalatok állítása szerint az NVIDIA CUDA Multi-Process Service és a Triton Inference Server kombinálásával az Amazon EC2 GPU-példányokon a kiszolgáláshoz szükséges GPU-k száma 16-ról 4-re csökkenthető, miközben a rendszer 92,1 kérést dolgoz fel másodpercenkénti GPU-nként, egy másodperc alatti késleltetés mellett. A Heidi Health hetente 2,4 millió klinikai konzultációt dolgoz fel 190 országban, ami indokolta a hatékonyabb kiszolgálási architektúra kidolgozását.