2026. augusztus 5., szerda · Modellek
NVIDIA: a World Action Modellek felváltják a robotikai VLA-kat
Az NVIDIA technikai blogja szerint a robotpolitikák új generációja, az úgynevezett World Action Model (WAM) videó-alapú világmodellekre épül, nem a megszokott nyelv-látás (VLM) alapú vision-language-action (VLA) rendszerekre. A cég állítása szerint a WAM-ok jobban általánosítanak új feladatokra, robotokra és környezetekre, mert a tanult fizikai dinamikát használják, nem csak szemantikus leképezést. Az NVIDIA saját, nyílt Cosmos 3 modelljét mutatja be alapként, amely Mixture-of-Transformers architektúrára épül, és rendkívül nagy, több száz millió kép-, videó- és akciómintát tartalmazó adathalmazon tanult. A vállalat szerint a Cosmos 3 munkaállomásos és Jetson-alapú, valós idejű futtatást is lehetővé tesz, kevesebb feladatspecifikus adattal érve el jobb teljesítményt. Az állítások az NVIDIA saját blogbejegyzéséből származnak, független megerősítés nélkül.
Miért fontos?
Ha a videó-alapú világmodellek valóban jobban általánosítanak, az alapjaiban változtathatja meg a robotpolitikák felépítését a mostani nyelv-látás alapú megközelítésekhez képest.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 5., szerda napi AI összefoglaló része.