2026. július 14., kedd · Kutatás

MIT kutatók AI-ügynökökkel építenek virtuális tereket robotok betanításához

Az MIT CSAIL és a Toyota Research Institute kutatói kifejlesztették a SceneSmith nevű rendszert, amely három mesterséges intelligencia alapú ügynök együttműködésével hoz létre valósághű háromdimenziós virtuális környezeteket robotok betanításához. A rendszer egy tervező, egy kritikus és egy szervező ügynökből áll, amelyek mindegyike vizuális-nyelvi modellre (VLM) támaszkodik a terek megtervezésekor. A kutatók szerint a SceneSmith által generált belső terek – például éttermek, szállodai szobák és hálószobák – részletesebbek és valósághűbbek, mint a korábbi megoldások, így a robotok sokféle feladatot gyakorolhatnak fizikai szimulációban, mielőtt a valós világban tesztelnék őket. A rendszer célja a robotika egyik fő szűk keresztmetszetének, a változatos betanítási adatok hiányának enyhítése, mivel a fizikai környezetben végzett tanítás munka- és időigényes.

Miért fontos?

A virtuális betanítási környezetek automatikus létrehozása jelentősen gyorsíthatja a robotok valós feladatokra való felkészítését.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 14., kedd napi AI összefoglaló része.

Kapcsolódó hírek

MIT-kutatás: nagy AI-modelleknél elveszik a képek eredete

Az MIT CSAIL kutatói, Zheng Dai és David Gifford, a Nature Communications folyóiratban publikált, lektorált tanulmányukban azt mutatták ki, hogy nagyon nagy adathalmazokon tanított képgeneráló AI-modelleknél gyakran lehetetlen egy adott kimenetet konkrét tanítóképhez kötni. A jelenséget „attribúciós lecsengésnek” nevezik: minél nagyobb a tanítóhalmaz, annál kevésbé számít bármelyik egyedi kép a végeredmény szempontjából. Módszerükkel ténylegesen törölték az egyes képeket – akár egy adott művész összes alkotását, akár egy személy minden fotóját – a tanításból, és sok esetben a modell kimenete nem változott. A kutatók szerint ez az első olyan eljárás, amely pontosan, nem csak közelítőleg bizonyítja, hogy egy adott adat eltávolítása nem befolyásolja az eredményt, ami megkérdőjelezi, hogy a jogvitákban felelősség rendelhető-e egyetlen forráshoz.

World Labs: egy robotfeladatból ezernyi szimulált tanítóváltozat

A Fei-Fei Li által alapított World Labs bemutatta Real-to-Sim-to-Real (R2S2R) nevű motorját, amely egyetlen valós robotfeladatból ezernyi kontrollált szimulációs változatot generál vezérlőmodellek betanításához. A technológia a júliusban felvásárolt SceniX startuptól származik. A cég állítása szerint a fő akadály nem a modellarchitektúra, hanem a megbízható működéshez szükséges tapasztalat mennyisége, mivel a valós adatgyűjtés drága, és sem a tesztek, sem az online videók nem fedik le a tárgyak, körülmények és hibaállapotok teljes skáláját. A rendszer a fényviszonyokat, tárgyak helyzetét, súrlódást és kameraszöget változtatva állít elő variációkat, majd szimulált és valós végrehajtást összevetve ellenőrzi a pontosságot. World Labs szerint a kizárólag szimulációban tanított modellek valós hardveren, például a nyílt forráskódú ALOHA platformon is órákig megbízhatóan futottak.

Anthropic: egyelőre nincs bizonyíték AI okozta tömeges munkahely-vesztésre

Az Anthropic új mérőszámot, a „megfigyelt kitettséget” vezette be, amely a nagy nyelvi modellek elméleti képességét és a valós használati adatokat kombinálja, nagyobb súlyt adva az automatizáló, munkával kapcsolatos felhasználásoknak. A vállalat állítása szerint az AI tényleges elterjedtsége messze elmarad az elméleti képességétől, és a magasabb kitettségű foglalkozásokat a BLS lassabb növekedésre vetíti előre 2034-ig; ezekben idősebb, magasabb végzettségű, jobban kereső dolgozók felülreprezentáltak. Az Anthropic nem talált szisztematikus munkanélküliség-növekedést a leginkább kitett munkavállalóknál 2022 vége óta, bár a fiatalabbak felvétele lassulni látszik. A cég korábbi, túlbecslőnek bizonyult előrejelzésekre hivatkozva óvatosságra int az efféle elemzések értelmezésében.

4 bites modell verte a saját 16 bites eredetijét egy Hugging Face-kutatásban

Egy Hugging Face-kutatócsapat a Quantization-Aware Healing (QAH) módszert mutatta be egy tanulmányban, amely szerint egy GPT-OSS 120B modellből 60 milliárd paraméterre tömörített, majd MXFP4 formátumban 4 bitre kvantált változat 9 benchmarkból 7-en jobban teljesített, mint az eredeti, teljes pontosságú (bfloat16) modell. A vállalat állítása szerint ez megfordítja a szokásos viszonyt a 4 bites és a 16 bites modellek pontossága között, miközben a tömörített modell kisebb és olcsóbb futtatni. A tanulmány rámutat, hogy a bevett gyógyító eljárás, a kvantálás-tudatos tanítás (QAT) drága és instabillá válhat, ha a tanítás túl sokáig folytatódik az optimális pont után. Fontos hangsúlyozni, hogy ez egy friss, nem lektorált kutatási eredmény, amelyet a Hugging Face saját blogján tett közzé, így független megerősítésre még vár.