2026. július 16., csütörtök · Kutatás

Csecsemők tanulási képességeivel vetik össze a mesterséges intelligenciát egy új tesztben

A Meta, a Stanford Egyetem, a Tokiói Egyetem és a francia École Normale Supérieure kutatói közösen kidolgoztak egy EgoBabyVLM nevű tesztet, amely a látás-nyelv modellek (VLM-ek) teljesítményét méri csecsemők fejére rögzített kamerák mintegy ezer órás videófelvételein. A WIRED beszámolója szerint a csúcstechnológiás modellek jelentősen alulteljesítettek ezen a valósághű, rendezetlen felvételanyagon, ami arra utal, hogy a csecsemőagy felépítésében lehet valami, ami lehetővé teszi a rendkívül hatékony tanulást minimális adatból. Michael Frank, a Stanford kognitív kutatója szerint a csecsemők nem csupán nyelvből, hanem gazdag multimodális és tapintási élményekből is tanulnak, ami túlmutat a jelenlegi AI-modellek képességein. A kutatók reményei szerint az eredmények hozzájárulhatnak energiahatékonyabb, kevésbé adatigényes modellek fejlesztéséhez.

Miért fontos?

A teszt rávilágít, hogy a mai AI-modellek a csecsemőknél jóval kevésbé hatékonyan tanulnak természetes környezetben, ami új kutatási irányokat jelölhet ki.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 16., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

Kutatás: az AI-kódolóügynökök nem érzik az idő múlását

Egy nem lektorált tanulmány, amelyet két független kutató készített a MATS kutatói program keretében, azt vizsgálta, mennyire tudják az AI-kódolóasszisztensek megbecsülni egy feladat elvégzéséhez szükséges időt. Az Anthropic Claude Code és az OpenAI Codex ügynökeit 200 feladaton (ProgramBench) és egy 18 tesztes saját csomagon tesztelték. Mindkét modell rendszeresen túlbecsülte az időigényt: a ProgramBench-en a nehézségtől függetlenül kb. 90 percet jósoltak, a második körben a Claude háromszor, a Codex hat-tízszer tévedett, főleg rövid feladatoknál. A futásidő a szoftverkörnyezettől is függött: a Claude Code addig dolgozik, amíg készen nem véli a feladatot, míg a Codex szinte mindig fél óra után leáll. Az ügynökök saját munkájukat is túlértékelték: az Opus 4.8 és a GPT-5.5 átlag 20 ponttal adott magának jobb jegyet, egy esetben 70 százalékos sikert állítva a valós 7-14,5 százalék helyett.

LAION kiadta a 10 millió órás nyílt videó-adathalmazt AI-kutatáshoz

A LAION közzétette a Big Video Dataset (BVD) nevű gyűjteményt, amely a CommonCrawlben talált 1,3 milliárd videó-URL-ből építkezik. A csapat 80 millió videót töltött le, ez összesen 10 millió óra anyagot jelent, ebből 55 millió klipet vágtak ki automatikusan generált videó- és hangleírásokkal, valamint 300 millió állóképet nyertek ki. A kísérő, egyelőre nem lektorált tanulmány szerint a BVD-n tanított modellek a videó-szöveg benchmarkokon akár 2,1 százalékponttal jobban teljesítenek, mint az InternVid adathalmazon tanítottak, ezt egyelőre csak a LAION saját közleménye állítja. A szervezet a 2024-es hamburgi bírósági döntésre hivatkozva kizárólag nem kereskedelmi kutatási célra teszi elérhetővé az adatokat, és kéri a felhasználókat, hogy tartsák tiszteletben az eredeti tartalomkészítők jogait.

LLM-ekkel automatizált szakirodalmi áttekintés járványmodellekről

Egy nem lektorált, arXiv-on közzétett tanulmány szerint kutatók nagy nyelvi modellekre épülő feldolgozási láncot fejlesztettek 536, lektorált ágensalapú betegségterjedési modelleket bemutató cikk automatikus feldolgozására, majd az eredményeket emberi kutatók szisztematikus szakirodalmi áttekintésével vetették össze. A szerzők állítása szerint a GPT-4.1 cikkszintű pontossága mintegy 77,95%, a GPT-5.0-é 81,67% volt, míg mezőnkénti szinten a pontosság 32,40% és 100% között szórt, a bonyolultabb, szubjektívebb mezőknél megbízhatatlanabbul. A tanulmány szerint az LLM-ek közötti egyezés a kimenet minőségének jelzője lehet: alacsony egyezés hallucinációra, magas egyezés alacsony pontossággal párosulva pedig az emberi adathalmaz hibáira utalhat.

Szimbolikus szabályrendszer segítené az AI-t iskolai kémiai feladatok megoldásában

Kutatók egy ChemOntoRule nevű, kémiai feladatokra szabott ontológiát és determinisztikus Python-szabályokat kombináló rendszert mutattak be, amely az elektronszerkezet, periodikus trendek, oxidációs állapotok és oxid-hidrid viselkedés köré épül. A cél, hogy a nyelvi modellek nehezen ellenőrizhető belső következtetése helyett egy átlátható szabálymag adjon választ iskolai szintű kémiai kérdésekre. A nem lektorált, arXivon közzétett tanulmány szerint a rendszer 300 emberi feladatból 296-ot oldott meg helyesen, a szabályalapú rész pedig 269 feladatból 266-ot talált meg pontosan. A szerzők hangsúlyozzák: mivel ugyanazt a feladathalmazt használták építéshez és teszteléshez, az eredmény a beépített lefedettséget mutatja, nem független általánosítást.