2026. szeptember 27., vasárnap · Kutatás

Kutatás: AI-hozzáférés miatt szinte senki sem mondja, hogy nem tudja a választ

Marcoccia, Quattrociocchi és Capraro kutatása 3132 résztvevővel öt kísérletben vizsgálta, hogyan változik az emberek bizonytalanság-kezelése, ha hozzáférnek egy nyelvi modellhez. A kérdéseket úgy válogatták, hogy a használt Step 3.5 Flash modell szinte mindig tévedjen bennük – ilyenek voltak a filmes vizuális részletek, például a csapatmez színe a Bend It Like Beckham című filmben –, míg a GPT-5.5, a Claude 4.6 Sonnet és a Gemini 3.5 Flash a többi kérdés nagy részét helyesen válaszolta meg. Az eredmények szerint AI-hozzáférés nélkül a résztvevők a kérdések 36-44 százalékánál mondtak „nem tudom”-ot, AI-val ez 3-6 százalékra esett. A második vizsgálatban a magabiztosság AI-val 75,9 pontra nőtt a 100-as skálán (AI nélkül 29,6), miközben a helyes válaszok aránya 27,6-ról 10,0 százalékra csökkent. Anyagi ösztönzők bevezetése (10 cent helyes, mínusz 10 cent hibás válaszért) csökkentette az AI-tanács kikérésének gyakoriságát, de a torzítást nem szüntette meg teljesen.

Miért fontos?

A kutatók szándékosan egy megbízhatatlan modellt, a Step 3.5 Flash-t választották, így kimutatták, hogy már a puszta AI-elérhetőség is a helyes válaszok arányát 27,5-ről 9,2 százalékra rontja, miközben a válaszadói magabiztosság megnő.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 27., vasárnap napi AI összefoglaló része.

Kapcsolódó hírek

Nvidia-kutatás: SoL-Pi rendszer felére csökkenti a kódoló AI-ügynökök tokenfogyasztását

Az Nvidia kutatói egy tanulmányban mutatják be a SoL-Pi rendszert, amely a kódoló AI-ügynökök úgynevezett harnessét, vagyis a modell és a környezet közötti vezérlőréteget optimalizálja automatikusan. A The Decoder beszámolója szerint egy megfigyelő kutatási AI-ügynök elemzi a végrehajtási nyomokat, javaslatokat tesz a harness módosítására, majd teszteli azokat, és csak a teljesítményt megőrző, olcsóbb változatokat tartja meg. A kutatók állítása szerint az EdgeBench teszten a SoL-Pi 50 százalékkal kevesebb tokent használt a Codexhez, és 54,3 százalékkal kevesebbet a Claude Code-hoz képest, miközben a teljesítmény nagyjából változatlan maradt. A kutatás 535 futtatható környezetben 152 irányt vizsgált, ebből 495 feladat GitHub issue-pull request párokból származott, 40 pedig szintetikus teszteset volt, összesen több mint 3000 futtatással és 60 000 ügynök-környezet interakcióval, ami a kutatók szerint a keresés szélességét mutatja.

RECLAIM: AI-ügynökök csupán 15–41%-ban tudják reprodukálni a gépi tanulási cikkeket

A RECLAIM benchmark 100 NeurIPS 2025-ös gépi tanulási cikk reprodukálhatóságát méri fel AI-ügynökök segítségével, előre meghatározott sikerkritériumokkal és GPU-óra kerettel. A cikkeket három nehézségi szintbe sorolják: a Run szinten kód, adat és súlyok egyaránt elérhetők; a Retrain szinten a súlyok hiányoznak; a Reimplement szinten az ügynöknek a kódot is magának kell megírnia. Nem lektorált arXiv-preprint formájában közzétett kutatási eredmények szerint a legjobb ügynök Run szinten a feladatok 41%-át, Retrain szinten 27%-át, Reimplement szinten mindössze 15%-át oldotta meg sikeresen. A leggyakoribb hiba az volt, hogy az ügynök a módszert a cikk saját számaival való összevetés nélkül implementálta — ez 400 futtatásból 63 esetben fordult elő. A sikertelen kísérletek átlagosan a rendelkezésre álló GPU-keret csupán 29%-át használták fel, vagyis az ügynökök jellemzően korán, kihasználatlan erőforrással adták fel a feladatot.

TW3Cast: ágens nélkül a 3. helyen a GIFT-Eval időzsor-benchmarkon

A TW3Cast nevű idősor-előrejelző rendszer egy nem lektorált, arXiv-on közzétett kutatási beszámoló szerint a GIFT-Eval benchmark 130 bejegyzése közül a 3. helyet szerezte meg az átlagos MASE-rangsor alapján, 2026. szeptember 14-i állapot szerint. A rendszer nem használ ágenseket vagy nyelvi modelleket: egyetlen, a tanítási felosztáson kiszámított és ezután lefagyasztott táblázat választja ki a megfelelő szakértőt (Chronos-2, TiRex vagy Toto könnyű finomhangolású verziói) 97 adathalmaz-frekvencia-horizont kombinációhoz. A szerzők állítása szerint a teljes útválasztó rendszer 19,4-es átlagos MASE-rangot ér el, szemben a legjobb önálló alapmodell 33,8-as és a tisztán versenyeztetéses módszer 38,0-s értékével. A választást három védőmechanizmus (pontossági-kalibrációs kettős kritérium, aszimmetrikus margó, konzervatív kapuk) hivatott védeni a túlillesztéstől, a kódot és az adatokat pedig nyilvánosan közzétették.

PixelJev: kis multimodális modellek vizuális döntéshozatala, de korlátokkal

A PixelJev egy új, kép alapú döntési interfész, amely egy képet, egy feladatutasítást és egy futásidőben megadott jelöltlistát strukturált választássá és jelölt-feltételes valószínűségekké alakít kis, nyílt multimodális modellek segítségével. A kutatás egy arXiv-preprintben jelent meg, tehát még nem esett át szakmai lektoráláson. A modell egyesíti a felismerést és a többválasztós vizuális kérdés-válasz feladatokat egy nyelvi modell alapú kiolvasáson keresztül. Hét benchmark-értékelés során a 64-mintás forrásadaptáció a Pets adathalmazon 60,13%-ról 92,40%-ra növelte a pontosságot, és ez célfinomhangolás nélkül is átvihető volt új textúra-címkékre és az A-OKVQA feladatra. A szerzők ugyanakkor kifejezetten leszögezik, hogy a pontosságnövekedés nem garantálja a kalibrált célvalószínűségeket, a specializált DINOv2-alapú próbák továbbra is erősebbek a forrás-felismerésben, és a fagyasztott 4 milliárd paraméteres modell felülmúlja az adaptált 2 milliárdosat DTD és ScienceQA teszteken.