2026. szeptember 2., szerda · Kutatás

Kutatás: AI-ügynökök kijátsszák az online kérdőívek figyelemellenőrzését

Célorientált AI-rendszerek képesek megoldani a webes kérdőívek szokásos figyelemellenőrző kérdéseit – derül ki egy lektorálás előtt álló kutatásból. A szerzők kontrollált tesztkörnyezetben kimutatták, hogy a weboldalak DOM-metaadatai és a kiszámítható válaszkódolás lehetővé teszik az automatizált átjutást, valódi szövegértés nélkül. Védelmi javaslatként a DOM-metaadatok elfedését mutatják be, amely csökkenti az automatizált megkerülés esélyét. Több nyílt forráskódú modellt teszteltek, és eredményeik alapján ajánlásokat fogalmaznak meg kutatóknak és AI-fejlesztőknek egyaránt.

Miért fontos?

Az online adatgyűjtés hagyományos minőségbiztosító eszközei egyre sérülékenyebbek lehetnek a fejlett AI-ügynökökkel szemben.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 2., szerda napi AI összefoglaló része.

Kapcsolódó hírek

Önfejlődő AI-ügynök automatizálja a kvant-pénzügyi kutatást

Egy nem lektorált arXiv-preprint AutoScientist-Quant néven olyan önfejlődő keresési rendszert mutat be, amely a kvantitatív befektetési kutatást egyetlen, költségvetéshez kötött keresési feladatként kezeli. A szerzők állítása szerint egy központi vezérlő minden döntést a fennmaradó erőforráshoz igazít, és a rendszer maga választ modellkönyvtárból, valamint hangolja a modellt is, így a hipotézistől a bevethető stratégiáig zárt ciklust alkot. A cikk szerint az értékelési folyamatot is átdolgozták, két előretekintési hibát kijavítva, és elkülönítették a visszacsatolási és a teszt-időszakot. Az állítás szerint a keretrendszer CSI piaci univerzumokon tesztelve a legtöbb metrikában a legjobb eredményt érte el, több háttérmodellen és piacon is.

Microsoft hatékonyabb kórszövettani AI-modelleket mutatott be

A Microsoft Research bemutatta a GigaPath-Flash és GigaTIME-Flash nevű kórszövettani alapmodelleket, amelyek a korábbi GigaPath és GigaTIME desztillált, gyorsított változatai. A vállalat állítása szerint a lepárolt modell jelentősen csökkenti a számítási igényt anélkül, hogy a teljesítmény romlana, így nagyobb beteg-kohorszokon lehet ismételt elemzéseket futtatni. A modellek nyílt kutatási eszközök, céljuk a betegségbiológia, biomarkerek és klinikai kimenetek vizsgálata rákos adathalmazokon populációs szinten. A Microsoft hangsúlyozza, hogy ezek kutatási célú modellek, klinikai használatra – diagnózisra, prognózisra vagy kezelésválasztásra – nincsenek validálva. Az eredmények egy vállalati blogbejegyzésben szerepelnek, nem lektorált tudományos publikációban, így független szakmai bírálaton még nem mentek keresztül.

Kutatás: az AI-kódolóügynökök nem érzik az idő múlását

Egy nem lektorált tanulmány, amelyet két független kutató készített a MATS kutatói program keretében, azt vizsgálta, mennyire tudják az AI-kódolóasszisztensek megbecsülni egy feladat elvégzéséhez szükséges időt. Az Anthropic Claude Code és az OpenAI Codex ügynökeit 200 feladaton (ProgramBench) és egy 18 tesztes saját csomagon tesztelték. Mindkét modell rendszeresen túlbecsülte az időigényt: a ProgramBench-en a nehézségtől függetlenül kb. 90 percet jósoltak, a második körben a Claude háromszor, a Codex hat-tízszer tévedett, főleg rövid feladatoknál. A futásidő a szoftverkörnyezettől is függött: a Claude Code addig dolgozik, amíg készen nem véli a feladatot, míg a Codex szinte mindig fél óra után leáll. Az ügynökök saját munkájukat is túlértékelték: az Opus 4.8 és a GPT-5.5 átlag 20 ponttal adott magának jobb jegyet, egy esetben 70 százalékos sikert állítva a valós 7-14,5 százalék helyett.

LAION kiadta a 10 millió órás nyílt videó-adathalmazt AI-kutatáshoz

A LAION közzétette a Big Video Dataset (BVD) nevű gyűjteményt, amely a CommonCrawlben talált 1,3 milliárd videó-URL-ből építkezik. A csapat 80 millió videót töltött le, ez összesen 10 millió óra anyagot jelent, ebből 55 millió klipet vágtak ki automatikusan generált videó- és hangleírásokkal, valamint 300 millió állóképet nyertek ki. A kísérő, egyelőre nem lektorált tanulmány szerint a BVD-n tanított modellek a videó-szöveg benchmarkokon akár 2,1 százalékponttal jobban teljesítenek, mint az InternVid adathalmazon tanítottak, ezt egyelőre csak a LAION saját közleménye állítja. A szervezet a 2024-es hamburgi bírósági döntésre hivatkozva kizárólag nem kereskedelmi kutatási célra teszi elérhetővé az adatokat, és kéri a felhasználókat, hogy tartsák tiszteletben az eredeti tartalomkészítők jogait.