2026. szeptember 14., hétfő · Kutatás
Sci-MMR: új teszt leplezi le a multimodális AI-ügynökök bizonyítási hiányosságait
Kutatók bemutatták a Sci-MMR benchmarkot, amely azt méri, mennyire képesek a multimodális AI-ügynökök több lépéses, bizonyítékra alapozott tudományos következtetésre. A nem lektorált, arXiv-preprintként közzétett tanulmány szerint a 235 feladatból álló teszt négy tudományterületet fed le, feladatonként átlag kilenc ábrapanellel. Nyolc élvonalbeli multimodális modell vizsgálatakor kiderült: a végső válasz pontossága több mint 20 százalékponttal meghaladja azt az arányt, amikor a modell a teljes bizonyítékláncot is helyesen adja vissza, vagyis gyakran jó választ ad valódi bizonyíték nélkül. A szerzők szerint a hibák 57,2 százaléka az ábrákból való hiányos bizonyítékkinyerésből ered, 31,8 százaléka pedig abból, hogy a modellek a meglévő bizonyítékot sem tudják helyes következtetéssé alakítani; még arany bizonyíték mellett is csak 69,1 százalékos pontosságot ér el a legjobb modell a legnehezebb feladatokon.
Miért fontos?
A benchmark szerint az automatikus képkivágó eszközök csak 4,5 pontos javulást hoznak, míg a kész, arany bizonyíték megadása 37 pontos pontosságnövekedést eredményez, ami jelzi, mennyire múlik a kutatási AI-ügynökök megbízhatósága a bizonyítékgyűjtés minőségén.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 14., hétfő napi AI összefoglaló része.