2026. július 25., szombat · Kutatás
DFAH-Bench: az AI-ügynökök pénzügyi döntéshozatalának viselkedési instabilitását mérő új benchmark
A DFAH-Bench nevű, nem lektorált kutatásban bemutatott benchmark-keretrendszer az AI-ügynökök viselkedési stabilitását méri pénzügyi feladatokban – nem csupán a végső döntést, hanem az odavezető eszközhasználati útvonalat is vizsgálja. A szerzők 8127 visszajátszási epizódot elemeztek 10 modellen és 3 feladaton: az élvonalbeli modellek 95%-os döntésegyezés mellett csupán 77%-ban követték ugyanazt az eszközútvonalat, ami 18 százalékpontos rejtett eltérést jelent. Három viselkedési profilt azonosítottak: mintaillesztőket, stabil végrehajtókat és trajektória-divergenseket, amelyek eltérő utakon jutnak azonos következtetésre.
Miért fontos?
A benchmark rámutat, hogy az eredményegyezés önmagában félrevezető képet ad az AI-ügynökök döntési stabilitásáról, ami pénzügyi alkalmazásoknál különösen kockázatos.
Források
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 25., szombat napi AI összefoglaló része.