2026. október 5., hétfő · Kutatás
ThinkingBox: az AI-ügynökök tényleges munkáját méri, nem a válaszukat
A Microsoft kutatói ThinkingBox néven új értékelő rendszert fejlesztettek, amely nem a végső válasz vagy a sikeres eszközhívások alapján minősíti az AI-ügynököket, hanem azt vizsgálja, milyen állapotot hagynak maguk után az adatbázisban. A rendszer Hugging Face-en keresztül is elérhető. A bejegyzés egy konkrét esetet mutat be: egy ügynök kilenc eszközhívással kezelt egy 745 dolláros, egy nashville-i elosztóközpontban elakadt csomaggal kapcsolatos panaszt, majd megoldottként zárta le az ügyet, miközben a futárszolgálat kivételkezelése még nyitva volt, és az ügyfél valódi kérdése megválaszolatlan maradt. A Microsoft szerint a ThinkingBox 507 állapotfüggő üzleti munkafolyamatot futtat, mindegyiket 20-szor, különböző nagy nyelvi modellekkel, és egy 12 modellt felölelő, 121 680 érvényes futtatást tartalmazó összehasonlításban is jelentős eltérés mutatkozott a sikeresnek tűnő és a ténylegesen helyes végállapotok között.
Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.
Miért fontos?
A ThinkingBox azért jelentős, mert az OpenEnv-en keresztül bárki önállóan lefuttathatja a benchmarkot, így ellenőrizhetővé válik, hogy egy ügynök valóban megoldotta-e a feladatot, nem csak úgy tűnt.
Források
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. október 5., hétfő napi AI összefoglaló része.