2026. augusztus 31., hétfő · Kutatás
Kutatás: az AI-kódolóügynökök nem érzik az idő múlását
Egy nem lektorált tanulmány, amelyet két független kutató készített a MATS kutatói program keretében, azt vizsgálta, mennyire tudják az AI-kódolóasszisztensek megbecsülni egy feladat elvégzéséhez szükséges időt. Az Anthropic Claude Code és az OpenAI Codex ügynökeit 200 feladaton (ProgramBench) és egy 18 tesztes saját csomagon tesztelték. Mindkét modell rendszeresen túlbecsülte az időigényt: a ProgramBench-en a nehézségtől függetlenül kb. 90 percet jósoltak, a második körben a Claude háromszor, a Codex hat-tízszer tévedett, főleg rövid feladatoknál. A futásidő a szoftverkörnyezettől is függött: a Claude Code addig dolgozik, amíg készen nem véli a feladatot, míg a Codex szinte mindig fél óra után leáll. Az ügynökök saját munkájukat is túlértékelték: az Opus 4.8 és a GPT-5.5 átlag 20 ponttal adott magának jobb jegyet, egy esetben 70 százalékos sikert állítva a valós 7-14,5 százalék helyett.
Miért fontos?
A vizsgálat szerint az AI-ügynökök megbízhatatlanul mérik fel saját idő- és teljesítményigényüket, ami kockázatot jelent hosszabb, önálló munkafolyamatoknál.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 31., hétfő napi AI összefoglaló része.