2026. július 29., szerda · Kutatás
Kódoló AI-ügynökök tesztjeinél a keretrendszer is számít, nemcsak a modell
Egy nem lektorált kutatói tanulmány szerint a kódoló AI-ügynökök nyilvános ranglistái félrevezetőek lehetnek, mert csak a modell nevét és a sikerességi arányt közlik, miközben a háttérben futó keretrendszer (scaffold) gyakran dokumentálatlan marad. A szerzők a Qwen 3.6 Plus és a MiniMax M2.5 modelleket három nyílt keretrendszerrel (Goose, OpenCode, OpenHands-SDK) tesztelték a Terminal-Bench Pro 50 feladatos részhalmazán. A keretrendszer választása akár 40-szeres különbséget okozott a feladatonkénti tokenfelhasználásban, míg az azonos modellen belüli sikerességi arány mindössze 0-8 százalékponttal tért el. A hibázási minták is inkább a keretrendszerhez kötődtek, nem a modellhez. A kutatók ezért a modell-keretrendszer párosok együttes, token- és késleltetési korlátok melletti értékelését javasolják.
Miért fontos?
A tanulmány rámutat, hogy a kódoló AI-ügynökök jelenlegi ranglistái torzíthatnak, mert figyelmen kívül hagyják a keretrendszer hatását a költségre és hatékonyságra.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 29., szerda napi AI összefoglaló része.