2026. szeptember 24., csütörtök · Kutatás
SWE-Serve: új benchmark leplezi le az AI kódügynökök gyengéit élő szerverkörnyezetben
Az NVIDIA technikai blogja bemutatta a SWE-Serve nevű benchmarkot, amely 53 feladaton, a nyílt forráskódú SGLang inferencia-kiszolgáló 83 összevont pull requestjéből származó módosításokon méri az AI kódolóügynökök teljesítményét hat területen: modellbetöltés, dekódolás, gyorsítótárazás, ütemezés, kiszolgáló API-k és elosztott futtatás. A 19, élő szervert is elindító feladatnál a javítások 69,4%-ban mentek át, ha az élő kiszolgálási teszteket kihagyták, de csak 45,9%-ban a teljes ellenőrzéssel, vagyis minden harmadik, más teszteken átment javítás elbukott valós terhelés mellett. A több futásidejű területet érintő feladatoknál a sikerarány 21,3 százalékponttal alacsonyabb volt, mint az egy területre koncentráló feladatoknál, ez a jelenség minden tesztelt modellnél megjelent. Tizenegy modellt vizsgáltak a mini-swe-agent keretrendszerrel zárt könyves módban, a pass@1 mutató 34,6% és 75,5% között szórt.
Miért fontos?
A benchmarkot a SGLang fejlesztőcsapat bevonásával készítették, ami arra utal, hogy a jelenlegi kódügynök-tesztek felülbecsülhetik a modellek megbízhatóságát valós, éles inferencia-szerverek üzemeltetésénél.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 24., csütörtök napi AI összefoglaló része.