Benchmark-tolmács · Kódolás

SWE-bench Verified

Valódi GitHub-hibajegyek alapján méri, hogy egy kódoló ügynök képes-e működő javítást készíteni meglévő Python-projektekben.

Más néven: SWEbench Verified, SWE-bench_Verified

Pontszám olvasata A sikeresen megoldott hibajegyek aránya; magasabb jobb. Csak azonos Verified készlet, tesztharness, agent, eszköz-, idő- és költségkeret mellett hasonlítható.
Frissesség Korosodó
Adatszivárgás Magas kockázat
Hétköznapi jelentőség Részleges kapcsolat
01

Mit mér valójában?

A pontszám mögötti képesség

A rendszer egy valódi kódbázist és hibajegyet kap, majd olyan javítást kell készítenie, amely átmegy a repository tesztjein. A Verified változat 500, szoftvermérnökök által megoldhatónak ellenőrzött feladatot tartalmaz.

Ez nem pusztán kódkiegészítés: a pontszámot a modell mellett az ügynöki keret, a fájlkeresés, a parancsfuttatás, a hibakeresési stratégia és a rendelkezésre álló számítási keret együtt alakítja.

02

Mit nem mér?

Amit ebből a számból nem tudunk

Nem méri általában a szoftvermérnöki munkát: a követelmények tisztázását, az új rendszertervezést, a kódreview-t, a biztonságot, a hosszú távú karbantarthatóságot vagy a csapatmunkát. A feladatok főként nyílt forrású Python-repositorykból származnak.

A teszteken átmenő patch sem feltétlenül a legjobb vagy legbiztonságosabb javítás, és a modell pontszáma nem választható le az agent implementációjáról.

03

Mennyire friss?

Korosodó

A valós repositoryk miatt gyakorlatiasabb sok régi kódtesztnél, de a Verified feladatai rögzítettek és széles körben használtak. A futtatókörnyezetet és a harness hibáit időközben javítják, ezért a dátum nélküli eredmény nem elég pontos.

Megjelenés: 2024. aug. 13. Adat-időmetszet: 2024-es, 500 feladatos Verified készlet; a harness verziója külön számít

04

Lehet-e adatszivárgás?

Magas kockázat

A hibajegyek, repositoryk és később a megoldások is nyilvános GitHub-adatokból származnak. Egy modell előtanítása, finomhangolása vagy agentjének visszakeresése találkozhatott velük. A tiszta összevetéshez a fejlesztőknek közölniük kell az adatszűrést, a hozzáférhető internetet és a benchmark-specifikus hangolást.

05

Jelent-e bármit a hétköznapokban?

Részleges kapcsolat

Kódkarbantartási feladatoknál az egyik hasznosabb külső jel, mert valódi projekten, végrehajtható tesztekkel mér. Ettől még nem garantál jó teljesítményt a te nyelveden, repositorydon vagy fejlesztői környezetedben; saját, vak hibajegyekkel végzett próba továbbra is fontos.

← Vissza a Benchmark-tolmácshoz