Benchmark-tolmács · Általános tudás

MMLU

57 tantárgy feleletválasztós kérdéseivel méri az angol nyelvű modellek széles körű tanult tudását és feladatmegoldását.

Más néven: Massive Multitask Language Understanding

Pontszám olvasata Pontosság százalékban; magasabb jobb. Csak azonos promptolás, mintaszám és pontozási eljárás mellett hasonlítható.
Frissesség Örökölt mérce
Adatszivárgás Magas kockázat
Hétköznapi jelentőség Csak közvetett jel
01

Mit mér valójában?

A pontszám mögötti képesség

A modell azt mutatja meg, milyen arányban választja ki a helyes választ 57 iskolai, egyetemi és szakmai témakör angol nyelvű, négyválaszos kérdésein. Egyszerre kér számon felidézett tárgyi tudást és rövid, zárt formátumú következtetést.

A részterületi bontás legalább olyan fontos, mint az átlag: két azonos összpontszámú modell tudása nagyon eltérően oszolhat meg.

02

Mit nem mér?

Amit ebből a számból nem tudunk

Nem méri a természetes párbeszédet, a hosszú dokumentumok kezelését, az eszközhasználatot, a forrásellenőrzést, a kreatív munkát vagy azt, hogy a modell felismeri-e, amikor bizonytalan. Magyar nyelvű használatról sem ad közvetlen jelet.

A feleletválasztós forma könnyebb lehet, mint a válasz önálló megfogalmazása, és a pontszám érzékeny a promptolásra és az értékelő keretrendszerre.

03

Mennyire friss?

Örökölt mérce

Az MMLU fontos történeti viszonyítási pont, de a 2020 óta nyilvános készlet a mai csúcsmodelleket kevésbé választja szét, mint megjelenésekor. Új eredménynél ellenőrizni kell, hogy az eredeti MMLU-ról, valamely javított változatról vagy MMLU-Pro-ról van-e szó.

Megjelenés: 2020. sze. 7. Adat-időmetszet: 2020-ban publikált, rögzített kérdéskészlet

04

Lehet-e adatszivárgás?

Magas kockázat

A kérdések és válaszok régóta nyilvánosak, ezért nem zárható ki, hogy közvetlenül vagy másolatokon keresztül bekerültek a tanítóadatba. A magas pontszám így részben felidézést is tükrözhet; ez különösen újabb, internetes korpuszon tanított modelleknél fontos fenntartás.

05

Jelent-e bármit a hétköznapokban?

Csak közvetett jel

A széles tárgyi tudás hasznos alapjel, de kevéssé jósolja meg, hogyan ír a modell magyarul, mennyire követ hosszú utasításokat, használ-e megbízható forrásokat vagy végigvisz-e egy valódi munkafolyamatot. Hétköznapi választásnál csak több más mérés és saját próba mellett érdemes figyelembe venni.

← Vissza a Benchmark-tolmácshoz