2026. július 30., csütörtök · Kutatás
Új mérési szabvány leplezi le a diffúziós nyelvmodellek kiértékelési hibáit
Egy nem lektorált preprint szerint a maszkolt diffúziós nyelvmodellek (MDLM) remasking stratégiáit vizsgáló hét friss kutatás egymással össze nem hasonlítható beállításokat használt: eltérő lépésszámot, metrikát és mintavételi hőmérsékletet, ezért a közölt rangsorok megbízhatatlanok. A szerzők bemutatják a CaRE nevű, számítási kapacitást figyelembe vevő kiértékelési keretrendszert, amely rögzíti a tényleges függvényhívások számát és több metrikát jelent egyszerre. A LLaDA-8B-Base és Dream-7B-Base modelleken végzett tesztek szerint a hőmérséklet magyarázza a MAUVE-mutató változásának nagy részét, a számításilag azonos feltételek melletti összehasonlítások pedig több publikált rangsort megfordítanak. A kutatás azt is állítja, hogy az informált remasking és a sztochasztikus feloldás egymással ütközik, amit egy 12 nyílt súlyú modellt felölelő ranglista is alátámaszt.
Miért fontos?
A tanulmány rámutat, hogy a diffúziós nyelvmodellek eddigi teljesítmény-összehasonlításai gyakran torzítottak, ami megkérdőjelezi a korábbi publikációk állításainak megbízhatóságát.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 30., csütörtök napi AI összefoglaló része.