2026. szeptember 25., péntek · Kutatás
Kutatás: a bizonyíték sorrendje csal at multimodális AI-modelleket
Egy vizsgálat szerint a multimodális nagy nyelvi modellek ítéletét nemcsak az befolyásolja, hogy kép vagy hang mond-e ellent a kísérő szövegnek, hanem az is, hogy melyik bizonyíték áll elöl vagy hátul. A kutatók egy még nem lektorált, arXiv-on közzétett preprintben olyan páros összehasonlítást alkalmaztak, amelyben az utasítás és a bizonyíték tartalma rögzített maradt, csak a kép vagy hangfelvétel és a szöveg sorrendjét cserélték fel. Az eredmény szerint, ha az érzékszervi bizonyíték (kép vagy hangfelvétel) az ellentmondó szöveg után következik, a modellek válaszai következetesen az érzékszervi tartalom felé tolódnak el. A szerzők ezt „bizonyíték-nemkommutativitásnak” nevezik, és amellett érvelnek, hogy korábbi tanulmányok szövegelfogultságra vonatkozó következtetései torzultak lehettek, mert rögzített sorrendet használtak vagy az utasítást a bizonyítékkal együtt mozgatták.
Egy forrás erősíti A hír állításait legfeljebb egy forrás támasztja alá tárgyilag; a többi forrás anyaga nem erről szól.
Miért fontos?
A talált sorrendfüggés azt jelenti, hogy a jelenlegi kép- és beszédkonfliktus-tesztek (pl. GPT-4V-szerű vagy Gemini-típusú multimodális rendszerek értékelésénél) újratervezést igényelhetnek, mert a bizonyíték elhelyezése önmagában megváltoztathatja a mért „modalitáspreferenciát”.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 25., péntek napi AI összefoglaló része.