2026. szeptember 19., szombat · Kutatás
Új benchmark: LLM-ek megbízhatatlanok autós hangparancsok engedélyezésénél
Kutatók egy 202 forgatókönyvből álló benchmarkot dolgoztak ki, amely azt méri, mennyire biztonságosan döntenek a nagy nyelvi modellek (LLM) autós hangasszisztensek parancsainak kezeléséről – végrehajtás, elutasítás, visszaigazolás vagy manuális vezérlés között. A nem lektorált arXiv-preprint szerint a Gemini 3.1 Pro Preview érte el a legjobb, 89,1%-os egyezést a referenciadöntésekkel, míg a Llama 3.2 3B csak 40,1%-ot; a három API-alapú modell 83,2-89,1% között teljesített, szignifikáns különbség nélkül. Még a legjobb modellek is 2-3 hamis végrehajtást produkáltak a 161 nem-végrehajtási esetből, és a visszaigazolási döntéseknél tartós hibák maradtak. A szerzők szerint a strukturált LLM-döntések önmagukban nem elégségesek, független érvényesítési rétegre van szükség a valós autós beépítéshez.
Egy forrás erősíti A hír állításait legfeljebb egy forrás támasztja alá tárgyilag; a többi forrás anyaga nem erről szól.
Miért fontos?
A teszt szerint még a piacvezető Gemini 3.1 Pro Preview is hibázhat biztonságkritikus autós parancsok, például ajtózárak vagy vezérlésváltás eldöntésében, ezért a gyártóknak külön szoftveres engedélyezési réteget kell beépíteniük az LLM mellé.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 19., szombat napi AI összefoglaló része.