2026. augusztus 22., szombat · Kutatás

Kutatók AI-val kísérleteztek légiforgalmi irányítói szövegek generálására

Egy nem lektorált, arXiv-on közzétett preprint azt vizsgálta, hogy nagy nyelvi modellek képesek-e hiteles légiforgalmi irányítói (ATC) közléseket generálni egy San Francisco feletti kísérleti repülés kézzel átírt rádióforgalma alapján. A szerzők kilenc modellt teszteltek öt, egyre szigorúbb promptszerkezettel, miközben a modell a pilóta rögzített szövegére válaszolva játszotta az irányító szerepét. Eredményeik szerint egy kidolgozott minta beillesztése javította a hasonlóságot a valós adatokhoz, ám a prompt szigorítása nem: a legkötetlenebb utasítások teljesítettek legjobban, míg a legrészletesebben szkriptelt verzió saját hibái miatt fokozatosan összeomlott, amit a helyes előzményszöveg beillesztése korrigált. A szerzők szerint ez konkrét, de korlátokkal terhelt utat vázol fel az LLM-alapú ATC-asszisztencia felé.

Miért fontos?

A biztonságkritikus légiforgalmi kommunikáció automatizálása komoly téttel bír, de az eredmények egy nem lektorált előzetes tanulmányból származnak.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 22., szombat napi AI összefoglaló része.

Kapcsolódó hírek

Helyben futtatható nyelvi modellek japán gyógyszerészvizsgán

Japán kutatók a Scientific Reports folyóiratban közölt, korai hozzáférésű tanulmányukban négy, helyben (lokálisan) futtatható nagy nyelvi modellt teszteltek a Japán Nemzeti Gyógyészvizsga (JNEP) 109. kiadásának 165 szöveges kérdésén. A vizsgált modellek – a phi-4, a DeepSeek R1 Distill Qwen (DSR1-Qwen32B), valamint két japánra finomhangolt DSR1-Qwen variáns – 55,2% és 76,4% közötti pontosságot értek el. A szerzők szerint a LoRA nevű, erőforrás-hatékony finomhangolási módszer a phi-4 modell pontosságát 60,6%-ról 66,1%-ra javította, ami arra utal, hogy a feladatspecifikus adaptáció növelheti a teljesítményt. A kutatók hangsúlyozzák, hogy az eredmények előzetes bizonyítékot jelentenek arra, hogy helyben futtatható modellek és erőforrás-takarékos adaptációs technikák alkalmazhatók strukturált, tudásalapú vizsgákon, de szükség van szélesebb körű vizsgálatokra is.

LLM-ekkel automatizált szakirodalmi áttekintés járványmodellekről

Egy nem lektorált, arXiv-on közzétett tanulmány szerint kutatók nagy nyelvi modellekre épülő feldolgozási láncot fejlesztettek 536, lektorált ágensalapú betegségterjedési modelleket bemutató cikk automatikus feldolgozására, majd az eredményeket emberi kutatók szisztematikus szakirodalmi áttekintésével vetették össze. A szerzők állítása szerint a GPT-4.1 cikkszintű pontossága mintegy 77,95%, a GPT-5.0-é 81,67% volt, míg mezőnkénti szinten a pontosság 32,40% és 100% között szórt, a bonyolultabb, szubjektívebb mezőknél megbízhatatlanabbul. A tanulmány szerint az LLM-ek közötti egyezés a kimenet minőségének jelzője lehet: alacsony egyezés hallucinációra, magas egyezés alacsony pontossággal párosulva pedig az emberi adathalmaz hibáira utalhat.

Kutatás: a kereskedelmi LLM-routerek nem múlják felül a véletlen választást

Hat kereskedelmi LLM-router tesztje 14 beállításban, nyolc feladatkategóriát lefedő benchmarkon azt mutatja, hogy egyikük sem múlja felül azt a módszert, amely két gondosan kiválasztott modell közül azonos költség mellett véletlenszerűen választ – áll egy nem lektorált kutatási anyagban (preprint). Némelyik router emellett több mint 10 százalékponttal gyengébben is teljesített, mint e kétmodelles véletlen alapvonal. A szerzők ezt négy visszatérő mintázatra vezetik vissza: a nehézség figyelmen kívül hagyására, a hosszúság szerinti téves rangsorolásra, a szemantikai illesztésre és a modellkészlet nem optimális összeállítására. A tanulmány egy alternatív értékelési módszert és egy egyszerű kétmodelles routert is javasol, amely elkerüli e négy hibát, ám a javulás a véletlenszerű routinghoz képest csekély marad, mert egy jól megválasztott modellpáros már eleve keveset enged javítani.

LLM-ügynökök finomítják az emberi gondolkodás kognitív modelljeit

Kutatók új hibrid rendszert mutatnak be, amely a kognitív algoritmusok felfedezését programfinomítási feladatként kezeli: a korábban kézzel megalkotott, valószínűségi programként megfogalmazott kognitív modelleket LLM-ügynökök vizsgálják felül. Az ügynökök azonosítják, hol tér el a modell az emberi viselkedéstől, kutatói korlátok között kódszintű módosításokat javasolnak, majd ellenőrzik a strukturális hűséget, miközben egy valószínűségi következtető modul számítja ki a rejtett változókat és az adatok valószínűségét. A nem lektorált, arXiv-on közzétett tanulmány szerint a módszert egy problémamegoldási feladatban tesztelték, ahol a felülvizsgált modellek következetesen jobban illeszkedtek az emberi viselkedésre, mint az eredeti modellek, és néhány visszatérő, érdemi viselkedési változatosságot magyarázó innovációt is azonosítottak. A szerzők szerint ez a hibrid megközelítés ötvözi az emberi szakértelem interpretálhatóságát az LLM-ek rugalmasságával és skálázhatóságával.