2026. június 28., vasárnap · Kutatás

Narration-of-Thought: új promptolási módszer az LLM-ek etikai következtetésének javítására

Egy új, arXiv-on megjelent preprint (arXiv:2606.26366v1) a Narration-of-Thought (NoT) nevű rendszerprompt-módszert mutatja be, amely a nagy nyelvi modellek erkölcsi dilemmákkal kapcsolatos gondolatláncát strukturálja. A szerzők szerint a hagyományos chain-of-thought megközelítés két jellemző hibát mutat: az érintettek figyelmen kívül hagyását (stakeholder collapse) és a bizonytalanság elnyomását (uncertainty suppression). A NoT öt szakaszra tagolja a következtetést: protagonista, érintettek, kétlépcsős következmények, bizonytalanság, majd döntés. A módszer nem igényel finomhangolást, új paramétereket vagy tréninget – kizárólag inferenciaidejű scaffolding. A szerzők 100 DailyDilemmas szcenárión, négy különböző generátor modellen tesztelték az eredményeket. Fontos megjegyezni, hogy a tanulmány preprint, így lektorált validálás még nem történt.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A kutatás arra mutat rá, hogy pusztán prompttervezéssel javítható az LLM-ek etikai érvelésének minősége, ami a felelős AI-használat szempontjából releváns.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. június 28., vasárnap napi AI összefoglaló része.

Kapcsolódó hírek

Új keretrendszer az AI gondolatmenet-konzisztenciájának ellenőrzésére biztonsági értékelésekben

Kutatók egy még nem lektorált tanulmányban bemutatták a reasoning consistency scanning módszert, amely az AI-modellek gondolatmenet-típusú (chain-of-thought) válaszainak belső logikai konzisztenciáját vizsgálja biztonsági értékelési kontextusban. A megközelítés lényege, hogy a hűség (faithfulness) vizsgálatával ellentétben a konzisztencia egyetlen átiratból is ellenőrizhető, kísérleti beavatkozás nélkül. A szerzők hatféle inkonzisztencia-típust azonosítanak, és egy 60 átiratból álló, kézzel validált benchmarkot építettek. Az InspectScout nevű szkennert négy generátor modellen és három biztonsági értékelési feladaton tesztelték, és azt találták, hogy a gondolatmenet-inkonzisztencia kimutatható, jelen van, és szisztematikusan változik modellek és feladattípusok között.

Kutatás: a kereskedelmi LLM-routerek nem múlják felül a véletlen választást

Hat kereskedelmi LLM-router tesztje 14 beállításban, nyolc feladatkategóriát lefedő benchmarkon azt mutatja, hogy egyikük sem múlja felül azt a módszert, amely két gondosan kiválasztott modell közül azonos költség mellett véletlenszerűen választ – áll egy nem lektorált kutatási anyagban (preprint). Némelyik router emellett több mint 10 százalékponttal gyengébben is teljesített, mint e kétmodelles véletlen alapvonal. A szerzők ezt négy visszatérő mintázatra vezetik vissza: a nehézség figyelmen kívül hagyására, a hosszúság szerinti téves rangsorolásra, a szemantikai illesztésre és a modellkészlet nem optimális összeállítására. A tanulmány egy alternatív értékelési módszert és egy egyszerű kétmodelles routert is javasol, amely elkerüli e négy hibát, ám a javulás a véletlenszerű routinghoz képest csekély marad, mert egy jól megválasztott modellpáros már eleve keveset enged javítani.

LLM-ügynökök finomítják az emberi gondolkodás kognitív modelljeit

Kutatók új hibrid rendszert mutatnak be, amely a kognitív algoritmusok felfedezését programfinomítási feladatként kezeli: a korábban kézzel megalkotott, valószínűségi programként megfogalmazott kognitív modelleket LLM-ügynökök vizsgálják felül. Az ügynökök azonosítják, hol tér el a modell az emberi viselkedéstől, kutatói korlátok között kódszintű módosításokat javasolnak, majd ellenőrzik a strukturális hűséget, miközben egy valószínűségi következtető modul számítja ki a rejtett változókat és az adatok valószínűségét. A nem lektorált, arXiv-on közzétett tanulmány szerint a módszert egy problémamegoldási feladatban tesztelték, ahol a felülvizsgált modellek következetesen jobban illeszkedtek az emberi viselkedésre, mint az eredeti modellek, és néhány visszatérő, érdemi viselkedési változatosságot magyarázó innovációt is azonosítottak. A szerzők szerint ez a hibrid megközelítés ötvözi az emberi szakértelem interpretálhatóságát az LLM-ek rugalmasságával és skálázhatóságával.

NASA és IBM nyílt forráskódú alapmodellt épített a Hold kutatására

A NASA és az IBM Research, egyetemi partnerekkel együttműködve, kiadta a NASA-IBM Lunar Foundation Modelt, amelyet a két szervezet az első nyílt forráskódú alapmodellek egyikeként mutat be a holdkutatás számára. A modellt a SomBench nevű adathalmazon tanították be a semmiből, amely a vállalatok állítása szerint a valaha összeállított legnagyobb, egymáshoz illesztett, többmodalitású holdi adatgyűjtemény. A legtöbb adat a Lunar Reconnaissance Orbiter 17 éves megfigyeléseiből származik, kiegészítve a GRAIL, a Lunar Prospector és a japán Kaguya/SELENE szonda méréseivel. A fejlesztők szerint a modell különösen jól teljesít a sarki jégkészletek előrejelzésében és a kráterek felismerésében, mivel címkézett adat kevés, de nyers megfigyelés bőven áll rendelkezésre.