2026. július 3., péntek · Kutatás

Bayesi bizonytalanság-propagálás az ágensalapú RAG rendszerek megbízhatóságának javítására

Kutatók egy bizonytalanságtudatos keretrendszert mutattak be ágensalapú Retrieval-Augmented Generation (RAG) rendszerekhez, amelyben a tervező, kiértékelő és generáló szakaszok bizonytalansági jeleket állítanak elő szemantikai eltérés és önértékelés alapján. Ezeket a jeleket egy Bayes-hálón propagálják, hogy rendszerszintű bizonytalanságot becsüljenek, és a munkafolyamat egyes csomópontjainál jelezzék a lehetséges hibaforrásokat. A StrategyQA és HotpotQA adathalmazokon, GPT-3.5-Turbo és GPT-4.1-Nano modellekkel végzett kísérletek szerint a módszer a többlépéses következtetést igénylő HotpotQA-n hatékonyabb, míg a StrategyQA-n a rosszul kalibrált upstream jelek korlátozzák a teljesítményt. A nem lektorált tanulmány a megközelítést ígéretesnek, de előzetesnek minősíti, és ipari validálást – például tengeri szélenergia-karbantartási döntéstámogatásban – tart szükségesnek.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A kutatás strukturált módszert javasol az összetett, többlépéses AI-rendszerek megbízhatóságának számszerűsítésére, ami kritikus a valós alkalmazásoknál.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 3., péntek napi AI összefoglaló része.

Kapcsolódó hírek

AI-keretrendszer gyorsítja az emberi szövetatlasz adatgyűjtését

Kutatók a Communications Biology folyóiratban bemutatták a HRAftu-LM-RAG nevű mesterséges intelligencia keretrendszert, amely nagy nyelvi modelleket, képi elemzést végző modelleket és visszakereséssel támogatott generálást (RAG) kombinál. A cél a funkcionális szövetegységek (FTU) tulajdonságainak automatikus kinyerése tudományos publikációkból a Human Reference Atlas (HRA) építéséhez, amely az emberi test szervezettségét térképezi fel szervi szinttől egyetlen sejtekig. A szerzők szerint a rendszer 244 640 PubMed Central cikket dolgozott fel 1 389 168 ábrával 22 FTU-ra vonatkozóan, ebből 617 237 mikroszkópos vagy sematikus képet azonosított, és 331 189 méretarány-jelölést, valamint 1 719 138 biológiai entitás-említést nyert ki, donor-metaadatokkal együtt. A cikk korai, lektorált változatként jelent meg, végleges formája még változhat.

OpenAI 722 matematikai kéziratot tett közzé – a szakma etikai aggályokat fogalmaz meg

Az OpenAI kedden 722 kéziratot hozott nyilvánosságra, amelyek 372 eredménycsaládba rendeződnek, és algebra, elméleti számítástechnika, valamint matematikai logika területén oldanak meg régi nyitott kérdéseket. Az eredmények egy egyelőre nyilvánosságra nem hozott modellből származnak; az AGMAI elitmatematikusokból álló tanácsadó csoport közlése alapján az átlagos eredmény hozzávetőleg háromórányi ChatGPT Pro gondolkodásnak felelt meg. Az AGMAI korábban arra is felszólította az AI-laboratóriumokat, hogy ne kezeljék marketingeszközként az ilyen felfedezéseket, és hozzák nyilvánosságra a modell nevét, a promptokat és a számítási költségeket. A princetoni Institute for Advanced Study aggodalmát fejezte ki amiatt, hogy az AI olyan matematikai érveket is előállíthat, amelyeket a promptot adó ember nem képes megérteni vagy ellenőrizni; az OpenAI bejelentette, hogy együttműködik az intézettel, ám nem jelezte, hogy leállítaná jelenlegi gyakorlatát.

Kutatás: a kereskedelmi LLM-routerek nem múlják felül a véletlen választást

Hat kereskedelmi LLM-router tesztje 14 beállításban, nyolc feladatkategóriát lefedő benchmarkon azt mutatja, hogy egyikük sem múlja felül azt a módszert, amely két gondosan kiválasztott modell közül azonos költség mellett véletlenszerűen választ – áll egy nem lektorált kutatási anyagban (preprint). Némelyik router emellett több mint 10 százalékponttal gyengébben is teljesített, mint e kétmodelles véletlen alapvonal. A szerzők ezt négy visszatérő mintázatra vezetik vissza: a nehézség figyelmen kívül hagyására, a hosszúság szerinti téves rangsorolásra, a szemantikai illesztésre és a modellkészlet nem optimális összeállítására. A tanulmány egy alternatív értékelési módszert és egy egyszerű kétmodelles routert is javasol, amely elkerüli e négy hibát, ám a javulás a véletlenszerű routinghoz képest csekély marad, mert egy jól megválasztott modellpáros már eleve keveset enged javítani.

LLM-ügynökök finomítják az emberi gondolkodás kognitív modelljeit

Kutatók új hibrid rendszert mutatnak be, amely a kognitív algoritmusok felfedezését programfinomítási feladatként kezeli: a korábban kézzel megalkotott, valószínűségi programként megfogalmazott kognitív modelleket LLM-ügynökök vizsgálják felül. Az ügynökök azonosítják, hol tér el a modell az emberi viselkedéstől, kutatói korlátok között kódszintű módosításokat javasolnak, majd ellenőrzik a strukturális hűséget, miközben egy valószínűségi következtető modul számítja ki a rejtett változókat és az adatok valószínűségét. A nem lektorált, arXiv-on közzétett tanulmány szerint a módszert egy problémamegoldási feladatban tesztelték, ahol a felülvizsgált modellek következetesen jobban illeszkedtek az emberi viselkedésre, mint az eredeti modellek, és néhány visszatérő, érdemi viselkedési változatosságot magyarázó innovációt is azonosítottak. A szerzők szerint ez a hibrid megközelítés ötvözi az emberi szakértelem interpretálhatóságát az LLM-ek rugalmasságával és skálázhatóságával.