2026. július 8., szerda · Kutatás

EmulatRx: ágens-alapú keretrendszer klinikai vizsgálatok tervezésének gyorsítására valós világ adataival

A Nature Communications-ben megjelent tanulmány bemutatja az EmulatRx nevű ágens-alapú keretrendszert, amely nagy nyelvi modellek együttműködésével és valós világ adatokkal (pl. elektronikus egészségügyi rekordok) segíti a klinikai vizsgálatok tervezését. A rendszer különböző szerepű AI-ágensek iteratív párbeszédén keresztül önállóan finomítja a vizsgálati protokollokat, és részletes jelentést generál a tervezési döntések megalapozásához. A szerzők akut betegségekre (pl. szeptikus sokk, akut szívelégtelenség) a MIMIC-IV adatbázison, krónikus betegségekre (Alzheimer- és Parkinson-kór) pedig öt New York-i egészségügyi rendszer adatain tesztelték a megoldást. Az eredmények szerint az EmulatRx képes felgyorsítani a klinikai vizsgálatok tervezési folyamatát, bár a valós klinikai alkalmazhatóságot további validáció igazolhatja.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

Az AI-ágensek klinikai vizsgálattervezésbe integrálása csökkentheti a gyógyszerfejlesztés idejét és költségeit, ha a módszert szélesebb körben is validálják.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 8., szerda napi AI összefoglaló része.

Helyesbítés · 2026. október 1., csütörtök

Helyesbítés (2026-09-20): a hírhez utólag hozzáfűztük a nem lektorált (preprint) státusz jelzését, mert a megjelenéskor ez lemaradt. A hír címe, összefoglalója és forrásai változatlanok. Helyesbítés (2026-10-01): a hír alól eltávolítottuk az arXiv 2607.03634 hivatkozást („The Role of Rigor in Artificial Intelligence”), mert nem erről a munkáról szól; vele együtt kikerült a „Miért fontos?”-ból a 2026-09-20-án hozzáfűzött „A mögöttes eredményt leíró tanulmány preprint” mondat, mert erre a téves hivatkozásra épült. A hír forrása a Nature Communications-ben megjelent, lektorált cikk.

Kapcsolódó hírek

Kutatás: a kereskedelmi LLM-routerek nem múlják felül a véletlen választást

Hat kereskedelmi LLM-router tesztje 14 beállításban, nyolc feladatkategóriát lefedő benchmarkon azt mutatja, hogy egyikük sem múlja felül azt a módszert, amely két gondosan kiválasztott modell közül azonos költség mellett véletlenszerűen választ – áll egy nem lektorált kutatási anyagban (preprint). Némelyik router emellett több mint 10 százalékponttal gyengébben is teljesített, mint e kétmodelles véletlen alapvonal. A szerzők ezt négy visszatérő mintázatra vezetik vissza: a nehézség figyelmen kívül hagyására, a hosszúság szerinti téves rangsorolásra, a szemantikai illesztésre és a modellkészlet nem optimális összeállítására. A tanulmány egy alternatív értékelési módszert és egy egyszerű kétmodelles routert is javasol, amely elkerüli e négy hibát, ám a javulás a véletlenszerű routinghoz képest csekély marad, mert egy jól megválasztott modellpáros már eleve keveset enged javítani.

LLM-ügynökök finomítják az emberi gondolkodás kognitív modelljeit

Kutatók új hibrid rendszert mutatnak be, amely a kognitív algoritmusok felfedezését programfinomítási feladatként kezeli: a korábban kézzel megalkotott, valószínűségi programként megfogalmazott kognitív modelleket LLM-ügynökök vizsgálják felül. Az ügynökök azonosítják, hol tér el a modell az emberi viselkedéstől, kutatói korlátok között kódszintű módosításokat javasolnak, majd ellenőrzik a strukturális hűséget, miközben egy valószínűségi következtető modul számítja ki a rejtett változókat és az adatok valószínűségét. A nem lektorált, arXiv-on közzétett tanulmány szerint a módszert egy problémamegoldási feladatban tesztelték, ahol a felülvizsgált modellek következetesen jobban illeszkedtek az emberi viselkedésre, mint az eredeti modellek, és néhány visszatérő, érdemi viselkedési változatosságot magyarázó innovációt is azonosítottak. A szerzők szerint ez a hibrid megközelítés ötvözi az emberi szakértelem interpretálhatóságát az LLM-ek rugalmasságával és skálázhatóságával.

NASA és IBM nyílt forráskódú alapmodellt épített a Hold kutatására

A NASA és az IBM Research, egyetemi partnerekkel együttműködve, kiadta a NASA-IBM Lunar Foundation Modelt, amelyet a két szervezet az első nyílt forráskódú alapmodellek egyikeként mutat be a holdkutatás számára. A modellt a SomBench nevű adathalmazon tanították be a semmiből, amely a vállalatok állítása szerint a valaha összeállított legnagyobb, egymáshoz illesztett, többmodalitású holdi adatgyűjtemény. A legtöbb adat a Lunar Reconnaissance Orbiter 17 éves megfigyeléseiből származik, kiegészítve a GRAIL, a Lunar Prospector és a japán Kaguya/SELENE szonda méréseivel. A fejlesztők szerint a modell különösen jól teljesít a sarki jégkészletek előrejelzésében és a kráterek felismerésében, mivel címkézett adat kevés, de nyers megfigyelés bőven áll rendelkezésre.

Google-kutatók módszere védi az önfejlesztő AI-ügynököket a tesztek bemagolásától

A Google Cloud AI Research és több egyetem kutatói olyan AI-ügynökökkel foglalkoztak, amelyek saját működési keretrendszerüket (a modellt körülvevő prompt-, eszköz- és logikarendszert) ismételten átírják a jobb teljesítmény érdekében. A kutatók szerint ez a folyamat, amelyet a gyakorlati rekurzív önfejlesztés egy formájának neveznek, komoly hátránnyal jár: az ügynökök a korlátozott tesztfeladat-készleten gyakorolva bemagolják azokat, így a teszteredményeik javulnak, de új, ismeretlen feladatokon alig vagy egyáltalán nem javulnak. Erre válaszul a kutatók egy RRSI nevű módszert dolgoztak ki, amely csökkenő „szerkesztési költségvetéssel” korlátozza az egyszerre bevezethető változtatások számát, és nyomon követi a korábbi sikertelen próbálkozásokat, hogy a rendszer ne ismételje azokat. A cikk állítása szerint az RRSI mindhárom vizsgált területen javulást hozott az ismeretlen feladatokon is, miközben a számítási költségeket is csökkentette.