2026. augusztus 20., csütörtök · Kutatás

Helyi nyelvi modellel dolgozó rendszer segíthet kutatási problémákat azonosítani

Kutatók bemutatták a Structural Gap Hypothesis Agent (SGHA) nevű rendszert, amely egy helyben futtatott, mindössze 9 milliárd paraméteres nyílt súlyú nyelvi modellel dolgozik, nem pedig felhőalapú, proprietary modellekkel, mint a jelenlegi automatizált AI-kutató ügynökök többsége. A szerzők szerint a rendszer a tudományos irodalmat bizonyítékokhoz kötött gráfba rendezi, ebben azonosít feltáratlan mintázatokat, majd nyomon követhető kutatási problémajavaslatokat generál feltevésekkel és célokkal együtt. Az állítás szerint öt gépi tanulási területen összevetve az AI Scientist-v2 ötletgeneráló moduljával az SGHA hasonlóan ígéretes, de átláthatóbb eredményeket adott. A közlemény nem lektorált arXiv-előzetes, eredményei függetlenül még nem igazoltak.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A megközelítés, ha beválik, csökkentheti a tudományos kutatás automatizálásának függését drága, átláthatatlan proprietary AI-modellektől.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 20., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

Shadow evaluation: AI-ágensek elbuknak a nyílt kutatói döntéseknél

Egy nem lektorált tanulmány „shadow evaluation” néven új tesztmódszert vezet be: két meg nem jelent NeurIPS 2026-os cikk nyitott kutatási kérdését kapták meg AI-ágensek hat nap és több ezer dollárnyi számítási kapacitás mellett, majd a kéziratok eredeti szerzői értékelték a munkájukat. A szerzők szerint az ágensek emberi segítség nélkül elvégezték a szükséges mérnöki munkát, de érdemi előrelépést nem értek el a kutatási kérdés megválaszolásában, ezért mindkét dolgozatot elutasították. Öt visszatérő hibamintát azonosítottak: gyenge publikálhatósági ítélőképesség, kreativitáshiány a kutatási terv hibáinak kezelésében, hatástalan visszalépés zsákutcákból, gyenge erőforrás-tudatosság és utasításoktól való eltávolodás. Egy második modellel végzett ellenőrzés ugyanezeket a hibákat reprodukálta.

OpenAI 722 matematikai kéziratot tett közzé – a szakma etikai aggályokat fogalmaz meg

Az OpenAI kedden 722 kéziratot hozott nyilvánosságra, amelyek 372 eredménycsaládba rendeződnek, és algebra, elméleti számítástechnika, valamint matematikai logika területén oldanak meg régi nyitott kérdéseket. Az eredmények egy egyelőre nyilvánosságra nem hozott modellből származnak; az AGMAI elitmatematikusokból álló tanácsadó csoport közlése alapján az átlagos eredmény hozzávetőleg háromórányi ChatGPT Pro gondolkodásnak felelt meg. Az AGMAI korábban arra is felszólította az AI-laboratóriumokat, hogy ne kezeljék marketingeszközként az ilyen felfedezéseket, és hozzák nyilvánosságra a modell nevét, a promptokat és a számítási költségeket. A princetoni Institute for Advanced Study aggodalmát fejezte ki amiatt, hogy az AI olyan matematikai érveket is előállíthat, amelyeket a promptot adó ember nem képes megérteni vagy ellenőrizni; az OpenAI bejelentette, hogy együttműködik az intézettel, ám nem jelezte, hogy leállítaná jelenlegi gyakorlatát.

Kutatás: a kereskedelmi LLM-routerek nem múlják felül a véletlen választást

Hat kereskedelmi LLM-router tesztje 14 beállításban, nyolc feladatkategóriát lefedő benchmarkon azt mutatja, hogy egyikük sem múlja felül azt a módszert, amely két gondosan kiválasztott modell közül azonos költség mellett véletlenszerűen választ – áll egy nem lektorált kutatási anyagban (preprint). Némelyik router emellett több mint 10 százalékponttal gyengébben is teljesített, mint e kétmodelles véletlen alapvonal. A szerzők ezt négy visszatérő mintázatra vezetik vissza: a nehézség figyelmen kívül hagyására, a hosszúság szerinti téves rangsorolásra, a szemantikai illesztésre és a modellkészlet nem optimális összeállítására. A tanulmány egy alternatív értékelési módszert és egy egyszerű kétmodelles routert is javasol, amely elkerüli e négy hibát, ám a javulás a véletlenszerű routinghoz képest csekély marad, mert egy jól megválasztott modellpáros már eleve keveset enged javítani.

LLM-ügynökök finomítják az emberi gondolkodás kognitív modelljeit

Kutatók új hibrid rendszert mutatnak be, amely a kognitív algoritmusok felfedezését programfinomítási feladatként kezeli: a korábban kézzel megalkotott, valószínűségi programként megfogalmazott kognitív modelleket LLM-ügynökök vizsgálják felül. Az ügynökök azonosítják, hol tér el a modell az emberi viselkedéstől, kutatói korlátok között kódszintű módosításokat javasolnak, majd ellenőrzik a strukturális hűséget, miközben egy valószínűségi következtető modul számítja ki a rejtett változókat és az adatok valószínűségét. A nem lektorált, arXiv-on közzétett tanulmány szerint a módszert egy problémamegoldási feladatban tesztelték, ahol a felülvizsgált modellek következetesen jobban illeszkedtek az emberi viselkedésre, mint az eredeti modellek, és néhány visszatérő, érdemi viselkedési változatosságot magyarázó innovációt is azonosítottak. A szerzők szerint ez a hibrid megközelítés ötvözi az emberi szakértelem interpretálhatóságát az LLM-ek rugalmasságával és skálázhatóságával.