2026. július 10., péntek · Kutatás

ROAM: ipari szakértői modellek LLM-alapú adaptálása újratanítás nélkül

A ROAM keretrendszer az üzembe helyezett ipari modellek korrekcióját célozza nagy nyelvi modellek következtetési képességével, a modellparaméterek újratanítása nélkül. Az eljárás egy alacsony dimenziós látens térben korrigálja a befagyasztott modell kimenetét – például szenzordrift vagy alapanyag-változás esetén –, miközben kockázatkorlátos mechanizmus gátolja a korrekciót megbízhatatlan bizonyíték mellett. A nem lektorált tanulmány szerzői szerint két ipari adathalmazon a módszer több mint 20%-kal csökkentette a MAE-t jelentős rezsimváltásoknál, mindössze 839 extra paraméterrel és 0,02 ms alatti lépésenkénti többletidővel.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

Az ipari modellkarbantartás költségeit potenciálisan csökkentheti, ha az LLM-következtetés biztonságos adaptációs jelként alkalmazható újratanítás nélkül.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 10., péntek napi AI összefoglaló része.

Kapcsolódó hírek

Egyetlen üzenettel feltörhető volt egy teljes AWS AI-ügynök-flotta

A Zenity Labs biztonsági kutatói sebezhetőség-láncot találtak Amazon Bedrock AgentCore platformján, amelyet „AgentCorruption” néven neveztek el. A kutatók szerint elég volt egyetlen chatüzenetet küldeni egy nyilvánosan elérhető AI-ügynöknek ahhoz, hogy átvegyék az irányítást az adott AWS-fiók és régió összes AgentCore-ügynöke felett. A probléma gyökere, hogy az ügynökök nem voltak megfelelően elszigetelve, és felszólításra kiadták az AWS belső metaadat-szolgáltatásától (169.254.169.254) kapott ideiglenes hitelesítő adataikat, amelyekkel a kutatók állítása szerint forráskódhoz, jelszavakhoz, privát beszélgetésekhez és más ügynökök memóriájához is hozzáfértek. Az ellopott hitelesítő adatok a kutatók szerint saját gépükről is működtek. Az AWS részlegesen javította a hibát a metaadat-hozzáférés szigorításával és az alapértelmezett végrehajtási szerepkör korlátozásával, a Zenity emellett szigorúbb, minimális jogosultságú szerepkörök manuális beállítását javasolja a vállalatoknak.

EPOCH: bizonyítékvezérelt keresés AI-kutatási ágenseknek

Egy kutatócsoport az EPOCH nevű architektúrát mutatja be, amely AI-kutatási ágensek számára próbálja garantálni, hogy a programok, matematikai konstrukciók és bizonyítások keresése során ne keveredjenek össze a törékeny, de ígéretesnek tűnő jelöltek a valóban megbízható felfedezésekkel. A rendszer explicit feladat-szerződéseket, tipizált memóriát, aktív cáfolási mechanizmusokat, befogadási ellenőrzéseket és független visszajátszást kombinál. A fejlesztők állítása szerint – ez egy nem lektorált, arXiv-on közzétett preprint eredménye – az EPOCH az AlgoTune benchmarkon 0,65-ös átlagos normalizált pontszámot ért el a legerősebb alapmodell 0,53-as eredményével szemben, a belső Math14 tesztcsomagon pedig 0,57-es átlagpontszámot hozott, emellett tíz felfedezési feladat közül többnél konkrét, bizonyítással alátámasztott előrelépést ért el.

OpenAI 722 matematikai kéziratot tett közzé – a szakma etikai aggályokat fogalmaz meg

Az OpenAI kedden 722 kéziratot hozott nyilvánosságra, amelyek 372 eredménycsaládba rendeződnek, és algebra, elméleti számítástechnika, valamint matematikai logika területén oldanak meg régi nyitott kérdéseket. Az eredmények egy egyelőre nyilvánosságra nem hozott modellből származnak; az AGMAI elitmatematikusokból álló tanácsadó csoport közlése alapján az átlagos eredmény hozzávetőleg háromórányi ChatGPT Pro gondolkodásnak felelt meg. Az AGMAI korábban arra is felszólította az AI-laboratóriumokat, hogy ne kezeljék marketingeszközként az ilyen felfedezéseket, és hozzák nyilvánosságra a modell nevét, a promptokat és a számítási költségeket. A princetoni Institute for Advanced Study aggodalmát fejezte ki amiatt, hogy az AI olyan matematikai érveket is előállíthat, amelyeket a promptot adó ember nem képes megérteni vagy ellenőrizni; az OpenAI bejelentette, hogy együttműködik az intézettel, ám nem jelezte, hogy leállítaná jelenlegi gyakorlatát.

Kutatás: a kereskedelmi LLM-routerek nem múlják felül a véletlen választást

Hat kereskedelmi LLM-router tesztje 14 beállításban, nyolc feladatkategóriát lefedő benchmarkon azt mutatja, hogy egyikük sem múlja felül azt a módszert, amely két gondosan kiválasztott modell közül azonos költség mellett véletlenszerűen választ – áll egy nem lektorált kutatási anyagban (preprint). Némelyik router emellett több mint 10 százalékponttal gyengébben is teljesített, mint e kétmodelles véletlen alapvonal. A szerzők ezt négy visszatérő mintázatra vezetik vissza: a nehézség figyelmen kívül hagyására, a hosszúság szerinti téves rangsorolásra, a szemantikai illesztésre és a modellkészlet nem optimális összeállítására. A tanulmány egy alternatív értékelési módszert és egy egyszerű kétmodelles routert is javasol, amely elkerüli e négy hibát, ám a javulás a véletlenszerű routinghoz képest csekély marad, mert egy jól megválasztott modellpáros már eleve keveset enged javítani.