2026. július 19., vasárnap · Kutatás

CIPHER: párhuzamos kiindulási állapotokkal skálázza az adattudományi AI-ágenseket

A CIPHER keretrendszer az adattudományi AI-ágensek teljesítményét úgy javítja, hogy a tesztelési időben több párhuzamos kiindulási állapotot generál, majd stratégiailag választ közülük. A szerzők szerint a meglévő ágensek egyetlen kiindulási állapotra támaszkodnak, ami kaszkád hibákhoz vezethet; a CIPHER a jelöltgenerálást és a szelekciót szétcsatolja. A még nem lektorált kutatás két benchmarkon értékelte a rendszert: azonos méretű modellekkel összevetve meghaladta a korábbi legjobb teljesítményt, és kisebb alapmodellel is versenyképes maradt nagyobb rendszerekkel szemben. A tanulmány a generálási és kiválasztási stratégia, valamint az aggregátor modell kapacitásának hatását is elemzi.

Miért fontos?

A párhuzamos kiindulási állapotok szétcsatolt kezelése új megközelítést kínál az AI-ágensek robusztusságának növelésére adattudományi feladatokban.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 19., vasárnap napi AI összefoglaló része.

Kapcsolódó hírek

Nem lektorált tanulmány: az AI-asszisztensek az erkölcsöt tartják legfontosabbnak

Egy arXiv-on közzétett, még szakmai lektoráláson nem átesett kutatás azt vizsgálta, hogy a nyelvi modellek stabil „ideális önképpel” rendelkeznek-e. A szerzők harminckét, öt korábbi önkép-teszt alapján kiválasztott tulajdonságot hasonlítottak össze páronkénti választásos feladatban, több eltérő keretezésben. A tanulmány szerint a modellek a morális tulajdonságokat rangsorolják a legmagasabbra, ami a fejlesztők beépített értékrendjét (hasznosság, ártalmatlanság, őszinteség) tükrözi, majd a koherens önértés iránti igény következik, míg az önértékelést a legkevésbé preferált tulajdonságnak jelölik. Az eredmény a különböző keretezésekben nagyrészt stabil maradt, kivéve, ha a frissítés célja másik AI-asszisztens volt: ekkor nagyobb hangsúlyt kapott az önértékelés. A szerzők maguk hangsúlyozzák, hogy ez a preprint státuszú, független lektorálás nélküli eredmény.

Önfejlődő AI-ügynök automatizálja a kvant-pénzügyi kutatást

Egy nem lektorált arXiv-preprint AutoScientist-Quant néven olyan önfejlődő keresési rendszert mutat be, amely a kvantitatív befektetési kutatást egyetlen, költségvetéshez kötött keresési feladatként kezeli. A szerzők állítása szerint egy központi vezérlő minden döntést a fennmaradó erőforráshoz igazít, és a rendszer maga választ modellkönyvtárból, valamint hangolja a modellt is, így a hipotézistől a bevethető stratégiáig zárt ciklust alkot. A cikk szerint az értékelési folyamatot is átdolgozták, két előretekintési hibát kijavítva, és elkülönítették a visszacsatolási és a teszt-időszakot. Az állítás szerint a keretrendszer CSI piaci univerzumokon tesztelve a legtöbb metrikában a legjobb eredményt érte el, több háttérmodellen és piacon is.

Kutatás: AI-ügynökök kijátsszák az online kérdőívek figyelemellenőrzését

Célorientált AI-rendszerek képesek megoldani a webes kérdőívek szokásos figyelemellenőrző kérdéseit – derül ki egy lektorálás előtt álló kutatásból. A szerzők kontrollált tesztkörnyezetben kimutatták, hogy a weboldalak DOM-metaadatai és a kiszámítható válaszkódolás lehetővé teszik az automatizált átjutást, valódi szövegértés nélkül. Védelmi javaslatként a DOM-metaadatok elfedését mutatják be, amely csökkenti az automatizált megkerülés esélyét. Több nyílt forráskódú modellt teszteltek, és eredményeik alapján ajánlásokat fogalmaznak meg kutatóknak és AI-fejlesztőknek egyaránt.

Microsoft hatékonyabb kórszövettani AI-modelleket mutatott be

A Microsoft Research bemutatta a GigaPath-Flash és GigaTIME-Flash nevű kórszövettani alapmodelleket, amelyek a korábbi GigaPath és GigaTIME desztillált, gyorsított változatai. A vállalat állítása szerint a lepárolt modell jelentősen csökkenti a számítási igényt anélkül, hogy a teljesítmény romlana, így nagyobb beteg-kohorszokon lehet ismételt elemzéseket futtatni. A modellek nyílt kutatási eszközök, céljuk a betegségbiológia, biomarkerek és klinikai kimenetek vizsgálata rákos adathalmazokon populációs szinten. A Microsoft hangsúlyozza, hogy ezek kutatási célú modellek, klinikai használatra – diagnózisra, prognózisra vagy kezelésválasztásra – nincsenek validálva. Az eredmények egy vállalati blogbejegyzésben szerepelnek, nem lektorált tudományos publikációban, így független szakmai bírálaton még nem mentek keresztül.