2026. szeptember 26., szombat · Kutatás

TW3Cast: ágens nélkül a 3. helyen a GIFT-Eval időzsor-benchmarkon

A TW3Cast nevű idősor-előrejelző rendszer egy nem lektorált, arXiv-on közzétett kutatási beszámoló szerint a GIFT-Eval benchmark 130 bejegyzése közül a 3. helyet szerezte meg az átlagos MASE-rangsor alapján, 2026. szeptember 14-i állapot szerint. A rendszer nem használ ágenseket vagy nyelvi modelleket: egyetlen, a tanítási felosztáson kiszámított és ezután lefagyasztott táblázat választja ki a megfelelő szakértőt (Chronos-2, TiRex vagy Toto könnyű finomhangolású verziói) 97 adathalmaz-frekvencia-horizont kombinációhoz. A szerzők állítása szerint a teljes útválasztó rendszer 19,4-es átlagos MASE-rangot ér el, szemben a legjobb önálló alapmodell 33,8-as és a tisztán versenyeztetéses módszer 38,0-s értékével. A választást három védőmechanizmus (pontossági-kalibrációs kettős kritérium, aszimmetrikus margó, konzervatív kapuk) hivatott védeni a túlillesztéstől, a kódot és az adatokat pedig nyilvánosan közzétették.

Egy forrás erősíti A hír állításait legfeljebb egy forrás támasztja alá tárgyilag; a többi forrás anyaga nem erről szól.

Miért fontos?

A benchmark-lista két magasabb helyezettje ágensalapú, nyelvi modellt használó rendszer, míg a TW3Cast pusztán fagyasztott útválasztással éri el a 3. helyet, ami megkérdőjelezi, hogy a bonyolultabb ágens-megoldások valóban szükségesek-e az időbeli előrejelzéshez.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 26., szombat napi AI összefoglaló része.

Kapcsolódó hírek

PixelJev: kis multimodális modellek vizuális döntéshozatala, de korlátokkal

A PixelJev egy új, kép alapú döntési interfész, amely egy képet, egy feladatutasítást és egy futásidőben megadott jelöltlistát strukturált választássá és jelölt-feltételes valószínűségekké alakít kis, nyílt multimodális modellek segítségével. A kutatás egy arXiv-preprintben jelent meg, tehát még nem esett át szakmai lektoráláson. A modell egyesíti a felismerést és a többválasztós vizuális kérdés-válasz feladatokat egy nyelvi modell alapú kiolvasáson keresztül. Hét benchmark-értékelés során a 64-mintás forrásadaptáció a Pets adathalmazon 60,13%-ról 92,40%-ra növelte a pontosságot, és ez célfinomhangolás nélkül is átvihető volt új textúra-címkékre és az A-OKVQA feladatra. A szerzők ugyanakkor kifejezetten leszögezik, hogy a pontosságnövekedés nem garantálja a kalibrált célvalószínűségeket, a specializált DINOv2-alapú próbák továbbra is erősebbek a forrás-felismerésben, és a fagyasztott 4 milliárd paraméteres modell felülmúlja az adaptált 2 milliárdosat DTD és ScienceQA teszteken.

Claude enzimrendszert azonosított, de CRISPR-szakértők szerint ez rutin genomkutatás

Az Anthropic bejelentette, hogy tavasszal indított biológiai kutatólaboratóriumában a Claude nevű mesterséges intelligencia önállóan fedezett fel egy új enzimrendszert, amelyet CRISPR-szerű DNS-ismétlődések kísérnek. A cég szerint mintegy 950 AI-ügynök 21 óra alatt több mint 200 000 reverz transzkriptázt vizsgált át, és talált egy szokatlan enzimet, amely mellett ismétlődő DNS-szakaszok jelentek meg; a rendszert ART néven említik, főként bakteriofágokban fordul elő, funkciója egyelőre ismeretlen. A The Decoder szerint Lucas Harrington, Jennifer Doudna volt PhD-hallgatója és a Mammoth Biosciences társalapítója kevésbé látja ezt áttörésnek: állítása szerint a genombányászati módszer évtizedek óta ismert, hasonló rendszerekről már 2008 óta tudni, és a valódi kihívás a funkció feltárása, amit az Anthropic még nem mutatott be. A két forrás tehát eltérően értékeli ugyanazt az eredményt: az Anthropic korai felfedezésként, a szakértő rutin adatbányászatként jellemzi.

Kutatás: a bizonyíték sorrendje csal at multimodális AI-modelleket

Egy vizsgálat szerint a multimodális nagy nyelvi modellek ítéletét nemcsak az befolyásolja, hogy kép vagy hang mond-e ellent a kísérő szövegnek, hanem az is, hogy melyik bizonyíték áll elöl vagy hátul. A kutatók egy még nem lektorált, arXiv-on közzétett preprintben olyan páros összehasonlítást alkalmaztak, amelyben az utasítás és a bizonyíték tartalma rögzített maradt, csak a kép vagy hangfelvétel és a szöveg sorrendjét cserélték fel. Az eredmény szerint, ha az érzékszervi bizonyíték (kép vagy hangfelvétel) az ellentmondó szöveg után következik, a modellek válaszai következetesen az érzékszervi tartalom felé tolódnak el. A szerzők ezt „bizonyíték-nemkommutativitásnak” nevezik, és amellett érvelnek, hogy korábbi tanulmányok szövegelfogultságra vonatkozó következtetései torzultak lehettek, mert rögzített sorrendet használtak vagy az utasítást a bizonyítékkal együtt mozgatták.

SWE-Serve: új benchmark leplezi le az AI kódügynökök gyengéit élő szerverkörnyezetben

Az NVIDIA technikai blogja bemutatta a SWE-Serve nevű benchmarkot, amely 53 feladaton, a nyílt forráskódú SGLang inferencia-kiszolgáló 83 összevont pull requestjéből származó módosításokon méri az AI kódolóügynökök teljesítményét hat területen: modellbetöltés, dekódolás, gyorsítótárazás, ütemezés, kiszolgáló API-k és elosztott futtatás. A 19, élő szervert is elindító feladatnál a javítások 69,4%-ban mentek át, ha az élő kiszolgálási teszteket kihagyták, de csak 45,9%-ban a teljes ellenőrzéssel, vagyis minden harmadik, más teszteken átment javítás elbukott valós terhelés mellett. A több futásidejű területet érintő feladatoknál a sikerarány 21,3 százalékponttal alacsonyabb volt, mint az egy területre koncentráló feladatoknál, ez a jelenség minden tesztelt modellnél megjelent. Tizenegy modellt vizsgáltak a mini-swe-agent keretrendszerrel zárt könyves módban, a pass@1 mutató 34,6% és 75,5% között szórt.