2026. szeptember 26., szombat · Kutatás

PixelJev: kis multimodális modellek vizuális döntéshozatala, de korlátokkal

A PixelJev egy új, kép alapú döntési interfész, amely egy képet, egy feladatutasítást és egy futásidőben megadott jelöltlistát strukturált választássá és jelölt-feltételes valószínűségekké alakít kis, nyílt multimodális modellek segítségével. A kutatás egy arXiv-preprintben jelent meg, tehát még nem esett át szakmai lektoráláson. A modell egyesíti a felismerést és a többválasztós vizuális kérdés-válasz feladatokat egy nyelvi modell alapú kiolvasáson keresztül. Hét benchmark-értékelés során a 64-mintás forrásadaptáció a Pets adathalmazon 60,13%-ról 92,40%-ra növelte a pontosságot, és ez célfinomhangolás nélkül is átvihető volt új textúra-címkékre és az A-OKVQA feladatra. A szerzők ugyanakkor kifejezetten leszögezik, hogy a pontosságnövekedés nem garantálja a kalibrált célvalószínűségeket, a specializált DINOv2-alapú próbák továbbra is erősebbek a forrás-felismerésben, és a fagyasztott 4 milliárd paraméteres modell felülmúlja az adaptált 2 milliárdosat DTD és ScienceQA teszteken.

Egy forrás erősíti A hír állításait legfeljebb egy forrás támasztja alá tárgyilag; a többi forrás anyaga nem erről szól.

Miért fontos?

A preprint szerint a magasabb benchmark-pontszám nem jelent megbízhatóbb valószínűség-becslést, ami kockázatos lehet olyan gyakorlati alkalmazásoknál, ahol a modell bizonytalanságára is szükség lenne, például automatizált minőségellenőrzésben.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 26., szombat napi AI összefoglaló része.

Kapcsolódó hírek

MindTopo: új benchmark a mesterséges intelligencia térbeli-topológiai gondolkodásának mérésére

A Microsoft Research kutatói MindTopo néven új benchmarkot mutattak be, amely azt vizsgálja, hogy a multimodális nagy nyelvi modellek képesek-e felismerni és fenntartani topológiai kapcsolatokat, mint az összekapcsoltság, a körülzártság, a sorrend, az elkülönülés és a csomók. A kutatás szerint a modellek statikus képeken jóval jobban teljesítenek a topológiai viszonyok felismerésében, mint interaktív, tervezést igénylő feladatokban, ahol elveszítik a struktúra nyomon követését, miközben a jelenet változik. A hibák jellemzően nem az észlelésnél, hanem a tervezési fázisban jelentkeznek, amikor a modellek fizikailag lehetetlen lépéseket javasolnak. A kutatók szerint ez fontos hiányosságot jelez a robotikai és interaktív rendszerekhez szánt mesterséges intelligencia fejlesztésében, ahol a strukturális kapcsolatok megőrzése kritikus a megbízható döntéshozatalhoz.

Bizonyítékalapú tudásgráf-építés előadásvideókból

Kutatók egy olyan feldolgozási módszert dolgoztak ki, amely előadásvideók hangját, diaszövegét, diagramjait és egyenleteit egyesíti egy nyomonkövethető, bizonyítékokkal alátámasztott tudásgráfban. A rendszer szöveggé alakítja az előadást, OCR-rel kiolvassa a diákat, majd egy vizuális-nyelvi modell csak azokat a fogalmakat és kapcsolatokat vonja ki, amelyeket a transzkript, az OCR vagy a kép is megerősít. Három neurális hálókról szóló előadáson tesztelve 3118 képkockából és 756 szövegszegmensből 172 kanonikus fogalmat és 282 kapcsolatot állítottak elő, 90,38%-os végpont-lefedettséggel. A szerzők szerint egy előzetes, mindössze három kérdésből álló visszakeresési tesztben 100%-os pontosságot kaptak, ez azonban rendkívül kis mintán mért eredmény. A munka egy nem lektorált arXiv-preprint, amely elsősorban az auditálható konstrukciós módszert, nem pedig csúcsteljesítményt állít.

TW3Cast: ágens nélkül a 3. helyen a GIFT-Eval időzsor-benchmarkon

A TW3Cast nevű idősor-előrejelző rendszer egy nem lektorált, arXiv-on közzétett kutatási beszámoló szerint a GIFT-Eval benchmark 130 bejegyzése közül a 3. helyet szerezte meg az átlagos MASE-rangsor alapján, 2026. szeptember 14-i állapot szerint. A rendszer nem használ ágenseket vagy nyelvi modelleket: egyetlen, a tanítási felosztáson kiszámított és ezután lefagyasztott táblázat választja ki a megfelelő szakértőt (Chronos-2, TiRex vagy Toto könnyű finomhangolású verziói) 97 adathalmaz-frekvencia-horizont kombinációhoz. A szerzők állítása szerint a teljes útválasztó rendszer 19,4-es átlagos MASE-rangot ér el, szemben a legjobb önálló alapmodell 33,8-as és a tisztán versenyeztetéses módszer 38,0-s értékével. A választást három védőmechanizmus (pontossági-kalibrációs kettős kritérium, aszimmetrikus margó, konzervatív kapuk) hivatott védeni a túlillesztéstől, a kódot és az adatokat pedig nyilvánosan közzétették.

Claude enzimrendszert azonosított, de CRISPR-szakértők szerint ez rutin genomkutatás

Az Anthropic bejelentette, hogy tavasszal indított biológiai kutatólaboratóriumában a Claude nevű mesterséges intelligencia önállóan fedezett fel egy új enzimrendszert, amelyet CRISPR-szerű DNS-ismétlődések kísérnek. A cég szerint mintegy 950 AI-ügynök 21 óra alatt több mint 200 000 reverz transzkriptázt vizsgált át, és talált egy szokatlan enzimet, amely mellett ismétlődő DNS-szakaszok jelentek meg; a rendszert ART néven említik, főként bakteriofágokban fordul elő, funkciója egyelőre ismeretlen. A The Decoder szerint Lucas Harrington, Jennifer Doudna volt PhD-hallgatója és a Mammoth Biosciences társalapítója kevésbé látja ezt áttörésnek: állítása szerint a genombányászati módszer évtizedek óta ismert, hasonló rendszerekről már 2008 óta tudni, és a valódi kihívás a funkció feltárása, amit az Anthropic még nem mutatott be. A két forrás tehát eltérően értékeli ugyanazt az eredményt: az Anthropic korai felfedezésként, a szakértő rutin adatbányászatként jellemzi.