2026. október 5., hétfő · Kutatás

NASA és IBM nyílt forráskódú alapmodellt épített a Hold kutatására

A NASA és az IBM Research, egyetemi partnerekkel együttműködve, kiadta a NASA-IBM Lunar Foundation Modelt, amelyet a két szervezet az első nyílt forráskódú alapmodellek egyikeként mutat be a holdkutatás számára. A modellt a SomBench nevű adathalmazon tanították be a semmiből, amely a vállalatok állítása szerint a valaha összeállított legnagyobb, egymáshoz illesztett, többmodalitású holdi adatgyűjtemény. A legtöbb adat a Lunar Reconnaissance Orbiter 17 éves megfigyeléseiből származik, kiegészítve a GRAIL, a Lunar Prospector és a japán Kaguya/SELENE szonda méréseivel. A fejlesztők szerint a modell különösen jól teljesít a sarki jégkészletek előrejelzésében és a kráterek felismerésében, mivel címkézett adat kevés, de nyers megfigyelés bőven áll rendelkezésre.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A nyílt forráskódú kiadás lehetővé teszi, hogy külső kutatók is a 17 éves LRO-adatvagyonra építve, kevés címkézett példával alkalmazzák a modellt saját holdkutatási feladataikra.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. október 5., hétfő napi AI összefoglaló része.

Kapcsolódó hírek

Google-kutatók módszere védi az önfejlesztő AI-ügynököket a tesztek bemagolásától

A Google Cloud AI Research és több egyetem kutatói olyan AI-ügynökökkel foglalkoztak, amelyek saját működési keretrendszerüket (a modellt körülvevő prompt-, eszköz- és logikarendszert) ismételten átírják a jobb teljesítmény érdekében. A kutatók szerint ez a folyamat, amelyet a gyakorlati rekurzív önfejlesztés egy formájának neveznek, komoly hátránnyal jár: az ügynökök a korlátozott tesztfeladat-készleten gyakorolva bemagolják azokat, így a teszteredményeik javulnak, de új, ismeretlen feladatokon alig vagy egyáltalán nem javulnak. Erre válaszul a kutatók egy RRSI nevű módszert dolgoztak ki, amely csökkenő „szerkesztési költségvetéssel” korlátozza az egyszerre bevezethető változtatások számát, és nyomon követi a korábbi sikertelen próbálkozásokat, hogy a rendszer ne ismételje azokat. A cikk állítása szerint az RRSI mindhárom vizsgált területen javulást hozott az ismeretlen feladatokon is, miközben a számítási költségeket is csökkentette.

ThinkingBox: az AI-ügynökök tényleges munkáját méri, nem a válaszukat

A Microsoft kutatói ThinkingBox néven új értékelő rendszert fejlesztettek, amely nem a végső válasz vagy a sikeres eszközhívások alapján minősíti az AI-ügynököket, hanem azt vizsgálja, milyen állapotot hagynak maguk után az adatbázisban. A rendszer Hugging Face-en keresztül is elérhető. A bejegyzés egy konkrét esetet mutat be: egy ügynök kilenc eszközhívással kezelt egy 745 dolláros, egy nashville-i elosztóközpontban elakadt csomaggal kapcsolatos panaszt, majd megoldottként zárta le az ügyet, miközben a futárszolgálat kivételkezelése még nyitva volt, és az ügyfél valódi kérdése megválaszolatlan maradt. A Microsoft szerint a ThinkingBox 507 állapotfüggő üzleti munkafolyamatot futtat, mindegyiket 20-szor, különböző nagy nyelvi modellekkel, és egy 12 modellt felölelő, 121 680 érvényes futtatást tartalmazó összehasonlításban is jelentős eltérés mutatkozott a sikeresnek tűnő és a ténylegesen helyes végállapotok között.

Új teszt mutatja: az AI modellek nem értik a gyógyszeres patentek Markush-képleteit

Egy kutatócsoport R-GroundBench néven új diagnosztikai tesztkészletet publikált egy arXiv-preprintben, amely azt méri, mennyire képesek az AI-modellek megérteni az úgynevezett Markush-struktúrákat – ezek a gyógyszeripari szabadalmakban gyakori molekulaábrázolások, amelyekben R1, R2 vagy X jelölésű helyettesíthető csoportok szerepelnek. A benchmark valódi szabadalmi adatokból épül fel, és két részből áll: egy feleletválasztós (VQA) és egy nyílt végű, molekulageneráló feladatsorból. A szerzők szerint a vizsgált modellek könnyű VQA-feladatokon 90% feletti pontosságot érnek el, de nehezebb, „trükköket” kizáró feladatokon ez 56-66%-ra esik; a kémiai szakterületre specializált vizuális-nyelvi modellek még gyengébbek, 25,7-46,2% közötti pontossággal. A generálási feladatban a legtöbb modell pontos egyezési aránya 20% alatt marad, képi bemenet mellett pedig 8% alá csökken. Mivel a tanulmány egyelőre nem lektorált preprint, az eredményeket független megerősítés nélkül kell kezelni.

Meta AI modellje matematikusokkal oldott meg nyitott kutatási problémákat

A Meta AI Research közlése szerint a vállalat Muse Spark 1.1 és 1.2 nevű modelljeivel, a meta.ai chat felületén, Thinking Mode-ban, külön kutatási keretrendszer nélkül dolgozott együtt matematikusokkal. Az együttműködésből hat tudományos cikk született, ezek közül öt korábban nyitott matematikai kérdésre ad választ. A munkát egy matematikuscsoport irányította, amely az AI-val közösen fejlesztette az érveléseket, majd egy másik csoport ellenőrizte az eredményeket; minden cikk jelöli, mely részeket írták a kutatók és melyeket az AI. A Meta elismerte, hogy más kutatócsoportok is függetlenül eljutottak néhány azonos probléma megoldásához, más módszerekkel. Az egyik közölt eredmény a Gauss-ellipszoid illesztés szigorú küszöbértékéről szóló valószínűségszámítási tétel, amelyet Aykut Arslan dolgozott ki a Muse Spark segítségével, négy matematikus általi ellenőrzéssel.