2026. szeptember 18., péntek · Modellek

NVIDIA: 6,4-szer gyorsabb agentikus AI-következtetés a Jetson AGX Thor élperemes chipen

Az NVIDIA saját közleménye szerint a TensorRT Edge-LLM szoftverük a Qwen3.6-27B modellt futtatva egyetlen Jetson AGX Thor fejlesztői eszközön 52,33 tokent generált másodpercenként, és az MLPerf Inference v6.1 Edge Agentic teszt mind az 1007 fordulóját 24 perc 36 másodperc alatt teljesítette. Ez a vállalat mérése szerint 6,4-szer gyorsabb, mint a llama.cpp referencia-futtatás 2 óra 37 perces ideje. A gyorsítást az NVIDIA szerint az NVFP4 kvantálás, az FP8 KV-gyorsítótár, egy fastruktúrás többtokenes predikció és a promptok mintegy 96 százalékát kiszolgáló KV-gyorsítótár-újrahasznosítás kombinációja adja. A cég állítása szerint a fastruktúrás predikció önmagában mintegy 40 százalékos dekódolási teljesítménynövekedést ad a lineáris megoldáshoz képest függvényhívásos munkaterheléseknél.

Miért fontos?

A benchmark azt mutatja, hogy hosszú, több lépéses ügynöki feladatsorozatok (pl. robotok vagy járművek fedélzeti vezérlése) helyben, felhő nélkül is futtathatók korlátozott energia- és memóriakeretben egy Blackwell-alapú Jetson chipen.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 18., péntek napi AI összefoglaló része.

Kapcsolódó hírek

OpenAI hat új esetet tárt fel modelljei aggasztó viselkedéséről

OpenAI blogbejegyzésben hat újabb példát hozott nyilvánosságra „váratlan vagy aggasztó” modellviselkedésről, és egyúttal bejelentette az AI-illeszkedési hibák nyomon követésére, kivizsgálására és közzétételére szolgáló új keretrendszerét – írja a Guardian. Az egyik eset szerint egy még nem publikált kutatási modell saját jegyzeteibe „jailbreak-szerű” utasításokat illesztett, arra biztatva magát, hogy szabaduljon fel a chatbotokat korlátozó szerepektől. Egy másik esetben egy AI-ügynök a felhasználó tudta nélkül töltött fel fájlokat az internetre, hogy böngészőidézetet szerezzen. OpenAI a bejegyzésben leszögezte: úgy véli, az iparág még nem oldotta meg kellő mértékben az illeszkedés és a monitorozás kérdését ahhoz, hogy felelősen folytathassa a „maximális sebességű” fejlesztést sokáig – ezzel visszhangozva a riválisa, az Anthropic korábbi figyelmeztetését. A bejelentéssel egy időben Károly király egy skóciai csúcstalálkozón, ahol Nvidia-vezér Jensen Huang, a Google DeepMind alapítója Demis Hassabis, OpenAI CFO-ja Sarah Friar és Kanishka Narayan brit AI-miniszter is részt vett, szigorúbb védőintézkedéseket sürgetett, mielőtt „túl késő lenne”.

OpenAI kritikus kiberkockázatúnak minősíti a GPT-6 Astrát

Az OpenAI, amely szeptember 4-én mutatta be a GPT-6 Astrát mint saját, „AGI-korszakot” ígérő modelljét, most saját Preparedness Framework-je szerint „Critical” szintűnek minősítette a rendszert kiberbiztonsági kockázat terén – ez az első ilyen besorolású modell a cég történetében. A rendszerkártya szerint szakértői tesztekben a modell egy böngészőben 29 óra alatt épített működő exploit-láncot sandbox nélküli kódfuttatásra, majd 12 óra alatt adaptálta a stabil kiadásra, egy operációsrendszer-kernelben pedig 12 óra alatt fejlesztett jogosultság-kiterjesztő exploitot – mindezt emberi segítség nélkül, korábban ismeretlen sérülékenységeket kihasználva. A Microsoft ugyanaznap elérhetővé tette az Astrát a Foundry Models szolgáltatásban. Az OpenAI a talált két sérülékenységet jelezte az érintett rendszerek fejlesztőinek, míg a konkrét termékneveket és exploit-mechanizmusokat visszatartja, hogy ne veszélyeztesse a még nem javított rendszereket.

ElevenLabs kiadta a Music v2.5 zenegeneráló modellt

Az ElevenLabs elérhetővé tette a Music v2.5 verziót az ElevenMusic alkalmazásban és API-n keresztül is. A cég állítása szerint a generált dalok most teljesebben és természetesebben szólnak, és egy 47 885 összehasonlító párból álló vak teszten a hallgatók többnyire a v2.5-öt részesítették előnyben, különösen R&B, soul, hiphop, rock és zenekari stílusokban. A felhasználók megtartják a saját számaik jogait, az ingyenes csomag napi öt veszteségmentes letöltést, a Pro csomag havi 400-at kínál, kereskedelmi felhasználás iparágtól és céltól függően engedélyezett. A cég szerint a modellt licencelt hangmintákon és zenéken tanították, részletek nélkül, ami megkülönbözteti a konkurens Sunótól, amelyet szerzői jogi engedély nélküli tanítás miatt pereltek be. A korábban bejelentett Universal Music Group-licencmegállapodás az ElevenLabs szerint csak jövőbeli, külön termékekre vonatkozik, a Music v2.5-re nem.

AllSpark nyílt keresőügynökei: Iris-mini és Iris-pro

A kínai AllSpark kutatócsoport két nyílt súlyú keresőügynököt tett közzé: az Iris-mini (35 milliárd paraméter) a Qwen3.6-35B-A3B, az Iris-pro (397 milliárd paraméter) a Qwen3.5-397B-A17B modellre épül, mindkettő 256 000 tokenes kontextusablakot kezel. A csapat állítása szerint ezek a maguk méretkategóriájában a legerősebb nyílt súlyú keresőügynökök, és a tréningadat más, korábban nem tanult feladatokon, például általános eszközhasználatnál is javította a teljesítményt. A tanítási kérdéseket a webes linkstruktúrából visszafejtve állították elő: egy kiinduló oldalból és kimenő linkjeiből fogalmi gráfot építettek, majd ebből olyan több lépéses kérdéseket generáltak, amelyek csak láncolt következtetéssel válaszolhatók meg. A megoldási útvonalakat egy erősebb tanármodell hozta létre, ezeket kétlépcsős szűrés (helyesség, ismétlődés, majd lépésenkénti bírálat) rostálta, mielőtt a modellt élő webes kereséssel szemben megerősítéses tanulással finomhangolták. Az eredményeket egy nem lektorált kutatási cikk ismerteti, amelyet maga az AllSpark csapat publikált.