2026. szeptember 25., péntek · Modellek

Black Forest Labs kiadta a FLUX 3 Action nyílt robotikai AI-modellt

A Black Forest Labs bemutatta a FLUX 3 Action nevű nyílt AI-modellt, amely a korábbi, videó-, kép- és hangadatokon tanított multimodális FLUX 3 modellre épül. A rendszer robotmunkaterek több kameraforrásból érkező videóit dolgozza fel, és ezekből jósolja meg, milyen következő lépést tegyen a robot, valamint hogyan változik meg ettől a környezet. A vállalat állítása szerint a modell mindössze hét milliárd paraméterrel új csúcsot ért el a RoboLab-120 ranglistán, miközben a korábbi legjobb nyílt modellnél kevesebb mint feleakkora méretű, és akár 3,95-szer gyorsabban fut. A Black Forest Labs szerint a nagy méretű, gondolkodó modellek jól terveznek, de robotikai alkalmazásra túl lassúak és túl nagyok, ezért fontos a hatékonyság az eszközön futtatott (on-device) telepítéshez. A modellsúlyok elérhetők a Hugging Face platformon.

Miért fontos?

A hét milliárd paraméteres méret és a Hugging Face-en elérhető nyílt súlyok azt jelentik, hogy fejlesztők eszközön futó, gyors robotvezérlő modellt tölthetnek le és futtathatnak saját hardveren, nagy felhő-infrastruktúra nélkül.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 25., péntek napi AI összefoglaló része.

Kapcsolódó hírek

NVIDIA: a World Action Modellek felváltják a robotikai VLA-kat

Az NVIDIA technikai blogja szerint a robotpolitikák új generációja, az úgynevezett World Action Model (WAM) videó-alapú világmodellekre épül, nem a megszokott nyelv-látás (VLM) alapú vision-language-action (VLA) rendszerekre. A cég állítása szerint a WAM-ok jobban általánosítanak új feladatokra, robotokra és környezetekre, mert a tanult fizikai dinamikát használják, nem csak szemantikus leképezést. Az NVIDIA saját, nyílt Cosmos 3 modelljét mutatja be alapként, amely Mixture-of-Transformers architektúrára épül, és rendkívül nagy, több száz millió kép-, videó- és akciómintát tartalmazó adathalmazon tanult. A vállalat szerint a Cosmos 3 munkaállomásos és Jetson-alapú, valós idejű futtatást is lehetővé tesz, kevesebb feladatspecifikus adattal érve el jobb teljesítményt. Az állítások az NVIDIA saját blogbejegyzéséből származnak, független megerősítés nélkül.

DeepMind új vezetője a Gemini 4 gyors kiadását sürgeti, nem az AGI-t

Koray Kavukcuoglu, aki augusztus óta vezeti a Google DeepMindet Demis Hassabis után, első nyilvános szereplésén a The Information AI Agenda Live csúcstalálkozóján elmondta: a Gemini 4 még a korai utótanítási fázisban van, de a modellt „sokkal korábban” szeretné kiadni, mint az év vége. Kavukcuoglu szerint az AGI-kérdés, amelyre elődje mindig fókuszált, „nem a megfelelő beszélgetés”. A Financial Times szerint a Gemini 3.5 Pro, amelyet Sundar Pichai májusban az I/O-n jelentett be júniusi megjelenéssel, három határidőt is elmulasztott, és Kavukcuoglu nem erősítette meg, hogy a projektet törölték-e. Hassabis jelenleg az egység elnöke és az Alphabet vezető tudósa. Kavukcuoglu „száz százalékig biztos” abban, hogy a Google mindig az élvonalban lesz, miközben az Anthropic és az OpenAI már fejlettebb modelleket kínál.

Hunyuan-A13B: nyílt forráskódú MoE-modell 13 milliárd aktív paraméterrel

A Hunyuan-A13B egy Mixture-of-Experts architektúrájú, nyílt forráskódú nagy nyelvi modell, amelynek technikai jelentését a fejlesztők arXiv-preprintként tették közzé, tehát az eredmények egyelőre nem estek át független szakmai lektoráláson. A modell összesen 80 milliárd paramétert tartalmaz, de következtetéskor csak 13 milliárdat aktivál, ami a fejlesztők szerint egyensúlyt teremt a képességek, a számítási hatékonyság és az üzemeltetési költség között. A tanítás egy 20 billió tokenes, szigorúan szűrt korpuszon történt, kiemelt STEM-adatokkal, majd felügyelt finomhangolás és nagyszabású megerősítéses tanulás egészítette ki. A modell kettős, gyors és lassú gondolkodási módot kínáló láncolt következtetési (Chain-of-Thought) keretrendszert alkalmaz, amely a feladat bonyolultságához igazítja a következtetés mélységét. A fejlesztők állítása szerint a modell matematikai, tudományos, programozási és ágensfeladatokban is versenyképes, gyakran jóval nagyobb modellek teljesítményét közelítve.

Alibaba bemutatta a Qwen-Audio-3.1 modellcsaládot, és drasztikusan csökkentette az AI-hangfeldolgozás árait

Az Alibaba Qwen csapata öt új modellből álló Qwen-Audio-3.1 csomagot jelentett be beszédfelismerésre (ASR), szövegfelolvasásra (TTS) és valós idejű hangalapú interakcióra. A cég állítása szerint az ASR modell jobban kezeli a többnyelvű és dialektus szerinti felismerést, az ASR-Next pedig több beszélőt is azonosít időbélyeggel, illetve érzelmeket és háttérzajokat is felismer. A TTS és TTS-Next modellek nyelvek közötti hangátvitelt és egyszerű szöveges utasítással vezérelhető érzelmi, stílusbeli hangolást tesznek lehetővé, míg a valós idejű modell egyidejű beszédet és hallgatást, illetve azonnali megszakítást támogat. Az Alibaba emellett jelentősen csökkentette az árakat: a TTS mintegy 70, a valós idejű szolgáltatás körülbelül 85, az ASR pedig akár 95 százalékkal olcsóbb lett. Az állítások a vállalat saját közleményén alapulnak, független teszteredmény egyelőre nem áll rendelkezésre.