2026. október 6., kedd · Modellek

Aleph Alpha bemutatta a Kolibri nyílt súlyú nyelvi modellt

Az Aleph Alpha német AI-vállalat kiadta a Kolibri nevű német-angol nyelvi modellt, amely 78 milliárd paraméterrel rendelkezik, ebből mixture-of-experts architektúra miatt tokenenként mintegy 3 milliárd aktív. A cég állítása szerint a Kolibri mindkét nyelven a minőség és üzemeltetési költség Pareto-frontján helyezkedik el, és felülmúlja a hasonló architektúrájú, részben jóval régebbi összehasonlító modelleket. A tanítási adatok 21,3 százaléka német nyelvű volt, ehhez a cég külön német adatfeldolgozó rendszert épített, míg a szintetikus adatok előállításához kínai modelleket is bevetettek. Az Aleph Alpha szerint a modellt elsősorban közigazgatási, légiközlekedési és ipari felhasználásra szánják, az EU AI Act szempontjait figyelembe véve, európai jog alatt fejlesztették, akár egymillió tokenes kontextusablakot is támogat, tanítása 768 darab B200 GPU-n zajlott Németországban és Finnországban. A súlyok Apache 2.0 licenc alatt elérhetők a Hugging Face platformon.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A Kolibri az Aleph Alpha szerint konkrétan közigazgatási, légiközlekedési és ipari ügyfeleket céloz meg, ami az európai szuverén AI-infrastruktúra iránti állami és kritikus iparági igényt jelzi.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. október 6., kedd napi AI összefoglaló része.

Kapcsolódó hírek

Reka AI kutatási előzetest adott ki a Rho-1 omnimodellből

A Reka AI kutatási előzetesként közzétette a Rho-1 nevű omnimodellt, amely a vállalat állítása szerint 19 milliárd paraméterrel egyetlen neurális hálózatban kezeli a szöveget, a képeket, a videót és a robotvezérlési parancsokat. A cég szerint a rendszer minden modalitást tokenként dolgoz fel egy közös kontextusablakban, külön eszközhívások vagy specializált modellek nélkül, és valós időben generál folyamatos videót, miközben útközben reagál új utasításokra. Ugyanazok a súlyok jelzik előre a kamera képeit, amelyek a robotmozgásokat is irányítják. A szűkös robotikai tréningadatok pótlására a Reka AI egy inverz dinamikai modellt épített, amely hétköznapi internetes videókból von ki vezérlőjeleket. A modellt 320 darab H100-as GPU-n, mintegy három hónap alatt tanították. A vállalat korábban, 2024 áprilisában mutatta be a Reka Core multimodális modellt, amely saját állítása szerint a GPT-4, a Claude 3 és a Gemini Ultra szintjén teljesített benchmarkokon.

Cohere bemutatta az Embed 5 vállalati keresőmodell-családot

A Cohere hivatalos közleménye szerint megjelent az Embed 5 modellcsalád, amely a vállalati célú visszakeresés (retrieval) élvonalába pozicionálja magát. A Pro verzió a cég állítása szerint a legmagasabb átlagpontszámot érte el az általuk tesztelt modellek közül, különösen pénzügyi adathalmazokon, feldolgozott PDF-eken és vizuálisan összetett dokumentumokon. Új elemként érkezik az Embed 5 Fast, amely alacsonyabb késleltetés és költség mellett (0,08 dollár millió tokenenként) nyújt versenyképes teljesítményt, míg a Pro ára 0,12 dollár millió tokenenként. A két modell közös embedding-teret használ, így egy indexet lehet Pro-val felépíteni és bármelyik modellel lekérdezni, index-újraépítés nélkül. A család multimodális bemeneteket, 100+ nyelvet és 128 ezer tokenes kontextusablakot támogat, és elérhető a Cohere API-n, a Microsoft Foundryn és az Amazon SageMakeren keresztül.

Black Forest Labs bemutatta a Flux 3 Image szerkesztőmodellt

A Black Forest Labs kiadta a Flux 3 Image modellt, amely a Flux 3 modellcsalád képi ága. A cég állítása szerint a modell több lépéses szerkesztést tesz lehetővé úgy, hogy közben a kép többi része változatlan marad, emellett támogatja a szöveg-kép, kép-kép, szövegmegjelenítő és fotórealisztikus generálást is. A felhasználók körülhatároló dobozokkal komponálhatnak jeleneteket, akár tíz referenciaképet is felhasználhatnak, és 4K felbontásig készíthetnek kimenetet, az ingyenes demó pedig elérhető online. Az API-hozzáférés október 8-ig 50 százalékos kedvezménnyel vehető igénybe, a vállalatok pedig kereskedelmi licenc keretében saját infrastruktúrájukon futtathatják és finomhangolhatják a modellt; nyílt súlyú verzió a következő hetekben várható. A bejelentés előtt röviddel az Ideogram is saját szerkesztésközpontú modelljét, a 4.5-öt jelentette be, amely szintén hamarosan nyílt súlyokkal jelenik meg.

Microsoft új beszédfelismerő és szövegfelolvasó AI-modelleket adott ki hangalapú asszisztensekhez

A Microsoft AI bemutatta a MAI-Transcribe-2-Streaming nevű valós idejű beszédfelismerő modellt, amely a vállalat állítása szerint az Artificial Analysis mérésén pontosság terén az első helyen végez, 60 nyelvet kezel, és már körülbelül 100 milliszekundum alatt megadja az első részeredményeket, így a hangalapú asszisztensek még mondat közben reagálhatnak. Egy óra hangfelvétel feldolgozása bevezető áron 0,54 dollárba kerül az év végéig. Emellett két új szövegfelolvasó modell is megjelent: a MAI-Voice-2.1 23 nyelven, natív akcentussal, ugyanazzal a hanggal tud beszélni, a gyorsabb MAI-Voice-2.1-Flash változat 150 milliszekundumos késleltetést és 15 dollár/millió karakter árat kínál a korábbi 22 dollár helyett. Mindkét hangmodell néhány másodperces referenciahangból képes hangklónozásra, a Microsoft szerint beépített védelmi mechanizmusokkal a visszaélések ellen. Egy 4000 fős teszten a résztvevők mintegy fele valódi embernek vélte a mesterséges hangokat.