2026. október 4., vasárnap · Modellek

Cohere bemutatta az Embed 5 vállalati keresőmodell-családot

A Cohere hivatalos közleménye szerint megjelent az Embed 5 modellcsalád, amely a vállalati célú visszakeresés (retrieval) élvonalába pozicionálja magát. A Pro verzió a cég állítása szerint a legmagasabb átlagpontszámot érte el az általuk tesztelt modellek közül, különösen pénzügyi adathalmazokon, feldolgozott PDF-eken és vizuálisan összetett dokumentumokon. Új elemként érkezik az Embed 5 Fast, amely alacsonyabb késleltetés és költség mellett (0,08 dollár millió tokenenként) nyújt versenyképes teljesítményt, míg a Pro ára 0,12 dollár millió tokenenként. A két modell közös embedding-teret használ, így egy indexet lehet Pro-val felépíteni és bármelyik modellel lekérdezni, index-újraépítés nélkül. A család multimodális bemeneteket, 100+ nyelvet és 128 ezer tokenes kontextusablakot támogat, és elérhető a Cohere API-n, a Microsoft Foundryn és az Amazon SageMakeren keresztül.

Miért fontos?

A Pro és Fast modellek közös embedding-tere gyakorlati előnyt jelent: vállalatok egyszer indexelhetnek Pro-val, majd a gyorsabb, olcsóbb Fast modellel is lekérdezhetik ugyanazt az adatbázist újraindexelés nélkül.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. október 4., vasárnap napi AI összefoglaló része.

Kapcsolódó hírek

Black Forest Labs bemutatta a Flux 3 Image szerkesztőmodellt

A Black Forest Labs kiadta a Flux 3 Image modellt, amely a Flux 3 modellcsalád képi ága. A cég állítása szerint a modell több lépéses szerkesztést tesz lehetővé úgy, hogy közben a kép többi része változatlan marad, emellett támogatja a szöveg-kép, kép-kép, szövegmegjelenítő és fotórealisztikus generálást is. A felhasználók körülhatároló dobozokkal komponálhatnak jeleneteket, akár tíz referenciaképet is felhasználhatnak, és 4K felbontásig készíthetnek kimenetet, az ingyenes demó pedig elérhető online. Az API-hozzáférés október 8-ig 50 százalékos kedvezménnyel vehető igénybe, a vállalatok pedig kereskedelmi licenc keretében saját infrastruktúrájukon futtathatják és finomhangolhatják a modellt; nyílt súlyú verzió a következő hetekben várható. A bejelentés előtt röviddel az Ideogram is saját szerkesztésközpontú modelljét, a 4.5-öt jelentette be, amely szintén hamarosan nyílt súlyokkal jelenik meg.

Microsoft új beszédfelismerő és szövegfelolvasó AI-modelleket adott ki hangalapú asszisztensekhez

A Microsoft AI bemutatta a MAI-Transcribe-2-Streaming nevű valós idejű beszédfelismerő modellt, amely a vállalat állítása szerint az Artificial Analysis mérésén pontosság terén az első helyen végez, 60 nyelvet kezel, és már körülbelül 100 milliszekundum alatt megadja az első részeredményeket, így a hangalapú asszisztensek még mondat közben reagálhatnak. Egy óra hangfelvétel feldolgozása bevezető áron 0,54 dollárba kerül az év végéig. Emellett két új szövegfelolvasó modell is megjelent: a MAI-Voice-2.1 23 nyelven, natív akcentussal, ugyanazzal a hanggal tud beszélni, a gyorsabb MAI-Voice-2.1-Flash változat 150 milliszekundumos késleltetést és 15 dollár/millió karakter árat kínál a korábbi 22 dollár helyett. Mindkét hangmodell néhány másodperces referenciahangból képes hangklónozásra, a Microsoft szerint beépített védelmi mechanizmusokkal a visszaélések ellen. Egy 4000 fős teszten a résztvevők mintegy fele valódi embernek vélte a mesterséges hangokat.

Google bemutatta a Gemini 4 Argon modellt, de egyelőre csak kevesek használhatják

A Google bejelentette a Gemini 4 Argon nevű új modelljét, amelyet a vállalat kódolásban, tudásmunkában és kiberbiztonságban iparágvezetőnek állít. A cég szerint a DeepSWE v1.1 szoftverfejlesztési teszten 77,9 százalékot ért el, és vezet a Vals Index gazdasági elemzési benchmarkon is – ezek a Google saját közlései, független megerősítés egyelőre nincs. A modell korlátozott ideig 2 dollár/millió bemeneti és 10 dollár/millió kimeneti tokenért érhető el API-n keresztül, kimeneti limitje pedig a korábbi 64 000-ről 1 millió tokenre nőtt. Google állítása szerint belső mérnökei már használják Argont, aminek köszönhetően 300 TiB memóriát takarítottak meg adatközpontjaikban, és több mint 800 000 sornyi kódot migráltak C/C++-ból Rustba a Fuchsia OS Zircon kerneljében. A szélesebb nyilvánosság egyelőre nem férhet hozzá a modellhez, mert a Google fokozatos, biztonsági fókuszú bevezetést tervez.

Az Ideogram 4.5 állítása szerint célzottan szerkeszt képeket a többi rész érintése nélkül

Az Ideogram cég bemutatta új, Ideogram 4.5 nevű képgeneráló modelljét, amely állítása szerint megoldja az AI-alapú képszerkesztés egyik legnagyobb problémáját: ha a felhasználó csak egy részletet módosít, a kép többi eleme változatlan marad. A cég szerint a vezető modellek, mint a GPT-Image 2.5 és a Nano Banana, sokat fejlődtek ebben, de több egymást követő szerkesztés után gyakran torzulnak. A gyártó szerint a 4.5-ös modell kizárólag a megjelölt területet módosítja, a célcsoport a termékfotózás, a belsőépítészet, a fotórestaurálás és a képen belüli szövegszerkesztés. A modell négy minőségi szinten, képenként 0,8 és 22 cent közötti áron, natív 2K felbontásban érhető el a saját platformon és API-n keresztül, emellett olyan partnerek integrálják, mint a Picsart, a Runway, a Pika és a Leonardo AI. A cég bejelentette, hogy hamarosan nyílt súlyú változat is érkezik.