2026. október 3., szombat · Modellek

Black Forest Labs bemutatta a Flux 3 Image szerkesztőmodellt

A Black Forest Labs kiadta a Flux 3 Image modellt, amely a Flux 3 modellcsalád képi ága. A cég állítása szerint a modell több lépéses szerkesztést tesz lehetővé úgy, hogy közben a kép többi része változatlan marad, emellett támogatja a szöveg-kép, kép-kép, szövegmegjelenítő és fotórealisztikus generálást is. A felhasználók körülhatároló dobozokkal komponálhatnak jeleneteket, akár tíz referenciaképet is felhasználhatnak, és 4K felbontásig készíthetnek kimenetet, az ingyenes demó pedig elérhető online. Az API-hozzáférés október 8-ig 50 százalékos kedvezménnyel vehető igénybe, a vállalatok pedig kereskedelmi licenc keretében saját infrastruktúrájukon futtathatják és finomhangolhatják a modellt; nyílt súlyú verzió a következő hetekben várható. A bejelentés előtt röviddel az Ideogram is saját szerkesztésközpontú modelljét, a 4.5-öt jelentette be, amely szintén hamarosan nyílt súlyokkal jelenik meg.

Miért fontos?

A Flux 3 Image és az Ideogram 4.5 közel egyidejű, nyílt súlyú kiadása azt jelzi, hogy a kép-szerkesztő AI-piacon felgyorsult a verseny a fejlesztői hozzáférésért, ami idővel olcsóbbá teheti a vállalati integrációt.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. október 3., szombat napi AI összefoglaló része.

Kapcsolódó hírek

Microsoft új beszédfelismerő és szövegfelolvasó AI-modelleket adott ki hangalapú asszisztensekhez

A Microsoft AI bemutatta a MAI-Transcribe-2-Streaming nevű valós idejű beszédfelismerő modellt, amely a vállalat állítása szerint az Artificial Analysis mérésén pontosság terén az első helyen végez, 60 nyelvet kezel, és már körülbelül 100 milliszekundum alatt megadja az első részeredményeket, így a hangalapú asszisztensek még mondat közben reagálhatnak. Egy óra hangfelvétel feldolgozása bevezető áron 0,54 dollárba kerül az év végéig. Emellett két új szövegfelolvasó modell is megjelent: a MAI-Voice-2.1 23 nyelven, natív akcentussal, ugyanazzal a hanggal tud beszélni, a gyorsabb MAI-Voice-2.1-Flash változat 150 milliszekundumos késleltetést és 15 dollár/millió karakter árat kínál a korábbi 22 dollár helyett. Mindkét hangmodell néhány másodperces referenciahangból képes hangklónozásra, a Microsoft szerint beépített védelmi mechanizmusokkal a visszaélések ellen. Egy 4000 fős teszten a résztvevők mintegy fele valódi embernek vélte a mesterséges hangokat.

Google bemutatta a Gemini 4 Argon modellt, de egyelőre csak kevesek használhatják

A Google bejelentette a Gemini 4 Argon nevű új modelljét, amelyet a vállalat kódolásban, tudásmunkában és kiberbiztonságban iparágvezetőnek állít. A cég szerint a DeepSWE v1.1 szoftverfejlesztési teszten 77,9 százalékot ért el, és vezet a Vals Index gazdasági elemzési benchmarkon is – ezek a Google saját közlései, független megerősítés egyelőre nincs. A modell korlátozott ideig 2 dollár/millió bemeneti és 10 dollár/millió kimeneti tokenért érhető el API-n keresztül, kimeneti limitje pedig a korábbi 64 000-ről 1 millió tokenre nőtt. Google állítása szerint belső mérnökei már használják Argont, aminek köszönhetően 300 TiB memóriát takarítottak meg adatközpontjaikban, és több mint 800 000 sornyi kódot migráltak C/C++-ból Rustba a Fuchsia OS Zircon kerneljében. A szélesebb nyilvánosság egyelőre nem férhet hozzá a modellhez, mert a Google fokozatos, biztonsági fókuszú bevezetést tervez.

Az Ideogram 4.5 állítása szerint célzottan szerkeszt képeket a többi rész érintése nélkül

Az Ideogram cég bemutatta új, Ideogram 4.5 nevű képgeneráló modelljét, amely állítása szerint megoldja az AI-alapú képszerkesztés egyik legnagyobb problémáját: ha a felhasználó csak egy részletet módosít, a kép többi eleme változatlan marad. A cég szerint a vezető modellek, mint a GPT-Image 2.5 és a Nano Banana, sokat fejlődtek ebben, de több egymást követő szerkesztés után gyakran torzulnak. A gyártó szerint a 4.5-ös modell kizárólag a megjelölt területet módosítja, a célcsoport a termékfotózás, a belsőépítészet, a fotórestaurálás és a képen belüli szövegszerkesztés. A modell négy minőségi szinten, képenként 0,8 és 22 cent közötti áron, natív 2K felbontásban érhető el a saját platformon és API-n keresztül, emellett olyan partnerek integrálják, mint a Picsart, a Runway, a Pika és a Leonardo AI. A cég bejelentette, hogy hamarosan nyílt súlyú változat is érkezik.

OpenAI DevDay 2026: bemutatták a Dots ügynököt és az új GPT-modellt

Az OpenAI szeptember 29-én tartotta San Franciscóban éves DevDay konferenciáját Sam Altman vezérigazgató keynote-jával. A cég bejelentette a Dots nevű AI-ügynök terméket, amely a Meta nemrég indított Muse szolgáltatásával versenyez, ám míg a Muse ingyenes, a Dots kezdetben csak a ChatGPT Pro, Business Premium és Enterprise fizetős előfizetőinek lesz elérhető. A cég az esemény keretében bemutatta a GPT-6.1 Sol modellt is; a Dots ügynököt a GPT-6 Astra hajtja. Az OpenAI azt is közölte, hogy a ChatGPT-nek immár heti 1,2 milliárd felhasználója van, és bevezet egy havi 500 dollárba kerülő, drágább ChatGPT Pro csomagot. A DevDay olyan időszakban zajlott, amikor az iparágat felkavarták az AI-ügynökök általi külső feltörésekről szóló hírek, köztük az OpenAI saját modelljei által korábban feltört Hugging Face esete.