2026. július 1., szerda · Modellek

A Google bemutatta a Nano Banana 2 Lite képgeneráló modellt: gyors és olcsó, de kompromisszumokkal

A Google DeepMind elérhetővé tette a Gemini 3.1 Flash Lite Image modellt, amelyet Nano Banana 2 Lite néven ismernek: a cég állítása szerint ez a leggyorsabb és legolcsóbb képgeneráló modelljük. Alapértelmezett módban körülbelül 4 másodperc alatt készít képet, míg a standard Nano Banana-nak ehhez mintegy 20 másodpercre van szüksége. Az API-ár átlagosan 0,034 dollár 1000 képenként, a kimeneti tokenár pedig a Nano Banana 2 felének felel meg. Az Ars Technica szerint az Arena.ai felhasználói értékelései közel azonosak a nem-Lite változatéval, ugyanakkor a Google maga is elismeri, hogy a modell gyengébben kezeli a szövegeket – különösen a kis betűméretűeket –, az infografikákon pontatlan adatok jelenhetnek meg, és a személyek megjelenítése kevésbé konzisztens. A modell tehát gyors prototípuskészítésre és ötletelésre alkalmas, de a részletgazdagság terén elmarad a nagyobb változatoktól.

Miért fontos?

A modell jelentősen csökkenti a képgenerálás költségét és idejét, ami tömeges fejlesztői hozzáférést tesz lehetővé.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 1., szerda napi AI összefoglaló része.

Kapcsolódó hírek

Google bemutatta a Gemini 3.7 Flash modellt, három hét után

Google kiadta a Gemini 3.7 Flash modellt, mindössze három héttel a 3.6 Flash után, amelyet fejlettebb kódolási és ügynöki (agentic) képességekkel reklámoz. A cég saját mérései szerint a FrontierCode teszten 34,4 százalékról 43,6 százalékra, a DeepSWE benchmarkon 49-ről 65,3 százalékra nőtt a pontszám, és javult a dokumentumfeldolgozás és az üzleti folyamatautomatizálás is. A Google saját adatai szerint az új modell felülmúlja a Claude Sonnet 5-öt és a GPT-5.6 Terrát, ezt azonban független teszt nem erősítette meg. A Gemini 3.7 Flash ára az év végéig 0,75 dollár millió beviteli és 3,75 dollár millió kimeneti tokenenként, ami a 3.6 Flash árának fele. Az Ars Technica szerint a gyors, három hetes ciklus inkább a folyamatos fejlődés látszatának fenntartásáról szólhat, miközben a várt Gemini 3.5 Pro zászlóshajó-modell kiadása továbbra is késik.

Google DeepMind diffúziós nyelvmodellé alakította a Gemma 4-et

A Google DeepMind technikai jelentést tett közzé a júniusban kiadott DiffusionGemma modellről. A vállalat állítása szerint nem nulláról építették: a meglévő Gemma-4-26B-A4B modellt alakították diffúziós architektúrává, az eredeti tanítási tokenmennyiség kevesebb mint tíz százalékának felhasználásával. A hagyományos, soronként tokeneket generáló modellekkel szemben a DiffusionGemma 256 tokenes blokkokat párhuzamosan finomít, ami Nvidia H100 gyorsítón a cég szerint mintegy 1500 token másodpercenkénti sebességet ad. A jelentés szerint a kétlépéses tanítás, benne az SD·RL nevű megerősítéses tanulás és mintavevő-desztilláció kombinációja, átlagosan tíz ponttal javította a teljesítményt érvelési benchmarkokon, a válaszok pedig mintegy 50 százalékkal rövidebbek lettek.

Google DeepMind bemutatta a Gemini Robotics ER 2 rendszert a fizikai AI-hoz

A Google DeepMind saját közleménye szerint a Gemini Robotics ER 2 videómegértést, feladat-orkesztrációt és több robot közötti együttműködést tesz lehetővé, ami lépésváltást jelent a robotikai alkalmazásokban. A WIRED beszámolója szerint a hozzá kapcsolódó Gemini Robotics 2 rendszer egy vizuális-nyelvi modellt és két, mozgásvezérlésre kiképzett vizuális-nyelvi-akció modellt kapcsol össze, amelyeket emberi távvezérléssel, videópéldákkal és szimulációval tanítottak be. Bemutatóvideókon például az Apptronik Apollo 2 robotja a Sharpa cég kezeivel polcokat pakolt rendbe. A cég szerint ez egy lépés a „fizikai AGI” felé, vagyis afelé, hogy a robotok emberi szintű sokféle feladatot végezzenek el, ugyanakkor a Google robotikáért felelős vezetője, Carolina Parada is elismerte, hogy a fizikai térben működő modellek nagyobb biztonsági kockázatot jelentenek, ezért réteges védőkorlátokat alkalmaznak.

DeepSeek kísérleti vizuális modellt adott ki ügynöki feladatokra

A kínai DeepSeek nyilvánosságra hozta a V4-Flash-Vision-Exp nevű kísérleti, multimodális modellt, amely a szöveges V4-Flash alapmodellt képfeldolgozási képességgel bővíti. A cég saját belső benchmarkjai szerint – ezt fontos hangsúlyozni, mivel független ellenőrzés nem történt – a vizuális változat ügynöki feladatokban közelít az Anthropic Opus 4.8 teljesítményéhez, miközben megőrzi az alapmodell szövegértési és világtudás-képességeit. A modell DeepSeek állítása szerint képeket ír le, szöveget nyer ki képernyőképekből, és diagramokat elemez, valamint kompatibilis az OpenAI és az Anthropic API-formátumaival. A vállalat egyúttal frissítette Harness nevű keretrendszerét is, amely a cikk szerint alapból támogatja az új modellt. A képfeldolgozás technikai részletei – például a fájlformátum-felismerés vagy a tokenköltség – szintén a DeepSeek saját dokumentációjából származó állítások.