AI-modell · Modellek

Gemini

A Google DeepMind által fejlesztett többmodalitású nagy nyelvi modellcsalád, amely szöveget, képet, hangot és kódot egyaránt kezel.

Más néven: Google Gemini, Gemini Pro, Gemini Ultra, Gemini Nano, Gemini Flash, Bard (korábbi név)

A Gemini a Google DeepMind által kifejlesztett mesterséges intelligencia modellcsalád, amely a vállalat korábbi nyelvi modelljeinek (például a PaLM) utódjaként jött létre. A Gemini modelleket eleve többmodalitásra tervezték, azaz nem csak szöveges bemenetek feldolgozására képesek, hanem képek, hangfelvételek, videók és programkód értelmezésére és generálására is. A modellcsalád több méretben érhető el, ezek jellemzően eltérő teljesítmény- és erőforrás-igényű változatokat jelentenek, a kompakt, eszközön futtatható verzióktól a nagy számítási kapacitást igénylő, komplex feladatokra optimalizált változatokig.

A Gemini a Google mesterséges intelligencia stratégiájának központi elemévé vált, és integrálódott számos vállalati termékbe, köztük a keresőmotorba, a Google Workspace alkalmazásaiba, az Android operációs rendszerbe és a korábban Bard néven ismert csevegőasszisztensbe, amely mára Gemini néven fut. A modellcsalád fejlesztése a versenytársak, elsősorban az OpenAI GPT-modelljei és az Anthropic Claude-modelljei által meghatározott piaci versenyhelyzetben zajlik, és a Google egyik legfontosabb válasza a generatív AI térnyerésére.

A Gemini jelentősége abban áll, hogy megmutatja, hogyan igyekeznek a nagy technológiai vállalatok egyetlen alapmodellre építeni széles termékportfóliójukat, ahelyett hogy külön-külön, feladatspecifikus modelleket fejlesztenének. A modellcsalád folyamatos fejlesztése és verziófrissítései az AI-ipar gyors ütemű technológiai versenyét, valamint a multimodális képességek egyre nagyobb szerepét illusztrálják.

← Vissza az AI-szereplőkhöz