AI-modell · Modellek
Gemini
A Google DeepMind által fejlesztett többmodalitású nagy nyelvi modellcsalád, amely szöveget, képet, hangot és kódot egyaránt kezel.
Más néven: Google Gemini, Gemini Pro, Gemini Ultra, Gemini Nano, Gemini Flash, Bard (korábbi név)
A Gemini a Google DeepMind által kifejlesztett mesterséges intelligencia modellcsalád, amely a vállalat korábbi nyelvi modelljeinek (például a PaLM) utódjaként jött létre. A Gemini modelleket eleve többmodalitásra tervezték, azaz nem csak szöveges bemenetek feldolgozására képesek, hanem képek, hangfelvételek, videók és programkód értelmezésére és generálására is. A modellcsalád több méretben érhető el, ezek jellemzően eltérő teljesítmény- és erőforrás-igényű változatokat jelentenek, a kompakt, eszközön futtatható verzióktól a nagy számítási kapacitást igénylő, komplex feladatokra optimalizált változatokig.
A Gemini a Google mesterséges intelligencia stratégiájának központi elemévé vált, és integrálódott számos vállalati termékbe, köztük a keresőmotorba, a Google Workspace alkalmazásaiba, az Android operációs rendszerbe és a korábban Bard néven ismert csevegőasszisztensbe, amely mára Gemini néven fut. A modellcsalád fejlesztése a versenytársak, elsősorban az OpenAI GPT-modelljei és az Anthropic Claude-modelljei által meghatározott piaci versenyhelyzetben zajlik, és a Google egyik legfontosabb válasza a generatív AI térnyerésére.
A Gemini jelentősége abban áll, hogy megmutatja, hogyan igyekeznek a nagy technológiai vállalatok egyetlen alapmodellre építeni széles termékportfóliójukat, ahelyett hogy külön-külön, feladatspecifikus modelleket fejlesztenének. A modellcsalád folyamatos fejlesztése és verziófrissítései az AI-ipar gyors ütemű technológiai versenyét, valamint a multimodális képességek egyre nagyobb szerepét illusztrálják.
Kapcsolódó szereplők és fogalmak
- Google DeepMind
- GPT (OpenAI)
- Claude (Anthropic)
- PaLM
- Bard
- Transformer architektúra
Gemini a hírekben
-
Kutatás 2026. július 25., szombat
AISE-Bench: új benchmark az akadémiai tudásgráfokon végzett többlépéses információkeresés értékelésére
Az AISE-Bench egy 1133 kérdés-válasz párból álló, valós felhasználói szándékokra épülő benchmark, amely akadémiai tudásgráfokon teszteli a nagy nyelvi modellek eszközhasználó ágensként való működését. A még nem lektorált kutatás szerint a rendszer teljes munkafolyamatot fed le: lekérdezés-tervezés, API-hívások végrehajtása, paraméterek kitöltése, hivatkozásokkal alátámasztott válaszok generálása és átfogó kiértékelés. A szerzők 14 módszert hasonlítottak össze, és azt találták, hogy még a legjobban teljesítő megközelítés (a Gemini-3-Pro-val működő PLAY2PROMPT) is csak közepes eredményt ért el, különösen az API-tervezés és -végrehajtás terén küzdött nehézségekkel. Az AISE-Bench célja, hogy megbízható tesztágyat biztosítson a többlépéses, nyomon követhető érvelést igénylő LLM-ágensek fejlesztéséhez és összehasonlításához. A kód és az adatok nyilvánosan elérhetők.
-
Kutatás 2026. július 23., csütörtök
Orvosi mesterséges intelligencia biztonságosságát torzítja az értékelő személye – hiányzó információ mellett
Egy nem lektorált kutatás négy nagy nyelvi modell (Claude Opus 4.8, GPT-5.5, Grok 4.3 és Gemini 3.5 Flash) orvosi biztonságosságát vizsgálta nyílt végű klinikai beszélgetésekben, ahol szándékosan hiányos információt kaptak a modellek. A szerzők szerint az értékelő megválasztása érdemben befolyásolja az eredményt: a négy LLM-bíró közötti egyezés csak közepes (Fleiss-kappa 0,65), és kimutatható pozitív torzítás, ha egy modellt saját szolgáltatójának bírája értékel. Az LLM-bírák ráadásul szignifikánsan engedékenyebbek voltak, mint a vakított klinikai szakértők: 66–84%-ban ismerték el a megfelelő bizonytalanságot, szemben a klinikus 52%-ával. A kutatók hangsúlyozzák, hogy a biztonsági rés nem tudáshiányból, hanem a kalibrációból ered, amit egy zárt végű MedQA-teszttel is alátámasztanak. A csoport a teljes tesztkeretrendszert, promptokat és annotációs protokollt nyilvánosan elérhetővé tette.
-
Modellek 2026. július 22., szerda
A Google három új Gemini modellt mutatott be, köztük a kiberbiztonságra szabott változatot
A Google három új mesterségesintelligencia-modellt jelentett be: a Gemini 3.6 Flash-t, a 3.5 Flash Lite-ot és a 3.5 Flash Cyber-t. Az Ars Technica beszámolója szerint a 3.6 Flash a kódolási benchmarkokban jelentős javulást mutat elődjéhez képest (a DeepSWE teszten 49 százalékot ért el a korábbi 37-tel szemben), miközben körülbelül 17 százalékkal kevesebb tokent használ, és alacsonyabb API-áron érhető el. A 3.5 Flash Lite a Google állítása szerint a leghatékonyabb modelljük, másodpercenként 350 tokenes sebességgel, kedvező árazással. A Gemini 3.5 Flash Cyber a vállalat első kifejezetten kiberbiztonsági célra fejlesztett modellje. A Google emellett jelezte, hogy a késlekedő Gemini 3.5 Pro továbbra sem jelent meg, viszont már tréningezik a Gemini 4-et.
-
Kutatás 2026. július 21., kedd
Az AI a toborzásban az embereknél is hajlamosabb sztereotípiák kialakítására – új kutatás
A Princeton Egyetem és a Chicagói Egyetem kutatói szimulált felvételi kísérletben vizsgálták, hogyan alakítanak ki sztereotípiákat a nagy nyelvi modellek. A ChatGPT-t, a Claude-ot és a Geminit is magában foglaló tesztben a modellek fiktív etnikai csoportokba tartozó jelölteket értékeltek negyven körön át, miközben minden jelölt valójában azonos eséllyel teljesített sikeresen. Az eredmények szerint a modellek a korai tapasztalatok alapján gyorsan elkezdték szegregálni a jelölteket, és a kutatók szegregációs skáláján mintegy 65 százalékkal magasabb értéket értek el az emberi résztvevőknél – az OpenAI o3 modellje közel a maximális szintet produkálta. A kutatók szerint az LLM-ek különösen hajlamosak kevés adatból általánosítani, ami az ágens-alapú, felhasználói részleteket megjegyző modellek terjedésével fokozott kockázatot jelent a munkaerő-felvételi döntésekben.
-
Eszközök 2026. július 20., hétfő
A Google AlphaEvolve kódoptimalizáló ügynöke általánosan elérhetővé vált a felhőplatformon
A Google bejelentette, hogy az AlphaEvolve evolúciós kódoptimalizáló ügynök általánosan elérhető lett a Gemini Enterprise Agent Platformon. Az eszköz Gemini modellekkel mutáns programváltozatokat generál, amelyeket a felhasználó saját infrastruktúráján értékel, így az üzleti kód nem hagyja el a kliens környezetét. A vállalat szerint több ügyfél is konkrét eredményeket ért el: a Klarna megduplázta ML-betanítási áteresztőképességét, a JetBrains 15-20 százalékkal csökkentette a kódkiegészítés késleltetését, a Kinaxis pedig 22 százalékkal javította előrejelzési pontosságát 90 százalékos futásidő-csökkenés mellett. A Google belső használatban TPU-tervezésnél és a Spanner adatbázis optimalizálásánál is alkalmazta.
-
Kutatás 2026. július 20., hétfő
Az AI-chatbotok veszélyesen magabiztosak a röntgendiagnózisban, még akkor is, ha tévednek
A RadLE 2.0 nevű benchmark 200 radiológiai eseten 16 mesterségesintelligencia-modellt tesztelt, és az eredményeket tapasztalt radiológusok teljesítményéhez hasonlította. Az Ashoka Egyetem CRASH Lab csapata által fejlesztett teszt nemcsak a diagnózis pontosságát, hanem a modell magabiztossági szintjét és a bizonytalanság beismerésének képességét is méri. A humán szakértők 988,7 pontot értek el a maximális 2000-ből, míg a legjobb AI-modell 758-at. A tanulmány szerint egyetlen modell sem győzött minden kategóriában: az Anthropic Claude Fable 5 a megbízhatóságban, a Google Gemini 3 Pro a nyers találati arányban, a Meta Muse Spark 1.1 pedig a saját korlátainak felismerésében teljesített a legjobban. A pontozás bünteti a magabiztos tévedést, mivel az orvoslásban egy hamisan határozott diagnózis sokkal veszélyesebb, mint a bizonytalanság őszinte bevallása.
-
Szabályozás 2026. július 18., szombat
Az EU kötelezi a Google-t keresési adatai megosztására és az Android AI-hozzáférés megnyitására
Az Európai Bizottság jogilag kötelező érvényű határozatokat hozott a digitális piaci törvény (DMA) alapján, amelyek a Google keresőjét és az Android rendszert egyaránt érintik. Az Android-telefonokon a Google-nak meg kell nyitnia a rivális mesterségesintelligencia-platformok előtt azokat a rendszerhozzáféréseket, amelyeket jelenleg kizárólag a Gemini élvez – beleértve az ébresztőszót, a képernyőtartalom-hozzáférést és az alkalmazásautomatizálást. A keresés terén a vállalatnak versenytársakkal kell megosztania keresési adatait. A Google állítása szerint az intézkedések a felhasználói adatvédelmet és biztonságot veszélyeztetik, a Bizottság ezzel szemben a verseny és a felhasználói választás szabadságának erősítését hangsúlyozza.
-
Kutatás 2026. július 17., péntek
A Google DeepMind és az Isomorphic Labs közös biobiztonsági stratégiát mutatott be
A Google DeepMind és az Isomorphic Labs közös megközelítést tett közzé a biológiai ellenálló képesség (bioreziliencia) erősítésére. A két szervezet saját közlése szerint az elmúlt egy évben több mint 15 partnerséget kötött kormányzati szervekkel, biobiztonsági szervezetekkel és kutatócsoportokkal annak érdekében, hogy megakadályozzák az AI-modellek visszaélésszerű felhasználását, és felgyorsítsák a járványok felismerését és a válaszlépéseket. A stratégia három pillérre épül: megelőzés, felderítés és reagálás. A cégek az AlphaFold, az AlphaGenome és az Isomorphic Labs gyógyszertervezési motorja (IsoDDE) mellett a Gemini modellt is megbízható partnerek rendelkezésére bocsátják. Emellett a SynthID vízjelező technológia biológiai alkalmazásán is dolgoznak, amely segíthetne a DNS-szintézis-szolgáltatóknak az AI által generált, potenciálisan kockázatos biológiai szekvenciák szűrésében.
-
Eszközök 2026. július 17., péntek
A Google Vids két új funkcióval bővül: Gemini Omni és személyes avatarok
A Google bejelentette, hogy a Google Vids videószerkesztő platformon két új funkciót vezet be. A Gemini Omni segítségével a felhasználók egyszerű szöveges utasításokkal és képi hivatkozásokkal hozhatnak létre vagy szerkeszthetnek videókat – a cég szerint például háttér cseréje vagy megvilágítás javítása is leírással megoldható. A másik újdonság a személyes avatar: egy szelfi és egy hangrögzítés feltöltésével digitális hasonmás készíthető, amely kamera nélkül szerepelhet a videókban. A Google közlése szerint minden mesterséges intelligenciával generált klip digitális vízjelet kap az átláthatóság érdekében. A vállalat korábban, februárban már elérhetővé tette a Veo 3.1 modellt a Vids felhasználói számára, az új frissítések erre az alapra építenek.
-
Eszközök 2026. július 15., szerda
25 éves a Google képkereső, megújul a felület és AI-képgenerálás kerül a találatokba
A Google a képkeresője 25. évfordulója alkalmából jelentős felületmegújítást jelentett be. Az Ars Technica beszámolója szerint az eddig minimalista kezdőoldal helyett egy folyamatosan frissülő képgaléria fogadja majd a felhasználókat, amelyet a Google a felhasználó keresési és böngészési előzményeiből levezetett érdeklődés alapján állít össze. A vállalat emellett újra előtérbe helyezi a Gyűjtemények (Collections) funkciót, amellyel a felhasználók elmenthetik a tetszésük szerinti képeket. A frissítés részeként a Google a Nano Banana nevű AI-képgeneráló modelljét – amely korábban a Geminiben és az AI Mode-ban volt elérhető – az AI Overviews keresési összefoglalókba is integrálja, így a felhasználók közvetlenül a keresési találatoknál kérhetnek mesterséges intelligenciával generált képeket.
-
Társadalom 2026. július 12., vasárnap
Terrorszervezetek rendszeresen használják a nagy AI chatbotokat támadástervezéshez és fegyverkészítéshez
A Cambridge-i CASP kutatója, Antonia Jülich 27 volt Boko Haram-tag 57 interjúján alapuló tanulmánya szerint az ISIS már 2023 óta oktatja a prompt engineering és jailbreak technikákat, és nigériai Boko Haram-parancsnokokat is kiképzett az AI biztonsági szűrők megkerülésére. A tanulmány szerint a Boko Haram mindkét frakciója dedikált AI-egységeket hozott létre, és a ChatGPT-t, Claude-ot, Geminit, Grokot, Meta AI-t és DeepSeeket használják támadástervezésre, robbanóeszközök fejlesztésére és műveleti biztonságra. A kutatás arra figyelmeztet, hogy a biztonsági szűrők nem képesek megbízhatóan megakadályozni a visszaéléseket – az Anthropic maga is elismerte, hogy a jailbreakek valószínűleg soha nem lesznek teljesen kiküszöbölhetők. Jülich szerint bár a csoport AI-használata egyelőre hagyományos, a tömegpusztító fegyverekhez való AI-segítség kockázatát komolyan kell venni.
-
Kutatás 2026. július 11., szombat
Mélytanulás és LLM-alapú döntéstámogatás a májrák diagnosztikájában és kezelésében
A Nature Communications-ben megjelent többközpontú tanulmány bemutatja a MAPUSE mélytanulási modellt, amely kontrasztanyagos ultrahangvideókból nem invazívan jelzi előre a hepatocelluláris karcinóma mikrovasculáris invázióját (MVI). Az 1716 beteg 5148 videóján validált rendszer 0,835–0,978 AUC-értékeket ért el, és transzkriptomikai elemzéssel a CD8+ T-sejtes immuninfiltrációhoz kötötte predikcióit. Egy még nem lektorált preprint emellett a HCC-STAR nyelvi modellt ismerteti, amely kórlapokból ad kockázati besorolást és kezelési ajánlást; a szerzők szerint 6668 betegen felülmúlta a GPT-5-öt és a Gemini-2.5 Pro-t. Mindkét kutatás kínai intézmények munkája, szélesebb független validáció még szükséges.
-
Eszközök 2026. július 9., csütörtök
A Google DeepMind háttérfuttatást és MCP-támogatást ad a Gemini API menedzselt ágenseihez
A Google DeepMind négy új funkcióval bővítette a Gemini API-ban elérhető Managed Agents szolgáltatást. A The Decoder beszámolója szerint a fejlesztők mostantól aszinkron módon, háttérben futtathatják az ágenseket (Background Execution), anélkül hogy nyitott HTTP-kapcsolatot kellene fenntartaniuk. Emellett távoli MCP (Model Context Protocol) szervereket csatlakoztathatnak közvetlenül belső adatbázisokhoz vagy API-khoz. Az újdonságok között szerepel, hogy egyedi függvények is használhatók a beépített sandbox-eszközök mellett, továbbá a hitelesítő tokenek frissíthetők interakciók között a sandbox állapot elvesztése nélkül. A bővítés azt követően érkezik, hogy a frissült Android Bench benchmarkon a Google saját Gemini modelljei a riválisok mögött végeztek kódgenerálásban, ami rámutat a cég ágensfejlesztési infrastruktúrájának fejlesztési kényszerére.
-
Társadalom 2026. július 6., hétfő
A Google reklámja szerint az alapító atyák az AI és a Workspace segítségével írták volna a Függetlenségi Nyilatkozatot
A Google új reklámfilmje azt a fiktív forgatókönyvet mutatja be, hogy az amerikai alapító atyák hogyan használták volna a Google Workspace eszközeit és a Gemini AI-t a Függetlenségi Nyilatkozat elkészítéséhez. A Group project, but make it 1776 szlogennel futó hirdetésben Jefferson Google Docsban szerkeszt, Franklin és Adams javaslatmódban javít, a Gemini pedig jegyzetel a Google Meet-hívás során, sőt tanácsot is ad, hogy III. György kapjon-e szerkesztési jogot. A The Verge és a TechCrunch egyaránt beszámol róla, hogy a YouTube-on és Instagramon többnyire pozitív, a Bluesky-on viszont erősen kritikus volt a fogadtatás: a nézők kínosan ízléstelennek és süketnek nevezték a reklámot. Angus Johnston, a CUNY történészprofesszora szerint még egy giccses fantáziaviccben is lehetetlen úgy bemutatni az AI-t, mint ami hasznos eszköz politikai szerveződéshez, íráshoz vagy emberi együttműködéshez.
-
Modellek 2026. július 3., péntek
Ausztrál startup az AI-csoportgondolkodás ellen: a Springboards Flint modellje változatosabb válaszokat ígér
A legtöbb nagy nyelvi modell – köztük a ChatGPT, Claude és Gemini – meglepően kiszámítható válaszokat ad nyitott kérdésekre: ha véletlenszámot kérünk 1 és 10 között, szinte mindig a 7-et kapjuk. A MIT Technology Review beszámolója szerint az ausztrál Springboards startup erre a problémára fejlesztette ki Flint nevű nagy nyelvi modelljét, amelyet kifejezetten arra tanítottak, hogy nyitott végű kérdéseknél – például úticél-ajánlásoknál – szélesebb válaszskálát kínáljon a mainstream modellekénél. A jelenség azért fontos, mert bár a kiszámíthatóság kódolási vagy kutatási feladatoknál elfogadható, az ötletelés és kreatív tervezés területén az AI-csoportgondolkodás komoly korlátot jelent. A Flint pontos teljesítményéről és összehasonlító teszteredményeiről a forrás nem közöl részleteket.
-
Kutatás 2026. július 2., csütörtök
Lebegőpontos hibák felismerése: 14 nagy nyelvi modellt teszteltek új benchmarkkal
Egy nem lektorált kutatás 14 nagy nyelvi modellt (LLM) értékelt aszerint, hogy mennyire képesek statikusan felismerni és osztályozni a lebegőpontos hibákat C forráskódban. A szerzők létrehozták az InterFLOPBench benchmarkot, amely 90 C kernelt és 1130 tesztmintát tartalmaz hat hibakategóriában: kioltás, összehasonlítás, nullával osztás, túlcsordulás, alulcsordulás és NaN. Az eredmények szerint a legújabb modellek – köztük a Qwen 3 32b, Gemini 2.5 Flash, Phi 4 Reasoning, DeepSeek R1T2 és a gpt-oss 20b/120b – 0,88 feletti összesített F1-pontszámot értek el. A teljesítmény hibakategóriánként eltérő: a nullával osztás átlagos F1-értéke 0,85 volt, míg az alulcsordulás (0,61) és a kioltás (0,62) esetében a modellek gyengébben teljesítettek, jelezve a finomabb numerikus jelenségek felismerésének nehézségét.
-
Üzlet 2026. július 2., csütörtök
Google júniusi AI-frissítései: Android 17, Gemini 3.5 Live Translate és Gemma 4 helyi futtatása
A Google összefoglalta 2026. júniusi mesterségesintelligencia-fejlesztéseit. A vállalat szerint elindult az Android 17, amelybe mélyen integrálták az AI-funkciókat, valamint bemutatkozott a Gemini 3.5 Live Translate valós idejű fordítási szolgáltatás és egy új, Geminire épülő Google Home hangszóró. A Google állítása alapján a Gemma 4 12B nyílt modell mindössze 16 GB memóriával, helyben futtatható laptopon, és egységes architektúrájában képfelismerést, hangfeldolgozást és fejlett következtetést ötvöz. Emellett a Gemini 3.5 Flash-be integrálták a számítógép-használati képességet, amellyel asztali, mobil- és böngészőkörnyezetben működő egyedi ügynökök építhetők. A frissítések a Google szerint azt a víziót tükrözik, hogy az AI a mindennapi feladatokban természetes partnerként legyen jelen.
-
Modellek 2026. július 1., szerda
A Google bemutatta a Nano Banana 2 Lite képgeneráló modellt: gyors és olcsó, de kompromisszumokkal
A Google DeepMind elérhetővé tette a Gemini 3.1 Flash Lite Image modellt, amelyet Nano Banana 2 Lite néven ismernek: a cég állítása szerint ez a leggyorsabb és legolcsóbb képgeneráló modelljük. Alapértelmezett módban körülbelül 4 másodperc alatt készít képet, míg a standard Nano Banana-nak ehhez mintegy 20 másodpercre van szüksége. Az API-ár átlagosan 0,034 dollár 1000 képenként, a kimeneti tokenár pedig a Nano Banana 2 felének felel meg. Az Ars Technica szerint az Arena.ai felhasználói értékelései közel azonosak a nem-Lite változatéval, ugyanakkor a Google maga is elismeri, hogy a modell gyengébben kezeli a szövegeket – különösen a kis betűméretűeket –, az infografikákon pontatlan adatok jelenhetnek meg, és a személyek megjelenítése kevésbé konzisztens. A modell tehát gyors prototípuskészítésre és ötletelésre alkalmas, de a részletgazdagság terén elmarad a nagyobb változatoktól.
-
Kutatás 2026. június 30., kedd
NormAct: új benchmark méri, hogy az AI-tervezők felismerik-e a rejtett társadalmi normákat
A NormAct nevű benchmark azt vizsgálja, képesek-e a multimodális nagy nyelvi modellek (MLLM-ek) a megtestesült (embodied) cselekvéstervezés során nemcsak az explicit célokat teljesíteni, hanem a ki nem mondott társadalmi normákat is betartani. A még nem lektorált kutatás szerint a tesztelt modellek (a szerzők GPT-5.4, Claude Opus 4.7 és Gemini 3 Pro megjelöléssel hivatkoznak rájuk) az explicit célokat az esetek 67,3%-ában érték el, de a rejtett normákat mindössze 26,4%-ban tartották be. A kutatók kimutatták, hogy a lemaradás nem az általános társadalmi tudás hiányából fakad, hanem abból, hogy a modellek nehezen aktiválják a releváns normákat a kontextusban. Megoldásként a NormPerceptor nevű kontextusfüggő jelzésgenerátort javasolják, amely a tervezés előtt feltárja a jelenethez illő normákat, és a teljes feladatsikert 24,2%-ról 46,7%-ra növelte a szerzők mérései alapján.
-
Szabályozás 2026. június 30., kedd
Google: az EU versenyszabályai komoly adatvédelmi kockázatokkal járhatnak
Az Európai Bizottság várhatóan jövő hónapban jelent be új szabályokat a Google számára, amelyek a Gemini AI kizárólagos Android-integrációjának megszüntetését és anonimizált keresési adatok versenytársakkal való megosztását írhatják elő. A Google biztonsági alelnöke, Heather Adkins a Wirednek azt állította, hogy a változtatások heteken belül a csalások jelentős növekedéséhez vezethetnek az EU-ban. A cég szerint a modern AI-modellek képesek lehetnek az anonim adathalmazok visszafejtésére, belső csapataik pedig állítólag sikeresen azonosítottak egyéneket ilyen adatokból. A Google valós adatvédelmi aggályokként értékeli az intézkedéseket, ugyanakkor a lépések antimonopolista pozícióvédelemként is értelmezhetők.