2026. július 9., csütörtök · Eszközök

A Google DeepMind háttérfuttatást és MCP-támogatást ad a Gemini API menedzselt ágenseihez

A Google DeepMind négy új funkcióval bővítette a Gemini API-ban elérhető Managed Agents szolgáltatást. A The Decoder beszámolója szerint a fejlesztők mostantól aszinkron módon, háttérben futtathatják az ágenseket (Background Execution), anélkül hogy nyitott HTTP-kapcsolatot kellene fenntartaniuk. Emellett távoli MCP (Model Context Protocol) szervereket csatlakoztathatnak közvetlenül belső adatbázisokhoz vagy API-khoz. Az újdonságok között szerepel, hogy egyedi függvények is használhatók a beépített sandbox-eszközök mellett, továbbá a hitelesítő tokenek frissíthetők interakciók között a sandbox állapot elvesztése nélkül. A bővítés azt követően érkezik, hogy a frissült Android Bench benchmarkon a Google saját Gemini modelljei a riválisok mögött végeztek kódgenerálásban, ami rámutat a cég ágensfejlesztési infrastruktúrájának fejlesztési kényszerére.

Miért fontos?

Az új funkciók a Gemini-alapú ágensek valós alkalmazhatóságát javítják, különösen háttérfuttatással és külső rendszerek MCP-n keresztüli integrálásával.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 9., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

Google frissítette a Gemini API menedzselt ügynökeit: alapértelmezett a 3.6 Flash

A Google hivatalos bejelentése szerint a Gemini API-ban futó menedzselt ügynökök (Managed Agents) mostantól alapértelmezetten a Gemini 3.6 Flash modellt használják, ehhez nincs szükség kódmódosításra. Az újdonság emellett úgynevezett környezeti hookokat vezet be: ezekkel egyéni szkripteket lehet futtatni minden eszközhívás előtt vagy után a homokozó-környezetben, például letiltva, ellenőrizve vagy naplózva a kód futtatását vagy fájlírást végző műveleteket. A vállalat szerint a fejlesztők explicit módon is választhatnak modellt a 3.6 Flash, a 3.5 Flash és a legkisebb késleltetésű 3.5 Flash-Lite közül. A frissítés emellett költségkeret-vezérlést, ütemezett triggereket és ingyenes hozzáférési szintet is bevezet a menedzselt ügynökökhöz.

A Google DeepMind jelnyelvi AI-t hoz a Pixel telefonokra

A Google DeepMind bemutatta a sign-language-to-text (SL2T) nevű, több nyelvet kezelő AI-modelljét, amely a vállalat állítása szerint minőségben és általánosíthatóságban áttörést jelent a jelnyelvi fordításban. A modell a Pixel 11 készülékeken a Gboard és a Live Transcribe funkciókban debütál, kezdetben amerikai jelnyelvről (ASL) angolra fordítva: a felhasználók jelelhetnek a telefonjuknak ott, ahol eddig gépelniük kellett volna, például keresésnél, üzenetírásnál vagy a Gemini utasításainál. A cég szerint a belső tesztelők gyorsabbnak és természetesebbnek találták a jelelést, mint a gépelést. A fejlesztők hangsúlyozzák, hogy a világ több mint 200 jelnyelvet használó, becslésük szerint 70 millió siket és nagyothalló embere eddig kimaradt a beszélt nyelvi AI-forradalomból. A vállalat további eszközöket és nyelveket ígér a jövőben.

Google nyilvánosan is elérhetővé tette a SynthID AI-tartalomfelismerőt

A Google kedden globálisan elérhetővé tette a SynthID Detector nevű weboldalt, amely bárki számára lehetővé teszi, hogy ellenőrizze: egy kép, videó vagy hangfájl AI-val készült-e. A szolgáltatás eddig csak kiválasztott újságírók és kutatók számára volt elérhető, most mindenki használhatja Google-, OpenAI- vagy Apple-fiókkal bejelentkezve. A Google szerint az eszköz nemcsak a saját Gemini, Veo és Lyria modelljeiből származó SynthID vízjeleket ismeri fel, hanem a partnerek, köztük az OpenAI, az Nvidia és a Kakao vízjeleit is, az Apple támogatása pedig hamarosan érkezik. A cég közlése szerint eddig több mint 180 milliárd kép és videó, valamint 240 ezer évnyi hanganyag kapott SynthID-jelölést, és naponta egymillió ellenőrzési kérés érkezik a Gemini alkalmazásban, a Chrome-ban és a Keresőben. A felhasználók naponta mintegy tíz kép-, videó- és hangellenőrzést végezhetnek, és a rendszer csak azt jelzi, hogy tartalmaz-e SynthID vízjelet, nem univerzális AI-detektor.

OpenAI bemutatta a Decisions API-t, és egyszerűsítette árazási szintjeit

Az OpenAI bejelentése szerint új API-t indított Decisions API néven, amely szöveget, képet vagy mindkettőt képes értékelni, és állítása szerint körülbelül tízszer gyorsabb, mint a meglévő Responses API. A szolgáltatás nyilvános béta fázisban érhető el, egyelőre kizárólag a gpt-6-luna modellel működik, bemeneti tokenenként 0,10 dollárért millió tokenenként, míg a kimeneti tokenek ingyenesek. Az API háromféle választ ad: igen/nem valószínűséget, előre megadott kategóriák közötti választást, illetve skálázott értékelést, a cég szerint például kárfelmérésre fotókon vagy ügyfélmegkeresések automatikus irányítására használható. Emellett az OpenAI ötről háromra csökkentette a fizetős API-szintek számát (Build, Launch, Grow), 500, 5000 és 200 000 dolláros havi felhasználási korláttal, és a szervezetek automatikusan lépnek feljebb a szinteken a vásárolt kreditösszeg alapján.