2026. július 29., szerda · Eszközök

Google frissítette a Gemini API menedzselt ügynökeit: alapértelmezett a 3.6 Flash

A Google hivatalos bejelentése szerint a Gemini API-ban futó menedzselt ügynökök (Managed Agents) mostantól alapértelmezetten a Gemini 3.6 Flash modellt használják, ehhez nincs szükség kódmódosításra. Az újdonság emellett úgynevezett környezeti hookokat vezet be: ezekkel egyéni szkripteket lehet futtatni minden eszközhívás előtt vagy után a homokozó-környezetben, például letiltva, ellenőrizve vagy naplózva a kód futtatását vagy fájlírást végző műveleteket. A vállalat szerint a fejlesztők explicit módon is választhatnak modellt a 3.6 Flash, a 3.5 Flash és a legkisebb késleltetésű 3.5 Flash-Lite közül. A frissítés emellett költségkeret-vezérlést, ütemezett triggereket és ingyenes hozzáférési szintet is bevezet a menedzselt ügynökökhöz.

Miért fontos?

A frissítés konkrét, ellenőrizhető fejlesztői eszközöket ad a fejlesztők kezébe az AI-ügynökök viselkedésének biztonságosabb szabályozására és költséghatékonyabb futtatására.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 29., szerda napi AI összefoglaló része.

Kapcsolódó hírek

A Google DeepMind háttérfuttatást és MCP-támogatást ad a Gemini API menedzselt ágenseihez

A Google DeepMind négy új funkcióval bővítette a Gemini API-ban elérhető Managed Agents szolgáltatást. A The Decoder beszámolója szerint a fejlesztők mostantól aszinkron módon, háttérben futtathatják az ágenseket (Background Execution), anélkül hogy nyitott HTTP-kapcsolatot kellene fenntartaniuk. Emellett távoli MCP (Model Context Protocol) szervereket csatlakoztathatnak közvetlenül belső adatbázisokhoz vagy API-khoz. Az újdonságok között szerepel, hogy egyedi függvények is használhatók a beépített sandbox-eszközök mellett, továbbá a hitelesítő tokenek frissíthetők interakciók között a sandbox állapot elvesztése nélkül. A bővítés azt követően érkezik, hogy a frissült Android Bench benchmarkon a Google saját Gemini modelljei a riválisok mögött végeztek kódgenerálásban, ami rámutat a cég ágensfejlesztési infrastruktúrájának fejlesztési kényszerére.

A Google DeepMind jelnyelvi AI-t hoz a Pixel telefonokra

A Google DeepMind bemutatta a sign-language-to-text (SL2T) nevű, több nyelvet kezelő AI-modelljét, amely a vállalat állítása szerint minőségben és általánosíthatóságban áttörést jelent a jelnyelvi fordításban. A modell a Pixel 11 készülékeken a Gboard és a Live Transcribe funkciókban debütál, kezdetben amerikai jelnyelvről (ASL) angolra fordítva: a felhasználók jelelhetnek a telefonjuknak ott, ahol eddig gépelniük kellett volna, például keresésnél, üzenetírásnál vagy a Gemini utasításainál. A cég szerint a belső tesztelők gyorsabbnak és természetesebbnek találták a jelelést, mint a gépelést. A fejlesztők hangsúlyozzák, hogy a világ több mint 200 jelnyelvet használó, becslésük szerint 70 millió siket és nagyothalló embere eddig kimaradt a beszélt nyelvi AI-forradalomból. A vállalat további eszközöket és nyelveket ígér a jövőben.

NVIDIA PAIR: helyi hálózaton osztja el az AI-feladatokat

Az NVIDIA bejelentése szerint béta állapotban elérhető a Personal AI Router (PAIR), amely a helyi hálózaton lévő több gép számítási kapacitását vonja össze, és automatikusan szétosztja köztük az AI-kéréseket. A vállalat célja elsősorban a többügynökös (multi-agent) munkafolyamatok támogatása, ahol egyetlen GPU-t túlterhelhetnek a párhuzamos modellhívások; PAIR ezt proxyként kezeli, és a bejövő kérést a megfelelő csomópontra irányítja anélkül, hogy az ügynöknek vagy a mögöttes architektúrának változnia kellene. NVIDIA saját demója szerint egy Hermes Desktop–Ollama–PAIR kombináció, amely RTX Spark, DGX Spark és RTX 5090 gépeket kapcsolt össze, körülbelül kétszeres gyorsulást ért el egyetlen RTX Spark laptophoz képest, ám a cég hangsúlyozza, hogy ez nem teljesítménygarancia, mert az eredmény a munkaterheléstől, a modelltől és a hálózattól is függ. A PAIR zökkenőmentesen illeszkedik olyan meglévő helyi inferenciaszolgáltatásokhoz, mint az Ollama és az LM Studio, és Windows 11, Linux, valamint macOS alatt, x64 és arm64 architektúrán egyaránt használható.

Amazon Bedrock: természetes nyelvű videókeresés a Marengo 3.0 modellel

Az AWS hivatalos bejegyzése szerint elérhetővé vált a TwelveLabs Marengo Embed 3.0 beágyazó modell az Amazon Bedrock Knowledge Bases szolgáltatásban. A modell videót, hangot, képet és szöveget kódol egyetlen, 512 dimenziós vektortérbe, így természetes nyelvű lekérdezésekkel kereshető jelentés alapján a videótartalom, például egy adott mozzanat egy több órás felvételben. A vállalat állítása szerint a Bedrock Knowledge Bases kezelt módon végzi a szegmentálást, a képkockakinyerést és az átiratkészítést, így a felhasználóknak nem kell külön transzkripciós szolgáltatásokat, beágyazó modelleket és vektoradatbázisokat összekapcsolniuk. Az AWS bemutatóban egy 2022-es FIFA világbajnoki döntő 10 perces klipjén demonstrálják a funkciót, S3-tárolóból történő feltöltéssel és a Bedrock konzolon keresztüli lekérdezéssel.