2026. augusztus 23., vasárnap · Modellek

DeepSeek kísérleti vizuális modellt adott ki ügynöki feladatokra

A kínai DeepSeek nyilvánosságra hozta a V4-Flash-Vision-Exp nevű kísérleti, multimodális modellt, amely a szöveges V4-Flash alapmodellt képfeldolgozási képességgel bővíti. A cég saját belső benchmarkjai szerint – ezt fontos hangsúlyozni, mivel független ellenőrzés nem történt – a vizuális változat ügynöki feladatokban közelít az Anthropic Opus 4.8 teljesítményéhez, miközben megőrzi az alapmodell szövegértési és világtudás-képességeit. A modell DeepSeek állítása szerint képeket ír le, szöveget nyer ki képernyőképekből, és diagramokat elemez, valamint kompatibilis az OpenAI és az Anthropic API-formátumaival. A vállalat egyúttal frissítette Harness nevű keretrendszerét is, amely a cikk szerint alapból támogatja az új modellt. A képfeldolgozás technikai részletei – például a fájlformátum-felismerés vagy a tokenköltség – szintén a DeepSeek saját dokumentációjából származó állítások.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A hír azt mutatja, hogy a DeepSeek saját mérései szerint gyorsan felzárkózik a vezető nyugati modellekhez multimodális ügynöki feladatokban, bár ezt független teszt nem igazolta.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 23., vasárnap napi AI összefoglaló része.

Kapcsolódó hírek

A DeepSeek frissítette V4 Pro modelljét, és megnyitotta ügynökszoftverét

A DeepSeek kiadta a V4-Pro-0813 build-et, amely a cég saját mérése szerint jelentősen javult ügynökfeladatokban: a Terminal Bench 2.1 pontszáma 72,1-ről 87,9-re, a DeepSWE pedig 12,8-ról 62,7-re nőtt, és a vállalat állítása szerint több benchmarkon megelőzte a Claude Opus 4.8-at. A független Artificial Analysis mérés is javulást mutat, de árnyaltabb képet ad: a modell az Intelligence Indexen 45-ről 53-ra emelkedett, beérve a GLM-5.2-t, de továbbra is a Muse Spark, a Qwen 3.8 Max, a Kimi K3 és a Claude Opus 5 mögött marad. A cég ezzel egyidejűleg MIT licenc alatt nyílt forráskódúvá tette saját Deepseek Harness ügynökszoftverét, valamint bejelentette, hogy augusztus 16-tól napszak szerinti árazásra tér át: a kínai munkaidőhöz igazított csúcsidőben duplázódnak a díjak, és a csúcsidőn kívüli alapár is emelkedik.

Google bemutatta az EmbeddingGemma 2 nyílt, könnyűsúlyú multimodális beágyazó modellt

A Google kiadta az EmbeddingGemma 2 nevű nyílt modellt, amely szöveget, képet, videót, hangot és kódot alakít numerikus vektorokká, hogy hasonló tartalmakat könnyebben lehessen keresni és összehasonlítani. A Google állítása szerint ez a legkompaktabb ilyen típusú modell a maga 740 millió paraméterével, és a multimodális beágyazási benchmarkokon felülmúlja a nála akár kétszer nagyobb versenytárs modelleket is. A modell API-kulcs nélkül, helyben futtatható: egy lekérdezés WebGPU-n keresztül böngészőben 20-70 ezredmásodpercet vesz igénybe, mindössze körülbelül 191 MB memóriát igényel, és akár hatszorosára csökkenti a helyi vektoradatbázisok tárolási igényét. Csak szöveges feladatokhoz egy 270 millió paraméteres, kisebb változat is elegendő. A Gemma 4-hez hasonló kis nyílt modellekkel párosítva offline, szerverre küldött adatok nélkül futó RAG-alkalmazások építhetők; a súlyok elérhetők a Hugging Face-en és a Kaggle-ön.

Elérhető az Anthropic Claude Haiku 5.5 modellje az AWS-en

Az AWS bejelentette, hogy a Claude Haiku 5.5 mostantól elérhető az Amazon Bedrocköz és a Claude Platformon keresztül is. Az Anthropic állítása szerint ez a Claude 5.5 család leggyorsabb és leghatékonyabb tagja, amelyet kifejezetten subagentekhez és nagy volumenű, költségérzékeny feladatokhoz fejlesztettek, és a legtöbb feladatnál mintegy 75 százalékkal olcsóbb, mint a Claude Haiku 4.5. A modell az első Haiku, amely úgynevezett effort control funkciót kapott, így feladatonként állítható a költség és a képesség aránya. A Bedrocköz kapcsolódva a vállalati adatok az AWS infrastruktúráján belül maradnak, és a megszokott AWS-eszközök (IAM, CloudTrail, CloudWatch, Bedrock Guardrails) is használhatók mellette. A gyártó szerint a modell jól teljesít kódolási, eszközhasználati és agentikus feladatokban, valamint ismétlődő böngésző- és asztali műveleteknél is.

Mistral Large 4: billió paraméteres, Európában épített AI-modell kiberbiztonsági éllel

A Mistral AI nyilvános előnézetben elérhetővé tette a Mistral Large 4-et (ML4), egy billió paraméteres, natívan multimodális modellt, amelyet a cég saját európai adatközpontjaiban, 3800 NVIDIA Grace Blackwell GPU-n tanított; a teljes súlyokat október végén adják ki. A Mistral állítása szerint ML4 a legjobb nyílt súlyozású modell az USA-ból vagy Európából, és élen jár kiberbiztonsági, pénzügyi és jogi feladatokban, mert sebezhetőségeket is reprodukál és javít, amit a versenytársak biztonsági szűrői gyakran megtagadnak. A független Artificial Analysis Intelligence Index szerint ML4 38 pontot ért el, ami jelentős ugrás a Mistral Large 3 9 és a Mistral Medium 3.5 14 pontjához képest, de így is messze elmarad a piacvezető Claude Opus 5.5 (Max) 58 pontjától. A teljes súlyok megjelenéséig a cég kiberbiztonsági szakértőkkel, ellenőrzött partnerekkel és állami szervekkel teszteli a modell csökkentett moderációjú, bővített kiberképességű változatát.