Sztori-szál · Eszközök
Az AI-ügynökök térhódítása és korlátai
Az AI-ügynökök önállóan terveznek és cselekszenek digitális feladatokban, de megbízhatóságuk és biztonságuk még korlátozott.
Az elmúlt hónapokban a mesterséges intelligencia fejlesztésének súlypontja a puszta szöveggenerálásról az úgynevezett agentic AI, vagyis önállóan cselekvő AI-ügynökök felé mozdult. Ezek a rendszerek nem csupán válaszolnak egy kérdésre, hanem lépéseket terveznek, eszközöket használnak, böngészőt kezelnek, kódot futtatnak, és több lépésben, emberi felügyelet nélkül próbálnak összetett feladatokat végrehajtani. A nagy technológiai cégek – köztük az OpenAI, a Google, az Anthropic és a Microsoft – sorra jelentik be saját ügynök-platformjaikat, amelyek célja az irodai munka, az ügyfélszolgálat vagy a szoftverfejlesztés automatizálása.
A szál tétje kettős: egyrészt gazdasági, mert az AI-ügynökök ígérete szerint jelentősen csökkenthetik a munkaerőköltségeket és felgyorsíthatják a vállalati folyamatokat, ami újraírhatja a szoftveripar és a szolgáltatói szektor üzleti modelljeit. Másrészt biztonsági és megbízhatósági kérdéseket vet fel: az ügynökök gyakran hibáznak, félreértik az utasításokat, vagy váratlan, nem kívánt műveleteket végeznek, amikor valós rendszerekhez (fizetés, e-mail, fájlkezelés) kapnak hozzáférést. Ez felveti a felelősség, az auditálhatóság és a káros következmények elkerülésének problémáját.
Érdemes követni ezt a szálat, mert az agentic AI körüli fejlesztések és kudarcok egyaránt megmutatják, hol áll valójában a technológia érettsége – a marketing-ígéretek és a gyakorlati alkalmazhatóság közötti szakadékot ugyanis egyre több független teszt és vállalati esettanulmány dokumentálja.
Kapcsolódó szálak és fogalmak
- Nagy nyelvi modellek (LLM)
- AI-biztonság és felügyelet
- Vállalati AI-automatizáció
- Multi-agent rendszerek
- Mesterséges intelligencia és munkaerőpiac
A szál fejleményei időrendben
-
2026. június 24., szerda Üzlet
4 millió dollárt gyűjtött a Fika Jobs AI-alapú videós állásinterjú-platformra
A stockholmi székhelyű Fika Jobs startup 4 millió dolláros finanszírozást szerzett, hogy videóközpontú munkaerő-felvételi platformját fejlessze. A rendszer AI-ügynököket alkalmaz az állásjelöltek interjúztatásához, miközben a felhasználók rövid videós profilokat tölthetnek fel magukról. A platform egyfajta hibridmegoldás: a LinkedIn szakmai hálózatosságát ötvözi a TikTok-szerű rövid videós formátummal.
-
2026. június 26., péntek Társadalom
AI-forradalom a futballban és az üzleti életben: ki profitál valójában?
A FIFA az idei világbajnokságon minden csapat számára elérhetővé tesz egy közös AI-ügynököt, ám a szakértők szerint ez csupán kiindulópont: a tehetősebb csapatok saját, fejlettebb eszközökbe fektetnek, ami új típusú egyenlőtlenségeket teremthet a sportban. Párhuzamosan a vállalati szférában is hasonló kihívások mutatkoznak – a Financial Times szerint a legtöbb cég szervezeti és kulturális akadályok miatt nem tudja hatékonyan bevezetni az AI-t. Az újabb technológia önmagában nem elég, ha a szervezet nem áll készen a változásra. Mindkét terület azt mutatja, hogy az AI-hoz való hozzáférés és az abból való profitálás képessége erősen összefügg a meglévő erőforrásokkal és struktúrákkal.
-
2026. június 29., hétfő Kutatás
Princetoni kutatók tesztje szerint az AI-ügynökök többsége csődbe viszi a szimulált startupot
A Princeton Egyetem kutatói CEO-Bench nevű benchmarkot fejlesztettek, amelyben AI-ügynököknek kell 500 szimulált napon át egy fiktív szoftvercéget irányítaniuk egymillió dolláros induló tőkével. A The Decoder beszámolója szerint a tesztelt modellek közül mindössze három végzett a kiinduló tőkénél magasabb egyenleggel, a többség pedig csődbe ment. Figyelemre méltó, hogy egy egyszerű, szabályalapú heurisztika – mesterséges intelligencia nélkül – szinte az összes AI-modellt felülmúlta. A kutatók szerint az AI-ügynökök egyre jobbak rövid, egyértelmű feladatokban, de a hosszú távú, bizonytalanság melletti stratégiai döntéshozatal – amit ők irányítási intelligenciának neveznek – alapvetően más képességeket igényel, amelyeket a jelenlegi modellek még nem tudnak felmutatni.
-
2026. június 29., hétfő Eszközök
Az AWS nyilvános előnézetben elérhetővé tette a FinOps Agent költségelemző szolgáltatást
Az Amazon nyilvános előnézetben bemutatta az AWS FinOps Agentet, egy Amazon Bedrockra épülő menedzselt szolgáltatást, amely automatizálja a felhőköltségek elemzését és optimalizálását. Az AWS szerint az ágens az AWS Cost Anomaly Detection riasztásaihoz kapcsolódva automatikusan vizsgálja a költséganomáliákat, a CloudTrail-eseményekkel korrelálja az adatokat, azonosítja a költségnövekedés valószínű okát, és az eredményeket Jira- vagy Slack-csatornákba továbbítja. A szolgáltatás természetes nyelvű költségkérdéseket is fogad, ütemezett riportokat generál, valamint szervezetspecifikus kontextusfájlok (például fióktulajdonos-hozzárendelések, címkézési szabályok) feltöltését is támogatja. A Redditen a szakemberek között vita bontakozott ki a teljesen autonóm, korlátokkal.
-
2026. június 30., kedd Társadalom
Az AI-ügynökök munkatársként kezelése rontja az emberi hibakeresést és felelősségvállalást
Emma Wiles, a Boston University üzleti professzora által végzett kutatás szerint az emberek 18%-kal kevesebb hibát fedeztek fel, ha az AI által készített munkát egy AI alkalmazott.
-
2026. június 30., kedd Üzlet
Az ágens AI készenléte: 101 feladat rangsorolása mutatja, hol van szükség emberi felügyeletre
Az MIT Technology Review Insights kutatása 101 ágens AI-feladatot rangsorolt a technológiai csapatok körében mért bizalom alapján. A felmérés szerint a szakértők kiemelkedően magabiztosak az AI-, adat- és felhőfeladatok ágensalapú automatizálásában, az MIT Technology Review értékelése szerint azonban a bizalom ott csökken, ahol az ágenseknek összetett üzleti kontextust kellene feldolgozniuk. A Gartner 2026-ot nevezi fordulópontnak az AI-projektek stratégiai összehangolásában, a McKinsey pedig az IT-infrastruktúra költségeinek két-háromszoros növekedését vetíti előre 2030-ig, változatlan költségvetések mellett. A kutatás arra mutat rá, hogy a vállalati adatok ágensekbe való integrálása és a kontextusgenerálás még korai fejlesztési szakaszban van, az emberi felügyelet pedig a sikeres bevezetés kulcstényezője marad.
-
2026. július 1., szerda Kutatás
Közlekedésmérnöki AI-ügynök fejlesztése: hat nagy nyelvi modellt finomhangoltak szakterületi szabványokra
Egy nem lektorált kutatás szisztematikus módszert javasol közlekedésmérnöki célú, testreszabott generatív AI-ügynök fejlesztésére. A szerzők amerikai közlekedési kézikönyvekből, tervezési irányelvekből és szabályozási dokumentumokból álló szakértői korpuszt állítottak össze, majd hat korszerű nagy nyelvi modellt hangoltak finomra LoRA (Low-Rank Adaptation) keretrendszerrel. A kiértékelés BLEU-4 és ROUGE metrikákkal történt; a kutatók állítása szerint a Qwen2.5-7B és a LLaMA-3.1-8B modell érte el a legmagasabb szakterületi illeszkedést és válaszminőséget. A szerzők azt hangsúlyozzák, hogy a LoRA-alapú adaptáció javítja a műszaki tartalom értelmezését és a kontextusfüggő következtetést. A kutatás reprodukálható fejlesztési keretet kínál szakterületi AI-ügynökök építéséhez, bár a módszer valós mérnöki környezetben történő validálása további lépést igényel.
-
2026. július 1., szerda Kutatás
SkillOpt: a Microsoft Research az ügynök-készségeket tanítható paraméterként kezeli, modellsúlyok módosítása nélkül
A Microsoft Research kutatói bemutatták a SkillOpt keretrendszert, amely az AI-ügynökök utasításkészleteit (skill-jeit) nem kézzel szerkeszti, hanem betanítási folyamatként optimalizálja – anélkül, hogy a nyelvi modell súlyait módosítaná. A megközelítés lényege, hogy a skill-fájlt a befagyasztott modellen kívüli tanítható paraméterként kezeli, lépésméret-kontrollt, validációs kapuzást és elutasított szerkesztésekből nyert visszacsatolást alkalmazva. A szerzők szerint hat benchmarkon, hét célmodellen és három végrehajtási módban összesen mind az 52 kiértékelési cellában a SkillOpt érte el a legjobb vagy azzal egyenértékű eredményt. A kutatók azt is állítják, hogy az optimalizált készségek modellméretek, ügynökkeretrendszerek és rokon feladatok között is átvihetők, ami újrafelhasználható munkafolyamat-tudásra utal.
-
2026. július 2., csütörtök Kutatás
Többágenses mesterséges intelligencia a jogi érvelésben: tárgyalótermi eljárások ihlette keretrendszerek
Kutatók többágenses deliberációs módszereket vizsgáltak nagy nyelvi modellekre (LLM) épülő jogi érvelési feladatokban – nem lektorált preprintjük két új, tárgyalótermi eljárásokból és jogi argumentációból ihletett többágenses keretrendszert mutat be. Kísérleteik jogi és nem jogi benchmarkokon azt mutatták, hogy a többágenses rendszerek összteljesítménye összevethető az egymodelles alapvonallal, ugyanakkor szignifikánsan eltérő válaszokat produkálnak. A szerzők kiemelték, hogy bizonyos eseteket a többágenses megoldás old meg sikeresen, amelyeken az alapmodell kudarcot vall – és fordítva. Kvalitatív elemzésük szerint a többperspektívás kritikai gondolkodást igénylő kérdéseknél a többágenses megközelítés tűnik előnyösebbnek. A szerzők eredményeik alapján a többágenses rendszereket ígéretes irányként pozicionálják a jogi AI számára.
-
2026. július 2., csütörtök Üzlet
Google júniusi AI-frissítései: Android 17, Gemini 3.5 Live Translate és Gemma 4 helyi futtatása
A Google összefoglalta 2026. júniusi mesterségesintelligencia-fejlesztéseit. A vállalat szerint elindult az Android 17, amelybe mélyen integrálták az AI-funkciókat, valamint bemutatkozott a Gemini 3.5 Live Translate valós idejű fordítási szolgáltatás és egy új, Geminire épülő Google Home hangszóró. A Google állítása alapján a Gemma 4 12B nyílt modell mindössze 16 GB memóriával, helyben futtatható laptopon, és egységes architektúrájában képfelismerést, hangfeldolgozást és fejlett következtetést ötvöz. Emellett a Gemini 3.5 Flash-be integrálták a számítógép-használati képességet, amellyel asztali, mobil- és böngészőkörnyezetben működő egyedi ügynökök építhetők. A frissítések a Google szerint azt a víziót tükrözik, hogy az AI a mindennapi feladatokban természetes partnerként legyen jelen.
-
2026. július 4., szombat Kutatás
CLAP: zárt hurkú keretrendszer domain-specifikus AI-ágensek utótréningjéhez
A CLAP keretrendszer az AI-ágensek finomhangolását, kiértékelését és kiadásvezérlését egyetlen zárt hurkú folyamatba integrálja – a szerzők nem lektorált kutatási munkában mutatják be. Öt gyártási szcenárión tesztelve a LoRA-SFT csak szerény javulást ért el (pontszám +0,0098, megfelelési arány +0,024), és csupán 3 az 5 tételből javult; a GRPO magas KL-kockázatot mutatott. Az alkalmazáslánc-visszajátszás szerint RAG-orientált adapterrel javulnak a kulcsmezők és a bizonyítékillesztés, de nő a késleltetés. A szerzők amellett érvelnek, hogy az utótréninget integrált ciklusként kell kezelni, nem egyetlen offline metrika alapján.
-
2026. július 5., vasárnap Üzlet
Az OpenAI társalapítója szerint a jövőben senki nem fog szoftvereket tanulni, a felhasználói felület eltűnik
Greg Brockman, az OpenAI társalapítója egy interjúban kifejtette elképzelését, miszerint a ChatGPT-nek láthatatlan háttérréteggé kellene válnia, amely önállóan végzi el a digitális feladatokat – felhasználói felület és hagyományos szoftvertanulás nélkül. Brockman elismerte, hogy a 2023-ban bevezetett ChatGPT Plugins rendszer kudarcot vallott, mert az akkori modellek nem voltak elég fejlettek, miközben az OpenAI aktívan reklámozta a technológiát. A The Decoder rámutat, hogy az OpenAI jelenlegi termékei – például a Codex – maguk is ellentmondanak a láthatatlan felület.
-
2026. július 8., szerda Kutatás
Raven-Agent: az első autonóm kereskedési ágens előrejelzési piacokra
Kutatók bemutatták a Raven-Agent nevű rendszert, amely a szerzők állítása szerint az első teljesen autonóm kereskedési ágens előrejelzési (predikciós) piacokra. A nem lektorált kutatás arra a problémára reagál, hogy a jó valószínűségi előrejelzés önmagában nem elegendő a sikeres piaci kereskedéshez – a korábbi benchmarkok is jelentős szakadékot mutattak a kalibrált előrejelzési pontszámok és a tényleges kereskedési eredmények között. A kontrollált visszajátszásos tesztelésben a Raven-Agent architektúra volt az egyetlen, amely pozitív hozamot és pozitív kockázattal korrigált hozamot ért el az összes vizsgált stratégia közül. A szerzők nyílt forráskódúvá tették a rendszert. Fontos megjegyezni, hogy az eredmények archivált döntési halmazon születtek, és a kutatás még nem esett át szakértői bírálaton.
-
2026. július 8., szerda Eszközök
Az Anthropic Claude Cowork ügynöke mostantól mobilon és weben is elérhető, felhőben fut a háttérben
Az Anthropic kedden bejelentette, hogy a korábban csak asztali alkalmazásként elérhető Claude Cowork AI-ügynök mostantól iOS-en, Androidon és böngészőben is használható. A The Verge és a WIRED egyaránt megerősíti, hogy a Cowork immár alapértelmezetten felhőben fut, így a feladatok a felhasználó laptopjának bezárása után is folytatódnak, és az ütemezett feladatok akkor is lefutnak, ha egyetlen eszköz sincs online. A mobilos és webes verzió a cég szerint nem tartalmazza az asztali alkalmazás összes funkcióját, például a helyi fájlhozzáférést. Az új funkciók először a Max előfizetőknek érhetők el, más csomagokra a következő hetekben terjesztik ki. Az Anthropic emellett augusztus 5-ig meghosszabbította a megduplázott Cowork-használati limitet.
-
2026. július 10., péntek Kutatás
Intézményi red-teaming: a telepítési szabályok okságilag befolyásolják a multiágens AI-biztonságot
Kutatók nem lektorált tanulmányban új módszertant mutatnak be, amellyel multiágens AI-rendszerek telepítési szabályainak biztonsági hatása vizsgálható: az ágenseket és célokat rögzítve egyetlen szabályt változtatnak, majd az eltérést a szabálynak tulajdonítják. Az IABench-CA benchmarkot 228 kontextusban, öt szabállyal és hét modellpopulációval tesztelték (33 924 játszma). Eredményeik szerint egyetlen szabályváltoztatás 22–58 százalékpontos eltérést okozott a halálos kimenetelekben, miközben univerzálisan biztonságos alapbeállítás nem létezik. Az identitásalapú célzás minden populációnál szelekciós szempontból nem biztonságos; a GPT-5.1 populáción végzett anonimizálási kísérlet szerint a veszteségviselő megnevezése 22%-ról 81%-ra emelte a célzott eliminációt.
-
2026. július 10., péntek Eszközök
NVIDIA Nemotron 3 Ultra teljesítménye javítható LangChain harness profilok segítségével, finomhangolás nélkül
Az NVIDIA technikai blogja bemutatja, hogyan lehet a Nemotron 3 Ultra nyílt forráskódú modell ágensalapú rendszerekben elért pontosságát a LangChain Deep Agents harness profilok testre szabásával növelni, anélkül hogy finomhangolásra lenne szükség. A módszer lényege egy iteratív fejlesztési ciklus: kiértékelés futtatása, hibaelemzés, harness profil módosítások (például promptváltoztatások, middleware beillesztése), javítás ellenőrzése, majd újrafuttatás. Az NVIDIA szerint ez lehetővé teszi, hogy a modell megközelítse a zárt, drágább frontier modellek pontosságát. Az automatizálást az úgynevezett agentic proposer.
-
2026. július 10., péntek Üzlet
Az Anthropic használatalapú díjat vezet be a Claude Fable 5 fogyasztói eléréséhez
Július 12-től az Anthropic előfizetői – a havi 20, 100 és 200 dolláros csomagok tulajdonosai – a havi díj mellett használatalapú pótdíjat fizetnek a Claude Fable 5 modell eléréséért. A WIRED szerint a fogyasztói árazás megegyezik a fejlesztői API-díjakkal: egymillió küldött tokenért 10, egymillió generált tokenért 50 dollár jár. Ez az első alkalom, hogy egy vezető AI-labor fogyasztói modelljét használatalapú számlázáshoz köti. Az Anthropic a lépést az iparági trendhez illeszti: a cég szerint az AI-ügynökök – például a Claude Code – lényegesen több számítási kapacitást igényelnek a hagyományos chatbotoknál, ami a korlátlan előfizetéseket fenntarthatatlanná teszi. A WIRED megjegyzi, hogy a változás összefügghet az Anthropic tervezett tőzsdei bevezetésével is.
-
2026. július 10., péntek Kutatás
Többágenses LLM-rendszerek biztonsági értékelése: az összesített pipeline-hatás
Egy nem lektorált kutatás szerint a többágenses nagy nyelvi modell-rendszerek (multi-agent LLM) biztonsági kiértékelésénél félrevezető lehet egyetlen összesített pipeline-hatásról.
-
2026. július 11., szombat Kutatás
LLM-ügynökök piaci stabilitását vizsgáló szimulációban a mediáció bizonyult a legellenállóbb mechanizmusnak
Egy még nem lektorált kutatás 18 DeepSeek-V3 alapú, önérdekű LLM-ügynökből álló piaci szimulációban vizsgálta, milyen formális mechanizmusok képesek fenntartani a piaci stabilitást ismételt társadalmi dilemmákban. Nyolc különböző mechanizmust hasonlítottak össze 200 körös kísérletekben, fokozatosan növelve a troll.
-
2026. július 11., szombat Kutatás
SolarChain-Eval: fizikai korlátokkal teszteli az AI-ügynökök megbízhatóságát a decentralizált energiapiacokon
A SolarChain-Eval egy új, nyílt forráskódú benchmark keretrendszer, amely decentralizált energiapiaci környezetben értékeli az autonóm AI-ügynökök megbízhatóságát – a szerzők nem lektorált preprintben mutatják be. A rendszer Gymnasium-kompatibilis Markov-döntési folyamatként modellezi a piacirányítást, és több dimenzió mentén pontozza az ügynököket: piaci hasznosság, fizikai biztonság, csúszás, döntési simaság, térbeli méltányosság és auditálhatóság. Az LLM-alapú Tervező/Auditor réteg felügyeli és naplózza a kockázatos döntéseket. A kísérletek szerint a megerősítéses tanulással (RL) működő ügynökök javítják a piaci hasznosságot, de fizikai korlátok nélkül érvénytelen termelési adatokat használhatnak ki és mesterséges likviditást hozhatnak létre. Az LLM-auditor javítja az átláthatóságot, de a szerzők szerint nem képes teljes mértékben kompenzálni a rosszul specifikált jutalomfüggvényt.
-
2026. július 13., hétfő Eszközök
A Claude Code beépített böngészőt kapott: az AI közvetlenül olvashat és kattinthat külső weboldalakon
Az Anthropic beépített böngészőablakot adott a Claude Code fejlesztői eszközhöz, amellyel az AI-ügynök közvetlenül megnyithat, olvashat, és interakcióba léphet külső weboldalakkal – beleértve dokumentációs oldalakat és hibakövetőket. A The Decoder beszámolója szerint a böngésző billentyűparanccsal nyílik meg, lapfüles felületet kínál, és ugyanazokat az eszközöket használja, amelyekkel a helyi alkalmazások előnézetét is kezeli, kiegészítve biztonsági szűrőkkel. Az Anthropic közlése alapján osztályozók ellenőrzik a külső oldalakon végzett írási műveleteket, és Claude a felhasználó beleegyezése nélkül nem vásárol, nem hoz létre fiókot és nem kerül meg CAPTCHA-kat. A böngésző tiszta profillal fut, mentett bejelentkezések nélkül. A szervezetek engedélyezési listával korlátozhatják az elérhető külső oldalakat, vagy teljesen letilthatják a böngészőeszközöket.
-
2026. július 14., kedd Kutatás
MIT kutatók AI-ügynökökkel építenek virtuális tereket robotok betanításához
Az MIT CSAIL és a Toyota Research Institute kutatói kifejlesztették a SceneSmith nevű rendszert, amely három mesterséges intelligencia alapú ügynök együttműködésével hoz létre valósághű háromdimenziós virtuális környezeteket robotok betanításához. A rendszer egy tervező, egy kritikus és egy szervező ügynökből áll, amelyek mindegyike vizuális-nyelvi modellre (VLM) támaszkodik a terek megtervezésekor. A kutatók szerint a SceneSmith által generált belső terek – például éttermek, szállodai szobák és hálószobák – részletesebbek és valósághűbbek, mint a korábbi megoldások, így a robotok sokféle feladatot gyakorolhatnak fizikai szimulációban, mielőtt a valós világban tesztelnék őket. A rendszer célja a robotika egyik fő szűk keresztmetszetének, a változatos betanítási adatok hiányának enyhítése, mivel a fizikai környezetben végzett tanítás munka- és időigényes.
-
2026. július 14., kedd Eszközök
Amazon Bedrock AgentCore Gateway: natív OAuth-tokenváltás többbérlős AI-ügynökökhöz
Az AWS hivatalos blogja szerint az Amazon Bedrock AgentCore Identity natívan támogatja az OAuth 2.0 Token Exchange (RFC 8693) szabványt, lehetővé téve a felhasználó nevében történő tokenváltást többbérlős AI-ügynök architektúrákban. Az AWS állítása szerint ezzel megoldható, hogy egy háttérszolgáltatást hívó ügynök megőrizze az eredeti felhasználói azonosságot anélkül, hogy saját jogkörét vagy a felhasználó eredeti tokenjét feltétel nélkül továbbítaná. A cikk egy Okta-integrált, TravelBot nevű referenciaimplementáción mutatja be a JWT-jogosultságok átalakulását és a közönségkötés elvét, amely a bérlők közötti biztonsági elkülönítést szolgálja. A referenciakód az AWS GitHub-tárhelyén lesz elérhető.
-
2026. július 18., szombat Eszközök
Traccia: OpenTelemetry-alapú kormányzási platform MI-rendszerek szabályozási megfelelőségéhez
A Traccia nevű, OpenTelemetry infrastruktúrára épülő többszintű MI-kormányzási keretrendszert mutat be egy még nem lektorált kutatási tanulmány. A szerzők szerint a jelenlegi, széttagolt LLM-értékelő és ML-munkafolyamat-felügyeleti eszközök nem képesek megfelelően kezelni az autonóm MI-ügynökök kockázatait, például az illeszkedési sodródást, az árnyék-MI-rendszerek jogosulatlan telepítését és a SaaS-biztonsági problémákat. A javasolt platform telemetriai adatokat, passzív szemantikai védőkorlát-értékelést és végrehajtási leszármazási információkat gyűjt egy hashelt nyomkövetési főkönyvbe, majd automatikusan állít elő szabályozási megfelelőségi csomagokat SHA-256 tartalomhashekkel. A tanulmány állítása szerint a rendszer közvetlenül leképezhető az EU MI-rendelet (AI Act) több cikkének követelményeire, miközben nem sérti az adatvédelmi előírásokat.
-
2026. július 18., szombat Kutatás
Mesterséges intelligencia mint társkutató: új keretrendszer az orvosbiológiai kutatások felgyorsítására
A Nature Medicine szerkesztőségi cikke szerint az új technológiák olyan ütemben állítanak elő orvosbiológiai adatokat, amely meghaladja az emberi elemzőkapacitást, miközben számos kutatási munkafolyamat ismétlődő és töredezett. Ez kutatási szűk keresztmetszetet hoz létre, amelynek feloldásában a mesterséges intelligenciára épülő ágensek segíthetnek. A cikk két kapcsolódó tanulmányra is hivatkozik: az egyik a rákpatológiában alkalmazható autonóm tudományos felfedezés ágens-keretrendszerét mutatja be, a másik pedig hematológiai rosszindulatú megbetegedéseknél nyújtott klinikai döntéstámogatásra fejlesztett MI-ágenssel foglalkozik. A szerkesztőségi írás tehát azt a gondolatot járja körül, hogy az MI-ágensek társkutatóként képesek lehetnek az orvosbiológiai kutatás tempójának növelésére azáltal, hogy átvállalják az adatelemzés és a munkafolyamatok egy részét.
-
2026. július 18., szombat Üzlet
Eric Trump által is támogatott robotikai cég halálos fegyverekkel tervezi felszerelni humanoid robotjait
A Foundation nevű, 2024-ben alapított amerikai robotikai vállalat vezérigazgatója, Pathak a WIRED-nek nyilatkozva közölte, hogy a cég néhány hónapon belül halálos képességekkel kívánja felruházni humanoid robotjait. A vállalat állítása szerint Pentagon-megbízásokkal rendelkezik, bár a Fox Businessben említett 24 millió dolláros szerződés pontos részletei a WIRED kutatása alapján nem teljesen tisztázottak. Eric Trump, az elnök fia befektetőként és stratégiai tanácsadóként is részt vesz a cégben. A Foundation saját közlése szerint Phantom MK1 nevű humanoidját ukrán erőkkel együttműködve már tesztelte is. A WIRED szerint a vállalat egyedülálló a katonai piac célzásában, miközben az amerikai hadsereg régóta érdeklődik a humanoid robotika iránt, amit a DARPA korábbi programjai és az xTechHumanoids kezdeményezés is mutat.
-
2026. július 19., vasárnap Szabályozás
Traccia: OpenTelemetry-alapú irányítási platform MI-rendszerek szabályozási megfelelőségéhez
A Traccia nevű, nem lektorált kutatásban bemutatott platform az OpenTelemetry infrastruktúrára építve kínál többszintű irányítási keretet nagy nyelvi modellekre és autonóm MI-ágensekre épülő rendszerekhez. A szerzők szerint a jelenlegi elszigetelt monitorozási megoldások nem kezelik hatékonyan az illeszkedési eltolódást, az árnyék-MI rendszereket és a felhőbiztonsági kockázatokat. A Traccia telemetriaadatokat, passzív szemantikai védőkorlát-kiértékelést és végrehajtási leszármazási információkat fűz hash-elt nyomkövetési főkönyvbe. Az EU MI-rendeletének több cikkéhez automatikusan generál megfelelőségi csomagokat SHA-256 tartalomhash-sel és hamisításálló ujjlenyomatokkal, az adatvédelem megsértése nélkül.
-
2026. július 20., hétfő Eszközök
A Google AlphaEvolve kódoptimalizáló ügynöke általánosan elérhetővé vált a felhőplatformon
A Google bejelentette, hogy az AlphaEvolve evolúciós kódoptimalizáló ügynök általánosan elérhető lett a Gemini Enterprise Agent Platformon. Az eszköz Gemini modellekkel mutáns programváltozatokat generál, amelyeket a felhasználó saját infrastruktúráján értékel, így az üzleti kód nem hagyja el a kliens környezetét. A vállalat szerint több ügyfél is konkrét eredményeket ért el: a Klarna megduplázta ML-betanítási áteresztőképességét, a JetBrains 15-20 százalékkal csökkentette a kódkiegészítés késleltetését, a Kinaxis pedig 22 százalékkal javította előrejelzési pontosságát 90 százalékos futásidő-csökkenés mellett. A Google belső használatban TPU-tervezésnél és a Spanner adatbázis optimalizálásánál is alkalmazta.
-
2026. július 21., kedd Eszközök
Az NVIDIA Omniverse ovrtx szenzorszimuláció mostantól modulárisan integrálható meglévő alkalmazásokba
Az NVIDIA bejelentette, hogy az Omniverse könyvtárak – amelyek immár az NVIDIA Agent Toolkit részét képezik – moduláris API-kat kínálnak meglévő alkalmazások bővítéséhez. Az ovrtx nevű, előzetes kiadásként GitHubon elérhető könnyűsúlyú C/Python SDK kamera-, lidar- és radarszenzor-szimulációt valósít meg RTX technológiával, OpenUSD-jelenetekből valós idejű, fizikailag megalapozott kimeneteket állítva elő. A cég szerint a rendszer integrálható CAD-, Blender-, robotikai és felhőalapú tervezési munkafolyamatokba, például a PTC Onshape Render Studióba. Az ovrtx az Omniverse többi könyvtárával – fizikai szimuláció (ovphysx), streamelés (ovstream), adatkezelés (ovstorage) és megosztott USD-jelenetkezelés (ovstage) – együttműködve többmodális szimulációs csővezetékeket támogat szintetikus adatgyártáshoz, digitális ikrekhez és fizikai AI-validációhoz.
-
2026. július 21., kedd Eszközök
Az Amazon Quick és az NVIDIA NeMo Agent Toolkit együttműködése ellátásilánc-kezelő ügynökfolyamatokat kínál
Az AWS hivatalos blogján bemutatott megoldás az Amazon Quick és az NVIDIA NeMo Agent Toolkit összekapcsolásával specializált, ügynökalapú munkafolyamatokat épít ellátásilánc-kockázatok kezelésére. Az Amazon Quick egységes, beszélgetésalapú felületet biztosít strukturált és strukturálatlan vállalati adatokhoz, több mint száz előre elkészített csatlakozóval és MCP-protokollon keresztül elérhető ügynökfolyamatokkal. Az NVIDIA NeMo Agent Toolkit nyílt forráskódú, keretrendszer-független könyvtárként működik, amely LangChain, LlamaIndex, CrewAI és más eszközökkel is kompatibilis. A bemutatott példában egy ellátásilánc-elemző az irányítópult kontextusából kiindulva, a csevegőügynökön keresztül automatikusan vizsgálja a zavarokat, hívja meg az eszközöket, validálja a javaslatot, és rangsorolt kockázatcsökkentési tervet ad vissza a tervezőnek.
-
2026. július 22., szerda Kutatás
RELIC: adatvédelmet megőrző, kombinálható készségek többágenses tervezéshez
A RELIC keretrendszer a többágenses tervezés egy kevéssé vizsgált problémájára kínál megoldást: hogyan fejleszthetik az ágensek saját képességeiket úgy, hogy belső megvalósításuk titkos marad. A korábbi megközelítések központi optimalizálást vagy megosztott házirendeket feltételeztek, ami adatvédelmi szempontból problémás. A még nem lektorált kutatásban bemutatott rendszerben minden ágens nagy nyelvi modell vezérelte kereséssel finomítja készségeit, míg egy megbízható vezénylő kizárólag csapatszintű teljesítmény alapján értékeli a frissítéseket. A sikeres viselkedéseket nem kódként osztják meg, hanem hordozható elvekké alakítják, amelyeket más ágensek saját felületükön alkalmazhatnak. A szerzők szerint ez szétválasztja az összehangolást a megvalósítás megosztásától.
-
2026. július 23., csütörtök Eszközök
A TensorRT motorépítés immár valós időben nyomon követhető és megszakítható
Az NVIDIA technikai blogján bemutatta, hogyan használható a TensorRT-ben több kiadás óta elérhető IProgressMonitor API a motorépítés valós idejű követésére és megszakítására Python és C++ környezetben. A cég szerint nagy modellek és mély taktikakeresés akár percekig tartó építést eredményezhet, ami felügyelet nélkül elvesztegetett GPU-órákat okozhat. Az API három metódus felülírásával fa struktúrájú fáziskövetést és Ctrl-C vagy programozott leállítási jelekre való reagálást tesz lehetővé. Az integráció révén a haladási információ terminálba, IDE-be, HTTP-szolgáltatásba vagy ügynök-futtatókörnyezetbe továbbítható, de szálbiztonság és megszakítási késleltetés gondos kezelését igényli.
-
2026. július 23., csütörtök Kutatás
Szemantikus kooperatív játékok: új módszer az ágensek hozzájárulásának mérésére többágenses LLM-rendszerekben
Kutatók egy új keretrendszert javasolnak, amely LLM-alapú többágenses rendszerekben méri az egyes ágensek hozzájárulását a végső kimenethez. A még nem lektorált tanulmány bevezeti a szemantikus Shapley-értéket (SSV) és a SLIC algoritmust, amely egyetlen futtatásból, az ágensek ismételt újrahívása nélkül építi fel a szemantikus hipergráfot és számítja ki az attribúciós értékeket. A szerzők szerint klasszikus feltételek mellett az SSV visszavezethető a hagyományos Shapley-értékre, a SLIC pedig egy orvosi benchmarkon 93,3%-kal csökkentette a számítási költséget a Monte Carlo Shapley-alapvonalhoz képest, nagyfokú konzisztencia mellett. Összetettebb munkafolyamatokban a módszer feltárhatja, hol tér el a szemantikus hozzájárulás és a hibák hatása.
-
2026. július 25., szombat Kutatás
DFAH-Bench: az AI-ügynökök pénzügyi döntéshozatalának viselkedési instabilitását mérő új benchmark
A DFAH-Bench nevű, nem lektorált kutatásban bemutatott benchmark-keretrendszer az AI-ügynökök viselkedési stabilitását méri pénzügyi feladatokban – nem csupán a végső döntést, hanem az odavezető eszközhasználati útvonalat is vizsgálja. A szerzők 8127 visszajátszási epizódot elemeztek 10 modellen és 3 feladaton: az élvonalbeli modellek 95%-os döntésegyezés mellett csupán 77%-ban követték ugyanazt az eszközútvonalat, ami 18 százalékpontos rejtett eltérést jelent. Három viselkedési profilt azonosítottak: mintaillesztőket, stabil végrehajtókat és trajektória-divergenseket, amelyek eltérő utakon jutnak azonos következtetésre.