2026. augusztus 13., csütörtök · Eszközök

AWS rétegzett KV-gyorsítótárat épített LLM-inferenciához

Az AWS blogbejegyzése szerint a vállalat rétegzett KV-gyorsítótár architektúrát épített a SageMaker HyperPod platformra, amely a Curvine nevű elosztott gyorsítótár-fájlrendszert használja megosztott NVMe-tárolóként a GPU- és CPU-memória mellett. Ez a HyperPod meglévő Managed Tiered KV Cache és Intelligent Routing képességeire épül, és lehetővé teszi a KV-gyorsítótár megosztását a vLLM-replikák között, közel lokális disksebességgel. A cég saját tesztjében ez akár 100 százalékos, Pod-ok közötti cache-hit arányt, legfeljebb 2,7-szeres TTFT-javulást és mintegy 56 ezredmásodperces csomópontok közötti L2 olvasási késleltetést eredményezett egy körülbelül 1900 tokenes promptnál. Az AWS szerint így olyan feladatok is futtathatók olcsóbb GPU-példányokon, amelyek korábban P5-ös instance-t igényeltek. Az eredmények a vállalat saját mérésén alapulnak, független validálásról nincs információ.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A megoldás csökkentheti a nagy nyelvi modellek üzemeltetési költségeit és javíthatja a válaszidőt, közvetlen hatással a felhőalapú AI-infrastruktúra gazdaságosságára.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 13., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

AWS: nyílt forráskódú AI-ügynök vezérli a SageMaker HyperPod klasztereket

Az AWS bemutatta a HyperPod InstantStart nevű nyílt forráskódú vezérlőréteget, amely az Amazon SageMaker HyperPod klaszterek – gépi tanulási modellek futtatására szolgáló, Amazon EKS-re épülő infrastruktúra – beállítását és napi üzemeltetését automatizálja. A vállalat állítása szerint a rendszer egyetlen, a felhasználó AWS-fiókjában futó menedzsment-konténerként működik, és ugyanazt a háttér-API-t szolgálja ki webes felületen és parancssoron keresztül is. Az AWS szerint egy AI-ügynök tervezi meg és futtatja a többlépcsős folyamatot – hálózat, tárhely, azonosságkezelés, node-helyreállítás, modellkiszolgálás –, és csak az elérhetőségi zóna vagy a példánytípus kiválasztásánál áll meg döntésre várva. A cég szerint a megbízhatóság kulcsa, hogy a működési szabályokat egy vezérlőréteg API-jába kódolják, nem pedig nyers parancssori hozzáférést adnak az ügynöknek.

AWS és NVIDIA: automatizált AI-gyártósor fizikai robotoknak

Az AWS hivatalos technikai blogja szerint a NVIDIA Cosmos 3 nevű nyílt, omnimodális világmodelljével és az Amazon SageMaker HyperPod infrastruktúrával úgynevezett Physical AI modellgyárat lehet építeni robotok és autonóm járművek számára. A leírás szerint a rendszer folyamatos hurokban generál szintetikus adatot, utótanítja az érzékelési és irányítási modelleket, majd zárt hurkú szimulációban értékeli őket, egyetlen Kubernetes-alapú klaszteren, elkerülve a külön GPU-kapacitást igénylő szakaszos gyakorlatot. Az AWS bemutatja a Cosmos 3 Mixture-of-Transformers architektúráját, valamint egy nyilvános DROID adathalmazon futtatott robotirányítási utótanítási példát, a kód pedig elérhető GitHubon. A cég szerint a kulcsfontosságú mutató nem az egyes feladatok csúcsteljesítménye, hanem a lefoglalt GPU-órákra vetített hasznos GPU-goodput.

AWS: új aws-ai-ml skill a SageMaker AI következtetés-optimalizáláshoz

Az AWS bemutatta az aws-ai-ml nevű új képességet, amely az Agent Toolkit for AWS részeként érhető el, és az Amazon SageMaker AI optimalizált generatív AI következtetési szolgáltatásához kapcsolódik. A vállalat állítása szerint a Model Context Protocol (MCP) protokollt támogató kódoló ügynökök, például a Kiro, a Claude Code és a Codex, ezzel a bővítménnyel mélyreható szakértelmet kapnak a következtetési végpontok teljesítményének benchmarkolásához, a telepítési konfigurációk ajánlásához és a futtatási eredmények összehasonlításához. A skill futtatható SageMaker Python SDK v3 kódot generál, amelyet a felhasználó a saját környezetében ellenőrizhet és módosíthat, mielőtt lefuttatná. Az AWS szerint a telepítés a helyi gépen vagy a SageMaker Studio JupyterLab térben is elvégezhető, és a cég állítása szerint mindössze 10 perc alatt eljuthatunk egy működő beszélgetésig.

Pizza Bot: nyílt forráskódú postaláda AI-ügynököknek az AWS-től

AWS-fejlesztők nyílt forráskódúvá (Apache 2.0 licenc alatt) tették a Pizza Bot nevű, önhosztolt alkalmazást, amely e-mail-kliens stílusú felületen kezeli a háttérben futó AI-ügynökök munkáját. A rendszer kliens-szerver architektúrán alapul: az ügynökök ütemezetten vagy webhookra indulva dolgoznak, feladatokat delegálhatnak specializált munkásoknak, és emberi jóváhagyásra várhatnak fontosabb lépések előtt. A fejlesztők, Joseph Dolivo (principal technologist) és Igor Fil (solutions architect) szerint a postaláda-metafora azért illik, mert egy szál olyan munkaegység, amihez visszatérünk, nem olyan munkamenet, amit folyamatosan figyelni kell. A rendszer több modellszolgáltatót és MCP-szervert támogat, miközben az ügynök állapotát, szálait és naplóit helyben, a felhasználó gépén tárolja, és csak a kiválasztott modellszolgáltatónak, illetve az engedélyezett MCP-szervereknek küld adatot. A projekt a fejlesztők elmondása szerint egy 2025 áprilisában indult, CRM-naplózást automatizáló belső eszközből, a „JoeBot”-ból nőtte ki magát.