2026. augusztus 13., csütörtök · Eszközök
AWS rétegzett KV-gyorsítótárat épített LLM-inferenciához
Az AWS blogbejegyzése szerint a vállalat rétegzett KV-gyorsítótár architektúrát épített a SageMaker HyperPod platformra, amely a Curvine nevű elosztott gyorsítótár-fájlrendszert használja megosztott NVMe-tárolóként a GPU- és CPU-memória mellett. Ez a HyperPod meglévő Managed Tiered KV Cache és Intelligent Routing képességeire épül, és lehetővé teszi a KV-gyorsítótár megosztását a vLLM-replikák között, közel lokális disksebességgel. A cég saját tesztjében ez akár 100 százalékos, Pod-ok közötti cache-hit arányt, legfeljebb 2,7-szeres TTFT-javulást és mintegy 56 ezredmásodperces csomópontok közötti L2 olvasási késleltetést eredményezett egy körülbelül 1900 tokenes promptnál. Az AWS szerint így olyan feladatok is futtathatók olcsóbb GPU-példányokon, amelyek korábban P5-ös instance-t igényeltek. Az eredmények a vállalat saját mérésén alapulnak, független validálásról nincs információ.
Miért fontos?
A megoldás csökkentheti a nagy nyelvi modellek üzemeltetési költségeit és javíthatja a válaszidőt, közvetlen hatással a felhőalapú AI-infrastruktúra gazdaságosságára.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 13., csütörtök napi AI összefoglaló része.