2026. augusztus 29., szombat · Eszközök
NVIDIA MPS technológiával 75%-kal csökkenthető a beszédfelismerés GPU-igénye AWS-en
Az AWS, az NVIDIA és a Heidi Health közös blogbejegyzése szerint az automatikus beszédfelismerés (ASR) GPU-kihasználtsága rendkívül alacsony: egyetlen kérés a Parakeet TDT 0.6B V2 modellel az NVIDIA L40S GPU kapacitásának mindössze 15-20 százalékát használja ki, a CUDA alapértelmezett időosztásos ütemezése miatt a kapacitás 80 százaléka kihasználatlan marad. A vállalatok állítása szerint az NVIDIA CUDA Multi-Process Service és a Triton Inference Server kombinálásával az Amazon EC2 GPU-példányokon a kiszolgáláshoz szükséges GPU-k száma 16-ról 4-re csökkenthető, miközben a rendszer 92,1 kérést dolgoz fel másodpercenkénti GPU-nként, egy másodperc alatti késleltetés mellett. A Heidi Health hetente 2,4 millió klinikai konzultációt dolgoz fel 190 országban, ami indokolta a hatékonyabb kiszolgálási architektúra kidolgozását.
Miért fontos?
A leírt módszer a vállalatok állítása szerint jelentősen csökkentheti a nagy volumenű, valós idejű AI-beszédfelismerés infrastruktúra-költségeit.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 29., szombat napi AI összefoglaló része.