2026. augusztus 29., szombat · Eszközök

NVIDIA MPS technológiával 75%-kal csökkenthető a beszédfelismerés GPU-igénye AWS-en

Az AWS, az NVIDIA és a Heidi Health közös blogbejegyzése szerint az automatikus beszédfelismerés (ASR) GPU-kihasználtsága rendkívül alacsony: egyetlen kérés a Parakeet TDT 0.6B V2 modellel az NVIDIA L40S GPU kapacitásának mindössze 15-20 százalékát használja ki, a CUDA alapértelmezett időosztásos ütemezése miatt a kapacitás 80 százaléka kihasználatlan marad. A vállalatok állítása szerint az NVIDIA CUDA Multi-Process Service és a Triton Inference Server kombinálásával az Amazon EC2 GPU-példányokon a kiszolgáláshoz szükséges GPU-k száma 16-ról 4-re csökkenthető, miközben a rendszer 92,1 kérést dolgoz fel másodpercenkénti GPU-nként, egy másodperc alatti késleltetés mellett. A Heidi Health hetente 2,4 millió klinikai konzultációt dolgoz fel 190 országban, ami indokolta a hatékonyabb kiszolgálási architektúra kidolgozását.

Miért fontos?

A leírt módszer a vállalatok állítása szerint jelentősen csökkentheti a nagy volumenű, valós idejű AI-beszédfelismerés infrastruktúra-költségeit.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 29., szombat napi AI összefoglaló része.

Kapcsolódó hírek

Anthropic új szabványt indított: AI-ügynökök vezérelhetnek laboreszközöket

Az Anthropic bejelentette a Model Hardware Standard (MHS) kutatási előnézetét, amely egységes illesztőfelületet ad AI-ügynökök számára fizikai eszközök, például mikroszkópok, folyadékadagolók és robotkarok vezérléséhez. A vállalat állítása szerint a szabvány – amelyet a HHMI Janelia Research Campus kutatóival közösen fejlesztettek – a jelenleg hetekig-hónapokig tartó eszközintegrációt órákra vagy percekre csökkentheti, mivel az eszközök egyszerű „olvasás/írás” parancsokon keresztül kommunikálnak egymással és az AI-modellekkel. Az Ars Technica megerősíti, hogy a rendszer modellfüggetlen, Model Context Protocollal is használható, és a szabványt egyelőre csak szűk kör kapja tesztelésre, nyílt forráskódúvá tétele még nem történt meg.

NVIDIA új eszközzel egyszerűsíti a nyílt AI-modellek C++ integrálását

Az NVIDIA saját közleménye szerint elérhetővé tette a TensorRT Model Connect nevű eszközt, amely nyílt AI-modellek natív C++ alkalmazásokba történő beépítését egyszerűsíti le. A vállalat állítása szerint a folyamat két lépésre bontható: előbb egy Python parancssori eszközzel egy Hugging Face modellazonosítóból telepítési csomag épül, majd ezt egy C++ alkalmazás futásidőben betöltve futtatja, PyTorch vagy Python interpreter nélkül. Az NVIDIA szerint két API-szint áll rendelkezésre: egy feladatszintű szemantikus felület, illetve egy modulszintű, tenzor- és komponensvezérlést lehetővé tevő verzió, továbbá TVM FFI-n keresztül egyéni GPU-kernelek is beépíthetők a pipeline-ba. A cég közlése szerint a fejlesztés AI-alapú kódolóügynökökkel és éjszakai kiadásokkal zajlik, hogy lépést tartson a nyílt modellökoszisztémával.

AWS új funkcióval oldja meg a SageMaker AI-modellek többzónás rendelkezésre állását

Az AWS hivatalos blogbejegyzése szerint a Salesforce a SageMaker AI Inference Components (IC) technológiával nyolcszorosára csökkentette infrastruktúraköltségeit az Agentforce nevű AI-ügynök platformnál, mivel több modellt oszthat meg közös GPU-kon. A cikk szerint az alapértelmezett elhelyezési algoritmus azonban nem garantálta a Salesforce megfelelőségi elvárása szerinti kétzónás redundanciát, mivel modellpéldányok egyenetlenül oszolhattak el a zónák között, ami instancia- vagy zónaszintű meghibásodás esetén kiesést okozhatott. Az AWS ezért bevezette a CreateInferenceComponent API-ban a SchedulingConfig paramétert, amely finomhangolt kontrollt ad a modellpéldányok zónák közötti elosztására. A bejegyzés a Salesforce egy konkrét, négy instanciás, két zónás példáján mutatja be a megoldást.

OpenAI tesztel egy „mindig futó” Codex-ügynök módot

A WIRED által megvizsgált Codex-kódbázisban felfedezett „Persistent mode” nevű beállítás szerint az ügynök a jelenlegi, perceken-órákon belül leálló módokkal szemben „alvó állapotig” futna tovább. A funkcióhoz tartozó „proaktivitás” elem alapján a rendszer a kérés megválaszolása után önállóan újabb feladatokat generálna, munkameneteken átívelve dolgozna, és a felhasználóról szerzett korábbi információk alapján döntene, akár kéretlen üzenetet is küldve. Az OpenAI szóvivője megerősítette a lapnak, hogy a funkciót tesztelik, de azonnali bevezetést nem terveznek; a cég vezetője a nyílt Codex-repót „közös játszótérnek” nevezte. A fejlesztés az OpenAI, az Anthropic és a Meta versenyébe illik a szélesebb közönséget megcélzó, önállóan dolgozó AI-ügynökök terén.