2026. július 24., péntek · Kutatás

Bizalmas GPU-inferencia teljesítményvizsgálata NVIDIA H100-on Intel TDX környezetben

Kutatók összehasonlító mérést végeztek az NVIDIA H100 GPU-n futó nagy nyelvi modellek hagyományos és bizalmas számítástechnikai módú inferenciája között Intel TDX környezetben. A nem lektorált tanulmány a Mistral-7B és a Qwen3-30B-A3B modelleket vizsgálta. A szerzők szerint a bizalmas mód 21,8–27,8%-kal növelte az első token előállítási idejét, a globális áteresztőképesség pedig 17,7–21,1%-kal csökkent. Zárt hurkú tesztekben a veszteség 11,5–20,2% maradt, de a nagyobb modell hamarabb telítődött. Az eredmények szerint a bizalmas inferencia használható marad, de a kapacitástervezésnek számolnia kell a többletköltséggel.

Miért fontos?

Első átfogó mérési adatokat nyújt arról, mekkora teljesítményárat jelent a bizalmas GPU-inferencia LLM-ek éles üzemeltetésénél.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 24., péntek napi AI összefoglaló része.

Kapcsolódó hírek

FORCE-Bench: új mérce az ágens MI-rendszerek vállalati pénzügyi értékelésére

Kutatók egy nem lektorált tanulmányban mutatták be a FORCE-Bench értékelési keretrendszert, amely 251 szakértő által annotált lekérdezéssel méri az ágens MI-rendszerek teljesítményét vállalati pénzügyi munkafolyamatokban. A benchmark nyolc dimenzióban – többek között pontosság, hivatkozások, megalapozottság és naprakészség – értékel három feladattípust: ERP-alapú kötelezettségkutatást, nyilvános jelentéseken alapuló entitáselemzést és többforrásos üzleti összefoglalók készítését. A szerzők állítása szerint az általános célú ágens rendszerek valós üzemeltetési korlátok mellett nem teljesítik megbízhatóan a pénzügyi minőségi elvárásokat, míg a Microsoft 365 Copilothoz épített célzott ágens stabilabb eredményeket mutat. Az adatkészletet és a kódot nyílt forráskódúként teszik elérhetővé.

Az AI forradalmasítja a biológiai gyógyszerjelöltek tervezését és felgyorsítja a gyógyszerfejlesztést

A gépi tanulás egyre meghatározóbb szerepet tölt be a biológiai gyógyszerek fejlesztésében: a modellek képesek a lehetséges molekulajelöltek hatalmas teréből kiválogatni a legígéretesebb variánsokat, ezzel jelentősen rövidítve a fejlesztési ciklusidőt. Az AstraZeneca szerint a vállalatnál minden lépés – tervezés, előállítás, tesztelés, elemzés – számítógépes támogatással működik, és az AI-alapú tervező-mérő-tanuló ciklus kevesebb zsákutcával jár. Puja Sapra, az AstraZeneca kutatási vezetője a MIT Technology Review-nak elmondta, hogy az AI nemcsak gyorsít, hanem korábban gyógyíthatatlannak tartott célpontok elérését is lehetővé teszi. A forrás szerint a következő generációs biológiai gyógyszerek egyszerre több célpontot képesek támadni, ami a hagyományos módszerekkel nem volt megvalósítható.

Orvosi mesterséges intelligencia biztonságosságát torzítja az értékelő személye – hiányzó információ mellett

Egy nem lektorált kutatás négy nagy nyelvi modell (Claude Opus 4.8, GPT-5.5, Grok 4.3 és Gemini 3.5 Flash) orvosi biztonságosságát vizsgálta nyílt végű klinikai beszélgetésekben, ahol szándékosan hiányos információt kaptak a modellek. A szerzők szerint az értékelő megválasztása érdemben befolyásolja az eredményt: a négy LLM-bíró közötti egyezés csak közepes (Fleiss-kappa 0,65), és kimutatható pozitív torzítás, ha egy modellt saját szolgáltatójának bírája értékel. Az LLM-bírák ráadásul szignifikánsan engedékenyebbek voltak, mint a vakított klinikai szakértők: 66–84%-ban ismerték el a megfelelő bizonytalanságot, szemben a klinikus 52%-ával. A kutatók hangsúlyozzák, hogy a biztonsági rés nem tudáshiányból, hanem a kalibrációból ered, amit egy zárt végű MedQA-teszttel is alátámasztanak. A csoport a teljes tesztkeretrendszert, promptokat és annotációs protokollt nyilvánosan elérhetővé tette.

Szelektív tényellenőrzési keretrendszer: a rendszer tartózkodhat, ha gyenge a bizonyíték

Kutatók egy Evidence Chain Evaluation (ECE) nevű szelektív tényellenőrzési keretrendszert mutattak be egy még nem lektorált tanulmányban. A rendszer lényege, hogy az igaz/hamis döntés helyett bizonytalan verdiktet is adhat, ha a rendelkezésre álló bizonyítékok gyengék, szórványosak vagy ellentmondásosak. A módszer webes keresést, tudományos keresést és végrehajtható ellenőrzéseket kombinál, majd strukturált verdiktet ad konfidenciaértékkel és forrásszintű metaadatokkal. A szerzők szerint az ECE-Bench teszthalmazon 91,6 százalékos standard pontosságot és 97,8 százalékos szelektív pontosságot ért el, miközben 95-ből 6 esetet halasztott el – ezek többsége alacsony megbízhatóságú bizonyítéki környezetbe esett. A kutatók hangsúlyozzák, hogy a tartózkodás biztonságorientált mechanizmusként működik az episztemikusan gyenge bizonyítékok kezelésére.