AI-fogalom · Modellek
Nagy nyelvi modell (LLM)
Hatalmas szövegkorpuszon tanított neurális háló, amely szöveget értelmez és generál.
Más néven: LLM, large language model
A nagy nyelvi modell (LLM) olyan mély neurális háló, amelyet rengeteg szövegen tanítottak be a következő token előrejelzésére.
Ebből a látszólag egyszerű feladatból a modell nyelvtani, tárgyi és érvelési képességeket sajátít el.
Kapcsolódó fogalmak
Kapcsolódó hírek
-
Modellek 2026. július 16., csütörtök
Az OpenAI megépítette a GPT-Red-et, egy LLM-alapú szuperhackert a modellek biztonságáért
Az OpenAI létrehozott egy GPT-Red nevű, támadóképességre kiképzett nagy nyelvi modellt, amellyel automatizáltan teszteli saját rendszerei biztonságát – a MIT Technology Review exkluzív beszámolója szerint. A GPT-Red-et önjáték-ciklusban képezték ki több modell ellen: a támadó egyre hatékonyabb prompt-injekciós módszereket fejlesztett ki, a védekező modellek pedig ellenállóbbá váltak. Az OpenAI kutatói szerint a rendszer már korábban ismeretlen támadási módszereket is felfedezett. A vállalat állítása alapján legújabb modelljük, a GPT-5.6 a GPT-Red-del szembeni edzésnek köszönhetően eddigi legrobusztusabb kiadásukká vált. A cél az, hogy az ágensként működő LLM-ek növekvő támadási felületét a jövőben is hatékonyan lehessen ellenőrizni.
-
Kutatás 2026. július 15., szerda
Klinikai LLM-ek nem a tudásukon véreznek el, hanem az aktív információkeresés szisztematikus kudarcán
Egy nem lektorált kutatás 32 élvonalbeli nagy nyelvi modellt tesztelt hematológiai onkológiai eseteken, ahol a modelleknek három körben kellett aktívan klinikai adatokat kérniük diagnózis előtt. A legjobb modell is csak 68%-os pontosságot ért el. A szerzők szerint a diagnosztikai pontosság legerősebb előrejelzője az információ-felhasználási arány volt (R=0,69), amely az utolsó körre 57%-ról 26%-ra esett, így kezelésválasztáshoz kritikus molekuláris adatok feltáratlanok maradtak. A gondolkodási láncolatok magas klinikai minőséget mutattak (91%), de ez nem korrelált a végső pontossággal. A hibaelemzés a kezdő klinikusokra jellemző kognitív torzításokat – horgonyzást, idő előtti lezárást – azonosította fő hibamódként.
-
Kutatás 2026. július 11., szombat
NVIDIA: JAX host offloading akár 57%-kal javítja a nagy nyelvi modellek tanítási átvitelét Blackwell GPU-kon
Az NVIDIA technikai blogja szerint a JAX keretrendszerben alkalmazott host offloading technika jelentősen csökkenti a GPU HBM-szűk keresztmetszetét LLM-tanítás során: a forward pass közben kiválasztott aktivációkat hoszt memóriába mozgatja, majd a backward passnál visszatölti. Az NVIDIA GB200 NVL72 rendszeren végzett MaxText kísérletekben a DeepSeek-V3 671B és Llama 3.1 405B modellekkel az aktiváció-újraszámításhoz képest akár 57%-os átviteli javulást mértek, különösen ritka MoE modellek esetén. A megoldás a Grace Blackwell NVLink-C2C 900 GB/s kétirányú sávszélességére épít, és az optimális eredményhez XLA ütemezési beállítások és Nsight Systems profilozás szükséges.
-
Kutatás 2026. július 10., péntek
ROAM: ipari szakértői modellek LLM-alapú adaptálása újratanítás nélkül
A ROAM keretrendszer az üzembe helyezett ipari modellek korrekcióját célozza nagy nyelvi modellek következtetési képességével, a modellparaméterek újratanítása nélkül. Az eljárás egy alacsony dimenziós látens térben korrigálja a befagyasztott modell kimenetét – például szenzordrift vagy alapanyag-változás esetén –, miközben kockázatkorlátos mechanizmus gátolja a korrekciót megbízhatatlan bizonyíték mellett. A nem lektorált tanulmány szerzői szerint két ipari adathalmazon a módszer több mint 20%-kal csökkentette a MAE-t jelentős rezsimváltásoknál, mindössze 839 extra paraméterrel és 0,02 ms alatti lépésenkénti többletidővel.
-
Kutatás 2026. július 10., péntek
Többágenses LLM-rendszerek biztonsági értékelése: az összesített pipeline-hatás
Egy nem lektorált kutatás szerint a többágenses nagy nyelvi modell-rendszerek (multi-agent LLM) biztonsági kiértékelésénél félrevezető lehet egyetlen összesített pipeline-hatásról.
-
Kutatás 2026. július 8., szerda
Megerősítéses tanulással tanítanak LLM-eket iteratív orvosi diagnózisra
Kutatók egy nem lektorált preprint keretében olyan rendszert mutatnak be, amely a nagy nyelvi modelleket (LLM) passzív válaszadókból aktív, bizonyítékgyűjtő diagnosztikai asszisztensekké alakítja. A megközelítés lényege, hogy az orvosi diagnózist iteratív bizonyítékkeresési feladatként formalizálják, és megerősítéses tanulást (RLVR) alkalmaznak ellenőrizhető jutalmakkal, amelyek a diagnosztikai pontosságot és a vizsgálati konzisztenciát ösztönzik. A szerzők bevezetik a RAGES nevű szimulátort, amely tudásalapú, valósághű klinikai visszajelzéseket generál a modell számára. Az empirikus eredmények szerint a rendszer képes felvenni a versenyt nagyobb és gondolkodásra optimalizált alapmodellekkel is, míg a RAGES a hagyományos LLM-eknél biológiailag plauzibilisebb klinikai válaszokat ad – legalábbis a szerzők állítása szerint.
-
Eszközök 2026. július 7., kedd
A Reddit nagy nyelvi modellekkel küzd az LLM-ek által generált spam ellen
A Reddit saját blogbejegyzése szerint nagy nyelvi modelleket (LLM) vetett be a platformon terjedő spam kiszűrésére – amely problémát részben maguk az LLM-ek súlyosbították, mivel a rosszhiszemű szereplők számára könnyebbé vált tömeges spamtartalom előállítása. A vállalat állítása szerint naponta 23 millió spam-megtekintést blokkol és mintegy 25 000 új spam bejegyzést szűr ki, január és március között pedig 20%-kal csökkentette a felhasználók spamnek való kitettségét az előző negyedévhez képest. A Reddit szerint az új eszközök olyan finom, koordinált manipulációs mintázatokat is felismernek, amelyeket a korábbi rendszerek nem tudtak azonosítani. Platformszakértők ugyanakkor hangsúlyozzák, hogy az AI-alapú tartalommoderálás csak emberi moderálással együtt igazán hatékony.
-
Kutatás 2026. július 2., csütörtök
Lebegőpontos hibák felismerése: 14 nagy nyelvi modellt teszteltek új benchmarkkal
Egy nem lektorált kutatás 14 nagy nyelvi modellt (LLM) értékelt aszerint, hogy mennyire képesek statikusan felismerni és osztályozni a lebegőpontos hibákat C forráskódban. A szerzők létrehozták az InterFLOPBench benchmarkot, amely 90 C kernelt és 1130 tesztmintát tartalmaz hat hibakategóriában: kioltás, összehasonlítás, nullával osztás, túlcsordulás, alulcsordulás és NaN. Az eredmények szerint a legújabb modellek – köztük a Qwen 3 32b, Gemini 2.5 Flash, Phi 4 Reasoning, DeepSeek R1T2 és a gpt-oss 20b/120b – 0,88 feletti összesített F1-pontszámot értek el. A teljesítmény hibakategóriánként eltérő: a nullával osztás átlagos F1-értéke 0,85 volt, míg az alulcsordulás (0,61) és a kioltás (0,62) esetében a modellek gyengébben teljesítettek, jelezve a finomabb numerikus jelenségek felismerésének nehézségét.