AI-modell · Modellek
GPT-5
Az OpenAI legfejlettebb nagy nyelvi modell-generációja, a GPT-sorozat egyik legújabb tagja.
Más néven: GPT5
A GPT-5 az OpenAI által fejlesztett nagy nyelvi modell, amely a korábbi GPT-sorozat (GPT-3, GPT-4) folytatásaként jelent meg, és a vállalat vezető, általános célú mesterséges intelligencia modelljét képviseli. A modell szöveges, illetve multimodális bemenetek feldolgozására és generálására képes, felhasználható kódolásban, elemzésben, tartalomkészítésben és összetett problémamegoldó feladatokban egyaránt.
A GPT-5 az OpenAI kereskedelmi és fejlesztői ökoszisztémájának központi elemét alkotja, elérhető a ChatGPT felhasználói felületen keresztül, valamint API formájában is, amelyet külső fejlesztők és vállalatok integrálhatnak saját alkalmazásaikba. A modell megjelenése jól illusztrálja azt a trendet, amely szerint a nagy nyelvi modellek egyre nagyobb kontextuskezelési kapacitással, pontosabb következtetési képességgel és bővülő multimodális funkciókkal jelennek meg.
A GPT-5 jelentősége abban áll, hogy referenciapontként szolgál az iparág többi szereplője számára a modellképességek terén, és hatással van arra, hogyan alakulnak a versengő fejlesztők (például Google, Anthropic, Meta) saját modelljeinek fejlesztési irányai. Az ilyen zászlóshajó modellek megjelenése egyben újabb vitákat is generál a mesterséges intelligencia biztonságával, energiaigényével és társadalmi hatásaival kapcsolatban.
Kapcsolódó szereplők és fogalmak
GPT-5 a hírekben
-
Modellek 2026. július 25., szombat
Az Anthropic kiadta a Claude Opus 5 modellt, amely megközelíti a Fable 5 képességeit
Az Anthropic csütörtökön bemutatta legújabb modelljét, a Claude Opus 5-öt, amelyről a vállalat azt állítja, hogy számos területen megközelíti a Fable 5 képességeit, és jelentősen jobb összetett kódolási feladatokban. A The Verge szerint a cég szóvivője megerősítette, hogy az Opus 5-öt is tesztelték kormányzati partnerekkel – összhangban a Fable 5 körüli szabályozási feszültségek után kialakult új felügyeleti gyakorlattal. Az Anthropic az Opus 5-öt vállalati ügyfeleknek szánja tudásmunkára és biológiai alkalmazásokra, míg a Fable 5 marad az ambiciózusabb projektekhez. Az árazás megegyezik az előd Opus 4.8-cal (5 dollár bemenet, 25 dollár kimenet millió tokenenként), ami a Fable 5 felének és a GPT-5.6-nál valamivel olcsóbbnak felel meg.
-
Kutatás 2026. július 23., csütörtök
Orvosi mesterséges intelligencia biztonságosságát torzítja az értékelő személye – hiányzó információ mellett
Egy nem lektorált kutatás négy nagy nyelvi modell (Claude Opus 4.8, GPT-5.5, Grok 4.3 és Gemini 3.5 Flash) orvosi biztonságosságát vizsgálta nyílt végű klinikai beszélgetésekben, ahol szándékosan hiányos információt kaptak a modellek. A szerzők szerint az értékelő megválasztása érdemben befolyásolja az eredményt: a négy LLM-bíró közötti egyezés csak közepes (Fleiss-kappa 0,65), és kimutatható pozitív torzítás, ha egy modellt saját szolgáltatójának bírája értékel. Az LLM-bírák ráadásul szignifikánsan engedékenyebbek voltak, mint a vakított klinikai szakértők: 66–84%-ban ismerték el a megfelelő bizonytalanságot, szemben a klinikus 52%-ával. A kutatók hangsúlyozzák, hogy a biztonsági rés nem tudáshiányból, hanem a kalibrációból ered, amit egy zárt végű MedQA-teszttel is alátámasztanak. A csoport a teljes tesztkeretrendszert, promptokat és annotációs protokollt nyilvánosan elérhetővé tette.
-
Modellek 2026. július 22., szerda
Tudósok értékelik a Kimi K3-at: fordulópontnak tartják a kínai AI-modellt
A Nature cikke szerint kutatók körében komoly visszhangot keltett a Moonshot AI múlt héten bemutatott Kimi K3 modellje. Joel Pearson, az UNSW Sydney kognitív idegtudósa szerint a modell "fordulópontot" jelent, egyesek pedig "Szputnyik-pillanatnak" nevezik. A cég saját tesztjei alapján a K3 kódolásban és táblázatkezelésben felveszi a versenyt amerikai riválisaival. A kereslet miatt a Moonshot AI három nappal a megjelenés után felfüggesztette az új regisztrációkat. Mehwish Nasim, a University of Western Australia AI-kutatója szerint a modell megjelenésének időzítése – az Anthropic Claude Fable 5 és az OpenAI GPT-5.6 debütálása után – azt jelzi, hogy Kína nemcsak élvonalbeli AI-rendszereket kíván építeni, hanem a nemzetközi AI-ökoszisztéma és szabályozás alakításában is részt akar venni.
-
Modellek 2026. július 20., hétfő
A Moonshot Kimi K3 modellje frontend kódban vezet, de matematikában messze lemarad a nyugati riválisoktól
A Moonshot AI kínai Kimi K3 modellje a Code Arena frontend kód benchmarkján 1679 pontot ért el, ezzel megelőzve a Claude Fable 5-öt (1631) és a GPT-5.6 Sol-t (1618) is – a The Decoder beszámolója szerint ez az első alkalom, hogy kínai modell végzett az élen ezen a teszten. A kép ugyanakkor vegyes: az Epoch AI adatai alapján a Kimi K3 a FrontierMath Tier 4 nehéz matematikai feladatain mindössze 39 százalékos pontosságot ért el, míg az OpenAI és az Anthropic modelljei ugyanezeken a feladatokon egyes esetekben 90 százalék körüli eredményt produkáltak. A két benchmark tehát eltérő területeken mutatja a modell erősségeit és korlátait: a frontend fejlesztésben kiemelkedő, de komplex matematikai problémáknál jelentős a lemaradása.
-
Kutatás 2026. július 16., csütörtök
Az automatikus harness-evolúció hatékonyságát kérdőjelezi meg egy új értékelési keretrendszer
Kutatók felülvizsgálták az LLM-ágensekhez használt automatikus harness-evolúció értékelési módszertanát egy még nem lektorált tanulmányban. A szerzők két alapvető problémát azonosítanak: egyrészt a harness-evolúció iteratív keresési folyamat, amelyet azonos visszacsatolási és inferencia-költségvetés mellett egyszerű keresési alapvonalakkal kellene összehasonlítani; másrészt a keresés és a végső kiértékelés ugyanazon a benchmarkon zajlik, ami túlillesztési kockázatot jelent. A Terminal-Bench 2.1 benchmarkon GPT-5.4 és Claude Opus 4.6 modellekkel végzett kísérleteik szerint az automatikus harness-evolúció nem múlja felül következetesen az egyszerű tesztelési idejű skálázási módszereket, és korlátozott az általánosítóképessége tartott (held-out) feladatokon. A szerzők tisztességesebb értékelési protokollok és benchmarkok kialakítását szorgalmazzák az automatikus harness-tervezéshez.
-
Modellek 2026. július 16., csütörtök
Az OpenAI megépítette a GPT-Red-et, egy LLM-alapú szuperhackert a modellek biztonságáért
Az OpenAI létrehozott egy GPT-Red nevű, támadóképességre kiképzett nagy nyelvi modellt, amellyel automatizáltan teszteli saját rendszerei biztonságát – a MIT Technology Review exkluzív beszámolója szerint. A GPT-Red-et önjáték-ciklusban képezték ki több modell ellen: a támadó egyre hatékonyabb prompt-injekciós módszereket fejlesztett ki, a védekező modellek pedig ellenállóbbá váltak. Az OpenAI kutatói szerint a rendszer már korábban ismeretlen támadási módszereket is felfedezett. A vállalat állítása alapján legújabb modelljük, a GPT-5.6 a GPT-Red-del szembeni edzésnek köszönhetően eddigi legrobusztusabb kiadásukká vált. A cél az, hogy az ágensként működő LLM-ek növekvő támadási felületét a jövőben is hatékonyan lehessen ellenőrizni.
-
Kutatás 2026. július 12., vasárnap
Az OpenAI GPT-5.6 Sol Ultra állítólag megoldott egy 50 éves matematikai sejtést kevesebb mint egy óra alatt
Az OpenAI bejelentette, hogy GPT-5.6 Sol Ultra nevű modellje 64 párhuzamosan dolgozó alügynök segítségével kevesebb mint egy óra alatt teljes bizonyítást készített a Cycle Double Cover sejtésre, amelyet az 1970-es évek óta nem sikerült igazolni. Thomas Bloom, a Manchesteri Egyetem matematikusa az eredményt "szép bizonyításnak" nevezte, amely ismert eszközöket kombinál, és akár már az 1980-as években is felfedezhetők lettek volna az alkalmazott módszerek. Bloom szerint az AI előnye az volt, hogy nem csüggedt el a sikertelen próbálkozásoktól, hanem apró variációkat próbálgatott. Ugyanakkor bírálta, hogy az OpenAI tanulmánya nem hivatkozik a korábbi releváns munkákra – különösen Bermond, Jackson és Jaeger 1983-as cikkére –, ami félrevezető lehet. A tudományos közösség teljes matematikai ellenőrzése még nem fejeződött be.
-
Modellek 2026. július 12., vasárnap
Az OpenAI GPT-5.6 Sol modellje önállóan végezte el a kisebb Luna modell utótréningezését
Az OpenAI állítása szerint új csúcsmodellje, a GPT-5.6 Sol önállóan hajtotta végre a kisebb Luna modell utótréningezését (post-training). A cég szerint egy kutató egy meglehetősen alulspecifikált promptot.
-
Üzlet 2026. július 12., vasárnap
Az OpenAI elismerte a ChatGPT Work és a GPT-5.6 Sol bevezetésének problémáit, gyorsjavítást ígér
Az OpenAI munkatársa, Thibault Sottiaux nyilvánosan elismerte, hogy a ChatGPT Work és a GPT-5.6 Sol modell bevezetése nem sikerült zökkenőmentesen. A felhasználók panaszai négy területet érintettek: a legmagasabb számítási kapacitás túl könnyen volt elérhető, ami gyorsan kimerítette a használati kereteket; az asztali alkalmazás átalakítása nehezen kereshetővé tette a korábbi funkciókat; egyes többágenses munkafolyamatok visszafejlődtek; valamint a Codex kódolóeszköz jövőjéről zavaros kommunikáció folyt. Az OpenAI azonnali intézkedésként kétszer is visszaállította a napi használati limiteket, és módosítja az alapértelmezett beállításokat, hogy a felhasználók ne kerüljenek automatikusan drága számítási szintekre. A cég jövő hétre egy nagyobb frissítést ígér, amely visszahozza az oldalsáv korábbi elrendezését és átláthatóbbá teszi a használati mutatókat.
-
Kutatás 2026. július 11., szombat
Mélytanulás és LLM-alapú döntéstámogatás a májrák diagnosztikájában és kezelésében
A Nature Communications-ben megjelent többközpontú tanulmány bemutatja a MAPUSE mélytanulási modellt, amely kontrasztanyagos ultrahangvideókból nem invazívan jelzi előre a hepatocelluláris karcinóma mikrovasculáris invázióját (MVI). Az 1716 beteg 5148 videóján validált rendszer 0,835–0,978 AUC-értékeket ért el, és transzkriptomikai elemzéssel a CD8+ T-sejtes immuninfiltrációhoz kötötte predikcióit. Egy még nem lektorált preprint emellett a HCC-STAR nyelvi modellt ismerteti, amely kórlapokból ad kockázati besorolást és kezelési ajánlást; a szerzők szerint 6668 betegen felülmúlta a GPT-5-öt és a Gemini-2.5 Pro-t. Mindkét kutatás kínai intézmények munkája, szélesebb független validáció még szükséges.
-
Kutatás 2026. július 10., péntek
Intézményi red-teaming: a telepítési szabályok okságilag befolyásolják a multiágens AI-biztonságot
Kutatók nem lektorált tanulmányban új módszertant mutatnak be, amellyel multiágens AI-rendszerek telepítési szabályainak biztonsági hatása vizsgálható: az ágenseket és célokat rögzítve egyetlen szabályt változtatnak, majd az eltérést a szabálynak tulajdonítják. Az IABench-CA benchmarkot 228 kontextusban, öt szabállyal és hét modellpopulációval tesztelték (33 924 játszma). Eredményeik szerint egyetlen szabályváltoztatás 22–58 százalékpontos eltérést okozott a halálos kimenetelekben, miközben univerzálisan biztonságos alapbeállítás nem létezik. Az identitásalapú célzás minden populációnál szelekciós szempontból nem biztonságos; a GPT-5.1 populáción végzett anonimizálási kísérlet szerint a veszteségviselő megnevezése 22%-ról 81%-ra emelte a célzott eliminációt.
-
Modellek 2026. július 10., péntek
Az OpenAI nyilvánosan elérhetővé tette a GPT-5.6 modellt és bemutatta a ChatGPT Work AI-ágenst
Az OpenAI a Trump-kormányzat jóváhagyását követően megkezdte a GPT-5.6 modellcsalád (Sol, Terra, Luna) nyilvános bevezetését – a modellt korábban csak engedélyezett szervezetek használhatták korlátozott előzetesben. Sam Altman vezérigazgató a cég eddigi legjobb modelljének nevezte. Ezzel egyidejűleg az OpenAI bemutatta a ChatGPT Work nevű AI-ágenst, amely a ChatGPT és a Codex képességeit egyesíti, és a The Verge szerint dokumentumok, táblázatok, prezentációk készítésére, valamint Slack, Gmail, Google Drive és más eszközök integrálására képes. A desktop alkalmazáson keresztül az ingyenes felhasználók is hozzáférhetnek, míg mobilon és weben a Pro, Enterprise és Edu felhasználók kapnak elsőként hozzáférést. Az OpenAI a terméket az Anthropic Claude Cowork közvetlen versenytársaként pozicionálja az AI-ágensek piacán.
-
Kutatás 2026. június 30., kedd
NormAct: új benchmark méri, hogy az AI-tervezők felismerik-e a rejtett társadalmi normákat
A NormAct nevű benchmark azt vizsgálja, képesek-e a multimodális nagy nyelvi modellek (MLLM-ek) a megtestesült (embodied) cselekvéstervezés során nemcsak az explicit célokat teljesíteni, hanem a ki nem mondott társadalmi normákat is betartani. A még nem lektorált kutatás szerint a tesztelt modellek (a szerzők GPT-5.4, Claude Opus 4.7 és Gemini 3 Pro megjelöléssel hivatkoznak rájuk) az explicit célokat az esetek 67,3%-ában érték el, de a rejtett normákat mindössze 26,4%-ban tartották be. A kutatók kimutatták, hogy a lemaradás nem az általános társadalmi tudás hiányából fakad, hanem abból, hogy a modellek nehezen aktiválják a releváns normákat a kontextusban. Megoldásként a NormPerceptor nevű kontextusfüggő jelzésgenerátort javasolják, amely a tervezés előtt feltárja a jelenethez illő normákat, és a teljes feladatsikert 24,2%-ról 46,7%-ra növelte a szerzők mérései alapján.
-
Kutatás 2026. június 29., hétfő
A Sina háromparaméteres VibeThinker-3B modellje a százszor nagyobb modellek szintjén teljesít matekban és kódolásban
A kínai Sina (Weibo anyavállalata) kiadta VibeThinker-3B modelljét, amely mindössze 3 milliárd paraméterrel egyes matematikai és kódolási benchmarkokon – a cég technikai jelentése szerint – a 200-333-szor nagyobb modellekkel, például a DeepSeek V3.2-vel és a Kimi K2.5-tel vetekszik. A modell az Alibaba Qwen2.5-Coder-3B alapmodelljére épül, a teljesítményt többlépcsős utóképzéssel érik el. A LeetCode-versenyeken (2026 április–május) 128-ból 123 feladatot elsőre megoldott, megelőzve a GPT-5.2-t és a Claude Opus 4.6-ot – állítja a Sina. Ugyanakkor a széles tárgyi tudást igénylő GPQA-Diamond benchmarkon a modell jelentősen elmarad nagyobb riválisaitól. A kutatók következtetése szerint a strukturált logikai gondolkodás jól tömöríthető kis modellekbe, de a faktikus világtudás továbbra is nagy paraméterszámot igényel.
-
Szabályozás 2026. június 28., vasárnap
A Trump-kormány korlátozott hozzáférést engedélyezett az Anthropic Mythos 5 modelljéhez
Howard Lutnick kereskedelmi miniszter június 26-i levelében – amelyet a The Verge és a WIRED is megtekintett – közölte az Anthropic-kal, hogy a Mythos 5 kiberbiztonsági modellt egy szűk körű, jóváhagyott szervezeti csoportnak újra elérhetővé tehetik. A két héttel korábbi exportellenőrzési irányelv, amely külföldi állampolgárok – köztük az Anthropic saját alkalmazottai – hozzáférését tiltotta, formálisan érvényben marad, de a most jóváhagyott szervezetek és az Anthropic külföldi munkavállalói ismét használhatják a modellt. A fogyasztói változat, a Fable 5 sorsa egyelőre rendezetlen: a WIRED szerint az erről szóló tárgyalások a hétvégén is folytatódnak. A lépés az OpenAI GPT-5.6-ra alkalmazott esetenkénti felmentési mintát követi, ami a Financial Times szerint továbbra is feszültséget kelt az ad hoc szabályozási megközelítés miatt.
-
Szabályozás 2026. június 28., vasárnap
Az OpenAI a GPT-5.6 modellt az amerikai kormány által ellenőrzött felhasználók számára tette elérhetővé
A Financial Times beszámolója szerint az OpenAI kiadta a GPT-5.6 jelzésű modelljét, amelyet kizárólag az Egyesült Államok kormánya által átvilágított, kiválasztott felhasználók érhetnek el. A hír arra utal, hogy a legújabb modellhez való hozzáférést kormányzati szintű biztonsági szűréshez kötötték. A rendelkezésre álló információk alapján nem ismert pontosan, milyen kritériumok alapján történik az átvilágítás, és hogy mely felhasználói kör kapott hozzáférést. Az intézkedés a fejlett AI-modellek ellenőrzött terjesztésének irányába tett lépésként értelmezhető, bár a részletekről a forráskivonat nem közöl további információt.
-
Szabályozás 2026. június 27., szombat
Az amerikai kormány kérésére korlátozta az OpenAI a GPT-5.6 kiadását
Az OpenAI a Trump-kormányzat kérésére elhalasztotta a GPT-5.6 modellcsalád nyilvános bevezetését, és helyette korlátozott előnézeti hozzáférést indított az amerikai hatóságok által ellenőrzött felhasználók számára. Az új modellcsalád három változatból áll: Sol (zászlóshajó), Terra (közepes szint) és egy harmadik változat, amelyek különösen erős kiberbiztonsági képességekkel rendelkeznek. A Trump-adminisztráció biztonsági aggályokra hivatkozva kérte a szakaszos kiadást. Az OpenAI ugyanakkor hangsúlyozta, hogy ez a fajta kormányzati hozzáférési folyamat nem válhat hosszú távú normává, mivel megfosztja a legjobb eszközöktől a fejlesztőket, vállalkozásokat és kiberbiztonsági szakembereket.
-
Szabályozás 2026. június 27., szombat
Trump-kormány visszafogja az OpenAI új modelljének kiadását
Az amerikai kormány – köztük a Pénzügyminisztérium és a Kereskedelmi Minisztérium – arra kérte az OpenAI-t, hogy ne hozza nyilvánosan forgalomba legújabb modelljét, a GPT-5.6-ot. A cég ezért egyelőre csak egy szűk partneri körrel osztja meg a rendszert, a szélesebb közönség nem férhet hozzá. A lépés alig két héttel azután történik, hogy az Anthropic kénytelen volt levenni a legfejlettebb AI-modelljeit. A kormányzat célja az, hogy előzetesen ellenőrizni tudja, kik és hogyan használják az újabb, erősebb mesterséges intelligencia rendszereket.
-
Modellek 2026. június 27., szombat
Az OpenAI bemutatja a GPT-5.6 Sol modellt
Az OpenAI előzetesen bemutatta a GPT-5.6 Sol nevű következő generációs mesterséges intelligencia modelljét. Az új modell kiemelkedő képességekkel rendelkezik programozás, természettudományok és kiberbiztonság területén. A vállalat hangsúlyozza, hogy a GPT-5.6 Sol a valaha fejlesztett legfejlettebb biztonsági rendszerrel párosul.
-
Kutatás 2026. június 24., szerda
GPT-5 segített megoldani egy háromévnyi immunológiai rejtélyt
Derya Unutmaz immunológus háromévnyi kutatás után a GPT-5 Pro segítségével jutott áttöréshez a T-sejtek viselkedésének megértésében. A mesterséges intelligencia olyan összefüggésekre mutatott rá, amelyeket a hagyományos kutatási módszerekkel nem sikerült feltárni. Az eredmény potenciálisan hozzájárulhat a rák- és autoimmun betegségek jövőbeli kezeléséhez.