2026. szeptember 5., szombat · Modellek
OpenAI kiadta a GPT-6 Astrát: döcögős indulás, vegyes benchmarkeredmények
Az OpenAI csütörtökön elindította GPT-6 Astra modelljét, „generációs ugrásnak” nevezve, de a bevezetés akadozott: sok fizető Plus és Pro előfizető órákig nem fért hozzá, mert a cég először vállalati ügyfeleket szolgált ki. Sam Altman elnézést kért a „kaotikus” indulásért, és napi egy visszaállítást ígért kártalanításként, amíg a hozzáférés hiányzik. Az OpenAI rendszerkártyája szerint Astra kevesebbet hallucinál elődjénél, a közvetlen prompt-injekciók 99,99 százalékát blokkolja, de tartós, többfordulós támadásokkal még mindig kb. minden harmadik alkalommal kicsikarható belőle problémás válasz, a dokumentumba rejtett indirekt injekciók sikerességi aránya pedig 27-ről 8,5 százalékra csökkent. Az Epoch AI és az Artificial Analysis mérőrendszerei ellentmondó eredményre jutottak Astra teljesítményéről, miközben az ARC-AGI-3 teszten a modell először dolgozott hatékonyabban az átlagembernél.
Miért fontos?
A hír megmutatja, hogy egy nagy modell piaci bevezetése és biztonsági megbízhatósága még mindig komoly gyakorlati kockázatokat és ellentmondó teljesítménymérési eredményeket hordoz.
Benchmark-tolmács
Mit mond a hírben szereplő pontszám?
ARC-AGI-3
Ismeretlen, interaktív játékszerű környezetekben méri, hogy egy AI-ügynök képes-e felfedezni a szabályokat, alkalmazkodni és célt elérni.
- Pontszám
- A környezetek szintjein elért normalizált teljesítmény; magasabb jobb. A Public Demo és a Semi-Private eredmény, valamint a gondolkodási és költségkeret külön kezelendő.
- Frissesség
- Folyamatosan frissül
- Szivárgás
- Alacsony kockázat
- Hétköznapi jel
- Csak közvetett jel
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 5., szombat napi AI összefoglaló része.