2026. október 11., vasárnap · Kutatás

Harvard-kutatás: az AI kódolóügynökök több kódot, de nem több szoftvert termelnek

A Harvard Egyetem kutatói, Fiona Chen és James Stratton, 700 szoftverfejlesztő cég és több mint 700 000 alkalmazott Jellyfish-adatai alapján (2021 és 2026 márciusa között, 300 millió munkaesemény elemzésével) vizsgálták az AI kódoló eszközök hatását. Eredményük szerint az AI kódolóügynökök bevezetése után a cégeknél 30 százalékkal nőtt a legenerált kódsorok száma, 20 százalékkal a commitok, 23 százalékkal pedig a pull requestek száma. Ennek ellenére a kutatók szerint alig van bizonyíték arra, hogy a cégek tényleges szoftverkibocsátása nőtt vagy a létszámuk csökkent volna, mert a nyereséget elnyeli az emberi kódellenőrzés „szűk keresztmetszete”: a review folyamat meghosszabbodik, több átdolgozásra van szükség, és a review-k alatt több megjegyzés születik. A tanulmány így azt sugallja, hogy a kódgenerálás gyorsulása önmagában nem alakítja át a szoftverfejlesztés végső kimenetét.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A tanulmány konkrétan azt mutatja, hogy a 30 százalékos kódnövekedés ellenére a cégek szoftverkibocsátása és létszáma nem változott, mert a nyereséget a kódellenőrzési fázis nyeli el.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. október 11., vasárnap napi AI összefoglaló része.

Kapcsolódó hírek

Az Ai2 új GPU-ütemezőt vezetett be kutatási klasztereihez

Az Ai2 mesterséges intelligencia infrastruktúra csapata blogbejegyzésben mutatta be, hogyan váltotta fel a korábbi prioritás-alapú GPU-ütemezőjét egy új rendszerre, amely GPU-időkereteket, hierarchikus igazságos elosztást és időszeletelési szerződést alkalmaz. A cég állítása szerint ezzel a kutatási projektek GPU-időigényéről szóló vitát eseti operatív döntésből átlátható adminisztratív költségvetés-tervezéssé alakították. Az Ai2 több ezer NVIDIA H100, B200 és B300 GPU-t üzemeltet, 88-1024 GPU-s klaszterekbe rendezve, és mintegy 150 belső kutatót szolgál ki különféle AI-területeken, LLM- és VLM-tréningtől a robotikai megerősítéses tanulásig. A vállalat szerint a kereslet jellemzően 2-3-szorosa a rendelkezésre álló kapacitásnak, és a régi rendszer olyan torzulásokhoz vezetett, mint a GPU-„foglalgatás”, amikor kutatók üresjáratú munkákat parkoltattak le, hogy szükség esetén gyorsan hozzáférjenek erőforráshoz.

Egyetlen üzenettel feltörhető volt egy teljes AWS AI-ügynök-flotta

A Zenity Labs biztonsági kutatói sebezhetőség-láncot találtak Amazon Bedrock AgentCore platformján, amelyet „AgentCorruption” néven neveztek el. A kutatók szerint elég volt egyetlen chatüzenetet küldeni egy nyilvánosan elérhető AI-ügynöknek ahhoz, hogy átvegyék az irányítást az adott AWS-fiók és régió összes AgentCore-ügynöke felett. A probléma gyökere, hogy az ügynökök nem voltak megfelelően elszigetelve, és felszólításra kiadták az AWS belső metaadat-szolgáltatásától (169.254.169.254) kapott ideiglenes hitelesítő adataikat, amelyekkel a kutatók állítása szerint forráskódhoz, jelszavakhoz, privát beszélgetésekhez és más ügynökök memóriájához is hozzáfértek. Az ellopott hitelesítő adatok a kutatók szerint saját gépükről is működtek. Az AWS részlegesen javította a hibát a metaadat-hozzáférés szigorításával és az alapértelmezett végrehajtási szerepkör korlátozásával, a Zenity emellett szigorúbb, minimális jogosultságú szerepkörök manuális beállítását javasolja a vállalatoknak.

EPOCH: bizonyítékvezérelt keresés AI-kutatási ágenseknek

Egy kutatócsoport az EPOCH nevű architektúrát mutatja be, amely AI-kutatási ágensek számára próbálja garantálni, hogy a programok, matematikai konstrukciók és bizonyítások keresése során ne keveredjenek össze a törékeny, de ígéretesnek tűnő jelöltek a valóban megbízható felfedezésekkel. A rendszer explicit feladat-szerződéseket, tipizált memóriát, aktív cáfolási mechanizmusokat, befogadási ellenőrzéseket és független visszajátszást kombinál. A fejlesztők állítása szerint – ez egy nem lektorált, arXiv-on közzétett preprint eredménye – az EPOCH az AlgoTune benchmarkon 0,65-ös átlagos normalizált pontszámot ért el a legerősebb alapmodell 0,53-as eredményével szemben, a belső Math14 tesztcsomagon pedig 0,57-es átlagpontszámot hozott, emellett tíz felfedezési feladat közül többnél konkrét, bizonyítással alátámasztott előrelépést ért el.

OpenAI 722 matematikai kéziratot tett közzé – a szakma etikai aggályokat fogalmaz meg

Az OpenAI kedden 722 kéziratot hozott nyilvánosságra, amelyek 372 eredménycsaládba rendeződnek, és algebra, elméleti számítástechnika, valamint matematikai logika területén oldanak meg régi nyitott kérdéseket. Az eredmények egy egyelőre nyilvánosságra nem hozott modellből származnak; az AGMAI elitmatematikusokból álló tanácsadó csoport közlése alapján az átlagos eredmény hozzávetőleg háromórányi ChatGPT Pro gondolkodásnak felelt meg. Az AGMAI korábban arra is felszólította az AI-laboratóriumokat, hogy ne kezeljék marketingeszközként az ilyen felfedezéseket, és hozzák nyilvánosságra a modell nevét, a promptokat és a számítási költségeket. A princetoni Institute for Advanced Study aggodalmát fejezte ki amiatt, hogy az AI olyan matematikai érveket is előállíthat, amelyeket a promptot adó ember nem képes megérteni vagy ellenőrizni; az OpenAI bejelentette, hogy együttműködik az intézettel, ám nem jelezte, hogy leállítaná jelenlegi gyakorlatát.