Mai briefing — 2026. augusztus 30., vasárnap

AI hírek röviden

A nap meghatározó fejleménye, hogy a Sony Music és a Warner Chappell milliárdos szerzői jogi pert indított az Anthropic ellen a Claude betanítási adatai miatt, tovább élesítve az AI-ipar és a tartalomipar közötti konfliktust. Az Anthropic emellett a fizikai világba is terjeszkedik: hardveres szabványt épít AI-ügynökök laboratóriumi és gyári gépirányításához. A kutatási oldalon a LAION 10 millió órás nyílt videó-adathalmaza és a Berkeley FreeToken inferenciamotorja tűnt ki, míg az Nvidia a teljes rendszerarchitektúrára építi versenyelőnyét a puszta GPU-dominancia helyett.

10 hír kb. 5 perc olvasás 3 témakör

  1. Üzlet

    Sony Music és Warner Chappell beperelte az Anthropicot szerzői jogsértés miatt

    A Sony Music Publishing, a Warner Chappell és több más kiadó pert indított az Anthropic ellen egy kaliforniai szövetségi bíróságon, azt állítva, hogy a cég tízezrek szerzői jogi tartalmát használta engedély nélkül a Claude betanításához. A kereset per műért akár 150 000, az azonosító adatok eltávolításáért pedig esetenként 25 000 dolláros kártérítést kér, ami összesen több milliárd dollárra rúghatna. A perben Anthropic mellett a társalapítókat, Dario Amodeit és Benjamin Mannt is nevesítik, állítva, hogy Mann BitTorrenten keresztül milliós nagyságrendben töltött le jogsértő könyveket. Az ügy a korábban 1,5 milliárd dolláros egyezséggel zárult kiadói per után újabb jogi támadást jelent a cég ellen; az Anthropic a megkeresésre nem reagált.

    Miért fontos? A per tovább növeli az AI-cégekre nehezedő jogi és pénzügyi kockázatot a betanítási adatok eredetével kapcsolatban, milliárdos kártérítést kilátásba helyezve.

    #Anthropic#szerzői jogi per
  2. Eszközök

    Az Amazon SageMaker Feature Store két új API-val gyorsítja az adatkezelést

    Az AWS hivatalos bejelentése szerint az Amazon SageMaker Feature Store két új API-hívást kapott. A BatchWriteRecord egyetlen hívásban akár 25 rekord írását teszi lehetővé több feature-csoportban, részleges sikeresség kezelésével és rekordonkénti élettartam-beállítással, ahelyett hogy a PutRecord-ot kellene egyesével, ismételve hívni. Az AWS szerint ez csökkenti a kapcsolat-terhelést nagy áteresztőképességű pipeline-oknál, például az általuk említett csalásfelismerő rendszerben, amely másodpercenként 10 000 rekordot kezel öt feature-csoportban. A ListRecords API lehetővé teszi a rekordazonosítók lapozott böngészését mind a Standard, mind az In-Memory tárolási szinten, ami eddig hiányzott, és adatvesztés esetén megnehezítette a helyreállítást. A bejegyzés kódpéldákkal és a szükséges IAM-jogosultságokkal mutatja be a két funkció használatát.

    Miért fontos? Az új API-k csökkenthetik a nagy áteresztőképességű gépi tanulási pipeline-ok üzemeltetési terhelését és javíthatják az adatok helyreállíthatóságát.

    #AWS SageMaker#Feature Store
  3. Kutatás

    LAION kiadta a 10 millió órás nyílt videó-adathalmazt AI-kutatáshoz

    A LAION közzétette a Big Video Dataset (BVD) nevű gyűjteményt, amely a CommonCrawlben talált 1,3 milliárd videó-URL-ből építkezik. A csapat 80 millió videót töltött le, ez összesen 10 millió óra anyagot jelent, ebből 55 millió klipet vágtak ki automatikusan generált videó- és hangleírásokkal, valamint 300 millió állóképet nyertek ki. A kísérő, egyelőre nem lektorált tanulmány szerint a BVD-n tanított modellek a videó-szöveg benchmarkokon akár 2,1 százalékponttal jobban teljesítenek, mint az InternVid adathalmazon tanítottak, ezt egyelőre csak a LAION saját közleménye állítja. A szervezet a 2024-es hamburgi bírósági döntésre hivatkozva kizárólag nem kereskedelmi kutatási célra teszi elérhetővé az adatokat, és kéri a felhasználókat, hogy tartsák tiszteletben az eredeti tartalomkészítők jogait.

    Miért fontos? Ekkora méretű, ingyenesen elérhető videó-szöveg-hang adathalmaz felgyorsíthatja a nyílt videó-AI kutatást, miközben a szerzői jogi jogalap továbbra is vitatott terület.

    #LAION#videó-adathalmaz
  4. Kutatás

    LLM-ekkel automatizált szakirodalmi áttekintés járványmodellekről

    Egy nem lektorált, arXiv-on közzétett tanulmány szerint kutatók nagy nyelvi modellekre épülő feldolgozási láncot fejlesztettek 536, lektorált ágensalapú betegségterjedési modelleket bemutató cikk automatikus feldolgozására, majd az eredményeket emberi kutatók szisztematikus szakirodalmi áttekintésével vetették össze. A szerzők állítása szerint a GPT-4.1 cikkszintű pontossága mintegy 77,95%, a GPT-5.0-é 81,67% volt, míg mezőnkénti szinten a pontosság 32,40% és 100% között szórt, a bonyolultabb, szubjektívebb mezőknél megbízhatatlanabbul. A tanulmány szerint az LLM-ek közötti egyezés a kimenet minőségének jelzője lehet: alacsony egyezés hallucinációra, magas egyezés alacsony pontossággal párosulva pedig az emberi adathalmaz hibáira utalhat.

    Miért fontos? A kutatás számszerű becslést ad arra, mennyire megbízhatóan automatizálhatók nagy nyelvi modellekkel az időigényes szisztematikus szakirodalmi áttekintések.

    #nagy nyelvi modellek#szakirodalmi áttekintés
  5. Kutatás

    Szimbolikus szabályrendszer segítené az AI-t iskolai kémiai feladatok megoldásában

    Kutatók egy ChemOntoRule nevű, kémiai feladatokra szabott ontológiát és determinisztikus Python-szabályokat kombináló rendszert mutattak be, amely az elektronszerkezet, periodikus trendek, oxidációs állapotok és oxid-hidrid viselkedés köré épül. A cél, hogy a nyelvi modellek nehezen ellenőrizhető belső következtetése helyett egy átlátható szabálymag adjon választ iskolai szintű kémiai kérdésekre. A nem lektorált, arXivon közzétett tanulmány szerint a rendszer 300 emberi feladatból 296-ot oldott meg helyesen, a szabályalapú rész pedig 269 feladatból 266-ot talált meg pontosan. A szerzők hangsúlyozzák: mivel ugyanazt a feladathalmazt használták építéshez és teszteléshez, az eredmény a beépített lefedettséget mutatja, nem független általánosítást.

    Miért fontos? A munka azt demonstrálja, hogy szabályalapú, ellenőrizhető szimbolikus rendszerek kiegészíthetik a nyelvi modellek nehezen auditálható következtetését szakterületi feladatokban.

    #ChemOntoRule#kémia-oktatás
  6. Eszközök

    Anthropic hardveres szabványt épít AI-ügynökök gépirányításához

    Az Anthropic egy Model Hardware Standard (MHS) nevű specifikációt fejleszt, amely a Model Context Protocol mintájára egységes felületet adna AI-ügynököknek laboratóriumi és gyári eszközök, például mikroszkópok és robotkarok eléréséhez. A cég állítása szerint eszközönként egyetlen szabványos meghajtó elég a gyártófüggő egyedi integrációk helyett, ami az összekapcsolás idejét hetekről-hónapokról órákra-percekre csökkentheti. Az Anthropic a specifikációt a HHMI Janelia kutatóintézettel közösen fejlesztette, és előbb kutatási előnézetként adja ki kiválasztott laboroknak és gyártóknak, nyílt forráskódú megjelenést később ígér. A vállalat szerint korai tesztek során az AI önállóan tudott munkafolyamatokat optimalizálni és futtatható szkripteket generálni, de még küzd a fizikai ok-okozati összefüggések megértésével, ezért emberi felügyelet marad szükséges.

    Miért fontos? Ha beválik, az AI-ügynökök közvetlen géptávvezérlése felgyorsíthatja a labor- és gyárautomatizálást, de ez a cég saját, még ellenőrizetlen állítása.

    #Anthropic#robotika
  7. Eszközök

    FreeToken: MoE-modellek futtatása fogyasztói hardveren dinamikus CPU-GPU ütemezéssel

    A Berkeley és az MIT kutatói FreeToken néven nyílt forráskódú inferenciamotort mutattak be, amely a nagy, ritka aktiválású Mixture-of-Experts modellek futtatását teszi lehetővé fogyasztói számítógépeken. A projekt szerzői között szerepel Matei Zaharia és Ion Stoica (Databricks társalapítói), valamint Song Han és Kurt Keutzer is. A cikk szerint a hagyományos megoldások a nem aktív szakértői súlyokat statikusan tárolják RAM-ban, és cache-hiba esetén leállítják a GPU-t a szinkron adatátvitel idejére. A FreeToken ezzel szemben a fejlesztők állítása szerint úgynevezett q* szabályzattal dinamikusan osztja meg a token-számítást CPU és GPU között, a súlyátvitelt pedig teljesen átfedésbe hozza a futó számítással, emellett elasztikus memóriakezelővel és úgynevezett szemantikus horgony-checkpointolással kezeli az ágensi munkafolyamatok gyakran változó kontextusát.

    Miért fontos? Ha a leírt módszer beválik, jelentősen olcsóbbá és elérhetőbbé teheti a nagy MoE-modellek futtatását adatközponti hardver nélkül, otthoni gépeken is.

    #FreeToken#MoE-modellek
  8. Üzlet

    Az Nvidia előnye a GPU-n túl: teljes rendszerekben gondolkodik a cég

    A TechCrunch beszámolója szerint a piac eddig azt a narratívát követte, hogy az Nvidia GPU-monopóliuma megszűnik, mivel az Amazon és a Google is saját chipeket fejleszt. A lap szerint a szerdai negyedéves eredmények után új kép bontakozott ki: az Nvidia előnye nem csak a GPU-kban rejlik, hanem az azokat körülvevő teljes rendszerekben is. A cikk példaként a most piacra kerülő Vera Rubin architektúrát említi, amely a Rubin GPU-t Vera CPU-val, Groq 3 LPX inferencia-gyorsítóval, valamint tárolási és hálózati elemekkel párosítja. Az Nvidia egyik alelnöke, Jason Hardy szerint a Vera CPU az adatok orchestrálását végzi, mivel egyetlen szerverbe csak korlátozott memória fér el.

    Miért fontos? A hír azt jelzi, hogy az Nvidia piaci pozíciója nem csak a GPU-technológián, hanem a teljes adatközponti rendszerarchitektúrán is alapulhat.

    #Nvidia#Vera Rubin architektúra
  9. Kutatás

    Gépi tanulási modell javítja a genetikai kockázati pontszámok pontosságát

    A Nature Communications korai hozzáférésű, lektorált, de a végleges közlésre még váró cikke szerint Ross DeVito és Melissa Gymrek (UC San Diego) kutatói olyan módszert dolgoztak ki, amely a hely- és időadatokat, valamint egyéb nem genetikai tényezőket nemlineáris gradient boosted decision tree modellel kezeli, nem a szokásos lineáris korrekcióval. A modell előrejelzését kiegészítő kovariánsként adják a poligénikus pontszám (PGS) számításához. A UK Biobank adatain 16 fenotípust vizsgálva a szerzők állítása szerint ez a megközelítés minden vizsgált tulajdonságnál javította az előrejelzést, a BASIL módszerrel medián 7,3%-os R² növekedést mértek. Az elemzés szezonális hatásokat, nemhez kötött életkor-összefüggéseket és összetett földrajzi mintázatokat is feltárt, ami a szerzők szerint jobban megérteti a környezeti hatások szerepét komplex tulajdonságokban.

    Miért fontos? A módszer, ha más adatkészleteken is beigazolódik, pontosabbá teheti a genetikai kockázati előrejelzéseket a személyre szabott orvoslásban.

    #poligénikus pontszám#UK Biobank
  10. Üzlet

    Cohere áttekintése: hogyan alkalmazzák a vállalatok a generatív AI-t

    A Cohere saját blogbejegyzésében áttekinti, hogy a generatív AI-modellek mára széles körben elérhetők a vállalatok számára, ám a cég szerint a vezetőknek nehéz elkülöníteni a valódi üzleti hasznot a túlzott várakozásoktól. A vállalat állítása szerint a technológia legfőbb üzleti alkalmazási területei közé tartozik a belső és külső tudásforrások keresése retrieval-augmented generation (RAG) módszerrel, valamint szöveges tartalmak – jelentések, marketingszövegek, összefoglalók, fordítások – létrehozása és átalakítása. A Cohere kiemeli továbbá a beszélgetőalapú asszisztensek szerepét ügyfélszolgálati, IT- és HR-támogatási feladatokban, amelyek rugalmasabban kezelik a szabadszavas kéréseket a hagyományos chatbotoknál. A bejegyzés gyakorlati bevezetési megközelítést is ígér, de ennek részletei a kivonatból nem derülnek ki.

    Miért fontos? A cikk egy AI-szolgáltató saját üzleti ajánlásait mutatja be arról, hol érdemes bevezetni a generatív AI-t a vállalati gyakorlatban.

    #Cohere#generatív AI

Napi összegzők

A nap összképe

A mai hírek két alapfeszültség köré rendeződnek: egyfelől az AI-modellek betanításához használt adatok szerzői jogi jogalapja egyre komolyabb jogi kockázatot jelent – a zenekiadók Anthropic elleni milliárdos pere és a LAION óriási, de jogi szempontból vitatott videó-adathalmaza ezt egyaránt illusztrálja. Másfelől az AI-ipar a puszta modellezésen túl egyre mélyebben hatol a fizikai világba: az Anthropic hardverszabvánnyal nyitna utat az AI-ügynökök laboratóriumi és gyári irányításához, míg az Nvidia a GPU-kat teljes adatközponti rendszerré bővíti. A kutatási oldal ezzel összhangban azt vizsgálja, hogyan tehető az AI megbízhatóbbá szakterületi feladatokban – legyen szó a nyelvi modellek szakirodalmi pontosságáról vagy a szabályalapú kémiai következtetésről –, miközben a FreeToken fejlesztői a nagy modellek fogyasztói hardverre hozását célozzák. Összességében az iparág egyidejűleg bővíti az AI működési terét és ütközik a jogi-társadalmi korlátokkal.

Témaszálak

Mi köti össze a mai híreket — a nap hírei a nagyobb témák köré rendezve.

Szerzői jogi csatározások a betanítási adatok körül

A Sony Music és Warner Chappell Anthropic elleni milliárdos pere, valamint a LAION 10 millió órás, nem kereskedelmi kutatásra korlátozott videó-adathalmaza egyaránt a betanítási adatok jogi kockázataira mutat rá. Mindkét eset azt jelzi, hogy az AI-fejlesztők és a tartalomtulajdonosok közötti konfliktus fokozódik.

AI a fizikai világban: rendszerszintű gondolkodás

Az Anthropic Model Hardware Standard szabványa az AI-ügynökök laboreszköz-irányítását célozza egységes felülettel, az Nvidia Vera Rubin architektúrája pedig GPU-n túli, teljes adatközponti rendszerben gondolkodik. Mindkettő azt jelzi, hogy az AI-ipar a szoftveres modellezés mellett a hardver- és rendszerintegráció felé mozdul el.

Megbízhatóság és elérhetőség kutatási kérdései

A járványmodellekre vonatkozó LLM-alapú szakirodalmi áttekintés, a ChemOntoRule szabályalapú kémiai rendszer és a FreeToken MoE-futtatási motor mind azt a kérdést boncolgatják, hogyan tehető az AI pontosabbá, ellenőrizhetőbbé, illetve olcsóbban hozzáférhetővé – de mindhárom eredmény nem lektorált vagy korai fázisban van.

Összefüggések korábbi napokkal

Hol folytatódnak a korábbi szálak — a mai hírek a megelőző napok eseményeihez kötve.

Mire figyelj

  • Érdemes figyelni, hogy az Anthropic elleni szerzői jogi perben a bíróság milyen ütemben halad, és a cég reagál-e nyilvánosan a zenekiadók állításaira, különösen a BitTorrent-letöltésekre vonatkozó vádakra.
  • A LAION videó-adathalmaz kutatói fogadtatása és az esetleges jogi kifogások – a hamburgi bírósági precedensre építve – megmutathatják, hogy a nem kereskedelmi kutatási célú hivatkozás mennyire tartható védelem.
  • Az Anthropic Model Hardware Standard nyílt forráskódú megjelenésének időzítése és a laborpartnerek visszajelzései jelezhetik, hogy a szabvány valós ipari elfogadást nyerhet-e.
  • A FreeToken inferenciamotorral kapcsolatban a független reprodukálhatóság lesz kulcskérdés: a nyílt forráskódú kód megjelenése után más kutatók megerősítik-e a leírt teljesítményelőnyöket fogyasztói hardveren.