2026. szeptember 14., hétfő · Modellek

ElevenLabs kiadta a Music v2.5 zenegeneráló modellt

Az ElevenLabs elérhetővé tette a Music v2.5 verziót az ElevenMusic alkalmazásban és API-n keresztül is. A cég állítása szerint a generált dalok most teljesebben és természetesebben szólnak, és egy 47 885 összehasonlító párból álló vak teszten a hallgatók többnyire a v2.5-öt részesítették előnyben, különösen R&B, soul, hiphop, rock és zenekari stílusokban. A felhasználók megtartják a saját számaik jogait, az ingyenes csomag napi öt veszteségmentes letöltést, a Pro csomag havi 400-at kínál, kereskedelmi felhasználás iparágtól és céltól függően engedélyezett. A cég szerint a modellt licencelt hangmintákon és zenéken tanították, részletek nélkül, ami megkülönbözteti a konkurens Sunótól, amelyet szerzői jogi engedély nélküli tanítás miatt pereltek be. A korábban bejelentett Universal Music Group-licencmegállapodás az ElevenLabs szerint csak jövőbeli, külön termékekre vonatkozik, a Music v2.5-re nem.

Miért fontos?

A modell azért lehet piaci előny, mert az ElevenLabs a Sunóval ellentétben licencelt zenei anyagra hivatkozik a tanítás forrásaként, ami elviekben csökkentheti a jogi kockázatot a felhasználók számára.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 14., hétfő napi AI összefoglaló része.

Kapcsolódó hírek

AllSpark nyílt keresőügynökei: Iris-mini és Iris-pro

A kínai AllSpark kutatócsoport két nyílt súlyú keresőügynököt tett közzé: az Iris-mini (35 milliárd paraméter) a Qwen3.6-35B-A3B, az Iris-pro (397 milliárd paraméter) a Qwen3.5-397B-A17B modellre épül, mindkettő 256 000 tokenes kontextusablakot kezel. A csapat állítása szerint ezek a maguk méretkategóriájában a legerősebb nyílt súlyú keresőügynökök, és a tréningadat más, korábban nem tanult feladatokon, például általános eszközhasználatnál is javította a teljesítményt. A tanítási kérdéseket a webes linkstruktúrából visszafejtve állították elő: egy kiinduló oldalból és kimenő linkjeiből fogalmi gráfot építettek, majd ebből olyan több lépéses kérdéseket generáltak, amelyek csak láncolt következtetéssel válaszolhatók meg. A megoldási útvonalakat egy erősebb tanármodell hozta létre, ezeket kétlépcsős szűrés (helyesség, ismétlődés, majd lépésenkénti bírálat) rostálta, mielőtt a modellt élő webes kereséssel szemben megerősítéses tanulással finomhangolták. Az eredményeket egy nem lektorált kutatási cikk ismerteti, amelyet maga az AllSpark csapat publikált.

Google bemutatta a TimesFM-3 idősor-előrejelző AI-modellt

A Google Research szerint új TimesFM-3 modellje egyetlen lépésben, nem pedig lépésenként jósolja meg a jövőbeli időbeli adatsorokat, mint például a napi eladási számokat, így a vállalat állítása szerint elkerülhető a korábbi verzióknál jellemző hibafelhalmozódás. A cég közlése szerint a Transformer-alapú modell 330 millió paraméterrel rendelkezik, és több mint egybillió valós és szintetikus adatpontból tanult, miközben zéró-shot módon, plusz tanítás nélkül alkalmazható új feladatokra. A Google bemutatója szerint a modell egyszerre tud kezelni több összefüggő változót – például különböző fagylaltízeket –, korábbi tényezőket, mint a múltbeli forgalmat, valamint ismert jövőbeli eseményeket, például tervezett kedvezményeket vagy időjárás-előrejelzéseket. Az eredmény minden időlépésre kilenc értéket ad, hogy a bizonytalanságot és a lehetséges tartományt is jelezze, de ezek egyelőre a fejlesztő cég saját közlésén alapuló állítások, független teszteredmény nem szerepel a forrásban.

OpenAI API-n keresztül is elérhetővé teszi az élő hangmodelljét

OpenAI hivatalos közlése szerint a GPT-Live-1 nevű beszédmodell mostantól fejlesztői API-n keresztül is elérhető, és full-duplex módban működik, vagyis egyszerre képes beszélni és hallgatni. A modell már a ChatGPT-ben is fut, és a The Decoder cikke szerint fejlesztők különböző háttérmodellekkel párosíthatják a feladat jellegétől függően. Az OpenAI saját benchmarkjai alapján a GPT-Live-1 a full-duplex interakciós teszten 80,1 százalékot ér el a korábbi GPT-Realtime-2.1 45,4 százalékával szemben, a válaszadási késleltetés 1,4-ről 0,8 másodpercre csökkent, az eszközhívási pontosság pedig 60-ról 87 százalékra nőtt. A cikk szerint a Yelp már telefonos foglalások kezelésére használja a modellt, a vállalat CTO-ja, Alex Levy szerint javult a hívások kezelése. A használat percenként 0,05 dolláros díjjal jár, a modell tizenkét új hangot is kínál.

Suno bemutatta v6 zenei AI-modelljét lemezkiadói licenccel

A Suno szerdán bemutatta v6 elnevezésű új zenegeneráló modellcsaládját, amelyet a cég állítása szerint a Warner Music Group, a BMG és a Believe licencelt zenei anyagaival tréningeztek. A vállalat szerint a v6 teljesen új adatkészletet használ, amely nem tartalmazza a korábbi modellek betanításához felhasznált adatokat, bár a pontos katalógusokról és a felhasznált mennyiségről nem közölt részleteket. Három változat érkezik: a fizetős előfizetőknek szánt v6 megbízható, kontrollálható kimenetet ígér, a szintén fizetős v6-wild kísérletezésre és váratlan eredményekre való, a mindenki számára ingyenes v6-mini pedig gyorsabb, egyszerűbb dalokat generál. A Suno a régebbi modelljeit teljesen leállítja. A The Decoder szerint a Warner peren kívüli megegyezés után partnerré vált, ám a Universal és a Sony továbbra is pert folytat a céggel szemben jogdíjügyben.