OpenAI hivatalos közlése szerint a GPT-Live-1 nevű beszédmodell mostantól fejlesztői API-n keresztül is elérhető, és full-duplex módban működik, vagyis egyszerre képes beszélni és hallgatni. A modell már a ChatGPT-ben is fut, és a The Decoder cikke szerint fejlesztők különböző háttérmodellekkel párosíthatják a feladat jellegétől függően. Az OpenAI saját benchmarkjai alapján a GPT-Live-1 a full-duplex interakciós teszten 80,1 százalékot ér el a korábbi GPT-Realtime-2.1 45,4 százalékával szemben, a válaszadási késleltetés 1,4-ről 0,8 másodpercre csökkent, az eszközhívási pontosság pedig 60-ról 87 százalékra nőtt. A cikk szerint a Yelp már telefonos foglalások kezelésére használja a modellt, a vállalat CTO-ja, Alex Levy szerint javult a hívások kezelése. A használat percenként 0,05 dolláros díjjal jár, a modell tizenkét új hangot is kínál.
A Suno szerdán bemutatta v6 elnevezésű új zenegeneráló modellcsaládját, amelyet a cég állítása szerint a Warner Music Group, a BMG és a Believe licencelt zenei anyagaival tréningeztek. A vállalat szerint a v6 teljesen új adatkészletet használ, amely nem tartalmazza a korábbi modellek betanításához felhasznált adatokat, bár a pontos katalógusokról és a felhasznált mennyiségről nem közölt részleteket. Három változat érkezik: a fizetős előfizetőknek szánt v6 megbízható, kontrollálható kimenetet ígér, a szintén fizetős v6-wild kísérletezésre és váratlan eredményekre való, a mindenki számára ingyenes v6-mini pedig gyorsabb, egyszerűbb dalokat generál. A Suno a régebbi modelljeit teljesen leállítja. A The Decoder szerint a Warner peren kívüli megegyezés után partnerré vált, ám a Universal és a Sony továbbra is pert folytat a céggel szemben jogdíjügyben.
Meta bejelentette a Muse nevű személyes AI-ügynököt, amely a vállalat állítása szerint önállóan tud feladatokat elvégezni, például e-mailt küldeni, utazást foglalni vagy vásárlást intézni a Link by Stripe fizetési rendszeren keresztül. A Muse a cég Muse Spark nevű modelljére épül, és egy dedikált Muse Secure VM nevű virtuális gépen fut, amely a felhasználó adatait is tárolja. A termék kezdetben az Egyesült Államokban érhető el iOS-en, Androidon, a muse.ai oldalon és WhatsAppon keresztül, AI-szemüvegre később kerül. A TechCrunch szerint a bevezetés alig két héttel egy 18 milliárd dolláros többállami perbeli megegyezés után történt, ami felveti a bizalom kérdését, mivel a Muse email-, naptár-, fizetési és egyéb személyes adatokhoz kér hozzáférést. A Verge megjegyzi, hogy a Muse hasonló funkciókat kínál, mint az OpenAI, az Anthropic, a Microsoft és a Google versengő ügynökei.
A Meta Superintelligence Labs kiadta a Muse Voice Transcribe nevű valós idejű hangmodellt, amely beszédfelismerést, mondathatár-felismerést és akár 20 beszélő megkülönböztetését végzi külön rendszerek nélkül, egyetlen modellben. A modell a bejövő hangot 80 milliszekundumos darabokra bontja, és szavanként dinamikusan állítja a várakozási időt: nehezebb szavaknál tovább hallgat a pontosabb eredményért, a Meta állítása szerint ezt megerősítéses tanulással érték el. A cég szerint a rendszer több mint 70 nyelvet támogat, 25-öt mélyebben teszteltek, és nyelvek közötti váltást is kezel. A Meta 0,18 dolláros óradíjat közöl, ami állítása szerint olcsóbb, mint az OpenAI vagy az ElevenLabs megoldásai. A cikk szerint a független Artificial Analysis értékelés megerősítette a Meta pontossági állításait angol nyelven, bár a teljes független validáció részletei a forrásból nem derülnek ki.