2026. szeptember 3., csütörtök · Modellek

World Labs bemutatta az Atlas 3D-világmodellt

A Fei-Fei Li társalapította World Labs bemutatta az Atlas nevű AI-modellt, amely a cég állítása szerint néhány fotóból 3D jeleneteket generál, rekonstruál és szimulál. A vállalat szerint Atlas minden bemenetet – szöveget, képet, videót és 3D-adatot – közös térbeli koordinátarendszerbe helyez, amit „térbeli kontextusnak” neveznek, így megkülönbözteti a hagyományos, síkban gondolkodó nyelvi és videódiffúziós modellektől. A cég közlése szerint a kameramozgást geometriai bemenetként kezeli, ezért a felhasználók pontos nézőpontokat és útvonalakat adhatnak meg szöveges leírás helyett, és akár egyperces, 1440p felbontású videót is generálhat. World Labs azt is állítja, hogy a modell néhány, akár egy-két képből is valósághű jelenetrekonstrukcióra képes speciális eszközök nélkül. Fontos hangsúlyozni, hogy ezek jelenleg kizárólag a fejlesztő cég saját, független ellenőrzés nélküli állításai.

Miért fontos?

Ha a World Labs állításai igazolódnak, jelentős lépés lehet a térbeli, 3D-tudatos AI-modellek felé, amelyek meghaladhatnák a hagyományos videó- és nyelvi modellek korlátait.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 3., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

OpenAI kiadja az Astra modellt, amely önállóan tör fel rendszereket

Az OpenAI szerint a hamarosan érkező Astra az első modellje, amely elérte a cég „kritikus kiberbiztonsági” küszöbét: emberi irányítás nélkül talál és használ ki ismeretlen szoftverhibákat, állításuk szerint hibátlan pontszámot ért el az ExploitBench teszten, egy módosított vizsgálatban pedig két zero-day sebezhetőséget is feltárt – ezt független fél nem erősítette meg. A The Information egy meg nem nevezett forrására hivatkozva azt írja, hogy az Astra a jól követhető gondolatlánc helyett egy zártabb, úgynevezett looped transformer architektúrát is használhat, ami nehezebben monitorozható, ez aggodalmat keltett biztonsági kutatóknál, köztük Ryan Greenblattnál. Az OpenAI a kiadás előtt több hetes szünetet tartott, és extra gondolatlánc-monitorozást, illetve egy „misalignment monitor” nevű szűrőt épített be.

Az AWS elérhetővé tette a Claude Fable 5.1 modellt

Az AWS bejelentése szerint a Claude Fable 5.1 elérhető az Amazon Bedrocken és a Claude Platform on AWS szolgáltatáson keresztül. Az Anthropic állítása szerint a modell a legnehezebb érvelési teszteken – köztük versenymatematikai és tudományos feladatokon – jobban teljesít, mint elődje, a Fable 5, és megbízhatóbb a kódolási, kutatási és vállalati munkafolyamatokban. Mivel az Anthropic „Covered Model” kategóriába sorolta, a modellre kiterjesztett adatmegőrzési (akár 30 napos), biztonsági felülvizsgálati és hozzáférési szabályok vonatkoznak. Az Anthropic emellett bemutatta az „Enterprise Frontier Safeguards” nevű megoldást, amely a vállalatnak lehetőséget ad a legfejlettebb modellek használatára úgy, hogy adataik saját felügyelt felhőinfrastruktúrájukban maradjanak. A közlemény kizárólag az AWS és az Anthropic saját állításait tartalmazza, független teljesítménymérés nem szerepel benne.

Runway bemutatta a Solaris nevű, valós idejű felületgeneráló AI-t

A Runway bemutatta a Solaris nevű rendszert, amely a cég állítása szerint az általa „Interface World Model” néven elnevezett új kategória első tagja: nem kódot futtat, hanem képkockánként rendereli a felhasználói felületet, és valós időben reagál kattintásra, húzásra vagy hangparancsra. A Gen-4.5 videómodellre épülő Solaris 720p felbontásban jelenít meg interfészeket, és Runway szerint alkalmas lehet interaktív vásárlásra, bútor- és lakberendezési vizualizációra, valamint vizuális oktatóanyagokra. A cég állítása szerint célja, hogy a rögzített alkalmazások helyett a felhasználóhoz igazodó, dinamikus felületek jöjjenek létre, és egyben AI-ágensek betanítására is alkalmas eszköznek tekinti. Fontos korlátozás, hogy a szöveg megjelenítése még hibás, nincs képernyőolvasó-támogatás, ezért Runway maga is kutatási projektnek nevezi a rendszert.

Google bemutatta a Gemini 3.5 Transcribe beszédfelismerőt

A Google elindította a Gemini 3.5 Transcribe nevű valós idejű beszéd-szöveg átalakító modelljét, amely a vállalat szerint automatikusan felismer több mint 85 nyelvet, kiszűri a töltelékszavakat, javítja a nyelvbotlásokat, és önállóan formázza a szöveget. Google állítása szerint a szóhiba-arány streamelt hangnál 4,0, rögzített hangnál 2,6 százalék, a késleltetés pedig 70 százalékkal alacsonyabb az elődjéhez, a Chirp 3-hoz képest. A modell function calling funkción keresztül más Gemini-modelleknek adhat tovább feladatokat, például képgenerálást vagy webes keresést. Két felülettel érhető el: a Live API valós idejű streameléshez, az Interactions API pedig rögzített hanganyagok feldolgozásához beszélő-azonosítással és időbélyegekkel. A Google szerint már elérhető az AI Studio-ban, a Gemini Enterprise platformon, Androidon és macOS-en, Chrome-támogatás hamarosan jön.