2026. július 20., hétfő · Kutatás
A Google DeepMind GenCeption rendszere videógenerátorból csinál univerzális látómodellt
A Google DeepMind kutatói kifejlesztették a GenCeption nevű rendszert, amely az Alibaba nyílt forráskódú Wan2.1 videómodelljét klasszikus számítógépes látási feladatokra – mélységbecslésre, szegmentálásra és 3D-s pózbecslésre – használja egyetlen előrecsatolt lépésben. A modell kis mennyiségű szintetikus videón tanult, mégis felveszi a versenyt specializált modellekkel, és valós felvételekre, valamint korábban nem látott kategóriákra is általánosít. A szerzők szerint ez a vitatott elképzelést támasztja alá, miszerint a videógenerátorok univerzális világmodellként szolgálhatnak. A tanulmány nem lektorált, eredményeit független szakértői vizsgálat még nem erősítette meg.
Miért fontos?
Egyetlen előtanított videómodell potenciálisan kiválthatja a számítógépes látás több különálló, specializált rendszerét.
Források
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 20., hétfő napi AI összefoglaló része.