AI-fogalom · Modellek
Multimodális modell
Olyan mesterséges intelligencia modell, amely egyszerre több adattípust – például szöveget, képet, hangot vagy videót – képes értelmezni és generálni.
Más néven: Multimodal model, Multimodal AI, Multimodális mesterséges intelligencia, Vision-language modell, Több modalitású modell
A multimodális modell olyan gépi tanulási rendszer, amely nem egyetlen adatformátumra, hanem többfélére – tipikusan szövegre, képre, hangra vagy videóra – egyszerre képes reagálni és azokat közösen értelmezni. Ezzel szemben az unimodális modellek csak egyféle bemenetet kezelnek, például kizárólag szöveget vagy kizárólag képet. A multimodalitás azt jelenti, hogy a modell képes összekapcsolni a különböző érzékelési csatornákból származó információt, hasonlóan ahhoz, ahogyan az ember is egyszerre lát, hall és olvas.
A működés alapja, hogy a különböző típusú adatokat egy közös, absztrakt reprezentációs térbe alakítják, ahol a szöveges és vizuális (vagy hangbeli) információk összevethetővé és kombinálhatóvá válnak. Ezt gyakran nagy mennyiségű, párosított adaton – például képaláírásokon vagy videó-szöveg párokon – történő tanítással érik el. Így a modell megtanulja, hogy egy adott kép tartalma milyen szavakkal írható le, vagy hogy egy hangfelvétel milyen jelentést hordoz szöveges kontextusban.
A multimodális modellek jelentősége abban rejlik, hogy sokkal gazdagabb, valósághűbb feladatokat képesek megoldani, mint az egymodalitású társaik. Tipikus alkalmazásuk a képek szöveges leírása, vizuális kérdés-válaszolás, hangalapú asszisztensek, videótartalom-elemzés vagy olyan chatbotok, amelyek képesek fájlokat, fotókat és szöveges üzeneteket egyaránt feldolgozni. Ez a képesség egyre inkább alapkövetelménnyé válik a modern, több érzékszervi csatornát kezelő AI-rendszerekben.