AI-fogalom · Modellek

Multimodális modell

Olyan mesterséges intelligencia modell, amely egyszerre több adattípust – például szöveget, képet, hangot vagy videót – képes értelmezni és generálni.

Más néven: Multimodal model, Multimodal AI, Multimodális mesterséges intelligencia, Vision-language modell, Több modalitású modell

A multimodális modell olyan gépi tanulási rendszer, amely nem egyetlen adatformátumra, hanem többfélére – tipikusan szövegre, képre, hangra vagy videóra – egyszerre képes reagálni és azokat közösen értelmezni. Ezzel szemben az unimodális modellek csak egyféle bemenetet kezelnek, például kizárólag szöveget vagy kizárólag képet. A multimodalitás azt jelenti, hogy a modell képes összekapcsolni a különböző érzékelési csatornákból származó információt, hasonlóan ahhoz, ahogyan az ember is egyszerre lát, hall és olvas.

A működés alapja, hogy a különböző típusú adatokat egy közös, absztrakt reprezentációs térbe alakítják, ahol a szöveges és vizuális (vagy hangbeli) információk összevethetővé és kombinálhatóvá válnak. Ezt gyakran nagy mennyiségű, párosított adaton – például képaláírásokon vagy videó-szöveg párokon – történő tanítással érik el. Így a modell megtanulja, hogy egy adott kép tartalma milyen szavakkal írható le, vagy hogy egy hangfelvétel milyen jelentést hordoz szöveges kontextusban.

A multimodális modellek jelentősége abban rejlik, hogy sokkal gazdagabb, valósághűbb feladatokat képesek megoldani, mint az egymodalitású társaik. Tipikus alkalmazásuk a képek szöveges leírása, vizuális kérdés-válaszolás, hangalapú asszisztensek, videótartalom-elemzés vagy olyan chatbotok, amelyek képesek fájlokat, fotókat és szöveges üzeneteket egyaránt feldolgozni. Ez a képesség egyre inkább alapkövetelménnyé válik a modern, több érzékszervi csatornát kezelő AI-rendszerekben.

← Vissza a fogalomtárhoz