AI-fogalom · Kutatás

Embedding (beágyazás)

Szavakat, mondatokat vagy más adatokat számokból álló vektorokká alakító technika, amely megőrzi a köztük lévő jelentésbeli hasonlóságot.

Más néven: vektoros beágyazás, word embedding, vector embedding, szóbeágyazás, embedding vektor

Az embedding egy olyan eljárás, amely szöveget, képet vagy más típusú adatot egy rögzített hosszúságú számvektorrá alakít úgy, hogy a hasonló jelentésű vagy hasonló tulajdonságú elemek a vektortérben egymáshoz közel helyezkedjenek el. Például a „kutya” és a „kölyökkutya” szavak beágyazása közelebb esik egymáshoz, mint a „kutya” és a „autópálya” szavaké, mert a modell megtanulja, hogy ezek a fogalmak jelentésben rokonok.

A beágyazásokat gépi tanulási modellek, jellemzően neurális hálózatok állítják elő nagy mennyiségű szöveges vagy egyéb adaton való tanítás során. A tanítás célja, hogy a hálózat olyan vektorreprezentációkat tanuljon meg, amelyek hasznosak a nyelv szerkezetének, kontextusának és jelentésének megragadásához. Ezek a vektorok jellemzően több száz vagy több ezer dimenzióból állnak, és bár az egyes dimenziók önmagukban nem feltétlenül értelmezhetők emberi fogalmakkal, együttesen gazdag jelentésbeli információt kódolnak.

Az embeddingek kulcsszerepet játszanak a modern mesterséges intelligencia számos alkalmazásában. A keresőmotorok és ajánlórendszerek szemantikai keresésre használják őket, hogy ne csak a pontos kulcsszóegyezéseket, hanem a jelentésbeli hasonlóságot is figyelembe vegyék. A nagy nyelvi modellek belső működésének is alapját képezik: a bemeneti szöveget beágyazásokká alakítják, mielőtt azokat a hálózat további rétegei feldolgoznák. A visszakereséssel kiegészített generálás (RAG) rendszerekben az embeddingek teszik lehetővé, hogy a releváns dokumentumrészleteket gyorsan megtaláljuk egy vektoradatbázisban.

Az embedding fogalma nem csak szövegre korlátozódik: képek, hangok, videók vagy akár felhasználói viselkedési adatok is átalakíthatók vektoros reprezentációvá, lehetővé téve a különböző adattípusok közötti hasonlóság mérését vagy akár a köztük lévő kapcsolatok modellezését, például kép és szöveg összekapcsolását multimodális rendszerekben.

← Vissza a fogalomtárhoz