AI-modell · Modellek
Stable Diffusion
Nyílt forráskódú szöveg-kép generáló diffúziós modell, amelyet a Stability AI adott ki.
Más néven: SD, Stable Diffusion XL, SDXL
A Stable Diffusion egy latens diffúziós modell, amely szöveges leírásból (prompt) képes fotórealisztikus vagy stilizált képeket generálni. A Stability AI, a Runway és a müncheni CompVis kutatócsoport együttműködésében készült, és nyilvánosságra hozatalával az egyik első széles körben elérhető, nyílt forráskódú, nagy teljesítményű képgeneráló modellé vált. Súlyai szabadon letölthetők, ami lehetővé tette, hogy fejlesztők, kutatók és hobbisták saját gépükön vagy felhőben futtassák, finomhangolják és beépítsék különféle alkalmazásokba.
A modell működése azon alapul, hogy egy zajból kiinduló képet lépésről lépésre "tisztít", a szöveges promptot egy nyelvi enkóder (jellemzően CLIP-alapú) segítségével vezérli a folyamatot, mindezt egy tömörített latens térben, ami jelentősen csökkenti a számítási igényt a korábbi diffúziós megközelítésekhez képest. Ez tette lehetővé, hogy viszonylag szerény hardveren is futtatható legyen, szemben a zárt, csak API-n keresztül elérhető versenytársakkal.
A Stable Diffusion megjelenése átalakította a generatív képalkotás ökoszisztémáját: köré épült a ControlNet, a LoRA-alapú finomhangolás és számtalan felhasználói felület (pl. Automatic1111, ComfyUI), miközben szerzői jogi és etikai vitákat is kirobbantott a betanítási adatok felhasználása kapcsán. A modell több generáción át fejlődött (SD 1.x, 2.x, SDXL, SD3), és mérföldkőnek számít a nyílt AI-modellek terjedésében.