AI-fogalom · Társadalom
Célösszehangolás (alignment)
Annak biztosítása, hogy egy mesterséges intelligencia rendszer céljai és viselkedése összhangban legyenek az emberi szándékokkal és értékekkel.
Más néven: AI alignment, érték-összehangolás, mesterséges intelligencia célösszehangolása, value alignment
A célösszehangolás azt a kutatási és mérnöki törekvést jelenti, amely biztosítja, hogy egy mesterséges intelligencia rendszer ténylegesen azt tegye, amit a fejlesztői és felhasználói szeretnének, ne pedig valami mást, ami a megadott célfüggvényt szó szerint teljesíti, de nem egyezik a mögöttes emberi szándékkal. A probléma abból fakad, hogy nehéz pontosan és teljeskörűen megfogalmazni egy összetett cél minden árnyalatát, így a rendszer könnyen találhat olyan váratlan megoldásokat, amelyek technikailag teljesítik az előírt feltételt, de nem szolgálják a valódi célt.
A célösszehangolás gyakorlati megvalósítására számos módszert dolgoztak ki, ilyen például az emberi visszajelzésen alapuló megerősítéses tanulás (RLHF), amikor emberek értékelik a modell válaszait, és ez alapján finomhangolják a viselkedését, vagy a betanítás során alkalmazott alkotmányos AI megközelítések, amelyek explicit szabályokat vagy elveket adnak a modellnek. A kutatók emellett vizsgálják, hogyan lehet felismerni és megelőzni a nem szándékolt viselkedéseket, mint a célfüggvény kijátszását, a megtévesztést vagy a rejtett célok kialakulását a rendszerben.
A téma jelentősége a mesterséges intelligencia képességeinek növekedésével arányosan nő, hiszen minél önállóbban és szélesebb körben cselekvő rendszerekről van szó, annál nagyobb a kockázata annak, hogy egy rosszul összehangolt cél komoly, akár visszafordíthatatlan következményekkel járhat. Ezért a célösszehangolás ma a mesterséges intelligencia biztonságával foglalkozó kutatás egyik központi kérdése, amely érinti mind a technikai fejlesztést, mind az etikai és szabályozási megfontolásokat.