2026. augusztus 15., szombat · Eszközök

Amazon Nova Forge: egyéni jutalomfüggvények többlépéses RL-hez

Az AWS hivatalos blogbejegyzése szerint az Amazon Nova Forge platformon a megerősítéses finomhangolás (RFT) középpontjában az egyéni jutalomfüggvény áll, amely eldönti, mit tanul meg a modell többlépéses, ágensszerű feladatokban, például eszközhasználat vagy hibajavítás közben. A cikk bemutatja, hogyan futtatható a jutalomlogika saját környezetben (Bring Your Own Orchestration), miközben a Nova Forge kezeli a lépések közti üzenetváltást és állapotot; emellett elérhetővé vált egy szerver nélküli, több lépésre optimalizált RL opció is. A vállalat kiemeli, hogy egy rosszul megtervezett jutalom úgy taníthat téves viselkedést, hogy a tanulási görbék közben egészségesnek tűnnek, és egy valós esetet is bemutatnak, ahol a legnagyobb súlyú jutalomkomponens semmilyen tanulási jelet nem adott.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A jutalomfüggvény hibás tervezése láthatatlanul félrevezetheti az ágensmodellek tanítását, ezért az AWS gyakorlati útmutatása közvetlen hatással van a vállalati AI-fejlesztők munkájára.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 15., szombat napi AI összefoglaló része.

Helyesbítés · 2026. október 1., csütörtök

Helyesbítés (2026-09-20): a hírhez utólag hozzáfűztük a nem lektorált (preprint) státusz jelzését, mert a megjelenéskor ez lemaradt. A hír címe, összefoglalója és forrásai változatlanok. Helyesbítés (2026-10-01): a hír alól eltávolítottuk az arXiv 2608.12995 hivatkozást, mert az egy kikötői hajóüldözésről szóló, ide nem tartozó cikk; vele együtt kikerült a „Miért fontos?”-ból a „A mögöttes eredményt leíró tanulmány preprint” mondat, mert erre a téves hivatkozásra épült. A hír forrása az AWS blogbejegyzése.

Kapcsolódó hírek

Az AWS bemutatta a SageMaker AI többfordulós megerősítéses tanulását kereső ügynökökhöz

Az Amazon AWS hivatalos blogbejegyzésben mutatta be, hogyan finomhangolhatók kereső ügynökök (search agent) többfordulós megerősítéses tanulással (MTRL) a SageMaker AI platformon. A cég állítása szerint a hagyományos felügyelt finomhangolás drága szakértői demonstrációkat igényel, az egylépéses megerősítéses tanulás pedig figyelmen kívül hagyja a több lépésben egymásra épülő döntések közötti összefüggéseket. Az AWS szerint az MTRL ezzel szemben a teljes döntési sorozatot optimalizálja, és a végeredmény minősége alapján ad visszajelzést, így egy kisebb, specializált modell is elérheti egy frontier modell megbízhatóságát, miközben gyorsabb és olcsóbb marad a futtatása. A bejegyzés a módszer működését és a visszakeresési minőségben mért eredményeket ismerteti, konkrét számszerű teljesítményadatok nélkül.

AWS: új aws-ai-ml skill a SageMaker AI következtetés-optimalizáláshoz

Az AWS bemutatta az aws-ai-ml nevű új képességet, amely az Agent Toolkit for AWS részeként érhető el, és az Amazon SageMaker AI optimalizált generatív AI következtetési szolgáltatásához kapcsolódik. A vállalat állítása szerint a Model Context Protocol (MCP) protokollt támogató kódoló ügynökök, például a Kiro, a Claude Code és a Codex, ezzel a bővítménnyel mélyreható szakértelmet kapnak a következtetési végpontok teljesítményének benchmarkolásához, a telepítési konfigurációk ajánlásához és a futtatási eredmények összehasonlításához. A skill futtatható SageMaker Python SDK v3 kódot generál, amelyet a felhasználó a saját környezetében ellenőrizhet és módosíthat, mielőtt lefuttatná. Az AWS szerint a telepítés a helyi gépen vagy a SageMaker Studio JupyterLab térben is elvégezhető, és a cég állítása szerint mindössze 10 perc alatt eljuthatunk egy működő beszélgetésig.

Pizza Bot: nyílt forráskódú postaláda AI-ügynököknek az AWS-től

AWS-fejlesztők nyílt forráskódúvá (Apache 2.0 licenc alatt) tették a Pizza Bot nevű, önhosztolt alkalmazást, amely e-mail-kliens stílusú felületen kezeli a háttérben futó AI-ügynökök munkáját. A rendszer kliens-szerver architektúrán alapul: az ügynökök ütemezetten vagy webhookra indulva dolgoznak, feladatokat delegálhatnak specializált munkásoknak, és emberi jóváhagyásra várhatnak fontosabb lépések előtt. A fejlesztők, Joseph Dolivo (principal technologist) és Igor Fil (solutions architect) szerint a postaláda-metafora azért illik, mert egy szál olyan munkaegység, amihez visszatérünk, nem olyan munkamenet, amit folyamatosan figyelni kell. A rendszer több modellszolgáltatót és MCP-szervert támogat, miközben az ügynök állapotát, szálait és naplóit helyben, a felhasználó gépén tárolja, és csak a kiválasztott modellszolgáltatónak, illetve az engedélyezett MCP-szervereknek küld adatot. A projekt a fejlesztők elmondása szerint egy 2025 áprilisában indult, CRM-naplózást automatizáló belső eszközből, a „JoeBot”-ból nőtte ki magát.

Meta megnyitotta a Muse AI-eszközök fejlesztői kódját

A Meta nyílt forráskóddal (Apache 2.0 licenc) elérhetővé tette a Muse Gadgets projektet, amellyel bárki saját hardvert építhet AI-ügynökéhez, a Muse-hoz. A csomag ESP32-alapú firmware-t és Linux SDK-t tartalmaz, így a Muse megjeleníthető például színes e-ink kijelzőn, HDMI-stickre töltve TV-n, vagy érintőképernyős mini eszközön; a fejlesztők munkáját Discord-közösség segíti. A Meta saját eszközt is készített: a Muse Home Link nevű, USB-C-s gadget okosotthoni eszközöket (TV, hangszóró, nyomtató) tud vezérelni a Muse-on keresztül, ebből 5000 darabot gyártottak, és előfizetőknek ingyen adják, amíg a készlet tart. A szállítás a tervek szerint hetek, illetve e hónap folyamán indul. A lépés a Meta idei hetén bejelentett Muse for Small Business és az új Meta Enterprise Platform üzletág mellé illeszkedik, amelyekkel a cég a Muse-t vállalati ügyfelek felé is terjeszti.