2026. július 24., péntek · Eszközök

Az NVIDIA Nemotron 3 Nano modell testreszabása percek alatt elvégezhető a Prime Intellect Lab platformon

Az NVIDIA technikai blogján közzétett útmutató szerint a Nemotron 3 Nano nyílt modell testreszabása a Prime Intellect Lab platformmal mindössze öt perc helyi beállítást igényel. A bemutatott munkafolyamat három lépésből áll: kiindulási teljesítmény mérése, megerősítéses tanulás (reinforcement learning) futtatása egy Python matematikai környezetben, majd az eredmények kiértékelése – a folyamat végén letölthető LoRA adapter jön létre. Az NVIDIA szerint a testreszabás után jelentős pontosságjavulás érhető el. A blogbejegyzés kiemeli, hogy ugyanez a folyamat alkalmazható a nagyobb Nemotron 3 Super és Ultra modellekre is, a nyílt súlyok, adatok és tanítási receptek pedig a reprodukálhatóságot és az átláthatóságot szolgálják. A megoldás lényege, hogy az infrastrukturális és szaktudásbeli akadályokat a felhőalapú platform nagymértékben csökkenti.

Miért fontos?

A nyílt modellek testreszabásának belépési küszöbe tovább csökken, ami szélesebb fejlesztői kör számára teszi elérhetővé a célfeladatra szabott LLM-eket.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 24., péntek napi AI összefoglaló része.

Kapcsolódó hírek

NVIDIA Nemotron 3 Ultra teljesítménye javítható LangChain harness profilok segítségével, finomhangolás nélkül

Az NVIDIA technikai blogja bemutatja, hogyan lehet a Nemotron 3 Ultra nyílt forráskódú modell ágensalapú rendszerekben elért pontosságát a LangChain Deep Agents harness profilok testre szabásával növelni, anélkül hogy finomhangolásra lenne szükség. A módszer lényege egy iteratív fejlesztési ciklus: kiértékelés futtatása, hibaelemzés, harness profil módosítások (például promptváltoztatások, middleware beillesztése), javítás ellenőrzése, majd újrafuttatás. Az NVIDIA szerint ez lehetővé teszi, hogy a modell megközelítse a zárt, drágább frontier modellek pontosságát. Az automatizálást az úgynevezett agentic proposer.

AI-ügynökök tesztelése: a demótól a termelésig

Zhou Yu, a Columbia Egyetem professzora és az Arklex AI alapítója egy InfoQ-előadásban azt állította, hogy a mai AI-ügynökök mintegy 95%-a megreked a demó fázisban, és nem jut el a valós termelési használatig. Állítása szerint ennek oka a megbízhatósági és megfelelőségi problémák, amelyeket szimulációalapú teszteléssel lehet kezelni. A bemutatott módszer szintetikus felhasználói profilokat, úgynevezett trajectory entropy metrikát és automatizált CI/CD folyamatokat alkalmaz a többfordulós, eszközhasználatot is végző párbeszéd-alapú ügynökök kiértékelésére, még a telepítés előtt felderítve a hibás eseteket. Az előadó szerint ezt a megközelítést saját kutatócsoportjában és az Arklex AI-nál alkalmazzák, célként az önmagukat tanuló munkafolyamatok skálázását nevezve meg termelési környezetben.

Google nyílt forráskódúvá tette a Mantis AI-sebezhetőségvizsgáló keretrendszert

A Google nyílt forráskódúként közzétette a Mantis nevű AI-ügynök keretrendszert, amely a vállalat állítása szerint automatizálja a szoftveres sebezhetőségek azonosítását, validálását, reprodukálását és javítását. A Google szerint a hagyományos AI-alapú kódvizsgálat gyakran hallucinált hibákat produkál, és a valós találatok aránya 7 százalék alatt marad, ezért a Mantis kritikus- és felülvizsgáló-ügynököket, valamint homokozó (sandbox) környezetben végzett reprodukciót kombinál a megbízhatóbb eredmény érdekében. A cég közlése szerint a rendszer a fájlokat hierarchikus fastruktúrába foglalja, ami 85 százalékkal csökkenti a tokenfelhasználást a szerkezeti kontextus megőrzése mellett. A Mantis moduláris felépítésű, több mint 15 eszközt tartalmaz, stratéga- és kutatóügynökökkel egészül ki, és több különböző AI-modell kombinálását is támogatja a különböző feldolgozási fázisokban.

Figma: AI-ügynökök gyorsítják a biztonsági riasztások kivizsgálását

A Figma mérnökcsapata saját beszámolója szerint AI-ügynököket épített biztonsági csapata számára, amelyek riasztásokat vizsgálnak ki, korábbi incidenseket keresnek vissza, rendszereket ellenőriznek, és kódjavításokat is előkészítenek. A rendszer Panther SIEM-re épül, az AWS, Okta, GitHub, GCP és osquery mellett száznál több forrást kérdez le, emellett AWS Bedrock Knowledge Bases, Amazon Kendra, Tines és Snowflake-alapú eszközöket is használ. A Figma állítása szerint ez mintegy 70 százalékkal csökkentette az összetett riasztások megoldási idejét, és 20 százalékkal kevesebb ügyeleti riasztást eredményezett. A cikk szerint a rendszer memóriája – korábbi esetek, viselkedési útmutatók, megtanult adatbázis-struktúrák – kulcsszerepet játszott, miközben emberi felülvizsgálat és beépített korlátok, például az alapból piszkozatként létrejövő kódjavaslatok, biztosítják a biztonságot.