AWS ukázalo, ako navrhovať odmeny pre viac-krokový tréning agentov v Nova Forge
Nový technický postup AWS rozoberá kompozitné odmeny pre viac-krokové reinforcement fine-tuning úlohy. Upozorňuje, že aj zdanlivo zdravý tréning môže ignorovať kľúčovú zložku odmeny, ak medzi odpoveďami nevytvára merateľný rozdiel.
Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.
- Typ zdroja
- Oficiálny zdroj
- Zdroj / autorita
- Amazon Web Services
Ako vznikol tento text
Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.
Text je zaradený v sekcii AI produkty a opiera sa o 2 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.
AWS zverejnilo technický postup pre návrh vlastných odmeňovacích funkcií pri viac-krokovom reinforcement fine-tuningu modelov Amazon Nova. Text sa sústreďuje na jednu z najcitlivejších častí tréningu agentov: prevod požadovaného správania na číselný signál, ktorý optimalizačný algoritmus skutočne dokáže použiť. Nesprávne navrhnutá odmena môže podľa AWS model systematicky učiť neželané správanie, hoci súhrnná tréningová krivka vyzerá bez problémov.
Reinforcement fine-tuning sa od supervised fine-tuningu líši tým, že nepotrebuje iba zbierku ukážkových odpovedí s vopred pripraveným postupom. Model generuje vlastné riešenia a tréning ich hodnotí pomocou definovaných signálov. Pri viac-krokových úlohách sa nehodnotí jedna odpoveď, ale celá trajektória: séria otázok, nástrojových volaní, pokusov, opráv a konečný výsledok. To je dôležité najmä pri agentoch, ktoré majú vedieť požiadať o doplnenie informácií, vykonať kód alebo sa zotaviť z chyby.
Nova Forge pri opísanom postupe používa Group Relative Policy Optimization, teda GRPO. Pre rovnakú úlohu vytvorí skupinu viacerých behov modelu a odmeňovacia funkcia ich zoradí. Aktualizácia modelu nevychádza iba z absolútnej výšky odmeny, ale z normalizovaného rozdielu medzi riešeniami v rovnakej skupine. Z toho vyplýva zásadné obmedzenie: ak niektorá zložka nadobúda pri všetkých riešeniach rovnakú hodnotu, nevytvára výhodu ani gradient a model sa z nej nič nenaučí, nech má v súčte akokoľvek vysokú váhu.
AWS pri viac-krokovom tréningu využíva režim Bring Your Own Orchestration. Nova Forge koordinuje odovzdanie behov a tréning, zatiaľ čo zákaznícke prostredie spravuje stav konverzácie, používateľský simulátor, vykonávanie kódu a overovanie výsledkov. Prostredie následne vracia celkovú hodnotu aggregate_reward_score a voliteľné čiastkové metriky. AWS ponúka aj serverless variant viac-krokového RL, ktorý je podľa firmy všeobecne dostupný, publikovaný príklad však používa zákazníkom spravovanú cestu BYOO.
Ukážková úloha trénuje Amazon Nova Lite 2.0 na spoluprácu pri programovaní. Dataset obsahuje 500 odlišných úloh, pričom model najskôr dostane zámerne neúplné zadanie. Simulovaný používateľ pozná úplnú špecifikáciu a chýbajúci detail prezradí iba vtedy, keď sa model opýta. Agent si preto musí vybrať medzi doplňujúcou otázkou a okamžitým odovzdaním kódu. Ak odošle kód, epizóda sa skončí a výsledok sa vyhodnotí pomocou skrytých jednotkových testov.
Kompozitná odmena kombinuje štyri signály. Správnosť má váhu 1,0 a zodpovedá podielu úspešných skrytých testov. Správanie „opýtal sa pred programovaním“ má váhu 0,6; najvyššie hodnotenie získava otázka hneď v prvom kroku, nižšie neskoršia otázka. Okamžité hádanie bez otázky prináša penalizáciu s váhou 0,4. Posledná zložka s váhou 0,2 penalizuje slučku, ak sú posledné dva kroky podobné na viac než 80 percent. Cieľom nie je odmeniť iba finálny kód, ale oddeliť užitočné stratégie od hádania a opakovania.
Príklad zároveň ukazuje slabiny hustých behaviorálnych odmien. Model sa môže rýchlo naučiť položiť akúkoľvek otázku, pretože za ňu získava ľahko dostupný signál, no nemusí sa zlepšiť v riešení samotnej úlohy. Ak behaviorálna zložka nasýti tréning skôr než riedka odmena za správnosť, výsledný agent môže formálne dodržiavať požadovaný postup bez rastu kvality výstupu. AWS preto odporúča sledovať zložky oddelene a podľa potreby znížiť váhu nasýteného signálu alebo zvýšiť význam konečného výsledku.
Najdôležitejšie prevádzkové odporúčanie sa týka variability v rámci skupiny. Nestačí merať priemer každej odmeny ani celkovú tréningovú krivku. Tím má sledovať aj smerodajnú odchýlku jednotlivých zložiek medzi riešeniami rovnakého zadania. Hodnota blízka nule znamená, že daná zložka neprispieva k učeniu. V reálnom behu opísanom AWS zostala najvyššie vážená správnosť bez účinku, pretože overovací mechanizmus v praxi nespúšťal modelom vytvorený výstup tak, ako autori predpokladali.
AWS odporúča čítať prepisy behov zoradené podľa skúmanej zložky, nie iba podľa celkového skóre, a vykonávať ablačné skúšky. Ak odstránenie odmeny nič nezmení, pravdepodobne už predtým nevytvárala tréningový signál. Podobne treba overiť, či podmienka získania odmeny nie je nedosiahnuteľná, či jedna hustá zložka nepotláča inú a či model nenašiel jednoduchú skratku. Praktický význam má teda skôr pozorovateľnosť každej časti odmeny než ďalšia komplikácia optimalizačného algoritmu.
Samostatnou témou je bezpečné vykonávanie kódu vytvoreného modelom. AWS výslovne odporúča izolované prostredie bez prístupových údajov a siete, s limitmi zdrojov a s overovačmi, ktoré model nedokáže sfalšovať. Pri programovacích úlohách majú pomôcť náhodné kontrolné hodnoty a kontrola počtu testov. Kód agenta treba považovať za neoverený vstup aj vtedy, keď vzniká vo vnútri tréningovej infraštruktúry.
Pre tímy vyvíjajúce agentov je podstatné, že viac-krokový reinforcement fine-tuning nie je automatickou cestou k lepšiemu správaniu. Model optimalizuje presne to, čo dokáže odmeňovacia funkcia odlíšiť, nie pôvodný zámer jej autora. Výsledok preto závisí od kvality simulácie, testov, bezpečného sandboxu a metrík rovnako ako od samotného modelu. Postup AWS je viazaný na Nova Forge, SageMaker HyperPod a zákaznícke prostredie, no princíp kontroly variability každej zložky platí všeobecne pre skupinové RL metódy.
Zdroje