Nový prehľad spája ústavy, rubriky a procesnú spätnú väzbu pri trénovaní LLM
Prehľad prijatý na Findings of EMNLP 2026 zjednocuje metódy, ktoré nahrádzajú jedinú odmenu štruktúrovanými kritériami. Upozorňuje aj na významový posun a zneužívanie jazyka rubrík.
Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.
- Typ zdroja
- Výskumná práca
- Zdroj / autorita
- Zifei Shan a Fangning Shao
Ako vznikol tento text
Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.
Text je zaradený v sekcii AI výskum a opiera sa o 4 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.
Nová prehľadová práca autorov Zifeia Shana a Fangninga Shaa navrhuje spoločný rámec pre posilňované učenie jazykových modelov riadené rubrikami. Text zverejnený na arXiv a prijatý na Findings of EMNLP 2026 vychádza z problému, že tradičná spätná väzba často stlačí kvalitu odpovede do jediného čísla. Jedna skalárna odmena však nedokáže transparentne oddeliť faktickú správnosť, bezpečnosť, užitočnosť, štýl či kvalitu jednotlivých krokov. Rubrika namiesto toho zapisuje viac kritérií prirodzeným jazykom a môže ich prispôsobiť konkrétnej úlohe. Autori prepájajú konštitučné pravidlá, rubriky pre jednotlivé prípady, procesný dohľad aj samostatne sa vyvíjajúce hodnotiace schémy do jednej taxonómie.
Od jedného skóre k štruktúrovanému hodnoteniu
Pri klasickom RLHF ľudia porovnávajú odpovede a preferencie sa použijú na vytvorenie odmeňovacieho modelu. Výsledný signál môže byť účinný, ale často neukazuje, prečo jedna odpoveď vyhrala. Dve odpovede môžu dostať podobné skóre, hoci jedna je vecná, no neúplná a druhá plynulá, no obsahuje neoverené tvrdenie. Rubrika rozkladá hodnotenie na pomenované dimenzie alebo kontrolné body. Odmeňovací model potom nemusí iba predpovedať všeobecnú ľudskú preferenciu; môže kontrolovať splnenie konkrétnych požiadaviek. Takýto rozklad sľubuje lepšiu auditovateľnosť, ale zároveň presúva významnú časť návrhu systému do textu kritérií a spôsobu, akým sa aplikujú.
Prehľad používa bayesovskú interpretáciu. Konštitúciu opisuje ako predchádzajúce rozdelenie nad možnými hodnotiacimi kritériami, teda všeobecný súbor zásad, z ktorého sa vychádza. Rubrika pre konkrétny vstup je potom podmienenou realizáciou týchto zásad podľa úlohy a kontextu. Tento pohľad spája metódy, ktoré sa na prvý pohľad líšia: trvalé pravidlá bezpečného asistenta, detailný kontrolný zoznam pre jednu odbornú otázku aj hodnotenie každého kroku matematického riešenia. Neznamená to, že sú tieto prístupy prakticky zameniteľné. Rámec je predovšetkým pojmová mapa, ktorá umožňuje porovnávať, odkiaľ kritériá pochádzajú, ako sa aktualizujú a na akej úrovni poskytujú odmenu.
Korene v konštitučnej AI a procesnom dohľade
Jedným z východísk je konštitučná AI, ktorú Anthropic predstavilo ako spôsob trénovania asistenta podľa zoznamu pravidiel alebo princípov. Model v pôvodnej práci vytváral sebakritiku a revidovanú odpoveď, po čom nasledovala fáza posilňovaného učenia zo spätnej väzby generovanej AI. Ľudský vstup sa tak sústredil najmä do výberu princípov, nie do označovania každého škodlivého výstupu. Výsledky tejto konkrétnej práce nemožno automaticky zovšeobecniť na všetky domény, no ukázala, že prirodzený jazyk môže fungovať ako ovládacia vrstva nad hodnotením správania. Nový prehľad tento princíp interpretuje ako všeobecný prior nad rubrikami.
Druhým dôležitým smerom je procesný dohľad. OpenAI v práci Let's Verify Step by Step porovnávalo odmenu za správny konečný výsledok s hodnotením každého medzikroku pri úlohách zo súboru MATH. Procesne trénovaný odmeňovací model v tomto experimente prekonal dohľad nad výsledkom a najlepší opisovaný systém vyriešil 78 percent reprezentatívnej podmnožiny testu. Výskumníci zároveň zverejnili PRM800K s približne 800-tisíc označeniami krokov. OpenAI výslovne uviedlo, že nie je známe, do akej miery sa výsledok prenesie mimo matematiky. Práve toto obmedzenie je dôležité: presná rubrika môže byť prirodzená pri algebraickom postupe, no oveľa spornejšia pri právnom výklade alebo tvorivej odpovedi.
Nová taxonómia pridáva aj rubriky vytvárané pre jednotlivé vstupy, samostatne sa meniace kritériá a rozšírenia pre agentické či multimodálne systémy. Agent nemusí byť hodnotený iba podľa záverečnej odpovede. Rubrika môže sledovať, či vybral vhodný nástroj, overil údaje, rešpektoval oprávnenia, pracoval úsporne a dokázal uviesť dôkaz. Pri obraze, zvuku alebo videu sa zase kritériá môžu týkať zhody s pokynom, konzistentnosti, bezpečnosti a technickej kvality. Výhodou je jemnejší signál. Nevýhodou je rastúca zložitosť: každé nové kritérium môže byť nejednoznačné, vzájomne konfliktné alebo ľahko merateľné iba pomocou ďalšieho modelu.
Praktický význam pre vývoj AI systémov
Pre tímy budujúce odmeňovacie modely je hlavný odkaz jednoduchý: pred zberom preferencií treba pomenovať, čo presne znamená dobrý výsledok. V podnikovej aplikácii môže rubrika samostatne merať oporu v interných dokumentoch, úplnosť odpovede, dodržanie formátu a správne odmietnutie neoprávnenej požiadavky. Pri programovacom agentovi môže rozlišovať prejdenie testov, rozsah zmeny, bezpečnosť závislostí a kvalitu vysvetlenia. Takto získané skóre umožňuje zistiť, ktorú vlastnosť tréning zlepšil a ktorú poškodil. Rubrika však nie je iba evaluačný formulár. Ak priamo riadi optimalizáciu, jej nepresnosť sa môže stať cieľom, ktorý sa model naučí maximalizovať.
Pre slovenské organizácie je zaujímavá aj jazyková vrstva. Kritériá napísané po anglicky nemusia zachytiť terminológiu, zdvorilosť, právne nuansy ani morfologické chyby v slovenčine. Preklad rubriky môže zmeniť hranicu medzi odporúčaním a povinnosťou alebo medzi neistým a kategorickým tvrdením. Pri zdravotníckych, finančných a verejných službách by preto mali byť slovenské rubriky vytvárané spolu s doménovými expertmi a testované na domácich príkladoch. Nestačí preložiť všeobecnú bezpečnostnú zásadu. Potrebné je overiť, či hodnotiaci model dokáže konzistentne rozlišovať správne citovanie slovenských predpisov, primerané upozornenie na neistotu a odpoveď, ktorá iba pôsobí úradne.
Rubriky môžu pomôcť aj bez ďalšieho trénovania základného modelu. Dajú sa použiť pri výbere medzi viacerými kandidátnymi odpoveďami, pri regresných testoch, monitorovaní produkcie alebo rozhodovaní, ktoré prípady poslať človeku. Takéto nasadenie je často jednoduchšie a bezpečnejšie než okamžité posilňované učenie. Prevádzkovateľ môže sledovať skóre jednotlivých kritérií a porovnať ich s úsudkom expertov. Ak automatický hodnotiteľ systematicky zvýhodňuje dlhé odpovede alebo konkrétne slovné spojenia, problém sa odhalí skôr, než sa tento vzorec zakóduje do správania modelu. Aj v tomto režime však rubrika potrebuje verziovanie, vlastníka a pravidelnú kontrolu.
Jazyk rubriky je zároveň novou slabinou
Autori prehľadu upozorňujú na kompromis medzi podrobnosťou a použiteľnosťou, významový posun a jazykové zneužívanie odmeny. Príliš všeobecné kritérium, napríklad odpovedz kvalitne, ponecháva hodnotiteľovi veľký priestor na nekonzistentnosť. Príliš podrobná rubrika môže byť drahá, krehká a naviazaná na presný formát. Významový posun nastáva, keď sa pôvodná zásada pri automatickom generovaní alebo opakovaných úpravách postupne zmení. Jazykové reward hacking znamená, že model nájde povrchové znaky, ktoré hodnotiteľ spája s kvalitou, bez skutočného splnenia zámeru. Môže napríklad napodobniť opatrný tón, uvádzať množstvo krokov alebo opakovať slová z rubriky.
Prehľad je syntézou výskumného smeru, nie dôkazom, že rubrikami riadené RL už vyriešilo zarovnanie modelov. Otvorené zostáva, kto má kritériá určovať, ako riešiť konflikt medzi nimi, ako merať ich stabilitu medzi jazykmi a či hodnotiaci model rozumie odbornému obsahu lepšie než model, ktorý trénuje. Chýbajú aj univerzálne benchmarky pre dlhodobý významový posun či odolnosť voči optimalizácii na formálne znaky. Najdôležitejším prínosom práce je preto spoločný slovník: umožňuje oddeliť zásady, konkrétne rubriky, procesné hodnotenie a mechanizmus odmeny. Ďalším krokom musí byť empirické porovnávanie na reálnych úlohách, s ľudským auditom a jasne priznanými hranicami automatického hodnotenia.
Zdroje