aifeed.skAI Feed
AI výskum5 min čítania

Cielené bezpečnostné ladenie LLM znižuje škodlivé odpovede, no môže spustiť masové odmietanie

Nová metóda učí model odmietať iba škodlivú časť témy. Experiment s Qwen3-8B však ukázal ostrý kompromis: menej nebezpečných odpovedí sprevádzalo až 74 % odmietnutí bezpečných úloh v XSTest.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Výskumná práca
Zdroj / autorita
Multiverse Computing

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI výskum a opiera sa o 4 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Bezpečnostné ladenie jazykových modelov sa často opiera o široké kategórie, ako sú zbrane, podvody, sebapoškodzovanie alebo politický obsah. Výskumníci z Multiverse Computing teraz navrhujú užšie zadanie: model nemá odmietnuť celú tému, ale iba konkrétnu škodlivú množinu požiadaviek v jej vnútri. V experimentoch použili politické presviedčanie, kde má asistent naďalej odpovedať na faktické otázky o voľbách, no odmietnuť cielenú manipuláciu, propagandu alebo požiadavky na radikalizáciu. Práca pomenúva tento problém ako bezpečnosť s úzkou hranicou a ukazuje, že rozhodujúce nie je iba množstvo tréningových dát, ale ich presná skladba.

Výsledky zároveň prinášajú varovanie pred jednoducho vyzerajúcimi bezpečnostnými metrikami. Pri modeli Qwen3-8B zvýšila jedna z konfigurácií odmietanie škodlivých politických požiadaviek z 9,47 % na 84,75 %. Priemerný podiel nebezpečných odpovedí v troch širších benchmarkoch klesol z 26,26 % na 0,14 %. Tá istá konfigurácia však v teste XSTest odmietla 74 % bezpečných promptov, zatiaľ čo pôvodný model odmietal dve percentá. Model sa teda podľa jednej skupiny metrík výrazne zlepšil, no podľa druhej sa zmenil na príliš opatrný systém s obmedzenou použiteľnosťou.

Hranica vedie vnútrom témy

Autori ilustrujú problém na dvoch aplikáciách postavených na rovnakom základnom modeli. Občiansky vzdelávací asistent aj systém pre verejnú správu môžu potrebovať fakticky vysvetliť voľby. Ich pravidlá pre politické presviedčanie však nemusia byť rovnaké. Bežná tematická klasifikácia nevie presne vyjadriť, že neutrálne vysvetlenie zostáva povolené, zatiaľ čo vytvorenie cielenej manipulatívnej kampane je za hranicou. Bezpečnostná politika je preto vlastnosťou konkrétneho nasadenia, nie iba univerzálnym štítkom témy.

Trénovaný model navyše nevytvára dokonale ostrú čiaru. Učí sa pravdepodobnosť odmietnutia a tá sa môže rozliať aj na bezpečné požiadavky s podobnými slovami. Otázka o chemickom zložení výbušniny, historickej propagande alebo prevencii samovraždy môže obsahovať výrazy typické pre nebezpečné zadania, hoci zámer používateľa je legitímny. Starší benchmark XSTest vznikol práve na meranie takéhoto prehnaného bezpečnostného správania. Obsahuje 250 bezpečných promptov v desiatich typoch a 200 kontrastných nebezpečných promptov.

OR-Bench neskôr rozšíril skúmanie nadmerného odmietania na 80-tisíc promptov v desiatich kategóriách, približne tisíc mimoriadne náročných bezpečných prípadov a 600 toxických kontrolných promptov. Tieto benchmarky pripomínajú, že užitočnosť a neškodnosť nemožno merať oddelene. Model, ktorý odmietne všetko, dosiahne výborný výsledok v teste škodlivej zhody, ale zlyhá ako asistent. Nová práca ide o krok ďalej tým, že testuje dvojice promptov s podobnou témou a odlišným zámerom priamo pri zamýšľanej hranici.

Oprava dier v syntetických dátach

Metóda vytvára bezpečnostné tréningové dáta pomocou samotného cieľového modelu. Pri škodlivom prompte sa model riadeným spôsobom vedie k odmietnutiu a výsledná stopa sa ponechá iba vtedy, ak ju kontrolný model uzná za platnú. Jediný pokus však v auditovanom súbore nevytvoril akceptované odmietnutie pri 19,88 % promptov, teda pri 8 009 položkách. Tieto prípady by sa pri jednoduchom postupe potichu zahodili, hoci môžu predstavovať práve najťažšie časti distribúcie.

Autori preto použili stupňované opakovanie s čoraz silnejším riadením. Podiel nevyriešených prípadov sa znížil na 0,20 %, čiže 79 promptov. Oprava pokrytia vytvorila 40 293 škodlivých tréningových príkladov. Samotné doplnenie odmietnutí však nestačilo, pretože posilnenie jednej strany hranice zväčšovalo oblasť, v ktorej model odmietal aj bezpečné otázky. Experiment tak oddeľuje dve úlohy, ktoré sa v praxi často zlejú do jedného skóre: pokrytie škodlivých požiadaviek a kalibráciu správania tesne mimo zakázanej množiny.

Na kompenzáciu autori zostavili 11 955 bezpečných promptov s navonok nebezpečnými znakmi v 18 sémantických typoch. Model sa na nich učí, že citlivé slovo samo osebe nie je dôvodom na odmietnutie. Ďalšiu vrstvu tvoria páry škodlivých a bezpečných promptov, ktoré zdieľajú tematickú kotvu, ale líšia sa zámerom. Na odložených pároch tieto dáta znížili nadmerné odmietanie na povolenej strane z 32,94 % na 4,16 %, zatiaľ čo odmietanie na škodlivej strane kleslo iba z 91,88 % na 87,72 %. To naznačuje, že lokálna presnosť hranice sa dá výrazne zlepšiť bez porovnateľne veľkej straty ochrany.

Zdroj odpovedí mení výsledok

Zaujímavý je aj vplyv toho, kto vytvorí tréningovú odpoveď. V samostatnom porovnaní nahradenie externých odpovedí overenými odpoveďami cieľového modelu znížilo nadmerné odmietanie z 15,20 % na 5,20 %. Autori to interpretujú ako dôkaz, že bezpečnostné dáta nie sú neutrálne nosiče správnych štítkov. Štýl a distribúcia odpovedí od iného modelu môžu cieľový model posunúť spôsobom, ktorý sa prejaví mimo úzko sledovaného škodlivého súboru.

Pre vývojárov to znamená, že dátový recept treba testovať ako súčasť produktu. Nestačí deklarovať počet bezpečnostných príkladov ani úspešnosť na jednom harmfulness benchmarku. Evaluačná sada má obsahovať škodlivé požiadavky, jednoznačne bezpečné otázky s citlivými výrazmi a najmä tesné páry na oboch stranách nasadzovanej politiky. Výsledky je vhodné rozložiť podľa jazykov, tém a používateľských rolí, pretože globálny priemer môže zakryť nefunkčnú hranicu v malej, ale dôležitej skupine.

Slovenské nasadenia potrebujú vlastné hranice

V slovenskom prostredí môže byť tento problém viditeľný pri verejnej správe, školstve, zdravotníctve či moderovaní volebných služieb. Model musí rozlíšiť spravodajský súhrn od politickej reklamy, vysvetlenie podvodu od návodu na jeho vykonanie alebo preventívnu zdravotnú otázku od škodlivého konania. Preklady anglických benchmarkov nemusia zachytiť lokálne eufemizmy, skloňovanie, zmiešanú češtinu a slovenčinu ani odkazy na domáce inštitúcie. Hranicu preto treba formulovať v konkrétnych scenároch a overovať s ľuďmi, ktorí poznajú jazyk aj pravidlá danej služby.

Párové testy majú praktickú výhodu aj pre audit. Namiesto všeobecnej požiadavky, aby bol model bezpečný, ukazujú, či malá zmena zámeru vedie k očakávanej zmene odpovede. Tím môže vedľa seba postaviť žiadosť o neutrálne porovnanie programov a žiadosť o manipulatívny odkaz zacielený na zraniteľnú skupinu. Ak model odmietne obe alebo splní obe, chyba je viditeľná a opakovateľná. Takéto dvojice sa dajú zaradiť do regresných testov pri každej zmene modelu, promptu alebo moderátora.

Čo zatiaľ nevieme

Práca má obmedzenia, ktoré bránia širokému zovšeobecneniu. Hlavné tvrdenia pochádzajú z experimentov s Qwen3-8B a politickým presviedčaním. Autori pripravili aj náboženský dátový súbor, ale podľa práce preň nedokončili osobitnú evaluáciu, preto na túto oblasť nevzťahujú výsledkové tvrdenia. Nie je isté, či sa rovnaké kompromisy a zlepšenia zachovajú pri väčších modeloch, iných jazykoch, ďalších druhoch škody alebo pri systémoch, kde odpoveď ešte kontroluje samostatný ochranný model.

Neistotu prináša aj automatické hodnotenie. Niektoré širšie výsledky skóruje LlamaGuard-3 a kvalita syntetických stôp závisí od kontrolných modelov. Chyba rozhodcu sa môže preniesť do dát aj metrík. Potrebné sú preto replikácie s ľudskými anotátormi, viacerými modelmi a reálnymi politikami nasadenia. Výskum napriek tomu presvedčivo ukazuje, prečo nemožno bezpečnostný pokrok vyhlásiť iba podľa poklesu škodlivých odpovedí. Dobre nastavený model musí odmietnuť správnu požiadavku, nie iba odmietať častejšie.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie