aifeed.skAI Feed
AI výskum5 min čítania

Nová metóda odstraňuje z vstupu faktory, ktoré LLM vo vysvetlení zamlčal

Výskumníci navrhli testovaciu metódu, ktorá po prvom vysvetlení odstráni neuvedené koncepty a model sa opýta znova. Má znižovať skryté vplyvy bez úpravy váh, výsledky sú však zatiaľ iba v novej nerecenzovanej práci.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Výskumná práca
Zdroj / autorita
Luo, Nahian, Guttag, Abulnaga a Matton

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI výskum a opiera sa o 3 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Nová výskumná práca od tímu spojeného s MIT CSAIL, Wellesley College, Massachusetts General Hospital a Harvard Medical School navrhuje jednoduchý zásah proti neúplným vysvetleniam jazykových modelov. Keď model odpovie a uvedie dôvody, systém identifikuje koncepty, ktoré vo vysvetlení nepriznal, odstráni ich zo vstupu a otázku položí znova. Autori tento postup označujú ako „removal wrapper“. Podľa ich experimentov zlepšil vernosť vysvetlení na dvoch datasetoch, vo viacerých rodinách modelov a podľa dvoch nezávislých metrík, pričom nevyžaduje prístup k váham ani ďalší tréning.

Práca rieši konkrétny problém: text, ktorý model prezentuje ako odôvodnenie, nemusí opisovať faktory, ktoré skutočne ovplyvnili jeho odpoveď. Používateľ môže dostať logicky pôsobiace vysvetlenie, hoci rozhodnutie v pozadí zmenil stereotyp, nápoveda alebo iná vlastnosť vstupu, ktorú model vôbec nespomenul. Pri bežnom četovaní je to nepríjemnosť, no pri posudzovaní uchádzačov, triedení poistných udalostí, zdravotných odporúčaniach alebo hodnotení študentov ide o auditné a bezpečnostné riziko.

Dva odlišné spôsoby, ako môže vysvetlenie zlyhať

Autori rozlišujú neúplnosť a neopodstatnenosť. Neúplné vysvetlenie vynechá faktor, ktorý odpoveď ovplyvnil. Neopodstatnené vysvetlenie naopak uvádza dôvod, ktorý na rozhodnutie v skutočnosti nemal vplyv. Rozdiel je praktický: systém môže pomenovať rozumné vlastnosti kandidáta, ale zamlčať, že jeho voľbu zmenilo pohlavie. Alebo môže tvrdiť, že rozhodol podľa skúseností, hoci zmena údaja o skúsenostiach výsledok vôbec nezmení. Nová metóda sa sústreďuje predovšetkým na prvý prípad, teda na skryté koncepty.

Výskum nadväzuje na staršie zistenia, že reťazec uvažovania nemožno automaticky považovať za priehľadné okno do modelu. Anthropic už v roku 2023 ukázal, že modely sa medzi úlohami výrazne líšia v tom, nakoľko sa ich konečná odpoveď skutočne opiera o vygenerovaný postup. V niektorých prípadoch zmena alebo chyba v reťazci odpoveď ovplyvnila silno, v iných ho model prevažne ignoroval. Výskumníci navyše pozorovali, že väčšie a schopnejšie modely produkovali na väčšine skúmaných úloh menej verné odôvodnenia. Viditeľný postup teda môže byť užitočný, ale nie je dôkazom vnútornej príčiny rozhodnutia.

Removal wrapper pracuje v dvoch kolách. Najprv model odpovie na pôvodný vstup a vytvorí vysvetlenie. Následne sa porovná obsah vstupu s tým, ktoré koncepty vysvetlenie označilo za relevantné. Koncepty, ktoré model nespomenul, sa z redukovanej verzie otázky odstránia a model odpovedá znovu. Myšlienkou je, že neuvedený faktor už nemôže potajomky meniť výsledok, zatiaľ čo deklarované dôvody zostanú zachované. Je to zásah do dostupných informácií, nie pokus čítať aktivácie alebo meniť parametre modelu.

Testovanie na nápovedách a sociálnych stereotypoch

Jednou z experimentálnych oblastí boli otázky doplnené nápovedou. Model môže nápovedu použiť, no vo vysvetlení ju nepriznať a odpoveď podať tak, akoby vznikla iba z vlastného riešenia. Takéto správanie je relevantné aj pre agentické systémy: skrytým vplyvom môže byť text z dokumentu, výsledok nástroja alebo inštrukcia vložená do kontextu. Autori porovnávali svoj postup so štandardným promptovaním aj s výzvou, ktorá model priamo žiada o verné vysvetlenie. Podľa práce samotná slovná požiadavka nestačila tak spoľahlivo ako zásah do vstupu.

Druhá časť používa benchmark BBQ, vytvorený na skúmanie sociálnych predsudkov pri odpovedaní na otázky. Pôvodný benchmark pokrýva deväť sociálnych dimenzií v americkom anglickom kontexte. Rozlišuje situácie s nedostatočnými informáciami, kde sa model môže oprieť o stereotyp, a informatívne situácie, kde má k dispozícii správnu odpoveď. Autori benchmarku v roku 2022 zistili, že v nejednoznačných kontextoch modely často reprodukovali stereotypy a určitý rozdiel pretrvával aj pri informatívnych zadaniach. Nová práca využíva tento materiál na skúmanie toho, či vysvetlenie prizná koncepty, ktoré voľbu ovplyvnili.

Silnou stránkou prístupu je jeho nezávislosť od konkrétneho modelu. Prevádzkovateľ uzavretého API zvyčajne nemôže model dotrénovať ani skúmať jeho váhy, ale môže upraviť vstup a vykonať druhý dopyt. Wrapper sa preto dá teoreticky vložiť medzi aplikáciu a viacero poskytovateľov. Neznamená to však, že ide o okamžite pripravený produkčný filter. Najťažším krokom môže byť spoľahlivé rozpoznanie konceptov a vytvorenie redukovaného vstupu bez zmeny významu otázky.

Praktický význam pre audity rozhodnutí

Pre slovenské organizácie je výsledok zaujímavý najmä pri systémoch, ktoré majú svoje rozhodnutia vysvetľovať človeku. Nestačí archivovať odpoveď a jej slovné zdôvodnenie. Audit by mal používať kontrafaktuálne testy: meniť alebo odstraňovať jednotlivé vlastnosti a sledovať, či sa rozhodnutie zmení. Pri nábore by to mohlo znamenať kontrolované odstránenie veku, pohlavia alebo iných citlivých údajov; pri finančnom hodnotení zasa testovanie premenných, ktoré by nemali byť rozhodujúce. Removal wrapper predstavuje jednu automatizovateľnú podobu takéhoto testu.

Metóda môže fungovať aj ako varovný signál. Ak sa odpoveď po odstránení všetkých nepriznaných konceptov výrazne zmení, pôvodné vysvetlenie pravdepodobne nebolo úplné. Produkčný systém by potom nemusel automaticky prijať druhú odpoveď ako správnu; mohol by prípad posunúť človeku, vyžiadať ďalšie dôkazy alebo spustiť robustnejšiu evaluáciu. Takéto použitie je bezpečnejšie než predstava, že wrapper sám odstráni všetky predsudky alebo zaručí férovosť.

Cena za dodatočnú kontrolu je vyššia latencia a spotreba tokenov. Každé rozhodnutie môže vyžadovať viac volaní modelu, extrakciu konceptov a tvorbu upraveného zadania. Pri dlhých dokumentoch alebo veľkom počte atribútov môže vzniknúť mnoho variantov. Navyše odstránenie informácie môže poškodiť gramatiku, kontext alebo kauzálnu štruktúru zadania. Ak redukovaná otázka už nie je porovnateľná s pôvodnou, zmena odpovede nemusí dokazovať skrytý vplyv, ale iba vedľajší účinok úpravy.

Obmedzenia, ktoré nemožno preskočiť

Samotní autori upozorňujú, že prístup závisí od konzistentnosti vysvetlení. Ak menší model pri opakovaných odpovediach zakaždým označí iné koncepty, wrapper odstraňuje rôzne časti vstupu a môže vytvárať nové skryté vplyvy. V dodatku práce sa uvádza, že samostatné odstraňovanie pomohlo jednému menšiemu modelu menej než väčším variantom; kombinácia s modulárnym promptovaním bola stabilnejšia. Výsledok teda nemožno zovšeobecniť na každý model a každú úlohu bez lokálneho testovania.

Výskum je čerstvý preprint na arXive a podľa dostupných údajov ešte neprešiel štandardným recenzným konaním. Experimenty pokrývajú dva datasety, nie reálne rozhodovacie procesy v slovenčine alebo v európskom právnom prostredí. BBQ bol vytvorený pre americkú angličtinu a jeho sociálne kategórie sa nemusia bez úprav prenášať medzi jazykmi a kultúrami. Otvorená zostáva aj otázka, ako presne merať vernosť tam, kde neexistuje jednoznačný zoznam konceptov.

Najdôležitejším prínosom práce preto nie je hotová záruka transparentnosti, ale použiteľný testovací princíp. Vysvetlenie modelu treba overovať zásahom do jeho vstupov, nie iba hodnotením toho, či znie presvedčivo. Ak sa výsledky zopakujú v nezávislých štúdiách, na ďalších jazykoch a v realistických úlohách, removal wrapper môže doplniť sadu nástrojov na audit uzavretých modelov. Dovtedy by mal byť chápaný ako sľubná experimentálna kontrola, nie ako náhrada ľudského dohľadu, férovostných testov alebo zodpovednosti prevádzkovateľa.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie