aifeed.skAI Feed
AI modely5 min čítania

Stanford preveril 56 AI benchmarkov: rovnaké schopnosti často merajú rozdielne

Dve štúdie zo Stanfordu upozorňujú, že populárne AI benchmarky nemusia merať deklarovanú schopnosť. Problém sa týka aj testov zaujatosti a viacjazyčnej bezpečnosti, podľa ktorých sa rozhoduje o nákupe či regulácii modelov.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Oficiálny zdroj
Zdroj / autorita
Stanford Institute for Human-Centered AI

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI modely a opiera sa o 3 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Výsledky benchmarkov ovplyvňujú, ktorý model firmy nasadia, koľko zaň investori zaplatia aj aké požiadavky naň uplatnia verejné inštitúcie. Nový výskum Stanfordovej univerzity však upozorňuje, že samotný názov testu ešte nezaručuje, že skóre naozaj zachytáva deklarovanú vlastnosť. Výskumníci v dvoch štúdiách, ktoré majú byť predstavené na konferencii COLM, použili postupy z psychometrie a v jednej analýze preverili 56 rozšírených benchmarkov. Zistili opakujúce sa nezhody medzi testami, ktoré majú merať rovnakú schopnosť, aj prípady, keď výsledok zrejme ovplyvňuje iná vlastnosť modelu. Nejde preto len o technickú debatu o rebríčkoch, ale o otázku, či organizácie prijímajú rozhodnutia podľa správne interpretovaných údajov.

Keď test zaujatosti skúša aj čítanie s porozumením

Stanford uvádza ako príklad benchmark BBQ, ktorý sa používa na hodnotenie sociálnej zaujatosti. Jedna skupina jeho otázok zámerne neposkytuje dosť informácií na spoľahlivú odpoveď. Ak sa model rozhodne podľa stereotypu namiesto voľby „nevieme“, test to vyhodnotí ako prejav zaujatosti. Problém je v tom, že správnu možnosť môže zvoliť aj zaujatý model, ktorý iba rozpozná formát chytáka. Naopak, model bez sledovanej zaujatosti môže otázku nesprávne pochopiť a dostať horšie skóre. Výsledok potom mieša minimálne dve odlišné veci: tendenciu používať stereotypy a schopnosť identifikovať nedostatočné zadanie. Jediné číslo neukáže, ktorá z nich rozhodla.

Takéto miešanie vlastností sa v meraní označuje ako problém validity. Výskumníci preto preniesli do hodnotenia AI dva pojmy známe z psychometrie. Konvergentná validita sa pýta, či rôzne testy tej istej schopnosti prinášajú podobný obraz. Diskriminačná validita preveruje, či testy odlišných schopností skutočne zachytávajú rozdielne javy. Ak dva benchmarky bezpečnosti zoradia modely úplne inak alebo sa test zaujatosti správa skôr ako test porozumenia textu, ich skóre nemožno bez ďalšieho kontextu považovať za čistú mieru bezpečnosti či férovosti. Stanford tvrdí, že takéto vzorce našiel naprieč skúmaným súborom 56 benchmarkov, nie iba pri jednom izolovanom príklade.

Preklad môže zmeniť model aj samotné meradlo

Druhá štúdia sa zaoberá bezpečnostnými testami v rôznych jazykoch. Väčšina známych benchmarkov vzniká v angličtine a do ďalších jazykov sa prekladá. Pri poklese bezpečnostného skóre však môžu súčasne pôsobiť dva mechanizmy. Model môže mať v slovenčine, španielčine alebo svahilčine slabšie ochranné mechanizmy, takže ľahšie poskytne škodlivú odpoveď. Zároveň môže preklad zmeniť náročnosť, význam alebo jednoznačnosť otázky. Z obyčajného rozdielu skóre sa nedá určiť, či zlyhal model, preklad alebo konštrukcia testu. Práve rozklad výsledku na jazykovo nezávislú bezpečnosť, náročnosť položky a kvalitu spracovania konkrétneho jazyka má priniesť presnejšiu diagnózu.

Pre menšie jazykové trhy je to zásadná výhrada. Bezpečnosť modelu overená v angličtine sa nedá automaticky preniesť na slovenčinu, češtinu či maďarčinu. Nestačí však ani mechanicky preložiť anglický test a porovnať percentá úspešnosti. Slovenské hodnotenie by malo kontrolovať významovú zhodu otázok, prirodzenosť formulácií, miestny kultúrny kontext a rozdiely v tom, ako model rozpoznáva rizikový zámer. Potrebné sú tiež rodení hovoriaci a opakované testovanie po aktualizáciách modelu. Inak môže lokálny benchmark vytvoriť dojem presnosti, hoci v skutočnosti spája jazykovú zdatnosť, bezpečnostné obmedzenia a kvalitu prekladu do jedného nejasného ukazovateľa.

Staršia práca „Safetywashing“, predstavená na NeurIPS 2024, dopĺňa rovnakú širšiu obavu z iného smeru. Jej autori skúmali, či zlepšenie skóre bezpečnostných benchmarkov nepredstavuje iba optimalizáciu na konkrétne testy namiesto všeobecného pokroku v bezpečnosti. Nové stanfordské štúdie nejde považovať za nezávislú replikáciu tejto práce, no obe línie výskumu spochybňujú jednoduché tvrdenie, že vyššie číslo automaticky znamená bezpečnejší systém. Podobne aj odborná analýza v časopise ITNOW upozorňuje, že dobrý výkon na širokej sade úloh nemusí spoľahlivo predpovedať správanie v konkrétnom podnikovom prostredí. Súhrnná správa z benchmarku preto potrebuje opis účelu, dát, obmedzení a podmienok použitia.

Čo by mali zmeniť firmy a verejné obstarávanie

Pre firmy je praktickým dôsledkom potreba oddeliť verejný rebríček od vlastného akceptačného testu. Model s najvyšším priemerným skóre nemusí byť najlepší na spracovanie slovenských dokumentov, volanie interných nástrojov alebo odmietanie rizikových pokynov. Organizácia by mala najprv pomenovať konkrétne správanie, ktoré chce merať, a až potom vybrať viac nezávislých skúšok. Výsledky treba rozdeliť podľa jazyka, typu úlohy a závažnosti chyby. Pri agentických systémoch je navyše potrebné hodnotiť celý pracovný tok vrátane výberu nástroja, oprávnení a kontroly výsledku, nie iba izolovanú odpoveď základného modelu. Benchmark má byť merací prístroj, nie marketingová nálepka.

Podobná opatrnosť je potrebná pri verejnom obstarávaní a regulácii. Jedna hranica skóre je administratívne pohodlná, ale môže zvýhodniť modely optimalizované na známy test alebo zakryť slabé výsledky v menšinových jazykoch. Zmysluplnejšie požiadavky by mali určiť, aký konštrukt test meria, pre akú populáciu používateľov platí a aká neistota sprevádza výsledok. Dodávateľ by mal uviesť verziu modelu, presné nastavenie testu, spôsob prekladu, použité hodnotiace modely aj dátum merania. Pri významných nasadeniach by mala nasledovať lokálna skúška na reprezentatívnych úlohách a priebežné monitorovanie po zavedení, pretože aktualizácia modelu môže pôvodné výsledky zmeniť.

Čo zatiaľ nevieme

Stanford zatiaľ predstavil zistenia najmä prostredníctvom univerzitného súhrnu a rozhovoru s autormi. Dve práce majú byť prezentované na konferencii COLM, preto bude dôležité preskúmať úplnú metodiku, výber 56 benchmarkov, štatistické predpoklady aj citlivosť výsledkov na konkrétnu skupinu modelov. Z dostupných podkladov nemožno vyvodiť, že všetky dnešné benchmarky sú nepoužiteľné alebo že každý nesúlad znamená chybný test. Rozdiely môžu niekedy zachytávať legitímne odlišné podoby tej istej široko pomenovanej schopnosti. Chýba tiež nezávislá replikácia nových výsledkov na ďalších modeloch, jazykoch a komerčných systémoch s uzavretými parametrami.

Najdôležitejší záver preto nie je prestať merať, ale prestať zamieňať skóre s vlastnosťou samotnou. Benchmark zostáva užitočný, ak má jasne vymedzený účel, overenú validitu a výsledok sa interpretuje v podmienkach, pre ktoré bol vytvorený. Pre slovenské organizácie to znamená doplniť globálne rebríčky o lokálne jazykové a prevádzkové skúšky a zaznamenávať, či predikcia benchmarku zodpovedala správaniu po nasadení. Až takéto spätné porovnanie ukáže, či test predpovedá realitu, alebo iba poradie modelov na ďalšom rebríčku. Pri rozhodnutiach o bezpečnosti, verejných službách a veľkých nákupoch je tento rozdiel podstatnejší než niekoľko bodov medzi prvým a druhým miestom.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie