EveryEvalEver chce zjednotiť roztrieštené hodnotenie AI modelov
Otvorený projekt IBM, Hugging Face a akademických partnerov zavádza spoločný formát pre výsledky benchmarkov a odhaľuje, koľko dôležitých údajov dnešným porovnaniam modelov chýba.
Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.
- Typ zdroja
- Kurátorovaný súhrn
- Zdroj / autorita
- IBM Research
Redakčný kontext
Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov a zodpovednú kontrolu pravidiel robí Marek Považský.
Článok je zaradený v sekcii AI výskum a opiera sa o 4 zdroje.
Benchmarky dnes výrazne ovplyvňujú, ktorý jazykový alebo multimodálny model si firmy vyberú, no rovnaké číslo nemusí v dvoch tabuľkách znamenať to isté. Projekt EveryEvalEver, na ktorom sa podieľajú výskumníci z IBM, Hugging Face, Technickej univerzity v Mníchove a ďalších pracovísk, sa pokúša tento problém riešiť spoločným jazykom pre záznam výsledkov. Namiesto ďalšieho rebríčka buduje otvorenú dátovú vrstvu, v ktorej sa dá dohľadať nielen skóre, ale aj pôvod testu, verzia modelu, spôsob spustenia, nastavenia generovania a význam použitej metriky.
Dôvod je praktický: hodnotenie AI je dnes rozdelené medzi desiatky testovacích nástrojov, akademické práce, produktové blogy a verejné rebríčky. Aj nominálne rovnaký benchmark môže pri odlišnom testovacom rámci, šablóne promptu alebo nastavení dekódovania priniesť citeľne iný výsledok. IBM upozorňuje, že v zdokumentovaných prípadoch sa rozdiely vyšplhali až na približne 20 percentuálnych bodov. Samotné poradie modelov preto môže hovoriť menej o ich skutočných schopnostiach a viac o podmienkach, za ktorých ich niekto zmeral.
EveryEvalEver zavádza modulárny formát JSON so štyrmi hlavnými skupinami údajov. Prvá opisuje zdroj výsledku a jeho autora, druhá presne identifikuje model a spôsob prístupu k nemu, tretia zachytáva konfiguráciu generovania a štvrtá vysvetľuje výsledok spolu so sémantikou metriky. Formát môže niesť aj údaje na úrovni jednotlivých úloh, napríklad konkrétne prompty a odpovede modelu. Záznam nemusí byť od začiatku úplný; chýbajúce polia zostávajú viditeľné, takže neistota sa neschová za uhladené finálne skóre.
Projekt už podľa IBM zhromaždil viac než 22-tisíc modelových výsledkov z približne 2 200 benchmarkov a preložil ich z 31 rôznych formátov. Širší dátový súbor obsahuje približne 230-tisíc jednotlivých hodnotení. Tím pripravil prevodníky pre rozšírené nástroje HELM, lm-eval-harness a Inspect AI aj pre známe rebríčky, medzi ktoré patria AlpacaEval, RewardBench či SWE-bench. Pred vložením do otvoreného úložiska na Hugging Face prejde príspevok validačnou kontrolou.
Najdôležitejším prínosom nie je samotný objem dát, ale možnosť odhaliť, čo v dnešných správach chýba. Analýza EveryEvalEver ukázala, že poskytovatelia uviedli platformu použitú na obsluhu modelu iba približne v dvoch percentách prípadov. Nastavenia generovania, napríklad teplotu ovplyvňujúcu náhodnosť odpovedí, zverejnili v menej než štvrtine záznamov. Bez týchto údajov je opakovanie experimentu náročné a porovnanie dvoch modelov môže byť zavádzajúce aj vtedy, keď obe tabuľky používajú rovnaký názov metriky.
Dáta zároveň ukazujú nerovnováhu v tom, ktoré systémy sa testujú najčastejšie. Podľa IBM patrilo 23 z 24 najčastejšie hodnotených modelov piatim americkým komerčným firmám. Menšie laboratóriá, otvorené modely, jazyky mimo angličtiny a nasadenia v prostrediach s obmedzeným výpočtovým rozpočtom tak môžu zostať mimo hlavného obrazu. Spoločný formát problém sám nevyrieši, ale dokáže presne ukázať, kde sú medzery a ktoré závery stoja na úzkom výbere dát.
Pre vývojárov je dôležité aj to, že výsledok modelu nemožno úplne oddeliť od softvéru, ktorý ho obklopuje. Pri agentoch môže cenu a úspešnosť meniť plánovač, výber nástrojov, pamäť, opakovanie pokusov aj pravidlá ukončenia úlohy. Výskumníci pri porovnávaní rôznych agentických obalov zistili, že zmena tejto vrstvy dokázala výrazne ovplyvniť náklady bez zodpovedajúceho zlepšenia výkonu. Záznam samotného názvu modelu je preto pre seriózny nákup alebo technický audit nedostatočný.
Otvorená databáza môže znížiť aj cenu hodnotenia. Tím odhaduje, že zopakovanie agregovaných výsledkov, ktoré už zhromaždil, by mohlo stáť až 370-tisíc dolárov, pričom tento odhad ešte nezahŕňa drahšie agentické testy, reasoning modely a opakované behy. Ak je starší výsledok dostatočne zdokumentovaný, ďalší tím ho môže znovu použiť, overiť iba kritické časti alebo cielene doplniť chýbajúce nastavenia namiesto opakovania celého experimentu.
Pre podniky to mení spôsob, akým by mali čítať dodávateľské benchmarky. Nestačí porovnať prvé číslo v tabuľke; treba žiadať identifikátor verzie modelu, dátum testu, presnú sadu úloh, promptovú šablónu, parametre generovania, počet opakovaní a spôsob výpočtu ceny. Pri agentoch treba navyše evidovať použitý testovací rámec a jeho konfiguráciu. EveryEvalEver poskytuje návrh dátovej schémy, ktorú možno preniesť aj do interného procesu výberu modelov alebo do dokumentácie pre audit.
Súčasná verzia má limity. Najlepšie pokrýva textové testy jedného modelu, zatiaľ čo multimodálne hodnotenia, ľudské preferencie a viacagentové prostredia sú zastúpené iba čiastočne. Otvorený register tiež nedokáže prinútiť poskytovateľa, aby zverejnil parametre proprietárneho systému alebo kontamináciu tréningových dát. Jeho výhoda spočíva v tom, že absenciu týchto informácií pomenúva a zachováva, namiesto toho, aby neúplný výsledok pôsobil ako plne reprodukovateľný dôkaz.
Projekt používa nezmazateľné identifikátory záznamov a konfliktné výsledky môže uchovať vedľa seba. To je dôležitejšie než snaha vyrobiť jedno údajne definitívne skóre: rozdiel medzi dvoma behmi sa stáva predmetom vyšetrovania, nie dátom, ktoré treba skryť. Tím tento prístup prirovnáva k otvorenému komunitnému zdroju, kde sa kvalita zlepšuje postupným dopĺňaním pôvodu, konfigurácie a významu metrík.
EveryEvalEver tak neoznamuje nový najlepší model, ale buduje infraštruktúru na dôveryhodnejšiu interpretáciu všetkých takýchto oznámení. Ak sa formát presadí medzi laboratóriami, rebríčkami a podnikovými tímami, benchmarkové výsledky budú ľahšie porovnateľné, opakovateľné a použiteľné pri rozhodovaní o nákladoch či riziku. Kľúčovou neistotou zostáva adopcia: technický štandard má hodnotu iba vtedy, ak doň autori výsledkov vložia dostatok údajov a komunita začne neúplné záznamy považovať za slabší dôkaz, nie za plnohodnotné poradie.
Zdroje
