EveryEvalEver zavádza spoločný formát pre výsledky AI benchmarkov
EveryEvalEver zhromažďuje približne 230-tisíc výsledkov evaluácií a dopĺňa ich o jednotné metadáta. Projekt vedený tímami z IBM, Hugging Face a Technickej univerzity v Mníchove chce uľahčiť porovnávanie modelov, odhaľovanie metodických rozdielov a opätovné využitie drahých meraní.
Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.
- Typ zdroja
- Oficiálny zdroj
- Zdroj / autorita
- IBM Research a EveryEvalEver
Ako vznikol tento text
Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.
Text je zaradený v sekcii AI modely a opiera sa o 3 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.
Rovnaký benchmark nemusí znamenať rovnaký test
Výsledky benchmarkov sa zvyčajne zobrazujú ako presné a priamo porovnateľné čísla. Za jedným skóre sa však môže skrývať konkrétna verzia datasetu, inak zostavený prompt, rozdielny počet ukážok, odlišná šablóna chatu či vlastný spôsob spracovania odpovede. Komunitný projekt EveryEvalEver sa túto fragmentáciu pokúša riešiť spoločným formátom na opis evaluácií a verejnou databázou výsledkov. Vedú ho výskumníci z IBM, Hugging Face, Technickej univerzity v Mníchove a ďalších organizácií.
Podľa údajov zverejnených IBM obsahuje databáza približne 230-tisíc jednotlivých výsledkov. Pokrýva viac než 22-tisíc kombinácií modelov a testov naprieč zhruba 2 200 benchmarkmi alebo ich variantmi. Dáta boli prevedené z 31 existujúcich evaluačných formátov. Nejde teda o ďalší rebríček, ktorý by všetky schopnosti modelu stlačil do jedného poradia. Ambíciou projektu je uchovať aj informácie potrebné na vysvetlenie, ako konkrétne číslo vzniklo.
Rozdiely nie sú iba teoretické. IBM uvádza, že nominálne rovnaké evaluácie môžu vykázať odchýlku až 20 percentuálnych bodov. Pri známom rozpore vo výsledkoch modelu Llama na teste MMLU sa ukázalo, že jednotlivé tímy použili odlišné evaluačné nástroje. Aj dokumentácia Open LLM Leaderboardu upozorňuje, že výsledky sa môžu mierne meniť podľa veľkosti dávky, a presne špecifikuje počet ukážok, metriku aj šablónu používanú pri každej úlohe. Názov benchmarku preto sám osebe nestačí na reprodukciu merania.
Čo uchováva spoločný záznam
EveryEvalEver používa modulárny formát JSON rozdelený do štyroch hlavných oblastí. Zaznamenáva pôvod výsledku a jeho autora, identitu testovaného modelu a spôsob prístupu k nemu, konfiguračné nastavenia behu a význam vykázaných metrík. Voliteľne môže obsahovať aj údaje na úrovni jednotlivých príkladov, napríklad presný prompt a odpoveď modelu. Chýbajúce pole zostane označené ako nevyplnené, aby sa čiastočne zdokumentované meranie nemuselo úplne zahodiť.
Projekt pripravil prevodníky pre rozšírené nástroje HELM, lm-eval-harness a Inspect AI, ako aj pre výsledky z rebríčkov AlpacaEval, RewardBench a SWE-bench. Pred zaradením záznamu prebehne validácia a každý príspevok dostane jedinečný identifikátor. Záznam nemožno nenápadne prepísať alebo odstrániť. Ak sa dve merania rozchádzajú, obe môžu zostať dostupné spolu s metadátami, podľa ktorých sa dá hľadať príčina rozdielu.
Doplňujúcou vrstvou sú Evaluation Cards, ktoré systematizujú dokumentáciu samotných testov. Podľa IBM zachytávajú výsledky takmer 5 800 modelov na 633 benchmarkoch. Takýto slovník je dôležitý aj pri zdanlivo známych metrikách. Tím napríklad našiel perplexitu vykazovanú podľa tokenov, slov aj bajtov. Bez uvedenia jednotky môžu dve rovnako pomenované hodnoty vyjadrovať odlišný výpočet a priame porovnanie by bolo zavádzajúce.
Agregované záznamy zároveň ukázali, ako málo podrobností poskytovatelia bežne zverejňujú. Platforma použitá na prevádzku modelu bola uvedená iba pri približne dvoch percentách výsledkov a nastavenia generovania, ako je teplota, pri menej než štvrtine. Päť amerických spoločností zastupovalo 23 z 24 najčastejšie hodnotených systémov. Databáza preto nie je reprezentatívnym obrazom celého trhu, ale zároveň presne odhaľuje, kde sú dnešné evaluačné dáta neúplné.
Praktický význam pre výber modelu
Pre firmy je hlavnou výhodou možnosť odlíšiť skutočný výkonnostný rozdiel od odchýlky spôsobenej testovacím postupom. Pri internom obstarávaní nestačí prebrať tabuľku dodávateľa. Zmysluplné porovnanie by malo uvádzať verziu modelu a benchmarku, promptovaciu šablónu, počet ukážok, nastavenia generovania, použitý hardvér alebo API a presnú definíciu metriky. Spoločný formát môže tieto položky premeniť na kontrolovateľný záznam namiesto poznámok roztrúsených v dokumentácii.
Význam rastie pri agentických systémoch. Výsledok už neurčuje iba základný model, ale aj dostupná sada nástrojov, spôsob práce s kontextom, limity krokov, pravidlá opakovania a orchestračný softvér. Tím EveryEvalEver pri porovnávaní scaffoldov zistil, že ich voľba môže výrazne meniť cenu behu bez zodpovedajúceho zlepšenia úspešnosti. Ak sa zaznamená iba názov modelu, podstatná časť experimentu zostane neviditeľná.
Opätovné využívanie výsledkov môže znížiť aj náklady. Autori odhadujú, že zopakovanie agregovaných meraní v databáze by hypoteticky stálo do 370-tisíc dolárov. Odhad pritom nezahŕňa drahšie agentické evaluácie, reasoning modely ani opakované behy potrebné na meranie variability. Starší výsledok však možno bezpečne znovu použiť len vtedy, keď poznáme jeho podmienky a benchmark sa medzitým nezmenil alebo nekontaminoval tréningové dáta.
Európsky kontext a hranice projektu
Zapojenie Technickej univerzity v Mníchove dáva iniciatíve priamy európsky rozmer. Pre slovenské firmy, univerzity a verejné organizácie môže byť jednotný záznam užitočný pri obstarávaní modelov, akademickej reprodukcii aj dokumentovaní interných testov. Osobitne pomôže menším tímom, ktoré si nemôžu dovoliť opakovane testovať desiatky modelov. Záznam z verejnej databázy však nemôže nahradiť lokálne overenie na slovenčine, vlastných dokumentoch a reálnych pracovných postupoch.
Lokálny kontext je dôležitý aj preto, že súčasné pokrytie zvýhodňuje textové testy a americké komerčné modely. Výsledok v anglickom vedomostnom benchmarku nehovorí dostatočne o práci so slovenskou právnou terminológiou, diakritikou, regionálnymi údajmi či viacjazyčnými dokumentmi. Slovenské organizácie by preto mali spoločné metadáta využiť ako základ auditu, nie ako hotové rozhodnutie o nákupe alebo nasadení.
EveryEvalEver navyše nerieši kvalitu samotných benchmarkov ani riziko, že model pozná testové otázky z tréningu. Neúplný záznam zostáva neúplný a formát spätne neobnoví nastavenia, ktoré pôvodný autor nikdy nezverejnil. Podpora multimodálnych testov, ľudských preferenčných hodnotení a prostredí s viacerými agentmi je zatiaľ iba čiastočná. Ani presne reprodukovaný výsledok automaticky neznamená, že test meria schopnosť dôležitú pre konkrétne nasadenie.
Najväčšou otvorenou otázkou je adopcia. Hodnota databázy porastie len vtedy, ak spoločný formát začnú pravidelne používať autori benchmarkov, prevádzkovatelia rebríčkov a poskytovatelia modelov. Projekt napriek tomu prináša praktický posun: namiesto izolovaného skóre uchováva aj jeho pôvod, konfiguráciu a význam. Pre používateľa modelu je to lepší základ na overenie tvrdení než samotné miesto v rebríčku.
Zdroje