aifeed.skAI Feed
AI výskum5 min čítania

AutoWorldModel-Bench meria, či AI agenti dokážu zlepšovať svetové modely

Aktualizovaná verzia benchmarku ukazuje zlepšenie východiskového svetového modelu v 63 zo 64 behov agentov Codex-5.4 a Claude Opus 4.6. Nové kontroly zahŕňajú scenárové testy, porovnanie s automatickým ladením, opakovanie s ďalšími seedmi a audit možného obchádzania metrík; stále však nejde o dôkaz plne autonómnej vedy.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Výskumná práca
Zdroj / autorita
Electronic Arts a Simon Fraser University

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI výskum a opiera sa o 4 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Výskumný cyklus uzavretý do šiestich hodín

AutoWorldModel-Bench od výskumníkov z Electronic Arts a Simon Fraser University skúša, či kódovací AI agent dokáže robiť viac než splniť presnú programátorskú špecifikáciu. Agent dostane funkčný, ale zámerne nie optimálny svetový model, tréningové a validačné dáta, hodnotiaci skript a šesťhodinový výpočtový rozpočet na jednej GPU H100. Následne číta kód, formuluje možné zlepšenia, upravuje architektúru alebo tréning, spúšťa experimenty a podľa výsledkov volí ďalší krok. Každý tréningový pokus môže trvať najviac desať minút, takže počas jednej relácie vznikne séria navzájom nadväzujúcich experimentov.

Svetový model v tomto kontexte predpovedá, ako sa stav hry zmení po vykonanej akcii. Benchmark zahŕňa hry Asteroids, Breakout, Frogger, Kong, Platformer, Pong, Racer a Snake a štyri rodiny východiskových modelov: rekurentný Dreamer, autoregresívny Transformer, diskrétny difúzny model D3PM a MaskGIT. Dvaja hodnotení agenti, Codex-5.4 a Claude Opus 4.6, tak absolvovali po 32 relácií, spolu 64. Nešlo o súťaž v rozpoznávaní obrazu: agenti pracovali s presným štruktúrovaným stavom objektov získaným z herného enginu. Tým sa oddelila percepcia od učenia dynamiky a experimenty sa výrazne zrýchlili.

Čo priniesla aktualizovaná verzia práce

Oproti pôvodnému článku z 13. augusta je podstatná najmä druhá verzia výskumnej práce, zverejnená na arXiv 16. augusta. Zachováva hlavný výsledok, ale podrobnejšie rozlišuje veľkosť zlepšení a pridáva viac kontrol odolnosti. Agenti prekonali východiskový model na zadržanej testovacej množine v 63 zo 64 relácií. Priemerný nárast skóre bol 0,196 na škále od nuly do jednej a medián 0,115. Za výrazné zlepšenie s rozdielom najmenej 0,10 autori označili 33 relácií; ďalších desať prinieslo stredný a dvadsať iba malý kladný posun. Samotný pomer 63 ku 64 preto nevystihuje rozdiel medzi zásadným a takmer zanedbateľným úspechom.

Výsledky sa sústreďovali na dlhšie otvorené predikcie, pri ktorých model opakovane používa vlastný predchádzajúci výstup. Pri horizonte jedného kroku stúplo priemerné čiastkové skóre z 0,813 na 0,864, pri desiatich krokoch z 0,578 na 0,788 a pri dvadsiatich z 0,488 na 0,737. To je dôležité, pretože model vhodný na plánovanie nestačí naučiť predpovedať iba bezprostredne nasledujúci stav. Musí obmedziť kumulovanie malých chýb, ktoré po viacerých krokoch vytvoria nereálnu trajektóriu. Medzi úspešnými zásahmi sa preto opakovali vyššie váhy chýb na konci rolloutu, tréning na vlastných predikciách, pohybové priority či predpovedanie zmien namiesto absolútneho stavu.

Aktualizácia pridáva aj scenárovú sadu 60 skupín testov s 1 860 epizódami. Tie izolujú konkrétne pravidlá, napríklad kolíziu loptičky s pálkou, zánik objektu, zabodovanie alebo koniec hry, a sledujú predikciu až do konca pripravenej sekvencie. Najlepší agentický model prekonal základ v 56 zo 64 relácií; smer zmeny sa zhodoval s hlavným testom v 55 prípadoch a korelácia rozdielov dosiahla 0,89. Je to presvedčivejšie než jedno validačné číslo, zároveň však osem scenárových regresií ukazuje, že optimalizácia priemernej predikcie automaticky nezachová každé pravidlo prostredia.

Výsledok nie je iba drahšie ladenie parametrov

Autori porovnali agentov s náhodným vyhľadávaním a bayesovskou optimalizáciou pri rovnakom výpočtovom rozpočte. Zmyslom bolo overiť, či úspech nevznikol iba tým, že jazykový model vyskúšal veľa hodnôt learning rate alebo počtu tréningových krokov. Automatický klasifikátor označil 91 percent víťazných zmien za netriviálne zásahy do straty, architektúry, inferencie, dátovej augmentácie alebo rollout procedúry. Toto označenie však nie je ľudsky recenzovaný vedecký verdikt: vychádza najmä z hodnotenia modelom Gemini Pro 3.1. Kontrola bez textového vysvetlenia agenta síce zachovala binárne rozlíšenie triviálnych a netriviálnych zmien vo väčšine prípadov, jemné kategórie boli podstatne menej stabilné.

Dôležité sú aj konkrétne mechanizmy. Pri kombinácii Snake a autoregresívneho Transformera zvýšil Codex-5.4 skóre z 0,10 na 0,83 tým, že silnejšie penalizoval chyby na konci predikovanej trajektórie. Pri Asteroids pomohlo priame preskočené spojenie zo základného stavu do dekódera, pri Froggerovi odvodenie rýchlosti z rozdielov polohy a pri Kongu dodatočná penalizácia pozičnej chyby v poslednom kroku. Nejde teda o jednu univerzálnu techniku. Benchmark skôr zachytáva schopnosť nájsť miestne slabé miesto konkrétnej kombinácie hry, reprezentácie a modelu.

V prospech dôveryhodnosti hovoria oddelené testovacie dáta, dodatočné vyhodnotenie víťazného checkpointu a ochrana hodnotiaceho skriptu proti úpravám. Autori auditovali relácie aj pre pokusy o obídenie metriky a časť experimentálnej mriežky zopakovali s dvoma ďalšími náhodnými seedmi. Zverejnili projektovú stránku, kód aj dátový formát, čo vytvára predpoklady na nezávislú reprodukciu. Zároveň sami dokumentujú nedeterministické rozdiely medzi opakovanými štartmi základných modelov na zdieľanej infraštruktúre. Pri porovnávaní agentov preto používajú výsledok relatívny k základnému behu z rovnakej relácie.

Čo to znamená pre vývojárov v Európe

Pre slovenské výskumné tímy a menšie firmy je zaujímavý najmä návrh pracovného postupu: presne oddeliť zapisovateľný tréningový kód od nemenného hodnotenia, uchovávať štruktúrovaný denník experimentov a rozhodovať podľa zadržaných dát, ktoré agent nevidí. Takýto agent by mohol zrýchliť návrh modelov v simulácii, robotike, priemyselnej optimalizácii alebo energetike, kde sa dá vytvoriť lacný a opakovateľný experimentálny cyklus. Európska sieť EuroHPC AI Factories ponúka výpočtové kapacity a podporné služby priemyslu aj vedeckým používateľom; Slovensko je v tejto sieti uvedené ako anténa rakúskej AI Factory. To môže znížiť infraštruktúrnu bariéru, nie však nároky na kvalitné dáta a evaluáciu.

Benchmark zatiaľ neoprávňuje hovoriť o plne autonómnom vedcovi. Problém, hry, dáta, metrika, základné implementácie aj časový rozpočet pripravili ľudia a agent si nevyberal vedecky významnú otázku. Nepracoval s pixelmi, fyzickým laboratóriom, neúplnými pozorovaniami ani protichodnými výsledkami z viacerých pracovísk. Každá hlavná kombinácia agenta, hry a architektúry mala iba jeden pôvodný beh a rozdiel medzi agentmi nebol pri tejto vzorke štatisticky presvedčivý: Codex vyhral 19 z 32 párových úloh, no Wilcoxonov test dal hodnotu p = 0,15. Výsledok preto nemožno používať ako spoľahlivý rebríček dodávateľov.

Najpresnejšia interpretácia je užšia: moderné kódovacie agenty dokážu v dobre ohraničenom, rýchlom a merateľnom prostredí opakovane nájsť technické zlepšenia svetových modelov, pričom často nejde iba o ladenie jedného čísla. Ďalším testom bude prenos na nové domény, viac nezávislých opakovaní, slepé ľudské posúdenie zmien a úlohy, v ktorých sa kvalita nedá stlačiť do jednej ľahko optimalizovateľnej metriky. Pre praktické nasadenie zostáva rozhodujúca ľudská kontrola hypotéz, nákladov, bezpečnosti a toho, či zlepšenie benchmarku skutočne rieši pôvodný problém.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie