AutoWorldModel-Bench meria, či AI agenti dokážu zlepšovať svetové modely
Aktualizovaná verzia benchmarku ukazuje zlepšenie východiskového svetového modelu v 63 zo 64 behov agentov Codex-5.4 a Claude Opus 4.6. Nové kontroly zahŕňajú scenárové testy, porovnanie s automatickým ladením, opakovanie s ďalšími seedmi a audit možného obchádzania metrík; stále však nejde o dôkaz plne autonómnej vedy.