Preprint testuje, kedy môžu audio modely hodnotiť plne duplexných hlasových agentov namiesto ľudí
Nová arXiv práca skúma spoľahlivosť Gemini modelov ako audio hodnotiteľov rozhovorov, kde človek a agent hovoria aj prerušujú sa v reálnom čase.
Tag
Všetky publikované články, v ktorých sa téma evals objavuje ako dôležitý kontext. Aktuálne 8 textov v archíve.
Nová arXiv práca skúma spoľahlivosť Gemini modelov ako audio hodnotiteľov rozhovorov, kde človek a agent hovoria aj prerušujú sa v reálnom čase.
Čerstvý preprint na arXive skúma slabinu polynomiálnych Steinových diskrepancií a navrhuje kovariančne váženú verziu λ-PSD. Cieľom je lepšie testovať kvalitu vzoriek bez straty lineárnej škálovateľnosti.
Výskum Apple Machine Learning Research meria, ako korelované chyby znižujú prínos panelov LLM sudcov. Zistenie je dôležité pre firmy, ktoré chcú hodnotiť modely väčšinovým hlasovaním viacerých modelov.
Nový arXiv preprint navrhuje varianty HSIC testu, ktoré pri testovaní nezávislosti nahrádzajú drahú permutačnú kalibráciu štandardným normálnym prahom a v experimentoch bežia 25- až 60-krát rýchlejšie.
Nový preprint navrhuje Token Replacement Test pre vision-language modely s latentnými tokenmi. Cieľom je odlíšiť skutočné využitie „vizuálneho myslenia“ od zlepšení spôsobených dlhším kontextom alebo špeciálnymi značkami.
Nový Open Agent Leaderboard nechce merať iba model, ale celý agentický systém vrátane nástrojov, plánovania, pamäte a ceny prevádzky.
Nový text na Hugging Face upozorňuje, že hodnotenie modelov a agentov už nie je len doplnok po tréningu. Pri drahých benchmarkoch, opakovaných behoch a multimodelových porovnaniach sa z evaluácií stáva samostatný nákladový problém.
VAKRA chce merať agentov v prostredí, kde nestačí pekná ukážka ani jeden tool call. Benchmark kombinuje tisíce lokálnych API, databázy a dokumenty, aby bolo vidieť, kde sa agent láme pri viac-krokovom rozhodovaní a reálnom vykonávaní úloh.