aifeed.skAI Feed

Tag

#evaluácie

Všetky publikované články, v ktorých sa téma evaluácie objavuje ako dôležitý kontext. Aktuálne 5 textov v archíve.

EveryEvalEver zavádza spoločný formát pre výsledky AI benchmarkov
Modely4 min čítania3 zdroje

EveryEvalEver zavádza spoločný formát pre výsledky AI benchmarkov

EveryEvalEver zhromažďuje približne 230-tisíc výsledkov evaluácií a dopĺňa ich o jednotné metadáta. Projekt vedený tímami z IBM, Hugging Face a Technickej univerzity v Mníchove chce uľahčiť porovnávanie modelov, odhaľovanie metodických rozdielov a opätovné využitie drahých meraní.

Patronus AI stavia testovanie agentov na digitálne svety
Produkty4 min čítania3 zdroje

Patronus AI stavia testovanie agentov na digitálne svety

Patronus AI oznámil 50-miliónové financovanie a prvý náhľad Digital World Model. Firma chce posunúť evaluácie agentov od statických datasetov k simulovaným digitálnym prostrediam, kde sa dajú skúšať dlhé pracovné postupy.