NVIDIA a Hugging Face tlačia kórejských agentov cez syntetické persony
NVIDIA na Hugging Face ukazuje, ako postaviť kórejského AI agenta nad šiestimi miliónmi syntetických person vytvorených z oficiálnych štatistík bez práce s osobnými údajmi.
Tag
Všetky publikované články, v ktorých sa téma Hugging Face objavuje ako dôležitý kontext. Aktuálne 65 textov v archíve.
NVIDIA na Hugging Face ukazuje, ako postaviť kórejského AI agenta nad šiestimi miliónmi syntetických person vytvorených z oficiálnych štatistík bez práce s osobnými údajmi.
Projekt QIMMA od Technology Innovation Institute tvrdí, že arabské benchmarky sú plné systematických chýb a že bez predbežnej validácie môžu leaderboardy skôr mýliť než presne merať kvalitu modelov.
TII cez Hugging Face spustil QIMMA, arabský leaderboard, ktorý najprv validuje samotné benchmarky a až potom hodnotí modely. Signál je dôležitý pre firmy, ktoré chcú merať jazykové modely na menej pokrytých jazykoch oveľa spoľahlivejšie.
VAKRA chce merať agentov v prostredí, kde nestačí pekná ukážka ani jeden tool call. Benchmark kombinuje tisíce lokálnych API, databázy a dokumenty, aby bolo vidieť, kde sa agent láme pri viac-krokovom rozhodovaní a reálnom vykonávaní úloh.
IBM Research a Hugging Face rozobrali benchmark VAKRA, ktorý preveruje agentov v prostrediach bližších podnikovým workflowom než klasickým demo úlohám. Výsledok je nepríjemný: aj silné modely často zlyhávajú práve v reťazení nástrojov, mapovaní schém a práci s viacerými zdrojmi naraz.