NVIDIA ladí Nemotron pre LangChain Deep Agents bez dotrénovania modelu
Nemotron 3 Ultra má v upravenom agentickom harness-e dosiahnuť špičku medzi otvorenými modelmi. Pointa nie je nový checkpoint, ale práca so systémovým prostredím okolo modelu.
Tag
Všetky publikované články, v ktorých sa téma benchmarky objavuje ako dôležitý kontext. Aktuálne 56 textov v archíve.
Nemotron 3 Ultra má v upravenom agentickom harness-e dosiahnuť špičku medzi otvorenými modelmi. Pointa nie je nový checkpoint, ale práca so systémovým prostredím okolo modelu.
OpenAI zverejnil audit benchmarku SWE-Bench Pro a tvrdí, že približne tretina úloh môže skresľovať hodnotenie kódovacích agentov. Pre vývojárov modelov je to pripomienka, že rast skóre nestačí bez kontroly kvality dát.
Hugging Face vydal LeRobot 0.6.0, veľkú aktualizáciu otvoreného robotického stacku. Nová verzia spája modely, ktoré si vedia predstavovať dôsledky akcií, jednotné benchmarky a praktickejšie nástroje pre tréning aj nasadenie politík na robotoch.
IBM Research a Hugging Face predstavili benchmark pre migrácie medzi Spring, Jakarta EE a Quarkus, ktorý hodnotí build, nasadenie aj testy namiesto porovnania s jedným referenčným diffom.
Nový benchmark má merať, či modely zvládnu nejednoznačné rozhodnutia v genomike a kvantitatívnej biológii, nielen mechanicky vykonať známy analytický postup.
Preprint Aloe-Vision predstavuje otvorenú rodinu medicínskych vision-language modelov v škálach 7B a 72B, tréningovú zmes Aloe-Vision-Data a benchmark CareQA-Vision. Dôležitý je najmä dôraz na reprodukovateľnosť a zistenie, že aj špecializované modely zostávajú zraniteľné voči zavádzajúcim vstupom.
Výskum Apple Machine Learning Research meria, ako korelované chyby znižujú prínos panelov LLM sudcov. Zistenie je dôležité pre firmy, ktoré chcú hodnotiť modely väčšinovým hlasovaním viacerých modelov.
Nový benchmark skúma nielen výsledok úlohy, ale aj cestu, počet krokov a správanie modelov pri práci s reálnymi nástrojmi a dokumentáciou.
Nový preprint opisuje systém Edge-TSR pre cestnú percepciu na Jetson Orin Nano. Sleduje aj javy, ktoré klasické benchmarky často nezachytia: kolísanie v čase, prehrievanie a stabilitu streamu.
Preprint navrhuje praktické hodnotenie long-form simultánneho speech-to-speech prekladu. Namiesto krátkych segmentov sleduje kvalitu a latenciu v dlhom prúde reči, čo lepšie zodpovedá reálnym stretnutiam a prednáškam.
Nový arXiv preprint predstavuje AfriSUD, kolekciu syntakticky anotovaných dát pre deväť afrických jazykov. Práca je dôležitá pre hodnotenie NLP modelov mimo jazykov, ktoré dominujú dnešným benchmarkom.
Preprint preveruje verejné medicínske vision-language benchmarky a varuje, že časť výsledkov môže byť ovplyvnená prekryvom s dátami dostupnými pri predtréningu.