aifeed.skAI Feed

Kategória

AI výskum

Výskumné práce, metódy, reprodukovateľné výsledky a posuny v bezpečnosti modelov.

AutoWorldModel-Bench meria, či AI agenti dokážu zlepšovať svetové modely
Výskum5 min čítania4 zdroje

AutoWorldModel-Bench meria, či AI agenti dokážu zlepšovať svetové modely

Aktualizovaná verzia benchmarku ukazuje zlepšenie východiskového svetového modelu v 63 zo 64 behov agentov Codex-5.4 a Claude Opus 4.6. Nové kontroly zahŕňajú scenárové testy, porovnanie s automatickým ladením, opakovanie s ďalšími seedmi a audit možného obchádzania metrík; stále však nejde o dôkaz plne autonómnej vedy.

IBM porovnal pamäť agentov s ACE: selektívne pokyny znížili objem kontextu
Výskum5 min čítania4 zdroje

IBM porovnal pamäť agentov s ACE: selektívne pokyny znížili objem kontextu

ALTK-Evolve premieňa skúsenosti AI agenta na samostatné, dohľadateľné pokyny a podľa úlohy načítava iba ich relevantnú časť. Interné porovnanie IBM na AppWorlde ukázalo podobnú alebo vyššiu úspešnosť než ACE pri výrazne menšom objeme spracovaných tokenov, výsledok však zatiaľ nemá nezávislú replikáciu.

Mean-field rámec riadi celé distribúcie výstupov difúznych modelov
Výskum5 min čítania4 zdroje

Mean-field rámec riadi celé distribúcie výstupov difúznych modelov

Nový mean-field rámec mení riadenie difúznych modelov počas inferencie z optimalizácie jednotlivých vzoriek na kontrolu celej výslednej distribúcie. Vážené interagujúce častice majú zachovať diverzitu alebo priblížiť súbor proteínových konformácií experimentálnym dátam, no praktické nasadenie zatiaľ obmedzuje výpočtová náročnosť a rozsah overenia.

Kvantilové mapovanie má obmedziť neférovosť sekvenčných rozhodnutí AI
Výskum5 min čítania4 zdroje

Kvantilové mapovanie má obmedziť neférovosť sekvenčných rozhodnutí AI

Nový preprint rozširuje kontrafaktuálnu férovosť na posilňované učenie pomocou sekvenčného mapovania kvantilov. Metódu overuje v simuláciách aj na dátach 12-týždňovej zdravotnej intervencie, no jej záruky závisia od správneho kauzálneho modelu a pred nasadením vyžaduje nezávislé klinické overenie.

Chunkovaná KL strata umožnila destilovať LLM s 32-tisícovým kontextom na jednom H200
Výskum5 min čítania5 zdrojov

Chunkovaná KL strata umožnila destilovať LLM s 32-tisícovým kontextom na jednom H200

Multiverse Computing spojilo offline uložené top-100 výstupy učiteľa s KL stratou, ktorá po blokoch prepočítava logity a nevytvára ich plnú maticu. Pri kompaktnom študentovi sa tak 32 768-tokenový tréning zmestil na jeden H200; zverejnené výsledky však pochádzajú z jediného tímu a ich prenos na iné modely zostáva otvorený.