Hugging Face ukazuje, prečo pri pozornosti v PyTorch nestačí pozerať iba na jeden riadok kódu
Nový diel série o profilovaní v PyTorch rozoberá attention jadro, SDPA backendy a praktické pasce pri optimalizácii transformerov.
Kategória
Výskumné práce, metódy, reprodukovateľné výsledky a posuny v bezpečnosti modelov.
Nový diel série o profilovaní v PyTorch rozoberá attention jadro, SDPA backendy a praktické pasce pri optimalizácii transformerov.
Čerstvý arXiv preprint opisuje reprezentáciu sEMG signálov ako grafov svalovej aktivity. Autori hlásia 99 % presnosť a priemerný čas 48 ms na konštrukciu grafu aj predikciu, čo je zaujímavé pre protézy a rozšírenú realitu.
Nová interpretability štúdia Anthropic opisuje J-space: malú množinu vnútorných reprezentácií, ktoré sa správajú ako zdieľaný pracovný priestor modelu. Dôležité je, že nejde o dôkaz vedomia, ale o praktický nástroj na čítanie a ovplyvňovanie tichého uvažovania modelu.
Apple Machine Learning Research opisuje SRLM, rámec pre dlhokontextové úlohy, ktorý vyberá programy podľa sebareflexie, konzistencie a odhadovanej neistoty. Výsledky naznačujú, že samotná rekurzia pri dlhom kontexte nestačí.

IBM Research predstavil CoFrGeNets, architektúru pre generovanie jazyka, ktorá nahrádza pozornosť a feed-forward bloky v transformeroch kompaktnejšími komponentmi. Výsledky sú zatiaľ výskumné, ale ukazujú smer k menším modelom s nižšími nárokmi na tréning.
Nový arXiv preprint navrhuje jeden štatistický rámec pre viacero forenzných úloh okolo AI: od odhaľovania generovaného textu cez halucinácie až po watermarky a adversariálne príklady.
Nový preprint AgentLens navrhuje benchmark pre interaktívnych kódovacích agentov. Hodnotí, ako agent používa nástroje, overuje prácu, zotavuje sa z chýb a komunikuje počas riešenia.
Databricks a UPenn testovali agenta, ktorý mimo horúcej cesty query optimalizátora skúša rôzne poradia joinov a v experimentoch zlepšil latenciu oproti predvolenému optimalizátoru.
Výskumný príspevok Apple opisuje TGPO, tréningový postup s overiteľnými odmenami, ktorý má potláčať priestorové skratky a zlepšiť časové uvažovanie vo videách z egocentrického pohľadu.
Nová práca nehodnotí len kvalitu odhmlenia obrázkov, ale aj dopad na detekciu a sledovanie malých UAV. Ukazuje, že lepší obraz nemusí automaticky znamenať lepší percepčný systém.
Nová teoretická práca porovnáva Fourierovu a architektonickú zložitosť funkcií a ukazuje, kedy trénované neurónové siete získavajú exponenciálnu výhodu nad NTK limitom.
Čerstvý preprint navrhuje konvexnú aproximáciu neurónovej likelihood funkcie, aby sa neistota v zložitých vedeckých inverzných úlohách dala počítať stabilnejšie.