Nový preprint hľadá štruktúru v pravdepodobnostných tenzoroch cez algebraické podpisy
Práca z arXivu navrhuje, aby sa niektoré pravdepodobnostné modely identifikovali podľa miznúcich binomických vzťahov namiesto priameho odhadu parametrov.
Tag
Všetky publikované články, v ktorých sa téma interpretovateľnosť objavuje ako dôležitý kontext. Aktuálne 10 textov v archíve.
Práca z arXivu navrhuje, aby sa niektoré pravdepodobnostné modely identifikovali podľa miznúcich binomických vzťahov namiesto priameho odhadu parametrov.
Nový preprint navrhuje prenositeľný prahový rámec pre medicínske dáta. Namiesto čiernej skrinky používa štatisticky vedené prahy a Bernoulliho naivný Bayes, aby klinické rozhodnutia zostali reprodukovateľné a vysvetliteľné.
Nový arXiv preprint navrhuje G-DNMF, viacvrstvovú faktorizáciu pre rozpoznávanie objektov v radarových snímkach. Zaujímavý je najmä tým, že rieši interpretovateľnosť modelov v bezpečnostne citlivom videní.
Výskumníci Apple opisujú mechanistický problém v bezpečnostnom ladení jazykových modelov: pri viacerých modeloch stačilo potlačiť alebo zosilniť jediný identifikovaný neurón, aby sa zmenilo odmietanie škodlivých požiadaviek.
Apple opisuje MemoryLLM, výskumný prístup na oddelenie feed-forward vrstiev od self-attention. Cieľom je lepšie pochopiť, ako tokeny pristupujú k pamäťovým miestam v parametroch a či sa časť výpočtu dá presúvať medzi VRAM a úložiskom.
Nová práca na arXive navrhuje geometrický rámec na identifikáciu a úpravu konkrétnych pamäťových stôp v modeloch. Tvrdí, že niektoré naučené znalosti možno skladať alebo mazať lineárnymi operáciami bez opakovaného tréningu.
Štúdia na siedmich jazykových modeloch ukazuje, že pri riadení správania modelu nestačí sledovať iba smer zásahu. Uhol nesie väčšinu konceptovej informácie, no veľkosť skrytého stavu rozhoduje o stabilite a vedľajších účinkoch.
Nový arXiv preprint opisuje V-os: jednorozmerný smer emočnej valencie odvodený z LLM iba z deviatich viet. Smer sa prenáša medzi 14 modelmi, koreluje s EEG 123 ľudí sledujúcich afektívne videá, no pokročilé zarovnávacie stratégie dekódovanie nezlepšili.
Preprint navrhuje výpočtovo dostupnú mieru komplexity modelov založenú na podobnosti gradientov. Má fungovať pre parametrické aj kernelové modely.
Štúdia porovnávajúca Integrated Gradients, Attention Rollout a SHAP upozorňuje, že pri diagnostike jazykových modelov neexistuje univerzálne vysvetlenie. Najstabilnejšie sa podľa autorov ukazujú gradientové atribúcie, kým attention a model-agnostic prístupy majú vlastné kompromisy.