ARCHead zmenšuje výstupnú hlavu jazykového modelu bez uloženia hustej BF16 vrstvy
Navrhnutá kompresia spája nízkohodnostné jadro, skupinové INT4 rezíduá a korekciu odvodenú z aktivácií. Na Qwen3-8B-Base znížila úložisko LM-head približne 3,7- až 3,9-násobne.
Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.
- Typ zdroja
- Výskumná práca
- Zdroj / autorita
- arXiv
Redakčný kontext
Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov. Zodpovednú kontrolu pravidiel robí Marek Považský.
Článok je zaradený v sekcii AI výskum a opiera sa o 1 zdroj.
Nová výskumná práca predstavuje ARCHead, metódu na kompresiu výstupnej hlavy veľkých jazykových modelov. Autori sa zamerali na časť modelu, ktorá sa pri bežnej kvantizácii často prehliada: finálnu projekciu z interných reprezentácií na skóre celého slovníka. Hoci transformerové bloky možno uložiť v štvorbitovej alebo inej úspornej reprezentácii, LM-head zostáva v mnohých praktických backendových zostavách vo formáte BF16 alebo FP16 a môže zaberať významnú časť pamäte.
Výstupná hlava má pri modeloch s veľkým slovníkom rozsiahlu maticu. Každý krok generovania cez ňu vytvára logity pre možné nasledujúce tokeny. Naivné zníženie presnosti tejto matice môže výrazne zmeniť rozdelenie logitov, pretože aj malé chyby vo váhach sa premietnu do poradia tisícov kandidátnych tokenov. Dôsledkom môže byť rast perplexity alebo zmena správania modelu, aj keď zvyšok siete prešiel overenou kvantizáciou.
ARCHead kombinuje tri kompresné prvky. Základom je kvantizované nízkohodnostné jadro, ktoré zachytáva dominantnú štruktúru projekcie. Zvyšnú chybu reprezentujú skupinové INT4 rezíduá. Poslednou časťou je nízkohodnostná korekcia prispôsobená metrike odvodenej z aktivácií modelu. Namiesto optimalizácie iba podľa numerického rozdielu medzi pôvodnými a približnými váhami tak metóda zohľadňuje, ktoré smery chyby sú dôležité pri reálnych vstupných aktiváciách.
Podľa autorov ARCHead neuchováva žiadnu hustú kópiu hlavy vo formáte BF16. Trvalé úložisko LM-head znižuje približne 3,7- až 3,9-násobne. Na modeli Qwen3-8B-Base použila komprimovaná hlava 25,6 percenta priestoru pôvodnej BF16 reprezentácie a dosiahla relatívnu perplexitu 1,007. Hodnota blízka jednej znamená, že odchýlka od referenčného modelu bola v tomto meraní malá.
Autori porovnali výsledok aj s jednoduchšou INT4 kvantizáciou pri podobnom úložnom rozpočte. Tá dosiahla relatívnu perplexitu medzi 1,14 a 1,16, teda citeľne väčšie zhoršenie. Porovnanie podporuje základnú tézu práce, že výstupnú projekciu nemožno bez následkov spracovať rovnakým spôsobom ako ľubovoľnú veľkú maticu. Korekcia založená na aktiváciách má zachovať práve tie vlastnosti logitov, ktoré sú pre model pri používaní najdôležitejšie.
ARCHead má dopĺňať existujúce kvantizačné metódy, nie ich nahrádzať. Pri kombinácii s AWQ alebo bitsandbytes komprimuje BF16 hlavu, ktorú tieto zostavy môžu ponechať nedotknutú. V experimentoch autorov pridanie ARCHead zvýšilo krížovú entropiu iba o 0,006 až 0,007. Nameraná zmena priepustnosti bola menšia než dve percentá, čo naznačuje, že úspora trvalej pamäte nemusí byť vykúpená výrazným spomalením samotného generovania.
Praktický význam závisí od architektúry a spôsobu nasadenia. Pri modeli so zdieľanými vstupnými a výstupnými embeddingmi, menším slovníkom alebo backendom, ktorý už LM-head účinne kvantizuje, môže byť prínos odlišný. Pri veľkom slovníku a inak silno skomprimovaných blokoch sa však nezmenšená výstupná matica stáva nápadným zvyškom v pamäťovom rozpočte. Jej kompresia môže pomôcť modelu zmestiť sa na lacnejší akcelerátor alebo uvoľniť kapacitu pre KV cache a dlhší kontext.
Výsledky sú zatiaľ založené na preprinte s rozsahom 13 strán, ktorý bol odoslaný do procesu ACL Rolling Review. Nejde o recenzovanú a nezávisle reprodukovanú techniku. Abstrakt uvádza hlavné výsledky na Qwen3-8B-Base, no všeobecnosť bude potrebné overiť na viacerých rodinách modelov, veľkostiach slovníka, úlohách a inferenčných backendových implementáciách. Perplexita navyše nepokrýva všetky možné zmeny v kvalite generovania alebo v zriedkavých tokenoch.
Autori zverejnili aj kód, čo uľahčuje overenie a porovnanie s ďalšími kompresnými postupmi. Dôležitá bude najmä reprodukcia pri rovnakom celkovom pamäťovom rozpočte a meranie koncových úloh, nielen priemernej jazykovej straty. Pri produkčnom nasadení treba sledovať aj čas načítania, podporu kernelov a skutočnú špičkovú pamäť, pretože menší súbor váh automaticky nezaručuje rovnakú úsporu počas všetkých fáz inferencie.
ARCHead upozorňuje na širší problém kvantizácie: po optimalizácii najväčších transformerových blokov začnú rozhodovať časti, ktoré predtým tvorili iba menší podiel celku. Výstupná hlava je jednou z nich. Ak sa deklarovaná kvalita potvrdí aj mimo uvedeného modelu, prístup môže doplniť bežné štvorbitové balenia a znížiť posledný veľký blok váh uchovávaný vo vyššej presnosti bez potreby meniť základnú architektúru jazykového modelu.
Zdroje