ARCHead zmenšuje výstupnú hlavu jazykového modelu bez uloženia hustej BF16 vrstvy
Navrhnutá kompresia spája nízkohodnostné jadro, skupinové INT4 rezíduá a korekciu odvodenú z aktivácií. Na Qwen3-8B-Base znížila úložisko LM-head približne 3,7- až 3,9-násobne.