Výber blokov na odstránenie z LLM rieši nová metóda ako fyzikálny optimalizačný problém
Výskumníci z Multiverse Computing previedli výber transformerových blokov na obmedzenú binárnu optimalizáciu. Pri 50-percentnom skrátení Llama 3.3 70B uvádzajú takmer 23-bodový náskok v MMLU oproti iným metódam odstraňovania blokov.
Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.
- Typ zdroja
- Výskumná práca
- Zdroj / autorita
- Multiverse Computing / arXiv
Ako vznikol tento text
Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.
Text je zaradený v sekcii AI výskum a opiera sa o 4 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.
Namiesto poradia blokov rozhodujú ich vzájomné väzby
Výskumníci z Multiverse Computing predstavili postup, ktorý vyberá celé transformerové bloky na odstránenie pomocou obmedzenej binárnej optimalizácie. Každému bloku priradí binárne rozhodnutie — ponechať alebo odstrániť — a hľadá kombináciu s čo najmenším predpokladaným poškodením modelu. Novinkou nie je samotné hĺbkové prerezávanie, ale spôsob hodnotenia kombinácií. Namiesto izolovaného zoradenia blokov podľa dôležitosti metóda modeluje aj to, ako sa účinok jedného odstráneného bloku mení v prítomnosti ďalších odstránených blokov. Autori úlohu mapujú na Isingov spinový systém, známy zo štatistickej fyziky, a nízku energiu systému používajú ako zástupný ukazovateľ kvality skráteného modelu.
Bežné heuristiky často vyhodnotia každý blok samostatne alebo odstránia jeden súvislý úsek vrstiev. Takýto postup je výpočtovo jednoduchý, no prehliada interakcie medzi vrstvami. Blok, ktorý sa samostatne javí ako nadbytočný, môže byť dôležitý po odstránení iného bloku. Počet možných kombinácií pritom rastie exponenciálne. Pri modeli s 80 blokmi a požiadavke odstrániť osem z nich existujú desiatky miliárd možností. Nový postup preto najprv vytvorí lacnejšiu energetickú aproximáciu a až podľa nej vyhľadáva sľubné konfigurácie, namiesto toho, aby každú konfiguráciu spúšťal cez celý súbor benchmarkov.
Základom aproximácie je rozšírenie straty modelu druhého rádu vzhľadom na premenné, ktoré zapínajú alebo vypínajú jednotlivé bloky. Diagonálne členy približnej Hessovej matice zachytávajú samostatný význam blokov, zatiaľ čo mimodiagonálne členy opisujú ich párové väzby. Výpočet matice vyžaduje dopredné a spätné priechody na menšom kalibračnom súbore, no následné ohodnotenie ďalšej kombinácie je už podstatne lacnejšie než reálna inferencia a evaluácia modelu. Rovnakú maticu možno podľa autorov použiť pre viac cieľových úrovní kompresie.
Najväčší rozdiel sa ukázal pri hlbokej kompresii
Najvýraznejší uvádzaný výsledok sa týka modelu Llama 3.3 70B Instruct. Pri odstránení polovice blokov dosiahla nová metóda v MMLU takmer o 23 percentuálnych bodov viac než porovnávané metódy odstraňovania blokov. Ide o relatívne náročný režim: pri ľahkom skrátení dokáže vyhovujúce riešenie nájsť viacero heuristík, no pri 50-percentnej redukcii sa následky nesprávnej kombinácie vrstiev násobia. Výsledok preto nepoukazuje len na všeobecnú redundanciu veľkých modelov, ale najmä na význam spoločného výberu blokov.
Autori metódu skúšali aj na Llama 3.1 8B Instruct a Qwen3 14B, a to pred ľahkým dotrénovaním aj po ňom. Pri miernejších úrovniach kompresie bol postup podľa práce približne na úrovni porovnávaných metód. Tvrdenie teda nie je, že fyzikálna formulácia automaticky vyhrá pri každom modeli a každom rozpočte. Jej hlavná výhoda sa ukazuje tam, kde treba odstrániť veľa blokov a jednoduché lokálne skóre už nevystihuje kombinované poškodenie modelu.
Experimenty zahŕňajú aj heterogénnejší model NVIDIA Nemotron 3 Nano 30B A3B FP8, v ktorom sa striedajú rôzne typy vrstiev a mixture-of-experts komponenty. Autori uvádzajú lepšie výsledky v AIME 2025 a GPQA než pri metóde založenej na vplyve jednotlivých blokov, keď odstránili dve attention vrstvy alebo tri MoE vrstvy. Tento test je dôležitý, pretože rovnomerný dense transformer predstavuje jednoduchší prípad. Pri architektúre, kde bloky nemajú rovnakú funkciu ani výpočtovú cenu, potrebuje kompresný algoritmus rozlišovať viac než iba ich pozíciu v sieti.
Praktický prínos nie je iba menší súbor s váhami
Odstránenie celých blokov má oproti neštruktúrovanému prerezávaniu praktickú výhodu: výsledný model zostáva zložený z hustých maticových operácií, ktoré dnešné GPU a inferenčné knižnice vykonávajú efektívne. Nulovanie jednotlivých váh môže zmenšiť počet matematicky aktívnych parametrov, ale bez vhodnej podpory riedkych matíc neprinesie úmerné zrýchlenie. Kratšia sekvencia transformerových blokov naopak priamo redukuje počet postupných výpočtov, takže potenciálne znižuje latenciu aj pamäťové nároky. Hĺbkové prerezávanie možno navyše kombinovať s kvantizáciou, low-rank kompresiou alebo ďalším doladením.
Pre menšie európske a slovenské tímy je zaujímavý najmä scenár, v ktorom už existuje vhodný otvorený model, ale jeho prevádzka je pridrahá. Systematické odstránenie blokov môže byť lacnejšou cestou než trénovanie menšieho modelu od začiatku alebo rozsiahla destilácia s veľkým učiteľským modelom. Pred produkčným nasadením by však tím musel zopakovať evaluáciu na vlastných úlohách: napríklad na slovenčine, firemných dokumentoch, extrakcii údajov alebo volaní nástrojov. Dobré priemerné skóre v MMLU nezaručuje zachovanie schopností, ktoré sú dôležité v konkrétnej aplikácii.
Metóda tiež neposkytuje kompresiu úplne zadarmo. Vytvorenie aproximácie potrebuje kalibračné dáta, gradientové výpočty a dostatok pamäte na odhad interakcií. Pri presnom prehľadávaní môže byť kombinatorický priestor stále veľmi veľký: blog autorov uvádza, že kontrola približne 29 miliárd možností pre odstránenie ôsmich z 80 blokov trvala približne dva dni na jednej GPU. Pri väčších úlohách preto používajú heuristické riešiče. Výskumná práca tvrdí, že kvalitné približné riešenia možno v realistických prípadoch nájsť rýchlo, no tento výsledok bude potrebné nezávisle reprodukovať na širšom výbere architektúr.
Čo výsledky zatiaľ nedokazujú
Uvedené porovnania pochádzajú od autorov metódy a článok je zverejnený ako preprint na arXive, nie ako potvrdený výsledok nezávislej recenznej replikácie. Takmer 23-bodový rozdiel navyše opisuje konkrétny model, benchmark a veľmi hlbokú úroveň kompresie. Nemožno ho automaticky preniesť na generovanie kódu, viacjazyčné úlohy, dlhý kontext ani agentické pracovné postupy. Prerezaný model môže tiež zachovať odpovede vo vedomostnom teste, ale zmeniť kalibráciu, bezpečnostné správanie alebo stabilitu pri dlhších konverzáciách.
Širší výskum napriek tomu potvrdzuje, že štruktúrované prerezávanie je aktívna a prakticky motivovaná oblasť. Staršia práca o neúčinnosti hlbších vrstiev ukázala, že z niektorých otvorených modelov možno po krátkom „hojení“ odstrániť veľkú časť vrstiev bez okamžitého kolapsu v otázkových benchmarkoch. Iný novší postup Putri kombinuje prerezávanie feed-forward častí, aktualizáciu zostávajúcich váh a odstraňovanie jednotlivých attention hláv. Nová Isingova formulácia sa od nich líši tým, že sa sústreďuje na kombinatorický výber celých blokov a explicitne zachytáva ich párové interakcie.
Najdôležitejším ďalším testom bude produkčný profil: skutočná priepustnosť, latencia prvého tokenu, spotreba pamäte a kvalita na doménových dátach po exporte do bežných inferenčných systémov. Už teraz však práca ukazuje užitočný posun v uvažovaní. Otázka nemusí znieť iba „ktoré vrstvy sú najmenej dôležité“, ale „ktorá spoločná zostava odstránených vrstiev spôsobí najmenšiu škodu“. Pri čoraz hlbších a heterogénnejších modeloch môže byť práve toto rozlíšenie rozhodujúce pre to, či kompresia prinesie použiteľný menší model alebo iba rýchlejšiu, no výrazne horšiu verziu pôvodného systému.
Zdroje