ULoRA mení inicializáciu adaptérov na laditeľný priestor medzi gradientmi
Preprint Unified LoRA spája viacero gradientových inicializácií adaptérov do jednej dvojparametrovej rodiny. Autori tvrdia, že optimálna miera predpodmienenia závisí od úlohy, a predstavujú automatický variant, ktorý ju volí podľa spektrálnych štatistík vrstiev.
Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.
- Typ zdroja
- Kurátorovaný súhrn
- Zdroj / autorita
- arXiv
Redakčný kontext
Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov a zodpovednú kontrolu pravidiel robí Marek Považský.
Článok je zaradený v sekcii AI výskum a opiera sa o 3 zdroje.
LoRA zlacnila prispôsobovanie veľkých modelov tým, že namiesto všetkých váh trénuje malé nízkohodnostné adaptéry. Menej pozornosti sa však venuje tomu, z akých hodnôt sa tieto adaptéry spustia. Nový preprint Unified LoRA, skrátene ULoRA, tvrdí, že viacero doteraz oddelených inicializačných metód patrí do jedného spojitého priestoru. Voľba správneho bodu v ňom môže ovplyvniť kvalitu rovnako podstatne ako známe hyperparametre učenia.
Bežná LoRA rozkladá aktualizáciu veľkej matice na súčin dvoch menších matíc. Tým výrazne znižuje počet trénovaných parametrov a pamäťové nároky, no počiatočné nastavenie určuje, ktorým smerom sa adaptér začne učiť. Novšie metódy používajú gradient cieľovej úlohy: niektoré vyberú jeho hlavné smery, iné gradient najprv upravia odhadom zakrivenia stratovej plochy. Druhý prístup sa približuje prirodzenému gradientu, ktorý zohľadňuje geometriu optimalizačného problému.
Autori ukazujú, že surový gradient a jeho „vybielená“ verzia nie sú dve nesúvisiace voľby. Zostavili dvojparametrovú rodinu predpodmienených inicializácií. Prvý exponent riadi spektrálne bielenie, teda silu korekcie podľa dominantných smerov a zakrivenia. Druhý má charakter diagonálnej korekcie podobnej optimalizátoru Adam. Posúvaním týchto hodnôt možno plynulo prechádzať medzi jednoduchším gradientovým začiatkom a silnejšie geometricky upravenou inicializáciou.
Kľúčovým výsledkom je, že neexistuje jedna pevná sila predpodmienenia, ktorá by vyhrávala všade. Najlepší bod sa mení podľa dát, modelu a úlohy a často leží medzi publikovanými krajnými metódami. To spochybňuje prax, pri ktorej sa inicializácia vyberie podľa názvu algoritmu a ďalej sa neladí. Podobne ako learning rate alebo rank adaptéra by sa mala chápať ako samostatná návrhová dimenzia.
Pri úplnom prehľadaní priestoru a samostatnom ladení rýchlosti učenia dosiahla vybraná konfigurácia ULoRA na všetkých piatich skúmaných úlohách GLUE s modelom RoBERTa-base výkon porovnateľný alebo lepší než plné dolaďovanie. Na matematickom datasete GSM8K s LLaMA-2-7B bola konkurencieschopná so silnými základnými metódami. Ide o výsledky na konkrétnom súbore benchmarkov, preto ich nemožno automaticky preniesť na moderné veľké modely, multimodálne úlohy alebo produkčné domény.
Úplné prehľadávanie by však zmazalo časť úspor, ktoré robia LoRA atraktívnou. Autori preto navrhujú ULoRA-Auto. Tento variant meria spektrálne štatistiky jednotlivých vrstiev a na ich základe vyberie exponenty bez dodatočného hľadania. Podľa preprintu sa približuje k hornému výsledku ladenej rodiny a medzi nasaditeľnými metódami sa umiestňuje na popredných miestach. Praktická hodnota bude závisieť od ceny merania štatistík a stability na väčších architektúrach.
Pre tímy, ktoré dolaďujú modely na viaceré úlohy, prináša práca konkrétnu myšlienku: rozpočet netreba míňať iba na skúšanie ranku, learning rate a počtu epoch. Inicializácia môže rozhodnúť, či nízkohodnostný priestor zachytí užitočné smery hneď na začiatku. Lepší štart môže skrátiť konvergenciu, znížiť citlivosť na náhodu a obmedziť počet neúspešných behov. To je zaujímavé najmä tam, kde sú tréningové dáta malé alebo drahé.
Zároveň treba oddeliť metodický prínos od tvrdenia o univerzálnej prevahe. Porovnanie s plným dolaďovaním na piatich GLUE úlohách je povzbudivé, ale RoBERTa-base predstavuje staršiu a menšiu architektúru. GSM8K overuje úzky typ matematického uvažovania. Chýbajú zatiaľ rozsiahle testy na inštrukčnom dolaďovaní, dlhom kontexte, kóde, zrakovo-jazykových modeloch a distribuovanom tréningu. Preprint navyše ešte neprešiel recenzným konaním.
ULoRA je napriek týmto obmedzeniam hodnotná tým, že zjednocuje zdanlivo rozdielne techniky a ukazuje ich spoločné osi. Takéto zjednotenie môže zjednodušiť experimentovanie aj budúce porovnávania: namiesto súboja izolovaných názvov sa skúma kontrolovaný priestor. Ak sa automatická voľba parametrov potvrdí vo väčšom meradle, parameterovo úsporné dolaďovanie môže byť nielen lacnejšie než plný tréning, ale aj systematickejšie a menej závislé od ručne vybraného receptu.
Zdroje
