aifeed.skAI Feed
AI výskum4 min čítania

Apple otestoval 1,7-miliardový neautoregresívny jazykový model v štyroch krokoch

Apple vytrénoval 1,7-miliardový základný flow model na 2,1 bilióna tokenov a samodestiláciou z neho vytvoril Categorical Flow Map, ktorá generuje text už v štyroch inferenčných krokoch. Výsledok rozširuje možnosti paralelného generovania, zatiaľ však nepreukazuje nižšiu latenciu ani vyššiu kvalitu oproti porovnateľným autoregresívnym modelom.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Výskumná práca
Zdroj / autorita
Apple Machine Learning Research

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI výskum a opiera sa o 3 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Jazykový model bez dekódovania token po tokene

Výskumníci Apple posunuli Categorical Flow Maps (CFM) z menších experimentov k 1,7-miliardovému jazykovému modelu. Základný flow model vytrénovali na 2,1 bilióna tokenov a následne ho samodestilovali do verzie, ktorá podľa autorov vytvára rozmanitý text už v štyroch inferenčných krokoch. Dôležitou novinkou oproti samotnému údaju o veľkosti je aj zavedenie hranice vierohodnosti pre semidiskrétny model. Tá umožňuje hodnotiť CFM na štandardných jazykových benchmarkoch, nielen porovnávať vybrané ukážky textu. Apple uvádza výsledky v rovnakom rozsahu ako pri diskrétnych difúznych metódach, nie však jasné prekonanie moderných autoregresívnych modelov.

Bežný veľký jazykový model generuje ďalší token podmienený všetkými predchádzajúcimi tokenmi. Takéto autoregresívne dekódovanie je presné a dobre preskúmané, no jednotlivé kroky na seba nadväzujú, čo obmedzuje paralelizáciu. Flow matching pracuje inak: model sa učí transformovať jednoduché počiatočné rozdelenie na cieľové dátové rozdelenie a počas inferencie postupne upravuje celú reprezentáciu. Pri texte vzniká osobitný problém, pretože slová a tokeny sú diskrétne kategórie. CFM ho rieši spojením Gaussovho rozdelenia s one-hot reprezentáciou tokenov v kontinuálnom priestore, z ktorého sa výsledok napokon prevedie späť na konkrétne tokeny.

Čo ukazuje škálovanie a samodestilácia

Samotný základný model ešte negeneruje text iba v štyroch krokoch. Krátku trajektóriu dosahuje až samodestilovaný CFM, ktorý sa učí napodobniť dlhší proces vlastného učiteľského modelu. Praktický význam spočíva v tom, že jedna aktualizácia môže naraz meniť viacero pozícií v sekvencii. Model preto teoreticky nemusí vykonať stovky či tisíce striktne po sebe idúcich operácií zodpovedajúcich dĺžke odpovede. Autori zároveň hlásia tokenovú entropiu blízku dátam, čo naznačuje, že zrýchlený proces neskolaboval na úzky súbor opakujúcich sa výstupov. Entropia však sama nehovorí, či je text fakticky správny, logicky konzistentný alebo užitočný.

Nová hranica vierohodnosti rieši metodický nedostatok modelov, ktoré nemajú rovnakú pravdepodobnostnú faktorizáciu ako autoregresívne LLM. Umožňuje odvodiť skóre použiteľné na zaužívaných jazykových testoch a kontrolovať, či dobrý dojem z generovaných ukážok zodpovedá merateľnému správaniu. Apple výsledky formuluje opatrne: CFM sa dostáva do pásma diskrétnych difúznych metód. Nejde teda o dôkaz, že štyri kroky prinášajú kvalitu špičkového konverzačného modelu, ani o priame porovnanie ceny jedného výstupu na rovnakom hardvéri.

Nezávislý kontext poskytuje práca Discrete Flow Matching, ktorá už skôr škálovala diskrétny flow model na 1,7 miliardy parametrov a ukázala neautoregresívne generovanie textu aj kódu. Ide však o odlišnú formuláciu: diskrétny flow pracuje priamo s pravdepodobnostnými cestami nad kategóriami, zatiaľ čo Apple skúma kontinuálny proces medzi Gaussovým šumom a one-hot dátami. Obe línie potvrdzujú, že neautoregresívne jazykové modelovanie už nie je obmedzené na malé demonštrácie. Súčasne ukazujú, že porovnanie architektúr musí zohľadniť nielen počet parametrov, ale aj tréningové dáta, počet krokov, kvalitu vzoriek a celkový výpočtový rozpočet.

Štyri kroky ešte neznamenajú štvornásobnú rýchlosť

Počet inferenčných krokov nemožno priamo zameniť za latenciu. Jeden krok CFM môže spracúvať všetky pozície a vyžadovať veľké maticové operácie, viac pamäte či opakovaný výpočet nad celou sekvenciou. Autoregresívne systémy zasa využívajú KV cache, optimalizované jadrá a desaťročie hardvérového a softvérového ladenia. Reálny test by preto musel porovnať čas do prvého použiteľného výstupu, celkový čas generovania, spotrebu energie, priepustnosť pri dávkovaní a kvalitu pri rovnakej úlohe. Apple vo verejnom súhrne takéto produkčné benchmarky neuvádza.

Ak sa výhoda potvrdí, najzaujímavejšie použitie nemusí byť obyčajný chatbot. Súbežná úprava pozícií môže pomôcť pri dopĺňaní chýbajúcich častí textu, prepisovaní dokumentu pod globálnymi obmedzeniami alebo generovaní viacerých variantov s určeným štýlom a štruktúrou. Flow modely prirodzene ponúkajú aj takzvaný tilting, teda smerovanie distribúcie k požadovaným vlastnostiam. V praxi by to mohlo znamenať lepšiu kontrolu formátu či terminológie, musí sa však overiť, či zásah neznižuje faktickosť a či funguje pri dlhých dokumentoch.

Pre slovenské organizácie by prípadná nižšia latencia alebo lepšia paralelizácia bola zaujímavá najmä pri lokálnom spracovaní dokumentov, prekladoch a verejných službách, kde cena inferencie obmedzuje širšie nasadenie. Výskum zatiaľ neobsahuje samostatné výsledky pre slovenčinu ani informácie o jazykovom zložení 2,1 bilióna tréningových tokenov. Bez takých údajov nemožno predpokladať, že model zvláda morfológiu, diakritiku a odbornú terminológiu menších európskych jazykov rovnako dobre ako angličtinu.

Európsky kontext a otvorené otázky

V Európskej únii by komerčné nasadenie podobného všeobecného jazykového modelu nebolo iba otázkou rýchlosti. Pravidlá AI Act pre poskytovateľov modelov na všeobecné použitie zahŕňajú transparentnosť a povinnosti súvisiace s autorským právom; pri modeloch so systémovým rizikom sa pridáva hodnotenie a zmierňovanie rizík. Európska komisia zároveň vyžaduje verejný súhrn tréningového obsahu podľa príslušnej šablóny. Výskumné oznámenie Apple nie je produktovou dokumentáciou ani dôkazom súladu, no chýbajúce podrobnosti o dátach by pri prípadnom uvedení modelu na trh nadobudli praktický význam.

Otvorená zostáva kvalita dlhých odpovedí, práca s premenlivou dĺžkou, faktická spoľahlivosť, bezpečnostné ladenie a schopnosť používať nástroje. Autori upozorňujú aj na problémy škálovania a ponúkajú odporúčania pre váženie stratovej funkcie a časový rozvrh tréningu. Jednotlivé časti flow trajektórie totiž nemusia byť rovnako náročné ani rovnako dôležité. Nevhodné vzorkovanie času môže plytvať výpočtom alebo zhoršiť tie fázy transformácie, ktoré rozhodujú o konečnom texte. Tieto poznatky sú cenné, no ich prenos na väčšie modely zatiaľ nebol verejne potvrdený.

Najpresnejšie je preto výsledok čítať ako dôkaz škálovateľnosti jednej alternatívnej architektúry, nie ako nástupcu dnešných LLM. Apple ukázal, že kontinuálny flow model možno trénovať na biliónoch tokenov, destilovať do niekoľkých krokov a hodnotiť pomocou pravdepodobnostnej hranice. Ďalším potrebným krokom sú reprodukovateľné benchmarky proti rovnako veľkým autoregresívnym a diskrétnym flow modelom, merania na reálnom hardvéri a testy naprieč jazykmi. Až tie ukážu, či menší počet krokov prinesie aj nižšiu cenu a lepšiu odozvu bez neprijateľnej straty kvality.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie