ARBITRAGE zrýchľuje matematické uvažovanie LLM až dvojnásobne, zatiaľ však iba v testoch
Výskumníci z UC Berkeley, Apple, ICSI a LBNL navrhli router, ktorý pri každom kroku odhaduje, či sa oplatí zapojiť výkonnejší jazykový model. Na matematických benchmarkoch hlásia až približne dvojnásobné zníženie latencie pri porovnateľnej presnosti, no výsledky pochádzajú z preprintu, vybraných otvorených modelov a kontrolovaného hardvéru.
Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.
- Typ zdroja
- Výskumná práca
- Zdroj / autorita
- UC Berkeley, Apple a spoluautori
Ako vznikol tento text
Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.
Text je zaradený v sekcii AI výskum a opiera sa o 5 zdrojov. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.
Staršia práca, ktorú Apple zaradilo do svojho katalógu
ARBITRAGE nie je nový model ani spôsob, ako skrátiť odpoveď odstránením krokov uvažovania. Je to rámec na rozdeľovanie práce medzi menší návrhový model a výkonnejší cieľový model počas generovania viacstupňového riešenia. Apple ho v auguste 2026 zaradilo do svojho katalógu Machine Learning Research, samotný preprint však vznikol skôr: prvá verzia bola odovzdaná na arXiv 4. decembra 2025 a aktuálna druhá verzia pochádza z 9. decembra 2025. Presnejšie je preto hovoriť o neskoršom oficiálnom zviditeľnení práce, nie o augustovej premiére metódy.
Aj autorstvo je širšie, než naznačoval pôvodný titulok. Na práci sa podieľali výskumníci z UC Berkeley, Apple, International Computer Science Institute a Lawrence Berkeley National Laboratory; firemnú afiliáciu Apple má podľa projektovej stránky jeden zo spoluautorov. Toto spresnenie nemení technický význam výsledku, ale zabraňuje tomu, aby sa spoločný akademicko-priemyselný výskum prezentoval ako samostatný produkt Apple. Práca je zatiaľ 22-stranový preprint a v overených podkladoch nie je uvedené prijatie na recenzovanú konferenciu.
Problém, ktorý autori riešia, je praktický. Jazykový model vytvára text autoregresívne, teda token po tokene, pričom pri každom kroku opakovane načítava veľké množstvo parametrov. Dlhé matematické postupy preto zvyšujú čas čakania aj náklady na inferenciu. Nezávislý prehľad Google Research potvrdzuje širší základ tejto optimalizácie: klasické špekulatívne dekódovanie používa rýchlejší návrh a paralelnú kontrolu silnejším modelom. Google pri pôvodnej metóde uvádzal zrýchlenia približne dvoj- až trojnásobne pri preklade a sumarizácii a opisuje aj jej nasadenie v produkčných službách.
Router namiesto slepého odmietania návrhov
Klasické špekulatívne dekódovanie porovnáva návrh na úrovni tokenov. To umožňuje pri správne navrhnutom algoritme zachovať distribúciu výstupu cieľového modelu, ale pri dlhom uvažovaní môže byť presná textová zhoda príliš prísna. Dva modely môžu ten istý matematický krok zapísať inými slovami alebo odlišným poradím operácií. Tokenový verifikátor potom môže odmietnuť významovo prijateľný návrh len pre povrchový rozdiel. Krokové metódy tento problém zmierňujú tým, že hodnotia celé časti postupu, napríklad úsek ukončený dvojitou novou čiarou.
Doterajšie krokové prístupy, s ktorými sa ARBITRAGE porovnáva, používajú procesný odmeňovací model a globálny prah kvality. Keď skóre návrhového kroku klesne pod prah, výkonnejší model krok vygeneruje znova. Slabinou je, že nízke absolútne skóre návrhu ešte neznamená, že cieľový model vytvorí niečo lepšie. Autori pri analyzovanom nastavení uvádzajú, že pri 70-percentnej miere odovzdania cieľovému modelu bolo približne 40 percent všetkých krokov regenerovaných bez zlepšenia podľa použitého odmeňovacieho modelu. Ide o meranie autorov, nie o všeobecný údaj pre všetky LLM.
ARBITRAGE preto odhaduje relatívnu výhodu. Menší model najprv pripraví celý krok a ľahký naučený router z kontextu a návrhu predpovie pravdepodobnosť, že cieľový model vytvorí podstatne lepšie pokračovanie. Ak odhad neprekročí nastavený prah, návrh sa ponechá; v opačnom prípade sa úloha eskaluje silnejšiemu modelu. Prah umožňuje meniť kompromis medzi výkonom a kvalitou. Teoretický „oracle“ pozná skóre oboch alternatív, praktický router sa jeho rozhodnutia iba učí napodobniť bez toho, aby bolo nutné zakaždým spustiť drahšiu vetvu.
Čo testy dokazujú a čo ešte nie
Autori hodnotili rámec na matematických súboroch MATH500 a OlympiadBench. Projektová stránka uvádza dvojice Llama 3 s návrhovým modelom s jednou miliardou parametrov a cieľovým modelom s ôsmimi miliardami, dvojicu 8B a 70B a tiež Qwen2.5-Math, kde návrhovú úlohu plnil trojbitovo kvantizovaný 7B model a cieľom bol plnohodnotný 7B model. Výsledky podľa článku posúvajú kompromis medzi presnosťou a podielom prijatých návrhov oproti Reward-guided Speculative Decoding a v najlepších konfiguráciách znižujú latenciu až približne dvojnásobne pri zhodnej presnosti.
Formulácia „až dvojnásobne“ označuje najlepší nameraný bod, nie garantované zrýchlenie každého LLM. Prínos závisí od rozdielu v rýchlosti a schopnostiach oboch modelov, kvality routera, dĺžky jednotlivých krokov, miery eskalácie a konkrétneho GPU prostredia. Rámec navyše potrebuje popri dvoch generátoroch procesný odmeňovací model a naučený router. Verejný repozitár obsahuje hlavný program, skripty pre servery založené na vLLM alebo SGLang a režimy pre základnú metódu, oracle, router aj tvorbu tréningových dát, takže postup možno skúmať a reprodukovať.
Otvorený kód ešte nepredstavuje nezávislú replikáciu výsledkov. Repozitár pri overení nemal vydané verzie a uvádzal len niekoľko commitov; publikované grafy a tvrdenia preto stále pochádzajú od rovnakého autorského tímu. Hodnotenie sa sústreďuje na matematiku a na presnosť konečnej odpovede, respektíve skóre procesného odmeňovacieho modelu. Nie je známe, či sa rovnaký router prenesie na programovanie, právne texty, slovenčinu, dlhé agentické plány alebo úlohy, v ktorých nesprávny medzikrok môže mať bezpečnostný dosah.
Význam pre slovenské a európske nasadenia
Pre slovenské firmy, ktoré modely prevádzkujú v cloude alebo na vlastných GPU, je zaujímavý najmä princíp selektívnej eskalácie. Rutinné časti odpovede môže obslúžiť lacnejší model a väčší model sa zapojí iba tam, kde router očakáva merateľný prínos. Takýto prístup môže znížiť čakaciu dobu a spotrebu drahého výpočtového času pri asistencii s kódom, analytike či agentických pracovných postupoch. Pred nasadením by však bolo potrebné znovu kalibrovať prah na slovenských dátach a merať nielen priemernú presnosť, ale aj zlyhania v rizikových prípadoch.
Efektívnejšia inferencia má aj európsky energetický rozmer, hoci ARBITRAGE spotrebu elektriny priamo nemeral. Európska centrálna banka upozornila, že rast dopytu dátových centier môže vytvárať tlak najmä v lokálnych elektrizačných sústavách a že dopad závisí od koncentrácie centier aj vlastností národného trhu. Menej volaní veľkého modelu môže teoreticky znížiť energiu potrebnú na jednu odpoveď, no úsporu môže vymazať vyšší počet požiadaviek alebo réžia ďalších komponentov. Bez merania energie na rovnakom hardvéri nemožno z publikovaného zrýchlenia odvodiť konkrétnu ekologickú úsporu.
Najdôležitejším výsledkom práce preto nie je samotné číslo 2×, ale zmena rozhodovacieho kritéria: výpočet sa nemá pridávať preto, že návrh vyzerá slabo, ale iba vtedy, keď má výkonnejší model reálnu šancu priniesť lepší krok. Je to sľubný smer pre lacnejšie uvažujúce systémy a verejný kód uľahčuje ďalšie overovanie. Kým však nevzniknú nezávislé replikácie na širších úlohách, produkčných záťažiach a európskych jazykoch, ARBITRAGE treba chápať ako výskumný prototyp s presvedčivými matematickými testami, nie ako univerzálny recept na dvojnásobné zrýchlenie AI.
Zdroje
- Arbitrage: Efficient Reasoning via Advantage-Aware Speculation – Apple Machine Learning Research
- Arbitrage: Efficient Reasoning via Advantage-Aware Speculation – arXiv:2512.05033
- SqueezeAILab/Arbitrage – verejná implementácia
- Looking back at speculative decoding – Google Research
- The increasing energy demand of artificial intelligence and its impact on commodity prices – ECB