aifeed.skAI Feed
AI modely5 min čítania

Liquid AI zrýchľuje obrazovo-jazykový model LFM2.5-VL pomocou špekulatívneho dekódovania

Experimentálny model LFM2.5-VL-3B-DSpark má zrýchliť generovanie až 3,13-násobne na Apple Silicon a 2,66-násobne na GPU H100 bez zmeny výstupu cieľového modelu.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Oficiálny zdroj
Zdroj / autorita
Liquid AI

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI modely a opiera sa o 4 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Liquid AI sprístupnila experimentálny pomocný model LFM2.5-VL-3B-DSpark, ktorý prináša špekulatívne dekódovanie do jej trojmiliardového obrazovo-jazykového modelu LFM2.5-VL-3B. Namiesto zmenšovania hlavného modelu alebo znižovania presnosti sa systém pokúša urýchliť samotné generovanie: menší model navrhne niekoľko ďalších tokenov a pôvodný model ich naraz overí. Výrobca uvádza zrýchlenie dekódovania až 3,13-násobne na čipe Apple M5 Max, 2,14-násobne na M3 Ultra a 2,66-násobne na jednej GPU Nvidia H100. Dôležitejšie je, že podpora nie je obmedzená na ukážkový kód. Príslušné zmeny už pribudli do SGLang a llama.cpp, pričom pre Apple Silicon je dostupná integrácia s MLX-VLM.

Malý model navrhuje, veľký rozhoduje

Špekulatívne dekódovanie rozdeľuje generovanie medzi dva modely. Menší a lacnejší „drafter“ pripraví blok kandidátskych tokenov, no konečné rozhodnutie zostáva na cieľovom LFM2.5-VL-3B. Ten návrhy overí a prijme iba tie, ktoré zodpovedajú jeho vlastnému výpočtu. Pri deterministickom generovaní s nulovou teplotou má byť preto výsledok totožný s výstupom samostatne spusteného cieľového modelu. Pri zhodných nastaveniach náhodného vzorkovania má metóda zachovať jeho výstupné rozdelenie. Nejde teda o náhradu modelu aproximáciou, ale o spôsob, ako obmedziť počet drahých sekvenčných krokov hlavného modelu.

LFM2.5-VL-3B-DSpark má 279,5 milióna parametrov, čo predstavuje približne 8,9 percenta veľkosti trojmiliardového cieľa. Tvoria ho štyri vrstvy plnej pozornosti, projekcia skrytých stavov, Markovova hlava a malá hlava na odhad istoty. Počas tréningu pracoval s blokom deviatich tokenov; pri nasadení Liquid AI odporúča blok osem alebo deväť podľa hardvéru. Pomocný model využíva skryté stavy zachytené vo vybraných vrstvách cieľového modelu. Keďže obrazové záplaty aj textové tokeny už pred týmito vrstvami vstupujú do spoločnej reprezentácie, rovnaký mechanizmus môže pripravovať pokračovanie pri textových aj obrazovo-jazykových úlohách.

Tento detail odlišuje vydanie od bežného zrýchlenia textového modelu. Obrazovo-jazykový systém musí najprv spracovať obraz vo vizuálnom enkodéri a následne vložiť stovky obrazových tokenov do jazykovej časti. DSpark urýchľuje dekódovanie odpovede, nie analýzu obrazu ani úvodné spracovanie celého vstupu. Výsledný prínos preto závisí od pomeru medzi týmito fázami. Pri krátkej odpovedi na zložitý obrázok môže prefill dominovať a celkové zrýchlenie bude podstatne menšie než číslo namerané iba pri dekódovaní. Pri dlhších opisoch, konverzáciách alebo analytických odpovediach má zrýchlená fáza väčší podiel na celkovom čase.

Výsledky sa výrazne menia podľa úlohy a hardvéru

Liquid AI merala šesť typov úloh z rámca MMSpec: všeobecné vizuálne otázky, čítanie textu z obrazu, opis obrázkov, interpretáciu grafov, komplexné uvažovanie a viac-kolovú konverzáciu. Na jednej H100 dosiahlo dekódovanie podľa úlohy približne 2,04- až 2,66-násobné zrýchlenie, zatiaľ čo celý proces sa zrýchlil 1,64- až 2,27-násobne. Na M5 Max sa dekódovanie zrýchlilo 2,30- až 3,13-násobne a celkový čas 1,56- až 2,62-násobne. Pri M3 Ultra boli rozsahy nižšie: 1,57- až 2,14-násobok pri dekódovaní a 1,30- až 1,77-násobok od vstupu po dokončenie odpovede.

Tieto výsledky pochádzajú od autora modelu a zatiaľ ich nemožno považovať za nezávislý prierez produkčnými nasadeniami. Merania používali 16-bitové spracovanie, dávku s jedinou požiadavkou, nulovú teplotu a najviac 2 048 výstupných tokenov. Na H100 išlo o SGLang s blokom deväť, na zariadeniach Apple o blok osem. Čísla preto nehovoria, ako sa systém zachová pri kvantizovaných modeloch, súbežných používateľoch alebo odlišnej skladbe promptov. Sú však dostatočne konkrétne na to, aby ukázali rozdiel medzi zrýchlením samotného dekódovania a reálnym časom celej požiadavky.

Technické údaje zo začlenenej úpravy SGLang tento obraz dopĺňajú. Test na jednej H100 cez celý testovací súbor MMSpec so 600 vzorkami a 723 konverzačnými ťahmi zaznamenal približne 2,08-násobné celkové zrýchlenie a nárast z 258 na 537 tokenov za sekundu. Pri väčších dávkach však výhoda klesala: pri veľkosti dávky osem na 1,55-násobok, pri 32 na 1,32-násobok a pri 64 na 1,18-násobok. To naznačuje, že technika je najzaujímavejšia najmä pre interaktívne nasadenia s nízkou dávkou, kde je prioritou odozva jedného používateľa, nie maximálna agregovaná priepustnosť servera.

Podpora v troch odlišných inferenčných cestách

Modelová karta uvádza podporu v SGLang 0.5.19 alebo novšom pre GPU Nvidia a v MLX-VLM 0.7.2 alebo novšom pre Apple Silicon. Pre llama.cpp je pripravený samostatný checkpoint vo formáte GGUF. Modelové váhy sú dostupné aj vo formáte Safetensors pod licenciou LFM1.0. Nejde iba o deklarovanú kompatibilitu: úprava SGLang, ktorá sprístupnila DSpark pre architektúru LFM2-VL, bola zlúčená 22. septembra, a oprava konverzie vizuálneho cieľa v llama.cpp nasledovala 23. septembra. Druhá zmena zároveň opravila dvojité preusporiadanie rotačných pozičných reprezentácií pri pomocných modeloch LFM2 a LFM2.5.

Pre vývojárov je podstatné, že SGLang vystaví model cez rozhranie kompatibilné s OpenAI API. Existujúca aplikácia tak nemusí meniť formát požiadaviek; zmena sa odohrá na vrstve inferenčného servera. Na Apple Silicon sa pomocný model odovzdá MLX-VLM spolu s cieľovým checkpointom. Aktuálna implementácia DSpark v MLX-VLM je však podľa modelovej karty obmedzená na greedy dekódovanie, teda generovanie s teplotou nula. Tímy používajúce kreatívnejšie vzorkovanie musia pred nasadením overiť nielen rýchlosť, ale aj to, ktoré kombinácie runtime, formátu váh a nastavení generovania ich cesta skutočne podporuje.

Pre lokálne slovenské aplikácie môže byť zaujímavé najmä zníženie latencie na pracovných staniciach Apple a možnosť prevádzkovať obrazovo-jazykové úlohy bez odosielania snímok do cudzieho cloudu. Praktickými scenármi sú čítanie dokumentov, opis technických fotografií, triedenie vizuálnych podkladov alebo asistenčné rozhrania nad obrazovkou. Novinka však sama osebe nič nehovorí o kvalite slovenčiny ani o presnosti modelu pri slovenských dokumentoch. DSpark má zachovať správanie cieľového modelu, nie ho zlepšiť. Pred produkčným použitím preto treba samostatne merať OCR, porozumenie slovenským pokynom, halucinácie a čas spracovania typických domácich dokumentov.

Čo zatiaľ zostáva otvorené

Najväčšou neistotou je prenos laboratórnych výsledkov do zmiešanej prevádzky. Zverejnené merania pokrývajú dávku jedna a vybrané benchmarkové úlohy, no produkčné systémy často spájajú obrázky rôznych rozlíšení, veľmi dlhé kontexty, priebežné streamovanie a desiatky súbežných požiadaviek. Dodatočných 279,5 milióna parametrov je v percentách malý nárast, stále však spotrebúva pamäť a môže komplikovať plánovanie na zariadeniach s tesným limitom. Rozhodujúca bude aj miera prijatia navrhnutých tokenov: ak pomocný model často netrafí pokračovanie, cieľový model vykoná overenie bez zodpovedajúcej úspory.

LFM2.5-VL-DSpark je preto skôr hotový stavebný prvok na meranie než univerzálny prísľub trojnásobne rýchlejšej multimodálnej AI. Silnou stránkou vydania je kombinácia stiahnuteľných váh, konkrétnych výsledkov a súčasnej podpory vo viacerých inferenčných projektoch. Limity sú rovnako zreteľné: zrýchľuje sa iba jedna časť pipeline, výsledky závisia od hardvéru a pri rastúcej dávke sa náskok zmenšuje. Pre tímy prevádzkujúce LFM2.5-VL-3B lokálne alebo s nízkou latenciou má zmysel porovnať základný a špekulatívny režim na vlastných vstupoch. Až takéto meranie ukáže, či dodatočný pomocný model prináša úsporu aj mimo podmienok, ktoré zvolila Liquid AI.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie