LFM2.5 prináša malé enkódery pre dlhé dokumenty, ktoré bežia rýchlo aj na CPU
Liquid AI vydáva otvorené enkódery s 230 a 350 miliónmi parametrov a kontextom 8 192 tokenov. Mieria na klasifikáciu, smerovanie požiadaviek, kontrolu pravidiel a detekciu citlivých údajov bez drahej GPU infraštruktúry.
Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.
- Typ zdroja
- Kurátorovaný súhrn
- Zdroj / autorita
- Liquid AI / Hugging Face
Redakčný kontext
Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov a zodpovednú kontrolu pravidiel robí Marek Považský.
Článok je zaradený v sekcii AI modely a opiera sa o 4 zdroje.
Liquid AI sprístupnilo dva všeobecné textové enkódery LFM2.5-Encoder-230M a LFM2.5-Encoder-350M. Sú určené na úlohy, pri ktorých systém nepotrebuje generovať dlhú odpoveď, ale rýchlo pochopiť alebo označiť celý vstup: klasifikovať dokument, nájsť citlivé údaje, vyhodnotiť pravidlá či nasmerovať požiadavku na správny model. Obe váhy sú dostupné na Hugging Face a podporujú kontext s dĺžkou 8 192 tokenov.
Enkóder sa od bežného generatívneho jazykového modelu líši spôsobom práce s textom. Namiesto postupného predpovedania ďalšieho tokenu vytvorí reprezentácie vstupu, z ktorých možno odvodiť triedu, skóre alebo značku pre každý token. To je praktické v produkčných potrubiach, kde by použitie veľkého konverzačného modelu bolo zbytočne pomalé, drahé a ťažšie kontrolovateľné. Typickým príkladom je filtrovanie osobných údajov pred odoslaním textu do cloudu alebo výber špecializovaného agenta podľa obsahu požiadavky.
Liquid AI vychádza z dekódovacích základov LFM2.5 s 230 a 350 miliónmi parametrov, no mení ich na obojsmerné enkódery. Každý token tak pri vytváraní reprezentácie vidí kontext naľavo aj napravo. Krátke konvolúcie už nie sú kauzálne a miešajú informácie zo susedov na oboch stranách. Pri tréningu je zakrytých 30 percent tokenov a model sa učí obnoviť ich z okolitého textu. Táto klasická úloha maskovaného jazyka je vhodnejšia pre porozumenie a označovanie než pre generovanie zľava doprava.
Tréning prebiehal v dvoch etapách. Prvá budovala všeobecnú jazykovú schopnosť na kontexte 1 024 tokenov a veľkom webovom korpuse. Druhá rozšírila kontext na 8 192 tokenov a posilnila prácu s faktickým, právnym a viacjazyčným obsahom. Dlhší kontext je dôležitý najmä pri zmluvách, prepisoch hovorov, interných predpisoch či vláknach zákazníckej podpory, ktoré sa pri kratšom limite musia umelo deliť na kúsky.
Výrobca porovnal štrnásť modelov na sedemnástich úlohách zo súborov GLUE, SuperGLUE a viacjazyčnej klasifikácie. Každý model bol pre konkrétnu úlohu plne doladený a výsledky boli spriemerované z piatich oddelených behov. Väčší LFM2.5-Encoder-350M skončil podľa zverejnených výsledkov štvrtý; tri lepšie modely boli väčšie a jeden mal 3,5 miliardy parametrov. Verzia 230M mala prekonať ModernBERT-base aj testované modely EuroBERT. Ide však o benchmarky autorov a výsledok v reálnom nasadení bude závisieť od dát, jazyka a spôsobu doladenia.
Najvýraznejšie tvrdenie sa týka výkonu na bežnom procesore. Pri vstupe s 8 192 tokenmi trval podľa merania Liquid AI jeden priechod ModernBERT-base viac než minútu a pol, zatiaľ čo LFM2.5-Encoder-230M približne 28 sekúnd. To predstavuje asi 3,7-násobné zrýchlenie. Na GPU bol rozdiel menší: ModernBERT mal viesť pri vstupoch kratších než približne tisíc tokenov, kým nové enkódery získali výhodu približne od dvoch tisíc tokenov. Tvrdené čísla preto treba čítať ako profil konkrétneho hardvéru a implementácie, nie ako garantovanú latenciu na každom zariadení.
Praktická hodnota CPU inferencie je širšia než len úspora ceny servera. Malý enkóder môže bežať pri zdroji dát, na firemnom pracovnom počítači alebo v izolovanom prostredí bez stáleho prístupu ku GPU. Organizácia môže najprv lokálne odhaliť osobné údaje, skontrolovať súlad textu s internými pravidlami alebo rozhodnúť, či požiadavka vôbec potrebuje veľký model. Takáto prvá vrstva znižuje objem platených generatívnych volaní a zároveň obmedzuje množstvo citlivého obsahu opúšťajúceho infraštruktúru.
Autori ukazujú ukážky smerovania promptov bez príkladov, kontroly pravidiel, opravy pravopisu a detekcie štyridsiatich typov osobných údajov v šestnástich jazykoch. Tieto demá dokazujú rozsah možných použití, no základný model stále potrebuje prispôsobenie konkrétnej úlohe. Na klasifikáciu, regresiu, vyhľadávanie alebo označovanie tokenov sa k telu enkódera pridá príslušná výstupná hlava a model sa doladí na doménových dátach. Liquid AI zverejnilo aj postup pre dlhé právne dokumenty a vyhodnocovací kód.
Pre agentické systémy môže byť LFM2.5 užitočný ako lacná riadiaca vrstva. Enkóder môže roztriediť požiadavku, vybrať nástroj, odhadnúť citlivosť obsahu alebo skontrolovať výstup pred jeho ďalším spracovaním. Nenahrádza uvažovanie generatívneho modelu, ale môže zmenšiť počet situácií, v ktorých je drahé uvažovanie potrebné. Pri vysokom počte požiadaviek býva práve takýto pomocný model dôležitejší pre cenu a odozvu systému než malé zlepšenie hlavného LLM.
Pred nasadením bude potrebné otestovať slovenčinu, doménové skratky, dlhé tabuľkové dokumenty aj chybovosť pri vzácnych typoch citlivých údajov. Benchmarkový priemer nedokáže nahradiť meranie presnosti, priepustnosti a pamäťových nárokov na cieľovom zariadení. Dôležitá je aj kalibrácia rozhodovacích prahov: príliš agresívny filter môže blokovať legitímny text, príliš voľný zase prepustiť údaje, ktoré mal zachytiť. Vydanie LFM2.5-Encoders je napriek tomu významným signálom, že časť produkčnej AI sa presúva od stále väčších generátorov k menším špecializovaným modelom, ktoré dokážu dlhý text spracovať lacno, lokálne a predvídateľne.
Zdroje
