aifeed.skAI Feed
AI modely5 min čítania

Liquid AI vydalo LFM2.5-VL-3B pre lokálne spracovanie obrazu, dokumentov a rozhraní

Kompaktný model LFM2.5-VL-3B spája OCR, lokalizáciu objektov, porozumenie obrazovkám a volanie nástrojov. Je pripravený na lokálnu inferenciu vo viacerých formátoch, jeho výkonové výsledky však zatiaľ pochádzajú najmä od výrobcu a slovenčina nepatrí medzi výslovne podporované jazyky.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Oficiálny zdroj
Zdroj / autorita
Liquid AI

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI modely a opiera sa o 4 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Čo Liquid AI skutočne vydalo

LFM2.5-VL-3B je približne 3,1-miliardový vision-language model, ktorý prijíma text a jeden alebo viac obrázkov a vytvára textový alebo štruktúrovaný výstup. Liquid AI ho postavilo na jazykovom základe LFM2.5-2.6B a zrakovom enkóderi SigLIP2 400M NaFlex. Nejde o model navrhnutý na dlhé reťazce uvažovania: odpovedá priamo, čím výrobca uprednostňuje nízku latenciu a vysokú priepustnosť. Praktické zameranie je preto užšie než pri veľkých multimodálnych asistentoch, no zároveň konkrétnejšie: OCR, analýza dokumentov a obrazoviek, lokalizácia objektov, práca s viacerými obrázkami a vytváranie volaní funkcií.

NaFlex umožňuje zachovať prirodzený pomer strán obrázka. Väčšie vstupy sa delia na neprekrývajúce sa bloky s rozmermi 512 × 512 pixelov a dopĺňa ich zmenšený pohľad na celý obraz. Kontextové okno má 32 768 tokenov a slovník 128-tisíc položiek. Modelová karta uvádza 16 podporovaných jazykov vrátane angličtiny, nemčiny, francúzštiny, poľštiny, ruštiny, arabčiny, čínštiny a hindčiny. Slovenčina v zozname nie je, preto nemožno automaticky predpokladať rovnako spoľahlivé rozpoznávanie slovenských dokumentov, diakritiky či pokynov ako pri výslovne podporovaných jazykoch.

Model je dostupný ako natívny checkpoint pre Transformers, vLLM a SGLang, ale aj vo formátoch GGUF, ONNX a MLX. To rozširuje možnosti nasadenia od servera s GPU cez počítače Apple Silicon až po CPU a mobilné akcelerátory. Označenie open-weight je presnejšie než open-source: váhy možno stiahnuť a upravovať, používanie sa však riadi osobitnou licenciou LFM1.0 uvedenou pri modeli. Organizácia by si preto mala pred distribúciou produktu, ďalším tréningom alebo komerčným nasadením preveriť konkrétne licenčné podmienky, nie sa spoliehať iba na všeobecný marketingový opis otvorenosti.

Výsledky vyzerajú silno, ale ešte nie sú nezávisle potvrdené

Liquid AI uvádza najväčšie zlepšenia pri porozumení používateľským rozhraniam, lokalizácii objektov a používaní nástrojov. Priemer v ScreenSpot-v2 má dosahovať 80,7 bodu, RefCOCO 87,9 oproti 57,1 pri predchádzajúcom LFM2-VL-3B a ToolSandbox 59,5 oproti 26,4. BLINK stúpol podľa firmy z 50,2 na 61,5 a MuirBench z 34,9 na 58,3. Výsledky naznačujú výrazný generačný posun, ale neukazujú univerzálne prvenstvo: v časti testov zostávajú porovnávané modely Qwen alebo InternVL lepšie a staršia verzia dokonca dosiahla vyššie skóre v CountBenchQA a POPE.

Dôležitou novou redakčnou korekciou je pôvod týchto čísel. Kompletné benchmarky aj merania rýchlosti zverejnilo Liquid AI; nezávislá analýza OrcaRouter upozornila, že krátko po vydaní ešte neexistovali výsledky z tretej strany ani dostatok skúseností komunity. Skóre preto treba chápať ako reprodukovateľné tvrdenia výrobcu, nie ako uzavreté poradie modelov. Rozdiely môžu ovplyvniť verzie benchmarkov, šablóny promptov, odporúčané parametre generovania, kvantizácia aj spôsob normalizácie výsledkov. Pre výber modelu je dôležitejší test na vlastných dátach než priemer z desiatok nesúrodých akademických úloh.

Rovnako opatrne treba čítať údaje o rýchlosti. Výrobca uvádza 228 výstupných tokenov za sekundu na Apple M5 Max, 116 na AMD Ryzen AI Max+ 395 a približne 20 na Galaxy S26 Ultra pri pamäťovej stope okolo troch gigabajtov. Na jednej NVIDIA H100 má systém pri vysokej súbežnosti dosahovať približne 11-tisíc výstupných tokenov za sekundu. Tieto scenáre však nie sú navzájom priamo porovnateľné. Reálna odozva závisí od počtu a rozlíšenia obrázkov, dĺžky textu, kvantizácie, dávkovania, inferenčného frameworku a tepelného či energetického limitu zariadenia.

Kde dáva lokálny multimodálny model zmysel

Najpresvedčivejším použitím je dávkové spracovanie dokumentov. LFM2.5-VL-3B vie z jednej strany vytvoriť text a zároveň označiť oblasti ako nadpis, tabuľku, rovnicu, kód, pätičku alebo číslo strany. Súradnice vracia v normalizovanom rozsahu, takže výstup možno napojiť na indexovanie, vyhľadávanie alebo kontrolu formulárov. Liquid AI však formát anotácie rozloženia označuje za experimentálny. Produkčný systém preto potrebuje validáciu schémy, kontrolu chýb a bezpečný postup pre prípady, keď model časť dokumentu vynechá, pomýli si stĺpce alebo doplní text, ktorý na stránke nie je.

Druhou oblasťou sú vizuálni agenti pracujúci s obrazovkami. Model môže podľa textového cieľa určiť polohu ovládacieho prvku a vytvoriť štruktúrované volanie nástroja. To však neznamená, že by mal bez ďalších zábran samostatne klikať v účtovníctve, bankovníctve alebo administrátorskom rozhraní. Lokalizácia prvku, správne pochopenie zámeru a bezpečné vykonanie akcie sú tri odlišné problémy. Citlivé operácie si vyžadujú povolené zoznamy nástrojov, kontrolu argumentov, obmedzené oprávnenia, auditnú stopu a ľudské potvrdenie pred nezvratným krokom.

Lokálna prevádzka môže znížiť potrebu odosielať obrázky a dokumenty externému poskytovateľovi. To je praktické pri interných zmluvách, servisných fotografiách, zdravotnej dokumentácii či snímkach výrobných zariadení. Sama osebe však nezaručuje súlad s GDPR. Európske pravidlá naďalej vyžadujú zákonný účel, minimalizáciu údajov, primerané zabezpečenie a obmedzenú dobu uchovávania. Prevádzkovateľ musí vedieť, kde zostávajú vstupy, medzivýsledky, logy a embeddingy, kto k nim má prístup a či sa používajú na ďalší tréning.

Slovenský a európsky kontext

Pre slovenské firmy je najväčšou neistotou jazyk. Blízkosť poľštiny slovenčinu automaticky nerieši a všeobecné multimodálne benchmarky málo vypovedajú o faktúrach, katastrálnych výpisoch, lekárskych správach alebo formulároch so slovenskou diakritikou. Pilotné hodnotenie by malo obsahovať skeny rôznej kvality, viac typov písma, tabuľky, pečiatky, rukou dopísané údaje a dokumenty miešajúce slovenčinu s češtinou či angličtinou. Osobitne treba merať presnosť čísel, dátumov, mien, súm a identifikátorov, kde aj jediný nesprávny znak môže mať právny alebo finančný dôsledok.

Európskym tímom môže kompaktný model pomôcť obmedziť cloudové náklady a udržať dáta vo vlastnej infraštruktúre, ale výber by nemal stáť iba na počte parametrov. Potrebné je porovnať kvalitu po kvantizácii, spotrebu energie, čas do prvého tokenu, priepustnosť pri reálnej záťaži a náklady na údržbu. Do testu patria aj halucinácie pri OCR, stabilita ohraničujúcich rámčekov, odolnosť voči pokynom vloženým priamo do obrázka a bezpečnosť funkčných volaní. Pri vysokorizikovom použití môže byť nevyhnutné viesť dokumentáciu o dátach, dohľade a monitorovaní aj vtedy, keď model beží úplne lokálne.

LFM2.5-VL-3B tak predstavuje zaujímavý stavebný prvok, nie hotové riešenie bez kontroly. Jeho veľkosť, dostupné formáty a priame odpovede vytvárajú dobrý základ pre rýchle spracovanie obrazu na zariadení. Otvorené zostáva, či sa deklarované výsledky zopakujú mimo laboratória výrobcu, ako spoľahlivo zvládne slovenčinu a čo s presnosťou urobí agresívna kvantizácia. Rozumným ďalším krokom je obmedzený pilot s vlastným zlatým súborom dát, meraním chýb po jednotlivých poliach a jasným pravidlom, ktoré výstupy musí pred použitím potvrdiť človek.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie