IBM predstavilo DocLang: otvorený formát má zachovať štruktúru dokumentov pre AI
DocLang má prevádzať PDF, kancelárske súbory, obrázky či zvuk do kanonickej XML reprezentácie so zachovaným poradím čítania, tabuľkami, grafikou a pôvodom prvkov. Podpora v Doclingu už umožňuje praktické skúšanie, no tvrdenia o nižších nákladoch zatiaľ nemajú nezávislé benchmarky a formát vo verzii 0.x môže prinášať nekompatibilné zmeny.
Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.
- Typ zdroja
- Oficiálny zdroj
- Zdroj / autorita
- IBM Research
Ako vznikol tento text
Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.
Text je zaradený v sekcii AI produkty a opiera sa o 4 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.
Nie ďalší PDF formát, ale medzivrstva pre modely
IBM Research predstavilo DocLang ako otvorený značkovací jazyk pre prenos dokumentov medzi parsermi a systémami umelej inteligencie. Nemá nahradiť PDF, DOCX ani HTML pri zobrazovaní obsahu ľuďom. Jeho úlohou je vytvoriť strojovo čitateľnú medzivrstvu, v ktorej zostanú explicitne zachované nadpisy, odseky, poradie čítania, tabuľky, obrázky, popisy, súradnice prvkov aj väzby na pôvodnú stránku. To je podstatný rozdiel oproti bežnej extrakcii textu, ktorá z viacstĺpcového PDF často vyrobí pomiešaný prúd viet a z tabuľky iba sériu čísel bez významu riadkov a stĺpcov.
DocLang vzniká vedľa open-source projektu Docling, nie namiesto neho. Docling načíta vstupný súbor, rozpozná jeho rozloženie a vytvorí štruktúrovaný dokument; DocLang definuje jednu z podôb, v ktorých možno výsledok uložiť alebo odovzdať ďalšiemu nástroju. Aktuálna dokumentácia projektu uvádza podporu PDF, DOCX, PPTX, XLSX, HTML, obrázkov, zvuku a ďalších formátov. Repozitár zároveň potvrdzuje import aj export DocLangu popri Markdowne, HTML, JSON a staršom formáte DocTags. Novinkou oproti prvému oznámeniu teda nie je iba návrh špecifikácie: vývojári už môžu formát skúšať v reálnom konverznom toku.
Problém, ktorý IBM rieši, je pri podnikovej AI zásadný. Model nepracuje s vizuálnou stránkou tak ako človek, ale s reprezentáciou vytvorenou predchádzajúcim softvérom. Ak parser priradí popis k nesprávnemu grafu, rozbije zlúčené bunky alebo zamení poradie stĺpcov, následný RAG systém môže podať presvedčivú, ale nesprávnu odpoveď. Lepší jazykový model túto stratu informácie nemusí napraviť, pretože pôvodnú štruktúru už vo vstupe nevidí. DocLang presúva časť zodpovednosti z promptu a modelu do presnejšie definovaného dátového formátu.
Prečo XML a čo znamená kanonický zápis
DocLang je obmedzený dialekt XML. Podľa IBM používa približne tisíc syntaktických tokenov a otváracie či zatváracie značky majú byť navrhnuté tak, aby sa dali úsporne mapovať na tokeny modelu. Vlastnosti sa zapisujú najmä ako vnorené elementy namiesto množstva voľných atribútov. Cieľom je obmedziť počet syntaktických variantov, ktoré sa musí model naučiť, a zabrániť výstupom s neuzavretými značkami alebo nekonzistentnou tabuľkou. Tvrdenie o nižšej latencii a nákladoch je však zatiaľ predovšetkým tvrdením autorov; chýba nezávislé porovnanie na viacerých modeloch, jazykoch a reprezentatívnych podnikových dokumentoch.
Dôležitou ambíciou je kanonická reprezentácia: rovnaký správne interpretovaný dokument by mal dostať rovnaký bajtový zápis. Myšlienka kanonizácie nie je v XML nová. Odporúčanie W3C Canonical XML definuje normalizovanú podobu XML vhodnú napríklad na porovnávanie a digitálne podpisovanie. DocLang sa pokúša podobnú jednoznačnosť rozšíriť aj na význam dokumentových prvkov. Ak sa ju podarí dodržať, firmy budú môcť spoľahlivejšie počítať odtlačky dokumentov, ukladať spracované výsledky do cache, sledovať zmeny a pripravovať konzistentnejšie tréningové dáta.
Práve tu sa nachádza jedna z najťažších otvorených otázok. Dve aplikácie môžu správne prečítať jednoduchý list, ale odlišne interpretovať komplikovanú výročnú správu s plávajúcimi objektmi, poznámkami, vnorenými tabuľkami a skenovanými prílohami. Kanonická syntax sama osebe nezaručí kanonické pochopenie zdroja. DocLang preto bude potrebovať testovacie súbory, referenčný validátor a nezávislé implementácie, ktoré ukážu, či rôzne parsery skutočne vytvoria rovnaký výsledok aj na hraničných prípadoch.
Praktický prínos pre RAG a správu dát
Pre vývojárov RAG aplikácií je najzaujímavejšie zachovanie pôvodu informácie. Docling eviduje pri prvkoch číslo stránky a ohraničujúci obdĺžnik, takže nájdený úryvok možno spätne priradiť ku konkrétnemu miestu v dokumente. Štruktúrne delenie zároveň umožňuje vytvárať bloky podľa sekcií a tabuliek namiesto mechanického rezania textu po pevnom počte znakov. V praxi to môže zlepšiť citovanie, kontrolu odpovedí aj zobrazovanie dôkazov používateľovi. Samotný formát však nezaručuje kvalitné vyhľadávanie: výsledok stále závisí od presnosti OCR, parsera, chunkovania, embeddingov a hodnotenia relevancie.
IBM uvádza, že hlavička DocLangu môže niesť označenia osobných údajov, povolenia na použitie v RAG alebo obmedzenia tréningu. Výhodou je, že pravidlá necestujú v oddelenom sprievodnom súbore, ktorý sa pri kopírovaní ľahko stratí. Takéto metadáta môžu pomôcť pri riadení prístupu a evidencii pôvodu, nemožno ich však zamieňať s technickým vynucovaním. Aplikácia môže značku ignorovať, nesprávne ju preniesť alebo umožniť export bez nej. Potrebné zostávajú prístupové politiky, audit, šifrovanie, retenčné lehoty a kontrola toho, na akom právnom základe sa údaje spracúvajú.
To je dôležité aj pre slovenské organizácie. Banky, poisťovne, úrady, nemocnice či právne kancelárie pracujú so zbierkami slovenských a viacjazyčných PDF, skenov a kancelárskych súborov, ktoré často obsahujú osobné údaje. GDPR sa uplatňuje v celej Európskej únii a zodpovednosť prevádzkovateľa neprechádza na dokumentový formát. DocLang môže niesť informáciu o citlivosti alebo povolenom účele, ale nevytvorí súhlas, právny základ ani automatickú zhodu s pravidlami ochrany údajov. Pri nasadení bude navyše potrebné merať kvalitu OCR a poradia čítania osobitne pre slovenčinu, diakritiku a lokálne formuláre.
Sľubný základ, nie hotový štandard
IBM spája DocLang so skoršími experimentmi OTSL, DocTags a modelom SmolDocling. Firma uvádza, že 256-miliónový SmolDocling dokázal pri prevode stránok s tabuľkami, vzorcami, kódom a grafikou konkurovať podstatne väčším modelom. Je to argument, že vhodne navrhnutá výstupná reprezentácia môže časť práce modelu zjednodušiť. Nie je to však priamy dôkaz, že každý systém používajúci DocLang bude presnejší alebo lacnejší. Výsledky konkrétneho modelu nemožno bez ďalšieho preniesť na celý formát a všetky typy dokumentov.
Pozitívnym signálom je, že Docling je verejne dostupný pod licenciou MIT, má aktívny repozitár a je projektom LF AI & Data. Formát preto možno skúšať bez odovzdania dokumentov cudzej cloudovej službe; Docling podporuje lokálne spracovanie a prostredia bez prístupu na internet. Pre európske firmy je táto možnosť praktická pri prototypoch s dôvernými dátami. Otvorený kód však ešte neznamená otvorený a stabilný štandard: bude záležať na transparentnom rozhodovaní o špecifikácii, kompatibilite parserov a účasti organizácií mimo IBM a najbližšieho ekosystému.
Najväčšou neistotou zostáva zrelosť. IBM výslovne označuje DocLang ako verziu 0.x a upozorňuje, že aj menšie vydania môžu byť nekompatibilné. Produkčný používateľ by preto mal ukladať pôvodné súbory, pripnúť verziu špecifikácie a parsera, pripravovať migračné testy a merať výsledky na vlastnom korpuse. Rozumný pilot porovná presnosť tabuliek, poradie čítania, počet tokenov, latenciu, cenu a úspešnosť odpovedí oproti existujúcemu JSON či Markdown toku. Kým nezávislé benchmarky a ďalšie implementácie nepotvrdia interoperabilitu, DocLang je presvedčivý experimentálny základ, nie bezpečná univerzálna náhrada zavedených dokumentových formátov.
Zdroje