aifeed.skAI Feed
AI modely3 min čítania

OfficeQA Pro V2 testuje agentov nad 120-tisíc stranami podnikových dokumentov

Nový benchmark Databricks ukazuje veľký vplyv agentického harnessu: rovnaké modely dosiahli výrazne odlišnú presnosť podľa spôsobu práce s dokumentmi.

Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.

Typ zdroja
Oficiálny zdroj
Zdroj / autorita
Databricks AI Research

Redakčný kontext

Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov. Zodpovednú kontrolu pravidiel robí Marek Považský.

Článok je zaradený v sekcii AI modely a opiera sa o 1 zdroj.

Databricks zverejnil OfficeQA Pro V2, benchmark zameraný na ukotvené uvažovanie nad rozsiahlymi dokumentovými zbierkami podobnými tým, s ktorými pracujú podnikové tímy. Súbor obsahuje 90 otázok odvodených z približne 1 400 dokumentov amerického ministerstva financií. Korpus pokrýva 233 rokov a približne 120-tisíc strán. Úlohou agenta nie je odpovedať zo všeobecných znalostí, ale nájsť správne podklady, interpretovať ich a vytvoriť presnú odpoveď opretú o konkrétne dokumenty.

Nová verzia nadväzuje na pôvodný OfficeQA a jeho náročnejšiu podmnožinu OfficeQA Pro. Databricks sa tentoraz pokúša oddeliť skutočné zlepšenie ukotveného uvažovania od optimalizácie na známy korpus. OfficeQA Pro V2 preto využíva inú kolekciu dokumentov a nové rozdelenie úloh. To lepšie pripomína podnikovú prax, kde agent po nasadení nepracuje stále s rovnakou sadou PDF a rovnakými typmi otázok, ale musí sa prispôsobovať novým formulárom, obdobiam a štruktúram dát.

Benchmark vznikol pomocou syntetickej dátovej pipeline. Systém generoval rozmanité otázky a odpovede nad zdrojovým korpusom, pričom Databricks zdôrazňuje ich následné overovanie. Syntetické dáta umožňujú škálovať tvorbu úloh, no prinášajú aj riziká: generátor môže opakovať určité vzory alebo vytvoriť distribúciu odlišnú od reálnych požiadaviek analytikov. Výsledky preto treba čítať ako meranie konkrétne definovanej schopnosti, nie ako univerzálny rebríček podnikovej inteligencie.

Najvýraznejším výsledkom je rozdiel medzi samotným modelom a systémom, ktorý ho obklopuje. Predvolené agentické konfigurácie dosiahli podľa Databricks v širšom porovnaní priemerne 26-percentnú presnosť. V porovnaní zhodných modelov mali základné harnessy priemer 37,5 percenta, zatiaľ čo Databricks Genie dosiahol 52,8 percenta. Firma tento posun opisuje ako priemerné zlepšenie o 24 percentuálnych bodov, respektíve o 92 percent relatívne pri príslušnom porovnaní.

Najlepšia konfigurácia Genie dosiahla 60 percent, no víťaz tímovej súťaže Grounded Reasoning Cup sa dostal na 63,3 percenta. Súťaž zahŕňala 11 akademických tímov podporovaných OpenAI, Anthropicom a Google DeepMind. Účastníci dostali dovtedy neznámy korpus, čo malo obmedziť priame prispôsobenie na test. Aj najlepší výsledok však znamená, že značná časť otázok zostala nezodpovedaná presne. Ukotvené uvažovanie nad veľkými dokumentovými archívmi teda ani pri súčasných modeloch nemožno považovať za vyriešený problém.

Databricks pripisuje časť výhody Genie spracovaniu dokumentov pomocou ai_parse. Predbežné parsovanie pomáha agentovi rýchlejšie identifikovať relevantné údaje na stránkach, namiesto opakovaných pokusov čítať veľké množstvo PDF počas každého behu. Pozorované stopy podľa firmy ukázali, že niektoré základné agentické konfigurácie sa dostávali do slučiek pri parsovaní dokumentov. To zvyšovalo cenu a predlžovalo beh bez zodpovedajúceho rastu presnosti.

Výsledky sú praktickým varovaním pred hodnotením podnikových agentov iba podľa mena základného modelu. Rovnaký model môže podať výrazne odlišný výkon podľa toho, ako systém indexuje dokumenty, vyberá nástroje, plánuje vyhľadávanie, spracúva tabuľky a kontroluje odpoveď. Pre nákup alebo vývoj riešenia preto nestačí prevziať všeobecné skóre modelu. Organizácia potrebuje otestovať celý produkčný reťazec na vlastných dokumentoch, oprávneniach a typoch otázok.

Do ekonomického porovnania treba započítať aj náklady, ktoré benchmark nemusí zachytiť jedným číslom. Databricks upozorňuje, že cena jednotlivého behu nezahŕňa jednorazové predbežné parsovanie korpusu. Pri opakovanej práci s rovnakým archívom sa tento náklad môže rozložiť a priniesť úsporu, pri často sa meniacich dokumentoch však môže byť významný. Podobne presnosť s nulovou toleranciou zvýhodňuje jednoznačné odpovede, no nemusí úplne vystihnúť užitočnosť čiastočne správneho analytického vysvetlenia.

OfficeQA Pro V2 je napriek týmto obmedzeniam užitočný tým, že presúva pozornosť od izolovaných modelových benchmarkov k celému agentickému systému. Korpus s historickými finančnými dokumentmi preveruje vyhľadávanie, OCR a parsovanie, prácu s tabuľkami, numerické uvažovanie aj schopnosť udržať dôkazový reťazec. Zverejnenie benchmarku umožní ďalším tímom porovnávať vlastné harnessy a postupy. Najdôležitejším záverom zatiaľ nie je jedno víťazné skóre, ale veľká medzera medzi predvoleným agentom a optimalizovanou architektúrou nad tým istým modelom.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie