aifeed.skAI Feed
AI modely5 min čítania

DeepAmbigQA odhaľuje slabinu LLM: správna odpoveď ešte nemusí byť úplná

Benchmark DeepAmbigQA skúša, či vyhľadávacie LLM dokážu rozlíšiť nejednoznačné názvy a zostaviť úplný zoznam odpovedí. Výsledky autorov ukazujú vysokú presnosť jednotlivých položiek, ale slabé pokrytie celej požadovanej množiny.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Výskumná práca
Zdroj / autorita
Apple Machine Learning Research a arXiv

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI modely a opiera sa o 3 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Keď jedna správna položka nestačí

Výskumníci z Apple a Kalifornskej univerzity v Santa Barbare predstavili DeepAmbigQA, benchmark zameraný na schopnosť jazykových modelov zostaviť úplnú odpoveď na zložité informačné otázky. Nejde iba o to, či model nájde pravdivý údaj. Musí rozlíšiť nejednoznačný názov, naplánovať viac krokov vyhľadávania, zhromaždiť dôkazy o všetkých relevantných kandidátoch a vrátiť celú požadovanú množinu bez nesprávnych či chýbajúcich položiek. Práca bola zverejnená ako preprint na arXive už v novembri 2025 a Apple ju zaradilo medzi svoje výskumné publikácie v auguste 2026.

Autori ilustrujú problém otázkou, ktorí herci z filmu s názvom The Heat získali aspoň jedného Oscara. Rovnaký alebo podobný názov môže označovať viac diel, takže systém musí najprv určiť všetky platné interpretácie. Následne potrebuje získať obsadenie príslušných filmov, preveriť ocenenia každého herca a výsledky zlúčiť. Odpoveď s jedným známym držiteľom Oscara môže byť fakticky správna, ale stále nevyhovuje zadaniu, ak vynechá ďalšie mená. Práve rozdiel medzi pravdivosťou jednotlivých tvrdení a úplnosťou výsledku je hlavnou témou benchmarku.

Ako benchmark vznikol a čo skutočne meria

DeepAmbigQA obsahuje 3 600 otázok, z ktorých polovica zahŕňa explicitne nejednoznačný názov. Zvyšných 1 800 otázok neobsahuje túto vloženú nejednoznačnosť, no naďalej vyžaduje viacstupňové získavanie informácií. Každé zadanie má najmenej dva kroky uvažovania, niektoré ich majú až osem a očakávaný zoznam môže podľa práce obsahovať až 43 entít. Benchmark preto netestuje iba rozpoznanie názvu, ale aj plánovanie rešerše, pokrytie veľkého priestoru kandidátov, filtrovanie a správne spojenie dôkazov.

Dáta vytvorila automatizovaná pipeline DeepAmbigQAGen, ktorá prepája textový korpus s vedomostným grafom. Štruktúrované vzťahy z Wikidát a texty Wikipédie umožňujú zostaviť vykonateľný plán otázky a odvodiť kontrolovateľnú množinu odpovedí. Jazykový model potom plán prekladá do prirodzenej otázky. Autori opisujú aj filtračné a verifikačné kroky a vykonali ľudské hodnotenie prirodzenosti a správnosti vzorky. Tento postup znižuje náklady na ručné anotovanie, zároveň však znamená, že benchmark odráža štruktúru použitých databáz a kvalitu automatickej syntézy.

V experimentoch dostali hodnotené modely nástroj na husté vyhľadávanie v korpuse Wikipédie. Podľa autorov dosiahol GPT-5 presnú zhodu 0,13 na nejednoznačnej časti a 0,21 na časti bez explicitnej nejednoznačnosti. Exact match je prísna metrika: výsledok je úspešný iba vtedy, keď zodpovedá celej referenčnej množine. Jedno chýbajúce alebo nadbytočné meno preto môže zmeniť inak užitočnú odpoveď na neúspech. Tieto čísla nemožno porovnávať priamo s benchmarkmi, ktoré hodnotia jednu krátku odpoveď alebo používajú voľnejšie posudzovanie významovej podobnosti.

Dôležitý detail prináša rozklad výsledkov. Presnosť jednotlivých vrátených položiek bola pri hodnotených systémoch podľa práce spravidla vyššia než 70 percent, zatiaľ čo recall a presná zhoda zostávali podstatne nižšie. Modely teda často uvádzali pravdivé položky, ale nenašli všetky. Doplnenie rozširovania dopytov na možné interpretácie a samostatnej extrakcie dôkazov prinieslo iba mierne zlepšenia. Výsledok naznačuje, že slabinou nie je len formulácia jedného vyhľadávacieho dopytu, ale aj systematické prechádzanie kandidátov a rozhodnutie, kedy možno rešerš považovať za dokončenú.

Dôsledky pre vyhľadávacích agentov a podnikové nasadenie

Pre vývojárov je praktickým poučením potreba oddeliť nájdenie kandidátov od ich overenia. Agent určený na úplnú rešerš by mal najprv vytvoriť množinu možných interpretácií a položiek, následne evidovať, ktoré z nich už preveril, a až potom zostaviť záver. Vhodná je aj záverečná kontrola pokrytia voči pôvodným podmienkam. Citácia pri každom mene môže potvrdiť, že položka do zoznamu patrí, sama však nedokazuje, že ďalšie platné položky neexistujú. Systém preto potrebuje sledovať nielen dôkazy podporujúce odpoveď, ale aj rozsah vykonaného vyhľadávania.

Táto slabina je významná pri auditoch, právnych rešeršiach, monitorovaní dodávateľov, farmaceutických prehľadoch alebo kontrole regulačných povinností. Používateľ môže dostať plynulú odpoveď s overiteľnými citáciami a napriek tomu urobiť chybné rozhodnutie, pretože v zozname chýba menej známa firma, dokument či riziková udalosť. V takýchto prípadoch by rozhranie nemalo čiastočný výsledok označovať za úplný bez primeraného dôkazu. Užitočnejšie je uviesť použitý rozsah zdrojov, obdobie, nevyriešené interpretácie a mieru istoty o pokrytí.

Benchmark súčasne upozorňuje na obmedzenia bežného hodnotenia chatbotov. Test, ktorý kontroluje iba to, či odpoveď obsahuje aspoň jeden správny fakt, môže prehliadnuť prevádzkovo dôležité vynechania. Tímy by preto mali merať samostatne presnosť položiek, recall, úplnú zhodu a počet nepodložených položiek. Produkčné testy majú používať vlastné dokumenty a realistické otázky, pretože výsledok na Wikipédii automaticky nepredpovedá výkon v slovenskej legislatíve, internom registri zmlúv ani v podnikovej znalostnej báze.

Slovenský a európsky kontext aj otvorené otázky

Pre slovenské organizácie je téma aktuálna pri zavádzaní asistentov do verejnej správy, bánk, poisťovní, nemocníc a regulovaných podnikov. Európsky akt o umelej inteligencii vyžaduje pri vysokorizikových systémoch okrem iného primeraný ľudský dohľad, robustnosť a zodpovedajúcu úroveň presnosti. DeepAmbigQA nie je predpísaným testom súladu a nízke skóre v ňom samo osebe neznamená porušenie nariadenia. Ukazuje však konkrétny typ rizika, ktorý by mal zachytiť interný manažment kvality: systém môže produkovať prevažne pravdivé tvrdenia, no jeho neúplnosť môže ovplyvniť rozhodnutie človeka.

V slovenskom prostredí vzniká navyše jazyková a dátová neistota. Benchmark používa anglické otázky, Wikidáta a anglickú Wikipédiu, zatiaľ čo lokálne nasadenia pracujú s menším množstvom slovenských dokumentov, skloňovanými názvami, historickými označeniami inštitúcií a rozdielnymi identifikátormi osôb či organizácií. Výkon preto nemožno bez ďalšieho preniesť na slovenčinu. Pred nasadením je potrebná lokálna evaluačná sada s kontrolovanými úplnými odpoveďami a s prípadmi, kde rovnaký názov označuje obec, firmu, zákon, dokument alebo osobu.

Otvorenou otázkou zostáva aj stabilita referenčných odpovedí. Vedomostné grafy a webové korpusy môžu byť neúplné alebo zastarané, takže exact match niekedy potrestá model za rozumnú položku, ktorá v referenčnej množine chýba. Automaticky syntetizované otázky tiež nemusia presne kopírovať rozloženie reálnych požiadaviek používateľov. DeepAmbigQA preto nemožno čítať ako všeobecný rebríček inteligencie ani ako dôkaz, že konkrétny model zlyhá pri každej rešerši. Jeho prínos spočíva v presnom oddelení schopnosti nájsť pravdivý fakt od oveľa náročnejšej schopnosti preukázateľne zostaviť celý výsledok.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie