aifeed.skAI Feed
AI produkty3 min čítania

AWS skúša prekonať limity RAG kompresiou znalostí podľa konkrétnej úlohy

Task-aware knowledge compression vopred vytvára viac úrovní skráteného kontextu a podľa náročnosti otázky volí vhodný kompromis medzi detailom, cenou a pokrytím dokumentov.

Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.

Typ zdroja
Kurátorovaný súhrn
Zdroj / autorita
AWS Machine Learning Blog

Redakčný kontext

Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov a zodpovednú kontrolu pravidiel robí Marek Považský.

Článok je zaradený v sekcii AI produkty a opiera sa o 3 zdroje.

Bežné systémy RAG vyhľadajú k otázke niekoľko podobných úryvkov a tie pošlú jazykovému modelu. Tento postup funguje pri presnom faktickom dopyte, no môže zlyhať pri analýze vzťahov roztrúsených v stovkách dokumentov. AWS preto predstavil referenčnú implementáciu prístupu task-aware knowledge compression (TAKC), teda kompresie znalostí prispôsobenej konkrétnej úlohe. Namiesto opakovaného vyhľadávania iba niekoľkých fragmentov sa celý relevantný korpus vopred skráti cez optiku finančnej analýzy, kontroly súladu alebo iného vopred určeného cieľa.

Základná myšlienka je jednoduchá: ten istý dokument nepotrebuje pre každú úlohu zachovať rovnaké informácie. Pri finančnej kontrole sú dôležité tržby, marže, peňažné toky a záväzky, kým pri právnom posudzovaní treba ponechať citácie predpisov, porušenia a históriu sporov. Všeobecné zhrnutie sa pokúša zachytiť všetko, a preto môže rozriediť podstatné údaje. TAKC používa zadanie, ktoré modelu presne určuje, čo má pri kompresii zachovať, vrátane čísel, entít, príčinných vzťahov a závislostí.

AWS navrhuje štyri úrovne kompresie: osemnásobnú, šestnásťnásobnú, tridsaťdvanásobnú a šesťdesiatštyrinásobnú. Najjemnejšia úroveň ponecháva viac kontextu pre viacstupňové uvažovanie, kým najagresívnejšia je určená skôr na klasifikáciu a jednoduché vyhľadanie údaja. Analyzátor zložitosti otázky má podľa jej dĺžky, typu a analytických výrazov vybrať vhodnú vrstvu. Pri nízkej istote smerovania používa referenčný návrh strednú úroveň ako konzervatívny kompromis.

Kompresia prebieha mimo kritickej cesty odpovede. Dokument po vložení do Amazon S3 spustí spracovanie v AWS Lambda, rozdelí sa na 256-tokenové úseky s prekrytím 50 tokenov a cez Amazon Bedrock vzniknú skrátené reprezentácie pre všetky úrovne. Výsledky sa ukladajú do Amazon ElastiCache Serverless a zálohujú do S3. Pri otázke potom systém načíta hotový kontext z vyrovnávacej pamäte a platí najmä za inferenciu nad podstatne kratším vstupom, nie za opakovanú kompresiu celého korpusu.

Referenčná architektúra oddeľuje ingest od obsluhy dopytov. Rozhranie vystavuje Amazon API Gateway, prístup zabezpečuje Amazon Cognito s tokenmi JWT a pred API stojí AWS WAF. Šifrovanie objektov má spravovať AWS KMS a prevádzkové metriky Amazon CloudWatch. AWS publikoval aj otvorenú ukážkovú implementáciu s infraštruktúrou v AWS CDK, takže tímy môžu preveriť správanie na vlastných dokumentoch namiesto toho, aby zostali iba pri koncepčnom opise.

Potenciálnou výhodou je širšie pokrytie stabilnej znalostnej bázy. Klasický RAG môže minúť súvislosť medzi dodávateľskou zmluvou, výkazom dcérskej firmy a právnym sporom, ak jednotlivé texty nepoužívajú podobné slová. TAKC sa snaží ponechať takéto väzby v komprimovanom obraze celého korpusu. AWS pri modelovom príklade so 100-tisíc tokenmi uvádza, že stredná šestnásťnásobná kompresia zníži vstup na približne 6 250 tokenov a najvyššia úroveň na približne 1 563 tokenov. Ide o odvodený výpočet z kompresného pomeru, nie o univerzálnu záruku reálnych nákladov alebo kvality.

Prístup má aj jasné hranice. Prvotné spracovanie stojí čas a peniaze, preto je výhodnejšie pri dokumentoch, ktoré sa menia denne alebo ešte pomalšie a používajú sa opakovane. Pri hodinových zmenách môže byť priebežné prepočítavanie drahšie než klasické vyhľadávanie. Komprimovaný text navyše môže zahodiť detail, ktorý neskôr potrebuje nepredvídaná otázka. Každú úroveň preto treba testovať proti odpovediam z plného kontextu a po zmene kompresného zadania zabezpečiť opakovateľné prepočítanie dát.

Dôležitá je aj auditovateľnosť. TAKC samo osebe nemusí používateľovi ukázať, z ktorého presného dokumentu pochádza každé tvrdenie. V regulovanom prostredí preto AWS odporúča kombinovať oba prístupy: TAKC vytvorí analytickú odpoveď nad širším kontextom a RAG dohľadá podporné dokumenty pre citácie a kontrolnú stopu. Takéto dvojité riešenie zvyšuje zložitosť, ale znižuje riziko, že lacnejší skrátený kontext sa začne považovať za náhradu dôkazov.

Pre podnikové tímy je najpraktickejšou novinkou zmena otázky pri návrhu systému. Namiesto automatického zväčšovania kontextového okna alebo počtu vyhľadaných úryvkov môžu zmerať, ktoré typy úloh sa opakujú, akú mieru detailu naozaj potrebujú a ako často sa korpus mení. Ak sú úlohy predvídateľné a dáta stabilné, vopred pripravené reprezentácie môžu znížiť latenciu aj spotrebu tokenov. Ak sú otázky otvorené a zdroje sa často menia, klasický RAG zostáva pružnejší.

TAKC preto nie je všeobecným koncom RAG, ale ďalšou vrstvou v architektúre podnikových znalostných systémov. Jeho hodnota sa ukáže až pri meraní na vlastných otázkach: treba sledovať správnosť, stratu faktov, náklady na prepočet, oneskorenie a schopnosť doložiť odpoveď zdrojom. Otvorená implementácia od AWS dáva tímom konkrétny základ na takýto experiment, no produkčné nasadenie si stále vyžaduje vlastné bezpečnostné, kvalitatívne a prevádzkové overenie.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie