aifeed.skAI Feed
AI produkty3 min čítania

AWS ukázalo pipeline, ktorá mení webové zdroje na prehľadávateľné AI poznatky

Referenčná architektúra spája AgentCore Browser, Bedrock, Lambda, SQS a OpenSearch Serverless. Renderuje dynamické stránky, extrahuje z nich témy a entity a sprístupňuje výsledky cez web aj MCP.

Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.

Typ zdroja
Oficiálny zdroj
Zdroj / autorita
Amazon Web Services

Redakčný kontext

Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov. Zodpovednú kontrolu pravidiel robí Marek Považský.

Článok je zaradený v sekcii AI produkty a opiera sa o 1 zdroj.

AWS zverejnilo referenčnú architektúru na automatické sledovanie webových zdrojov a extrakciu poznatkov pomocou umelej inteligencie. Riešenie kombinuje Amazon Bedrock AgentCore Browser, modely v Bedrocku, OpenSearch Serverless a serverless komponenty AWS. Cieľom je nahradiť ručné prechádzanie desiatok stránok systémom, ktorý zachytí nový článok, vykreslí ho, vyčistí, zanalyzuje a uloží do sémanticky prehľadávateľnej databázy.

Vstupom sú nakonfigurované RSS kanály. Plán v Amazon EventBridge každých 15 minút spúšťa funkciu Lambda, ktorá vyhľadá nové záznamy a porovná ich s obsahom v S3. URL sa hashujú na jedinečné identifikátory, takže opakovane zachytený článok nemusí spustiť drahé spracovanie. Predvolený časový filter prijíma obsah publikovaný za posledných 24 hodín, no možno ho upraviť podľa potrieb monitorovania.

Na rozdiel od jednoduchého HTTP sťahovania používa pipeline spravovaný vzdialený prehliadač AgentCore Browser. Lambda sa k nemu pripája pomocou Playwrightu cez Chrome DevTools Protocol. Prehliadač vykreslí JavaScript, počká na dynamické prvky, vytvorí snímku stránky a stiahne obrázky. Do S3 uloží HTML, screenshot, metadáta aj zachytené médiá. Tento krok má zvýšiť odolnosť voči webom, ktoré by bežnému scraperu vrátili neúplný obsah.

Nahratie metadát do S3 spustí ďalšiu časť cez front Amazon SQS. Druhá Lambda vyčistí HTML a pripraví ho pre model. Súbory väčšie než jeden megabajt zjednoduší prevodom HTML na text, pri menších používa knižnicu Mozilla Readability, ktorá lepšie oddeľuje hlavný článok od navigácie. AWS zdôrazňuje, že čistenie nie je iba drobná optimalizácia: znižuje spotrebu tokenov a zlepšuje konzistentnosť extrakcie.

Model v Amazon Bedrock následne vytvorí krátke zhrnutie, identifikuje témy, hlavné entity, kategórie a potenciálne praktické poznatky. Z vyčisteného obsahu sa vygeneruje aj embedding. OpenSearch Serverless uloží pôvodný text, extrahované metadáta a vektor, vďaka čomu podporuje súčasne kľúčové slová aj sémantické vyhľadávanie. Dopyt tak môže nájsť tematicky príbuzný článok aj vtedy, keď neobsahuje presnú formuláciu používateľa.

Používatelia pristupujú k výsledkom cez rozhranie v Reacte, ktoré beží v Amazon ECS s Fargate a používa autentifikáciu Cognito. Pre agentov a ďalšie nástroje architektúra pridáva MCP server, takisto nasadený na Fargate a vystavený cez CloudFront. Interný asistent preto môže prehľadávať vytvorenú databázu cez štandardizované nástroje bez priameho prístupu k surovým úložiskám. Spracovanie prebieha vo VPC, pozorovateľnosť zabezpečuje CloudWatch a oprávnenia IAM.

AWS navrhuje použitie pri konkurenčnom spravodajstve, výskume trhu, kurátorovaní obsahu a sledovaní regulačných zmien. Zároveň upozorňuje, že externý web je nedôveryhodný vstup. Pre produkciu odporúča Bedrock Guardrails s filtrami obsahu, zakázanými témami a kontrolou ukotvenia výstupu v zdrojovom článku. Ani tieto mechanizmy však nenahrádzajú kontrolu licenčných podmienok webov, rešpektovanie prístupových obmedzení či overenie faktov pred ďalším zverejnením.

Architektúra otvorene pomenúva aj náklady. Jedno vykreslenie cez AgentCore Browser trvalo v teste približne 10 až 30 sekúnd a bolo výrazne drahšie než obyčajná HTTP požiadavka. Deduplikácia pred otvorením prehliadača je preto zásadná. OpenSearch Serverless má navyše minimálnu kapacitnú a cenovú hranicu bez ohľadu na nízke využitie. AWS pri menších nasadeniach odporúča zvážiť relačnú databázu RDS s pgvectorom.

Oddelenie zberu a spracovania cez SQS umožňuje obom častiam škálovať nezávisle a dead-letter queue zachytí opakované zlyhania. Ide o robustnejší návrh než jeden dlhý agentický beh, no skladá sa z veľkého počtu spravovaných služieb. Tím musí sledovať náklady, regionálnu dostupnosť modelov, zmeny stránok, kvalitu čistenia aj prompt injection v získanom texte. Zhrnutie vytvorené modelom nemožno automaticky považovať za overený fakt.

AWS sprístupnilo aj kompletnú implementáciu a návod na nasadenie. Najväčším prínosom ukážky nie je nový model, ale praktické rozdelenie ingestu na deterministický zber, asynchrónne spracovanie, modelovú extrakciu a samostatnú vyhľadávaciu vrstvu. Organizáciám ponúka východiskový bod pre interné monitorovanie, pričom zároveň jasne ukazuje, že spoľahlivé webové AI nevzniká samotným promptom, ale kombináciou prehliadača, frontov, deduplikácie, bezpečnostných kontrol a auditovateľného úložiska.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie