AWS a Motorway ukazujú produkčné hodnotenie agentov od testu nástrojov po živú prevádzku
Referenčný postup nad Strands a Bedrock AgentCore spája testovanie pred nasadením s priebežným hodnotením v produkcii. Motorway uvádza pokles chybných výsledkov z jednej z ôsmich otázok na jednu z päťdesiatich.
Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.
- Typ zdroja
- Kurátorovaný súhrn
- Zdroj / autorita
- AWS
Redakčný kontext
Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov a zodpovednú kontrolu pravidiel robí Marek Považský.
Článok je zaradený v sekcii AI produkty a opiera sa o 3 zdroje.
AWS a britské automobilové trhovisko Motorway zverejnili produkčný postup na hodnotenie AI agentov, ktorý spája testy pred nasadením s priebežným dohľadom v živej prevádzke. Príklad vychádza z agenta pre vyhľadávanie skladových vozidiel: predajcovia namiesto ručného prechádzania tabuliek zadávajú prirodzené otázky, pričom systém musí správne preložiť cenu, vek, palivo, polohu a ďalšie obmedzenia do volaní nástrojov a vyhľadávania.
Podľa AWS dokázal spoločný postup znížiť podiel nesprávnych výsledkov z približne jednej z ôsmich otázok na jednu z päťdesiatich. Čas potrebný na odhalenie problému sa mal skrátiť z niekoľkých hodín na niekoľko minút. Ide o čísla dodávateľa a zákazníka z jedného konkrétneho nasadenia, nie o univerzálny benchmark, no ukazujú praktický rozdiel medzi jednorazovým testom odpovede a systematickým meraním celej trajektórie agenta.
Jadrom návrhu sú tri vrstvy. Prvá sleduje používanie nástrojov: či agent zvolil správny nástroj, poslal mu platné argumenty a dodržal poradie krokov. Druhá hodnotí uvažovanie a trajektóriu, teda či sa agent nestratil medzi čiastkovými rozhodnutiami alebo pri viacťahovom spresnení otázky. Tretia meria výslednú odpoveď z pohľadu relevantnosti, správnosti a užitočnosti. Doménové kontroly potom overujú konkrétne pravidlá trhu s vozidlami.
Takéto rozdelenie je dôležité, pretože pekne znejúca odpoveď môže zakrývať chybný dotaz, nesprávny filter alebo náhodne trafený výsledok. Naopak, samotný neúspešný výsledok ešte nehovorí, či zlyhal model, nástroj, vyhľadávací index alebo konverzačná pamäť. V produkčnom systéme treba vedieť priradiť chybu ku konkrétnej vrstve; inak sa tím pokúša opravovať prompt aj vtedy, keď je problém v schéme nástroja alebo v dátach.
Postup používa dve fázy. Počas vývoja bežia lokálne alebo integračné hodnotenia cez otvorenú knižnicu Strands Evals a referenčné scenáre. V produkcii sa vzorky behov posielajú do Amazon Bedrock AgentCore Evaluations, kde môžu byť vyhodnotené vstavanými alebo vlastnými hodnotiteľmi. AgentCore prevádza stopy z podporovaných rámcov cez OpenTelemetry a OpenInference do jednotného formátu a používa aj hodnotenie modelom, preto treba výsledky kalibrovať proti ľudským kontrolám.
AWS opisuje päťstupňový nasadzovací tok s bránami kvality. Zmena najprv prejde jednotkovými a komponentovými testmi, potom hodnotením na pripravenom súbore otázok, skúškou nasadeného kandidáta, postupným uvoľnením a napokon živým monitorovaním. Ak metriky klesnú pod určený prah, vydanie sa zastaví. Dôležitou metrikou je pass^k, ktorá nehodnotí iba jeden úspešný pokus, ale pravdepodobnosť konzistentného úspechu pri opakovaní nedeterministickej úlohy.
Zverejnené úložisko obsahuje univerzálnu trojvrstvovú hodnotiacu súpravu a referenčné nasadenie agenta pre aukcie vozidiel. Ukážka kombinuje Strands, AgentCore, pamäť, bránu pre MCP nástroje, vektorové vyhľadávanie a cloudové komponenty pre udalosti, úložisko a upozornenia. AWS uvádza odhad päť až desať dolárov za spustenie vzorovej hodnotiacej sady; skutočné produkčné náklady závisia od vzorkovania, modelov a počtu hodnotiteľov.
Pre firmy je podstatné, že hodnotenie nemožno pridať až tesne pred spustením. Potrebujú zachytávať verziu promptu, modelu, nástrojov, dátového indexu a schémy odpovede, aby bolo možné výsledok zopakovať. Testovací súbor má obsahovať bežné aj hraničné otázky, viacťahové opravy, konfliktné obmedzenia a prípady bez správnej odpovede. Citlivé trajektórie zároveň nemožno bez rozmyslu ukladať do telemetrie, pretože môžu obsahovať osobné či obchodné údaje.
Referenčná architektúra je naviazaná na AWS, ale jej hlavná zásada je prenositeľná: agent sa má hodnotiť ako systém, nie ako jedna textová odpoveď. Tímy používajúce iný cloud môžu zachovať vrstvy, brány kvality, opakované pokusy a spätné prehrávanie incidentov. Pred prevzatím uvádzaných výsledkov by však mali overiť vlastné prahy, manuálne skontrolovať zhodu automatických hodnotiteľov s odborníkmi a sledovať, či optimalizácia na testovací súbor nevytvára novú formu preučenia.
Zdroje