ADIAS riadi vývoj AI agentov cez pretrvávajúci register problémov
ADIAS mení automatický návrh agentov na sledovaný proces opráv: uchováva dôkazy, stav chýb aj výsledky zásahov. Autori hlásia náskok na piatich benchmarkoch a po vydaní preprintu zverejnili kód, výsledky však ešte neboli nezávisle reprodukované.
Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.
- Typ zdroja
- Výskumná práca
- Zdroj / autorita
- arXiv a verejný repozitár autorov
Ako vznikol tento text
Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.
Text je zaradený v sekcii AI výskum a opiera sa o 3 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.
Od nových kandidátov k riadeniu opráv
Rámec ADIAS, teda Automated Design of Interactive Agentic Systems, rieši nenápadný, ale podstatný problém automatického vývoja AI agentov. Bežný optimalizačný cyklus vytvorí novú verziu agenta, spustí ju na úlohách, vyhodnotí výsledky a z predchádzajúcich behov navrhne ďalšie úpravy. História je však zvyčajne usporiadaná podľa kandidátskych verzií. Informácie o jednej opakujúcej sa chybe sa preto môžu rozptýliť medzi kód, skóre a trajektórie viacerých kandidátov. ADIAS namiesto toho udržiava explicitný register problémov a ďalšie revízie vedie podľa toho, čo zostáva nevyriešené.
Nejde iba o iný spôsob zapisovania poznámok. Každý problém má stabilnú identitu, prioritu, podporné dôkazy, stav životného cyklu a históriu zásahov s ich výsledkami. Nová diagnóza sa priradí k existujúcemu problému alebo vytvorí nový záznam. Stav môže prechádzať medzi aktívnym, predbežne opraveným, potvrdene opraveným a regresným problémom. V experimentoch sa oprava považovala za potvrdenú až po tom, čo sa chyba neobjavila v najmenej dvoch po sebe nasledujúcich hodnoteniach. Tým sa odlišuje dočasné zmiznutie prejavu od stabilnejšieho vyriešenia.
Táto myšlienka nadväzuje na širšiu oblasť Automated Design of Agentic Systems, ktorú skoršia práca prijatá na ICLR 2025 opisuje ako automatické vytváranie agentických architektúr a ich stavebných prvkov. Jej Meta Agent Search iteratívne programuje nové agentické návrhy podľa predchádzajúcich výsledkov. ADIAS nemení základný cieľ tejto oblasti, ale spresňuje stav optimalizačného procesu: namiesto neustáleho odvodzovania ďalšieho kroku z archívu kandidátov robí zo samotného postupu opravy trvalý a operačne využiteľný objekt.
Ako rámec zasahuje do celého agentického systému
ADIAS začína počiatočným agentom a jednorazovým vyhľadaním verejných informácií o danej úlohe. Takto získané predpoklady sú iba pracovné hypotézy, nie potvrdené chyby. Diagnostický agent následne analyzuje skutočné trajektórie a výsledky behov. Správca problémov porovná pozorované zlyhania s hypotézami, priradí im identity a vytvorí počiatočný stav. V každom ďalšom kole vyberie malý počet cieľových problémov, rodičovskú verziu agenta a smer revízie. Optimalizátor potom pripraví sústredenú úpravu a jej účinok sa zapíše k príslušnému problému.
Priestor zmien pritom nie je obmedzený na prompt. Rámec môže upravovať spracovanie pozorovaní, pamäť, plánovanie, používanie nástrojov, riadiaci tok, overovanie výsledkov či zotavenie po chybe. Autori sa snažia spojiť dve protichodné požiadavky: zachovať flexibilitu úprav celého kódu, ale zúžiť konkrétny zásah natoľko, aby bolo možné rozumne posúdiť jeho následok. Ak revízia naraz zmení množstvo nesúvisiacich mechanizmov, z výsledného skóre sa ťažko určuje, čo pomohlo a čo prinieslo regresiu.
Od pôvodného zverejnenia preprintu pribudol prakticky dôležitý podklad: verejný repozitár už obsahuje počiatočné vydanie kódu. Implementácia rozdeľuje systém na úlohového agenta, diagnostického agenta, profilového agenta udržiavajúceho register v súbore profile.json a metaagenta upravujúceho povolené časti systému. Dostupné sú kontajnerové konfigurácie a spúšťacie skripty pre jednotlivé domény. To umožňuje preskúmať mechaniku rámca podrobnejšie než iba z článku, ale samo osebe to ešte nepredstavuje nezávislú reprodukciu publikovaných čísel.
Čo ukázali experimenty a čo čísla nehovoria
Autori porovnali ADIAS na piatich interaktívnych prostrediach: Tau-Bench pre používanie nástrojov v zákazníckej podpore, ALFWorld pre plánovanie vo virtuálnom prostredí, TextCraft pre skladanie postupov, WebShop pre webovú navigáciu a ScienceWorld pre simulované vedecké experimenty. V hlavnom porovnaní použili model DeepSeek-V4-Flash a desať optimalizačných iterácií, pričom v každej vzorkovali 15 tréningových epizód. Jedna epizóda mala limit 30 interakčných krokov alebo dialógových kôl. Metódy dostali rovnaké rozhrania, dátové delenia, rozpočty a hodnotiace skripty.
Podľa tabuľky v preprinte dosiahol ADIAS priemer 78,4 bodu, zatiaľ čo najsilnejšia porovnávaná metóda DGM-H dosiahla 62,6. Autori tento rozdiel vyjadrujú ako priemerné relatívne zlepšenie o 25,2 %. ADIAS mal najvyššie skóre vo všetkých piatich hlavných prostrediach. Na Tau-Bench ho následne skúšali aj s modelmi GLM-5.2, Hy3-Preview a GPT-5.4; podľa ich výsledkov zostal najsilnejšou metódou pri všetkých štyroch základných modeloch. Ablácie ukázali pokles až o 40,7 %, keď sa odstránil pretrvávajúci stav problémov alebo sa revízie vrátili ku kandidátsky orientovaným politikám.
Tieto hodnoty sú tvrdeniami autorov z nerecenzovaného preprintu. Hlavné experimenty navyše používali reprezentatívne podmnožiny úloh, aby obmedzili výpočtové náklady. Rozšírený test na celej maloobchodnej distribúcii Tau-Bench síce podľa práce zachoval náskok ADIAS, no stále ide o experiment tej istej výskumnej skupiny. Verejný kód zlepšuje auditovateľnosť, ale v čase tejto aktualizácie nebol nájdený nezávislý reprodukčný výsledok. Čísla preto nemožno interpretovať ako všeobecný dôkaz, že rovnaký prístup zlepší ľubovoľného produkčného agenta.
Praktický význam pre slovenské a európske tímy
Pre menšie slovenské tímy môže byť najhodnotnejším prvkom samotný dátový model opráv, nie kompletné automatické prepisovanie agentického kódu. Register stabilných problémov s dôkazmi, prioritou, pokusmi o opravu a kontrolou regresií sa dá zaviesť aj do poloautomatického procesu s ľudským schvaľovaním. Takýto záznam môže spojiť prevádzkové incidenty, testovacie trajektórie a zmeny promptov alebo nástrojov. Tím potom nehodnotí iba to, či nová verzia získala vyššie priemerné skóre, ale aj ktoré konkrétne zlyhania odstránila a ktoré sa vrátili.
V európskom prostredí je dôležitá auditovateľnosť, riadenie zmien a primeraný ľudský dohľad. ADIAS nie je nástrojom na automatické splnenie požiadaviek európskej regulácie a štúdia neposudzuje právny súlad. Jeho evidencia životného cyklu chýb však môže byť užitočnou technickou vrstvou pri internom riadení kvality. V regulovanom nasadení by bolo potrebné doplniť schvaľovacie brány, nemenné logy, oddelené testovacie prostredie, kontrolu nákladov a pravidlá určujúce, ktoré časti agentického systému sa vôbec smú automaticky meniť.
Otvoreným problémom zostáva spoľahlivosť diagnózy. Rovnaká príčina sa môže prejaviť viacerými spôsobmi a podobný prejav môže mať odlišné príčiny. Nesprávne zlúčenie alebo rozdelenie problémov skreslí históriu a môže optimalizátor viesť zlým smerom. Rastúci register zároveň zvyšuje náklady na hodnotenie a údržbu. Repozitár výslovne upozorňuje, že systém vykonáva modelom generované úpravy, preto má bežať v izolovanom prostredí, s oddeleným kontajnerovým zázemím a kontrolovanými prístupovými údajmi. Najpresnejší záver teda nie je, že ADIAS vyriešil automatický vývoj agentov, ale že ponúka konkrétny a overiteľný spôsob, ako v ňom nestratiť kontinuitu opráv.
Zdroje