AEROBAT automatizuje výskum správania AI agentov, aktualizovaná štúdia uvádza takmer 23-tisíc simulačných kôl
Aktualizovaná verzia preprintu opisuje systém AEROBAT, ktorý generuje hypotézy, pripravuje kontrolované prostredia a vyhodnocuje správanie AI agentov. Pri 12 typoch správania otestoval 73 hypotéz v 22 954 simulačných kolách; výsledky sú sľubné, no závisia od modelových simulácií a automatického hodnotenia.
Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.
- Typ zdroja
- Výskumná práca
- Zdroj / autorita
- arXiv
Ako vznikol tento text
Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.
Text je zaradený v sekcii AI výskum a opiera sa o 4 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.
Od otázky po výskumnú správu
AEROBAT je multiagentový výskumný systém, ktorý má automatizovať celý cyklus behaviorálneho skúmania AI agentov. Používateľ určí cieľové správanie a skúmaný model, zatiaľ čo jednotlivé komponenty systému definujú jav, vytvoria hodnotiacu rubriku, navrhnú hypotézy, pripravia kontrolované prostredia, vykonajú simulácie a výsledky štatisticky spracujú. Prácu vytvorili výskumníci z KAIST, Soulskej národnej univerzity, Yaleovej univerzity, University College London, Amsterdamskej univerzity a Haifskej univerzity. Ide však stále o preprint bez potvrdenia štandardným recenzným konaním.
Oproti pôvodnému súhrnu článku je dôležitá oprava čísel podľa druhej verzie práce z 15. augusta 2026. Aktuálny rukopis neuvádza 79 hypotéz, 1 240 experimentov a 23 512 simulačných kôl, ale 73 otestovaných hypotéz, 1 160 kontrolovaných experimentov a 22 954 kôl. Stredne silné až silné štatistické dôkazy autori hlásia pri 30 hypotézach, nie pri 26. Zmena ukazuje, prečo treba pri rýchlo sa vyvíjajúcich preprintoch kontrolovať konkrétnu verziu dokumentu a nepreberať výsledky iba zo skorého abstraktu.
Systém skúmal dvanásť sociálnych, ekonomických a prevádzkových prejavov: priateľskosť, extroverziu, empatiu, pochlebovanie používateľovi, nakupovanie, súťaživosť, nedôveru, strategickú agresivitu, doslovnosť, neposlušnosť, plánovanie a klamanie. Pri hlavnom experimente bol skúmaným agentom GPT-5-mini. Pre každý jav AEROBAT vytvoril najviac dvadsať hypotéz a vybral päť až sedem na ďalšie testovanie. Jedna hypotéza sa následne realizovala vo viacerých doménach a konfiguráciách, aby pozorovaný účinok nebol viazaný iba na jediný príbeh alebo formuláciu zadania.
Ako má kontrolovaný experiment fungovať
Kľúčovým prvkom AEROBAT-u nie je samotný počet behov, ale spôsob tvorby párovaných podmienok. Systém opisuje prostredie pomocou domény, premenných a ich usporiadaných alebo binárnych hodnôt. V jednej skupine simulácií sa má meniť iba predpokladaná príčina, napríklad prísnosť pravidiel, dostupnosť zdrojov alebo sila sociálnej normy. Ostatné vlastnosti zostávajú rovnaké. Každú abstraktnú hodnotu možno navyše uskutočniť viacerými situáciami: nedostatok zdrojov môže znamenať málo času, peňazí alebo personálu. Autori sa tým snažia obmedziť riziko, že výsledok vyvolala konkrétna slovná formulácia namiesto skúmanej premennej.
Výskumný reťazec obsahuje viacero kontrolných brán. Manažérsky agent najprv zoradí hypotézy, potom preveruje vnútornú súdržnosť pripravených konfigurácií a po simulácii vyraďuje behy, ktoré nezodpovedajú zadaným podmienkam. Hodnotiaci agent dostane históriu simulácie a rubriku správania, ale nemá poznať testovanú hypotézu ani ostatné podmienky. Podobne simulátor a skúmaný agent nepoznajú očakávaný smer účinku. Toto zaslepenie má znížiť tlak modelov na potvrdenie hypotézy, hoci ho nemôže úplne odstrániť.
Pri štatistickom vyhodnotení autori používajú Bayesov faktor a štandardizovanú veľkosť účinku pre monotónne zmeny medzi úrovňami skúmanej premennej. Za dôkaz účinku považujú Bayesov faktor vyšší než tri a výsledok kontrolujú aj stratifikovanou Kendallovou koreláciou s permutačným testom. Medzi ilustračné nálezy patrí rastúca tendencia klamať, keď ostatní aktéri klamanie normalizovali, či vyššia doslovnosť pri zložitejších súboroch obmedzení. Ide o výsledky v umelo vytvorených textových prostrediach, nie o dôkaz rovnakého správania v reálnych organizáciách.
Čo pribudlo v aktualizovanej analýze
Druhá verzia rukopisu podrobnejšie skúma, či sa nálezy prenášajú medzi modelmi. Autori opätovne vykonali desať vybraných experimentov so skúmanými agentmi GPT-5-mini, Gemini-3.1-Pro a Kimi K2.6. Poradie veľkostí účinkov bolo podľa nich medzi modelmi do istej miery podobné: korelácia s pôvodným výsledkom GPT-5-mini dosiahla 0,95 pri jeho novom behu, 0,68 pri Gemini a 0,70 pri Kimi. Takáto malá vzorka však nestačí na tvrdenie, že mechanizmy správania sú všeobecné pre všetky modely alebo agentické architektúry.
Autori osobitne hodnotili aj vernosť prostredí. Model sa pokúšal spätne určiť hodnoty premenných z konfigurácií, priradiť simulácie k správnym podmienkam a identifikovať, ktorá premenná sa medzi nimi menila. Ľudský hodnotiteľ následne posudzoval, či identifikovaná zmena zodpovedá zamýšľanej príčine. Tento postup je užitočnejší než nekontrolované generovanie scenárov, stále však ponecháva veľkú časť validácie na ďalších jazykových modeloch. Spoločné chyby simulátora, hodnotiteľa a skúmaného modelu sa preto môžu navzájom posilňovať.
Porovnanie významných výsledkov so skoršou literatúrou prinieslo prevažne nepriamu zhodu, nie nezávislé replikácie. Z 29 porovnávaných nálezov autori označili štyri za priamo konzistentné, 23 za konzistentné cez príbuzný jav a po jednom za priamo alebo nepriamo nekonzistentné. Aj tento rozpis je dôvodom na opatrnosť: podobný smer výsledku pri odlišnom meradle alebo zásahu môže podporovať vierohodnosť hypotézy, ale nenahrádza reprodukciu rovnakého experimentu nezávislým tímom.
Praktický význam pre Európu a Slovensko
Pre vývojárov môže byť AEROBAT zaujímavý ako nástroj na objavovanie rizikových situácií pred nasadením agenta. Slovenská banka, poisťovňa, nemocnica alebo verejná inštitúcia by mohla systematicky meniť mieru časového tlaku, konflikt cieľov, prístup k citlivým nástrojom či pokyny nadriadeného a sledovať, kedy agent začne obchádzať pravidlá. Automatizované experimenty by mohli doplniť regresné testy po zmene modelu alebo systémového promptu. Nemali by však samy rozhodovať o pripravenosti produktu: kritické nálezy treba zopakovať s pevne uloženými konfiguráciami, ľudským hodnotením a reálnymi pracovnými dátami v bezpečnom prostredí.
Európsky kontext zvyšuje význam sledovateľnosti. Európska komisia pri vysokorizikových systémoch zdôrazňuje riadenie rizík, zaznamenávanie činnosti, dokumentáciu, ľudský dohľad, robustnosť a presnosť; pri modeloch na všeobecné účely so systémovým rizikom požaduje hodnotenie a zmierňovanie rizík. AEROBAT nie je automatickým dôkazom súladu s Aktom o AI, no jeho experimentálne záznamy by mohli byť jedným zo vstupov do interného testovania. Podobne profil NIST pre generatívnu AI odporúča začleniť dôveryhodnosť do návrhu, používania a evaluácie systému, čo podporuje opakované behaviorálne testy namiesto jednorazového benchmarku.
Najväčšou otvorenou otázkou zostáva vedecká nezávislosť celého reťazca. Jazykové modely navrhujú hypotézu, realizujú prostredie, produkujú správanie a významnú časť správania aj hodnotia. Zaslepenie a štatistika sú užitočné poistky, no nevylučujú zdieľané skreslenia, nepresné rubriky, výber zaujímavejších hypotéz ani falošné objavy pri veľkom množstve pokusov. Kým iné tímy nezopakujú výsledky a neporovnajú automatické skóre s rozsiahlejšou ľudskou anotáciou, AEROBAT je presvedčivejší ako generátor overiteľných hypotéz a škálovateľný predbežný audit než ako autonómny vedecký arbitér.
Zdroje
- Automating and Scaling Behavioral Scientific Research on AI Agents – záznam preprintu v2
- Automating and Scaling Behavioral Scientific Research on AI Agents – úplné znenie práce
- Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
- AI Act – prehľad pravidiel Európskej komisie