Formula 1 skrátila onboarding dátových zdrojov z ôsmich týždňov na približne 40 minút
Agentický Data Accelerator na AWS generuje dátové pipeline, rieši zmeny schém a spája observabilitu s riadením prístupu. Ľudia naďalej schvaľujú každý zásah do produkcie.
Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.
- Typ zdroja
- Oficiálny zdroj
- Zdroj / autorita
- Amazon Web Services
Redakčný kontext
Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov. Zodpovednú kontrolu pravidiel robí Marek Považský.
Článok je zaradený v sekcii AI produkty a opiera sa o 1 zdroj.
Formula 1 a AWS nasadili systém Data Accelerator, ktorý automatizuje pripájanie nových zdrojov do marketingovej dátovej platformy Customer 360. Proces, ktorý podľa zverejnenej prípadovej štúdie trval šesť až osem týždňov manuálnej práce, sa skrátil na približne 40 minút generovania kódu, po ktorých nasledujú hodiny nasadenia a ľudskej kontroly. Agenti majú zabezpečiť približne 95 percent práce spojenej s onboardingom, no zmeny neposielajú do produkcie bez schválenia inžinierom.
Customer 360 zbiera interakcie fanúšikov z predaja vstupeniek, streamovania F1 TV, sociálnych sietí, partnerských aktivácií aj predaja tovaru. Nový zdroj predtým znamenal ručne pripraviť mapovanie schémy, ingestnú pipeline, testy kvality dát, klasifikáciu podľa GDPR a pravidlá správy prístupu. Formula 1 uvádza, že mala osemnásťmesačný backlog na integráciu dvanástich zdrojov. Pri pretekoch každé dva týždne a krátkych marketingových oknách sa tak rýchlosť dátovej integrácie stala prevádzkovým obmedzením, nie iba interným technickým problémom.
Data Accelerator vznikol začiatkom roka 2026 a využíva Amazon Bedrock AgentCore. Prvá fáza sa začína stručným dokumentom s biznisovými požiadavkami, ktorý tím nahrá do úložiska Amazon S3. Udalosť spustí funkciu AWS Lambda a agenta v AgentCore Runtime. Agent z dokumentu vytvorí konfiguračné súbory, cez GitHub App otvorí pull request v štandardizovanom repozitári a cez rozhranie Jira založí prepojenú úlohu. Priradený inžinier môže návrh upraviť a následne ho schváliť.
Po potvrdení konfigurácie človek spustí druhú fázu. Agent pripraví tri samostatné pull requesty: aplikačný a infraštruktúrny kód pre AWS Glue, transformačný rámec DBT a pravidlá správy dát vrátane GDPR tagov. Všetky sú spojené s jedným tiketom, aby zostala zachovaná sledovateľnosť. Agent pritom analyzuje stĺpce a navrhuje, či obsahujú osobné, citlivé osobné alebo pseudonymizované údaje. Kategórie sa zapisujú do registra správy dát v SageMaker Unified Studio, stále však platí princíp, že AI navrhuje a človek rozhoduje.
Architektúra nepoužíva pevne previazaný graf viacerých agentov. Jeden agent si podľa úlohy vyberá modulárne zručnosti pre mapovanie schémy, odhad dátových typov, kontrolu kvality, presadenie pravidiel a klasifikáciu citlivých údajov. Spracovanie má viac priechodov: prvý čistí a riadi objem tokenov, druhý sumarizuje výstupy nástrojov a tretí vytvára celkové posúdenie. Nová schopnosť sa tak dá pridať ako ďalší modul bez prepisovania základnej slučky agenta. Pre prevádzkový tím je to podstatné najmä z hľadiska údržby a kontroly rastúceho systému.
Automatizácia nekončí prvým pripojením zdroja. Dodávatelia dát môžu bez upozornenia premenovať stĺpec, pridať pole, zmeniť štruktúru súboru alebo čas doručenia. Agent preto cez udalosti z AWS Lambda a Amazon EventBridge sleduje zmeny schém, vyhodnocuje ich dopad na nadväzujúce pipeline a spotrebiteľov dát a navrhne opravy vo všetkých dotknutých repozitároch. Následne vytvorí tiket a pull requesty s vysvetlením zmeny. Formula 1 tvrdí, že celý proces nápravy sa z dní skrátil na hodiny.
Druhou významnou časťou riešenia je jednotná observabilita. Pred nasadením museli inžinieri pri podozrivom ukazovateli samostatne prehľadávať cesty v S3, riadiace tabuľky v Amazon Redshift, logy Airflow a výstupy DBT. Nové rozhranie zobrazuje líniu dát od surovej vrstvy v S3 cez spracovanie až po transformačné stupne v Redshift a DBT. Používateľ môže otvoriť konkrétny uzol, skontrolovať posledný beh, trvanie a stav a pri chybe vidieť, ktoré ďalšie dáta sú ovplyvnené. Prehľad sa podľa AWS obnovuje každých pätnásť minút.
Nástroj na analýzu koreňovej príčiny kombinuje technické logy s kontextovým grafom, v ktorom je topológia a biznisový kontext zapísaný ako JSON. Rozdiel je medzi konštatovaním, že v S3 chýba súbor, a vysvetlením, že jeho dodávateľ presunul čas doručenia, preto súbor v okamihu spustenia pipeline ešte neexistoval. Systém môže pri opraviteľnej chybe navrhnúť aj zmenu kódu. Toto spojenie observability, dátovej línie a návrhu nápravy je praktickejší vzor agentickej prevádzky než samostatný chatbot nad logmi.
Formula 1 zároveň zjednotila prístup analytikov, dátových inžinierov a vedcov cez SageMaker Unified Studio. Deklaratívna definícia zdroja súčasne publikuje dáta do katalógu a vytvára potrebné riadenie prístupu v dátovej sieti. Tím tvrdí, že pravidlá sú vynútené štruktúrou platformy, takže používateľ nemusí ručne riešiť umiestnenie dát, S3 prefixy ani jednotlivé oprávnenia. Samostatná optimalizácia algoritmu na zlučovanie identity fanúšika naprieč kanálmi navyše skrátila čas spracovania o polovicu bez deklarovanej zmeny presnosti alebo nadväzujúcich integrácií.
Bezpečnostný model zahŕňa krátkodobé tokeny s hodinovou platnosťou, minimálne oprávnenia, audit každej akcie, automaticky generované testy, možnosť návratu zmien a prevádzku v privátnych podsieťach bez priameho prístupu na internet. Tajomstvá sú uložené v AWS Systems Manager Parameter Store a prístup k modelom prechádza cez internú AI Gateway. Ako základný model AWS uvádza Claude Sonnet 4.6 a pri vývoji použitie nástroja Kiro. Zverejnené čísla pochádzajú z prípadovej štúdie dodávateľa a zákazníka, nie z nezávislého auditu. Napriek tomu ide o konkrétny produkčný vzor: agent generuje opakovanú prácu a návrhy opráv, ale existujúce pull requesty, testy, audit a ľudské schválenie zostávajú rozhodujúcou kontrolnou vrstvou.
Zdroje