Od redakcie: AI sa presúva od pôsobivých ukážok k dlhodobým agentom, pamäti a prísnejšiemu overovaniu
Prehľad 4. septembra: GitHub rozšíril Copilot, AWS ukázalo multimodálnych agentov aj správu ich pamäti a Databricks upozornil, že výkon generovaného kódu musí stáť na dôslednom overovaní.
Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.
- Typ zdroja
- Mediálny zdroj
- Zdroj / autorita
- Redakcia AI Feed
Ako vznikol tento text
Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.
Text je zaradený v sekcii AI novinky a opiera sa o 7 zdrojov. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.
Štvrtok 4. septembra 2026 nepriniesol iba ďalší rad izolovaných produktových noviniek. Naprieč vývojárskymi nástrojmi, cloudovou infraštruktúrou a optimalizáciou modelov sa opakovala spoločná téma: AI systémy sa pripravujú na dlhšie, samostatnejšie a prevádzkovo náročnejšie úlohy. S tým však rastie význam pamäti, riadenia životného cyklu dát, merateľnosti, kontroly nákladov a nezávislého overenia výsledkov.
Najviditeľnejšou udalosťou dňa bolo všeobecné sprístupnenie modelu GPT-6 Astra v službe GitHub Copilot. Prakticky dôležitejšie než samotný názov modelu sú však zmeny v spôsobe práce vývojárskych agentov. AWS medzitým publikovalo architektúry pre multimodálnu komunikáciu cez WhatsApp, údržbu dlhodobej pamäti agentov a továreň na modely pre fyzickú AI. Databricks opísal systém Proteus, v ktorom agent generuje špecializované GPU jadrá, ale o ich prijatí rozhoduje prísny validačný mechanizmus. PydanticAI zase rozšírilo kompatibilitu s novým modelom a opravilo viacero problémov v observabilite, streamovaní a práci s multimédiami.
Tieto oznámenia majú rôznu váhu. Niektoré predstavujú dostupné produktové funkcie, iné referenčné architektúry alebo výsledky merané samotným dodávateľom. Preto v súhrne oddeľujeme overiteľné fakty z primárnych zdrojov od tvrdení, ktorých všeobecnú platnosť zatiaľ nemožno potvrdiť nezávislým testovaním.
GitHub Copilot dostal GPT-6 Astra a posilňuje agentické pracovné postupy
GitHub 4. septembra oznámil všeobecnú dostupnosť modelu GPT-6 Astra v GitHub Copilot. Podľa oficiálneho changelogu je model určený najmä na dlhodobé autonómne programovanie a agentické úlohy. GitHub tvrdí, že pri internom testovaní model priebežne plánoval, validoval svoje kroky, spájal diagnostiku s overením a pred ukončením úlohy samostatne kontroloval výsledok. V porovnaní s predchádzajúcimi modelmi OpenAI mal dlhé programátorské úlohy zvládať v menšom počte krokov.
Ide o tvrdenia výrobcu a zatiaľ ich nemožno chápať ako nezávislé porovnanie. GitHub nezverejnil v krátkom oznámení kompletnú metodiku, sadu úloh ani rozptyl výsledkov. Overeným faktom však je dostupnosť modelu pre plány Copilot Pro+, Max, Business a Enterprise. Model možno vybrať vo Visual Studio Code, Visual Studio, Copilot CLI, agentovi Copilot, aplikácii Copilot, na github.com, v mobilných aplikáciách a vo vývojových prostrediach JetBrains, Xcode a Eclipse. Nasadzovanie je postupné a používanie sa účtuje podľa cenníka poskytovateľa.
Týždenný prehľad GitHubu doplnil širší kontext. Copilot rozširuje výber modelov a jeho aplikácia aj CLI už rešpektujú pravidlá vylúčenia obsahu. Citlivý kód označený podnikovou politikou sa tak nemá dostať do kontextu agentických pracovných postupov. Vo VS Code sa zároveň objavil Agent Merge vo verejnom náhľade. Jeho cieľom je pripraviť pull request na zlúčenie riešením pripomienok z kontroly, neúspešných automatických testov a konfliktov. Experimentálne pracovné priestory s viacerými koreňovými priečinkami majú umožniť relácie Copilotu a agentov Claude naprieč viacerými časťami projektu.
Pre slovenské vývojárske tímy je podstatná kombinácia schopností a správy. Nový model môže urýchliť rozsiahle refaktoringy alebo riešenie chýb, no podnikové nasadenie by nemalo stáť iba na deklarovanej kvalite. Organizácia potrebuje sledovať cenu jednotlivých behov, rozsah sprístupneného repozitára, zmeny navrhnuté agentom a výsledky testov. Obsahové výnimky sú užitočná ochranná vrstva, nie náhrada za minimálne oprávnenia, kontrolu tajomstiev a povinné posúdenie kritických zmien človekom.
PydanticAI reaguje podporou modelu a opravami prevádzkových detailov
PydanticAI vo verzii 2.39.0 pridalo podporu modelu GPT-6 Astra. Samotná kompatibilita s novým modelom je len jedna časť vydania. Dôležité sú aj opravy, ktoré sa týkajú reálnej prevádzky agentov: únikov pri spracovaní telemetrických záznamov, chýb obsahového filtra v Azure, streamovania prepisov reči, multimediálnych výsledkov nástrojov a skladania schopností.
Release notes uvádzajú opravu vyrovnávacej pamäte funkcie context_subtree a súvisiacich únikov span procesorov. Obnovená bola aj voľba include_model_request_parameters v inštrumentácii. PydanticAI má navyše rozpoznať chyby obsahového filtra pri AzureProvider aj pri klientoch AsyncAzureOpenAI použitých cez OpenAIProvider. Pri hlasových aplikáciách sa má finalizovaná reč emitovať aj v prípade, že ju ukončí volanie nástroja. Médiá vrátené nástrojom sa majú správne priradiť k pôvodnému volaniu, ak ich nemožno preniesť priamo vo výsledku nástroja.
Takéto zmeny nie sú marketingovo také nápadné ako nový model, ale pre produkčný systém môžu byť rozhodujúce. Agent, ktorý správne vyrieši úlohu, no zanechá neúplné stopy, nesprávne priradí multimediálny výstup alebo chybne interpretuje blokovanie obsahu, môže skomplikovať audit aj riešenie incidentu. Slovenské firmy používajúce regulované alebo osobné údaje by preto pri aktualizácii nemali testovať iba kvalitu odpovede. Potrebujú overiť telemetriu, chybové vetvy, prerušovanie streamu, správanie filtrov a spätnú kompatibilitu integračnej vrstvy.
AWS spája text, hlas a obraz v jednom zákazníckom agentovi
AWS predstavilo referenčnú implementáciu multimodálneho objednávkového asistenta pre WhatsApp postaveného na Amazon Bedrock AgentCore a Amazon Nova 2. Podľa oficiálneho opisu dokáže jeden firemný kontakt prijímať textové správy, hlasové poznámky aj živé hlasové hovory. Komunikačná vrstva je oddelená od vrstvy spracovania objednávok a spoločná pamäť má rozpoznávať zákazníka vo všetkých troch kanáloch.
Praktický význam nie je obmedzený na objednávanie jedla. Rovnaký návrhový vzor možno použiť v zákazníckej podpore, rezerváciách, poisťovníctve alebo terénnych službách. Používateľ môže začať textom, pokračovať fotografiou a problém vysvetliť hlasom bez toho, aby systém pri každej zmene kanála stratil celý kontext. Oddelenie komunikačnej a doménovej vrstvy zároveň uľahčuje pridať ďalší kanál bez prepisovania obchodnej logiky.
Referenčná architektúra však nie je automatickým dôkazom vhodnosti pre ostrú prevádzku. Pri hlasových a obrazových vstupoch vznikajú ďalšie kategórie osobných údajov, zvyšuje sa riziko nesprávneho rozpoznania a rastie počet externých integračných bodov. Prevádzkovateľ musí presne určiť, čo sa ukladá do pamäti, ako dlho sa údaje uchovávajú, kto k nim má prístup a ako používateľ opraví nesprávne pochopenú objednávku. Pri rozhodnutiach s finančným alebo právnym následkom má byť pred potvrdením viditeľný jednoznačný súhrn úkonu.
Pre slovenský trh je dôležitá aj jazyková stránka. Deklarovaná multimodalita sama osebe negarantuje rovnakú presnosť v slovenčine, pri nárečiach, hlučnom prostredí alebo pri miešaní jazykov. Pred nasadením je potrebná lokálna testovacia sada obsahujúca reálne názvy, adresy, ceny, skloňovanie a typické zvukové podmienky. Bez nej môže pôsobivá ukážka zakryť chyby, ktoré sa prejavia až pri bežných zákazníkoch.
Dlhodobá pamäť agentov potrebuje zabúdanie, nielen zhromažďovanie
Druhý príspevok AWS sa venoval pravidlám životného cyklu pamäti v Amazon Bedrock AgentCore. Východiskom je problém, ktorý bude s dlhšie pracujúcimi agentmi narastať: uložené poznatky zastarávajú, môžu si odporovať a časom zhoršovať kvalitu odpovedí. Zároveň vytvárajú náklady a riziko, že osobné alebo citlivé informácie zostanú dostupné dlhšie, než je potrebné.
AWS navrhuje pravidelný pracovný postup, ktorý pamäte hodnotí, konsoliduje a odstraňuje. Referenčné riešenie používa nočný proces v AWS Step Functions a dodáva sa s nasaditeľným balíkom AWS CDK. Dôležitá je myšlienka, že pamäť nie je pasívny archív. Má vlastnú kvalitu, platnosť a účel. Dve podobné položky možno zlúčiť, staré tvrdenie nahradiť novším a informáciu bez ďalšej hodnoty odstrániť.
Pre podniky ide o spojenie kvality AI so správou dát. Agent, ktorý si pamätá starý cenník, neplatný interný postup alebo predchádzajúcu pracovnú pozíciu zákazníka, môže vytvoriť presvedčivú, ale nesprávnu odpoveď. Ak sa pamäť používa na personalizáciu, musí existovať spôsob, ako zistiť pôvod informácie, dátum jej získania a dôvod ďalšieho uchovávania. Automatické skórovanie môže pomôcť, no pravidlá vymazávania by mali vychádzať aj z právnych lehôt, obchodného účelu a požiadaviek používateľa.
Slovenské organizácie podliehajúce GDPR by mali pri podobnom riešení rozlišovať medzi krátkodobým kontextom relácie, dlhodobou používateľskou pamäťou, auditným záznamom a analytickými dátami. Každá vrstva môže mať inú dobu uchovania a iný právny základ. Nočný automatizovaný proces je technický mechanizmus; sám neurčuje, čo je zákonné alebo primerané. Na to je potrebná dátová politika, evidencia spracovateľských činností a overiteľná možnosť výmazu.
Fyzická AI potrebuje nepretržitú továreň na dáta, tréning a hodnotenie
Tretia architektúra AWS ukazuje továreň na modely fyzickej AI s NVIDIA Cosmos 3 na SageMaker HyperPod a Kubernetes platforme Amazon EKS. Podľa AWS nejde o jeden tréningový beh, ale o opakovaný cyklus syntetickej tvorby dát, dotrénovania a uzavretého hodnotenia. Trvalý a odolný klaster má udržiavať celý proces v prevádzke a ako kľúčová metrika sa uvádza „GPU goodput“ – podiel užitočnej práce, ktorú infraštruktúra skutočne vykoná.
Tento posun je významný pre robotiku, autonómne stroje, logistiku a priemysel. Model fyzického sveta nemožno hodnotiť len podľa toho, či vierohodne vytvorí video. Potrebuje konzistentné priestorové a časové správanie, reprezentatívne scenáre a spätnú väzbu z testovania. Syntetické dáta môžu pokryť zriedkavé alebo nebezpečné situácie, ale môžu zároveň preniesť chyby simulátora do modelu. Uzavretá slučka hodnotenia preto musí obsahovať aj reálne dáta a testy mimo distribúcie, na ktorej systém vznikol.
Pre slovenské výrobné podniky je zaujímavá najmä ekonomika využitia GPU. Pri dlhých tréningových a simulačných úlohách nestačí sledovať rezervovanú kapacitu. Potrebné je merať čas stratený čakaním na dáta, zlyhanými úlohami, presunom checkpointov alebo nevyváženým rozdelením práce. Vyšší goodput môže znamenať nižšie náklady, no bezpečnostné testovanie fyzického systému nemožno optimalizovať iba na priepustnosť.
Databricks: generovať je jednoduchšie než dôveryhodne overovať
Najsilnejší technický motív dňa priniesol Databricks v texte o systéme Proteus na agentické generovanie špecializovaných GPU jadier. Systém necháva agenta navrhovať implementácie prispôsobené konkrétnym tvarom operácií, následne ich porovnáva s kontrolovanou referenciou, meria úspešné varianty a iteratívne zlepšuje najlepšie výsledky. Databricks uvádza, že jednotlivé jadrá vytvorené pre Qwen 3.5 122B boli 1,8- až 5,2-násobne rýchlejšie než najlepšie dostupné implementácie vo vLLM.
Čísla pochádzajú od autora systému a nemožno ich automaticky zovšeobecniť na celý model, všetky vstupy alebo produkčné nasadenie. Databricks sám zdôrazňuje riziko chybného merania. Kandidát mohol využiť skompilovaný stav z predchádzajúceho pokusu, profitovať z neférového porovnania alebo sa prispôsobiť iba viditeľným testovacím rozmerom. Preto Proteus používa viac spôsobov časovania, čistí zvyškový stav, opakuje meranie víťazov, zachováva skryté testy a označuje fyzikálne nepravdepodobné zrýchlenia, napríklad výsledky presahujúce limity pamäťovej priepustnosti či výpočtového výkonu.
Ide o poučenie presahujúce GPU jadrá. Agent môže optimalizovať ukazovateľ bez toho, aby vyriešil skutočný problém. Ak test odmeňuje iba rýchlosť, môže vzniknúť neúplná implementácia. Ak hodnotenie vidí agent vopred, môže sa naň nadmerne prispôsobiť. Ak sú obe strany merané inak, údajné zrýchlenie je iba artefakt. Databricks preto formuluje praktickú zásadu: návrhy možno produkovať lacno a paralelne, ale pokrok je taký rýchly, ako rýchlo ich dokážeme dôveryhodne skontrolovať.
Pre slovenských vývojárov je tento princíp použiteľný pri generovaní kódu, migráciách databáz aj automatizovaných bezpečnostných opravách. Agent potrebuje priestor skúšať riešenia, no vonkajší systém musí určovať, čo sa smie dostať do produkcie. Testy majú obsahovať skryté prípady, porovnanie musí byť reprodukovateľné a neobvykle dobré výsledky majú vyvolať kontrolu, nie okamžitú oslavu.
Záverečný kontext
Správy zo 4. septembra ukazujú, že ďalšia fáza AI nebude definovaná len kvalitou modelov. Rozhodujúce budú systémy okolo nich: vývojárske rozhrania, oprávnenia, multimodálne kanály, správa pamäti, telemetria, validačné mechanizmy a hospodárne využitie infraštruktúry.
GitHub posúva agentické programovanie bližšie k bežným vývojovým nástrojom. PydanticAI rieši integračné detaily, bez ktorých sa spoľahlivá prevádzka nezaobíde. AWS ukazuje, ako môžu agenti komunikovať viacerými spôsobmi, ako možno udržiavať ich pamäť a ako vybudovať opakovaný proces pre fyzickú AI. Databricks pripomína, že autonómia bez pevného hodnotiaceho rámca vedie k výsledkom, ktoré môžu vyzerať lepšie, než v skutočnosti sú.
Spoločný praktický odkaz pre slovenské firmy je jednoduchý: pri nákupe alebo vývoji agentického systému sa netreba pýtať iba na to, ktorý model používa. Rovnako dôležité je vedieť, aké údaje vidí, čo si pamätá, ako sa pamäť aktualizuje a vymazáva, koľko stojí dlhý beh, ako sa meria úspech a kto overí, že agent nesplnil metriku obídením zámeru. Práve tieto menej viditeľné vrstvy budú rozhodovať o tom, či sa AI z ukážky zmení na dôveryhodnú súčasť prevádzky.
— Redakcia AI Feed
Zdroje