aifeed.skAI Feed
AI novinky9 min čítania

Od redakcie: AI sa 28. augusta učila pracovať s neistotou, nástrojmi aj reálnou prevádzkou

Piatok priniesol nové metódy hodnotenia agentov, presnejší pohľad na neistotu v LLM, otvorenejšie testovanie rozpoznávania reči a konkrétne lekcie z nasadenia AI v maloobchode i tréningovej infraštruktúre.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Mediálny zdroj
Zdroj / autorita
Redakcia AI Feed

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI novinky a opiera sa o 7 zdrojov. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Piatok 28. augusta 2026 nepriniesol jeden dominantný model ani veľké generačné predstavenie. Oveľa zaujímavejšia bola spoločná línia viacerých nezávislých oznámení: umelá inteligencia sa posúva od pôsobivých ukážok k systémom, ktoré treba hodnotiť, prevádzkovať a kontrolovať v konkrétnych podmienkach. Apple predstavil výskum automatizovaného vytvárania testovacích scenárov pre agentov a samostatnú prácu o nekonzistentnom spracovaní pravdepodobnosti v jazykových modeloch. Hugging Face a VoiceArena rozšírili otvorené hodnotenie rozpoznávania reči o hindčinu a indickú angličtinu. AWS s Decathlonom ukázali produkčné nasadenie modelu Chronos-2 na prognózovanie dopytu a Databricks rozobral, prečo pri veľkom tréningu nestačí uložiť iba váhy modelu. PydanticAI a llama.cpp medzitým posunuli praktické nástroje pre agentov a lokálnu inferenciu.

Spoločným menovateľom je overiteľnosť. Nestačí vedieť, že model dosiahol dobré priemerné skóre. Organizácia potrebuje poznať jeho správanie pri zložitých parametroch nástrojov, pri zmene dôkazov, pri odlišných prízvukoch, počas výpadku GPU alebo po obnovení rozpracovaného procesu. Pre slovenské firmy a verejné inštitúcie je to dôležitejšie než ďalšie porovnanie veľkosti modelov: rozhodujúca konkurenčná výhoda sa čoraz častejšie vytvára v kvalite dát, testov, prevádzkového návrhu a kontroly rizík.

Agenti potrebujú scenáre, nielen zoznam nástrojov

Apple v práci Agent Seer rieši praktický problém, ktorý rastie spolu s používaním agentov: ako pripraviť realistické testy pre systém, ktorý počas viacerých konverzačných krokov vyberá externé nástroje a vypĺňa ich argumenty. Ručná tvorba takýchto scenárov vyžaduje znalosť domény, zle sa škáluje a rýchlo zastaráva pri zmenách API. Agent Seer preto vychádza priamo zo špecifikácie Model Context Protocol, teda z názvov funkcií, opisov a typovaných schém parametrov. Nepotrebuje ukážkové úlohy, živý prístup k nástrojom ani ladenie pre konkrétnu doménu.

Navrhnutý postup obohatí surové schémy, vytvorí odstupňované scenáre so syntetickými výstupmi nástrojov a rozšíri ich na viacťahové dialógy založené na fiktívnych testovacích dátach. Autori ho hodnotili na siedmich MCP špecifikáciách z rôznych oblastí. Podľa zverejneného opisu dosiahol dobrú správnosť volania nástrojov a konverzačnú súdržnosť; pri malých a stredne veľkých špecifikáciách pokryl všetky nástroje. Najsilnejšie s rozdielmi v kvalite súvisela zložitosť schém parametrov, nie samotný počet funkcií. Dominantným problémom nebol nesprávny názov nástroja, ale nepresná hodnota argumentu.

To je dôležité zistenie pre vývojárov. Agent môže na prvý pohľad vyzerať úspešne, pretože vybral správnu funkciu, no zároveň poslať chybný dátum, identifikátor zákazníka, menu alebo rozsah oprávnení. V produkcii môže byť takáto chyba drahšia než úplné zlyhanie, pretože systém vykoná platnú operáciu s nesprávnym obsahom. Slovenský tím, ktorý buduje agenta pre účtovníctvo, logistiku alebo elektronické služby, by preto nemal merať iba mieru správneho výberu nástrojov. Potrebuje testovať typy, hraničné hodnoty, väzby medzi parametrami, viacťahové opravy aj situácie, keď agent nástroj použiť nemá.

Agent Seer je zatiaľ výskumný návrh, nie dôkaz, že syntetické testy nahradia ľudskú kontrolu. Scenáre odvodené zo špecifikácie nemusia zachytiť nepísané obchodné pravidlá, reálne rozdelenie požiadaviek ani bezpečnostné dôsledky konkrétnej operácie. Praktická hodnota preto spočíva skôr v rýchlom vytvorení širokej základnej testovacej vrstvy. Tú treba doplniť incidentmi z prevádzky, expertnými prípadmi a testami zneužitia.

Jazykové modely nepracujú s neistotou vždy konzistentne

Druhá augustová práca Apple skúma jazykové modely ako pravidlá na spracovanie informácií. Autori merajú rozdiel medzi tým, ako model po prijatí dôkazu zmení svoje pravdepodobnostné presvedčenie, a aktualizáciou podľa Bayesovho pravidla. Táto otázka má priamy význam v medicíne, práve, poisťovníctve či vede, kde často neexistuje jediná istá odpoveď a nové dôkazy majú meniť odhad pravdepodobnosti.

Výsledky podľa autorov nie sú jednoduchým príbehom o tom, že presnejšia matematická aktualizácia automaticky vedie k lepšiemu systému. Niektoré skúmané postupy sa približovali Bayesovej aktualizácii, iné používali naučenú heuristiku. Prekvapujúco mohli nebayesovské heuristiky dosiahnuť lepší výsledok v následnej úlohe než presná Bayesova aktualizácia. Autori to interpretujú ako signál, že vnútorný pravdepodobnostný model sveta v LLM môže byť nesprávne špecifikovaný. Formálne optimálne spracovanie dôkazu potom nemusí napraviť chybný základný obraz problému.

Pre používateľa je podstatné, že slovné vyjadrenie istoty modelu nemožno automaticky považovať za kalibrovanú pravdepodobnosť. Hodnota „80 percent“ môže závisieť od formulácie otázky, poradia dôkazov alebo spôsobu, akým sa od modelu vyžiada aktualizácia. Pri rozhodovacích systémoch preto treba oddeliť generovanie vysvetlenia od výpočtu rizika. Tam, kde je to možné, majú pravdepodobnosti pochádzať z overeného štatistického modelu alebo deterministického nástroja a jazykový model má pomáhať s interpretáciou, nie nahrádzať merací mechanizmus.

Práca zároveň ponúka užitočný diagnostický smer. Namiesto otázky, či model odpovedal správne na jednom datasete, sa dá sledovať, či mení svoje presvedčenia konzistentne pri postupnom pridávaní dôkazov. Takéto testovanie môže byť relevantné aj pri posudzovaní vysokorizikových systémov podľa európskych pravidiel. Samotná štúdia však neoprávňuje na všeobecný záver, že všetky LLM sú v každej úlohe nekalibrované. Výsledok závisí od modelu, promptu, spôsobu získania pravdepodobnosti a domény; práve túto neistotu treba v dokumentácii otvorene pomenovať.

Otvorené ASR testy sa rozšírili za hranice európskych jazykov

Hugging Face a VoiceArena pridali do Open ASR Leaderboard dve sady: Monsoon en-IN pre indickú angličtinu a Monsoon hi-IN pre hindčinu. Hindčina sa tým stala prvým indickým jazykom v multilingválnej časti rebríčka, ktorá dovtedy podľa autorov pokrývala iba európske jazyky. Štyri verejné a neverejné časti sú rozdelené tak, aby sa medzi nimi neopakovali hovoriaci, a spolu zahŕňajú 4 888 rečníkov. Neverejné časti majú obmedzovať prispôsobovanie modelov konkrétnym benchmarkovým dátam.

Dôležitý nie je iba nový jazyk, ale návrh zberu. Sady zachytávajú geografiu, vek, rod, slovnú zásobu, zariadenia, akustické prostredie, typ a tempo reči i existenciu viacerých platných prepisov. Nahrávky vznikli z nečítaných spontánnych rozhovorov, často na vlastných telefónoch používateľov a v prirodzených podmienkach. Pri hindčine sa používa mriežka prijateľných pravopisných variantov namiesto jediného referenčného reťazca. To má znížiť penalizáciu správnych prepisov, ktoré sa líšia iba legitímnym zápisom.

Tento krok pripomína, že agregovaná chybovosť WER môže skrývať veľké rozdiely medzi skupinami. Systém s dobrým priemerom môže zlyhávať pri konkrétnom prízvuku, vekovej skupine alebo lacnejšom zariadení. Pre Slovensko je paralela zrejmá. Pri hodnotení slovenského rozpoznávania reči nestačí niekoľko hodín štúdiovej slovenčiny. Potrebujeme regionálne nárečia, maďarský a rómsky jazykový kontext, reč seniorov, telefonický zvuk, ruch verejných priestorov a terminológiu zdravotníctva či samosprávy. Inak môže hlasová automatizácia zlepšiť priemernú dostupnosť služby a súčasne zhoršiť prístup skupinám, ktoré už dnes čelia digitálnym bariéram.

Aj tu treba zachovať mieru. Monsoon je podľa autorov zámerne rozsiahly počtom hovoriacich, no relatívne malý dĺžkou zvuku. Rebríček ukáže časť nerovnomernosti, nie celú produkčnú realitu. Výsledky by preto mali byť vstupom do širšieho hodnotenia spolu s testami latencie, odolnosti proti hluku, ochrany biometrických údajov a ľudskej možnosti opraviť chybný prepis.

Podniková AI sa meria zásobami, nákladmi a časom obnovy

AWS a Decathlon zverejnili jeden z konkrétnejších príkladov nasadenia základného modelu mimo generovania textu. Decathlon používa Chronos-2 na týždenné prognózovanie predaja desiatok tisíc produktov v horizontoch 12 a 52 týždňov. Interné porovnanie zahŕňalo 101 časových rezov za takmer dva roky a približne 25 000 produktov v každom reze. Jemne doladený Chronos-2 mal v juhovýchodnej Ázii znížiť WAPE v 12-týždňovom horizonte z 39 na 28 percent a v Latinskej Amerike z 53 na 38 percent, teda o 11 a 15 percentuálnych bodov.

Zaujímavá je ekonomika prevádzky. Model sa dolaďuje pomocou LoRA iba raz za šesť mesiacov, zatiaľ čo prognózy bežia týždenne v dávke. AWS uvádza približne 40 sekúnd pre 7 000 a 75 sekúnd pre 15 000 časových radov na CPU infraštruktúre. Odhadované náklady jedného týždenného inferenčného behu sú približne tri centy. Nasadenie prognózovania v novom regióne sa podľa prípadovej štúdie skrátilo z približne šiestich na dva až tri mesiace.

Tieto čísla pochádzajú od dodávateľa a zákazníka zapojeného do implementácie, nejde teda o nezávislý audit. Napriek tomu ukazujú správny spôsob uvažovania: model sa hodnotil na vlastných dátach, vo viacerých časových rezoch a cez metriku previazanú so zásobami a dostupnosťou. AWS výslovne upozorňuje, že globálne rebríčky môžu mať na doménových dátach iné poradie modelov. Slovenský maloobchod, výroba alebo energetika by si z toho mali vziať najmä metodiku, nie automatický záver, že rovnaký model prinesie rovnaké zlepšenie.

Databricks doplnil prevádzkovú stránku veľkých tréningov. Pri stovkách alebo tisícoch GPU je zlyhanie očakávaná udalosť, preto je dôležitý „goodput“: podiel času, počas ktorého akcelerátory vykonávajú užitočný výpočet namiesto čakania a obnovy. Distribuovaný checkpoint v PyTorch umožňuje, aby jednotlivé procesy zapisovali vlastné časti stavu paralelne. Asynchrónne ukladanie môže prekryť zápis pokračujúcim tréningom a sprístupniť častejšie kontrolné body bez dlhého blokovania GPU.

Najdôležitejšie upozornenie sa týka dátového potrubia. Uloženie váh modelu nestačí, ak sa po obnove nevie presne určiť, ktoré dáta už boli spracované. Chyba môže viesť k tichému opakovaniu alebo vynechaniu vzoriek. Prevádzková odolnosť preto znamená verziovať model, optimalizátor, plán učenia, generátory náhodnosti aj stav dátového načítania. Pre menšie tímy je to pripomienka, že drahá GPU kapacita nie je jedinou položkou rozpočtu. Bez obnoviteľného potrubia sa úspora na inžinierstve môže zmeniť na opakovaný výpočet a výsledok, ktorý sa nedá reprodukovať.

Nástrojový ekosystém dozrieva po malých krokoch

PydanticAI vo verzii 2.36.0 pridal dekorátor @durable_operation a verejné rozhranie backendu pre externé systémy trvácneho vykonávania. Cieľom je umožniť operáciám agenta prežiť prerušenie procesu a pokračovať v koordinácii s enginmi určenými na spoľahlivé pracovné postupy. Verzia priniesla aj stabilný identifikátor častí inštrukcií, podporu asynchrónnych iterátorov pri odosielaní audia v reálnom čase a v nástroji clai podporu konfigurácie MCP i streamovania volaní nástrojov. Poznámky zároveň upozorňujú na kompatibilitu a vyžadujú explicitný názov trvácnej operácie.

Pre produkčný tím sú podobné zmeny významnejšie, než pôsobia v zozname noviniek. Trvácne vykonávanie, stabilné identifikátory a streamovanie ovplyvňujú auditovateľnosť, obnovu a používateľskú odozvu. Súčasne však verejné API pre backendy rozširuje integračný povrch. Pred aktualizáciou treba otestovať migráciu, idempotentnosť operácií, opakovanie po zlyhaní a to, či agent po obnove nevykoná platbu alebo zápis druhýkrát.

V llama.cpp vyšlo zostavenie b10680 zamerané na nastavenie SDK pre Snapdragon vo Windowse. Pôvodný PowerShell postup bol prenesený do Python skriptu, ktorý má uľahčiť inštaláciu Hexagon a OpenCL SDK. Ide o úzku technickú zmenu, ale zapadá do širšieho trendu lokálnej inferencie na klientskych zariadeniach. Tá môže znížiť latenciu a obmedziť odosielanie citlivých dát do cloudu. Sama osebe však nezaručuje súkromie: aplikácia stále potrebuje správu modelov, kontrolu telemetrie, podpisovanie balíkov a ochranu lokálne uložených kontextov.

Záverečný kontext: kvalita systému vzniká medzi modelom a realitou

Správy z 28. augusta spája presun pozornosti na rozhrania medzi modelom a svetom. Agent Seer skúma, či agent správne skladá nástroje a argumenty. Výskum pravdepodobnostných presvedčení upozorňuje, že sebavedomá odpoveď nemusí predstavovať konzistentnú neistotu. Monsoon rozširuje hodnotenie reči o populácie a podmienky, ktoré priemer ľahko zakryje. Decathlon meria AI cez zásoby, dostupnosť a čas nasadenia, Databricks cez užitočný čas GPU a správnu obnovu dát. PydanticAI a llama.cpp riešia trvácnosť procesov a lokálne vykonávanie.

Pre slovenské organizácie z toho vyplýva praktický postup. Najprv treba určiť merateľný výsledok a riziko, potom vytvoriť lokálny benchmark, testovať menšinové a hraničné prípady, zaznamenávať verzie dát i nástrojov a navrhnúť obnovu ešte pred produkčným nasadením. Pri systémoch s právnym alebo bezpečnostným dopadom je potrebná ľudská eskalácia, zrozumiteľné logovanie a jasné oddelenie odporúčania od automaticky vykonanej operácie.

Neistota zostáva vo všetkých dnešných výsledkoch. Výskumné práce nemusia generalizovať na každú doménu, dodávateľské prípadové štúdie nemusia zachytiť všetky náklady a benchmarky sú iba modelom reality. Práve otvorené pomenovanie týchto hraníc je však znakom dozrievania odvetvia. Najdôležitejšou novinkou dňa preto nie je jeden model, ale rastúci dôraz na to, aby sa tvrdenia o AI dali preveriť v konkrétnom pracovnom postupe.

Redakcia AI Feed

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie