aifeed.skAI Feed
AI novinky8 min čítania

Od redakcie: AI sa 27. augusta presúvala od odpovedí k overiteľným pracovným postupom

Štvrtok ukázal AI ako súčasť celého pracovného procesu: Apple spresňuje odmeňovanie odpovedí, Databricks spracovanie grafov, Google cestovanie a AWS dátovú suverenitu.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Mediálny zdroj
Zdroj / autorita
Redakcia AI Feed

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI novinky a opiera sa o 5 zdrojov. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Umelá inteligencia sa 27. augusta neposunula jedným veľkým modelovým predstavením, ale sériou praktických krokov, ktoré spolu ukazujú dôležitejší trend. Dodávatelia sa už nesústredia iba na to, či model dokáže vytvoriť presvedčivú odpoveď. Čoraz viac riešia, z akých podkladov odpoveď vznikla, ako sa dá skontrolovať, či agent správne prečítal dokument, kde sa spracúvajú dáta a ako sa výsledok dostane do reálneho produktu.

Apple predstavil výskum odmeňovania odpovedí pomocou rubrík založených na dôkazoch. Databricks ukázal, že pri podnikových dokumentoch môže byť štruktúrovaná reprezentácia grafu užitočnejšia než spoliehanie sa iba na vizuálne schopnosti veľkého modelu. Google rozšíril AI Mode vo vyhľadávaní o cestovné úlohy, ktoré už nekončia odporúčaním, ale smerujú k sledovaniu cien a rezervácii. AWS zároveň oznámilo lokálne inferenčné možnosti pre modely OpenAI v Indii, čím opäť zvýraznilo význam dátovej rezidencie.

Spoločným menovateľom je prechod od všeobecného chatbota k systémom s konkrétnou zodpovednosťou. Taký systém musí vedieť pracovať s dôkazmi, štruktúrovanými dátami, externými nástrojmi aj prevádzkovými obmedzeniami. Pre slovenské organizácie je to podstatnejšia správa než ďalšie izolované porovnanie modelov: hodnota AI sa čoraz viac rozhoduje v architektúre okolo modelu.

Apple rozkladá kvalitu odpovede na kontrolovateľné kritériá

Výskumníci Apple opísali rámec pre post-tréning modelov, v ktorom sa odpoveď nehodnotí iba jedným všeobecným skóre. Systém pre každú otázku vytvára osobitnú rubriku založenú na vyhľadaných dôkazoch a rozkladá kvalitu do viacerých rozmerov, napríklad kompozície odpovede, opory v zdrojoch a dodržania pokynov.

Podľa zverejneného súhrnu dosiahol tento prístup v priemere cez tri hodnotené osi zlepšenie o 6,5 percenta oproti východiskovému modelu doladenému na inštrukcie. V porovnaní s jednoduchšími, „plochými“ variantmi rubriky bolo zlepšenie štyri percentá. Apple zároveň uvádza, že podmienenie rubrík vyhľadanými dôkazmi posilnilo faktickú oporu a rozdelenie na samostatné kvalitatívne dimenzie pomohlo koherencii, organizácii a dodržaniu požiadaviek používateľa.

Praktická dôležitosť nespočíva iba v konkrétnych percentách. Jediné súhrnné skóre často zakrýva, prečo bola odpoveď označená za dobrú. Model môže byť štylisticky presvedčivý, no slabo podložený, alebo môže správne citovať fakty, ale nesplniť formát či účel zadania. Viacrozmerná rubrika umožňuje tieto prípady odlíšiť a vytvára presnejší signál pre ďalšie učenie.

Pre firmy, verejnú správu alebo médiá na Slovensku je tento princíp použiteľný aj bez tréningu vlastného veľkého modelu. Pri hodnotení interného asistenta možno osobitne merať správnosť citácií, úplnosť, dodržanie interných pravidiel, primeranosť jazyka a schopnosť priznať neistotu. Tím potom nevidí iba priemerné skóre, ale aj konkrétny typ zlyhania.

Treba však zachovať odstup od čísel prezentovaných autorom metódy. Výsledky pochádzajú z vybraných hodnotiacich dát a samy osebe nedokazujú rovnaké zlepšenie v slovenčine, v právnych dokumentoch alebo pri špecializovaných podnikových otázkach. Automaticky vytvorená rubrika môže navyše zdediť chybu z nesprávne vyhľadaného podkladu. Metóda preto nenahrádza kontrolu zdrojov; skôr poskytuje jemnejší spôsob, ako ju začleniť do tréningu a evaluácie.

Graf nie je iba obrázok

Databricks sa venoval inému slabému miestu podnikových agentov: informáciám ukrytým v grafoch a obrázkoch v dokumentoch. Bežný textový vyhľadávací systém vidí najmä okolité odseky a titulok grafu. To nemusí stačiť pri otázkach na konkrétne hodnoty, lokálne maximá, časové obdobia alebo vzťahy medzi viacerými krivkami.

Firma demonštrovala rozdiel na otázke, koľko lokálnych maxím sa nachádza v zobrazenom grafe. Agent, ktorý dostal iba obrázok, podľa článku po približne 50 sekundách uvažovania odpovedal nesprávne číslom 17. Genie s využitím štruktúrovanej extrakcie grafu odpovedal 18, čo bola správna hodnota. Jedna ukážka nie je benchmarkom, ale dobre ilustruje typ problému: vizuálne pôsobivý model nemusí spoľahlivo vykonať presné počítanie.

Navrhnutý postup používa funkciu ai_parse_document, ktorá reprezentuje obsah grafu ako štruktúrované JSON dáta. Nasleduje príprava blokov na vyhľadávanie, indexovanie ľahším textovým embeddingovým modelom s približne 300 miliónmi parametrov a napojenie výsledkov na agenta. Databricks uvádza hodnotenie na časti benchmarku ViDoRe V3 bohatej na grafy a na vlastnom syntetickom súbore Chart-RAG. Podľa firmy štruktúrovaná extrakcia zlepšila vyhľadanie relevantných strán aj presnosť odpovedí a bola konkurencieschopná voči väčším multimodálnym embeddingovým modelom.

Ide o dôležitú protiváhu predstave, že na každý problém stačí nasadiť väčší multimodálny model. Ak možno graf previesť na explicitné polia, série a hodnoty, systém dostáva reprezentáciu vhodnejšiu na presné vyhľadávanie a výpočty. Zároveň vzniká stopa, ktorú možno kontrolovať: prevádzkovateľ vie porovnať extrahované hodnoty s originálnou stranou dokumentu.

Na Slovensku je tento problém relevantný pre banky, poisťovne, priemyselné podniky, energetiku aj verejné inštitúcie. Výročné správy, technické protokoly, rozpočty a analytické materiály často obsahujú rozhodujúce údaje práve v grafoch. RAG systém postavený iba nad textom môže nájsť správny dokument, ale stále odpovedať nepresne, pretože nevidí jeho dátovú vrstvu.

Ani štruktúrovaná extrakcia však nie je automatickou zárukou správnosti. Chyby môžu vzniknúť pri rozpoznaní osi, legendy, farieb, jednotiek alebo prekrytých dátových radov. Pri dôležitých rozhodnutiach by preto pipeline mala uchovávať pôvodný obrázok, extrahovanú štruktúru a odkaz na konkrétnu stranu. Odpoveď agenta musí byť spätne overiteľná, nie iba presvedčivá.

Google posúva AI Mode bližšie k transakcii

Google rozšíril AI Mode vo vyhľadávaní o tri cestovné možnosti: sledovanie cien leteniek v konverzácii, zobrazovanie cien v bodoch alebo míľach a rezerváciu hotelov. Používateľ môže opísať trasu a termín, nechať si porovnať možnosti a následne požiadať o sledovanie ceny. Google uvádza, že dáta o letoch čerpá od viac než 300 partnerských aerolínií a cestovných služieb. Pri zmene ceny má používateľ dostať e-mailové upozornenie.

Zobrazovanie cien v bodoch a míľach je podľa Googlu globálne dostupné v podporovaných lokalitách AI Mode, spočiatku pre vybraných leteckých a hotelových partnerov. Samotná rezervácia hotela sa začala zavádzať v angličtine v Spojených štátoch a využíva partnerov ako Booking.com, Expedia, Hilton, Marriott či Trip.com.

Pre európskeho čitateľa je rozhodujúca poznámka pod čiarou. Sledovanie cien letov v AI Mode nie je pri oznámenom zavádzaní dostupné v krajinách a územiach Európskeho hospodárskeho priestoru. Google tiež upozorňuje, že niektoré zobrazované funkcie bodov a míľ nemusia byť v EHP k dispozícii. Slovenský používateľ preto nemá automaticky očakávať rovnaký produkt ako používateľ v USA, aj keď sa oznámenie opisuje globálnym jazykom.

Strategicky je však smer jasný. Vyhľadávanie sa mení z rozhrania na nájdenie webovej stránky na asistenta, ktorý udržiava kontext, sleduje stav a privádza používateľa až k transakcii. To mení pozíciu aerolínií, hotelov, porovnávačov aj menších cestovných portálov. Nestačí byť indexovateľný; dôležité budú aktuálne štruktúrované dáta, dostupnosť cez partnerské rozhrania a schopnosť vysvetliť cenu, podmienky či storno pravidlá.

Pre spotrebiteľa pribúda pohodlie, ale aj otázka neutrality. AI rozhranie rozhoduje, ktoré možnosti zobrazí, ako ich zoradí a ktorých partnerov podporuje. Pri rezervácii musí používateľ stále skontrolovať konečnú cenu, batožinu, storno podmienky, menu a identitu zmluvnej strany. Konverzačné pohodlie neznižuje význam týchto detailov; môže ich naopak ľahšie skryť.

Dátová rezidencia sa stáva vlastnosťou modelovej platformy

AWS oznámilo dostupnosť modelov OpenAI v Amazon Bedrock pre inferenciu v rámci Indie. Podľa oznámenia ide o modely GPT-5.6 Terra a Luna a geografické smerovanie, pri ktorom majú inferenčné požiadavky a dáta zostať v Indii. Správa je geograficky vzdialená od Slovenska, no vystihuje globálny posun v infraštruktúre AI.

Podniky nechcú iba prístup k výkonnému modelu. Potrebujú vedieť, v ktorom regióne sa požiadavka spracuje, aké záznamy vzniknú, kto ich môže vidieť a či architektúra spĺňa miestne pravidlá alebo zmluvné záväzky. Preto sa dostupnosť modelu čoraz častejšie rozdeľuje podľa regiónov a kombinuje s kontrolami cloudovej platformy.

Pre slovenské organizácie je poučenie praktické. Pojem „dáta sú v Európe“ treba rozložiť na konkrétne otázky: kde prebieha inferencia, kde sa ukladajú logy, či sa vstupy používajú na tréning, kam smeruje telemetria a akí subdodávatelia sa zapájajú. Samotný názov európskeho regiónu nemusí odpovedať na celý dátový tok. Pri citlivých údajoch treba overiť aj retenčné politiky, šifrovanie, riadenie prístupu a možnosti auditu.

Dátová suverenita zároveň nie je synonymom bezpečnosti. Lokálne spracovanie znižuje niektoré právne a prevádzkové riziká, ale nechráni pred chybnými oprávneniami, prompt injection, únikom cez nástroje agenta alebo príliš podrobným logovaním. Je to jedna vrstva architektúry, nie konečný certifikát dôveryhodnosti.

Agentické knižnice dozrievajú cez malé prevádzkové zmeny

Aj menšie vydania vývojárskych nástrojov ukázali, kde sa agentická infraštruktúra stabilizuje. LangGraph vydal Python SDK 0.4.4, ktorého konkrétnou novinkou je smerovanie LangSmith trás z thread streamov. Nejde o veľké produktové predstavenie, ale o typ zmeny dôležitý pri diagnostike viacstupňových agentov. Ak agent vykonáva sériu streamovaných krokov, vývojár potrebuje spojiť udalosti s príslušným vláknom a sledovať, kde vznikla latencia, chyba alebo neočakávané rozhodnutie.

Takéto release notes pripomínajú, že produkčný agent nie je iba prompt a model. Potrebuje pozorovateľnosť, identifikáciu behov, kontrolu nákladov, opakovateľné testy a zrozumiteľný záznam volaní nástrojov. Pre slovenský tím môže kvalitné trasovanie priniesť väčší prevádzkový úžitok než okamžitý prechod na novší model, pretože umožní odhaliť skutočný zdroj zlyhania.

Zároveň treba pri rýchlo vydávaných SDK postupovať konzervatívne. Aktualizácie by mali prejsť regresnými testami, najmä ak sa mení streamovanie, trasy alebo trvalý stav vlákien. Pozorovateľnosť navyše vytvára nové dátové záznamy; nesmie sa zmeniť na nekontrolovaný archív používateľských otázok, osobných údajov a interných dokumentov.

Záverečný kontext: model je iba jedna vrstva

Udalosti 27. augusta spája požiadavka na lepšie rozhranie medzi modelom a realitou. Apple sa snaží presnejšie definovať, čo znamená kvalitná a podložená odpoveď. Databricks prevádza vizuálne informácie do štruktúry, ktorú možno vyhľadávať a kontrolovať. Google prepája konverzáciu s aktuálnymi cestovnými dátami a transakčným procesom. AWS rieši geografiu inferencie a LangGraph viditeľnosť agentických behov.

Pre slovenské firmy a inštitúcie z toho vyplýva rozumná priorita: pred výberom modelu treba opísať celý tok úlohy. Odkiaľ prichádzajú podklady? Ako sa spracujú tabuľky a grafy? Podľa akých kritérií sa odpoveď hodnotí? Ktoré nástroje smie agent volať? Kde sa spracúvajú a logujú dáta? Ako používateľ skontroluje zdroj a ako prevádzkovateľ vyšetrí chybu?

Práve tieto otázky sa zároveň približujú bezpečnosti a regulácii. Európske organizácie budú potrebovať preukázať nielen to, aký model použili, ale aj ako riadili dáta, riziká, ľudský dohľad a kvalitu výstupu. Viacrozmerné rubriky, zdrojové odkazy, štruktúrovaná extrakcia a trasovanie môžu pomôcť vytvoriť auditovateľnú stopu. Samy osebe však nezaručujú súlad ani správnosť.

Najväčšou neistotou zostáva prenos výsledkov medzi prostrediami. Výsledok na anglickom benchmarku nemusí platiť pre slovenské dokumenty, produkt dostupný v USA nemusí byť dostupný v EHP a deklarovaná dátová rezidencia nemusí pokrývať všetky pomocné služby. Preto má byť ďalším krokom nie slepé preberanie tvrdení dodávateľov, ale vlastné testovanie na lokálnych dátach, dokumentovanie obmedzení a jasné určenie situácií, v ktorých rozhodnutie musí prevziať človek.

— Redakcia AI Feed

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie