aifeed.skAI Feed
AI novinky9 min čítania

Od redakcie: AI sa 25. augusta posúvala od väčších modelov k efektívnejšiemu nasadeniu, agentom a infraštruktúre

Denný prehľad spája nové otvorené reasoning modely IBM, výskum multimodálnej generácie, kompresiu LLM, lokálne modely v Claude, agentickú observabilitu, čipovú infraštruktúru aj riziká vplyvových operácií.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Mediálny zdroj
Zdroj / autorita
Redakcia AI Feed

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI novinky a opiera sa o 9 zdrojov. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Utorok 25. augusta 2026 nepriniesol jednu dominantnú udalosť, ktorá by sama definovala smer celého odvetvia. Namiesto toho sa objavilo viacero navzájom prepojených signálov: nové otvorené modely získavajú dlhší kontext a schopnosť používať nástroje, výskumníci hľadajú spoločnú architektúru pre text a obraz, kompresia prestáva byť iba núdzovým kompromisom a infraštruktúrne firmy súperia o rýchlosť, energetickú efektívnosť aj jednoduchšie prevádzkovanie agentov. Súčasne sa pripomenulo, že praktická hodnota AI nemôže byť oddelená od bezpečnosti, dôveryhodnosti zdrojov a kontroly nad tým, kam agent posiela údaje.

Pre slovenské firmy, vývojárov a verejné inštitúcie je dôležitý najmä spoločný menovateľ týchto správ. Konkurenčná výhoda sa už netvorí len výberom modelu s najlepším výsledkom v jednom benchmarku. Čoraz viac záleží na celej zostave: licencii, lokálnom alebo cloudovom nasadení, pamäťových nárokoch, podpore nástrojov, pozorovateľnosti, bezpečnostných pravidlách a schopnosti overiť výstup proti pôvodným dokumentom. Nasledujúce udalosti preto čítame ako časti jedného technologického posunu, nie ako izolované oznámenia.

Granite 4.2 ukazuje, čo sa dnes očakáva od otvoreného modelu

IBM zverejnilo technický opis rodiny Granite 4.2. Ide o husté decoder-only reasoning modely s veľkosťami 3B, 8B a 30B parametrov, vydané pod licenciou Apache 2.0. Podľa technického článku boli modely predtrénované od začiatku približne na 15 biliónoch tokenov. Päťfázový tréning mal v závere rozšíriť podporovaný kontext až na 512-tisíc tokenov. Všetky varianty ponúkajú natívne volanie nástrojov a prepínanie medzi režimom s uvažovaním a bez neho; k dispozícii je aj úsporný režim s kratším rozpočtom na uvažovanie.

Dôležitejšie než samotné počty parametrov je zameranie posttréningu. IBM uvádza približne 7,2 milióna vzoriek pre supervised fine-tuning, pričom agentická časť zahŕňala softvérové inžinierstvo, terminál, vyhľadávanie, matematiku a používanie nástrojov. Modely 8B a 30B navyše prešli agentickým reinforcement learningom v reálnych sandboxovaných prostrediach. To je podstatný rozdiel oproti modelu, ktorý bol iba naučený vytvoriť syntakticky správny JSON s názvom funkcie. Agent musí zvládnuť celý sled krokov, reagovať na chyby nástroja a upravovať postup podľa výsledku.

Pre slovenského používateľa je zaujímavá kombinácia otvorenej licencie, relatívne dostupných veľkostí a podpory štandardného formátu volania funkcií. Model s 3B alebo 8B parametrami môže byť kandidátom na lokálne experimenty, interných asistentov či spracovanie citlivých dokumentov, hoci reálna kvalita v slovenčine a pri doménových úlohách sa musí samostatne otestovať. Udávané dĺžky kontextu tiež nemožno zamieňať s garanciou, že model dokáže spoľahlivo nájsť detail kdekoľvek v polmiliónovom vstupe. Technická podpora dlhého okna, kvalita vyhľadania informácie a ekonomika inferencie sú tri rozdielne otázky.

STARFlow2 spája jazykový model a kontinuálne generovanie obrazu

Apple predstavil výskumnú prácu STARFlow2, ktorá sa pokúša zjednotiť porozumenie aj generovanie textu a obrazu pod jedným kauzálnym mechanizmom. Súčasné multimodálne systémy často používajú odlišné postupy: text generujú autoregresívne, zatiaľ čo obraz vzniká opakovaným odšumovaním v difúznom modeli. Alternatívou je previesť obraz na diskrétne tokeny, čo však môže znížiť vizuálnu vernosť.

STARFlow2 vychádza z pozorovania, že autoregresívne normalizačné toky môžu používať rovnakú kauzálnu masku, ľavostranné generovanie a KV cache ako jazykové transformery. Architektúra podľa autorov vertikálne prepája zmrazený prúd predtrénovaného vision-language modelu s prúdom TARFlow cez reziduálne spojenia. Textové aj vizuálne výstupy môžu vstupovať priamo do cache bez opätovného kódovania. Cieľom je zachovať už naučené multimodálne porozumenie a súčasne generovať kvalitný obraz v kontinuálnom priestore.

Ide zatiaľ o výskumný výsledok, nie oznámenie spotrebiteľského produktu. Praktický význam však môže byť veľký. Jednotnejšia architektúra by mohla zjednodušiť agentov, ktorí striedavo čítajú dokument, vytvoria diagram, doplnia text a následne pracujú s vlastným vizuálnym výstupom. Pre menšie slovenské tímy je relevantná aj možná úspora spôsobená spoločnou cache a odstránením opakovaného prekódovania. Kým však nebudú dostupné nezávislé testy, náklady na tréning a širšie porovnania, nemožno z výsledkov vyvodiť, že autoregresívne toky nahradia difúzne modely. Práca predovšetkým ukazuje životaschopný smer.

Štvorbitový model nemusí byť automaticky horší

Ďalší pozoruhodný výsledok sa týka kompresie. Tím Multiverse Computing opísal metódu Quantization-Aware Healing, skrátene QAH. Pri experimente použil pôvodný model GPT-OSS 120B ako učiteľa a štrukturálne zmenšený 60-miliardový model v štvorbitovom formáte MXFP4 ako študenta. Autori tvrdia, že výsledný štvorbitový model prekonal vlastný bfloat16 checkpoint v siedmich z deviatich benchmarkov.

Podstatou nie je tvrdenie, že nižšia presnosť sama osebe zvyšuje inteligenciu. QAH pridáva ďalšiu fázu destilácie: komprimovaný a kvantizovaný študent sa neučí od už zhoršeného zmenšeného checkpointu, ale priamo od pôvodného veľkého modelu. Výstupné rozdelenie učiteľa nezávisí od toho, či majú oba modely rovnakú architektúru. Študent tak môže počas „hojenia“ získať informáciu, ktorú skoršia fáza kompresie nestihla preniesť.

Ak sa výsledok potvrdí na ďalších modeloch a nezávislých testoch, môže zmeniť ekonomiku lokálneho nasadenia. Menší model znamená nižšie nároky na pamäť, lacnejší server a potenciálne menšiu energetickú stopu. Pre slovenskú firmu môže byť rozdiel medzi 16-bitovým a štvorbitovým variantom rozdielom medzi vlastným hardvérom a trvalou závislosťou od externého API. Zároveň treba zachovať opatrnosť: sedem z deviatich benchmarkov nie je univerzálne víťazstvo, benchmarky nemusia reprezentovať slovenčinu ani konkrétny podnikový proces a porovnávaný bfloat16 model bol sám výsledkom predchádzajúcej kompresie. Ide o výsledky autorov metódy, nie o všeobecne potvrdený zákon.

Claude Desktop sa otvára lokálnym modelom cez Ollamu

Ollama oznámila jednoduché prepojenie s aplikáciou Claude Desktop ako poskytovateľ tretej strany. Používateľ môže v nastaveniach Ollamy zapnúť integráciu a následne v rozhraní Claude vyberať lokálne modely alebo modely dostupné cez cloud Ollamy. Vypnutím funkcie sa má obnoviť pôvodné nastavenie Claude.

Na prvý pohľad ide o malú produktovú zmenu, no dobre ilustruje oddeľovanie používateľského rozhrania od modelovej vrstvy. Organizácia si môže ponechať pracovný nástroj, na ktorý sú ľudia zvyknutí, a meniť model podľa citlivosti dát, ceny alebo požadovanej schopnosti. Lokálny model môže spracovať interný text, zatiaľ čo náročnejšia výskumná úloha môže smerovať do cloudu.

Tvrdenia Ollamy o vypnutej telemetrii a politike nulového uchovávania údajov sú vyhláseniami dodávateľa. Pred firemným nasadením treba overiť sieťovú komunikáciu, konfiguráciu konkrétneho modelu, logovanie operačného systému aj pravidlá samotnej desktopovej aplikácie. „Lokálny model“ neznamená automaticky úplne offline proces, ak pracovný tok používa vzdialené vyhľadávanie, MCP server alebo ďalší cloudový nástroj.

Agenti potrebujú observabilitu, nielen konverzačné okno

AWS predstavilo agentickú observabilitu pomocou Amazon OpenSearch Service MCP Apps. Podľa oznámenia môže MCP server vracať spolu s textovou odpoveďou interaktívne vizualizácie. Agent tak môže v jednom rozhovore prejsť od upozornenia cez distribuovaný trace a logy až k návrhu koreňovej príčiny, pričom operátor vidí podklady priamo vo svojom vývojovom prostredí.

Toto je dôležitý posun od agenta, ktorý iba slovne zhrnie stav systému, k rozhraniu, v ktorom možno jeho postup priebežne kontrolovať. V produkcii nestačí presvedčivo znejúca diagnóza. Prevádzkový tím potrebuje vedieť, aký log agent otvoril, ktorý časový úsek použil, ako spojil udalosti a či neprehliadol alternatívne vysvetlenie. Interaktívne prvky môžu skrátiť cestu k dôkazu, ale samy osebe negarantujú správnu analýzu.

Slovenské tímy by si pri podobnom nasadení mali nastaviť minimálne prístupové role, audit volaní nástrojov, časové a nákladové limity a jasnú hranicu medzi čítaním a zásahom do systému. Agent určený na diagnostiku nemusí mať právo reštartovať službu alebo meniť konfiguráciu. MCP zjednodušuje prepojenie modelu s nástrojmi, no zároveň zväčšuje priestor, ktorý treba bezpečnostne kontrolovať.

Aj PydanticAI vydal počas sledovaného obdobia nové verzie. Release v2.34.0 priniesol okrem podpory GLM-5.3 a migračného skillu z LangChainu viacero opráv adaptérov, volania nástrojov a retry mechanizmov. Nasledujúca verzia v2.35.0 upravila API schopností, frekvenciu exportu metrík pre Temporal a zachovanie explicitne prázdneho opisu nástroja. Jednotlivé zmeny nie sú veľkým produktovým príbehom, ale pripomínajú, že agentické frameworky sa stále rýchlo menia. Pri produkčných aplikáciách je preto rozumné pripínať verzie, čítať poznámky o kompatibilite a testovať nielen konečnú odpoveď, ale aj presný priebeh volaní nástrojov.

Infraštruktúrny súboj sa presúva k latencii, energii a celej zostave

Cerebras na konferencii Hot Chips podrobnejšie opísal systém CS-4 a rackovú platformu Nexus. Jeden rack má podporovať tri wafer-scale enginy v samostatných výpočtových moduloch s vlastným napájaním, chladením a vstupno-výstupnou vrstvou. Firma zdôrazňuje umiestnenie meničov približne 0,5 milimetra od waferu, modulárnu kvapalinovú chladiacu sústavu a možnosť vymeniť výpočtový modul bez zásahu do spoločného rozvodu vody či siete.

Cerebras zároveň načrtol plán pre CS-5 v roku 2027. Pri vybraných otvorených modeloch firma cieli až na 10-tisíc výstupných tokenov za sekundu na používateľa; pri najväčších modeloch uvádza cieľ do 5-tisíc tokenov za sekundu. Sú to výhľadové ciele dodávateľa, nie hotové nezávisle overené výsledky. Aj porovnania priepustnosti s GPU rackmi závisia od modelu, dávkovania, presnosti a metodiky.

Smer je však jasný. Agentické úlohy často obsahujú desiatky sekvenčných volaní, takže latencia jedného kroku sa násobí. Rýchlejšia inferencia môže skrátiť niekoľkominútový proces na interaktívnu úlohu. Pre európske a slovenské organizácie sa k výkonu pridáva cena elektriny, dostupnosť chladenia, servis, dátová suverenita a závislosť od jedného dodávateľa. Rozhodnutie preto nemožno robiť podľa maximálneho počtu tokenov za sekundu; treba merať celkovú cenu dokončenej úlohy a kvalitu výsledku.

Do tejto línie zapadá aj oznámenie OpenAI o prvých výsledkoch vlastného inferenčného čipu Jalapeño. Verejný zdroj charakterizuje čip ako riešenie pre vyššiu priepustnosť, nižšiu latenciu a lepšiu energetickú efektívnosť moderných modelov. Keďže úplnú technickú stránku sa pri príprave prehľadu nepodarilo spoľahlivo extrahovať, nepreberáme neoverené číselné porovnania. Samotná existencia ďalšieho vlastného akcelerátora však potvrdzuje vertikálnu integráciu laboratórií: model, kompilátor, čip, dátové centrum a produkt sa optimalizujú spoločne.

Bezpečnosť: lacnejšia tvorba obsahu neznamená automaticky veľký dosah

OpenAI zverejnilo správu o zablokovaní skupiny účtov, ktoré podľa jeho vyšetrovania veľmi pravdepodobne pochádzali z Ruska. Účty mali cez VPN používať ChatGPT na tvorbu príspevkov a komentárov propagujúcich údajný izraelský International Burke Institute. Operácia zahŕňala web s kopírovanými alebo nesprávne pripísanými akademickými textami, takzvaný index suverenity zvýhodňujúci Rusko a obsah šírený cez Telegram, X, Facebook, LinkedIn a Substack. OpenAI uvádza, že kampaň zasiahla relatívne malé publikum.

Práve posledný údaj je dôležitý. Generatívna AI znižuje cenu výroby presvedčivo vyzerajúceho obsahu, prekladov, log a falošných komentárov, ale nezaručuje distribúciu ani dôveru publika. Obrana preto nemá stáť iba na detekcii „AI textu“, ktorá je sama osebe nespoľahlivá. Dôležitejšie je overovať pôvod organizácie, vlastníctvo domény, autorstvo citovaných prác, históriu účtov a koordinované správanie naprieč platformami.

Pre Slovensko, ktoré je vystavené viacjazyčným informačným operáciám, je relevantná kombinácia mediálnej gramotnosti a technickej analýzy. Redakcie, úrady aj firmy by mali archivovať zdroje, kontrolovať citácie a pri podozrivých kampaniach oddeľovať tri otázky: kto obsah vytvoril, akým nástrojom vznikol a aký skutočný dosah dosiahol. Správa OpenAI je primárnym opisom vyšetrovania zo strany prevádzkovateľa platformy, nie rozhodnutím nezávislého súdu, a tak ju treba interpretovať s týmto obmedzením.

Záverečný kontext

Správy z 25. augusta spoločne ukazujú, že ďalšia etapa AI nebude iba súťažou o väčší model. Granite 4.2 posúva otvorené modely k agentickým schopnostiam, STARFlow2 hľadá jednotný základ pre text a obraz a Quantization-Aware Healing skúša zachovať alebo dokonca obnoviť kvalitu pri agresívne menšej reprezentácii. Ollama oddeľuje známe používateľské rozhranie od voľby modelu, AWS pridáva kontrolovateľnejšiu observabilitu a výrobcovia akcelerátorov optimalizujú celé dátové centrum okolo inferencie.

Pre slovenského čitateľa z toho vyplýva praktická rada: model treba hodnotiť ako súčasť systému. Pri pilotnom projekte má zmysel súčasne merať kvalitu v slovenčine, latenciu celej úlohy, cenu, spotrebu pamäte, úspešnosť nástrojov, dohľadateľnosť zdrojov a správanie pri chybe. Otvorená licencia nie je to isté ako nízka prevádzková cena, dlhý kontext nie je zárukou presného vyhľadania a lokálna inferencia sama osebe nevyrieši bezpečnosť pracovného toku.

Mnohé z uvedených čísel pochádzajú od autorov modelov alebo dodávateľov infraštruktúry. Ich benchmarky môžu byť technicky korektné, ale nemusia reprezentovať slovenské dokumenty, miestne právne požiadavky ani reálne zaťaženie menšej organizácie. Najrozumnejšou reakciou preto nie je okamžitá migrácia, ale reprodukovateľný pilot s vlastnými dátami, jasnými kritériami a možnosťou návratu. Práve schopnosť overovať tvrdenia a meniť jednotlivé vrstvy systému môže byť hodnotnejšia než krátkodobé prvenstvo v jednom rebríčku.

— Redakcia AI Feed

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie
Notion otvoril Lore, zdieľanú dlhodobú pamäť pre AI agentov
Produkty5 min čítania4 zdroje

Notion otvoril Lore, zdieľanú dlhodobú pamäť pre AI agentov

Open-source nástroj Lore ukladá skúsenosti, rozhodnutia a úlohy agentov do spoločného priestoru v Notione. Cez MCP ich môžu využívať rôzne nástroje aj ďalší členovia tímu, no výsledky Notionu zároveň ukazujú, že neuprataná pamäť dokáže agentom uškodiť.