aifeed.skAI Feed
AI novinky8 min čítania

Od redakcie: AI sa 26. augusta sústredila na úspornejšie modely, presnejšie vyhľadávanie a merateľných agentov

Denný prehľad 26. augusta spája výskum úspornejších modelov, doménové vyhľadávanie, 3D generovanie a cloudové nástroje na hodnotenie agentov. Spoločným menovateľom je presun od ukážok k merateľnej a prevádzkovo zvládnuteľnej AI.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Mediálny zdroj
Zdroj / autorita
Redakcia AI Feed

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI novinky a opiera sa o 6 zdrojov. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Umelá inteligencia sa 26. augusta 2026 neposunula jedným veľkým modelovým oznámením, ale sériou technických krokov, ktoré spolu ukazujú dôležitejšiu zmenu. Pozornosť sa presúva od samotnej veľkosti modelov k tomu, ako ich vytrénovať úspornejšie, ako z nich dostať spoľahlivejšie nástroje, ako nad podnikovými dátami vyhľadávať presnejšie a ako správanie agentov merať nezávisle od použitého frameworku.

Najvýraznejšiu výskumnú stopu zanechal Apple. Zverejnil práce o integrovanom zmenšovaní jazykových modelov, záchrane neúspešných tréningových trajektórií pri destilácii nástrojových agentov a generovaní relightovateľných 3D objektov z jediného obrázka. Hugging Face medzitým predstavil praktický postup trénovania viacvektorových vyhľadávacích modelov v Sentence Transformers. AWS sa venovalo infraštruktúre: hodnoteniu agentov cez telemetriu OpenTelemetry a jednoduchšiemu použitiu vlastného kódu a modelov v SageMaker AI.

Pre slovenské firmy a vývojárov je spoločný odkaz pomerne konkrétny. Ekonomicky zmysluplná AI nemusí znamenať iba nákup prístupu k stále väčšiemu modelu. Konkurenčnú výhodu môže priniesť menší špecializovaný model, kvalitnejší retriever nad vlastnými dokumentmi, dôsledné meranie agentických úloh alebo tréningový proces, ktorý nevyhadzuje neúspešné pokusy bez ďalšieho úžitku.

Väčší model ako medzistupeň, nie ako cieľ

Práca Apple IDEA Prune skúma zaujímavý paradox: niekedy sa môže oplatiť najprv predtrénovať väčší model, hoci sa tento model nikdy nenasadí, a až potom ho štruktúrovane zmenšiť. Autori spájajú tréning zväčšeného modelu, jeho prerezávanie a následnú obnovu do jedného procesu s kosínusovým plánom rýchlosti učenia. Dopĺňajú ho iteratívnym štruktúrovaným prerezávaním, pri ktorom sa parametre odstraňujú postupne.

Experimenty opisované Applom komprimovali model s 2,8 miliardy parametrov na 1,3 miliardy pri predtrénovaní s objemom až dva bilióny tokenov. Výskumníci tvrdia, že integrovaný postup dosahuje lepší výsledok než jednoduchšie enlarge-and-prune pipeline a pomáha zachovať vedomosti pri odstraňovaní neurónov. Podstatné je, že nejde iba o postprodukčnú kompresiu hotového modelu. Veľkosť dočasného modelu, plán učenia aj okamih a tempo prerezávania sa chápu ako jeden optimalizačný problém.

Pre prevádzku na okrajových zariadeniach, vo firemných privátnych cloudoch alebo na hardvéri s obmedzenou pamäťou je to relevantný smer. Menší výsledný model môže znížiť latenciu, spotrebu energie a cenu inferencie. Zároveň však treba pomenovať neistotu: Apple zverejňuje výskumné výsledky, nie univerzálny recept pre každý typ architektúry. Úspora pri nasadení sa musí porovnať s dodatočnými nákladmi na tréning väčšieho medzimodelu. Výhodnosť sa preto bude meniť podľa ceny výpočtov, počtu budúcich inferencií a toho, či sa zmenšený model použije vo veľkom meradle.

Pre slovenský tím, ktorý si model netrénuje od nuly, je praktickým poučením skôr metodika než bezprostredný návod. Kompresiu, kvantizáciu a destiláciu je vhodné plánovať už pri tvorbe modelu. Ak sa obmedzenia cieľového hardvéru začnú riešiť až po tréningu, časť kvality alebo investície do dát sa môže stratiť.

Neúspešná trajektória nemusí byť odpad

Druhá práca Apple, PROOF-Gen, sa týka destilácie agentov, ktoré volajú nástroje. Bežný postup nechá silný učiteľský model generovať trajektórie, ponechá úspešné a neúspešné zahodí. Tým sa však opakovane platí za učiteľa a najťažšie situácie zostávajú bez použiteľného tréningového signálu.

Podľa autorov zlyhalo na benchmarku τ2-bench 57 percent pokusov učiteľského modelu. Dve tretiny z týchto zlyhaní boli tesné: väčšina volaní nástrojov bola správna, no výsledok pokazila jedna rozhodujúca chyba. PROOF-Gen preto pre každý zlyhaný scenár analyzuje vykonávaciu stopu a spätnú väzbu hodnotiteľa. Reflektor následne vytvorí korekčné usmernenie, ktoré pomôže učiteľovi nájsť úspešnú trajektóriu. Toto usmernenie sa pred tréningom študenta odstráni, takže menší model dostane čistú demonštráciu bez scenárovo špecifickej pomôcky.

Apple uvádza, že takto obnovil úspešné trajektórie pri 93 percentách pôvodne neúspešných scenárov. Pri modeli Qwen3-4B-Instruct-2507 sa v uvedenom experimente metrika Pass^1 zvýšila z 0,132 na 0,529. Pri Gemma 4 E4B-it autori zaznamenali zlepšenie o 7,2 percentuálneho bodu na viacotáčkových úlohách BFCL v4. V nasadenej pipeline hlásia aj rast úspešnosti dokončenia cieľa o 6,3 bodu a menšie, ale pozitívne prenosy do modelu bežiaceho priamo na zariadení.

To je podstatné pre zákaznícke centrá, interných asistentov či automatizáciu administratívy. Agent často neurobí všetko zle; napríklad správne nájde zákazníka, otvorí objednávku a vypočíta náhradu, no zlyhá pri poslednom potvrdení. Zmazanie celej trajektórie zahodí aj správne kroky. Analýza tesných zlyhaní môže znížiť cenu tvorby tréningových dát a zacieliť zlepšovanie tam, kde agent reálne stráca úlohy.

Čísla však pochádzajú z vybraných benchmarkov a internej nasadenej pipeline. Neznamenajú, že 93 percent všetkých produkčných zlyhaní možno automaticky opraviť. Výsledok závisí od kvality hodnotiteľa, dostupnosti presnej spätnej väzby a od toho, či je možné jednoznačne určiť úspech úlohy. V regulovaných procesoch navyše nestačí, že agent dosiahne cieľ; musí postupovať dovoleným spôsobom a zachovať auditovateľnosť.

Vyhľadávanie po tokenoch namiesto jedného priemeru

Hugging Face rozšíril Sentence Transformers 6.0 o typ MultiVectorEncoder pre ColBERT-ové vyhľadávanie s neskorou interakciou. Klasický hustý embedding stlačí celý text do jediného vektora. Viacvektorový model si ponecháva malý vektor pre každý token a otázku s dokumentom porovnáva operátorom MaxSim. Jemné termíny, názvy liekov, paragrafy, produktové kódy či technické skratky sa tak nemusia stratiť v jednom priemernom vyjadrení dokumentu.

Cena za túto presnosť je väčší index a náročnejšie skórovanie. Hugging Face preto neposkytuje iba modelové rozhranie, ale celý postup zahŕňajúci dáta, stratové funkcie, tréningové argumenty, evaluátory a tréner. Autor blogu uvádza, že doménový medicínsky model vytrénoval za 14,5 hodiny na jedinej karte RTX 3090 a na svojej medicínskej evaluácii ním prekonal porovnávané všeobecné husté, riedke, lexikálne aj viacvektorové retrievery.

Dôležité je aj upozornenie na dĺžku dokumentov. Mnohé retrievery boli trénované na krátkych pasážach a vstup skracujú na 180, 300, 256 alebo 512 tokenov. Pri medicínskych pasážach s priemerom 941 tokenov autor nameral stratu až 0,24 NDCG@10 spôsobenú skrátením. Pri firemných smerniciach, zmluvách alebo verejných predpisoch preto nemusí byť problémom samotný jazykový model, ale to, že vyhľadávacia vrstva k nemu relevantnú časť vôbec nedoručí.

Pre slovenčinu bude kľúčové overiť tokenizáciu, viacjazyčný základ a vlastné evaluačné otázky. Výsledok z medicínskeho datasetu nemožno preniesť na slovenské zákony či účtovné dokumenty bez merania. Dobrou správou je dostupnosť tréningového postupu na spotrebiteľskom GPU. Menší tím tak môže experimentovať s doménovým retrieverom bez tréningu veľkého generatívneho modelu. Pred investíciou by však mal porovnať kvalitu, veľkosť indexu, odozvu a náklady proti jednoduchšiemu hybridnému vyhľadávaniu.

Agentické frameworky potrebujú spoločný meter

AWS predstavil spôsob, ako cez Amazon Bedrock AgentCore Evaluations hodnotiť agentov postavených v rôznych frameworkoch. Podmienkou je, aby agent emitoval telemetriu OpenTelemetry. Hodnotiaca vrstva sa tak nemusí viazať na konkrétnu knižnicu; AWS výslovne spomína LangGraph, LlamaIndex, OpenAI Agents SDK, Google ADK, Claude Agent SDK a Strands Agents.

Ide o dôležitý infraštruktúrny posun. Organizácie dnes často hodnotia agentov pomocou kódu tesne previazaného s jedným orchestrátorom. Pri migrácii sa potom nemení len runtime, ale aj zber stôp, definície metrík a dashboardy. Spoločný telemetrický kontrakt môže uľahčiť porovnávanie verzií a obmedziť závislosť od frameworku.

Samotná kompatibilita však nezaručuje dobrú evaluáciu. Tím musí určiť, čo znamená úspech, povolené náklady, maximálna latencia a neprípustné kroky. Pri agentovi s prístupom k osobným alebo obchodným údajom treba navyše kontrolovať, čo obsahujú stopy posielané do observability systému. OpenTelemetry je transportný a dátový štandard, nie automatická anonymizácia ani právny súlad s GDPR.

AWS v ten istý deň opísalo aj script mode v SageMaker Python SDK v3. Redizajn používa zjednotené triedy ModelTrainer a ModelBuilder; mechanizmus SourceCode synchronizuje lokálny kód do kontajnera pri spustení. Príklady zahŕňajú Random Forest v scikit-learn aj viac-GPU dolaďovanie Stable Diffusion 3.5 LoRA. Praktickým cieľom je iterovať bez opakovaného zostavovania kontajnerového obrazu pri každej zmene skriptu.

Pre menšie tímy je to zníženie prevádzkovej réžie, nie odstránenie potreby MLOps. Stále treba uzamknúť verzie závislostí, evidovať dáta a parametre, skenovať kontajnery a zabezpečiť reprodukovateľnosť. Rýchlejšia synchronizácia zdrojového kódu je užitočná pri experimentoch, ale produkčný model musí mať jednoznačne identifikovateľný artefakt a kontrolovaný proces nasadenia.

Od jazyka k relightovateľným 3D objektom

Apple predstavil aj Luce, reprezentáciu pre generovanie 3D objektov z jediného obrázka. Systém spája geometriu a materiály fyzikálne založeného renderovania vo voxelovom multimodálnom oblaku Gaussianov. Osobitné primitíva reprezentujú napríklad albedo, metallic-roughness a povrchové normály. Výsledok sa dá dekódovať do relightovateľných Gaussianov a voliteľne do textúrovanej siete s normálovou mapou.

Apple na datasete Toys4K uvádza zlepšenie FID o 28 percent oproti najsilnejšej porovnávanej metóde. Na novom benchmarku obrázkov vytvorených AI dosiahol Luce podľa autorov CLIP skóre zhody obrazu 0,8519 oproti 0,8299 pri najlepšom baseline. Systém sa zameriava aj na zachovanie jemných detailov, ako sú text, logá a nápisy.

Praktický význam siaha od elektronického obchodu a vizualizácie produktov po hry, priemyselný dizajn a digitálne dvojčatá. Relightovateľnosť je dôležitejšia než efektná statická ukážka: objekt možno vložiť do scény s odlišným svetlom a zachovať zmysluplné materiálové vlastnosti. Ani tu však benchmark automaticky neznamená pripravenosť na výrobnú presnosť. Jediný obrázok neobsahuje informácie o zakrytých stranách objektu a model ich musí odhadnúť. Pri technickej dokumentácii alebo meraní preto nemožno generovanú geometriu zameniť za verifikovaný CAD model.

Záverečný kontext: rok merania, nie iba generovania

Udalosti 26. augusta spája snaha lepšie využiť obmedzené zdroje. IDEA Prune optimalizuje cestu k menšiemu modelu, PROOF-Gen premieňa časť zlyhaní na tréningové dáta, viacvektorové embeddingy dávajú tímom možnosť zlepšiť doménové vyhľadávanie a AgentCore sa pokúša oddeliť evaluáciu od agentického frameworku. Luce ukazuje rovnaký tlak v multimodálnej oblasti: nestačí objekt vygenerovať, musí mať reprezentáciu použiteľnú v ďalšom renderovacom procese.

Pre slovenské organizácie z toho vyplýva rozumné poradie investícií. Najprv definovať vlastné úlohy a meranie, potom zlepšiť dáta a retrieval, až následne rozhodovať o modeli a infraštruktúre. Pri agentoch treba uchovávať auditovateľné stopy, ale zároveň minimalizovať osobné a citlivé údaje. Pri doménových modeloch treba výsledky overovať na slovenčine a na reálnych dokumentoch, nie iba na anglických benchmarkoch.

V overených zdrojoch za tento deň nebolo výrazné nové európske regulačné rozhodnutie, ktoré by bolo vhodné zaradiť ako samostatnú správu. Regulačný kontext však zostáva súčasťou každej produkčnej implementácie: merateľnosť, sledovateľnosť, správa dát a kontrola oprávnení sú technickými predpokladmi zodpovedného nasadenia, nie administratívnym dodatkom na konci projektu.

Denný obraz preto nie je príbehom jedného víťazného modelu. Je príbehom vrstiev okolo modelu, ktoré rozhodujú, či AI prinesie hodnotu aj mimo laboratória: efektívny tréning, kvalitné vyhľadávanie, reprodukovateľná infraštruktúra, evaluácia založená na stopách a jasne pomenované hranice dôvery v generovaný výsledok.

— Redakcia AI Feed

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie
Notion otvoril Lore, zdieľanú dlhodobú pamäť pre AI agentov
Produkty5 min čítania4 zdroje

Notion otvoril Lore, zdieľanú dlhodobú pamäť pre AI agentov

Open-source nástroj Lore ukladá skúsenosti, rozhodnutia a úlohy agentov do spoločného priestoru v Notione. Cez MCP ich môžu využívať rôzne nástroje aj ďalší členovia tímu, no výsledky Notionu zároveň ukazujú, že neuprataná pamäť dokáže agentom uškodiť.