Od redakcie: AI sa 24. augusta posúvala od modelov k infraštruktúre, agentom a suverenite
Denný prehľad 24. augusta: efektívnejšie video uvažovanie od Apple, nové smerovanie inferencie, spravovaný Ray na AWS aj veľká dohoda Mistralu o suverénnej AI.
Tag
Všetky publikované články, v ktorých sa téma AI infraštruktúra objavuje ako dôležitý kontext. Aktuálne 9 textov v archíve.
Denný prehľad 24. augusta: efektívnejšie video uvažovanie od Apple, nové smerovanie inferencie, spravovaný Ray na AWS aj veľká dohoda Mistralu o suverénnej AI.
Otvorený model NVIDIA s 30 miliardami parametrov, z ktorých pri inferencii aktivuje tri miliardy, sa dá nasadiť cez SageMaker JumpStart. Mieri na početné rutinné kroky agentov, nie na nahradenie najvýkonnejších modelov pri každom type úlohy.
Denný redakčný súhrn za 16. august 2026 prepája európsku regionálnu inferenciu Mistralu, textové vodoznaky pre budúce modely Claude, začlenenie Cursoru do SpaceX a nenápadnú, no poučnú opravu vydávacieho procesu llama.cpp. Spoločnou témou je rastúci význam infraštruktúry, prevádzkovej kontroly, transparentnosti a overiteľnosti tvrdení.
Aktualizovaná analýza Hugging Face ukazuje, že otvorenú AI formujú najmä malé stabilné modely, ekosystém Qwen a komunitná infraštruktúra. Čísla zároveň potvrdzujú priepastný rozdiel medzi mediálnou pozornosťou a používaním, no samy osebe nemerajú kvalitu ani skutočné produkčné nasadenie.
Referenčná architektúra spája GPU cache, operačnú pamäť a zdieľaný NVMe pool Curvine. V teste zrýchlila čas do prvého tokenu až 2,7-násobne, výsledok však závisí od prekrývania promptov a siete.
Cloudflare spojil prístup k vlastnej GPU inferencii a externým modelovým API cez spoločný binding, REST rozhranie, pozorovateľnosť a fakturáciu. Dokumentácia spresňuje 5 % poplatok za nákup kreditov aj možnosti vypnúť ukladanie citlivých promptov; pokročilé smerovanie podľa kvality, ceny či latencie však nemožno považovať za úplne hotovú funkciu.
Nová práca opisuje koncept siete modelov, v ktorej by sa ľahšie vyhľadávali, prepájali a používali menšie doménové AI systémy. Ide skôr o architektonickú víziu než hotový štandard, no dobre vystihuje problém fragmentácie modelov.
ServiceNow na Hugging Face rozobralo migráciu z vLLM V0 na V1 pri RL tréningu modelov a ukázalo, že kľúčové nie sú len nové optimalizačné schémy, ale najmä korektné logproby, runtime defaulty a správa váh počas behu.
Anthropic oznámil dvojaký krok: okamžite zvyšuje limity pre Claude Code a API modelov Opus a zároveň si rezervuje celú kapacitu dátového centra Colossus 1 od SpaceX. Správa ukazuje, že boj o používateľov sa už presúva od modelových parametrov k fyzickej dostupnosti výpočtov.