Cloudflare zrýchľuje inferenciu modelov Kimi a GLM kompresiou cache a váh
Cloudflare pri modeloch Kimi K2.6 a GLM 5.2 zmenšilo KV cache aj váhy, čím zvýšilo priepustnosť a uvoľnilo pamäť GPU. Výsledky sú sľubné, no pochádzajú z meraní samotného prevádzkovateľa.