AWS ukázalo zdieľanú KV cache pre vLLM cez HyperPod a distribuované NVMe
Referenčná architektúra spája GPU cache, operačnú pamäť a zdieľaný NVMe pool Curvine. V teste zrýchlila čas do prvého tokenu až 2,7-násobne, výsledok však závisí od prekrývania promptov a siete.