SageMaker smeruje podobné prompty na rovnaký server a zrýchľuje prvú odpoveď LLM
Nové smerovanie v Amazon SageMaker Inference drží požiadavky so spoločným začiatkom na rovnakých inštanciách, aby mohli opakovane využívať KV cache. AWS vo vlastnom teste uvádza až 77-percentné skrátenie mediánu času do prvého tokenu.