llama.cpp zrýchľuje streamovanie v llama-serveri: renderovanie na token výrazne kleslo
Nová zmena v llama.cpp odstraňuje úzke miesta webového rozhrania pri streamovaní odpovedí. Najpomalší blok sa podľa meraní autora zrýchlil z 210,36 na 2,67 milisekundy na token, pričom samotné inferenčné jadro sa nemenilo.