aifeed.skAI Feed
AI produkty5 min čítania

TensorRT-LLM zapína novú správu KV cache pre desiatky rodín modelov

Predbežné vydanie TensorRT-LLM 1.3.0rc25 nastavuje KV Cache Manager V2 ako predvolenú voľbu pre široké spektrum modelov. NVIDIA súčasne upozorňuje na početné riziká pri distribuovanej prevádzke.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Oficiálny zdroj
Zdroj / autorita
NVIDIA TensorRT-LLM

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI produkty a opiera sa o 3 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

NVIDIA vydala predbežnú verziu TensorRT-LLM 1.3.0rc25, ktorá mení predvolenú správu KV cache pri nasadzovaní viacerých významných rodín jazykových modelov. KV Cache Manager V2 sa má po novom automaticky používať napríklad pri modeloch DeepSeek V3, R1 a V4, GPT-OSS, Mistral Large 3, Kimi K2 a K3, Qwen3-Next, Qwen3.5, Qwen3.8, Gemma 3 a Gemma 4. Zoznam zahŕňa aj vybrané modely GLM, MiniMax a Nemotron. NVIDIA označuje V2 za odporúčanú architektúru s lepšou škálovateľnosťou a stabilitou. Nejde však o stabilné produkčné vydanie: označenie release candidate a rozsiahly zoznam známych chýb sú podstatnou súčasťou správy.

Čo sa mení pod povrchom inferencie

KV cache uchováva kľúče a hodnoty vypočítané pre predchádzajúce tokeny, aby ich model pri generovaní nemusel opakovane počítať. Táto optimalizácia výrazne ovplyvňuje priepustnosť aj latenciu, no jej pamäťové nároky rastú s dĺžkou kontextu, počtom súbežných požiadaviek a veľkosťou modelu. Správca cache preto rozhoduje o prideľovaní blokov, ich opätovnom použití a uvoľňovaní. Zmena predvoleného správcu nie je iba interným uprataním kódu: môže ovplyvniť využitie GPU pamäte, plánovanie požiadaviek aj správanie služby pod záťažou. NVIDIA uvádza, že nové modely budú používať V2 automaticky, existujúce bude migrovať postupne a staršiu generáciu V1 plánuje vyradiť.

Rozsah zmeny ukazuje, ako sa inferenčný softvér prispôsobuje čoraz rôznorodejším architektúram. V jednom zozname sú husté aj mixture-of-experts modely, reasoning modely, multimodálne systémy a rodiny používajúce odlišné varianty pozornosti. Release zároveň rozširuje podporu o Cosmos3-Edge pre generovanie obrazu a videa, HunyuanVideo 1.5, GLM-Image či multimodálny Kimi K3. Pri Qwen3.5 a Qwen3.8 pribúdajú ďalšie režimy MoE, dátového paralelizmu pozornosti a načítania váh. Praktický význam preto nespočíva v jedinom zrýchlení, ale v spoločnej infraštruktúrnej vrstve, ktorá má obslúžiť viac typov modelov bez samostatného správcu cache pre každú rodinu.

Prečo je KV cache strategickou vrstvou

Pri produkčnom servingu už výkon neurčuje iba počet operácií modelu. Dôležité je, či systém dokáže znovu použiť spoločné časti kontextu, efektívne dávkovať požiadavky a zabrániť fragmentácii drahej GPU pamäte. Rovnaký systémový prompt, dlhé dokumenty alebo opakované prefixy môžu tvoriť veľkú časť vstupu. Ak zostanú príslušné bloky v cache, server preskočí časť prefill výpočtu. Staršia technická dokumentácia TensorRT-LLM opisuje aj stránkovanú a kvantovanú cache, opätovné použitie blokov a presun časti dát do hostiteľskej pamäte. V2 treba chápať ako pokračovanie tejto optimalizačnej línie, nie ako tvrdenie, že samotná aktualizácia automaticky zrýchli každú konfiguráciu.

NVIDIA už skôr pridala prioritné vyraďovanie blokov a udalostné rozhranie pre KV cache. Prevádzkovateľ môže dôležitým rozsahom tokenov, napríklad spoločnému systémovému promptu, prideliť vyššiu prioritu a určiť, ako dlho sa má zachovať. Udalosti o uložení alebo odstránení blokov zase umožňujú smerovať požiadavky k inštancii, ktorá už potrebný prefix drží. NVIDIA pri vlastných testoch staršej prioritnej politiky uviedla približne 20-percentné zvýšenie úspešnosti zásahov cache, ale výsledok závisel od pracovnej záťaže. Toto číslo preto nemožno preniesť na V2 ani na ľubovoľnú produkciu bez samostatného merania.

Praktický dopad na prevádzkovateľov

Tímy, ktoré používajú niektorú z dotknutých rodín modelov, by mali aktualizáciu posudzovať ako zmenu prevádzkového správania. Aj keď zostane model, kvantizácia a hardvér rovnaký, nový predvolený správca môže zmeniť hranicu medzi počtom súbežných požiadaviek a dostupnou pamäťou. Pred migráciou je vhodné porovnať čas do prvého tokenu, rýchlosť dekódovania, priepustnosť, podiel zásahov cache a špičkové využitie GPU pri skutočnom rozdelení dĺžok vstupov. Samostatne treba testovať studený štart, opakované spúšťanie a ukončovanie workerov, dlhý kontext a správanie po prerušení požiadavky. Pri agentických aplikáciách je dôležitý aj opakovaný prefix s nástrojovými schémami a inštrukciami.

Veľkú opatrnosť si vyžaduje disaggregated serving, pri ktorom sa prefill a dekódovanie alebo ďalšie časti inferencie rozdeľujú medzi rôzne procesy či uzly. Poznámky k vydaniu uvádzajú možné zamrznutie pri štarte alebo ukončení, ponechanie bežiacich workerov, problémy s prenosom KV cache po prerušení odosielateľa a pády niektorých distribuovaných konfigurácií. Hlásené sú aj zablokovania pri GPT-OSS EAGLE, problémy pri DeepSeek-R1 a riziko vyčerpania pamäte pri vybraných kombináciách. Ide o oficiálne deklarované známe chyby predbežného vydania, nie o potvrdenie, že sa prejavia v každom nasadení. Zároveň ich nemožno ignorovať iba preto, že základný lokálny test prejde.

Zvlášť dôležité je odlíšiť výkonnostnú chybu od chyby správnosti. NVIDIA upozorňuje nielen na pády a zamrznutia, ale aj na možné NaN hodnoty, stratu presnosti alebo zhoršenú kvalitu výstupu v konkrétnych multimodálnych a kvantovaných cestách. Pri Qwen3 môže jedna konfigurácia preskočenia softmaxu skončiť chybou zariadenia, pri niektorých modeloch sa uvádza strata presnosti a špekulatívne dekódovanie s deleným prefillom môže nesprávne pracovať s cache. Overovanie preto nemá končiť pri sledovaní latencie. Potrebné sú regresné evaly kvality, deterministické testovacie vstupy a kontrola odpovedí pri rovnakom nastavení pred aktualizáciou a po nej.

Čo zatiaľ nevieme

Poznámky k vydaniu neuvádzajú jednotný benchmark, ktorý by kvantifikoval prínos V2 oproti V1 naprieč podporovanými modelmi, GPU a dĺžkami kontextu. Tvrdenie o lepšej škálovateľnosti a stabilite je stanoviskom výrobcu, no bez verejnej porovnávacej tabuľky nemožno určiť, pri akom pracovnom profile je rozdiel najväčší. Nejasný zostáva aj presný harmonogram vyradenia V1 a to, ako dlho bude možné starú cestu vynútiť pri problematických konfiguráciách. Produkčné tímy by preto nemali zamieňať nový predvolený režim za povinnú okamžitú migráciu bez možnosti návratu.

Pre slovenské firmy prevádzkujúce vlastné modely je podstatné najmä to, že optimalizácia inferencie sa stáva samostatnou inžinierskou disciplínou. Náklady nemusí znižovať iba menší model alebo agresívnejšia kvantizácia; významný efekt môže priniesť aj lepšie využitie opakovaného kontextu a pamäte. V regulovaných či kritických službách však musí byť zmena správcu cache súčasťou riadeného release procesu, s canary nasadením, metrikami kvality a pripraveným návratom na overenú verziu. TensorRT-LLM 1.3.0rc25 je silný signál ďalšieho smerovania platformy, ale jeho vlastný zoznam obmedzení zároveň hovorí, že ide predovšetkým o vydanie na kvalifikáciu a meranie, nie o bezpodmienečný produkčný upgrade.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie
SageMaker Feature Store pridáva dávkový zápis a vyhľadávanie identifikátorov záznamov
Produkty5 min čítania6 zdrojov

SageMaker Feature Store pridáva dávkový zápis a vyhľadávanie identifikátorov záznamov

AWS rozšírilo SageMaker Feature Store o rozhrania BatchWriteRecord a ListRecords. Prvé zapisuje v jednom volaní najviac 25 záznamov naprieč viacerými skupinami príznakov, druhé sprístupňuje stránkovaný zoznam identifikátorov v online úložisku. Novinky zjednodušujú dátové pipeline, kontrolu ingestu aj prevádzkovú údržbu produkčných ML systémov.

Notion otvoril Lore, zdieľanú dlhodobú pamäť pre AI agentov
Produkty5 min čítania4 zdroje

Notion otvoril Lore, zdieľanú dlhodobú pamäť pre AI agentov

Open-source nástroj Lore ukladá skúsenosti, rozhodnutia a úlohy agentov do spoločného priestoru v Notione. Cez MCP ich môžu využívať rôzne nástroje aj ďalší členovia tímu, no výsledky Notionu zároveň ukazujú, že neuprataná pamäť dokáže agentom uškodiť.