Chunkovaná KL strata umožnila destilovať LLM s 32-tisícovým kontextom na jednom H200
Multiverse Computing spojilo offline uložené top-100 výstupy učiteľa s KL stratou, ktorá po blokoch prepočítava logity a nevytvára ich plnú maticu. Pri kompaktnom študentovi sa tak 32 768-tokenový tréning zmestil na jeden H200; zverejnené výsledky však pochádzajú z jediného tímu a ich prenos na iné modely zostáva otvorený.