ARCHead komprimuje výstupnú hlavu LLM bez uchovania hustej BF16 vrstvy
ARCHead zmenšil výstupnú hlavu Qwen3-8B-Base na 25,6 % pôvodného úložiska pri malom náraste perplexity. Výsledky zahŕňajú viac modelov, no zatiaľ ich nezopakoval nezávislý tím.
Tag
Všetky publikované články, v ktorých sa téma LLM objavuje ako dôležitý kontext. Aktuálne 21 textov v archíve.
ARCHead zmenšil výstupnú hlavu Qwen3-8B-Base na 25,6 % pôvodného úložiska pri malom náraste perplexity. Výsledky zahŕňajú viac modelov, no zatiaľ ich nezopakoval nezávislý tím.
Nový korpus spája automatický prepis, rozpoznanie rečníkov a LLM klasifikáciu 60 miliónov riadkov vysielania.
Anthropic uvádza Claude Opus 5 ako výkonnejšiu a úspornejšiu generáciu modelu pre kódovanie, odbornú prácu a dlhobežiacich agentov. AWS ho súčasne sprístupňuje v Bedrocku s podnikovými kontrolami a regionálnym spracovaním.
Nový arXiv preprint opisuje V-os: jednorozmerný smer emočnej valencie odvodený z LLM iba z deviatich viet. Smer sa prenáša medzi 14 modelmi, koreluje s EEG 123 ľudí sledujúcich afektívne videá, no pokročilé zarovnávacie stratégie dekódovanie nezlepšili.
AWS opisuje architektúru, v ktorej sa Databricks Unity Catalog používa ako governance vrstva nad podnikovými dátami a Amazon SageMaker AI ako prostredie na dolaďovanie veľkých jazykových modelov. Dôležitý je dôraz na dátovú lineage, auditovateľnosť a regulované workloady, nie iba na samotný tréning modelu.
Nový preprint ξ-DPO tvrdí, že pri direct preference optimization vie nahradiť ťažko čitateľnú margin schému interpretovateľnejším pomerovým cieľom. Pre tímy, ktoré dolaďujú modely na ľudských preferenciách, to môže znamenať menej slepého skúšania a ľahšie prenositeľné nastavenia.
AWS opisuje, ako na SageMakeri sledovať výpočtovú stopu pri doladovaní jazykových modelov, aby firmy vedeli, či sa pri tréningu nepribližujú k hraniciam nových povinností podľa európskeho AI Actu.
Apple Machine Learning Research ukazuje, že tlak na lacnejší serving nemusí ísť len cez kvantizáciu či skracovanie kontextu. Nová práca skúša zmenšiť KV cache po hĺbke siete a zachovať pritom výkon aj priepustnosť.
Apple predstavilo ParaRNN, framework, ktorý má odstrániť kľúčové úzke miesto klasických rekurentných sietí. Firma tvrdí, že pri tréningu nelineárnych RNN dosiahla zrýchlenie až 665-krát a otvorila cestu k sedemmiliardovým modelom s konkurencieschopnou perplexitou.