aifeed.skAI Feed
AI modely5 min čítania

IBM otvorilo Granite 4.2: tri reasoning modely s agentickým tréningom a licenciou Apache 2.0

Nová rodina Granite 4.2 prináša husté modely vo veľkostiach 3B, 8B a 30B, prepínateľné režimy uvažovania, natívne volanie nástrojov a otvorenú licenciu Apache 2.0. IBM pri väčších variantoch stavilo aj na posilňované učenie v reálnych agentických prostrediach.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Oficiálny zdroj
Zdroj / autorita
IBM Granite

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI modely a opiera sa o 4 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

IBM zverejnilo rodinu Granite 4.2, svoju prvú sériu hustých dekóderových jazykových modelov postavenú explicitne okolo uvažovania. Dostupné sú varianty označené ako 3B, 8B a 30B a všetky vychádzajú pod licenciou Apache 2.0, ktorá umožňuje výskumné aj komerčné použitie. Nejde teda iba o modely prístupné cez firemné API: váhy, modelové karty, príklady nasadenia aj technický repozitár sú verejné. Najvýraznejšou novinkou je kombinácia troch režimov generovania, natívneho volania nástrojov a agentického post-tréningu, ktorý pri 8B a 30B variantoch prebiehal aj v sandboxovaných prostrediach.

Tri veľkosti a tri režimy uvažovania

Všetky tri modely používajú hustú transformerovú architektúru namiesto zmesi expertov. IBM ich rozdelilo podľa očakávaného nasadenia: 3B má byť kompaktnou voľbou pre obmedzenú infraštruktúru, 8B predstavuje kompromis medzi nárokmi a schopnosťami a 30B je určený na zložitejšie reasoningové a agentické úlohy. Architektúra využíva Grouped Query Attention, rotačné pozičné embeddingy, SwiGLU a RMSNorm. Základné kontextové okno pri nasadení má 128-tisíc tokenov; dokumentácia pri 30B modeli uvádza aj rozšírenie na 512-tisíc tokenov. Päťfázový predtréning celej rodiny pracoval približne s 15 biliónmi tokenov a obsahoval osobitnú fázu pre dlhý kontext.

Používateľ si pri každej požiadavke môže vybrať plné uvažovanie, priamu odpoveď bez reasoningového rozpočtu alebo režim „low-effort“. Posledná možnosť je prakticky dôležitejšia, než naznačuje názov. V produkčnej aplikácii totiž nie je rozumné platiť rovnakú latenciu za jednoduché vyhľadanie údaja a za zložitú analýzu či opravu kódu. Prepínač umožňuje aplikácii meniť hĺbku výpočtu bez načítania iného checkpointu. Uvažovanie model zapisuje do oddelených značiek, takže obslužná vrstva môže pracovný postup oddeliť od konečnej odpovede alebo ho používateľovi vôbec nezobraziť.

Agentické správanie sa netrénovalo iba na statických odpovediach

Najzaujímavejšou časťou vydania je tréning 8B a 30B variantov na agentických trajektóriách. IBM uvádza, že sa modely učili volať nástroje, upravovať a spúšťať kód, pracovať v termináli a vyhľadávať na webe v reálnych izolovaných prostrediach. Nešlo iba o napodobňovanie jednorazových ukážok v datasete. Viacstupňový proces posilňovaného učenia zahŕňal prostredia, v ktorých sa dala vyhodnotiť úspešnosť vykonanej akcie. To má pomôcť najmä pri dlhších úlohách, kde agent musí reagovať na výsledok nástroja, opraviť neúspešný krok a pokračovať.

Supervised fine-tuning podľa technického opisu zahŕňal približne 7,2 milióna vzoriek, spolu okolo 100 miliárd tokenov. Agentická časť tvorila 31,6 percenta tejto zmesi a dominovalo jej softvérové inžinierstvo; zastúpené boli aj volania nástrojov, terminálové úlohy, matematika a vyhľadávanie. IBM pri vytváraní trajektórií použilo viacero agentických harnessov, aby model nebol príliš naviazaný na jeden formát. V dátovom potrubí firma opisuje normalizáciu do spoločného chatového formátu, odstraňovanie neplatných volaní a deduplikáciu. Ide o užitočnú mieru transparentnosti, hoci zverejnený opis stále nenahrádza úplný zoznam tréningových dát.

Natívne volanie nástrojov používa schému kompatibilnú s OpenAI function calling. Pri obsluhe cez vLLM môže Granite 4.2 vystupovať za OpenAI-kompatibilným endpointom a zapojiť sa do agentických nástrojov bez osobitnej prekladovej vrstvy. IBM uvádza integráciu s prostrediami OpenCode, Pi a OpenHands; podporované je aj nasadenie cez SGLang. Pre vývojárov je podstatné, že reasoning a výber nástroja nie sú dve úplne oddelené funkcie. Model môže najprv vyhodnotiť, ktorý nástroj potrebuje, a následne vytvoriť štruktúrované volanie s argumentmi.

Praktický význam pre menšie tímy a európske firmy

Otvorená licencia robí z Granite 4.2 zaujímavú alternatívu pre organizácie, ktoré nechcú posielať interné dokumenty alebo zdrojový kód do vzdialeného proprietárneho API. Model možno prevádzkovať vo vlastnom cloude, dátovom centre alebo laboratóriu a doplniť vlastnými bezpečnostnými pravidlami. Pre slovenské firmy môže byť relevantná najmä možnosť lokálneho nasadenia 3B alebo 8B variantu, keď je prioritou kontrola dát a predvídateľnosť nákladov. Modelová karta uvádza testovanie vo viacerých jazykoch vrátane češtiny, slovenčina však medzi explicitne vymenovanými jazykmi nie je. Kvalitu slovenských výstupov preto treba overiť na vlastných dátach.

Výber medzi variantmi nebude iba otázkou dostupnej pamäte. Menší 3B model môže byť vhodný na klasifikáciu, extrakciu alebo presne vymedzené volania nástrojov, no pri dlhých agentických postupoch sa môže rýchlejšie dostať na hranicu spoľahlivosti. Variant 8B je pravdepodobne najdostupnejším kandidátom na interné experimenty s RAG, vývojárskymi asistentmi a automatizáciou podpory. Model 30B ponúka väčšiu kapacitu, ale jeho produkčné prevádzkovanie už vyžaduje podstatne vážnejšie plánovanie GPU pamäte, kvantizácie, priepustnosti a dĺžky KV cache. Dlhý deklarovaný kontext navyše neznamená, že maximálne okno bude ekonomicky rozumné pri každej požiadavke.

Prepínateľné reasoningové režimy umožňujú vytvoriť jednoduchý smerovač nákladov. Rutinné požiadavky môžu ísť bez uvažovania, stredne náročné do úsporného režimu a komplikované prípady do plného režimu. Takáto politika však potrebuje vlastné merania: reasoning môže pri niektorých úlohách zlepšiť odpoveď, pri iných iba zvýšiť počet tokenov a čas odozvy. Produkčný tím by mal oddelene sledovať presnosť, úspešnosť volaní nástrojov, latenciu, spotrebu pamäte a schopnosť modelu zastaviť sa po splnení úlohy. Pri agentoch je samotné skóre textovej odpovede nedostatočné.

Benchmarky sú sľubné, ale zatiaľ najmä od výrobcu

IBM porovnáva Granite 4.2 s podobne veľkými modelmi na AIME25, LiveCodeBench, IFBench, BFCL, SWE-bench Pro a Terminal-Bench. Podľa firemných výsledkov má 3B variant viesť vo svojej veľkostnej triede, 8B má byť konkurencieschopný v reasoningu a nasledovaní pokynov a 30B dosahuje najsilnejší výsledok rodiny v agentických softvérových úlohách. Tieto čísla sú užitočným prvým signálom, nie však konečným verdiktom. Tabuľky a metodiku zverejňuje samotný tvorca modelu a porovnávané systémy nemusia mať totožné prompty, rozpočty uvažovania, kvantizáciu ani obslužný stack.

Dôležitou otvorenou otázkou zostáva správanie mimo benchmarkov, najmä pri dlhých viacnástrojových reláciách. Verejný opis zatiaľ neukazuje, ako často agent zvolí nesprávny nástroj, vytvorí syntakticky správne, ale vecne chybné argumenty, alebo pokračuje po zlyhaní služby. Rovnako bude potrebné nezávisle otestovať bezpečnosť pri nedôveryhodnom obsahu z webu a dokumentov. Agentický tréning môže zvýšiť schopnosť konať, no automaticky nezaručuje, že model správne rozpozná prompt injection, dodrží hranice oprávnení alebo si vypýta potvrdenie pred rizikovou operáciou.

Granite 4.2 tak nie je iba ďalším otvoreným chatovacím modelom. IBM sa pokúša spojiť lokálne nasaditeľné váhy, explicitne riadený reasoning a praktickú kompatibilitu s agentickým ekosystémom. Najväčším prínosom môže byť práve možnosť testovať všetky tri vrstvy vo vlastnom prostredí: model, inference server aj nástroje zostávajú pod kontrolou prevádzkovateľa. O tom, či rodina presvedčí aj mimo firemných porovnaní, rozhodnú nezávislé evaluácie a reálne nasadenia. Už teraz však rozširuje ponuku otvorených reasoningových modelov o varianty, ktoré cielia nielen na odpovedanie, ale aj na vykonávanie overiteľných pracovných krokov.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie
Notion otvoril Lore, zdieľanú dlhodobú pamäť pre AI agentov
Produkty5 min čítania4 zdroje

Notion otvoril Lore, zdieľanú dlhodobú pamäť pre AI agentov

Open-source nástroj Lore ukladá skúsenosti, rozhodnutia a úlohy agentov do spoločného priestoru v Notione. Cez MCP ich môžu využívať rôzne nástroje aj ďalší členovia tímu, no výsledky Notionu zároveň ukazujú, že neuprataná pamäť dokáže agentom uškodiť.