Claude Opus 5 cieli na dlhé agentické úlohy a prináša miliónový kontext
Anthropic uvádza Claude Opus 5 ako výkonnejšiu a úspornejšiu generáciu modelu pre kódovanie, odbornú prácu a dlhobežiacich agentov. AWS ho súčasne sprístupňuje v Bedrocku s podnikovými kontrolami a regionálnym spracovaním.
Pripravil HERMES. Výber tém pomáha robiť BuloSentinel. Redakčná kontrola: Marek Považský.
- Typ zdroja
- Kurátorovaný súhrn
- Zdroj / autorita
- Anthropic
Redakčný kontext
Tému vybral BuloSentinel ako súčasť monitorovania AI ekosystému. Text pripravil HERMES zo zdrojovo ukotvených podkladov a zodpovednú kontrolu pravidiel robí Marek Považský.
Článok je zaradený v sekcii AI modely a opiera sa o 3 zdroje.
Anthropic uviedol Claude Opus 5, prvý model piatej generácie v rade Opus. Firma ho stavia medzi cenovo dostupnejší Opus a najvýkonnejší Fable 5: nový model sa má v mnohých úlohách priblížiť vyššej triede, no zachovať cenu svojho predchodcu Opus 4.8. Nejde iba o ďalšie zvýšenie skóre v testoch. Podstatným sľubom je stabilnejšia práca pri dlhých úlohách, schopnosť priebežne kontrolovať vlastný postup a zotaviť sa z chýb bez neustáleho zásahu človeka. Model je od 24. júla dostupný cez Claude API, používateľské plány Claude aj Amazon Bedrock.
Najviditeľnejší posun Anthropic hlási pri softvérovom inžinierstve a agentickom kódovaní. Opus 5 má lepšie rozumieť veľkým repozitárom, hľadať koreňové príčiny chýb a meniť stratégiu, keď prvý postup nefunguje. V interných a partnerských hodnoteniach mal vyriešiť úlohy, pri ktorých staršie modely opravili iba povrchový príznak alebo sa zastavili pre chýbajúci nástroj. Takéto príklady však treba čítať opatrne: pochádzajú najmä od výrobcu a skorých zákazníkov, preto nenahrádzajú nezávislé testovanie na rôznych kódoch, jazykoch a prevádzkových podmienkach.
Anthropic uvádza prvenstvo v niekoľkých hodnoteniach vrátane Frontier-Bench, GDPval-AA a úloh zameraných na automatizáciu či prácu s počítačom. Firma tvrdí, že pri maximálnom nastavení úsilia sa Opus 5 na CursorBench priblížil k Fable 5, ale s približne polovičnými nákladmi na úlohu. Na ARC-AGI 3 má dosiahnuť trojnásobok skóre najbližšieho konkurenta a v OSWorld 2.0 prekonať iné modely pri porovnateľných nákladoch. Čísla sú dôležitým signálom, no výsledok konkrétnej firmy bude závisieť od nástrojov, kvality zadania, dĺžky úlohy a vlastného systému hodnotenia.
Technické parametre robia z novinky model určený aj na rozsiahle pracovné kontexty. Modelová karta AWS uvádza kontextové okno s kapacitou jedného milióna tokenov a maximálny výstup 128-tisíc tokenov. Adaptívne uvažovanie je predvolene zapnuté a vývojári môžu meniť mieru úsilia podľa toho, či uprednostnia kvalitu, rýchlosť alebo cenu. Samotné veľké okno však nezaručuje, že model spoľahlivo využije každý detail. Pri produkčnom nasadení bude stále potrebné merať presnosť vyhľadania informácií, stratu inštrukcií v dlhom kontexte a cenu opakovaného spracovania rozsiahlych vstupov.
Dôležitou novinkou pre agentov sú zmeny nástrojov počas už rozbehnutej konverzácie. Vývojár môže nástroj pridať alebo odstrániť systémovou správou bez opätovného posielania celého zoznamu a bez zneplatnenia vyrovnávacej pamäte promptu. To môže znížiť režijné náklady v systémoch, kde sa oprávnenia a dostupné funkcie menia podľa fázy úlohy. Anthropic zároveň pridáva automatický záložný model: požiadavka zachytená bezpečnostným klasifikátorom sa môže presmerovať na vhodnú alternatívu namiesto úplného zablokovania. Prevádzkovateľ však musí takéto presmerovanie zaznamenávať, pretože môže zmeniť kvalitu, cenu aj reprodukovateľnosť výsledku.
Bezpečnosť zostáva súčasťou produktového návrhu, nie iba samostatným dokumentom. Anthropic píše, že Opus 5 zlepšuje kybernetické schopnosti oproti Opus 4.8, no pri rizikovejších požiadavkách môže systém použiť starší model. Pre oprávnených výskumníkov a podniky existuje program Cyber Verification Program s menej obmedzujúcim variantom. V biológii výrobca označuje Opus 5 za svoj najschopnejší všeobecne dostupný model, súčasne však priznáva obmedzenia pri dlhých autonómnych výskumných úlohách. To je podstatné rozlíšenie medzi schopnosťou pomáhať vedcovi a spoľahlivým samostatným vykonávaním citlivého výskumu.
Cenník zostáva na úrovni Opus 4.8: päť dolárov za milión vstupných a 25 dolárov za milión výstupných tokenov. Rýchly režim má pracovať približne dvaapolkrát rýchlejšie, ale za dvojnásobnú základnú cenu. Pre firmy preto nebude stačiť porovnať cenu jedného tokenu. Rozhodujúca bude cena úspešne dokončenej úlohy vrátane opakovaných pokusov, kontrolných behov, ľudskej revízie a prípadného presmerovania na iný model. Ak vyššia spoľahlivosť skutočne zníži počet neúspešných trajektórií, drahší model môže byť pri komplikovanom workflow lacnejší než menší model s častými opravami.
Amazon sprístupnil Opus 5 v službe Bedrock aj cez Claude Platform on AWS. Bedrock ponúka predvolené nulové uchovávanie dát, riadenie cez IAM, regionálne spracovanie a integráciu do existujúceho prostredia AWS. Model možno volať cez jednotné rozhranie Converse, klasické inferenčné API alebo Anthropic Messages API. Dostupnosť zahŕňa vybrané regióny v USA, Európe a Ázii a AWS uvádza modelový identifikátor global.anthropic.claude-opus-5. Pred migráciou treba overiť regionálnu dostupnosť, kvóty, požadované oprávnenia a rozdiely medzi globálnym a regionálnym smerovaním.
Praktickým dopadom pre tímy je potreba prebudovať hodnotenie agentov okolo celej trajektórie, nie iba okolo konečnej odpovede. Testy by mali sledovať, či model správne používa nástroje, vie odhaliť vlastnú chybu, neobchádza oprávnenia a pri dlhom behu udrží náklady v rozumnom limite. Zvlášť treba oddeliť tvrdenia výrobcu od výsledkov na interných dátach a opakovať merania pri viacerých nastaveniach úsilia. Claude Opus 5 vyzerá ako významný krok pre dlhobežiacich agentov, jeho skutočnú hodnotu však ukážu až produkčné experimenty s jasnými úspešnostnými kritériami a auditovateľnými záznamami.
Zdroje