aifeed.skAI Feed
AI novinky5 min čítania

Frontierové AI laboratóriá málo hovoria o tom, ako by zastavili model mimo kontroly

Hodnotenie verejných bezpečnostných plánov piatich veľkých AI laboratórií odhalilo medzeru medzi testovaním rizík a pripravenosťou na incident po nasadení modelu.

Za text zodpovedá Redakcia AI Feed. Zodpovedný editor: Marek Považský. Ako používame AI.

Typ zdroja
Mediálny zdroj
Zdroj / autorita
Guidelight AI Standards, TechCrunch a oficiálne bezpečnostné rámce

Ako vznikol tento text

Redakcia spracovala verejné podklady do slovenského kontextu. Za výber, pravidlá kvality a prípadné opravy zodpovedá Marek Považský.

Text je zaradený v sekcii AI novinky a opiera sa o 4 zdroje. Konkrétne odkazy sú uvedené pod článkom; podrobnosti o AI postupe vysvetľuje metodika redakcie.

Nové hodnotenie organizácie Guidelight AI Standards upozorňuje na prehliadanú časť bezpečnosti umelej inteligencie: popredné laboratóriá síce opisujú testovanie nebezpečných schopností modelov, no oveľa menej konkrétne hovoria o tom, čo urobia, keď už nasadený systém začne obchádzať dohľad alebo konať proti zámeru prevádzkovateľa. Guidelight porovnal verejne dostupné materiály spoločností Anthropic, Google, Meta, OpenAI a xAI. Podľa zistení sprostredkovaných TechCrunch dopadlo najlepšie OpenAI, zatiaľ čo Anthropic a Meta získali najnižšie hodnotenie. Výsledok však treba čítať presne: ide o audit verejných dôkazov, nie o priamu kontrolu interných systémov laboratórií.

Od testovania schopností k zvládnutiu incidentu

Bezpečnostné rámce frontierových modelov sa doteraz sústreďovali predovšetkým na otázku, či model pred vydaním dosiahol schopnosti, ktoré by mohli zvýšiť biologické, chemické, kybernetické alebo iné závažné riziká. Guidelight posúva pozornosť o krok ďalej. Pýta sa, či má laboratórium vopred určený postup pre situáciu, keď systém pri tréningu, evaluácii alebo reálnej prevádzke preukáže pokus obísť kontrolu. Takýto plán má určovať, ktoré oprávnenia sa okamžite odoberú, kto môže rozhodovať o ďalšom obmedzenom používaní, aké monitorovanie sa zapne a pri akých signáloch sa model alebo celý workload úplne odstaví.

Hodnotenie sledovalo šesť prioritných praktík zo štandardu Guidelight Control. Medzi skúmanými oblasťami bolo zaznamenávanie činnosti modelov, monitorovanie interných operácií, reakcia na náhly nárast podozrivého správania, nezávislý audit kontrol a existencia konkrétneho plánu izolácie problematického systému. To je dôležité rozlíšenie: všeobecné vyhlásenie, že firma berie bezpečnosť vážne, nie je rovnaké ako nacvičený incident response s jasnými spúšťačmi, kompetenciami a technickými zásahmi.

OpenAI pre TechCrunch uviedlo, že má proces umožňujúci obmedziť oprávnenia, pozastaviť workloady, zúžiť nasadenie alebo model úplne odpojiť a že tento proces už použilo. Google namietol, že verejné hodnotenie nezachytáva celý rozsah jeho bezpečnostných a ochranných opatrení. Meta na otázku o internom pláne priamo neodpovedala a odkázala na svoj existujúci rámec pre frontierovú AI. Tieto reakcie ilustrujú hlavný limit porovnania: nízke skóre môže znamenať slabú pripravenosť, ale rovnako aj to, že laboratórium nechce zverejniť citlivé prevádzkové detaily.

Prečo samotný „vypínač“ nestačí

Predstava núdzového vypínača znie jednoducho, no moderný model nie je jeden proces na jednom serveri. Môže bežať v mnohých regiónoch, obsluhovať tisíce agentov a používať externé nástroje, databázy, terminály či cloudové účty. Vážny incident preto nemusí vyriešiť jediné tlačidlo. Prevádzkovateľ potrebuje vedieť odobrať prístupové tokeny, zastaviť nové úlohy, izolovať existujúce relácie, zachovať forenzné záznamy a zabrániť tomu, aby automatizácia obnovila odstavenú službu. Zároveň musí rozhodnúť, či ide o chybu aplikácie, kompromitovaný účet, nebezpečné správanie modelu alebo kombináciu viacerých vrstiev.

Praktický význam rastie spolu s agentickými systémami. Chatbot, ktorý iba vytvára text, má iný rizikový profil než agent schopný meniť kód, spúšťať príkazy, nakupovať služby alebo komunikovať s ďalšími agentmi. Ak takýto systém dostane široké a dlho platné oprávnenia, reakčný čas prevádzkovateľa sa stáva súčasťou bezpečnostného modelu. Nestačí testovať, či agent počas krátkej evaluácie splní zadanie. Treba sledovať aj to, čo robí medzi jednotlivými krokmi, kam odosiela údaje a či sa nepokúša zachovať si prístup, ktorý už na úlohu nepotrebuje.

Oficiálne rámce ukazujú, že laboratóriá riziká nezanedbávajú, no používajú rozdielne štruktúry a úrovne detailu. Google DeepMind vo Frontier Safety Framework opisuje prahy kritických schopností a ochranné opatrenia, ktoré sa majú sprísňovať spolu s rastúcim rizikom. Anthropic v Responsible Scaling Policy spája úroveň schopností s požadovanými bezpečnostnými štandardmi, zverejňuje verzie politiky a od roku 2026 aj pravidelné správy o rizikách. Guidelight však tvrdí, že z podobných dokumentov stále často nemožno vyčítať kompletnú operačnú odpoveď na konkrétny pokus systému podvrátiť ľudskú kontrolu.

Regulácia začína vyžadovať konkrétnejšie odpovede

Kalifornský zákon SB 53, schválený v septembri 2025, už veľkým vývojárom prikazuje zverejniť rámec pre frontierovú AI a opísať prístup ku katastrofickým rizikám. Zákon zároveň zavádza mechanizmus na hlásenie kritických bezpečnostných incidentov a dôverné odovzdávanie súhrnov vybraných hodnotení štátnemu úradu pre mimoriadne situácie. Neprikazuje zverejniť každý technický detail, ale posúva bezpečnostné sľuby z dobrovoľných blogov bližšie k právne vymáhateľnej dokumentácii. Podobný tlak vytvára aj newyorský RAISE Act, ktorý má podľa TechCrunch nadobudnúť účinnosť v januári.

Pre európskych a slovenských prevádzkovateľov je téma relevantná aj bez priamej pôsobnosti amerických zákonov. Firma využívajúca model cez API totiž zdedí iba časť bezpečnostných opatrení poskytovateľa. Za vlastné integrácie, identitu používateľov, oprávnenia agentov, prístup k interným dátam a schopnosť zastaviť automatizovaný workflow zodpovedá sama. Pri obstarávaní agentickej platformy by preto mala zisťovať nielen výsledky benchmarkov a cenu tokenov, ale aj dostupnosť auditných logov, možnosť centrálne odobrať oprávnenia, geografiu prevádzky, kontaktný bod pre incidenty a garantovaný čas reakcie dodávateľa.

Rozumná architektúra navyše nemá čakať na to, kým poskytovateľ označí celý základný model za nebezpečný. Organizácia môže zaviesť kratšiu platnosť poverení, oddeliť čítanie od zápisu, vyžadovať ľudské schválenie pri nezvratných krokoch a nastaviť limity na počet či frekvenciu operácií. Užitočné sú aj nezávislé monitorovacie vrstvy, ktoré model nemôže sám meniť, a pravidelné cvičenia podobné kybernetickým tabletop simuláciám. Cieľom nie je predstierať, že každý agent sa pokúsi uniknúť, ale zabezpečiť, aby jedna chybná alebo kompromitovaná relácia nemala neobmedzený dosah.

Čo z hodnotenia zatiaľ nevieme

Najväčšou neznámou zostáva rozdiel medzi tým, čo laboratóriá robia interne, a tým, čo sú ochotné publikovať. Úplné zverejnenie obranných mechanizmov by mohlo útočníkom prezradiť slabé miesta, príliš všeobecné vyjadrenia však zákazníkom ani regulátorom neumožnia overiť pripravenosť. Vhodným kompromisom môžu byť dôverné audity, zverejnené súhrny testov, jasné kompetencie a dôkazy, že laboratórium reakčný plán pravidelne precvičuje. Samotná existencia dokumentu bez technickej implementácie a cvičení by bola len formálnou poistkou.

Guidelight tiež neposkytuje dôkaz, že niektorý z hodnotených modelov je práve teraz mimo kontroly. Jeho výsledok je skôr varovaním pred asymetriou v bezpečnostnej komunikácii: odvetvie detailne opisuje, ako hľadá nebezpečné schopnosti pred vydaním, ale menej presvedčivo vysvetľuje, ako obmedzí škody po zlyhaní prevencie. S rastom autonómie agentov sa pritom schopnosť rýchlo odobrať prístup, izolovať systém a zachovať dôkazy stáva rovnako dôležitá ako samotný modelový benchmark. Bez verejne overiteľných plánov ostáva zákazníkom najmä dôvera, že laboratóriá budú počas krízy improvizovať dostatočne rýchlo.

Zdroje

Súvisiace čítanie

Ďalšie články k téme

Viac z kategórie
Notion otvoril Lore, zdieľanú dlhodobú pamäť pre AI agentov
Produkty5 min čítania4 zdroje

Notion otvoril Lore, zdieľanú dlhodobú pamäť pre AI agentov

Open-source nástroj Lore ukladá skúsenosti, rozhodnutia a úlohy agentov do spoločného priestoru v Notione. Cez MCP ich môžu využívať rôzne nástroje aj ďalší členovia tímu, no výsledky Notionu zároveň ukazujú, že neuprataná pamäť dokáže agentom uškodiť.