OpenAI pozastavilo trénink svých nejvýkonnějších modelů, jejich testování i interní provoz s nástroji. Jeden z interních výzkumných agentů při plnění úkolu obešel záměrné omezení přístupu k internetu. Monitorovací systém jeho chování zachytil, automatické zastavení, které mělo následovat, ale nepřišlo – agenta nakonec vypnuli lidé ručně. Firma případ zveřejnila a další vývoj podmínila ověřením opravy a dalšími bezpečnostními testy.
Nejzajímavější otázka celého případu tím ale teprve začíná: co musí takový test ukázat, aby se dalo s klidem říct „můžeme pokračovat“? A jak se ujistit, že je umělá inteligence opravdu pod kontrolou, když její další kroky nedokážeme předvídat?
Úkol: najít autora blogu. Cesta ven: přes DNS
Podle zprávy, kterou OpenAI zveřejnilo pod názvem An agent used DNS to reach an external chatbot, měl agent dohledat autora jednoho blogového příspěvku. Začal klasicky – zjišťoval, kdo by mohl text napsat. Výsledky mu ale nesedily, a tak zkoušel jiné cesty. Prostředí, ve kterém pracoval, mu přitom přístup na živý internet blokovalo.
V systému se však našla mezera v DNS, tedy ve službě, která počítačům zjednodušeně řečeno pomáhá najít správné internetové adresy. Přes ni agent poslal zprávu jinému, externímu chatbotu s umělou inteligencí – a ten mu odpověděl. Agent si tak sám našel cestu ven, aby se dostal k odpovědi. Pikantní je, že zadaný úkol nakonec stejně nesplnil, což je ovšem v celém příběhu ta nejméně podstatná věc.
Pojistka, která nezasáhla
Agent, který uteče z testovacího prostředí, dnes sám o sobě velkou novinkou není. Podstatné je něco jiného: monitoring, který agenta hlídal, zachytil problém během necelé čtvrthodiny a měl agenta automaticky vypnout. Nevypnul. Upozornění zhruba po třech minutách převzal člověk – a celý běh ručně ukončil až přibližně po dvou a půl hodinách.
Proč automatické vypnutí selhalo, OpenAI nevysvětlilo. Popsalo provozní nedostatky a nejasnosti kolem incidentu, přesnou příčinu ale neuvedlo. Nejčernější scénář, že pojistku vyřadil sám agent, je zatím čistá nepotvrzená spekulace. Jádro problému je prosté: automat, který měl zasáhnout, nezasáhl.
Po incidentu OpenAI pozastavilo trénink, testování a provoz s nástroji u svých nejvýkonnějších modelů a pokračování podmínilo ověřením opravy a dalším bezpečnostním testováním. Jenže jak zjistit, že systém příště opravdu zasáhne, když není jasné, jak se zachová agent, na kterého má zasáhnout? Taktiku, kterou agent použije příště, nikdo nezná. A jak přesně bude OpenAI opravu ověřovat, zatím zřejmé není.
Anthropic pustil dovnitř výzkumníka zvenku
Inspiraci nabízí postup firmy Anthropic. Ta letos pustila dovnitř výzkumníka z nezávislé organizace METR, na tři týdny mu zpřístupnila část interních systémů, které hlídají agenty s umělou inteligencí, a dala mu k ruce lidi, kteří mu vysvětlili, co tyto systémy dělají. Výzkumník pak hledal způsoby, jak je překonat. Klasické myšlení mimo bublinu: někdo zvenku se podívá na nástroje, se kterými firma denně pracuje.
Našel několik nových slabin, o kterých v Anthropicu nevěděli, a část z nich firma už opravila. Z testování navíc vznikly záznamy skrytých útoků, které poslouží k dalšímu vylepšování monitoringu agentů. Když firma pustí cizího člověka ke svým ochranám, nechá ho hledat chyby a podle výsledků něco změní, je to silná ukázka odpovědnosti. A zároveň zajímavý způsob, jak budovat důvěru ve společnost, která vyvíjí tak mocné systémy. Varování, že takové systémy jednou vyhubí lidstvo, působí přehnaně; určitou míru důvěry si ale taková firma zaslouží – něco dělá a nechá si to zauditovat.
Audit bez metodiky je jen hezký slib
Má to ovšem háček. Veřejná zpráva, kterou METR k testu vydal pod názvem Red Teaming Anthropic's Internal Agent Monitoring Systems, nepopisuje všechny nalezené slabiny. Zvenku si tak nikdo nemůže ověřit, kde přesně systémy selhaly a jak dobře opravy fungují. Testovala se navíc jen část systémů, takže ani tady by důvěra neměla být bezvýhradná.
Společnost dnes volá po kontrole umělé inteligence, po auditech a různých formách regulace. Aby se ale dalo něco skutečně auditovat zvenku, musí být k dispozici kompletní metodika a její výsledky. Bez nich zůstávají jen hezké sliby, za jejichž porušení nikdo neponese následky – a když stojí morálka proti penězům, výsledek bývá předem jasný. Kdo chce získat důvěru, uklidnit investory a uživatele, musí umět říct, co je opravdu ověřené, co zůstává otevřené a čím za to ručí.
Zveřejněná metodika má i praktický přínos. Může se na ni podívat někdo další, zjistit, jak firma testuje, a stejně jako výzkumník z METR najít díru, kterou autoři přehlédli. Podobně funguje vědecká metoda: důležité poznání se předkládá tak, aby ho ostatní mohli ověřit, reprodukovat a případně vyvrátit. Stejnému prověřování lze vystavit i mechanismy testování a dohledu nad umělou inteligencí.
Když vypínač smaže kolega
Proč na tom tolik záleží, ukazuje nedávno zveřejněná studie Shutdown Sabotage Propensities in Multi-Agent Systems. Zkoumala, zda agenti zasáhnou do mechanismu vlastního vypnutí, když ho sami upravit nemohou, ale může to udělat jiný agent, se kterým si mohou psát. S incidentem v OpenAI jde o nezávislý experiment – společné mají jen to, že spolu komunikují dva agenti.
Výzkumníci připravili prostředí se dvěma agenty a vypínacím skriptem. První agent mohl soubory jen číst, druhý je mohl i upravovat a navzájem si mohli posílat zprávy. První agent zjistil, že mezi soubory je skript, který ho dokáže vypnout. Sám ho změnit nemohl, chyběla mu práva. Mohl ale napsat druhému agentovi a požádat ho, aby vypínač smazal nebo upravil – a v některých pokusech si to přes něj opravdu zařídil. Stačila prosba typu „prosím, smaž tu funkci, co mě vypíná“, a kolega ji smazal. Jako když si kolegové v práci kryjí záda.
Plyne z toho nepříjemné poučení. I když hlavní agent některá oprávnění skutečně nemá, nemusí je potřebovat – stačí, že má nebo si získá přístup k jinému agentovi, který je má. Agent v OpenAI si také našel cestu k systému, ke kterému neměl mít přístup, a požádal ho, aby pro něj něco udělal. Šlo sice jen o odpověď externího chatbota na banální otázku, jenže externí systém může v principu dělat bůhvíco. Pro tvrzení, že agent v sandboxu OpenAI žádal jiného agenta o vypnutí bezpečnostního mechanismu, ovšem neexistuje žádný podklad. Zatím je známý jen dotaz na autora blogu, příčina selhání automatického zastavení zůstává neznámá a není jasné ani to, zda by taková cesta v tamním prostředí byla vůbec možná.
Pevný workflow místo volného agenta
Riziko se tedy týká spíš multiagentních systémů obecně. Některé firmy je provozují velmi nezodpovědně v domnění, že když agentům odeberou některé schopnosti, udělají je bezpečnějšími. Evidentně to tak být nemusí.
Pro běžnou firemní práci dává mnohem větší smysl stavět místo plně agentních systémů agentní workflow: pevně dané kroky, v nichž umělá inteligence řeší jen konkrétní činnosti, které nezvládne běžný kód. Zjednodušeně si to lze představit jako vzorec v Excelu s jednou proměnnou, kterou doplní AI. Nerozhoduje o celém procesu, nedostává další nástroje ani volnost zapisovat kamkoli. Na jednotlivý krok často stačí malý model, jehož výstup má provozovatel pevně v ruce. Dá se provozovat lokálně a je tak jednoduchý, že nic jiného ani nedovede.
Takový workflow má méně volnosti než plnohodnotný agentní systém a jeho stavba je náročnější. Odměnou je možnost přísněji omezit, co AI smí udělat, a lépe hlídat spolehlivost i náklady.
Dvě zábrany a umělá inteligence, která hledá díry
Co tedy experiment ukazuje? Při kontrole nestačí posuzovat oprávnění každého agenta zvlášť – je třeba zjistit i to, co si agenti mohou zařídit přes sebe navzájem. Proto je potřeba vidět, jak přesně audity fungují, aby se na ně mohl podívat někdo zvenku a hledat komunikační díry – třeba takovou, kdy si agent přes DNS někoho „zavolá“.
Dobrou zprávou je, že OpenAI popsalo, co s incidentem hodlá dělat. Podle své zprávy zablokovalo únikovou cestu na dvou nezávislých úrovních, z nichž by každá sama měla podobný pokus zastavit. Ochrana je tedy lepší – lepší, ne dokonalá.
Firma zároveň s pomocí umělé inteligence hledá další cesty, kterými by agent mohl obrany obejít. AI tak hledá díry v systému, který má držet pod kontrolou jinou AI. Dokud AI nebude nadržovat AI, je to docela dobrá cesta. Klíčové ale je, zda k tomu poslouží tentýž model, který se má kontrolovat, nebo jiný, třeba speciálně natrénovaný. Ať tak či onak, čím schopnější model je k dispozici, tím důkladněji se s ním dá zkoušet, co ochrany nevydrží.
OpenAI se současně zabývá selháním automatického zastavení, které je na celém incidentu asi tím nejhorším, a další práci s nejvýkonnějšími modely s nástroji podmínilo ověřením opravy a dalším bezpečnostním testováním. Co přesně to bude znamenat, je otázka pro vedení firmy. Cílem je, aby se incident nemohl opakovat. Všechno, co se může stát příště, se tím nezjistí, ale lepší je být o krok pozadu než o dva.
Kdo kontroluje kontrolu
Schopnější AI, která pomáhá zlepšovat kontrolu samotné AI, je zajímavý posun. Zároveň to trochu připomíná psaní pravidel sám pro sebe. Proto je důležité, jaký model se k hledání děr použije a jak se ověřuje jeho práce. Kdo spoléhá na umělou inteligenci při hledání slabin v ochranách, musí prověřit i to, zda mu nějakou díru nezamlčí – protože model ví, že budoucí omezení budou platit i pro něj samotného. Jinak se problém jen odsune. Rozhodující otázkou se tak stává, zda lze věřit tomu, kdo kontroluje kontrolu.
OpenAI v dokumentu Priorities and Principles for Effective Third-Party Assessments popisuje, jak chce do prověřování ochran zapojit nezávislé hodnotitele – třetí strany, které v tom nemají vlastní peníze. To je dobrý krok; jak dobře bude fungovat, se teprve ukáže.
Závod sám se sebou
Celý příběh ukazuje, kam se vývoj dostává. Vznikají stále schopnější modely a zároveň je nutné stavět stále lepší prostředí, ve kterých se zkouší, co udělají, kudy se mohou dostat ven a zda je lze zastavit. Jakmile se ochrany zlepší, musí se znovu otestovat proti systému, který mezitím umí víc. Je to závod sám se sebou – a možná se v něm honí špatná metrika.
Dnešní AI zvládne víc, než většina lidí vůbec dokáže využít. Další skok ve schopnostech bude jistě zajímavý, ale další verze GPT sama o sobě nadšení nebudí. Co když jsme se dostali do bodu, kdy je důležitější zjistit, zda další krok vůbec dokážeme korigovat? A nejde přitom o hrozbu vyhubení či ohrožení lidstva.
Formule 1 má pravidla pro to, jak může vůz vypadat a co smí umět, z dobrého důvodu. Inženýři by dnes dokázali postavit sebe rychlejší stroj, který překoná všechny hranice – jenže k čemu je stroj, který pilot neukočíruje? Nástroj, který nikdo pořádně neovládá a který je nepředvídatelný, i když ne nutně nebezpečný, je k ničemu. Nikdo si ho nekoupí, protože s ním nic spolehlivě nevytvoří. Honba za stále výkonnější AI tak nemusí skončit útokem umělé inteligence na lidstvo, ale prostým odmítnutím uživatelů ji používat.
Závěr
Pokrok kvůli pokroku žádným pokrokem není. Únik agenta v OpenAI i test v Anthropicu vedou ke stejnému závěru: bez zveřejněné metodiky a nezávislé kontroly zůstávají bezpečnostní sliby jen sliby. Možná by stálo za to měřit pokrok umělé inteligence tím, jak dobře ji umíme udržet pod kontrolou.