Zpráva, že Google vyrobil umělou inteligenci, která sama sebe zlepšuje, spolehlivě rozdělí internet na dvě půlky: jedna začne kreslit exponenciály, druhá hledat bunkry. Zkratka RSI přitom znamená recursive self improvement, tedy rekurzivní sebezdokonalování — systém změní vlastní postup, ověří, jestli mu to pomohlo, lepší postup použije k dalšímu pokusu a takhle pořád dokola. Stroj, který se učí z vlastních chyb.

Kam ta logika vede, popsal už v roce 1965 matematik I. J. Good: stroj navrhne lepší stroj, ten navrhne další a tak dál, až je první takový stroj posledním vynálezem lidstva, protože pak už všechno vymyslí sám. Mezi touhle představou a jedním systémem, který si přepíše kousek vlastního kódu, je ale podobná díra jako mezi papírovou vlaštovkou a Boeingem. Co tedy tým z Google DeepMind postavil?

Co by stroj musel umět, aby se zlepšoval sám

Měřítka, která musí splnit systém rekurzivně zlepšující sám sebe

klip od 1:23

Než se dá něco takového posoudit, je potřeba mít měřítka. Nestačí, že systém navrhne nějaký lepší program — musí změnit sám sebe. Nestačí ani to, že změna jednou vyjde: nová verze musí převzít práci té staré a sama začít hledat další zlepšení. Teprve tím vzniká rekurze, protože výsledek jednoho kola se stane nástrojem pro kolo další.

Jenže než se nová verze pustí dál, musí být vidět, že je opravdu lepší. Může být rychlejší, ale méně přesná. Může vyhrát v jednom testu a selhávat jinde. Nebo si najde dobrý způsob, jak obejít měření a jenom vypadat líp. V samotném procesu se navíc může ukrýt vada, která o několik generací později způsobí kolaps modelu — a už jen definice toho, co znamená „skutečně lepší“, je zásadní problém sama o sobě.

Cesta k rekurzivnímu sebezdokonalování proto nezačíná změnou, ale schopností změnu navrhnout, poctivě otestovat a její výsledek použít v dalším kole. Na ověřování jsou přitom ideální programy: dají se spustit, dostanou stejný vstup a jde přesně změřit, jestli vracejí správný výsledek a jak rychle ho vrátí.

Úkol, na kterém se to zkoušelo: rychlejší lasso

Zadání pro Dream-RSI: najít rychlejší implementaci statistické metody lasso

klip od 3:08

V Dream-RSI, což je ta nová velká věc od Googlu, dostala umělá inteligence za úkol najít lepší a rychlejší implementaci metody lasso — statistického postupu, který ve velkém množství dat hledá proměnné, na kterých opravdu záleží. Pro tenhle příběh je podstatné hlavně to, že výsledek musí zůstat správný, je měřitelný a program má běžet rychleji.

Jazykový model napíše jednu variantu programu, ta se spustí a testy změří její správnost i rychlost. Výsledek, případná chyba i dosažené skóre se uloží, takže další pokus může navázat tam, kde ten předchozí skončil. Postupně vzniká strom větví — slibné směry, průměrné nápady, slepé uličky.

Tenhle základ nový není. FunSearch a AlphaEvolve už podobně spojovaly generování programů s automatickým testováním. Dream-RSI jde o krok dál v tom, že mění pravidla, podle kterých systém rozhoduje, kterou větev zkusit dál.

Programátor, tester a řídící program

Rozdělení rolí uvnitř systému Dream-RSI

klip od 6:21

Celý systém se dá představit jako malý výzkumný tým. Jazykový model v něm funguje jako programátor, který navrhuje další varianty toho programu. Hodnotitel je tester — programy spouští a zapisuje jejich výsledky. A nad nimi stojí řídící program, který rozhoduje, jestli se má pokračovat v rozdělané větvi, otevřít nový směr, pustit několik pokusů najednou, nebo hledání ukončit.

Dream-RSI nepřepisuje jazykový model ani hodnotitele. Přepisuje ten řídící program: po každém kole navrhne novou verzi pravidel, podle kterých má příští hledání probíhat, a ta potom převezmou řízení dalšího kola. Tohle je ta sebeúprava, o níž článek mluví. Takže ne, nejde o umělou inteligenci, která sama navrhuje novou umělou inteligenci, ale o systém, který mění vlastní pravidla chování.

Snění: přehrávání stromu vlastních pokusů

Jak systém zkouší nová pravidla na záznamu dřívějších pokusů

klip od 7:38

Nová strategie může vypadat chytře a přitom mít slabiny. Ověřovat každou variantu tak, že se celé hledání spustí znovu od začátku, by ale bylo absurdně drahé. Dream-RSI je proto nejdřív zkouší na zkušenosti, kterou systém už má — na celém stromu předchozích pokusů. Ten obsahuje programy, které systém skutečně vytvořil, jejich chyby, naměřené výsledky i větve, které nikam nevedly. Každý takový záznam autoři označují jako „world“, tedy svět. Není to simulovaná planeta ani pořádný Matrix, je to jen funkce s efektním názvem.

Nová strategie pak stromem prochází, jako by původní hledání řídila ona. Kouká, kterými větvemi by se vydala, a když vybere větev, která už v historii existuje, dostane skutečný uložený výsledek. Systém díky tomu nemusí znovu volat model, znovu spouštět ani znovu hodnotit tentýž program. Tomuhle zpětnému přehrávání autoři říkají dreaming, snění — odtud Dream-RSI.

Zní to schopněji, než jaký ten proces ve skutečnosti je. Dream-RSI si nevymýšlí výsledky experimentů, které se nikdy nestaly; je to spíš přehrávání záznamu s dobrým vyhodnocením. Jakmile chce nová strategie odbočit tam, kam původní hledání nikdy nešlo, archiv končí a výsledek se musí zjistit skutečným novým pokusem.

Z prověřených strategií systém vybere tu nejlepší a nechá ji řídit další živé kolo. Tím vzniká nová historie, na které se může připravit další verze pravidel. Ve zkratce: armáda agentů nejdřív odmaká spoustu skutečných pokusů a vytvoří strom výsledků, Dream-RSI nad tím záznamem přepíše pravidla, podle kterých si má příští armáda rozdělit práci, a v přehrávce zkouší, jestli by se s nimi dostala ke stejnému nebo lepšímu výsledku s menším počtem pokusů. Nejlépe hodnocená pravidla převezmou agenti pro další živé kolo a proces se opakuje. Pořád je to jen masivní hledání metodou pokus omyl — jenom strašně dobře organizované, což není myšleno nijak špatně.

Čísla: o 42 % méně volání, o 18 % rychlejší program

Srovnání pevné strategie a přepisovaných pravidel na testovacích datech

klip od 10:12

Autoři porovnali dvě verze hledání se stejným modelem Gemini 3.1 Pro a stejným úkolem. Kontrolní varianta také využívala předchozí zkušenost, ale její řídící pravidla zůstávala stejná, zatímco Dream-RSI je mezi koly přepisuje. Pevná pravidla spotřebovala 550 volání discovery agenta, Dream-RSI jenom 317 — zhruba o 42 % méně. Program, který Dream-RSI nakonec našel, měl na šesti testovacích datasetech průměrnou dobu běhu 2931 ms místo zhruba 3500 ms, tedy asi o 18 % rychleji.

Dvě výhody najednou: hledání spotřebovalo méně volání a dovedlo systém k programu, který byl na oddělených testovacích datech v průměru rychlejší. Těch 42 % se ale nesmí zaměnit za celkově levnější hledání — do počtu volání nejsou vůbec započítané náklady na vývoj strategie, na přehrávku ani na hodnocení.

A program není rychlejší pokaždé, spíš naopak. Rychlejší byl jen při jediném pokusu, jenže ta jedna úspora byla tak zásadní, že dohnala zpomalení na ostatních. V součtu přes šest testů odvedl stejnou práci průměrně o 18 % rychleji. Je to reálné zrychlení pro tenhle konkrétní mix úloh, ne důkaz, že Dream-RSI našel univerzálně rychlejší řešení metody lasso pro každý typ dat.

Podobné to bylo i u matematických úloh a u optimalizace programů pro grafické karty. Někde se systém dostal ke srovnatelnému výsledku s menším počtem pokusů, jinde našel rychlejší program, ale nebyl nejlepší ve všem. Důležité proto není jedno rekordní číslo. Důležité je, že stejný základní model dokázal díky přepisované strategii využít své pokusy v několika různých prostředích účelněji — lépe si rozvrhl zdroje.

Co to zatím neznamená

Proč přepsaná pravidla hledání nejsou totéž co chytřejší umělá inteligence

klip od 12:51

Google nepostavil umělou inteligenci, která si přepisuje vlastní mozek a vyrábí pořád chytřejší verze sebe sama. Postavil systém, který z vlastní zkušenosti mění jednu svou konkrétní součást: pravidla, podle kterých organizuje další postup. Upravená pravidla ovlivní nové pokusy, ty vytvoří novou zkušenost a ta může znovu změnit pravidla. V tomhle omezeném smyslu jde o skutečnou sebezdokonalující smyčku, jenže zdokonalí se jen způsob hledání, ne samotná umělá inteligence.

Vůči Goodově původní představě o sebezdokonalující se superinteligenci jsme tedy pořád na začátku. Dream-RSI neukazuje, že každé další kolo vytvoří obecně chytřejší systém, ani že zlepšování může pokračovat bez konce, ani že si systém dokáže opravit vlastní hodnotitele nebo cíle. Všechny tyhle části zůstávají pevné.

Shazovat to ale rozumné není. Je to regulérní ukázka toho, že současné systémy dovedou velmi efektivně hledat lepší cesty, jak využít samy sebe v rámci svých možností, a taková úroveň vhledu do vlastního fungování patří mezi nutné první kroky ke skutečnému rekurzivnímu sebezdokonalování. Dalším krokem je otázka, jestli ta pravidla pomohou i u jiného problému v jiném oboru, jestli se zlepšování udrží i po dalších desítkách kol a jestli se to vyplatí, i když se započítají úplně všechny náklady. Pokud ano, podobné smyčky můžou urychlit vývoj dalších systémů.

Závěr

Dnes je Dream-RSI spíš důkazem, že se umělá inteligence může zlepšovat kolem samotného modelu — ne důkazem, že začala inteligenční exploze. Pro vyhrocenou debatu o tom, jestli nás sebezdokonalující systémy zlikvidují, je to další uklidňující faktor. Ne proto, že by rizika nebyla, ale proto, že současné systémy mají i přes svou působivost před sebou velmi závažné překážky, které musí překonat, aby se skutečnou superinteligencí staly. Až se příště objeví titulek o tom, že Google vyrobil sebezdokonalující se inteligenci, stojí za to si vzpomenout, že jde o první krok, ne o finále.