Umělou inteligenci si dnes většina lidí představí jako chatbota: napíšete mu něco chytrého a on vrátí něco ještě chytřejšího. Velká část skutečné práce ale žádný další text nepotřebuje. Stačí rozpoznat, co přišlo, rozhodnout, kam to patří, a poslat to správným směrem. Právě na tom stojí nový model Jev od firmy TypeSafe, který nedávno udělal na internetu pořádný rozruch.

Umělá inteligence, která nic nepíše

Úvod: nový model Jev jako klasifikátor místo chatbota

klip od 0:00

Jev neumí vygenerovat ani krátký text, a přesto má být v některých úlohách skoro 900krát rychlejší a až 400krát levnější než velký jazykový model. Jak může být model, který na první pohled umí podstatně méně, užitečnější než klasický chatbot? A může se pro skutečnou práci ukázat dokonce jako důležitější?

E-mail ze e-shopu: stačí tři odpovědi

Příklad s e-mailem zákazníka, který chce vyměnit zboží

klip od 1:12

Celou krásu takového modelu ukáže jednoduchý příklad. Máte e-shop a přijde e-mail od zákazníka: „Díky, balík dneska dorazil, uvnitř je ale špatná velikost. Nechci zpátky peníze, chci jen tu správnou. V pátek odlétám, zkuste to rychle.“ Člověk hned vidí, co se stalo – zákazník nechce vrátit peníze, chce výměnu a docela spěchá.

Pro běžný software je to neřešitelné, nebo přinejmenším velmi složité. Když bude hledat slovo peníze, pošle e-mail do procesu vracení peněz. Když se chytí slova balík, zařadí ho jako problém s doručením. A když mu taková pravidla nikdo nenapíše, neudělá nejspíš vůbec nic.

E-mail samozřejmě můžete poslat velkému jazykovému modelu. Ten nejspíš správně popíše, co se děje a co zákazník chce, a ještě napíše hezkou omluvu nebo celou věc rovnou vyřeší. Jenže žádné vysvětlení nepotřebujete. Potřebujete tři mnohem jednodušší odpovědi: o jaký typ požadavku jde, jestli spěchá a jestli máte dost informací, abyste mohli pokračovat.

Právě tady leží jedno z nejužitečnějších míst pro celou umělou inteligenci. Naprostou většinu zbytku procesu zvládne obyčejný program: najde objednávku, zkontroluje skladové zásoby, spočítá termín a spustí připravený postup pro výměnu. Problémem je jen ten malý okamžik mezi chaotickým lidským textem a softwarem s přesnými pravidly. Někdo musí pochopit, co člověk vlastně napsal. K tomu nepotřebujete autora, agenta ani gigantický výzkumný systém. Potřebujete AI jako překladač mezi světem, kde každý píše trochu jinak, a světem, kde software potřebuje naprosto přesný pokyn.

Podklady a otázky: Choice, Score a Noul

Jak se modelu Jev zadávají podklady a otázky

klip od 4:35

Pro takový způsob práce se Jev hodí dokonale. Jeho úkolem není vygenerovat odpověď ani vést nějakou činnost, ale rozpoznat klíčové prvky vstupu a zařadit je. Vstup se skládá v zásadě jen ze dvou částí. První jsou podklady, kterým TypeSafe říká state. V příkladu je to text e-mailu, stejně dobře ale může jít o popis produktu, fakturu, záznam konverzace nebo data, která systém vytáhl z databáze.

Druhou část tvoří přesně popsané otázky, na které chcete dostat přesně definovaný typ odpovědi. První typ se jmenuje Choice: modelu nabídnete možnosti jako výměna, vrácení peněz, problém s doručením nebo něco jiného a Jev jednu z nich vybere. Nevrátí odstavec o tom, že zákazník nejspíš prožívá nepříjemnou situaci a že máte naprostou pravdu – takové řeči se tu prostě nekonají. Vrátí hodnotu, kterou program okamžitě přiřadí ke konkrétní větvi procesu, a k ní rozdělení pravděpodobností mezi jednotlivé možnosti a údaj o tom, jak jednoznačný byl výběr.

Druhý typ, Score, nepracuje s kategoriemi, ale se stupnicí. Popíšete třeba, co znamená požadavek bez časového tlaku, co je běžně naléhavé a co už vyžaduje okamžitou reakci, a model umístí vstup mezi popsané úrovně. Třetí typ, Noul, vrací pravděpodobnost prostého ano, nebo ne: je v e-mailu dost informací, abyste mohli pokračovat? Žádá zpráva o vrácení peněz? Podporují dodané podklady konkrétní tvrzení? Výsledkem je číslo mezi nulou a jedničkou.

Samotné názvy nejsou důležité. Podstatné je, že aplikace předem ví, jakou podobu bude mít odpověď. Nečeká, až model vytvoří text, ze kterého se pak pokusí vydolovat význam – dostane několik hodnot na přesně určených místech. A protože všechny otázky pracují se stejnými podklady, dokáže Jev podle TypeSafe vyhodnocovat více věcí současně.

Rozhoduje model, zbytek odvede obyčejný kód

Co Jev umí a co za něj musí udělat klasický software

klip od 7:08

Z Jevu je důležité nedělat něco, čím není. Neprohledává sklad, nezná stav objednávky a sám od sebe nemá databázi zákazníků. Fakta uchovává databáze, Jev posuzuje význam vstupu a vybírá z možností, které jste mu předem dali. Jakmile v příkladu s e-shopem vznikne výsledek výměna, jeho práce končí. Hodnotu převezme obyčejný software, který dohledá objednávku v tabulce, zkontroluje dostupnost správné velikosti a spustí postup pro výměnu, připravený předem a pokaždé stejný.

Správně zvolená přihrádka je tedy jen začátek vyřízení požadavku, zároveň ale jedna z mála věcí, které v celém procesu opravdu musí dělat AI. Drtivou většinu zbytku zvládne úplně jednoduchý kód. Ten sice většině lidí vygeneruje nějaká složitější AI, jenže jen jednou – velký náklad tak vznikne jednorázově. Motorem v provozu pak může být Jev, který ve srovnání s velkými hráči nestojí skoro nic.

Proč je tak levný: žádné psaní token po tokenu

Rozdíl mezi generativními modely a modelem typu system one

klip od 8:23

Nízkých cen dosahuje Jev pozoruhodným způsobem. ChatGPT, Claude nebo Gemini vytvářejí odpovědi postupně: vygenerují jeden token, podle něj další a tak dál, dokud není odpověď hotová. Připomíná to člověka u psacího stroje, který může napsat další slovo, až když dopíše to předchozí. A podobně jako na psacím stroji model nemůže snadno mazat – co jednou vygeneruje, zůstane.

Dává to smysl, když chcete odstavec textu, e-mail nebo kus programu. Když ale potřebujete jedinou hodnotu výměna, je celý tento způsob práce trochu zvláštní. Model navíc musí postupně vypisovat závorky, názvy polí, uvozovky a jednotlivé hodnoty; i strukturovaný výstup generuje token za tokenem, jen jako velmi krátký text. A to je vlastně zbytečné.

Jev je od začátku postavený pro úplně jiný druh výstupu. TypeSafe mu říká system one model. Nemá rozepisovat postup uvažování ani formulovat odpovědi, ale nad dodanými podklady rovnou vytvořit rozdělení pravděpodobností pro předem definovaná rozhodnutí. Místo spisovatele, který musí napsat celou odpověď, si stačí představit panel s kontrolkami: přijde e-mail a kontrolky pro výměnu, vrácení peněz, dopravu a ostatní se rozsvítí různou intenzitou, nebo vůbec. Systém se podívá na panel a podle toho, co vidí, rozhodne.

Znamená to také, že když se u jednoho e-mailu ptáte na téma, naléhavost a dostatek informací, nemusí model stejný e-mail třikrát posílat a třikrát samostatně zpracovávat. Několik rozhodovacích otázek nad stejným vstupem vyhodnotí současně – jedny podklady, několik výstupů. Žádné čekání, až model postupně dopíše odpovědi a vypráví k nim pořádnou pohádku. Kdo zná ten pocit, když po první minutě pochopí, co mu druhý chce říct, a pak už jen slušně čeká, až se vymáčkne, ocení, že tady se na nic čekat nemusí.

Trénink na kalibrovaná rozhodnutí a cena pod pět centů

Trénink RLCD, ceník a to, co firma TypeSafe nezveřejnila

klip od 11:22

Způsobu tréninku se říká RLCD, tedy reinforcement learning for calibrated decisions, česky zhruba posilované učení pro kalibrovaná rozhodnutí. Model nedostává odměnu za přesvědčivý odstavec. Trénink ho tlačí ke správnému rozhodnutí a zároveň k tomu, aby rozdělení pravděpodobností odpovídalo tomu, jak moc jsou jednotlivé možnosti podložené. Kombinace je tedy přímočará: Jev nemusí generovat volný text, několik otázek vyřeší současně a jeho výstup má od začátku podobu, jakou software potřebuje.

Podle aktuálního ceníku TypeSafe stojí milion vstupních tokenů 4,2 centu a za výstup se neplatí nic. To samozřejmě neznamená, že výstup nespotřebuje žádný výpočetní výkon, jen že za něj firma zatím nic nechce. U takto malé laboratoře to ale naznačuje, že samotný běh modelu nebude náročný – oproti velkým jazykovým modelům bude náročnost extrémně nízká.

Zůstává ovšem podstatná díra. TypeSafe nezveřejnil počet parametrů, popis architektury, použitý hardware ani test, který by oddělil přínos tréninku, paralelního vzorkování a samotného provozu. Výslovně dokonce odmítá, že by Jev byl jen malý model. O Jevu se tak ví dost na pochopení základního principu, ale strašně málo na to, aby šel z veřejných údajů postavit jeho klon nebo spočítat, na jakém hardwaru běží. Jsme ovšem v době AI, takže se brzy dá čekat nějaká open-weight varianta téhož řešení.

Benchmark, v němž správnou odpověď určily jiné modely

Srovnání modelu Jev s velkými jazykovými modely ve čtyřech pracovních postupech

klip od 13:36

Něco se dá odhadnout už teď, protože TypeSafe postavil Jev proti několika velkým jazykovým modelům ve čtyřech připravených pracovních postupech: zpracování faktur, zákaznická podpora, bezpečnostní incidenty a kontrola práce jiného agenta. Tedy přesně úlohy, ve kterých model nemá psát román, ale rozdělit vstup do několika předem definovaných kategorií a rozhodnutí.

Je ale důležité pohlídat si, co v tomto testu znamená správná odpověď. Jako referenci TypeSafe používá průměr odpovědí dvou silných modelů, GPT-6 Astra a Claude Fable 5.1, s vysokým nastavením přemýšlení. Výsledné procento tedy neříká, v kolika případech model skutečný problém vyřešil správně, ale jak často se přiblížil odpovědi, na které se shodly dva špičkové generativní modely.

V tomto srovnání vyšel Jev na 67,8 % shody, což je prakticky stejně jako Terra a Claude Sonnet 5. Jev ale podle zveřejněné tabulky potřeboval v průměru čtyři desetiny sekundy a zhruba čtyři setiny centu na jeden případ. Terra potřebovala přes deset sekund a stála 76krát víc, Sonnet přes minutu a stál víc než dvěstěkrát tolik – což nikoho, kdo kdy používal Claude, nepřekvapí, protože ten je příšerně drahý a odporně pomalý. V určitém typu úloh se tedy Jev dokáže dostat velmi blízko výsledkům mnohem dražších modelů za zlomek času i ceny.

Neplatí to ale všude. Při zpracování faktur skončil Jev zhruba na 62 %, zatímco Terra měla kolem 75 %. U benchmarku, který zveřejní firma, jež chce ohromit svět, je to varovné číslo: navenek se vždycky ukazuje nejlepší kůň v nejlepším světle. Jev tak může být mimořádně zajímavá architektura, ale skákat po něm jako po řešení pro všechno, co se kde klasifikuje, je předčasné. Je to velká černá skříňka a čísla musí někdo nezávisle potvrdit. Obzvlášť ta obří o skoro 900krát vyšší rychlosti a víc než 400krát nižší ceně. Ve srovnání se Sonnetem vychází rychlost opravdu zhruba dvěstěkrát vyšší, cenový rozdíl je ale menší. S jiným soupeřem vyjdou zase úplně jiné násobky. Jde o horní marketingové hodnoty, které závisí na konkrétní úloze, konfiguraci a vybraném soupeři.

Nezávislý test: 500 shod, ale jen pět situací

Test týmu LangChain s agentem pro předpověď počasí

klip od 17:00

Naštěstí existuje i jeden test mimo samotný TypeSafe. Připravili ho lidé z LangChain: vzali pět uložených běhů agenta pro předpověď počasí a nechali několik modelů rozhodnout, jestli agent splnil zadání. Každý z pěti případů zopakovali stokrát a Jev se ve všech 500 opakováních shodl s lidským verdiktem. Jeden výsledek mu trval v průměru 0,44 sekundy, srovnávaným generativním modelům tentýž krok 2,2 a 2,8 sekundy.

V relativně nezávislém testu byl tedy Jev zhruba pětkrát až šestkrát rychlejší. Pořád výrazně, ale už ne devětsetkrát ani dvěstěkrát. Proti nejlevnějšímu modelu od OpenAI, Luně, byla navíc cena skoro stejná, oproti Terře a Sonnetu už vycházel výrazně levněji.

Těch 500 výsledků má ještě jeden háček: nešlo o 500 různých situací, ale o pět situací, z nichž každou systém viděl stokrát. Experiment tak dobře ukazuje hlavně stabilitu. Jev si držel stejný názor pokaždé, když dostal stejný vstup, a to je pro udržitelné nasazení a dlouhodobou spolehlivost naprosto zásadní.

Stabilní i v omylu

Chybné zařazení problému s platební bránou Stripe a význam dobře popsaných kategorií

klip od 18:45

Stabilita má ovšem cenu, jen pokud model není stabilně přesvědčený o nějaké pitomosti. Rychlost, stabilita, nízká cena a dokonale pravidelný formát mají hodnotu jen tehdy, když model rozhoduje správně. Příklad z reálného testu: uživatel poslal Jevu zprávu, v níž zákazník popisoval chybu připojení k platební bráně Stripe. Očekávaným výsledkem byla technická podpora, Jev ale zprávu zařadil do kategorie billing, tedy fakturace. A když stejný vstup spustili stokrát, ani jednou nezměnil názor. Byl nádherně stabilní a stabilně mačkal úplně špatný výstup.

Při pohledu na problém se Stripem se dá namítnout, že jde o problém s platbou, takže proč ne fakturace. Jenže je to rozbité připojení, tedy spíš technická podpora. Člověku, který zná firmu a její interní procesy, bude případ jasný. Model ale interní pravidla nezná, pokud mu je nedáte do definice kategorií a příkladů. A když se kategorie do určité míry překrývají, není špatné rozhodnutí automaticky chybou modelu. Možná jste mu jen připravili špatnou nabídku tlačítek nebo špatné popisky k nim.

Při skutečném nasazení proto nebude stačit vymyslet hezké názvy kategorií. Bude potřeba pečlivě popsat, co do nich patří a co už ne, dodat hraniční příklady a většinou i možnost ostatní nebo nedokážu rozhodnout. Jinak model nutíte vybrat odpověď i tam, kde v nabídce žádná správná není. Jev sice k volbě vrací i confidence, tedy údaj o tom, jak moc si věří. Umělá inteligence má ale obecně sklon sama sobě nadržovat a tady to nejspíš nebude jiné. Jak přesný model skutečně je, budete stejně muset zjistit na vlastních datech – což jde, protože je v betaverzi a dá se vyzkoušet.

Specializovaný rozhodovací motor, ne nový ChatGPT

Co Jev je a není a srovnání s nadšením kolem difuzních modelů

klip od 21:00

Co tedy Jev je? Žádná nová univerzální AI a rozhodně ne náhrada ChatGPT. E-mail vám nenapíše a firmu za vás ani omylem řídit nebude. Je to velmi specializovaný rozhodovací motor, který podle dosavadních výsledků může být v přesně vymezených úlohách extrémně rychlý, extrémně levný a překvapivě schopný.

Velkým řečem o největším posunu od GPT nebo o začátku konce současných jazykových modelů je zatím lepší se vyhnout. Stačí si vzpomenout na ohromný humbuk kolem difuzních jazykových modelů, které podle představ některých nadšenců měly postupně převálcovat autoregresivní modely a rovnou odstavit transformery. Od prvních velkých slibů uběhl nějaký čas a ChatGPT pořád píše odpovědi slovo po slově. Neznamená to, že by difuzní modely byly k ničemu – na některé věci jsou výborné. Ukazuje se jen, že cesta od dobré myšlenky se slibnými výhodami k technologii, která unese skutečný provoz, je strašně dlouhá. Vždyť ani současné jazykové modely ještě v mnoha situacích neumíme využít opravdu dobře. Stejnou rezervu je rozumné držet si i u Jevu.

Nejlepší model nemusí umět všechno

Závěrečné shrnutí: kde má Jev skutečné místo

klip od 22:40

Už teď je ale jasné, že Jev vůbec nemusí porazit velký jazykový model ve všem. Stačí, když bude dobrý, nebo podstatně lepší, v jednom krátkém okamžiku, kdy je mezi chaotickým lidským vstupem a přesným softwarem potřeba udělat rozhodnutí. V příkladu s e-shopem rozpozná výměnu, naléhavost a chybějící informace. Klasický kód pak dohledá objednávku, zkontroluje sklad a spustí předem připravený proces. A teprve když je potřeba zákazníkovi něco napsat, přijde na řadu model, který umí skutečně psát.

Právě tady je na Jevu nejzajímavější rozmanitost, kterou přináší. Připomíná, že nejlepší model nemusí být nutně ten, který umí všechno. Někdy je nejlepší ten, který udělá jednu malou věc dostatečně dobře, rychle, spolehlivě a levně. Takovým modelem nikdy nebude GPT-6 Astra – ale možná, jen možná, jím bude něco jako Jev.