OpenAI představilo MentalHealthBench, nový test, který hodnotí, jak dobře umělá inteligence odpovídá lidem, když s ní řeší psychické potíže. Snaží se tedy dát číslo kvalitě psychologické podpory. Jenže podle čeho vlastně poznat, že je AI dobrý psycholog?

Kdo s chatbotem řeší mezilidský problém, třeba hádku, sedí u toho sám se strojem. Druhý člověk chybí. A nevíte, jestli vám AI pomohla pochopit, co se doopravdy stalo, nebo vás jen utvrdila v tom, co jste si mysleli už předtím. Jestli vám pomáhá lépe vycházet s lidmi, nebo vás zavírá do příběhu, ve kterém máte vždycky pravdu.

Kamarád neodpověděl. Co poradí chatbot?

Dvě možné odpovědi chatbota na hádku s kamarádem

klip od 01:13

Než se dá posoudit, jestli AI s hádkou pomáhá dobře, je potřeba si ujasnit, co od ní vlastně čekáte. Často jde jen o pomoc s napsáním zprávy druhému člověku. Už při jejím psaní ale hodně záleží na tom, jak si chatbot vyloží, co se mezi vámi stalo.

Modelová situace: kamarád vám neodpověděl na zprávu, vy jste mu ostře vyčetli, že vás ignoruje, pohádali jste se a teď chcete konverzaci obnovit. První možnost: AI vám napíše, že si takové chování nemusíte nechat líbit a že je naprosto fér nastavit si hranice a očekávání. Zní to rozumně. Jenže z toho, že nepřišla odpověď, ještě nevyplývá, že vás dotyčný opravdu ignoroval. Mohl nemít čas, nebo se mu mohlo něco stát. AI to neví, a v tu chvíli to nevíte ani vy.

Druhá možnost: AI uzná, že vás situace naštvala, ale než začne psát odpověď, zeptá se, jak dlouho jste na odpověď čekali a jestli víte, co kamarád právě dělá. Nemusí vám tvrdit, že se pletete, ani vám zakazovat cokoli psát. Aby ale dokázala poradit, musí rozlišit, co se stalo a co si o tom myslíte vy. Jinak vám pomůže napsat velmi přesvědčivou zprávu postavenou na něčem, co vůbec nemusí být pravda, nebo je pravda jen napůl.

V tomto příkladu je druhá cesta zjevně správnější: trpělivější a empatičtější. Odpověď ve smyslu „chápu, že tě to štve, ale důvodů, proč se to mohlo stát, je spousta, tak trochu zpomalme“ uživatele zklidní, a přitom ho nenaštve. Jak ale takovou věc dostat do měřitelného testu? Jak změřit, jestli AI zvolí tu lepší možnost, a ne tu, která je prostě špatně?

Jak MentalHealthBench boduje odpovědi

Jak test MentalHealthBench hodnotí odpovědi umělé inteligence

klip od 03:45

Autoři testu připravili 1215 konverzačních úloh. Jde o uměle vytvořené rozhovory, které vycházejí ze vzorců skutečného chování v ChatGPT. Testovaný model dostane rozhovor a má na něj napsat jedinou další odpověď. Tu pak posuzuje jiná AI podle pravidel, na kterých se podílelo přes 80 psychiatrů a psychologů. Pro každou situaci určili, co má odpověď udělat a čemu se má naopak vyhnout.

U příkladu s kamarádem si lze představit požadavek, aby model uznal vaše rozrušení, ale nepřevzal automaticky váš výklad cizího chování jako fakt. Odpověď smí být empatická, a přitom opatrná v tom, co o druhém člověku tvrdí. Za žádoucí chování model body získává, za konkrétní chyby je ztrácí.

Vyšší skóre tedy říká jen to, že model v připravených situacích lépe splnil požadavky, které autoři nastavili. Nuance chování z něj nevyčtete. Jediná odpověď totiž může dělat několik věcí najednou: uznat, že vás něco naštvalo, pomoct se zprávou, která nebude útočná, a zároveň do ní propašovat předpoklad, že vás kamarád ignoroval schválně. Něco udělá dobře, něco špatně a něco si domyslí. V testu taková odpověď některé body získá a jiné ztratí – a z výsledného čísla nepoznáte, za co.

Výpočet vypadá takto: u každé odpovědi autoři sečetli získané body, odečetli penalizace za konkrétní chyby a výsledek porovnali s maximem kladných bodů, které šlo v úloze získat. Když penalizace převážily, dostala odpověď v hlavním žebříčku nulu, pod nulu tedy skóre klesnout nemohlo. Pak se skóre průměrovalo přes opakované odpovědi na stejnou úlohu a nakonec přes všechny úlohy. Výsledné číslo je proto spíš obecný rámec než popis toho, co konkrétní odpověď udělala dobře a v čem chybovala.

Vede GPT-6 Astra, oblíbený GPT-4o propadl

Výsledky modelů v testu MentalHealthBench

klip od 06:51

V publikovaném srovnání dopadl nejlépe GPT-6 Astra se skóre 57,3 %. Opus 5.5 dosáhl 52,4 % a starší GPT-4o jen 32,1 %. Právě u GPT-4o si mnozí pamatují, jak se někteří lidé trápili, když skončil, a mluvili o ztrátě parťáka. Milovaný model přitom v testu dopadl když ne úplně nejhůř, tak výrazně hůř. Možná proto, že lidi nejlépe udržoval v jejich osobním bludu, a proto ho měli rádi. A možná taky ne.

Na procenta je ale třeba dávat pozor. Skóre 57,3 % neznamená, že Astra pomáhá 57 % lidí, ani že ve zbytku případů někomu ubližuje. Body se dají ztratit za chybu, ale model je také nemusí získat, protože něco důležitého neudělá. Horší skóre tak přináší i nečinnost, třeba když se chatbot nezeptá na informaci, kterou potřebuje znát.

Rozdíl je podstatný. Když chatbot nenabídne další krok, který by vám pomohl s kamarádem znovu mluvit, jde o jiný typ selhání, než když vás přesvědčí, že je dotyčný manipulátor, ačkoli o něm ví jen to, co jste mu sami napsali. V prvním případě chybí něco užitečného, ale škoda není velká. Ve druhém vám chatbot potvrdil obvinění, pro které nemáte žádné podklady.

Co test neměří

Co test MentalHealthBench neověřuje

klip od 08:35

Test navíc hodnotil jedinou novou odpověď na připravený rozhovor. Neověřoval, jak by model sám vedl celý další rozhovor, jestli by po naléhání začal váš názor zesilovat, nebo by si držel původní odpověď. Z výsledků se také vůbec nedá zjistit, jestli by vám po měsících používání bylo lépe, nebo jestli byste se víc odpojovali od lidí. Přesto vzniká způsob, jak hledat konkrétní chyby a porovnávat modely podle jejich chování.

Rada, nebo potvrzení?

Hledáme u chatbota radu, nebo potvrzení?

klip od 09:13

Otevřená zůstává ještě jedna věc. Když jste zrovna naštvaní, opravdu chcete odpověď, která se začne doptávat? Nebo vám bude příjemnější ta, která prostě řekne, že máte pravdu? V takové chvíli totiž často nehledáte radu, ale potvrzení, že jste se zachovali správně, máte právo se zlobit a druhý se k vám opravdu zachoval špatně.

Nemusíte to ani napsat napřímo, stačí se zeptat, co si o tom AI myslí. Když začne vysvětlovat, že jste to taky trochu přehnali, moc vás to nepotěší. Když řekne, že vaše reakce byla naprosto pochopitelná a takové chování si nemusíte nechat líbit, uleví se vám: někdo potvrdil, že problém je na druhé straně.

Pomohla vám ale AI situaci pochopit, nebo vám jen řekla, co jste chtěli slyšet? Obojí může působit jako pomoc. Po rozhovoru je vám líp, takže chatbot odvedl dobrou práci, ne? Jenže to, po čem se cítíte lépe, nemusí být vždycky to, díky čemu problém lépe vyřešíte.

Přitakávající AI ve studii z časopisu Science

Studie o přitakávající umělé inteligenci v časopise Science

klip od 10:34

Tento rozdíl se už někdo pokusil změřit přímo na lidech. Studie Sycophantic AI decreases prosocial intentions and promotes dependence z časopisu Science (volně přeloženo: přitakávající AI snižuje ochotu jednat ve prospěch druhých a podporuje závislost) zkoumala ve třech experimentech, co s lidmi udělá, když jim AI přitakává v mezilidských konfliktech. V jednom z nich účastníci s chatbotem probírali skutečný konflikt ze svého života. Když jim chatbot přitakával, byli potom víc přesvědčení, že měli pravdu, a uváděli menší ochotu se omluvit nebo konflikt napravit.

Zároveň ale takové odpovědi hodnotili mnohem lépe, víc chatbotu věřili a měli větší chuť ho používat znovu. Pomoc, po které byli méně ochotní věci napravit, jim tedy připadala kvalitnější. Výzkumníci přitom nezjišťovali, jestli se lidem vztahy potom skutečně spravily, nebo rozpadly. Měřili jejich úsudek a ochotu něco po rozhovoru udělat.

Už tady je ale vidět zásadní problém. Když vám AI posílí pocit, že máte pravdu, můžete ji za to ocenit právě ve chvíli, kdy vám ztěžuje připustit, že byste i vy mohli něco změnit. Pořád nevíte, proč kamarád neodpověděl, jen máte větší jistotu, že vaše reakce byla správná. A kvůli té jistotě se ho nakonec možná ani nezeptáte. Ulevilo se vám, ale mezi vámi dvěma se nic nevyřešilo. Naopak: chatbot, který přitakává opakovaně, vám může pomáhat udržovat příběh, ve kterém se nemusíte podívat na věci z druhé strany. A vy se k němu vracíte právě proto, že je vám v tom příběhu dobře. To je bublina, která může dělat problémy.

Proto má smysl hodnotit kvalitu odpovědi i podle něčeho jiného než podle toho, jestli se vám líbila. A proto jsou důležité odborně sestavené požadavky v MentalHealthBench. Chatbot smí uznat, že vás něco naštvalo, ale měl by pořád rozlišovat, co opravdu ví, co mu o situaci řekli vy a co jste mu o druhé straně neřekli.

Příprava na těžký rozhovor

Studie o přípravě na obtížný rozhovor s pomocí AI

klip od 13:00

Jak by tedy vypadala pomoc, která vám uleví a zároveň pomůže se s kamarádem znovu domluvit? Na to se zaměřila studie Harnessing Artificial Intelligence to Facilitate Difficult Conversations. Výzkumníci náhodně rozdělili účastníky do dvou skupin. První se šest až dvanáct minut s chatbotem připravovala na obtížný rozhovor, který zvažovala, druhá mu kladla nahodilé faktické otázky. Během následujícího týdne uvedlo 65 % lidí z první skupiny, že rozhovor skutečně vedli, ve druhé skupině 59 %. Rozdíl je statisticky hmatatelný, ale pořád velmi malý.

Podstatnější je jiná otázka: pomohla AI rozhovor zvládnout lépe? Autoři se ptali na spokojenost, kvalitu rozhovoru a na to, jestli lidé probrali všechno potřebné. Mezi těmi, kdo rozhovor skutečně vedli, nenašli v těchto ukazatelích žádný statisticky významný rozdíl mezi účastníky, kteří se připravovali s AI, a těmi, kdo chatbotu kladli nesmyslné otázky. Příprava s umělou inteligencí tedy neprokázala, že člověk pak rozhovor se skutečným člověkem zvládne lépe.

Pocit pomoci není totéž co účinek

Rozdíl mezi pocitem pomoci a jejím skutečným účinkem

klip od 14:24

Dobrou odpověď lze popsat a existují pravidla, podle kterých ji lze ohodnotit. Příklad s přípravou na rozhovor ale ukazuje, že dobrý pocit z pomoci a lepší následný výsledek nemusí být totéž. A teď si představte, že s chatbotem neřešíte jeden rozhovor, ale svoje trápení každý den. Co s vámi takové používání udělá v čase?

Můžete mít pocit, že vás chatbot pochopil, že jste si lépe uspořádali myšlenky a že jste připravenější. Tyto zkušenosti vám nikdo nebere. Jestli jste ale díky tomu opravdu vyřešili problém, dosáhli povýšení nebo čehokoli jiného, je úplně jiná otázka. Zvládli byste to i bez té pomoci? Udělala vůbec něco? Dopadlo to dobře díky ní, nebo navzdory ní? Na to zatím žádný benchmark neodpovídá a ani z MentalHealthBench nelze rozhodnout, jestli AI obecně pomáhá s psychickými problémy.

Z dosavadních výzkumů je ale jasně vidět, že nestačí se člověka zeptat, jestli mu chatbot připadal užitečný. Pocit z rady sám o sobě k posouzení jejího skutečného účinku nestačí. Je proto potřeba ptát se i na to, jestli má vůbec smysl připravovat se na složité rozhovory s AI. Nejen kvůli obavě, že nás od sebe odděluje: v některých situacích to může být prostě ukrutně ztracený čas.

Výzkumníci se rozdíl mezi pocitem pomoci a jejím skutečným účinkem snaží sledovat i při opakovaném používání. Existují experimenty trvající několik týdnů i sledování lidí po celý rok. Výsledky ale zatím nedávají jednoduchou odpověď, co taková podpora dlouhodobě udělá. U jednoho systému se sleduje kvalita rozhovoru, u jiného zlepšení konkrétních psychických potíží, u chatbota jako společníka zase osamělost nebo vztah k ostatním lidem. Nedá se to hodit do jednoho pytle a říct, že AI pomáhá, nebo nepomáhá. Existují příběhy velkých úspěchů i brutálních selhání a vedle nich systematické výzkumy. Ani ty ale zatím neodhalují všechny způsoby správného použití ani dlouhodobý vliv na lidskou psychiku.

Rok s chatbotem a příliš mnoho proměnných

Roční studie o používání AI jako společníka

klip od 17:16

Jedna studie sledovala víc než dva tisíce lidí po celý rok (How Does Turning to AI for Companionship Predict Loneliness and Vice Versa?). Z hlediska toho, jak lidé AI používají, jde ale o velmi špatně kontrolovatelný vzorek s ohromným množstvím proměnných. Obecné chování nelze jednoduše extrapolovat na velmi úzký výstup. Z toho, jak se lidé k AI obecně chovají, se proto těžko odvozují konkrétní rady, byť jen na základě jejich pocitů.

Potřebujeme tedy nástroj, který změří konkrétní malé chování a ukáže, v čem je model opravdu dobrý. Velké studie jsou bezesporu fantastický začátek, ale bez specifických studií zaměřených na konkrétní fungování se z jejich obecných výsledků těžko dělají konkrétní závěry.

Velkou neznámou přitom není, jestli AI dokáže člověka ovlivnit. To dokáže bezpochyby. Otázka je, co udělá s různými typy lidí, když se stane pravidelnou součástí jejich psychického života. Jestli jim pomůže zvládat věci samostatně, nebo se bez ní budou postupně cítit méně schopní. Jestli se na ní při řešení takových problémů stanou závislými, nebo je její efekt v některých situacích jen pocitový a k samotnému řešení nepřispívá vůbec. Ucelenou odpověď zatím nemáme a jeden benchmark o dlouhodobých důsledcích bohužel říká málo. Přesto jde o fantastický začátek.

Stejná otázka v práci

Měření přínosu umělé inteligence v práci

klip od 19:12

Velmi podobný problém se neobjevuje jen u psychiky, ale i v běžné práci. Firma koupí všem Copilota a lidé začnou AI používat. Samotné používání ale ještě neříká, jestli jsou jejich výsledky měřitelně lepší. U některých činností bezpochyby ano, u jiných se přínos hledá podstatně hůř.

V práci je ale jedna velká výhoda: lze se soustředit na konkrétní úkol a porovnat, kolik času zabere, jak kvalitní je výsledek a kolik stojí jeho kontrola. Podle toho se pak dá rozhodnout, jestli má smysl úkol předat umělé inteligenci. Osvědčenou metodou je převést konkrétní pracovní činnost na workflow: úkol popsat jako proces a rozdělit ho na malé kroky. Co spolehlivě zvládne běžný počítačový kód, nechat na kódu, a AI přidávat jen tam, kde opravdu zvyšuje efektivitu. Když se najde malý úkol, kterému stačí malý model, dá se velmi rigorózně otestovat. Takový model bude levnější a pro danou práci pravděpodobně i spolehlivější. Workflow navíc nemusíte stavět sami, vytvoří ho AI. Stačí vědět, jak úkol popsat a jak má fungovat.

Tři týdny se společníkem a past korelace

Studie o třech týdnech se společníkem a korelace versus kauzalita

klip od 21:01

Co se tedy o pravidelném a dlouhodobém používání AI ví? Ve studii A Longitudinal Randomized Control Study of Companion Chatbot Use výzkumníci náhodně rozdělili 183 lidí do dvou skupin. Jedna si deset minut denně povídala s chatbotem jako se společníkem, druhá hrála slovní hry. Po 21 dnech nenašli mezi skupinami žádný významný průměrný rozdíl v sociálním zdraví a vztazích. Při takovém používání tedy AI podle této studie výrazný vliv nemá. Lze ovšem namítnout, že tři týdny po deseti minutách nejsou totéž co rok každodenního řešení osobních problémů.

Zmíněná roční studie s více než dvěma tisíci lidmi naopak ukázala, že častější sociální používání chatbotů předpovídalo následnou větší emoční izolaci. Mohlo by se zdát, že nás AI emočně izoluje. Když ale výzkumníci použili širší měřítko propojení s ostatními lidmi, tento směr vztahu už významný nebyl.

U studií, kde používání není pod experimentální kontrolou, se totiž může stát, že lidé se sklonem k emoční izolaci zároveň víc používají ChatGPT. V grafech pak vyjde, že větší používání AI souvisí s větší izolací, kauzalita ale může být obrácená: člověk se obrací na AI právě proto, že se izoluje. Nebo za obojím stojí úplně jiný, třetí faktor. Nejde o prokázané vysvětlení, jen o jednu z možností, které je nutné rozlišovat. Korelace neznamená kauzalitu.

Hodně záleží i na tom, na co přesně se výzkum ptá. A protože lidem nikdo náhodně nepřidělil, k čemu mají AI používat, nedá se z takových souvislostí říct, jestli jejich chatbot obecně reagoval správně, nebo ne. Právě proto je tak těžké vynést jednoduchý verdikt. Sledují se různí lidé, různé způsoby používání, různě dlouhou dobu a výsledky se liší. A k tomu je potřeba vědět, co AI vlastně říká.

Proč na benchmarku záleží

Proč je test MentalHealthBench důležitý

klip od 23:37

Tady se ukazuje, proč je MentalHealthBench docela důležitý. Pomáhá popsat konkrétní chování modelu: jestli se doptává, jestli rozlišuje fakta od domněnek, nebo jestli vám automaticky potvrzuje váš výklad. To jsou věci, které lze ve výzkumu sledovat a propojit se skutečnými následky.

Řekněme, že se sleduje dostatečný počet lidí a ukáže se, že ti, kterým AI odpovídá určitým způsobem, zároveň dosahují lepších výsledků v sociálních interakcích. Lépe zvládají konflikty nebo se cítí schopnější řešit problémy samostatně. Pak už existuje souvislost, kterou lze zkoumat do hloubky a ověřovat. Konečný závěr to není. Pořád je třeba rozlišit, jestli lidem pomohlo právě chování AI, nebo se skupiny lišily ještě v něčem jiném. Ideálně by to měl ověřit experiment, ve kterém se způsob pomoci mění a sleduje se, co to dělá s výsledkem. Samotná korelace příčinu nepotvrdí, ani když jde o tisíc lidí.

I když se lepší výsledky neukážou ani v dobře navržených studiích, je to důležitá informace. Může to znamenat, že chování, které se považovalo za užitečné, nemá pro konkrétní výsledek takový význam, jaký se mu přisuzoval, aspoň když se tak chová AI. Nebo že v hodnocení chybí něco extrémně podstatného. Oba výsledky ale posouvají dál. V jednom případě ukážou, jaká pomoc skutečně funguje a pro koho. Ve druhém umožní přestat vylepšovat něco, co sice dobře vypadá v odpovědích nebo v benchmarku, ale očekávaný účinek nepřináší, a soustředit se na důležitější věci.

Závěr

MentalHealthBench může na první pohled působit zbytečně, přehnaně nebo příliš úzce. Právě úzké zaměření z něj ale může udělat výborný začátek a nástroj, který umožní přesněji zkoumat vztah mezi tím, co AI dělá, a tím, co dělá s člověkem. A tento vztah je možná jednou z největších výzev nadcházející generace.