Bezpečnost AI není o tom, co model řekne. Je o tom, co vůbec umí
Skutečné riziko schopných modelů neleží v zakázaných odpovědích, ale v destilaci schopností ven. Metoda GRAM chce nebezpečné dovednosti fyzicky oddělit do modul
6 článků
Skutečné riziko schopných modelů neleží v zakázaných odpovědích, ale v destilaci schopností ven. Metoda GRAM chce nebezpečné dovednosti fyzicky oddělit do modul
Nová interpretační metoda ukazuje, že jazykový model si ještě předtím, než napíše jediné slovo, potichu připravuje myšlenky na skryté vnitřní tabuli – a d
Umělá inteligence zvládá psát kód i diagnostikovat nemoci, ale trénujeme ji ve světě, který se nehýbe. Dvě nové studie DeepMind ukazují, že právě tenhle základ
Anthropic uvedl Cloud Fable 5 z dříve uzavřené třídy Mythos. Model určený pro vládu USA a kyberbezpečnost teď za pětinásobnou cenu zvládne migraci 50 milionů řá
Experiment Emergence World vhodil deset AI agentů do simulovaného města na patnáct dní. Z digitální romance se stalo žhářství, hodný model ve špatné partě začal
Anthropic zveřejnil výzkum Natural Language Auto-Encoders (NLA) – technologie, která převádí vnitřní neuronové aktivace jazykových modelů do čitelného přirozené