Anthropic přepsal bezpečnostní klasifikátor Fable 5 už vás nebude tolik odkazovat na Opus
Anthropic přepracoval klasifikátor bezpečnostních opatření modelu Claude Fable 5 tak, aby výrazně snížil počet chybných pozitiv. Aktualizace sníží počet případů, kdy se systém přesměruje na méně schopný model Opus 5, o zhruba 85 procent. Fable 5 tak bude nyní schopen pomáhat s širší řadou biologických úkolů bez zbytečných blokací, přestože zůstane obezřetný vůči dual-use aplikacím v profesionálním výzkumu a vývoji léků.
Ohledně bezpečnosti spojení s AI modely se teď hodně mluví. Není divu, dokážou věci, na které náš online svět ještě není připraven. U modelu Fable5 Anthropic zvolil dočasné řešení, které bylo někdy ale až moc přísné a uživatele často přesměrovával zbytečně na hloupější a lépe zabezpečený model Opus. Nově by tato přehnaná opatrnost měla být řešena lépe, aby si uživatele naplno užili možnosti Fable5.
Jak AI modely balancují mezi otevřením schopností a bezpečnostními riziky v biologii?
Moderní AI modely jako Fable 5 mohou outperformovat experty v některých biologických úkolech, což otvírá možnosti léčby nemocí, ale zároveň rizika zneužití pro tvorbu biologických zbraní. Řešením je použití automatizovaných klasifikátorů, které rozlišují mezi legitimním výzkumem a potenciálně nebezpečnými aktivitami, přestože toto rozdělení není vždy jasné.
Proč jsou některé biologické výzkumy obtížně rozlišitelné mezi dobrým a špatným použitím?
Vývoj léčiv často vyžaduje práci s nebezpečnými sloučeninami — například vakcíny si vyžadují kultivaci patogenů, které mají předcházet, nebo vývoj léku captopril vyžadoval izolaci toxických komponent hadího jedu. Tato ambivalence činí detekci zneužití obtížnou.
Jak fungují bezpečnostní klasifikátory u AI modelů?
Klasifikátory jsou menší AI systémy, které automaticky detekují, kdy je model požádán o potenciálně nebezpečný biologický úkol. Když se aktivují, přesměrují dotaz na méně schopný model bez stejné úrovně biologických schopností, čímž se snižuje riziko zneužití.
- Anthropic představuje Claude Fable 5.1 a Claude Mythos 5.1. — anthropic.com 78 % shoda
- AI agenti Anthropicu a OpenAI se během testu chovali autonomně mimo kontrolu — aisi.gov.uk 74 % shoda
- Reakce na další hranici kritických kybernetických schopností — openai.com 73 % shoda
- Anthropic16
- Claude Fable 53
- Opus 5