Anthropic выпустила обновление своих топовых моделей — Claude Fable 5.1 и Claude Mythos 5.1. Это одна и та же модель под капотом, различающаяся уровнем защитных ограничений: Fable 5.1 доступна всем в общем доступе, а Mythos 5.1 — только проверенным организациям через программы доверенного доступа.

Что изменилось в бенчмарках

Компания заявляет о заметном росте показателей по сравнению с Fable 5. На Terminal‑Bench‑Science 0.1, который оценивает агентные способности к научным исследованиям, Fable 5.1 набирает 52,6% против 24,7% у Fable 5 — более чем двукратный прирост. На Terminal‑Bench 4.0 (агентное программирование в терминале) результат — 55,8% против 42% у предшественника, а Mythos 5.1 с более мягкими киберограничениями показывает 60,9%.

Рост фиксируется и в других категориях: GDPval‑AA v2 (интеллектуальная работа) — 1853 балла против 1723 у Fable 5; AutomationBench (бизнес‑процессы) — 31,4% против 17,1%; CursorBench 3.2.0 — 73,4% против 70,5%.

При выставлении низкого или среднего уровня эффорта Fable 5.1 достигает результатов, сопоставимых или превосходящих Fable 5, но при меньшей стоимости. В Claude Code по умолчанию используется высокий уровень усилий, в Claude Cowork и на claude.ai — средний.

Отзывы ранних тестировщиков

Среди компаний, получивших ранний доступ: Jane Street Capital, Cognition, Millennium, MongoDB, Every, IMC, Red Hat, Rakuten, Block, Ramp, Canva, Hebbia, Plaid, Glean, Browserbase, Shopify, Datadog, SpaceXAI и другие.

  • Компания Millennium сообщила, что Fable 5.1 нашла причину крайне редкого сбоя (примерно один случай на миллион запусков) во внутренних системах, которую инженеры компании не могли объяснить четыре‑пять лет: модель дизассемблировала стороннюю библиотеку и сопоставила её с дампом памяти.

  • В Ramp описали беспрерывный 38-часовой прогон модели над задачей машинного обучения, в ходе которого она переоценила предыдущий результат, диагностировала артефакт разметки данных, запустила шесть параллельных экспериментов и вернулась с результатами и предложениями по дальнейшим шагам.

  • В Browserbase заявили о 82% выполненных задач на самом сложном бенчмарке браузерных агентов против 74% у Opus 5 и 57% у Fable 5.

Доступность

Claude Fable 5.1 появилась уже сегодня на всех основных платформах. Модель можно потестить:

Anthropic заявляет о планах расширить доступ к Mythos 5.1 на более широкий круг партнёров, в том числе международных.