Anthropic выпустила Claude Fable 5 с фильтрами

Anthropic выпустила Claude Fable 5 — первую публично доступную модель из класса Mythos. Ранние тесты показывают заметный рост качества, особенно в программировании, но модель уже критикуют за фильтры безопасности, цену и новые правила хранения данных.

По данным Anthropic, Fable 5 использует ту же базовую модель, что и Claude Mythos 5, но с более жёсткими ограничениями. Они блокируют часть запросов, связанных с кибербезопасностью, биологией, химией и дистилляцией моделей. Сама Mythos 5 тоже доступна, но пока лишь небольшой группе пользователей.

Что именно означает класс Mythos с технической точки зрения, до конца не ясно. Издание Every со ссылкой на CEO Дэна Шиппера пишет, что сотрудники Anthropic говорили об отсутствии особой архитектурной разницы. В линейке Haiku, Sonnet и Opus Mythos, по сути, означает самую крупную и самую сильную модель. Разработчик Саймон Уиллисон предполагает то же самое и считает, что это крупнейшая публично доступная модель Anthropic на данный момент.

Artificial Analysis приводит косвенное подтверждение этой версии. На бенчмарке AA-Omniscience, который измеряет уровень знаний и склонность к галлюцинациям, Fable набрала 40 баллов — на семь больше, чем предыдущий лидер Gemini 3.1 Pro.

По ряду тестов Fable 5 вышла на первое место. На Artificial Analysis Intelligence Index модель получила 64,9 балла, примерно на пять больше ближайшего конкурента GPT-5.5. На GDPval-AA, который оценивает агентные сценарии для рабочих задач, она набрала Elo-рейтинг 1932. На Humanity’s Last Exam результат составил 53%, что более чем на семь пунктов выше Opus 4.8. Один прогон этого теста, включая резервные затраты, обошёлся примерно в 2200 долларов.

Сервис Vals также поставил Fable 5 на первое место в общем зачёте и во всех тестах по программированию. В частности, модель получила 95% на SWE-bench Verified и 90,35% на Vibe Code Bench. Инструмент Devin тоже сообщил о лучшем результате на своём внутреннем бенчмарке FrontierCode.

При этом часть сообщества оценивает релиз сдержанно. На Hacker News некоторые пользователи назвали прогресс скорее постепенным, чем радикальным, и указали на возможную подгонку под бенчмарки. Сам Уиллисон признал, что его первые впечатления — это скорее субъективная оценка, а не строгий сравнительный тест.

Тем не менее практические примеры тоже привлекли внимание. Итан Моллик рассказал, что с помощью Claude Code модель собрала полноценно исследованную карту изохрон времени в пути. Fable сама запускала более дешёвых субагентов, собирала данные по более чем 2200 авиамаршрутам, расписаниям поездов и скорости движения по дорогам из научных работ, параллельно писала код и проверяла его через другие агенты.

Другой проект, связанный с исследовательским инструментом для калибровки человеческих и ИИ-оценок, занял девять с половиной часов. В Every сообщают, что по одному запросу модель создала 3D-визуализацию «Вавилонской библиотеки» Борхеса и анализ опроса, который, по словам Шиппера, точнее указал на проблему конверсии, чем недели ручной работы.

На внутреннем тесте Every для старших инженеров Fable получила 91 балл из 100 против 63 у Opus 4.8 и 62 у GPT-5.5. Шиппер назвал модель «warp drive» и сказал, что она хорошо подходит для больших и чётко поставленных задач в асинхронном режиме, но хуже — для быстрых диалогов. Уиллисон описал первое впечатление ещё короче: Fable — «a beast».

У такого подхода есть и минусы. Моллик пишет, что в ходе работы сам участвовал минимально и не мог отследить большую часть из сотен микрорешений модели. По его словам, он перешёл от роли «волшебника, который произносит заклинание» к роли клиента: «Я описываю, что хочу, плачу за это и оцениваю результат».

Сервис CodeRabbit подтверждает сильные стороны Fable в автономных задачах по программированию с неполным заданием, но отмечает, что по точности ревью кода модель уступает Opus 4.8. Также она склонна продолжать выполнение задач, пока систему не остановят принудительно.

Главная претензия пользователей касается защитных ограничений. Fable автоматически переключается на более слабую Opus 4.8 или отказывается отвечать, если считает тему чувствительной. По оценке Artificial Analysis, это происходит примерно в 8–9% задач, в основном научных.

На практике, по словам пользователей, фильтры слишком часто срабатывают на безобидных запросах. Медицинский физик написал: «Я правда не могу пользоваться Fable. Я медицинский физик. Я часто использую слово nuclear». Другие жалуются, что сегментация МРТ-снимков классифицировалась как биотерроризм, вопрос о передаче малярии комарами блокировался, а обычный аудит безопасности отмечался как риск в кибербезопасности.

Внимание сообщества привлёк и один фрагмент из системной карточки объёмом 319 страниц. Уиллисон пишет, что Anthropic встроила скрытые вмешательства, которые намеренно ухудшают ответы Fable, если пользователь пытается разрабатывать конкурирующие передовые модели, включая пайплайны предобучения или проектирование ML-ускорителей.

В отличие от фильтров по кибербезопасности или биологии, здесь нет заметного переключения на другую модель. Вместо этого Anthropic, как сообщается, меняет запросы или использует steering vectors для незаметной коррекции ответа. Компания утверждает, что это затрагивает около 0,03% трафика.

Уиллисон раскритиковал такой подход и заявил, что ему не нравится модель, которая скрытно искажает ответы по теме «проектирование ML-ускорителей», чтобы замедлить исследования, способные конкурировать с целями Anthropic. На форумах этот шаг многие сочли открыто антиконкурентным. Один из комментариев сформулировал это так: «Anthropic’s definition of ‘unsafe’ encompasses ‘competing with Anthropic.’»

Отдельный вопрос — оправдывает ли результат высокую цену после завершения субсидируемых тарифов с фиксированной ставкой. Компании платят отдельно за Harness, а токены тарифицируются по стандартным API-ставкам. Один разработчик сообщил, что переход с плана Max за 200 долларов на корпоративную тарификацию увеличил ежемесячные расходы на Opus с 200 до 10 000 долларов при том же уровне использования. Для Fable, по его оценке, сумма составила бы около 20 000 долларов.

Для части пользователей сравнение получается прямым: за 10 000–20 000 долларов в месяц можно нанять одного или двух опытных разработчиков, а затем добавить им ИИ-инструменты. За пределами США разница выглядит ещё заметнее. Один разработчик с доходом около 2500 долларов в месяц сказал: «nobody I know would pay that, no company will justify spending $20k/month when they can hire 10 more developers instead.»

Сторонники модели возражают, что ценность нельзя считать только в токенах. Если Fable действительно помогает решать трудные задачи за дни вместо недель и стабильно выдаёт результат на уровне двух или трёх разработчиков, это может окупаться. Скептики отвечают, что главная проблема в разработке ПО обычно не в самом решении, а в постановке результата, рамок задачи и критериев приёмки. Кроме того, сгенерированные ИИ решения нередко приходится выбрасывать и переписывать.

На этом фоне обсуждается гибридный сценарий использования. Более дешёвые модели, включая DeepSeek v4, многие считают достаточными для повседневной работы, а Fable или Opus предлагают оставлять для сложных функций, трудных багов и задач верхнего уровня. Один из пользователей описал схему, в которой сначала строит план в Opus 4.8, затем просит Fable проверить, как его упростить, и только потом переходит к более дешёвому циклу исполнения.

Claude Fable 5 получила контекстное окно в 1 млн токенов и лимит вывода в 128 000 токенов. Данные для обучения модели включают информацию по январь 2026 года. Сейчас она временно доступна в тарифах Pro, Max, Team и Enterprise, где до 22 июня считается как двойное использование Opus. Пользователи отмечают, что лимиты заканчиваются быстро: один из них сообщил, что одна сессия исчерпала всё пятичасовое окно на плане Max за 200 долларов, так и не завершив задачу. Другой написал, что один запрос превысил лимит Pro.

С 23 июня для доступа к модели понадобятся кредиты, пока Anthropic не вернёт подписочный доступ после расширения мощностей. На практике это делает использование модели ещё дороже.

Ещё одно изменение касается хранения данных. Для моделей класса Mythos вводится 30-дневная политика retention. Она действует даже в случаях, когда у клиента есть соглашение о нулевом хранении данных. Для компаний, которые опирались на этот режим, это, по словам пользователей, стало немедленным стоп-фактором.

На раннем этапе Fable 5 выглядит как серьёзный шаг вперёд, особенно для сложной делегируемой разработки в руках опытных пользователей. Для коротких и быстрых задач, а также для работы в регулируемых сферах, многим, вероятно, подойдут более дешёвые или менее жёстко ограниченные модели. Одновременно релиз показывает, как Anthropic меняет подход к защите, цене и скрытому управлению своими самыми мощными моделями.

Источник: The Decoder, Artificial Analysis, Vals, Every, Simon Willison, Hacker News, Ethan Mollick, CodeRabbit.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai