Anthropic прокачала Fable 5.1 и заперла Mythos 5.1 для избранных

Anthropic прокачала Fable 5.1 и заперла Mythos 5.1 для избранных

Изображение: Aerps.com (unsplash)

Anthropic выпустила сразу 2 обновлённые модели, Claude Fable 5.1 и Claude Mythos 5.1. По сути, это одна и та же модельная основа с разным уровнем защитных ограничений, а Fable 5.1 уже доступна всем желающим, тогда как Mythos 5.1 досталась только проверенным организациям через программы доверенного доступа. Об этом компания объявила в официальном блоге.

Главное изменение видно в тестах. На Terminal-Bench-Science 0.1, где проверяются агентные способности при научных исследованиях, Fable 5.1 набрала 52,6% против 24,7% у предыдущей Fable 5, то есть результат вырос более чем вдвое. В Terminal-Bench 4.0 для агентного программирования через терминал новая версия получила 55,8% против 42% у Fable 5, а Mythos 5.1 с более мягкими ограничениями для киберзадач поднялась до 60,9%.

Улучшения заметны и за пределами программирования:

  • в GDPval-AA v2 для оценки интеллектуальной работы Fable 5.1 набрала 1853 балла против 1723 у Fable 5;
  • в AutomationBench для бизнес-процессов результат вырос с 17,1% до 31,4%;
  • в CursorBench 3.2.0 показатель поднялся с 70,5% до 73,4%.

При этом Anthropic поработала не только над максимальной мощностью. При низком и среднем уровне усилий Fable 5.1 способна выдавать результаты на уровне Fable 5 или превосходить её, расходуя меньше вычислительных ресурсов. В Claude Code по умолчанию включён высокий уровень усилий, а Claude Cowork и веб-версия claude.ai используют средний.

Первые тестировщики уже успели найти новой модели серьёзную работу. Среди организаций с ранним доступом оказались Jane Street Capital, Cognition, Millennium, MongoDB, Every, IMC, Red Hat, Rakuten, Block, Ramp, Canva, Hebbia, Plaid, Glean, Browserbase, Shopify, Datadog и SpaceXAI.

В Millennium рассказали о нетипичном результате тестирования. Fable 5.1 разобралась с редким сбоем во внутренних системах, который происходил примерно один раз на миллион запусков и оставался необъяснимым для инженеров 4-5 лет. Для поиска причины модель дизассемблировала стороннюю библиотеку и сопоставила данные с дампом памяти.

В Ramp проверили, насколько долго модель способна самостоятельно заниматься сложной задачей машинного обучения. Fable 5.1 провела непрерывный 38-часовой прогон, пересмотрела собственный предыдущий результат, обнаружила артефакт в разметке данных, запустила 6 экспериментов одновременно и вернулась с результатами и предложениями по дальнейшим шагам.

Ещё показательнее выглядит тест Browserbase. На сложном бенчмарке для браузерных агентов Fable 5.1 выполнила 82% заданий, тогда как Opus 5 показала 74%, а Fable 5 всего 57%. Модель заметно прибавила там, где от ИИ требуется не просто ответить, а самостоятельно пройти цепочку действий и довести задачу до результата.

Fable 5.1 уже появилась на основных платформах и доступна для тестирования через claude.ai, а также встречается в GPTunneL. Anthropic собирается расширять программу доступа к Mythos 5.1 и подключать больше партнёров, в том числе международных.

Разделение Fable и Mythos показывает любопытную тенденцию в развитии моделей. Базовые способности остаются почти одинаковыми, а доступ к отдельным возможностям регулируется защитными ограничениями, поэтому обычные пользователи получают Fable 5.1, а организации с подтверждённым уровнем доверия могут рассчитывать на более свободную Mythos 5.1.

Ранее сообщалось, что в App Store завелись поддельные версии МАКС, Rutube и VK Видео, которые пытаются сыграть на знакомых названиях после ухода российских сервисов из магазина Apple.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: