Claude Opus 5.5 не превзошла Opus 5 в трёх задачах на рассуждение

Claude Opus 5.5 не превзошла Opus 5 в трёх задачах на рассуждение

Изображение: OpenAI

Claude Opus 5.5 не превзошла Claude Opus 5 по результатам трёх задач на логические рассуждения в тесте The New Stack, но на каждом запуске обошлась дешевле и завершала работу быстрее. В одной из задач обе модели израсходовали почти весь лимит вывода, работали до 25 минут и не предоставили ответа.

Автор сравнил модели через Anthropic API с одинаковыми запросами и настройками adaptive thinking по умолчанию. Проверка включала логическую таблицу с семью участниками, подсчёт допустимых перестановок задач развёртывания и игру с камнями с ограничениями на ходы. Claude Opus 5.5 и Opus 5 решили две задачи одинаково и обе не справились с подсчётом перестановок.

На логической таблице модели правильно заполнили все 28 ячеек. Opus 5.5 выполнила задачу за 65 секунд, использовала 7 573 выходных токена и стоила $0,16; Opus 5 работала 108 секунд, вывела 10 621 токен и стоила $0,27. Разница в стоимости составила 43% при одинаковом правильном ответе.

В задаче с камнями обе модели корректно ответили на все три вопроса. Opus 5.5 завершила запрос за 215 секунд, использовав 28 740 выходных токенов за $0,58. Opus 5 потребовались 624 секунды, 74 981 токен и $1,88 — на 62% больше токенов и на 69% дороже.

Задача на подсчёт перестановок оказалась для моделей нерешаемой в рамках теста. При лимите в 48 000 выходных токенов обе израсходовали весь бюджет на рассуждения и не дали текстового ответа: Opus 5.5 работала 489 секунд и стоила $0,96, Opus 5 — 553 секунды и $1,20. При увеличении лимита до 128 000 токенов Opus 5 работала более 25 минут и также не ответила, а Opus 5.5 использовала 112 733 токена за 19 минут, после чего API завершил ответ с причиной остановки «refusal» без текста.

Автор предположил, что в последнем случае защитный фильтр Anthropic по ошибке пометил безвредный запрос: задача содержала только подсчёт вариантов расстановки работ. Верные значения для случаев с 6, 8 и 10 задачами составляют 27, 1 695 и 159 019 соответственно, однако в тесте модели не могли запускать код для полного перебора вариантов.

За все вызовы Opus 5.5 обработала вывод со скоростью 103,4 токена в секунду, а Opus 5 — 93,1 токена в секунду. Это примерно на 11% быстрее, тогда как Anthropic заявляла об ускорении более чем на 30%. Суммарно Opus 5.5 израсходовала 197 046 выходных токенов, работала 31 минуту 45 секунд и стоила $3,95; показатели Opus 5 составили 261 602 токена, 46 минут 49 секунд и $6,55.

Anthropic снизила API-тарифы для Opus 5.5 с $5 до $4 за миллион входных токенов и с $25 до $20 за миллион выходных токенов. По расчёту автора, это обеспечивает 20% экономии, а остальная разница зависит от меньшего числа токенов, которое использует модель. Для сложных задач он рекомендует задавать жёсткий лимит вывода и контролировать расходы, поскольку модель может долго рассуждать без результата.

Сергей
Автор: Сергей
Пишу о кибербезопасности и информационных технологиях на простом и понятном языке
Комментарии:

Как мы обрабатываем данные: политика обработки персональных данных