Claude Sonnet 5.5 оказалась дешевле Opus 5.5 в тестах программирования

Claude Sonnet 5.5 оказалась дешевле Opus 5.5 в тестах программирования

Изображение: OpenAI

Claude Sonnet 5.5 обошлась примерно на 36% дешевле Opus 5.5 в тестах программирования The New Stack с учётом повторных попыток. Sonnet справилась во всех 15 запусках, Opus — в 13.

Автор сравнил модели через API Anthropic с одинаковыми запросами, адаптивным режимом рассуждений и максимальной глубиной анализа. Каждую задачу давали моделям по пять раз, а результаты проверяли тестами, которые модели не видели.

В задаче на исправление ошибок в Python-проекте Sonnet в четырёх из пяти первоначальных запусков исчерпала лимит в 32 тыс. токенов на один шаг и не закончила работу. После увеличения лимита до 128 тыс. повторные попытки прошли успешно. Обе модели исправили все четыре ошибки, но Opus закончила примерно на 35% быстрее. С учётом неудачных попыток один запуск Sonnet стоил в среднем около $0,98 против $0,75 у Opus.

В задаче на написание программы для разрешения зависимостей по заданной спецификации обе модели прошли все скрытые тесты во всех запусках. Sonnet справилась быстрее и дешевле.

Sonnet также устранила все три состояния гонки в очереди заданий на asyncio во всех пяти запусках. Opus в двух из пяти случаев исчерпала лимит токенов на рассуждения, так и не выдав ответа.

Независимые тесты Artificial Analysis дали иной результат: при максимальной глубине анализа задача обходилась Sonnet в $7,67, а Opus — в $5,98. Цена входных и выходных токенов Sonnet вдвое ниже, но больший расход токенов может свести эту экономию на нет.

Сергей
Автор: Сергей
Пишу о кибербезопасности и информационных технологиях на простом и понятном языке
Комментарии:

Как мы обрабатываем данные: политика обработки персональных данных