OpenAI выпустила GPT-5.5 и усилила позиции, но Claude пока впереди в программировании

OpenAI выпустила GPT-5.5 и усилила позиции, но Claude пока впереди в программировании

Изображение: Zulfugar Karimov (unslash)

OpenAI показала модель GPT-5.5, назвав её своей самой продвинутой разработкой с упором на автоматизацию рутины и уверенной работой с кодом. Несмотря на рывок по многим метрикам, в задачах программирования новинка по-прежнему проигрывает Claude Opus 4.7. Компания сфокусировалась на реальных рабочих процессах, а не на эффектных демонстрациях.

Новая версия быстрее схватывает суть запроса, самостоятельно проходит промежуточные шаги и доводит работу до завершения без постоянных подсказок от пользователя. Охват широкий: от написания кода до анализа данных, обработки документов, таблиц и связки с внешними сервисами. В OpenAI уточняют, что скорость обработки осталась прежней, а расход токенов при работе с кодом даже снизился.

Во внутренних замерах компания показывает ощутимый прирост. На Terminal-Bench 2.0 модель выбила 82,7 процента против прежних 75,1. В GDPval цифра поднялась с 83,0 до 84,9, в OSWorld-Verified с 75,0 до 78,7, а в CyberGym с 79,0 до 81,8. Рост виден и в научных бенчмарках, где GeneBench вырос с 19,0 до 25,0 процента, а BixBench подтянулся с 74,0 до 80,5. Сама OpenAI оговаривается, что часть замеров выполнена у них внутри, поэтому прямым сравнением с конкурентами эти цифры считать не стоит.

Дальше начинается самое занятное. Публичный тест SWE-Bench Pro ставит GPT-5.5 на отметку 58,6 процента, тогда как Claude Opus 4.7 забирает 64,3 процента. Значит, в программистских задачах пальма первенства осталась у конкурента, даже с учётом общего прогресса OpenAI.

Автономность стала главным вектором развития для новой модели. GPT-5.5 подают как систему, способную разбирать огромные кодовые базы, вылавливать сложные баги и подтягивать исследовательские задачи. В пресс-материалах упомянуты кейсы с разбором биологических данных и даже помощь в поиске математических доказательств вокруг чисел Рамсея. Правда, большинство подобных историй идёт от самой OpenAI и её партнёров с ранним доступом, а не от независимых экспертов.

Вопросам защиты в компании уделили отдельное место. По словам разработчиков, для GPT-5.5 собран самый жёсткий набор предохранителей среди всей их линейки. Перед релизом прошли внутренние и внешние аудиты, добавилась проверка по направлениям киберугроз и биорисков, а обратную связь собрали у почти 200 партнёров.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: