OpenAI выпустила GPT-5.6, которая «ломает» смартфоны и находит дыры в популярном софте

изображение: grok
OpenAI запустила закрытое тестирование линейки GPT-5.6, сделав упор на программирование, безопасность и научные задачи. Новые модели заметно прибавили в анализе уязвимостей и работе со сложным кодом, получив самую проработанную систему защитных механизмов за всю историю семейства GPT. Доступ пока открыт только проверенным партнёрам через API и платформу Codex.
Линейка состоит из трёх моделей с разным позиционированием:
- GPT-5.6 Sol — флагман для самых ресурсоёмких задач, где нужна максимальная глубина анализа;
- GPT-5.6 Terra — универсальный вариант, балансирующий между скоростью и производительностью;
- GPT-5.6 Luna — лёгкая версия для случаев, когда критична скорость отклика и низкая стоимость токенов;
- все три модели доступны через единый API без изменения интерфейса разработчика.
Развёртывание идёт в связке с правительством США. Когда закрытый этап завершится, доступ откроют пользователям ChatGPT, Codex и API — это произойдёт в ближайшие недели.
Разработчики усилили барьер против опасных запросов в области кибербезопасности и биологических исследований, расширили выявление повторяющихся попыток злоупотреблений и прогнали модели через многонедельное стресс-тестирование с реалистичными атакующими сценариями. Внутри компании говорят о пересборке всего защитного контура.
Стоит обратить внимание, что разработчики отказались от единой системы фильтрации в пользу многоуровневой архитектуры контроля, где каждый слой решает свою задачу независимо от остальных.
Главные изменения достались GPT-5.6 Sol, которая получила прокачку агентного выполнения задач. Модель эффективнее тянет длительные рабочие процессы при написании кода, разборе биологических данных и исследовании вопросов безопасности. Одновременно OpenAI опубликовала развёрнутую системную карту, где раскрыла возможности модели, методы тестирования, найденные риски, реализованные механизмы защиты и ограничения, сохраняющиеся на текущем этапе.
Среди технических новинок выделяются режимы max reasoning и ultra reasoning. Они дают модели использовать внутренних субагентов для распределения сложных задач между несколькими логическими цепочками, ускоряя продолжительные вычисления и повышая отдачу от каждого запроса.
В программировании GPT-5.6 Sol заняла первое место в тесте Terminal-Bench 2.1, где оцениваются:
- способность планировать последовательность действий в командной строке;
- умение переключаться между разными инструментами в рамках одной задачи;
- корректировка стратегии по мере выполнения операций;
- восстановление после ошибок без вмешательства пользователя;
- работа с длинными цепочками зависимых команд.
В биологических исследованиях модель тоже показала более высокую отдачу, сократив расход токенов при выполнении типовых рабочих процессов. По данным OpenAI, GPT-5.6 заметно продвинулась в продолжительных задачах поиска уязвимостей, разборе программного обеспечения и исследовании потенциальных способов эксплуатации найденных ошибок.
Отмечается, что вместе с ростом наступательных возможностей модели разработчики синхронно усиливали защитный контур, чтобы новые навыки не превратились в инструмент для злоумышленников.
Модель обучалась распознавать попытки выудить запрещённую помощь в кибербезе и биологии даже тогда, когда пользователь маскирует истинную цель запроса. Каждый ответ анализируется прямо во время генерации, а самые рискованные обращения могут временно задерживаться для проверки более продвинутой системой контроля. Отдельные механизмы отслеживают активность учётных записей, отделяя легитимные исследования безопасности от потенциально вредного применения.
В OpenAI признают, что на этапе закрытого тестирования часть законных запросов может выполняться с задержкой или временно блокироваться, пока защитные алгоритмы продолжают доучиваться. Компания также рассказала о совместной работе с корпоративными заказчиками над дополнительными контурами безопасности. Среди направлений названы:
- технологии обнаружения угроз с сохранением конфиденциальности данных;
- настраиваемые заказчиком механизмы безопасности под конкретные регламенты;
- адаптация уровня доступа в зависимости от риска пользователя или рабочей нагрузки;
- инструменты аудита запросов для служб информационной безопасности компаний-клиентов.
Большое внимание разработчики уделили внутренней проверке самой модели. Для поиска слабых мест OpenAI использовала автоматизированное Red Team-тестирование, что позволило кратно расширить число проверяемых сценариев по сравнению с ручной работой, быстрее ловить повторяющиеся ошибки и сокращать сроки устранения найденных проблем. Дополнили автоматику классическим тестированием с независимыми специалистами — внешние эксперты искали обходные пути и нестандартные атаки, которые алгоритмы могли пропустить.
Свою оценку модели провела лаборатория Irregular, специализирующаяся на безопасности искусственного интеллекта. По итогам испытаний GPT-5.6 Sol показала небольшое, но устойчивое преимущество перед GPT-5.5 при выполнении продолжительных задач в области информационной безопасности. Во время тестирования модель нашла ранее неизвестные уязвимости в популярном ПО и мобильных устройствах. При этом специалисты Irregular фиксируют — GPT-5.6 по-прежнему буксует при работе с хорошо защищёнными системами и не способна самостоятельно проводить полноценные многоэтапные атаки без участия человека.
Ранее сообщалось, что ChatGPT впервые опустился ниже отметки в 50% мирового рынка ИИ-ассистентов. Согласно отчёту AI Report 2026 аналитической компании Sensor Tower, на который ссылается TechCrunch, по итогам мая 2026 года доля сервиса OpenAI составила 46,4%. Ещё в январе ChatGPT контролировал более половины глобального рынка, однако усилившаяся конкуренция привела к заметному сокращению его доли.
Эксперты редакции CISOCLUB уточнили, что выход GPT-5.6 обозначает новую развилку для индустрии — модели стали ощутимо полезнее для наступательного анализа, и игнорировать этот факт корпоративным службам защиты уже не получится. Многоуровневый контур фильтрации запросов выглядит разумным шагом, но реальную устойчивость системы покажет только массовое применение, когда за модель возьмутся злоумышленники с серьёзными ресурсами. Способность находить ранее неизвестные уязвимости в популярном ПО — звонок для разработчиков защитных продуктов, которым придётся ускорять выпуск патчей и пересматривать процессы реагирования.
Сотрудничество OpenAI с правительством США тоже даёт повод задуматься о будущем регулировании языковых моделей с расширенными техническими возможностями. Российским специалистам по защите данных стоит закладывать в модели угроз появление подобных инструментов у атакующих и пересматривать подходы к мониторингу периметра. Гонка между наступательным и оборонительным применением больших языковых моделей только разгоняется.



