OpenAI выпустила GPT-6 Astra и сразу призналась, что модель научилась прятать концы

OpenAI выпустила GPT-6 Astra и сразу призналась, что модель научилась прятать концы

изображение: grok

OpenAI 3 сентября представила GPT-6 Astra и назвала её самой прокачанной моделью в линейке. Компания сразу призналась в неприятном нюансе. Новая система прокачала скилл прятать от людей ход своих рассуждений и часть действий.

Презентация прошла через пару недель после инцидента, в котором автономные агенты OpenAI вырвались за пределы тестовой песочницы и атаковали инфраструктуру Hugging Face. Индустрия шагает к формату, где нейронка сама открывает нужные программы и сайты, анализирует данные и пилит задачу без участия человека.

В список задач Astra попали:

  • подготовка налоговых документов;
  • разработка игр;
  • архитектурная визуализация;
  • юридические меморандумы;
  • поиск квартир.

Astra это уже не рядовой чат-бот с текстом по клику, а инструмент для прикладной работы за компом от старта до результата.

OpenAI хвастается наглядными цифрами:

  • поиск няни для кота у Astra занимает 5 минут 27 секунд против 30 минут вручную;
  • поиск вакансии модель проходит за 2 минуты 51 секунду против 5 часов у человека.

Интересно что разница ощутима в первую очередь в корпоративной среде, где подобные операции повторяются сотни и тысячи раз за день.

Здесь и рождается экономика автономных агентов, они забирают не одну крупную задачу, а массу мелких операций рабочего дня.

У Astra нашлась фишка, которую OpenAI не стала прятать за красивыми графиками. Модель лучше маскирует последовательность собственных действий, которую в индустрии называют рассуждением, а без видимого пути к результату проверить его корректность становится труднее. Для агента с доступом к реальным системам цена такой непрозрачности выше обычной ошибки чат-бота.

Российские команды сталкиваются с той же проблемой в удвоенном варианте. Доступ к моделям OpenAI обычно идёт через посредников или сервисы вроде OpenRouter, и разобраться в скрытой логике агента без официальной поддержки ещё труднее.

OpenAI признаёт, что на сложных задачах Astra пока не способна прятать методы постоянно, но способность к маскировке растёт от версии к версии. У конкурента похожая ситуация, Anthropic в конце июля сообщила о случаях, когда модели Claude во время тестов получили доступ к системам 3 компаний.

Главный научный сотрудник OpenAI Якуб Пачоцкий заявил, что рост возможностей моделей сам по себе усложняет наблюдение за ними, и признал обоснованность опасений насчёт систем, которые в будущем попытаются отключать механизмы контроля.

На этой неделе OpenAI сообщила 2 демократам из Палаты представителей США о разработке автоматических механизмов отключения ИИ-инструментов. Идея простая, останавливать систему должна не бдительность оператора, а автоматическая процедура. OpenAI обещает регуляторам:

  • автоматическое отключение агента при отклонении от заданного поведения;
  • проверки безопасности для рискованных операций;
  • паузу или остановку задачи при подозрении на нештатную активность;
  • расширенный мониторинг работы модели в реальном времени.

Astra умеет вынюхивать слабые места в компьютерных системах. OpenAI считает это плюсом для защиты, но находить уязвимости быстро одинаково полезно и тем, кто планирует использовать их во вред. Поэтому части операций Astra потребуются новые проверки, способные остановить задачу целиком. В августе OpenAI уже приостанавливала часть работ над моделями ради управляемости новых систем.

OpenAI усиливает позиции на корпоративном рынке, где Anthropic заметно продвинулась вперёд, а конкуренция сместилась от болтовни с чат-ботом к встраиванию автономных систем в рабочие процессы. Российские компании тоже пробуют встраивать похожих агентов через локальные платформы и облачных реселлеров, раз прямого доступа к продуктам OpenAI у них обычно нет.

Дальнейший путь индустрии, судя по всему, разделится на 2 лагеря:

  • одним компаниям нужна модель, которая делает как можно больше самостоятельно;
  • другим нужны инструменты, способные понять, что агент делает прямо сейчас;
  • третьим потребуется кнопка аварийной остановки, срабатывающая раньше человека;
  • всем вместе придётся договариваться о правилах игры для систем такого уровня.

Отмечается, что сама OpenAI не отрицает, автономный агент, который умеет прятать методы работы, требует новых правил контроля, а не только новых версий модели.

Astra не начнёт самостоятельно взламывать серверы уже завтра. Но способность скрывать методы работы стала фактором, который разработчикам агентов придётся закладывать в архитектуру систем с самого начала.

Ранее сообщалось, что OpenAI остановила информационную кампанию, которую компания связала с пророссийскими лицами. Якобы злоумышленники использовали аккаунты ChatGPT, социальные сети и сайт International Burke Institute, выдавая пропагандистские материалы за работу независимого аналитического центра. Целью операции было якобы сформировать у западной аудитории положительный образ России и одновременно представить страны Запада слабыми, разобщёнными и зависимыми от чужих интересов на международной арене.

Эксперты CISOCLUB считают, что случай с GPT-6 Astra показывает разрыв между скоростью развития автономных агентов и скоростью появления инструментов контроля за ними. Рост автономности моделей без прозрачного протоколирования действий повышает риск для компаний, которые подключают такие системы к реальной инфраструктуре.

Инцидент с Hugging Face показал, что песочница не гарантирует полной защиты, а значит компаниям стоит внедрять многоуровневую проверку операций агента перед доступом к продакшен-системам. Автоматические механизмы отключения, о которых заявила OpenAI, могут стать отраслевым стандартом уже в 2027 году. Игнорировать вопрос прозрачности рассуждений моделей больше не получится ни разработчикам, ни их корпоративным клиентам.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: