OpenAI готовит систему контроля ИИ, которая ищет злоупотребления без чтения переписки клиентов

Изображение: Om siva Prakash (unsplash)
OpenAI начала предварительное тестирование Private Safety Processing — системы для выявления подозрительной активности вокруг ИИ, при которой сотрудники компании не получают доступа к содержимому запросов и ответов. Первые клиенты уже участвуют в испытаниях, а полноценный запуск и публикацию технического документа компания планирует на сентябрь.
Разработка рассчитана на организации, которым приходится одновременно решать две противоположные задачи — контролировать возможное злоупотребление ИИ и не отдавать поставщику модели содержимое конфиденциальных запросов.
OpenAI объясняет, что система способна искать признаки потенциально опасного поведения сразу в нескольких связанных взаимодействиях. Обычные защитные механизмы чаще оценивают каждый запрос отдельно, а новый вариант пытается увидеть общую последовательность действий и обнаружить цепочку, которая по отдельности может выглядеть безобидной.
Содержимое запросов и ответов при этом должно оставаться недоступным для сотрудников OpenAI. Автоматические механизмы анализируют активность и в случае обнаружения возможной проблемы отправляют клиенту ограниченный сигнал о характере риска, не раскрывая сами тексты взаимодействий.
Компания разрабатывает Private Safety Processing в том числе для клиентов API, использующих режим Zero Data Retention. При подобной конфигурации запросы и ответы после обработки не сохраняются. Отдельное исключение предусмотрено для изображений, которые система может классифицировать как потенциальные материалы сексуального насилия над детьми. Они могут удерживаться для ручной проверки и последующего сообщения о нарушении.
Есть несколько вариантов размещения данных.
- в конфигурациях с Zero Data Retention информация остаётся внутри инфраструктуры, которую контролирует заказчик;
- готовится альтернатива, при которой сведения будут находиться на инфраструктуре самой OpenAI, но защищаться шифрованием с ключами под контролем клиента;
- в обоих вариантах автоматические системы смогут искать возможные нарушения и формировать ограниченные сигналы безопасности;
- сами запросы и ответы не должны становиться доступными сотрудникам OpenAI ради проведения проверки.
Самое любопытное начинается там, где касаются нескольких взаимодействий подряд. Отдельный запрос может выглядеть совершенно нормально, следующий тоже не вызывает вопросов, а последовательность действий уже способна указывать на попытку обойти ограничения, подготовить вредоносную операцию или использовать модель не по назначению. Private Safety Processing должна замечать подобные связи.
Когда система фиксирует потенциальную проблему, клиент получает определённый сигнал с указанием категории активности. Организация может использовать его для принятия собственных решений о дальнейших действиях и ограничения доступа. Если срабатывание оказалось ошибочным, заказчик сможет предоставить OpenAI необходимые сведения для обжалования решения или объяснения законной активности.
Среди ранних участников программы OpenAI называет Abridge, работающую с медицинскими данными. CISO компании Зак Пауэрс отметил, что для здравоохранения сохранность, точность и целостность информации критичны, поскольку от этого зависит доверие врачей и пациентов.
Пока идёт предварительный этап тестирования. Компания постепенно подключает первых заказчиков, собирает обратную связь и дорабатывает технологию. Более подробное описание архитектуры OpenAI обещает опубликовать в сентябре вместе с техническим документом.
В итоге получается непривычная модель контроля. ИИ должен следить за тем, не используется ли другой ИИ подозрительным образом, но при этом поставщик модели старается не получать возможность читать пользовательскую переписку.
Ранее сообщалось, что OpenAI в конце июля 2026 года распустила подразделение Preparedness, занимавшееся оценкой наиболее серьезных рисков, связанных с развитием и применением нейросетей. Команда анализировала ситуации, при которых модели могли вести себя непредсказуемо или вопреки намерениям разработчиков, а также оценивала их способность создавать потенциально катастрофические угрозы.



