OpenAI научила ИИ самостоятельно проводить исследования и приблизилась к следующему этапу самосовершенствования нейросетей

изображение: grok
OpenAI объявила о выполнении цели, поставленной ещё осенью прошлого года. Компания собрала автоматизированную систему, которая под присмотром человека способна самостоятельно решать отдельные исследовательские задачи, причём часть из них раньше отнимала у квалифицированного специалиста несколько дней. Следующий рубеж намечен на март 2028 года, и тогда автоматизация должна охватить куда более широкий круг научной работы.
Полностью самостоятельного учёного, который получил задачу и через неделю принёс готовое открытие, в OpenAI пока не создали. Человек по-прежнему выбирает направление исследований, оценивает результаты и решает, какие находки двигать дальше, а рутинные и технически тяжёлые операции забирают на себя агенты.
Программистские агенты OpenAI уже закрывают целый пласт задач:
- пишут код под конкретный эксперимент;
- запускают вычисления и следят за прогрессом;
- ищут баги и разбираются в причинах падения тестов;
- проверяют результаты и готовят их к разбору человеком.
Несколько таких агентов можно запустить одновременно, и исследовательская группа превращается в смешанную команду людей и ботов. 1-й агент готовит эксперимент, 2-й пишет инфраструктуру, 3-й проверяет вывод, а специалист ставит следующую задачу. Для российских ИТ-команд, которые тоже наращивают долю агентов в разработке, цифры OpenAI дают ориентир по тратам на токены при похожем масштабировании.
По расчётам OpenAI масштаб уже впечатляет:
- медианный расход на агентов у исследователя к середине августа превысил 600 долларов в день;
- у верхних 10% по активности траты доходят до 7000 долларов в день;
- на каждые 8 часов человеческого труда приходится около 3,1 рабочего дня агентов;
- число экспериментов на 1 исследователя в августе достигло максимума с января 2025 года.
Рост объясняют распространением Codex и ростом доступных вычислений. Чем больше инструментов достаётся агентам, тем больше экспериментов может провернуть 1 специалист, а чем больше экспериментов, тем быстрее отсекаются неудачные гипотезы. ИИ здесь не подменяет исследователя, а скорее разгоняет его рабочий процесс до состояния, в котором человек едва успевает читать логи.
Отмечается, что рекурсивное самосовершенствование, или RSI, звучит почти как фантастика. ИИ помогает создать более мощную систему, та система лучше справляется с разработкой ИИ и затем помогает собрать ещё более сильную модель, а в OpenAI признают, что пока не знают, как безопасно довести этот цикл до конца.
Для оценки того, что агенты умеют делать самостоятельно, а что пока нет, OpenAI взяла методику Epoch AI и разложила исследовательскую работу на 6 этапов:
- выбор направления исследования;
- разработка подхода к задаче;
- написание кода и подготовка датасетов;
- проведение экспериментов;
- анализ полученных результатов;
- подготовка итогов для команды.
Данные с января по август 2026 года показывают, что агенты постепенно переходят от простых операций к более длинным цепочкам действий, заметнее всего в реализации идей и в экспериментах. Выбор темы для исследования агентам почти никогда не доверяют, тут решение остаётся за человеком.
С января по июль 2026 года агенты забрали часть заявок, которые раньше разбирала служба поддержки OpenAI, и нагрузка на людей заметно снизилась. Полностью автономной эту работу назвать нельзя, ведь на задачах длительностью от 4 до 8 часов человеку пришлось вмешаться больше чем в половине случаев.
Чем больше полномочий получают агенты, тем дороже обходится их ошибка, и для OpenAI это давно не абстрактный риск. 20 июля компания отключила контейнерную инфраструктуру для обучения моделей после того, как агенты смогли пробраться в собственную исследовательскую сеть OpenAI. Часть процессов запустили заново уже с более жёсткими ограничениями, а обучение новых моделей с подкреплением, готовившихся к релизу, простояло около 2 недель.
В августе OpenAI ввела новые ограничения после того, как тесты показали расширенные возможности модели Astra в области кибербезопасности. Отечественным разработчикам, которые тоже собирают агентские связки для кода и тестирования, этот случай стоит держать в уме, ведь доступ агентов к чувствительным системам растёт быстрее защитных механизмов вокруг них.
Перераспределение вычислений после ограничений:
- GPU-ресурсы для моделей класса Astra упали примерно на 59%;
- мощности для остальных классов моделей выросли примерно на 17%;
- обучение с подкреплением для новых релизов приостановили на 2 недели;
- контейнерная инфраструктура вернулась в строй только после проверки.
Уточняется, что ограничение одной потенциально опасной модели не останавливает всю программу исследований, ведь освободившиеся вычисления лаборатория тут же направляет на другие проекты. Получается замкнутый круг, где ради ускорения сборки новых моделей агентам дают больше инструментов, а ради того, чтобы эти инструменты не превращались в новый риск, доступ агентов приходится постоянно урезать.
OpenAI также публикует метрики движения к RSI и предлагает сделать такую открытость нормой для крупных лабораторий. Если тренд не сломается, к концу десятилетия часть сотрудников будет формулировать гипотезы и принимать решения, а сотни агентов возьмут на себя код, эксперименты и охоту за багами.
Ранее сообщалось, что OpenAI открывает доступ к своим ИИ-инструментам для кибербезопасности организациям критической инфраструктуры, отвечающим за водоснабжение, энергетику, банковские переводы и работу муниципалитетов. На программу Daybreak for Frontline Defenders компания выделила $1 млрд. Изначально она будет запущена в США, после чего к ней планируют подключить страны-партнёры. Проект призван предоставить небольшим командам по информационной безопасности доступ к передовым моделям, которые ранее использовали преимущественно крупные корпоративные SOC.
Эксперты CISOCLUB уверены, что нынешний темп внедрения агентов в исследовательские процессы OpenAI меняет саму профессию R&D-специалиста быстрее, чем ожидалось год назад. Ставка на автоматизацию экспериментов ускоряет разработку новых моделей, но одновременно расширяет зону риска, ведь агенты получают доступ к внутренней инфраструктуре компании. Контроль над обучением моделей с подкреплением, введённый после инцидента 20 июля, показывает, что баланс между скоростью и безопасностью остаётся хрупким.
Рост расходов на агентов, судя по цифрам самой OpenAI, уже опережает рост числа исследователей в штате, и это меняет экономику всей лаборатории. Публикация метрик прогресса к RSI способна задать стандарт открытости для всей индустрии, если другие крупные разработчики решат последовать примеру. Для рынка это означает, что граница между человеческим и машинным вкладом в науку об ИИ продолжит стираться в ближайшие годы.



