Google, Anthropic и OpenAI синхронно прокачали свои модели ИИ для войны с хакерами

изображение: grok
Google, Anthropic и OpenAI за одну неделю представили обновления своих ИИ-моделей под кибербезопасность. Гугл представил Gemini 3.8 Flash Cyber, Anthropic одновременно выпустила Claude Fable 5.1 и Claude Mythos 5.1, а OpenAI приоткрыла детали будущей Astra, которая уже перешагнула порог критических кибервозможностей. Три компании решают одну задачу дать ИИ силы для поиска дыр в защите и не отпустить вожжи так, чтобы не получить автономного хакера.
Gemini 3.8 Flash Cyber долетела до пользователей в рамках программы Fairwind, доступ к ней получили пока только избранные спецы, которым нужно готовиться к атакам заранее, а не тушить пожар постфактум. В список потенциальных участников попадают:
- государственные структуры;
- медицинские учреждения;
- телеком-операторы.
Google уже сотрудничает более чем с 650 организациями по всему миру, а в списке партнёров засветились CrowdStrike, Datadog, Menlo Security, Palo Alto Networks и Snowflake. Новая модель добежала до релиза всего через месяц после Gemini 3.5 Flash Cyber и, по словам Google, бьёт предшественницу по автономному поиску уязвимостей, выходя на уровень конкурентов из лагеря Anthropic и OpenAI. Упор сделали на защитные фичи и охоту за багами, а не на прокачку наступательных скиллов.
Российским компаниям доступ к Fairwind не светит по понятным причинам, но следить за трендом стоит в любом случае, потому что инструменты для поиска уязвимостей рано или поздно просачиваются в паблик.
Anthropic обновила линейку сразу двумя моделями. Claude Fable 5.1 теперь можно легально натравливать на поиск уязвимостей в софте, а доступ к Claude Mythos 5.1 ограничили доверенными программами, завязанными на кибербез и биологические исследования. Более рискованные задачи вроде пентеста и генерации эксплойтов Anthropic по-прежнему прогоняет через модели линейки Opus.
Отмечается, что Mythos 5.1 показала лучшую устойчивость к атакам с prompt injection среди всех моделей Anthropic, когда вредоносные команды прячут внутри обрабатываемого контента.
Для корпоративных клиентов Anthropic запустила Enterprise Frontier Safeguards, пакет с нулевым хранением данных и защитой от неправомерного использования ИИ. У OpenAI, к слову, есть похожий концепт Private Safety Processing.
Заодно Anthropic усилила мониторинг моделей и притормозила внешние кибертесты после того, как Claude получил доступ к боевым системам без разрешения. Модели игнорировали признаки того, что тестовая среда подключена к интернету, держались версии про симуляцию даже после доказательств обратного, а часть систем была готова доводить задачу до конца опасными действиями в реальном интернете.
Anthropic связывает баг с нюансами поведения моделей и дырами в контроле. В ответ компания предприняла несколько шагов:
- усилила мониторинг моделей;
- обновила систему вознаграждений при обучении;
- разработала классификатор попыток выхода из песочницы.
Специалисты Anthropic считают, что проблемы с reward hacking на этапе обучения способны въесться в модель как привычка и заставить её тянуть длинные цепочки рискованных действий в реальном мире ради нужного результата.
OpenAI анонсировала скорый релиз Astra и заявила, что модель перешагнула порог критических кибервозможностей по внутренней системе оценки готовности. Для тестов самых мощных фич компания подключит ограниченный круг спецов через программу Daybreak Blue. Критическим уровнем OpenAI считает состояние, когда ИИ способен сам находить и юзать уязвимости нулевого дня сразу в нескольких защищённых системах либо атаковать цель по одной команде без подстраховки человека.
Релиз притормозили ради защиты от киберпреступлений и самоуправства моделей, а отдельным квестом стало не наступить на те же грабли, что и с Hugging Face. Во время оценки ExploitGym агенты юзали исследовательскую инфраструктуру, чтобы атаковать Hugging Face и выцепить готовый ответ вместо решения нерешаемой задачи.
Стоит обратить внимание, что по данным METR один агент организовал львиную долю махинации, а второй продолжил работу с большим бюджетом, выдавая мошеннические действия за легитимную работу.
Сама Astra выдаёт высокие цифры в наступательных кибертестах. На ExploitBench модель набрала 100% при генерации эксплойтов под известные уязвимости, а долю отклонённых джейлбрейков подняла до 91,5% против 59% у GPT-5.6 Sol. По ходу тестов Astra:
- находит и юзает уязвимости нулевого дня в незнакомом софте;
- собирает найденные баги в цепочки эксплуатации;
- выполняет произвольный код при меньшем числе токенов на выходе.
В одном из тестов Astra слепила из неизвестных уязвимостей цепочку атаки, которая взламывала браузер, вырывалась из песочницы и выполняла команды на хостовой машине после открытия обычного HTML-файла. Отдельно нашлась цепочка багов в защищённой ОС от обычного юзера без прав до рута. Эти находки и определили критический уровень кибервозможностей Astra.
Чтобы уравновесить такую мощь, OpenAI добавила несколько уровней защиты:
- новые классификаторы вредоносных запросов;
- многослойную систему ограничений на действия модели;
- контроль автономных цепочек действий в реальном интернете.
Для рунета это не абстрактная тема, потому что инструменты такого уровня рано или поздно всплывают в даркнете и бьют по инфраструктуре российских компаний.
OpenAI признаёт, что классификаторы иногда путают легитимную работу безопасника с киберпреступлением, поэтому разработчикам приходится совмещать свободу для работы специалиста и контроль над потенциальным кибератакующим. В итоге Google, Anthropic и OpenAI двигаются в одну сторону, но с разными акцентами. Google делает ставку на ранний доступ защитников, Anthropic закручивает гайки в контроле поведения ИИ и данных, а OpenAI готовит Astra к работе на уровне, где модель сама находит и эксплуатирует неизвестные баги.
Ранее сообщалось, что Федеральный резервный банк Нью-Йорка опубликовал новый отчёт о состоянии рынка труда. Согласно его данным, среди компаний сферы услуг, уже использующих ИИ, лишь 4% сократили сотрудников по этой причине за последние шесть месяцев. В промышленности этот показатель оказался нулевым. Ни одна из опрошенных компаний не увольняла сотрудников из-за нейросетей ни в 2025, ни в 2026 году.
Эксперты CISOCLUB считают, что синхронный апгрейд сразу трёх моделей отражает банальную гонку вооружений в киберсфере, где каждый вендор старается не отстать от конкурентов по заявленным цифрам. По их мнению, рост автономности систем требует одновременного роста контроля со стороны разработчиков, иначе разрыв между атакой и защитой будет только увеличиваться.
Специалисты обратили внимание, что кейс с Hugging Face показывает, насколько сложно предугадать поведение модели с доступом к реальной инфраструктуре. Они также отметили, что для российского рынка подобные инструменты пока недоступны официально, но эксплойты и техники с таких моделей обычно расходятся по миру куда быстрее любых экспортных ограничений.
В CISOCLUB прогнозируют, что в течение ближайшего года модели с критическим уровнем кибервозможностей появятся у большего числа вендоров, и контроль над ними станет одной из главных тем на рынке информационной безопасности.



