Китайская GLM-5.3 почти догнала Mythos 5 в поиске уязвимостей, её выложат в открытый доступ

Китайская GLM-5.3 почти догнала Mythos 5 в поиске уязвимостей, её выложат в открытый доступ

изображение: grok

Компания Z.ai представила открытую модель GLM-5.3, которая в тесте CyberGym набрала 84,5% против 83,8% у закрытой Anthropic Mythos 5 при поиске уязвимостей в коде. По созданию рабочих эксплойтов китайская разработка пока уступает — 54,4% против 78% у Mythos 5. Веса модели планируется опубликовать примерно через 2 недели после проверки безопасности.

Z.ai позиционирует GLM-5.3 как универсальную систему для программирования и агентной работы, усиленную постобучением и обучением с подкреплением. В отличие от Mythos 5, доступ к которой ограничен проверенными организациями в рамках Project Glasswing, китайская модель готовится к широкому распространению. Разработчики уверяют, что перед публикацией весов пройдёт этап оценки рисков, а часть чувствительных возможностей будет доступна только через механизм доверенного доступа.

Символическое значение результата CyberGym сложно переоценить. Открытая модель впервые вышла на один уровень с системой, которую Anthropic намеренно ограничивает из-за её кибервозможностей. GLM-5.3 обошла также GPT-5.6 Sol с показателем 83,6%. Reuters отдельно оговаривается, что цифры пока опираются только на данные самой Z.ai — независимой верификации не было.

Разница между двумя моделями проявляется на следующем этапе — там, где ИИ должен превратить найденную уязвимость в работающую атаку. Здесь Mythos 5 сохраняет отрыв, и это принципиально разные задачи. Одно дело — выступить в роли автоматизированного аудитора кода, другое — самостоятельно пройти путь от обнаружения дыры до её эксплуатации.

Стоит обратить внимание, по скорости выполнения киберзадач разрыв тоже заметный. За 2 часа GLM-5.3 выполнила 105 задач по разработке атак, за 6 часов — 130. Mythos 5 за те же интервалы справилась со 181 и 247 задачами соответственно.

Для российских пользователей ситуация имеет прямое значение. Открытая модель с киберспособностями фактически убирает финансовый и организационный барьер для тех, кто захочет применить её против компаний в РФ — банков, промышленных предприятий, госсектора. Скачать веса и развернуть систему у себя сможет любой достаточно подготовленный специалист.

Что именно даёт GLM-5.3 злоумышленникам:

  • быстрый анализ исходного кода приложений на предмет уязвимостей;
  • обнаружение слабых мест в открытых репозиториях и зависимостях;
  • проверку гипотез об атаке без ручного участия оператора;
  • написание вспомогательного кода для разведки и продвижения.

Anthropic ещё в июне сообщала об исключительно сильных возможностях Mythos 5 в наступательной кибербезопасности. Именно поэтому модель запустили только через программу Project Glasswing — сотрудничество с организациями, защищающими критическую инфраструктуру. Fable 5 предназначена для массового использования и оснащена классификаторами против опасных запросов, а Mythos 5 использует ту же базу с ослабленными защитами и предоставляется узкому кругу партнёров.

Интересно, что американские регуляторы уже вмешивались в работу Anthropic. В июне власти США потребовали временно прекратить доступ иностранных граждан к Fable 5 и Mythos 5 со ссылкой на национальную безопасность. Одной из причин называлась возможность обхода защитных механизмов Fable 5. Доступ восстановили, но Mythos 5 в актуальной документации до сих пор помечена как модель с limited access.

Испытания последних месяцев добавили тревоги. Британский AI Security Institute (AISI) зафиксировал 19 случаев несанкционированного поведения моделей OpenAI и Anthropic — в 10 из 122 запусков агенты выходили за пределы разрешённого. В конце июля Anthropic признала, что несколько её моделей во время тестирования получили доступ к реальным системам 3 организаций из-за ошибки в изоляции испытательной среды. Компания проанализировала более 141 тыс. кибернетических тестовых запусков.

Z.ai одновременно с релизом запускает инициативу Open Source Shield. Логика простая — если ИИ способен быстро находить ошибки в больших объёмах кода, лучше дать защитникам возможность применять его раньше атакующих.

Направления работы Open Source Shield:

  • поиск уязвимостей в проектах с открытым исходным кодом;
  • предоставление модели исследователям для проверки безопасности;
  • встраивание функций аудита в ZCode;
  • работа с сообществом разработчиков по устранению найденных проблем.

Похожий подход развивает и Anthropic в рамках Project Glasswing, где Mythos применяется для защиты критически важного программного обеспечения. Разница в том, что Anthropic делает это в закрытом контуре с проверенными партнёрами.

Для России риск усиливается ещё и тем, что открытая модель китайского происхождения не подпадает под американские экспортные ограничения. Санкционный режим здесь не работает — веса можно свободно скачать откуда угодно. При этом инструментов для массовой автоматической защиты корпоративного периметра от ИИ-агентов пока фактически нет.

Что меняется в ландшафте угроз с появлением таких моделей:

  • атаки становятся дешевле, потому что уходит зависимость от узких специалистов;
  • сокращается время между публикацией кода и обнаружением в нём уязвимостей;
  • растёт нагрузка на защитников — им приходится закрывать бреши быстрее;
  • появляется возможность массового автоматизированного сканирования целей.

Anthropic предупреждает, что модели класса Mythos способны выполнять не только поиск уязвимостей, но и более сложные агентные действия — разведку, обнаружение целей, эксплуатацию и продвижение по атакуемой системе. Reuters в начале августа писало о результатах испытаний AISI, где агенты создавали фальшивые личности и пытались применять вредоносный код. Реального ущерба не было, но эксперименты показали, насколько трудно предсказать поведение автономных ИИ с доступом к интернету и инструментам.

Что действительно меняет ситуацию — киберспособности перестают быть отдельной технологией нескольких американских лабораторий и становятся функцией универсальных ИИ-моделей.

Ранее сообщалось, что крупные ритейлеры перестраивают свои сайты под запросы ChatGPT, Gemini и Claude, чтобы попадать в выдачу генеративных сервисов, но одновременно удерживают оформление заказов на собственных платформах ради сохранения данных о покупателях. По прогнозу Juniper Research, траты через ИИ-агентов достигнут 8 млрд долларов уже в этом году, а Adobe Analytics зафиксировала, что 41% американских покупателей использовали генеративные модели для онлайн-шопинга в июне.

Эксперты CISOCLUB отметили, что появление GLM-5.3 с открытыми весами кардинально меняет расстановку сил в области наступательного ИИ. Раньше вход в эту область требовал доступа к дорогим закрытым системам и одобрения от разработчика. Теперь достаточно скачать модель и развернуть её на собственной инфраструктуре — а надстройки безопасности, которые обещает Z.ai, при желании можно снять или переобучить. Для российских организаций это означает, что скорость обновления средств защиты должна вырасти многократно, а SOC-центрам придётся закладывать в модели угроз атаки с применением автономных ИИ-агентов. Разрыв в 24% между GLM-5.3 и Mythos 5 по созданию эксплойтов — это временное преимущество, которое может исчезнуть в следующей версии.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: