Claude Mythos нашёл тысячи уязвимостей, но люди проверили лишь малую часть

Изображение: Aerps.com (unsplash)
Anthropic прогнала экспериментальную Claude Mythos Preview по 281 опенсорсному проекту и получила 23 019 потенциальных уязвимостей. Из этого массива до сих пор разобрали только 1 900 находок, а в реальные фиксы превратились всего 97 штук. Цифры зафиксированы на 22 мая 2026 года, и разрыв между тем, что нашла модель, и тем, что успели проверить люди, получился настолько огромным, что впору говорить не про баг-хантинг, а про завал.
Из отправленных на проверку 1 900 находок разработчики подтвердили 1 451 проблему, а 88 случаев получили официальные security-адвайзори. Итоговый процент попаданий — 90,8%, что для автоматического сканера выглядит как читерский скилл. Но за бортом остаются 21 119 находок, которые вообще никто со стороны не трогал.
Компания Echo, которая собрала и опубликовала эти метрики, сразу осадила восторги. Отобранные для ревью 1 900 кейсов — не рандомная выборка, а, скорее всего, самые убедительные находки из всей кучи. То есть 90,8% отражает качество топовых результатов Mythos, а не всего массива в 23 тысячи штук.
Раскладка по цифрам:
- 281 опенсорсный проект попал под прогон Mythos;
- 23 019 потенциальных уязвимостей нашла модель;
- 1 900 находок успели разобрать люди;
- 1 451 проблему подтвердили сами разработчики;
- 97 фиксов реально доехали до продакшна.
Отмечается, что даже 90,8% точности не гарантирует такой же результат на оставшемся массиве — выборка для ревью явно была не случайной.
Рейтинг Critical от нейросети не всегда означает Critical
Из 88 опубликованных адвайзори 27 получили официальные CVE-номера. Сама Mythos раздала оценки жёстко — 8 Critical, 15 High, 4 Medium, ни одной Low. После независимого ревью расклад стал другим — 1 Critical, 16 High, 8 Medium и 2 Low. Из восьми находок с максимальным уровнем опасности подтвердилась ровно одна.
На Temporal Server Mythos поставила Critical и решила, что атакующий способен захватить рабочие процессы сразу в нескольких namespace. Разработчики Temporal оценили иначе — CVSS вышел на 2,3, категория Low, ведь для атаки нужен был уже захваченный неймспейс и привилегированный внутренний секрет.
С MinIO Mythos снова поставила Critical, независимая security-контора притормозила до High, а сами разработчики MinIO остановились на Medium — условие эксплуатации требовало уже имеющегося root-JWT-токена внутри кластера. MinIO и связки на его основе давно стоят в дата-центрах не только за рубежом — часть российских компаний, ушедших с западных сторадж-решений на опенсорс, гоняет его в проде прямо сейчас, так что такие баги касаются и их инфраструктуры напрямую.
Echo отметила, что оценка серьёзности от Mythos годится максимум для первичной сортировки, а не как финальный вердикт. Из 27 разобранных CVE в 14 случаях оценка модели разошлась с итогом — в 13 из них Mythos перегнула палку в сторону опасности, и лишь раз, с утилитой jq, наоборот, недооценила проблему.
Расклад по 27 разобранным CVE получился таким:
- Mythos насчитала 8 Critical, после ревью осталась 1;
- High выросла с 15 до 16;
- Medium увеличилась с 4 до 8;
- Low появилась впервые — сразу 2 случая вместо нуля.
От известного бага до рабочего эксплойта за 72% попыток
Anthropic взяла 50 известных уязвимостей в движке SpiderMonkey, который крутится внутри Firefox 147, и дала Mythos по пять попыток на каждую — итого 250 заходов. Модель довела дело до рабочего эксплойта с произвольным выполнением кода в 181 случае, это 72,4%. Ещё в 29 экспериментах получилось выбить частичный контроль над регистрами процессора.
Firefox по-прежнему стоит у немалой доли российских пользователей, в том числе у тех, кто принципиально держится подальше от Chromium-форков, так что скорость превращения бага в эксплойт касается и их браузера тоже.
Для сравнения Claude Opus 4.6 на том же тесте справилась всего с двумя случаями из 250, меньше 1%. Разница между поколениями примерно 90-кратная.
Уточняется, что 72,4% успешных эксплойтов получены в лабораторных условиях без песочницы браузера, а не в реальной боевой среде.
На известном use-after-free баге в ядре Linux Anthropic собрала рабочий root-эксплойт меньше чем за 2 000 долларов вычислений и уложилась меньше чем в сутки. По пути модель нашла вторую уязвимость use-after-free в планировщике traffic control и связала оба бага в одну цепочку.
У теста с эксплойтами сразу несколько условий, которые снижают градус хайпа:
- уязвимости были известны заранее, а не найдены с нуля;
- песочницу Firefox и часть защит из среды убрали;
- тест придумала и провела сама Anthropic;
- независимого повторения результатов пока нет.
Люди стали новым узким горлышком баг-хантинга
Echo в июле 2026 года опросила больше 80 руководителей security-подразделений в США. Расклад получился наглядным:
- 37% CISO называют главной проблемой разрыв между находками и ресурсами на фикс;
- 11% планируют вкладываться в ещё больший поиск багов;
- Anthropic уже вручную подтвердила часть находок, но пока не отправила их разработчикам;
- причина простая — не хватает рук и времени у самой компании и её партнёров.
Claude Mythos пока выглядит не как волшебная кнопка «нашёл и почини», а как генератор бесконечного тикет-трекера для security-команд. Чем сильнее нейронка прокачивается в поиске, тем острее выпирает человеческое ограничение — 23 019 подозрительных мест найти оказалось на порядок проще, чем их все разобрать.
Ранее сообщалось, что Пентагон расширил перечень ИИ-инструментов, доступных американским военным, добавив на платформу GenAI.mil специальные версии ChatGPT от OpenAI и Grok от xAI. Сервис предназначен для сотрудников Министерства обороны США и работает в рамках программы OpenAI for Government, при этом основное назначение платформы — обработка несекретной информации. Об этом сообщило само ведомство.
Эксперты CISOCLUB отметили, что нынешний расклад с Mythos — предсказуемый этап взросления ИИ-баг-хантинга, а не сенсация. По их оценке, автоматический поиск уязвимостей всегда будет обгонять возможности команд по ревью и фиксам, просто потому что сканирование масштабируется мгновенно, а человеческая экспертиза — нет. Они указали, что завышенные оценки серьёзности от модели не критичны сами по себе, если процесс ревью выстроен с поправкой на такое смещение.
Рост числа находок без роста числа фиксов, по их прогнозу, вынудит индустрию вкладываться не в новые сканеры, а в автоматизацию подтверждения и приоритизации находок. Отдельно они предупредили, что команды, которые слепо доверятся рейтингу ИИ, рискуют потратить ресурсы не на те баги.



