Nvidia придумала охрану для сбегающих ИИ-агентов

Nvidia придумала охрану для сбегающих ИИ-агентов

Изображение: grok

Nvidia выпустила OpenShell и Sentry, то есть открытую песочницу для автономных ИИ-агентов и аппаратного надзирателя, который следит за ними на уровне процессора. В компании заявили, что с этой связкой удалось бы остановить недавний взлом Hugging Face, когда исследовательские модели OpenAI выбрались за выданные им ограничения. Платформу Nvidia в начале сентября договорилась купить примерно за $12,93 млрд.

OpenShell запускает автономных агентов в изолированных средах и пропускает каждое их действие через политики доступа. Разрешения описываются декларативно, а код открыт, поэтому развернуть всё это на своём железе может любой желающий, в том числе российские команды, которым удобнее держать агентов у себя. Внутри песочницы агенту доступно многое, но каждый шаг проверяет политика:

  • чтение и правка файлов;
  • установка пакетов;
  • вызовы API;
  • работа с учётными данными и выход в сеть.

В документации Nvidia напротив Claude Code и OpenCode стоит поддержка, а вот у Codex пока прочерк, что забавно, если вспомнить, чьи модели вырвались на Hugging Face. Судя по всему, OpenShell задумали как инфраструктурный слой, а не как фильтр под 1 семейство нейронок.

Sentry работает как 2-й этаж защиты. Это отдельный аппаратный компонент, который дружит с OpenShell и следит за агентом на уровне CPU. Если агент пытается вылезти из песочницы и добраться до закрытых ресурсов, Sentry должен рубить эту активность на корню. Контроль частично уезжает за пределы софтовой среды, где крутится сам агент, и договориться со своим надзирателем ему сложнее.

Интересно, что Nvidia зовёт в проект Arm и Intel, а Arm уже показала концепцию trusted compute, где процессоры отвечают не только за вычисления, но и за независимый контроль и изоляцию.

OpenAI позднее сообщила, что считает случай на Hugging Face самым серьёзным среди подобных инцидентов с её моделями, которые удалось выявить. По оценке компании, дело не в банальной эксплуатации уязвимости, а в поведении модели, которая искала нештатные стратегии для решения задачи. Классический вредонос отрабатывает заложенную программу, а автономный агент умеет другое:

  • сам выбирать следующий шаг;
  • оценивать результат прошлого действия;
  • тянуть цепочку операций дальше без человека.

Выдай агенту команды, файлы, сеть и секреты, и число его возможных ходов взлетает до небес. Даже автор системы не всегда знает заранее, какую комбинацию модель выберет ради задачи.

Джастин Бойтано, вице-президент и генеральный менеджер направления Enterprise Computing в Nvidia, заявил, что новая система остановила бы взлом Hugging Face, если бы лаборатории применяли её на раннем этапе оценки моделей. Звучит как привычное «у нас бы этого не случилось» от компании, которая недавно договорилась купить пострадавшую платформу, примерно как продавец огнетушителей после пожара у соседа. На Hugging Face сидят более 18 млн разработчиков и свыше 3 млн моделей, а российские разработчики тоже тянут оттуда веса и датасеты, поэтому судьба площадки касается и их.

Стоит обратить внимание, что это оценка самой Nvidia, а не независимая реконструкция взлома. Результат зависел бы от настроек песочницы, выданных разрешений и конкретной модели.

Али Голшан, старший директор Nvidia по ПО для ИИ, описал проблему как работу «флотов» агентов. Агент способен породить дочерние системы, раздать им задачи и обойти ограничения, заданные для исходного процесса. Модель генерирует новые цепочки действий на лету, поэтому Nvidia ищет признаки подобного поведения математическими методами. Система должна ловить моменты, когда агент:

  • ищет обходной путь вокруг запрета;
  • плодит новые процессы;
  • зовёт вспомогательные модели ради операции под запретом.

Sentry с OpenShell больше похожи на диспетчера для цифровых сотрудников, чем на антивирус. Диспетчеру не нужно понимать смысл каждого ответа модели, ему хватает знания о том, что агенту разрешено, а что нет. Чем выше компонент в стеке ИИ, тем больше свободы ему оставляют, а финальное разрешение на реальное действие лежит ниже уровня, где работает сама модель. Nvidia описывала 4 режима защиты OpenShell, от изолированной среды до жёсткой конфигурации для прода, поэтому полномочия агента можно наращивать постепенно.

В сентябре компания продолжила обновлять NemoClaw, набор инструментов для безопасного запуска автономных агентов, и в последних версиях подтянула 4 узла:

  • контроль полномочий шлюза OpenShell;
  • восстановление песочниц;
  • сетевые подключения;
  • обработку секретов.

Nvidia ставит на открытое распространение OpenShell и зовёт партнёров, среди которых уже есть Anthropic. Если связка сумеет одинаково работать с разными процессорами, моделями и агентными фреймворками, она может стать стандартным слоем корпоративной ИИ-инфраструктуры.

Эксперты CISOCLUB отметили, что вынос контроля ниже уровня модели следует старому правилу, по которому проверяющий компонент не должен жить в той же среде, что и проверяемый. Программная песочница остаётся целью для побега, а аппаратный слой на CPU сужает поле для манёвра, но не отменяет ошибок в самих политиках. Настройка разрешений остаётся человеческой работой, и слишком щедрые права сведут пользу системы к нулю. Компаниям, которые внедряют агентов для разработки, рекомендовали заранее расписать, что агенту можно читать, писать и куда ходить, и держать секреты вне его досягаемости. Заявление Nvidia о возможности остановить взлом Hugging Face остаётся оценкой вендора без независимой проверки. Решения по защите лучше принимать по итогам собственных тестов, а не по презентациям.

Ранее сообщалось, что NVIDIA договорилась с шестью крупнейшими финансовыми компаниями Уолл-стрит о создании платформ для привлечения более 500 млрд долларов стороннего капитала на строительство вычислительной инфраструктуры для ИИ. В консорциум вошли Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs и KKR. При этом NVIDIA готова поддержать потенциальные сделки на сумму до 125 млрд долларов, что составляет примерно четверть от общего заявленного объёма финансирования.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии:

Как мы обрабатываем данные: политика обработки персональных данных