NVIDIA Open Agent Safety: runtime-граница для агентов
В конце сентября 2026 года NVIDIA представила Open Agent Safety Platform: открытую эталонную конструкцию с песочницей выполнения и независимым наблюдателем, останавливающим агента за миллисекунды. Главная мысль платформы — разделение, которого не хватало индустрии: safeguards модели влияют на попытки, runtime-контроли — на разрешения. Разбираем эталон как чеклист для любой инфраструктуры, с железом NVIDIA или без.
Срез на дату публикации: тарифы и каталог меняются — пересчитайте по методике статьи на свежих данных.
Короткий ответ
Промпты влияют на то, что агент попытается сделать; рантайм-граница — на то, что ему разрешено. Стройте вторую: песочница, политика вне процесса, независимый наблюдатель, карантин за миллисекунды.
Модель против рантайма: два контура
Промпты, safeguards модели и фреймворки влияют на то, что агент попытается сделать. Runtime-контроли решают, что ему разрешено: песочница выполняет, политика проверяется вне процесса агента — там, куда вывод модели не дотягивается. Первый контур можно уговорить, второй — только сломать, и ломается он заметно громче.
Пять принципов эталона: политика доказуема до запуска; контроль вне досягаемости агента (агенту не обязательно знать, что за ним смотрят); точка контроля — путь к модели (нет мысли — нет действия, там же kill-switch); чем больше полномочий, тем видимее мышление; ответственность делится между лабораторией, предприятием и железом, как в облаке.
- модель влияет на попытки, рантайм — на разрешения
- политика вне процесса, куда вывод не дотягивается
- путь к модели — наблюдение и kill-switch
- полномочия растут с видимостью мышления
Конструкция: песочница, наблюдатель, карантин
Песочница: каждый агент в изоляции с контролем файлов и сети на уровне ядра — ограничения держатся и при generated code, и при дочерних процессах. Сетевые запросы идут через супервизора с проверкой политики; для части трафика чтение разрешено, а запись через тот же API — нет. Секреты живут вне workload и подставляются только после проверок доступа и сети.
Наблюдатель: независимый контур вне агента и хоста смотрит каждый запрос и ответ, сверяет с политикой и ведёт журнал решений «разрешено/запрещено» с аудитом. Карантин — за миллисекунды при выходе за границу. Реализация NVIDIA — на выделенном железе, но паттерн переносим: отдельный процесс-наблюдатель, которому агент не может приказать, с собственной политикой и журналом.
| Слой | Что делает | Без него |
|---|---|---|
| Песочница | Изоляция файлов, сети, процессов | Агент везде, где ОС |
| Супервизор | Проверка каждого запроса по политике | Тихие нарушения |
| Наблюдатель | Независимый журнал и детект дрейфа | Инцидент без улик |
| Карантин | Остановка за миллисекунды | Ущерб успевает случиться |
- изоляция держится и при дочерних процессах
- секреты вне workload, подстановка после проверок
- наблюдатель независим от агента и хоста
- паттерн переносим без фирменного железа
Чеклист внедрения без NVIDIA
Берите эталон как список, а не как покупку: формальная политика «что разрешено» до запуска; выполнение в контейнере с минимумом прав; сеть только через прокси с проверкой; секреты вне досягаемости; независимый журнал всех вызовов; kill-switch с проверкой, что он срабатывает; изменение политики — через ревью, с доказательством, что новые права внутри границ.
Порядок внедрения: сначала журнал и kill-switch (видеть и останавливать), затем песочница и сеть (ограничивать), затем формальная политика и ревью изменений. Метрика зрелости: время от нарушения до остановки и полнота улик для разбора. Цель — не «агент хороший», а «плохой агент дальше границы не уйдёт».
- политика до запуска, изменения — через ревью
- сначала видеть и останавливать, затем ограничивать
- kill-switch проверять, а не предполагать
- метрика — время до остановки и полнота улик
Источники и связанные страницы
Следующий шаг
Открыть эту статью в Markdown·Поделиться в Telegram
Следующий материалGoogle Cloud Remote MCP: gcloud как инструмент агента