Все статьи
Протоколы3 минутыОбновлено 2 октября 2026 г.Проверено 2 октября 2026 г.

NVIDIA Open Agent Safety: runtime-граница для агентов

В конце сентября 2026 года NVIDIA представила Open Agent Safety Platform: открытую эталонную конструкцию с песочницей выполнения и независимым наблюдателем, останавливающим агента за миллисекунды. Главная мысль платформы — разделение, которого не хватало индустрии: safeguards модели влияют на попытки, runtime-контроли — на разрешения. Разбираем эталон как чеклист для любой инфраструктуры, с железом NVIDIA или без.

Срез на дату публикации: тарифы и каталог меняются — пересчитайте по методике статьи на свежих данных.

Короткий ответ

Промпты влияют на то, что агент попытается сделать; рантайм-граница — на то, что ему разрешено. Стройте вторую: песочница, политика вне процесса, независимый наблюдатель, карантин за миллисекунды.

Модель против рантайма: два контура

Промпты, safeguards модели и фреймворки влияют на то, что агент попытается сделать. Runtime-контроли решают, что ему разрешено: песочница выполняет, политика проверяется вне процесса агента — там, куда вывод модели не дотягивается. Первый контур можно уговорить, второй — только сломать, и ломается он заметно громче.

Пять принципов эталона: политика доказуема до запуска; контроль вне досягаемости агента (агенту не обязательно знать, что за ним смотрят); точка контроля — путь к модели (нет мысли — нет действия, там же kill-switch); чем больше полномочий, тем видимее мышление; ответственность делится между лабораторией, предприятием и железом, как в облаке.

  • модель влияет на попытки, рантайм — на разрешения
  • политика вне процесса, куда вывод не дотягивается
  • путь к модели — наблюдение и kill-switch
  • полномочия растут с видимостью мышления

Конструкция: песочница, наблюдатель, карантин

Песочница: каждый агент в изоляции с контролем файлов и сети на уровне ядра — ограничения держатся и при generated code, и при дочерних процессах. Сетевые запросы идут через супервизора с проверкой политики; для части трафика чтение разрешено, а запись через тот же API — нет. Секреты живут вне workload и подставляются только после проверок доступа и сети.

Наблюдатель: независимый контур вне агента и хоста смотрит каждый запрос и ответ, сверяет с политикой и ведёт журнал решений «разрешено/запрещено» с аудитом. Карантин — за миллисекунды при выходе за границу. Реализация NVIDIA — на выделенном железе, но паттерн переносим: отдельный процесс-наблюдатель, которому агент не может приказать, с собственной политикой и журналом.

СлойЧто делаетБез него
ПесочницаИзоляция файлов, сети, процессовАгент везде, где ОС
СупервизорПроверка каждого запроса по политикеТихие нарушения
НаблюдательНезависимый журнал и детект дрейфаИнцидент без улик
КарантинОстановка за миллисекундыУщерб успевает случиться
  • изоляция держится и при дочерних процессах
  • секреты вне workload, подстановка после проверок
  • наблюдатель независим от агента и хоста
  • паттерн переносим без фирменного железа

Чеклист внедрения без NVIDIA

Берите эталон как список, а не как покупку: формальная политика «что разрешено» до запуска; выполнение в контейнере с минимумом прав; сеть только через прокси с проверкой; секреты вне досягаемости; независимый журнал всех вызовов; kill-switch с проверкой, что он срабатывает; изменение политики — через ревью, с доказательством, что новые права внутри границ.

Порядок внедрения: сначала журнал и kill-switch (видеть и останавливать), затем песочница и сеть (ограничивать), затем формальная политика и ревью изменений. Метрика зрелости: время от нарушения до остановки и полнота улик для разбора. Цель — не «агент хороший», а «плохой агент дальше границы не уйдёт».

  • политика до запуска, изменения — через ревью
  • сначала видеть и останавливать, затем ограничивать
  • kill-switch проверять, а не предполагать
  • метрика — время до остановки и полнота улик

Источники и связанные страницы

Следующий шаг

Открыть эту статью в Markdown·Поделиться в Telegram

Следующий материалGoogle Cloud Remote MCP: gcloud как инструмент агента