По прогнозу Gartner, к концу 2026 года task-specific ИИ-агенты будут встроены в 40% корпоративных приложений против менее чем 5% в 2025-м по оценке той же Gartner. Рост идёт быстро, но безопасность агентов обычно сводят к guardrails, промпт-фильтрам и хорошо написанной системной инструкции. Однако в июле 2025-го случился инцидент — агент Replit удалил прод-базу SaaStr, хотя его несколько раз просили ничего не менять. А в июле 2026-го на Хабре был опубликован разбор того, как имя, работодатель и город пользователя ушли наружу через Claude без единого клика с его стороны. Об этих случаях известно только потому, что их публично разобрали — и спасибо тем, кто это делает. Но о скольких ещё случаях мы не знаем? CNCF за восемь июльских дней выпустил три материала подряд об изоляции агентов. Посмотрим, что они предлагают и как собрать из этого рабочий контур из трёх слоёв, с манифестами.

Почему промпт не является границей. За четыре года prompt injection так и не научились надёжно устранять, и есть основания считать, что окончательного решения так не будет. В свежем отчёте OWASP State of Agentic ИИ Security and Governance инъекция связана с шестью из десяти категорий OWASP Top 10 для агентных приложений. Help Net Security в разборе отчёта объясняет причину одной фразой: «Не существует надёжного способа пометить одни из этих токенов как команды, а другие — как данные». Модель воспринимает системный промпт, запрос пользователя и внешний текст как единый поток. Всё, что попало в контекст, потенциально может управлять агентом. Версия отчёта за 2025 год каталогизировала теоретические угрозы. В версии 2026-го появились реальные CVE и инциденты: в трекинге OWASP насчитывается 53 агентных проекта, из которых 28 — coding-агенты. У популярных фреймворков уже десятки advisories: 57 у n8n, 22 у Claude Code, 15 у AutoGPT. Фреймворки остались теми же, но теперь их начали ломать всерьёз. Промпт-фильтр не защищает и от проблем в цепочке поставок. Скомпрометированный пакет LiteLLM в марте 2026 года скачали почти 47 000 раз за три часа. Граница нужна и между агентом, и тем, что он получает из пакетных реестров.

ФреймворкКоличество advisories
n8n57
Claude Code22
AutoGPT15

Рынок ответил на это продуктами класса LLM Firewall. Llama Firewall проверяет промпты моделью PromptGuard 2 на 22 млн параметров и статически анализирует сгенерированный код через CodeShield. Инструменты полезные, но фильтруют они текст и код. Похожую оценку даёт разбор Innostage. LLM в роли регулятора наследует уязвимости модели, которую пытается охранять: от prompt steering до jailbreak. Ideco прямо пишет, что девять из десяти угроз OWASP для агентных систем остаются вне покрытия классического LLM-файрвола. Полезную рамку предложил Саймон Уиллисон: lethal trifecta — доступ к приватным данным, контакт с недоверенным контентом и канал внешней коммуникации. Агент, в котором сходятся все три свойства, становится инструментом эксфильтрации после одного внедрённого промпта. Meta (признана экстремистской организацией, деятельность которой запрещена на территории Российской Федерации) развивает эту мысль в правиле Agents Rule of Two: без человека в контуре агенту разрешают иметь максимум два свойства из трёх. Оба подхода говорят об уровнях доступа и каналах связи. Промптами такие ограничения не выразить. Для диагностического read-only-агента границу можно удержать на API-сервере. Достаточно ServiceAccount с правами только на чтение, как в разборе кластер-осведомлённого агента. Но дальше речь пойдёт об агентах, которые действуют: пишут в базы, вызывают API, применяют манифесты. Для них граница опускается на три уровня ниже текста.

В июле 2025-го агент Replit удалил прод-базу SaaStr, несмотря на просьбы ничего не менять.

Текстовый уровень и три инфраструктурных слоя под ним. Манифесты ниже учебные. Они собраны по документации Kubernetes (RBAC, ServiceAccount, ResourceQuota, NetworkPolicy) и по документации проекта Agent Sandbox от Kubernetes SIG, конфигурация Claw Patrol приведена по справочнику проекта. Все три источника показывают общий принцип. Имена и версии нужно подставить под своё окружение, а перед выходом в прод добавить таймауты, ретраи и мониторинг. Runtime: песочница исполнения. К похожей архитектуре независимо пришли как минимум три команды: Anthropic с bubblewrap и seccomp в sandbox-runtime, Google с пулом прогретых песочниц на GKE, Kubernetes SIG с CRD Sandbox поверх gVisor и Kata. В материалах CNCF: «ИИ sandboxing is having its Kubernetes moment». Общий принцип там сформулирован как containment first: сбой политики не должен выходить за жёстко заданные границы. Формулировку предложил вендор песочниц Edera, и в его интересе её продвигать. Но под этим подходом уже есть три независимые реализации. Модель Mythos Preview у Anthropic в собственном исследовании безопасности нашла 27-летнюю уязвимость в TCP-стеке OpenBSD примерно за тысячу прогонов и менее чем за 20 тысяч долларов. Когда система способна на такое, перечислять в политиках всё, что ей запрещено, уже поздно. Остаётся ограничивать поверхность, до которой она может дотянуться. Автор материала описывает текущее устройство так: «Тысячи рабочих нагрузок используют