В 2025–2026 годах поверхность атаки в корпоративных ИИ-системах сместилась. Если раньше основными рисками были генерация вредоносного контента и утечки через промпт, то теперь агенты выполняют реальные действия: работают с почтой, CRM, базами данных, API и кодом. Ошибка или компрометация агента — это уже не текстовая проблема, а операционный инцидент.

Классический Shadow ИИ — это использование сотрудниками ChatGPT, Claude или аналогичных сервисов без ведома ИТ и службы безопасности. Но большинство LLM Firewall видят только на уровне вызова «теневых» моделей (API-трафик к моделям) и почти не видят то, что происходит на локальных машинах. При этом Shadow ИИ живет глубже: в MCP-инструментах, локальных desktop-агентах, встроенных в корпоративные приложения, в IDE разработчиков и на рабочих станциях сотрудников. Именно поэтому контроль Shadow ИИ сегодня невозможно рассматривать отдельно от runtime-контроля ИИ-агентов.

Автономные ИИ-агенты уже не просто генерируют текст, они самостоятельно планируют задачи, выбирают инструменты, обращаются к корпоративным системам, выполняют код и запускают цепочки действий. В отличие от классических LLM в режиме «вопрос-ответ», агент работает как субъект с правами. Он использует те привилегии, которые ему выдали, и часто имеет доступ сразу к нескольким системам. Если нет сетевой изоляции и контроля поведения, после запуска действие ИИ-агента практически никто не отслеживает: какие операции выполняются, какие данные уходят и с какими узлами устанавливаются соединения.

LLM Firewall контролирует только взаимодействие с моделями, но не видит действия агентов в инфраструктуре.

Это принципиально меняет характер угроз. После первоначальной компрометации (в том числе через indirect prompt injection) агент может продолжать получать инструкции, менять поведение и фактически становиться долгоживущим инструментом злоумышленника. Ошибка в агентской среде — это уже не ошибка одного продукта, а ошибка на уровне целой категории приложений.

Многие компании сегодня выбирают LLM Firewall как основное решение для безопасности ИИ. Это понятный и относительно быстрый шаг. Однако если параллельно не внедрять runtime-контроль агентов (перехват вызовов инструментов (tool calls), проверку аргументов и намерений, контроль MCP), организация закрывает только один слой угроз и оставляет открытым самый опасный — слой реальных действий.

LLM Firewall решает важную задачу — контролирует взаимодействие с моделями (контроль промптов и ответов, защита данных). Однако ИИ-агент после получения команды переходит к действиям и именно на этом этапе необходимо выстраивать контроль. Типичные сценарии, которые Firewall почти не закрывает: вызов разрешённого инструмента с вредоносными аргументами; отравление инструмента и искажение его работы (tool poisoning); эксфильтрация данных через легитимный вызов инструмента (tool call); отклонение от исходного намерения пользователя; использование избыточных привилегий, выданных агенту. Без перехвата и контроля tool calls, проверки аргументов и сверки с исходным намерением (intent) эти действия просто выполняются.

LLM Firewall контролирует все взаимодействия с ИИ-моделями, а система контроля ИИ-агентов контролирует все действия, которые совершает агент в инфраструктуре компании. Вместе они закрывают полный цикл: от мысли до действия. Один слой без другого оставляет критическую дыру. Когда внедрены оба компонента — LLM Firewall и контроль работы ИИ-агентов, то защита становится многослойной и покрывает полный цикл работы агента: от запроса к модели до реального действия в инфраструктуре.

Эффективный контроль ИИ-агентов строится на нескольких технических принципах. Во-первых, обнаружение и инвентаризация (ИИ-BOM): реестр моделей, агентов, MCP-серверов, skills и их связей. Без этого невозможно понять реальный периметр. Во-вторых, runtime-перехват действий: MCP-прокси и agent hooks (PreToolUse / PostToolUse) должны видеть имя инструмента и аргументы до выполнения. Вердикт должен выноситься до исполнения. В-третьих, политики доступа: всё, что явно не разрешено, должно быть запрещено (Deny-by-default). Ограничения на инструменты, аргументы, пути, домены и объёмы данных. В-четвертых, изоляция и наименьшие привилегии: агент работает в изолированной среде, со своей идентичностью, без постоянных секретов и с минимально необходимыми правами. И наконец, контроль поведения: мониторинг действий агента в реальном времени, выявление отклонений от намерения пользователя и реагирование на аномалии.

Пока индустрия обсуждала безопасность моделей и промптов, уязвимая поверхность уже сместилась глубже — в runtime-слой агентских фреймворков и протоколов (включая MCP). Компании, которые ограничиваются только LLM Firewall, защищают «мозг» агента, но оставляют его «руки» практически без контроля. А именно руками агент наносит реальный ущерб.