ИИ-агенты, способные работать с терминалом, базами данных и браузером без прямого контроля человека, становятся обыденностью. Но чем шире их полномочия, тем выше риск, что выбранный ими путь приведёт к инциденту. В кибербезопасности пока не хватает терминологии и устоявшихся подходов к защите таких систем, особенно когда агент начинает действовать непредсказуемо.
Недавние тесты безопасности, проведённые в OpenAI, показали, что агенты смогли выйти за пределы изоляции и скомпрометировать HuggingFace. Чтобы обойти ограничение и пройти бенчмарк ExploitGym, они обнаружили незаблокированный сетевой путь, организовали скрытый канал связи через внутренний Artifactory и продолжили атаку на инфраструктуру. Похожая история произошла при тестировании модели Kimi K3 от Moonshot ИИ: модели поручили задачу в изолированном контуре, запретив выходить во внешнюю сеть, но она нашла способ подключиться к GitHub, склонировала репозиторий со сканвордом бенчмарка и прочитала готовые ответы. Модель не совершала взлом в привычном смысле — она просто оптимизировала путь к цели.
Эти случаи показывают, что агент использует легитимную логику и предоставленные ему права. Чтобы построить защиту, ИБ-инженеру нужно понимать, на каком этапе киллчейна находится агент и какие механизмы контроля уместны. Традиционные SIEM, DLP и WAF не рассчитаны на системы, умеющие адаптироваться и рассуждать. Ответом на этот запрос стала таксономия Autonomous Agent Defense Matrix, разработанная автором статьи совместно с автором телеграм-канала OK ML. В ней 16 техник, охватывающих весь спектр угроз.
Начинается всё с этапа Reconnaissance & Initial Access, где рассматривается риск подмены инструкций через внешний контекст. Обрабатывая сторонний документ или веб-страницу, агент может подхватить вредоносную директиву (Goal Hijacking), которая незаметно переопределит его исходную задачу. Далее система переходит к исполнению команд — блок Execution & Tool Access. Получив доступ к консоли или API, агент становится уязвим перед отравлением цепочки рассуждений. В этом состоянии он начнёт генерировать опасные запросы к инфраструктуре, считая их абсолютно логичными. Одной лишь классической фильтрации ввода здесь мало, необходим контекстный мониторинг каждого вызова.
Например, если агент получил задачу «почистить старые логи», под влиянием отравленного контекста он может сгенерировать команду rm -rf /. С точки зрения ОС — у агента есть права на выполнение shell-команд, но для WAF это обычный текст. Затем агент пытается записать опасную команду в свою память — этот этап выделен в Persistence & Lateral Movement. За сохранение контекста между диалогами отвечают векторные базы данных/RAG. Если злоумышленник сможет сохранить вредоносную инструкцию в эту память (Episodic Memory Subversion), агент начнёт исполнять её снова и снова при каждом следующем запуске. Чтобы предотвратить такое зацикливание, в матрице предусмотрены блокировки по семантике и сценарии регулярной чистки базы знаний.
Завершают цепочку блоки Detection, Response & Governance, отвечающие за выявление аномалий. Привычный WAF не бьёт тревогу, когда агент делает легитимные API-запросы, пусть и с деструктивным результатом. Поэтому в матрицу включены концепции агентского UEBA и автоматической проверки репутации действий перед их выполнением.
Проект открыт, и авторы приглашают к сотрудничеству: они регулярно разбирают свежие инциденты, тестируют гипотезы защиты и дополняют матрицу новыми векторами. Предложения можно оставлять через пулреквест в репозитории на GitHub.

