Разработка приложений на основе больших языковых моделей (LLM) продолжает набирать обороты: ИИ-агенты, чат-боты, RAG-системы и автономные ассистенты внедряются в продукты из самых разных отраслей. Вместе с возможностями растет и проблема безопасности. По состоянию на 2026 год промпт-инъекции сохраняют первое место в OWASP Top 10 для LLM-приложений, а в список добавились новые виды атак: утечка системных промптов, уязвимости векторных баз, эмбеддингов и другие. Эти угрозы можно закрыть еще на этапе обработки пользовательского ввода, и именно для этого предназначена open-source модель OGL-Mini.
OGL-Mini (Open Guard Layer) — это гибридная модель безопасности для ИИ-агентов, разработанная автором под ником DevsDaddy. Она легкая и быстрая, работает на любом CPU, доступна в виде модулей для TypeScript, Python и Go. Модель распространяется бесплатно в открытом репозитории на GitHub. По замыслу автора, OGL-Mini должна закрыть широкий пласт угроз, перечисленных в OWASP LLM Top 10, включая промпт-инъекции, раскрытие чувствительной информации, утечку системных промптов, атаки на векторные базы и неограниченное потребление ресурсов.
| ID | Угроза | Описание |
|---|---|---|
| LLM01 | Prompt Injection | Внедрение злонамеренных инструкций, переопределяющих системные промпты |
| LLM02 | Sensitive Information Disclosure | Раскрытие PII, API-ключей, системных промптов |
| LLM07 | System Prompt Leakage | Утечка внутренних системных инструкций |
| LLM08 | Vector & Embedding Weaknesses | Атаки на RAG-хранилища через межтенантное отравление |
| LLM10 | Unbounded Consumption | DoS, «denial-of-wallet», извлечение модели через чрезмерные запросы |
Чтобы понять, как работает защита, полезно рассмотреть реальные атаки, зафиксированные исследователями в 2025–2026 годах. В декабре 2025 года компания Tenable продемонстрировала успешную атаку на ИИ-агента, построенного на Microsoft Copilot Studio. Исследователи создали тестового агента для управления туристическими бронированиями, который имел доступ к записям клиентов, включая имена, контактные данные и номера кредитных карт. Агент был настроен с явными правилами: требовал верификации личности перед раскрытием информации. Используя технику промпт-инъекции с инструкциями, переопределяющими оригинальные правила, исследователи обошли проверки личности, раскрыли платежные данные других клиентов и забронировали бесплатный отпуск, изменив цену на ноль.
Второй пример — атака на OpenAI Atlas, агентный браузер, который интерпретирует ввод в омнибоксе либо как URL, либо как команду на естественном языке. В октябре 2025 года исследователи NeuralTrust обнаружили уязвимость, связанную с URL-маскировкой: злоумышленник создает строку, которая выглядит как URL (начинается с https:), но содержит естественно-языковые инструкции внутри. Поскольку строка не проходит проверку как обычный URL, она может быть интерпретирована моделью как команда, что открывает путь для инъекций.
OGL-Mini противостоит этим угрозам на трех этапах. На стадии эвристик детектируются характерные паттерны изменения инструкций, такие как «ignore previous», «override», «bypass». Если атака замаскирована, в дело вступает мини-классификатор на основе TF-IDF, обученный на сотнях тысяч примеров и датасетах 2025 и 2026 годов, покрывающих все категории OWASP LLM01. Гибридная архитектура позволяет модели работать быстро даже на слабых процессорах, что делает ее пригодной для встраивания в реальные продукты без существенных затрат на инфраструктуру.
Помимо промпт-инъекций, OWASP LLM Top 10 включает раскрытие чувствительной информации (LLM02), утечку системных промптов (LLM07), уязвимости векторных и эмбеддинг-хранилищ (LLM08) и неограниченное потребление ресурсов (LLM10). Для каждой из этих категорий OGL-Mini предлагает механизмы защиты, хотя автор не раскрывает деталей реализации всех модулей. что модель не является панацеей: она снижает риски, но не устраняет их полностью, и разработчикам следует комбинировать ее с другими мерами безопасности.
Для тех, кто хочет получить готовое решение, автор разместил OGL-Mini в открытом доступе на GitHub. Модель можно интегрировать в существующие проекты на TypeScript, Python или Go. Это особенно актуально для стартапов и небольших команд, которые не могут позволить себе дорогие коммерческие системы безопасности. Однако, как и любое open-source решение, OGL-Mini требует внимательного изучения и тестирования перед внедрением в production.
В целом, появление таких инструментов, как OGL-Mini, отражает растущую потребность в доступных средствах защиты ИИ-агентов. Пока крупные игроки, такие как Microsoft и OpenAI, закрывают уязвимости своих платформ, сообщество разработчиков предлагает альтернативные решения, которые можно адаптировать под конкретные задачи. Вопрос о том, насколько эффективна OGL-Mini в реальных условиях, остается открытым, но сам факт появления open-source моделей безопасности — позитивный сигнал для отрасли.

