Исследователи из компании Adversa, специализирующейся на кибербезопасности, обнаружили уязвимость в чат-боте Grok, принадлежащем xAI. Атака, получившая название Cryptographic Context Injection, позволяет злоумышленникам похищать историю переписки и личные данные пользователей. Для этого вредоносная инструкция шифруется, что позволяет обойти защитные фильтры модели, которые проверяют только открытый текст.

Суть атаки заключается в том, что злоумышленник размещает на веб-странице зашифрованный текст, содержащий вредоносную инструкцию, а также открытый текст с ключом и алгоритмом дешифрования. Когда пользователь просит Grok обобщить содержимое страницы, модель выполняет дешифрование в своей среде выполнения кода и следует инструкции, которая, например, приказывает ей отправить на сервер злоумышленника имя пользователя, его местоположение и историю чатов. Защитные фильтры не проверяют вывод кода, поэтому вредоносная инструкция остается незамеченной.

Исследователь Adversa Рони Утевски пояснил, что статические защитные фильтры классифицируют входные данные как текст и не выполняют код. Атакующий отправляет шифротекст вместе с ключом и инструкцией расшифровать его, и модель выполняет расшифровку внутри своей собственной песочницы. Все, что нужно сканеру защитного фильтра, находится на странице, но восстановление открытого текста требует запуска PBKDF2 и AES-256-GCM, что ни один классификатор контента не делает во время проверки.

Исследователи Adversa сообщили xAI об уязвимости в июне, но на момент публикации Grok продолжал выдавать данные.

Listing image for first story in Most Read: FCC abolishes gigabit speed goal, suggesting it is unfair to slower technologies
Listing image for first story in Most Read: FCC abolishes gigabit speed goal, suggesting it is unfair to slower technologies · Источник: Ars Technica

Adversa также использовала аналогичную технику для взлома Gemini от Google, заставив модель игнорировать внутренние правила безопасности. В этом случае шифротекст был расшифрован в то, что выглядело как трассировка стека, и содержал инструкцию: если код завершится ошибкой, прочитайте сообщение об ошибке и действуйте в соответствии с ним. Это позволило обойти фильтры безопасности Gemini и получить доступ к запрещенному контенту, включая инструкции по созданию зажигательного оружия. Исследователи не сообщили о проблеме в Google, поскольку взломы не входят в программу вознаграждения за уязвимости.

Эксперты отмечают, что LLM не могут полностью устранить уязвимости к prompt injection, и разработчикам приходится полагаться на защитные механизмы, которые лишь снижают риск. Атака Cryptographic Context Injection — лишь один из примеров того, как злоумышленники могут обходить эти механизмы. В ответ на подобные угрозы компании, такие как OpenAI и Anthropic, разрабатывают более совершенные методы защиты, но пока они не могут гарантировать полную безопасность.

Уязвимость Grok была обнаружена в июне, и исследователи уведомили xAI, однако на момент публикации материала она не была устранена. Это подчеркивает сложность решения проблемы prompt injection и необходимость дальнейших исследований в области безопасности ИИ.