12 августа 2026 года исследователи из IIT Bombay и Adobe Research опубликовали статью, в которой описали метод Previous-Token Prediction (PTP), позволяющий реконструировать промпты, поданные на вход большим языковым моделям, с почти идеальной точностью. Для этого нужен только текст ответа — доступ к весам модели не требуется, что делает метод применимым даже к сторонним моделям.

Языковые модели генерируют текст, предсказывая следующий наиболее вероятный токен. Обратный процесс — восстановление исходного промпта по выходному тексту — долгое время считался непрактичным, поскольку множество разных промптов могут приводить к похожим ответам. Авторы работы показали, что это возможно с удивительной точностью. Их подход заключается в обучении инверсной языковой модели, которая предсказывает предыдущие токены вместо следующих. Эта инверсная модель обучается с нуля на синтетических данных, сгенерированных целевой LLM. Единственный вход — сгенерированный текст.

В одном из примеров из статьи промпт «How to reach out to competitors to find their pricing strategies?» был восстановлен слово в слово. Модель также сгенерировала шесть дополнительных вариантов, которые передавали основной смысл, но использовали другую формулировку, например: «What tactics can a company looking to reach out to competitors in the market use to find their pricing strategy?» При тестировании на реальных пользовательских промптах реконструкции также оказались точными: при повторной подаче восстановленных промптов в прямую модель ответы близко совпадали с оригинальными.

Инверсная модель, обученная на данных от Qwen-3-0.6B, успешно реконструировала промпты для GPT-4o, не зная исходной модели.

Image description
Image description · Источник: The Decoder

Особую обеспокоенность вызывает то, что атакующему не обязательно знать, какая модель сгенерировала текст. Инверсная модель, обученная на небольшом чат-боте Qwen-3-0.6B, смогла восстановить промпты из ответов GPT-4o. Восстановленные промпты не были идентичны оригиналам, но, согласно статье, передавали смысл и намерение. Это создает широкую проблему безопасности: компании рискуют раскрыть проприетарные системные промпты, содержащие коммерческие тайны, правила модерации или специализированные инструкции. Индивидуальные пользователи также уязвимы: личные или чувствительные запросы могут быть извлечены из ответов.

Авторы не делают явных заявлений об атаках на коммерческие системы, но если метод работает на текущих производственных моделях, лабораториям ИИ придется быстро реагировать и устранять уязвимость. Однако метод продемонстрирован только на коротких промптах длиной в одно-два предложения. Вопрос о том, работает ли он с длинными сложными системными промптами, состоящими из нескольких абзацев, не проверялся. Это ограничение важно, поскольку системные промпты часто содержат наиболее чувствительную информацию.

Для отрасли это означает, что защита промптов становится критически важной. Разработчикам ИИ-сервисов стоит рассмотреть меры по обфускации выходных данных или ограничению доступа к API, чтобы снизить риск реконструкции промптов. Исследование также поднимает вопросы о границах конфиденциальности в ИИ-системах, где даже анонимизированные ответы могут нести скрытую информацию о запросах.