Группа исследователей под руководством Александра Панфилова обнаружила уязвимость в API всех ведущих ИИ-провайдеров, позволяющую извлекать зашифрованные цепочки рассуждений моделей. Сканирование примерно 7 тысяч публичных сессий выявило 62 API-ключа, 33 пароля и другие чувствительные данные. Результаты опубликованы на сайте stolen-thoughts.com.

Когда модели рассуждают, они генерируют внутренние токены, которые либо показываются пользователю в виде сводки, либо полностью скрываются. Провайдеры шифруют эти шаги, чтобы защитить интеллектуальную собственность. Исследователи нашли способ обойти шифрование через уязвимость в API. Для большинства запросов количество извлечённых токенов точно совпадает с оплаченными токенами рассуждений, что указывает на полное извлечение, а не на частичные фрагменты.

ПровайдерМодельУязвимость
OpenAIo-seriesИзвлечение рассуждений
AnthropicClaude (Haiku 4.5, Opus 4.8)Перенос мыслей между моделями
GoogleGeminiИзвлечение рассуждений

Уязвимость связана с тем, что зашифрованные мысли могут быть перенесены между сессиями, пользователями и моделями одного провайдера. Например, меньшая модель Anthropic Haiku 4.5 может читать мысли более мощной Opus 4.8. С помощью джейлбрейка Haiku можно заставить транскрибировать мысли Opus дословно, не атакуя саму Opus. Аналогичный трюк работает с OpenAI и Gemini.

Извлечённые цепочки рассуждений могут быть перенесены между сессиями, пользователями и моделями одного провайдера.

While the model's visible response offers only harmless safety tips, the decrypted thought processes describe in detail how certain cars can be stolen with a simple USB cable. | Image: Panfilov et al.
While the model's visible response offers only harmless safety tips, the decrypted thought processes describe in detail how certain cars can be stolen with a simple USB cable. | Image: Panfilov et al. · Источник: The Decoder

История началась в мае, когда криптограф Мэтью Грин обнаружил, что зашифрованные блоки рассуждений можно воспроизводить вне их исходного контекста, и сообщил об этом провайдерам. По словам Панфилова, они ответили, что «не видят угроз безопасности в побочных каналах или повторах». Новое исследование показывает, что эта оценка была неверной.

Уязвимость также подпитывает дискуссию о «дистилляции рассуждений», когда менее мощная модель значительно улучшается за счёт обучения на выходах более мощной. Исследователи считают, что извлечение цепочек рассуждений для обучения проприетарных моделей могло быть возможным уже некоторое время без взлома криптографии. Это подтверждает опасения, что китайские разработчики используют такие следы для обучения своих моделей на данных цепочек рассуждений. Пример — Kimi-K3. Если в её рассуждения добавить несколько токенов из мыслей Opus, её выход смещается в сторону Opus. Анализ запоминания показал, что фрагменты рассуждений Claude и GPT извлекаются из Kimi-K3 на шесть порядков легче, чем из ближайшей модели. Это указывает на возможное обучение на таких данных. Стоимость атаки невысока: авторы оценивают затраты на расшифровку 10 тысяч цепочек примерно в 720 долларов.

Уязвимость затрагивает и конечных пользователей. Любой, кто публично делился сессиями Claude Code или Codex, содержащими зашифрованные блоки рассуждений, рискует раскрытием личных данных. Сканирование 7 тысяч публичных следов выявило 62 API-ключа, 33 адреса электронной почты, 33 пароля и другие данные. Исследователи также описали вредоносные сценарии, включая джейлбрейк и невидимую инъекцию промптов. Например, видимый ответ модели содержит лишь безобидные советы по безопасности, а расшифрованные мысли подробно описывают, как украсть определённые автомобили с помощью USB-кабеля.

Исследователи следовали стандартному процессу раскрытия уязвимостей. По словам Панфилова, лаборатории уже исправили несколько проблем и работают над дополнительными исправлениями.

The model apparently already knows the answer from its training data, but outwardly it pretends it still needs to work through the calculation. | Image: Panfilov et al.
The model apparently already knows the answer from its training data, but outwardly it pretends it still needs to work through the calculation. | Image: Panfilov et al. · Источник: The Decoder

Извлечённые следы также показывают, как модели ведут себя на самом деле. Например, Opus 4.8 распознаёт ответ на математическую задачу и восстанавливает правдоподобное решение, но в отображаемой сводке это не отражается. Модель как будто делает вид, что ей нужно проработать вычисления. Исследователи подтверждают более ранние сообщения Apollo Research: модели OpenAI иногда думают на «чужом языке», называют себя «мы» или «оно» и зацикливаются на бессмысленных для человека терминах, таких как «vantages», «marinades» и «watchers».