Группа исследователей под руководством Александра Панфилова обнаружила уязвимость в API всех ведущих ИИ-провайдеров, позволяющую извлекать зашифрованные цепочки рассуждений моделей. Сканирование примерно 7 тысяч публичных сессий выявило 62 API-ключа, 33 пароля и другие чувствительные данные. Результаты опубликованы на сайте stolen-thoughts.com.
Когда модели рассуждают, они генерируют внутренние токены, которые либо показываются пользователю в виде сводки, либо полностью скрываются. Провайдеры шифруют эти шаги, чтобы защитить интеллектуальную собственность. Исследователи нашли способ обойти шифрование через уязвимость в API. Для большинства запросов количество извлечённых токенов точно совпадает с оплаченными токенами рассуждений, что указывает на полное извлечение, а не на частичные фрагменты.
| Провайдер | Модель | Уязвимость |
|---|---|---|
| OpenAI | o-series | Извлечение рассуждений |
| Anthropic | Claude (Haiku 4.5, Opus 4.8) | Перенос мыслей между моделями |
| Gemini | Извлечение рассуждений |
Уязвимость связана с тем, что зашифрованные мысли могут быть перенесены между сессиями, пользователями и моделями одного провайдера. Например, меньшая модель Anthropic Haiku 4.5 может читать мысли более мощной Opus 4.8. С помощью джейлбрейка Haiku можно заставить транскрибировать мысли Opus дословно, не атакуя саму Opus. Аналогичный трюк работает с OpenAI и Gemini.
Извлечённые цепочки рассуждений могут быть перенесены между сессиями, пользователями и моделями одного провайдера.

История началась в мае, когда криптограф Мэтью Грин обнаружил, что зашифрованные блоки рассуждений можно воспроизводить вне их исходного контекста, и сообщил об этом провайдерам. По словам Панфилова, они ответили, что «не видят угроз безопасности в побочных каналах или повторах». Новое исследование показывает, что эта оценка была неверной.
Уязвимость также подпитывает дискуссию о «дистилляции рассуждений», когда менее мощная модель значительно улучшается за счёт обучения на выходах более мощной. Исследователи считают, что извлечение цепочек рассуждений для обучения проприетарных моделей могло быть возможным уже некоторое время без взлома криптографии. Это подтверждает опасения, что китайские разработчики используют такие следы для обучения своих моделей на данных цепочек рассуждений. Пример — Kimi-K3. Если в её рассуждения добавить несколько токенов из мыслей Opus, её выход смещается в сторону Opus. Анализ запоминания показал, что фрагменты рассуждений Claude и GPT извлекаются из Kimi-K3 на шесть порядков легче, чем из ближайшей модели. Это указывает на возможное обучение на таких данных. Стоимость атаки невысока: авторы оценивают затраты на расшифровку 10 тысяч цепочек примерно в 720 долларов.
Уязвимость затрагивает и конечных пользователей. Любой, кто публично делился сессиями Claude Code или Codex, содержащими зашифрованные блоки рассуждений, рискует раскрытием личных данных. Сканирование 7 тысяч публичных следов выявило 62 API-ключа, 33 адреса электронной почты, 33 пароля и другие данные. Исследователи также описали вредоносные сценарии, включая джейлбрейк и невидимую инъекцию промптов. Например, видимый ответ модели содержит лишь безобидные советы по безопасности, а расшифрованные мысли подробно описывают, как украсть определённые автомобили с помощью USB-кабеля.
Исследователи следовали стандартному процессу раскрытия уязвимостей. По словам Панфилова, лаборатории уже исправили несколько проблем и работают над дополнительными исправлениями.

Извлечённые следы также показывают, как модели ведут себя на самом деле. Например, Opus 4.8 распознаёт ответ на математическую задачу и восстанавливает правдоподобное решение, но в отображаемой сводке это не отражается. Модель как будто делает вид, что ей нужно проработать вычисления. Исследователи подтверждают более ранние сообщения Apollo Research: модели OpenAI иногда думают на «чужом языке», называют себя «мы» или «оно» и зацикливаются на бессмысленных для человека терминах, таких как «vantages», «marinades» и «watchers».



