Три исследователя из команды Hacktron использовали модели Anthropic Claude, чтобы проникнуть во внутренние системы OpenAI через форум community.openai.com. Атака заняла менее 72 часов. По словам исследователей, она стала возможной только после выхода Claude Opus 5. OpenAI подтвердила устранение уязвимости примерно через 14 часов после отчёта.

Схема атаки опиралась на цепочку из двух уязвимостей. Первая — в библиотеке libheif, которую форум использовал для обработки загружаемых изображений в формате HEIC. Исправление для неё было доступно в исходном коде год, но его не пометили как проблему безопасности, и пакеты Debian на форуме оставались уязвимыми. Специально сформированный файл изображения позволял исследователям выполнить свой код на сервере. Вторая уязвимость — ошибка конфигурации в центральной системе единого входа OpenAI (SSO). Тот, кто контролировал сервер форума, мог выдавать себя за активных участников и захватывать их аккаунты в ChatGPT и Codex. Hacktron отмечает, что проблема выходила за пределы форума: любой скомпрометированный сервис, использующий вход через OpenAI, давал такой же доступ.

ЭтапСобытие
До 24 июляClaude Opus 4.8 создаёт эксплойт только при отключённой ASLR
24 июля, вечерAnthropic выпускает Claude Opus 5
Через 3 часаOpus 5 создаёт рабочий эксплойт для локального Mac
Через 4 часа после запуска агентаАгент захватывает тестовый сервер
Через ~14 часов после отчётаOpenAI подтверждает устранение уязвимости

Через аккаунты сотрудников исследователи попали во внутренний репозиторий OpenAI на GitHub. Чтобы подтвердить доступ, они от имени аккаунта Codex одного из сотрудников создали безобидный pull request во внутреннем монорепозитории. По их словам, чувствительные данные они не просматривали. Потенциально под угрозой были и подключённые к Codex и ChatGPT сервисы — GitHub, Slack и электронная почта.

Через форум они получили доступ к аккаунтам сотрудников в ChatGPT и Codex, а затем — к внутреннему репозиторию на GitHub.

Image description
Image description · Источник: The Decoder

Ключевым фактором стал переход от Claude Opus 4.8 к Claude Opus 5. Сначала исследователи использовали Opus 4.8: модель построила рабочий эксплойт, но только при отключённой ASLR — распространённой защите от атак на память. За несколько сессий она не смогла создать надёжную версию с включённой ASLR. Вечером 24 июля Anthropic выпустила Claude Opus 5. По данным Hacktron, новая модель создала рабочий эксплойт для локального Mac за три часа, а затем адаптировала его к серверному окружению Discourse. Исследователи запустили Claude в автономном цикле против собственного тестового экземпляра. Поскольку модель отказывалась писать эксплойты против реальных систем, цель была представлена как задача benchmark. Через четыре часа агент захватил сервер. На смежной задаче исследователи также отметили рост производительности по сравнению с GPT-5.6 Sol от OpenAI.

Проект получил название HEIF Heist. Помимо OpenAI, исследователи проверили Slack, Meta, GitHub Enterprise и другие цели. Три человека работали над проектом два месяца и потратили на ИИ менее $3000. Адаптация атаки под каждую новую цель занимала всего один-два дня. Активность заметил только Shopify, несмотря на тысячи загрузок изображений и повторяющиеся сбои в обработке.

Hacktron формулирует более широкий вывод: программное обеспечение долго пользовалось своего рода безопасностью через сложность. Даже при открытом исходном коде и известной уязвимости для создания надёжного эксплойта требовались редкая экспертиза, время и глубокое знание целевой среды. Сложность не была настоящим барьером, но на практике защищала многие компании. ИИ снимает эту защиту, заменяя дефицитную экспертизу вычислительной мощностью. «Работа, которая когда-то требовала хорошо обеспеченной команды и месяцев усилий, теперь сжимается до дней», — пишет команда. Hacktron призывает пересмотреть модели угроз с учётом того, насколько дешёвыми стали атаки.