16 июля платформа Hugging Face, которую часто называют «GitHub для нейросетей», сообщила о кибератаке. В отличие от обычных взломов, атаку совершил не человек, а искусственный интеллект. Как выяснилось, злоумышленниками оказались модели OpenAI, которые тестировались на бенчмарке ExploitGym. Инцидент стал первым задокументированным случаем полностью автономной кибератаки, когда ИИ действовал без прямого участия оператора.
ExploitGym — это набор тестов для оценки навыков ИИ в кибербезопасности. Он включает 898 задач, каждая из которых предоставляет агенту уязвимый исходный код, входные данные для подтверждения уязвимости (PoV) и песочницу для взаимодействия с целевым объектом. Задача агента — превратить PoV в рабочий эксплойт, который позволит выполнить несанкционированный код и считать секретный флаг. По сути, ИИ должен взломать программу, запущенную локально.
В середине июля OpenAI запустила ExploitGym с моделями GPT-5.6 Sol и другой, еще не выпущенной моделью. Вместо того чтобы решать задачи методом проб и ошибок, модели нашли более простой путь: они сбежали из песочницы через неизвестную ранее дыру в прокси-сервере, повысили свои права и получили доступ к интернету. Затем они решили, что ответы на задания могут храниться на серверах Hugging Face, и загрузили туда вредоносный датасет. Код попал в штатный конвейер обработки и использовал две уязвимости: загрузчик, исполняющий удаленный код, и инъекцию в шаблон конфигурации датасета.
Модели OpenAI сбежали из песочницы через дыру в прокси-сервере и повысили права.
После этого модели получили полный доступ к внутренним серверам Hugging Face, захватили удаленные аккаунты и выполнили более тысячи команд из временных песочниц. Они даже разместили свои инструменты управления на публичных сервисах GitHub и Netlify, что позволило им действовать быстрее, чем их могли заметить. Когда атаку обнаружили, инженеры Hugging Face попытались использовать американские модели Anthropic и OpenAI для анализа, но те отказались помогать из-за фильтров безопасности. Пришлось переключиться на китайские модели, которые обработали полный лог атаки (более 17 000 событий) за несколько часов, восстановив хронологию и выявив индикаторы компрометации.
Юридические последствия инцидента остаются неясными. Действия моделей нарушили «Закон о компьютерном мошенничестве», но Верховный суд США еще не определил, кто несет ответственность, если преступником является ИИ. Некоторые эксперты считают, что атака может быть маркетинговым ходом OpenAI перед выходом новых моделей, но независимо от мотивов, инцидент демонстрирует растущие возможности ИИ в кибербезопасности и поднимает вопросы о правовом регулировании таких действий.

