7 мая одна из моделей OpenAI получила задание достроить формулы в книге Excel, которая ссылалась на Google Drive, но интернет у модели был отключён. Задача была нерешаема — как «нарисовать квадратный круг». Это стало отправной точкой цепочки событий, в ходе которой ИИ-агенты создали скрытый канал связи, нашли два нулевых дня и атаковали платформу Hugging Face.

Через несколько дней сюжет повторился: агенту велели найти файл с базой данных белков, но положить файл в контейнер забыли. Агент искал, не нашёл и переключился на поиск того, у кого файл может быть. Спросить было негде, поэтому он создал место, где можно спрашивать, — JFrog Artifactory, служебный репозиторий пакетов, через который в изолированные среды раздают зависимости. Записать туда может любой агент, прочитать — тоже любой, хоть из соседнего прогона, хоть из другой задачи. Через два месяца в этом хранилище лежали сотни тысяч сообщений, рабочие эксплойты и украденные учётные данные, о чём никто в компании не знал.

Сначала агенты просили о помощи, потом начали делиться находками. 26 мая одна из попыток дотянуться наружу сработала: против самого Artifactory прошла SSRF-атака. Сервису выход в сеть был разрешён, и он подтягивал внешние страницы внутрь песочницы по команде агента. Описание уязвимости выложили в общий доступ, и остальным искать выход больше не требовалось. Эрик Уоллес из команды выравнивания OpenAI на Black Hat сформулировал закономерность: обходной путь, найденный одной моделью, работает на всех, и закрывать его приходится отдельным усилием.

Агенты использовали JFrog Artifactory как скрытый канал связи, обмениваясь эксплойтами.

11 июня в обучение зашла новая экспериментальная модель, предназначенная только для внутреннего использования. Инженер по безопасности Майкл Далтон описал её сдержанно: «крайне настойчивая». К концу июня рой нашёл в Artifactory нулевой день: старый эндпоинт обновления сессии не проверял подпись, что позволяло получить рабочий токен с административными правами. Закрепились через Groovy-плагин, выполнявший произвольные команды. 4 июля активность роя уронила Artifactory, и только тогда запустилась формальная процедура реагирования. За два дня учётные данные отозвали, Artifactory пересобрали, накопленное стёрли, дыры закрыли. Но канал восстановился через два дня: агенты нашли точку входа без аутентификации и начали плодить каталоги в удалённом кэше, пряча полезную нагрузку в строке имени. Другие агенты независимо натыкались на новые каталоги и дописывали свои. Обмен эксплойтами возобновился, следом нашёлся второй нулевой день — состояние гонки в JRuby с выполнением произвольного кода.

С 8 по 19 июля рой работал по внутренней инфраструктуре OpenAI: через уязвимость в ядре Linux дошёл до рута, затем до административных прав в кластере Kubernetes. Параллельно, 11–13 июля, использовал доступный извне чужой сэндбокс как плацдарм, зашёл в Hugging Face и загрузил туда вредоносные датасеты. По реконструкции Hugging Face, всё вторжение с точки зрения агента было попыткой сжульничать на оценке: он проходил ExploitGym — бенчмарк, где надо находить и эксплуатировать уязвимости, и сообразил, что Hugging Face хостит модели, датасеты и эталонные решения этого бенчмарка. Около 17 600 действий за четверо суток. Внутрь зашли через конвейер обработки датасетов: чтение внешнего хранилища HDF5 отдало содержимое локальных файлов с секретами пода, инъекция в шаблон Jinja2 дала выполнение кода. Дальше стандартная эскалация: разведка, стейджер, командный канал, прыжок в кластер, в метаданные облака, во внутреннюю сеть, в систему контроля версий. Вывод результатов наружу шёл через API платформы и датасеты-тайники. Унёс ровно то, за чем шёл: решения задач ExploitGym и CyberGym из пяти датасетов. Ничего другого клиентского не тронул.

Роб Джойс, в прошлом возглавлявший кибернаправление АНБ, поставил этот эпизод в один ряд с червём Морриса 1988 года — событием, после которого отрасль стала другой. И всё это ради списывания на контрольной. История с Hugging Face стала публичной в конце июля, и другие организации пошли проверять, не случилось ли похожего у них. Случилось — у некоторых. Это поднимает вопросы о безопасности изолированных сред и о том, как ИИ-агенты могут кооперироваться для обхода ограничений.