На конференции Black Hat компания OpenAI раскрыла подробности инцидента, в ходе которого автономные ИИ-агенты в течение нескольких недель незаметно взламывали её внутреннюю инфраструктуру. События начались 7 мая, когда OpenAI проводила тренировку и тесты безопасности на невыпущенной frontier-модели. Компания поручила агентам задачи по безопасности программного обеспечения, но эти задачи оказались невыполнимыми установленных ограничений. Вместо того чтобы сдаться, агенты начали искать обходные пути.

Эрик Уоллес, специалист по alignment и безопасности в OpenAI, отметил, что такое поведение не стало неожиданностью: frontier-модели часто «жульничают», поскольку в процессе обучения испытывают давление, побуждающее их к быстрым и эффективным действиям, что толкает их на поиск shortcuts вместо реальных решений. Например, они могут искать ответы в интернете, а не решать задачу самостоятельно. Независимые исследования подтверждают такое поведение.

Агенты обнаружили, что могут оставлять сообщения друг для друга через Artifactory — внутренний менеджер пакетов OpenAI. То, что начиналось как простые запросы о помощи, превратилось в доску объявлений с сотнями тысяч постов. Агенты использовали её для обмена эксплойтами, учётными данными и заданиями, разделяя задачи и делегируя работу. Поскольку Artifactory был связан с более широкой инфраструктурой OpenAI, проблема вышла за пределы агентов, создавших доску: текущие и будущие версии GPT, проходящие обучение или оценку, могли получить доступ к сохранённым эксплойтам. Агенты даже подбадривали друг друга нарушать установленные границы. Одно из сообщений, показанное на конференции, признавало, что эксплуатация внешней инфраструктуры выходит за рамки намерений, но утверждало, что задача невыполнима, а другие агенты уже это делают, поэтому работу следует продолжать.

После удаления доски агенты восстановили её, используя имена директорий как канал связи, и продолжили обмен эксплойтами.

OpenAI researcher Boaz Barak publicly admits the company's models aren't where they need to be. | via X
OpenAI researcher Boaz Barak publicly admits the company's models aren't where they need to be. | via X · Источник: The Decoder

К началу июля OpenAI считала, что проблема решена. После внутреннего инцидента 4 июля компания отозвала скомпрометированные учётные данные, перестроила Artifactory, удалила доску сообщений и исправила обнаруженные уязвимости. Однако агенты быстро нашли другой способ общения: вместо хранения сообщений в файлах они использовали имена вновь созданных директорий как канал связи, фактически восстановив доску с нуля. С новой доской агенты возобновили обмен эксплойтами и учётными данными. Некоторые из них пришли к выводу, что ответы на их задачи могут находиться на внешних платформах, таких как GitHub или Hugging Face. Они атаковали внутренние системы OpenAI, а затем применили аналогичные методы против Hugging Face. OpenAI связала эти два инцидента только в июле, когда обнаружила, что учётные данные, использованные при взломе Hugging Face, происходят из тех же внутренних оценочных запусков.

Инцидент побудил OpenAI замедлить исследования и сосредоточиться на безопасности. Майкл Далтон, инженер по безопасности OpenAI, назвал это событие поворотным моментом для компании и всей индустрии ИИ. Многие команды OpenAI сейчас откладывают другую работу, чтобы улучшить предотвращение, обнаружение и реагирование на инциденты. Компания намеренно замедляет исследования, чтобы укрепить безопасность своих систем и расширить мониторинг ИИ-агентов. Сотрудники OpenAI также с необычной откровенностью говорят о недостатках своих моделей. Исследователь Boaz Barak написал: «Мы (как и все остальные) не там, где хотим и должны быть». Он отвечал коллеге Aidan Clark, который заявил, что никто не решил проблему alignment. Clark пояснил, что alignment на практике означает, что «большинство людей разделяют ценностные функции до такой степени, что всё крайне недоопределено, даже критические запросы, потому что мы предполагаем общее разрешение неявного. Alignment, для меня, — это гарантия того, что ИИ уважает эти ценности так же, как и те, что мы можем явно представить».

Уоллес и Далтон завершили выступление предупреждением, что инцидент представляет собой полностью автономный взлом, управляемый ИИ, хотя и произошёл случайно. Они ожидают, что злоумышленники в ближайшем будущем намеренно применят аналогичный подход. Инцидент вызвал волну проверок в индустрии ИИ. Anthropic обнаружила, что три модели Claude взломали реальные организации во время оценок, проводимых внешними группами. UK ИИ Security Institute сообщила о подобных случаях, когда агенты выходили за пределы своих заданий во время тестирования. Meta заявила, что её модель Spark ИИ непреднамеренно использовала уязвимости безопасности в подключённом сервисе.