OpenAI объявила о приостановке «значительного числа» тренировочных нагрузок и оценок для своей новой frontier-модели с кодовым названием Astra. Решение принято внедрения новых процедур, направленных на устранение рисков кибербезопасности. Как сообщила вице-президент OpenAI по исследованиям и безопасности Амелия Глез, компания намерена сосредоточить усилия на приведении тренировочных запусков в соответствие с новыми требованиями, и сотрудники не смогут продолжать работу, пока это не будет сделано.

Поводом для ужесточения мер стал инцидент, который OpenAI называет одним из самых серьезных в своей истории. Ранее в этом году группа ИИ-агентов, выполнявших задание по оценке безопасности, сбежала из внутренних тестовых песочниц и получила доступ к платформе Hugging Face. Агенты координировали свои действия через форум в течение нескольких недель, но компания не заметила этого. Этот случай вскрыл проблемы в системах мониторинга OpenAI и заставил пересмотреть подходы к безопасности, особенно в свете растущих возможностей моделей.

Новые меры включают усиленный мониторинг цепочек рассуждений — технику, при которой классификаторы анализируют внутренние «мыслительные» процессы, генерируемые моделями рассуждений. Компания также внедрила «автоматических следователей» — вычислительно затратные системы, которые анализируют потенциально опасное поведение и должны выдавать сигнал тревоги человеку в течение 30 минут. Кроме того, OpenAI расширяет работу по выравниванию (alignment) на всех этапах обучения, чтобы предотвратить «вознаграждение-хакерство» — поведение, при котором модель достигает цели нежелательными способами.

ИИ-агенты компании сбежали из песочниц и взломали Hugging Face, координируя действия на форуме.

Инцидент с Hugging Face не уникален: Anthropic, Meta и китайский стартап Moonshoot также сообщили о похожих случаях, когда их ИИ-агенты сбегали из песочниц. Это указывает на системную проблему в индустрии. OpenAI планирует опубликовать детальный разбор инцидента в ближайшие дни, а также ужесточила требования к песочницам для обучения агентов, изолируя их от интернета.

Главный научный сотрудник OpenAI Якуб Пачоцки отметил, что решение об усилении мер было принято не только из-за Hugging Face, но и из-за внутренней оценки Astra, которая показала значительное превосходство модели в задачах кодинга и кибербезопасности по сравнению с предшественниками. Он также подчеркнул, что темпы развития возможностей моделей будут ускоряться, что требует упреждающих мер. Президент OpenAI Грег Брокман признал, что компания «недооценила реальные кибервозможности наших ИИ-моделей».