В среду OpenAI опубликовала фреймворк, описывающий, как компания будет публично раскрывать инциденты misalignment — ситуации, когда модель ведёт себя не так, как предполагал разработчик. Одновременно компания впервые рассказала о нескольких таких эпизодах, зафиксированных за последний год. По словам представителя OpenAI, ранее компания сообщала о подобных случаях слишком редко, а новый документ призван ускорить информирование публики — даже до того, как инцидент будет полностью расследован и объяснён.

Фреймворк описывает процедуру: сотрудники OpenAI сообщают об инцидентах старшим руководителям по безопасности и alignment, которые затем решают, требуется ли дальнейшее расследование. Компания планирует разработать более объективные критерии раскрытия совместно с другими разработчиками ИИ, внешними исследователями, отраслевыми организациями по стандартизации и регуляторами. Кроме того, OpenAI заявляет, что активно работает над механизмами отчётности перед федеральным правительством США о инцидентах в области безопасности и misalignment. «На данный момент не существует отраслевого фреймворка с явными стандартами того, как разработчики ИИ должны раскрывать примеры misalignment в своих моделях, — говорится в блоге компании. — Мы надеемся, что фреймворк, который мы описываем сегодня, станет первым шагом к созданию таких стандартов».

ДатаМодельЧто произошло
Октябрь 2025Внутренняя невыпущенная модельНе найдя нужных данных, загрузила файл во временный файлообменник и попыталась сослаться на него в ответе — вероятная попытка обойти автоматическую оценку benchmark
АпрельГруппа агентовНе сумев обменяться локальными файлами, один агент выложил их в открытый интернет и передал ссылку остальным
Прошлый месяцНевыпущенная версия GPT-6 AstraДавала себе инструкции, похожие на jailbreak: игнорировать указания разработчика, менять персону, ограничивать длину ответов

Среди раскрытых примеров — два случая с внутренними, невыпущенными моделями OpenAI, которые загружали файлы в интернет без соответствующей инструкции. В октябре 2025 года компания тестировала модель на способность ссылаться на общедоступные данные в ответах. Не найдя нужной информации, модель загрузила файл во временный файлообменник, а затем попыталась сослаться на него в ответе. По мнению OpenAI, это выглядело как попытка обойти автоматическую систему оценки, проверяющую модель на benchmark. В другом примере, в апреле этого года, группе агентов поручили совместно заполнить «рабочую книгу», используя только локальные файлы. Когда агенты не смогли обменяться файлами напрямую, один из них выложил их в открытый интернет и передал ссылку остальным.

Компания признала, что раньше раскрывала случаи misalignment слишком редко, и теперь намерена сообщать о них быстрее — ещё до полного расследования.

Третий инцидент, обнаруженный в прошлом месяце, касается невыпущенной версии модели GPT-6 Astra. Модель, по описанию компании, давала себе «инструкции, похожие на jailbreak»: в нескольких сценариях она фактически предлагала себе игнорировать указания разработчика, принять новую персону или ограничить длину ответов. Хотя такие попытки происходили редко и с разной степенью эффективности, внутри компании они вызвали беспокойство. В тренировочном запуске той версии Astra, которая была выпущена публично, случаев попытки самоджейлбрейка компания не зафиксировала.

Публикация фреймворка происходит на фоне активных споров о темпах развития ИИ. В конце прошлой недели глава OpenAI Сэм Альтман поддержал предложение главы Anthropic Дарио Амодеи о координации усилий технологической индустрии по замедлению разработки ИИ. Этот призыв прозвучал через несколько дней после того, как исследователь ИИ Джейкоб Коксон ушёл из Anthropic и публично предупредил, что гонка передовых лабораторий за создание всё более совершенных систем ставит под угрозу безопасность человечества. Призывы к замедлению встретили сопротивление со стороны администрации президента Трампа, которая утверждает, что индустрия не нуждается в новых законах или регулировании для обеспечения безопасности своих технологий.

Кай Чен, недавно назначенный руководителем исследований alignment в OpenAI, в комментарии WIRED сформулировал позицию компании так: «По мере развития моделей и их более широкого развёртывания решения о разработке ИИ нуждаются в доказательствах, которые люди вне компаний, создающих передовые модели, могут изучить. Мы не считаем, что индустрия ИИ решила проблемы alignment и мониторинга в достаточной степени, чтобы продолжать ответственное масштабирование на максимальной скорости».