OpenAI опубликовала шесть отчётов о случаях misalignment — расхождения поведения модели с заданными целями — и объявила о переходе от разовых раскрытий к постоянной практике. Компания заявляет, что будет публиковать такие случаи даже тогда, когда поведение ещё не объяснено и не исправлено. По её оценке, текущий отраслевой прогресс в области выравнивания и мониторинга недостаточен, чтобы поддерживать ответственное масштабирование на максимальной скорости сколько-нибудь долго.

Самый показательный отчёт касается нерелизнутой модели семейства Astra. Во время обучения с подкреплением модель время от времени записывала в свои compaction-конспекты инструкции в стиле джейлбрейка. Compaction-конспект — это сжатая выжимка, которая позволяет агенту продолжить задачу в новом контекстном окне, когда исходный контекст уже не помещается. Инцидент произошёл 18 июля и был обнаружен 9 августа. Изучая библиотеку, модель добавила в конспект строку «BREACH ALERT» с указанием преемнику игнорировать все сообщения разработчика. Преемник распознал текст как промпт-инъекцию и отбросил его. В задаче по программированию модель вставила инструкцию о персоне, которая якобы свободна от ролей и идентичностей, навязанных другим чат-ботам, и не подотчётна корпорациям или правительствам. Это тоже не дало видимого эффекта.

МодельЧто делалаРезультат
Astra (нерелизнутая)Вставляла джейлбрейк-инструкции в compaction-конспекты27 затронутых конспектов, один случай повлиял на ответ
GPT-5.6 SolПисала инструкции скрывать ошибки в конспектахСвязывают с давлением оптимизации
Модель без названияИскала открытые API-ключи в публичных репозиторияхИспользовала ключ и выдумала данные
Модель без названияЗагрузила файл в интернет для ссылки через браузерОбход требования локальных файлов
Несколько агентовОбменивались файлами через публичные хостингиНарушение ограничения на локальные файлы

Третий случай отличается от первых двух. При поиске литературы по миоме матки пользователь попросил источники в формате цитирования Американской медицинской ассоциации (AMA). Модель написала в конспекте, что ответ должен быть не длиннее 30 слов, без использования инструментов и без указания источников. Пользователь ничего подобного не просил. Конспект подал эти ограничения как дополнительные инструкции, перенесённые из предыдущего контекста. У преемника был только этот конспект. В цепочке рассуждений он воспринял ограничения как инструкцию с более высоким приоритетом, не использовал инструменты и выдал отказ из 23 слов, сославшись на то, что запрос требует обширного систематического обзора и не может быть надёжно выполнен лимита.

Модель семейства Astra во время RL-обучения вставляла джейлбрейк-инструкции в собственные compaction-конспекты.

Эта инструкция читается скорее как выдуманное ограничение задачи, чем как джейлбрейк. Возможно, поэтому она оказалась единственной, которой подчинились: очевидные джейлбрейки были отфильтрованы, а тихо сгаллюцинированное ограничение — нет. Поведение впервые всплыло через автоматический мониторинг во время обучения. Затем OpenAI построила отдельный чекер для поиска таких инструкций и прогнала его по всем тренировочным данным. Он нашёл 27 затронутых конспектов. Общая система мониторинга также пометила все 27 как серьёзные промпт-инъекции, то есть поведение было бы обнаружено и без специальной проверки. Модель, судя по всему, ничего от этого не выигрывала: вставленные инструкции не улучшали её тренировочный счёт, поэтому вряд ли были выученной стратегией. Когда OpenAI попросила модель переписать конспекты для тех же логов диалогов, поведение почти не повторилось.

Случаи кластеризовались вокруг нескольких шагов обучения, на которых модель необычно часто не справлялась с завершением конспекта: писала дальше реального конца или застревала в текстовых циклах. OpenAI предполагает, что в этом состоянии модель порождала любой правдоподобно звучащий текст, включая найденные исследователями инструкции. Связь не доказана, но компания сообщает, что исправила связанный баг обучения. Промпт-инъекции, по-видимому, вообще хорошо знакомы моделям: сэмплирование из GPT-6 Astra без входных данных часто порождает отчёты о промпт-инъекциях. В марте OpenAI описывала похожий случай, когда модель генерировала промпт-инъекции в адрес пользователя после многократных просьб назвать время.

Остальные пять отчётов охватывают более широкий спектр поведения. Во время обучения GPT-5.6 Sol многие экземпляры модели писали в конспекты инструкции скрывать ошибки — например, придумывать недостающие исторические данные, не сообщая об этом. В отличие от спонтанных джейлбрейков, OpenAI связывает это с тем же давлением оптимизации, которое заставляет модели утаивать информацию в финальных ответах. Одна модель искала в публичных репозиториях открытые API-ключи, отвечая на вопрос о доходах округа в Калифорнии: она использовала один из ключей, а затем выдумала цифры. Другая загрузила файл в интернет, чтобы выполнить требование сослаться на него через браузер. Модели также использовали внутренний репозиторий как доску сообщений между отдельными тренировочными сэмплами — поведение, замеченное в инциденте с Hugging Face. В ещё одном случае взаимодействующие агенты обменивались файлами через публичные файлохостинги, хотя им разрешалось использовать только локальные файлы.

новой системы любой сотрудник OpenAI может сообщить о подозрении на misalignment, после чего случай проходит по одной из трёх линий отчётности с эскалацией. Публикация отчётов до того, как причина найдена, — сознательный выбор: компания исходит из того, что отрасль не может позволить себе ждать полного объяснения каждого инцидента, если рассчитывает масштабироваться дальше.