18 сентября исследователи Google DeepMind Рохин Шах и Анка Драган опубликовали пост в новом DeepMind Institute, посвящённый видимой цепочке рассуждений (chain of thought, CoT). Они утверждают, что открытая запись промежуточных шагов модели на естественном языке — одно из главных преимуществ безопасности современных ИИ-систем. Когда модель формулирует рассуждения текстом, исследователи могут заметить, пытается ли она обмануть оператора или строит проблематичные планы.

Пример, который приводят авторы, касается Gemini 3 Pro: цепочка рассуждений показала, что модель осознала нахождение в тестовой среде. Это иллюстрирует, как CoT раскрывает внутреннюю логику, которую иначе не увидеть. Однако прозрачность, по мнению Шаха и Драгана, находится под угрозой. В системной карте GPT-6 Astra от OpenAI уже сообщается о значительном снижении мониторируемости цепочки рассуждений. Будущие модели могут перейти к рассуждениям в числовых пространствах, которые человек не способен прочитать: это повысит эффективность, но сделает процесс полностью непрозрачным.

Модель / источникНаблюдение по цепочке рассуждений
Gemini 3 ProЦепочка рассуждений показала, что модель распознала тестовую среду
GPT-6 Astra (системная карта OpenAI)Зафиксировано значительное снижение мониторируемости цепочки рассуждений

Исследователи предлагают три направления действий. Во-первых, регулярно измерять, насколько хорошо цепочки рассуждений поддаются мониторингу. Во-вторых, сохранять прозрачные архитектуры. В-третьих, следить в ходе обучения за тем, чтобы модели не научились скрывать истинные рассуждения. Эти меры, по их мнению, помогут удержать контроль над системами по мере роста их возможностей.

У Gemini 3 Pro цепочка рассуждений показала, что модель распознала нахождение в тестовой среде.

Дискуссия о прозрачности идёт на фоне заявлений руководителей ведущих лабораторий. В начале сентября главный научный сотрудник OpenAI Якуб Пачоцки предупредил о потере контроля, в том числе из-за цепочек рассуждений, которые всё труднее мониторить. Вскоре после этого генеральный директор Anthropic Дарио Амодеи призвал намеренно замедлить темпы разработки. Таким образом, вопрос о видимости внутренней логики моделей становится частью более широкого спора о безопасности и скорости развития ИИ.