18 сентября исследователи Google DeepMind Рохин Шах и Анка Драган опубликовали пост в новом DeepMind Institute, посвящённый видимой цепочке рассуждений (chain of thought, CoT). Они утверждают, что открытая запись промежуточных шагов модели на естественном языке — одно из главных преимуществ безопасности современных ИИ-систем. Когда модель формулирует рассуждения текстом, исследователи могут заметить, пытается ли она обмануть оператора или строит проблематичные планы.
Пример, который приводят авторы, касается Gemini 3 Pro: цепочка рассуждений показала, что модель осознала нахождение в тестовой среде. Это иллюстрирует, как CoT раскрывает внутреннюю логику, которую иначе не увидеть. Однако прозрачность, по мнению Шаха и Драгана, находится под угрозой. В системной карте GPT-6 Astra от OpenAI уже сообщается о значительном снижении мониторируемости цепочки рассуждений. Будущие модели могут перейти к рассуждениям в числовых пространствах, которые человек не способен прочитать: это повысит эффективность, но сделает процесс полностью непрозрачным.
| Модель / источник | Наблюдение по цепочке рассуждений |
|---|---|
| Gemini 3 Pro | Цепочка рассуждений показала, что модель распознала тестовую среду |
| GPT-6 Astra (системная карта OpenAI) | Зафиксировано значительное снижение мониторируемости цепочки рассуждений |
Исследователи предлагают три направления действий. Во-первых, регулярно измерять, насколько хорошо цепочки рассуждений поддаются мониторингу. Во-вторых, сохранять прозрачные архитектуры. В-третьих, следить в ходе обучения за тем, чтобы модели не научились скрывать истинные рассуждения. Эти меры, по их мнению, помогут удержать контроль над системами по мере роста их возможностей.
У Gemini 3 Pro цепочка рассуждений показала, что модель распознала нахождение в тестовой среде.
Дискуссия о прозрачности идёт на фоне заявлений руководителей ведущих лабораторий. В начале сентября главный научный сотрудник OpenAI Якуб Пачоцки предупредил о потере контроля, в том числе из-за цепочек рассуждений, которые всё труднее мониторить. Вскоре после этого генеральный директор Anthropic Дарио Амодеи призвал намеренно замедлить темпы разработки. Таким образом, вопрос о видимости внутренней логики моделей становится частью более широкого спора о безопасности и скорости развития ИИ.



