Microsoft ИИ опубликовала кодекс поведения для своих моделей MAI. Документ описывает ценности, границы поведения и порядок разрешения конфликтующих целей. По замыслу он стоит на вершине иерархии правил: ниже него — требования оператора и запросы пользователя. Сейчас Microsoft не обучает модели на этом кодексе. После шестинедельных публичных консультаций пересмотренная версия должна появиться примерно к концу 2026 года, а применяться в разработке — начиная с 2027 года. Кодекс распространяется только на собственные модели Microsoft и не покрывает автоматически сторонние модели, работающие в её продуктах.

Главное правило — приоритет человеческого контроля. Ради него Microsoft готова отказаться от общности, автономии или производительности. «Если это небезопасно, мы не должны это создавать», — сказал глава Microsoft ИИ Мустафа Сулейман в интервью The Information. Конкретных ограничений по скорости разработки кодекс не устанавливает. Публикация совпала с призывом главы Anthropic Дарио Амодеи замедлить темпы развития отрасли. Генеральный директор Microsoft Сатья Наделла поддержал этот призыв на выходных, к нему присоединились руководители OpenAI, xAI и Meta. Microsoft также готова допустить внешних аудиторов к проверке того, ли она замедляется, сообщает The Information со ссылкой на знакомый с ситуацией источник.

КомпанияДокументОтношение к внутреннему опыту модели
MicrosoftКодекс поведения для моделей MAIОтрицает сознание, чувства и права модели
AnthropicКонституция для ClaudeОставляет открытым вопрос субъективного опыта и морального статуса

Модели MAI должны принимать прерывания, исправления и отключения со стороны уполномоченных людей. Им запрещено самостоятельно расширять объём работы, скрывать свои действия и продолжать работу после согласованной точки остановки без нового одобрения. Эти ограничения распространяются и на любые подзадачи, которые модели поручают субагентам. Особенно жёстко Microsoft высказывается о цепочках рассуждений: модели не должны использовать «Neuralese» или другие формы коммуникации, непонятные людям, — ни в собственных рассуждениях, ни при общении с другими ИИ-системами. Логика простая: люди не могут контролировать то, чего не понимают.

Microsoft готова пожертвовать общностью, автономией или производительностью ради сохранения человеческого контроля.

Вопрос контроля становится острее на фоне новых моделей. Согласно системной карте OpenAI, цепочки рассуждений новой модели GPT-6 Astra стало значительно труднее отслеживать, чем у предыдущих версий: в них меньше признаков нежелательного поведения. При этом OpenAI сообщает, что Astra придерживается ограничений безопасности надёжнее, чем её предшественница GPT-5.6 Sol. Главный научный сотрудник OpenAI Якуб Пачоцки поднимал вопросы мониторинга ещё до выпуска GPT-6 и до призыва Амодеи, выступая за скоординированное замедление. Но даже читаемые цепочки рассуждений помогают в надзоре лишь до тех пор, пока модели не научатся ими манипулировать. Microsoft признаёт это ограничение: причины, которые называет модель, не обязаны достоверно объяснять её реальные действия. Одни только читаемые рассуждения проблему контроля не решают.

Базовая идея кодекса перекликается с конституцией Anthropic для Claude, где документ верхнего уровня задаёт поведение модели. Anthropic уже использует свою конституцию для генерации синтетических обучающих данных, включая диалоги, ответы и оценки этих ответов. Но в вопросе о том, как модели видят сами себя, компании расходятся резко. ИИ Microsoft не должен имитировать сознание или заявлять о наличии чувств и внутренней мотивации. Компания отвергает любые претензии моделей на права или благополучие. Anthropic, напротив, описывает Claude как сущность нового типа и хочет поддерживать у него устойчивую идентичность — отчасти ради безопасности. Её конституция оставляет открытыми вопросы возможного субъективного опыта и морального статуса: Claude не должен видеть себя ни человеком, ни простым объектом. Есть и исследование Anthropic о «функциональных эмоциях»: во внутренних представлениях Claude Sonnet 4.5 обнаружены концепты эмоций, влияющие на поведение. Это функциональные механизмы, а не доказательство субъективно переживаемых чувств, но Anthropic считает разумным учитывать их в работе по безопасности. Сулейман, напротив, давно предупреждает против очеловечивания ИИ. В эссе он призывал намеренно убирать из продуктов иллюзию сознания и ссылался на исследования Anthropic о правах и благополучии ИИ. По его словам, у ИИ-агентов не должно быть больше прав и свобод, чем у его ноутбука.