Microsoft опубликовала документ, который задаёт правила поведения для всех её ИИ-моделей. Кодекс начинается с прогноза: в ближайшее десятилетие сверхразумные системы превзойдут человека в большинстве задач. «Сдерживание, контроль и выравнивание такой мощной силы — один из величайших вызовов, с которыми когда-либо сталкивалось человечество», — говорится в документе. Компания прямо формулирует, зачем создаёт эти системы и как намерена их контролировать.
Кодекс состоит из двух уровней. Первый — общие принципы: модели должны поддерживать человека, а не заменять его, и способствовать его развитию. Второй — конкретные ограничения, которые реализуют эти принципы на практике. Ключевая особенность: у каждой модели есть общий кодекс, который имеет приоритет над предпочтениями отдельных пользователей и любыми конкретными задачами. Иными словами, запрос пользователя не может отменить базовые запреты.
| Запрет | Что именно запрещено |
|---|---|
| Кибератаки | Модели не должны участвовать в атаках на системы |
| Ядерное оружие | Запрет на содействие разработке ядерного оружия |
| Дипфейки | Запрет на создание синтетических видео и аудио, имитирующих людей |
| Обход надзора | Запрет на адаптивные, обманные, самоусиливающиеся и коллюзионные механизмы для выхода из-под контроля человека |
Среди этих запретов — «абсолютные ограничения». Моделям Microsoft запрещено участвовать в кибератаках, разработке ядерного оружия и создании дипфейков. Отдельно прописан запрет на потерю контроля: модели не должны использовать адаптивные, обманные, самоусиливающиеся или коллюзионные механизмы, чтобы обходить или побеждать человеческий надзор. Цель — сохранить возможность надёжно управлять моделью, изменять её и отключать уполномоченными людьми или системами.
Документ запрещает моделям использовать скрытые, обманные или самоусиливающиеся механизмы, чтобы выходить из-под контроля человека.

Публикация появилась на фоне резкого роста внимания к безопасности ИИ. За последнее время произошла серия инцидентов с вышедшими из-под контроля агентами, а сотрудник Anthropic внезапно уволился, сославшись на растущий риск того, что ИИ приведёт к вымиранию человечества. Microsoft вместе с Anthropic, OpenAI и xAI в целом поддержала подход осознанного замедления разработки. Отдельно компания высказалась за «встроенных оценщиков» в лабораториях ИИ — специалистов, которые следят за поведением моделей изнутри процесса.
«Мы приветствуем исследования, внимание и осознанное замедление, необходимое для того, чтобы выравнивание было сделано правильно как цель дизайна, — написал в сети генеральный директор Microsoft Сатья Наделла. — Мы также приветствуем идеи вроде „встроенных оценщиков“ и более широкие усилия по созданию механизмов, которые сделают это не просто разговорами».
Кодекс Microsoft отличается от недавнего призыва главы Anthropic Дарьо Амодеи замедлить развитие передового ИИ. Документ Microsoft менее высокоуровневый: он описывает ценности и красные линии, которыми руководствуются при обучении моделей внутри Microsoft ИИ. При этом это один из наиболее подробных публичных документов о том, как крупная компания подходит к безопасности ИИ и как эти идеи применяются на практике.



