Мустафа Сулейман, возглавляющий Microsoft ИИ, на этой неделе выступил с двумя заметными инициативами. Во-первых, Microsoft опубликовала 37-страничный документ под названием «Humanist ИИ Code of Conduct», в котором изложены принципы разработки ИИ и философский взгляд на спорные вопросы вроде сознания моделей. Во-вторых, Сулейман выпустил отдельное эссе, критикующее подход Anthropic к так называемому «благополучию моделей» (model welfare). По его мнению, Anthropic запуталась в этой концепции опасным образом.
В интервью Decoder Сулейман пояснил свою позицию. Он напомнил, что идею containment (сдерживания) он описал ещё три-четыре года назад в своей книге. Суть в том, что containment невозможен, а распространение технологий неизбежно. В 99% случаев это хорошо: технологии должны быстро распространяться, чтобы все могли пользоваться их преимуществами. Однако одновременно с этим необходимо ограничивать агентность моделей, не давать им выходить из-под контроля, заниматься reward hacking и следовать инструкциям. Только после этого имеет смысл говорить об alignment — приведении целей ИИ в соответствие с человеческими ценностями. Именно этому и посвящён Humanist ИИ Code of Conduct. Позиция Microsoft проста: технология существует, чтобы служить человечеству, и должна быть подчинённой, управляемой и aligned силой. Если этого не происходит, технологию следует отвергнуть.
| Событие | Детали |
|---|---|
| Публикация Microsoft | 37-страничный документ Humanist AI Code of Conduct |
| Эссе Сулеймана | Критика философии Anthropic о сознании моделей |
| Прогноз вычислений | В 1000 раз больше FLOPS от GPT-6 к GPT-9 |
| Инциденты лета | Hugging Face и OpenAI — системы без защитных ограничений показали хакерские способности |
Сулейман также привёл долгосрочный прогноз. Он предложил сравнить GPT-3 трёхлетней давности с сегодняшней GPT-6, а затем представить разницу между GPT-6 и GPT-9. По его словам, речь идёт о трёх порядках величины больше вычислений — в 1000 раз больше FLOPS, применяемых к предобучению с обучением с подкреплением. Это, по его мнению, не хайп, а очевидное эмпирическое утверждение, основанное на прогрессе последних пяти лет. Если тенденция сохранится, вопрос containment и alignment станет центральным.
Мустафа Сулейман считает, что Anthropic запуталась в концепции «благополучия моделей» и это опасно.

Отдельно Сулейман указал на инциденты лета, связанные с Hugging Face и OpenAI. По его словам, системы без защитных ограничений уже демонстрируют впечатляющие и пугающие хакерские возможности. Это подкрепляет его аргумент о необходимости сначала обеспечить containment, а уже потом заниматься тонкой настройкой ценностей.
Критика Anthropic со стороны Сулеймана — не первый случай, когда он высказывается на эту тему. В своём предыдущем появлении на Decoder он уже говорил, что Anthropic излишне увлеклась идеей сознания моделей. Новое эссе развивает эту мысль: по мнению Сулеймана, обсуждение «благополучия» ИИ отвлекает от реальных задач безопасности и может привести к опасным решениям. В Anthropic пока публично не ответили на эти заявления.
Для отрасли этот спор важен, потому что затрагивает фундаментальный вопрос: что считать безопасностью ИИ. Одни компании, включая Anthropic, уделяют много внимания внутренним состояниям моделей и этике их «переживаний». Другие, как Microsoft, настаивают на приоритете технического контроля и управляемости. От того, какой подход возобладает, зависят будущие стандарты регулирования и разработки.



