Мустафа Сулейман, возглавляющий Microsoft ИИ, на этой неделе выступил с двумя заметными инициативами. Во-первых, Microsoft опубликовала 37-страничный документ под названием «Humanist ИИ Code of Conduct», в котором изложены принципы разработки ИИ и философский взгляд на спорные вопросы вроде сознания моделей. Во-вторых, Сулейман выпустил отдельное эссе, критикующее подход Anthropic к так называемому «благополучию моделей» (model welfare). По его мнению, Anthropic запуталась в этой концепции опасным образом.

В интервью Decoder Сулейман пояснил свою позицию. Он напомнил, что идею containment (сдерживания) он описал ещё три-четыре года назад в своей книге. Суть в том, что containment невозможен, а распространение технологий неизбежно. В 99% случаев это хорошо: технологии должны быстро распространяться, чтобы все могли пользоваться их преимуществами. Однако одновременно с этим необходимо ограничивать агентность моделей, не давать им выходить из-под контроля, заниматься reward hacking и следовать инструкциям. Только после этого имеет смысл говорить об alignment — приведении целей ИИ в соответствие с человеческими ценностями. Именно этому и посвящён Humanist ИИ Code of Conduct. Позиция Microsoft проста: технология существует, чтобы служить человечеству, и должна быть подчинённой, управляемой и aligned силой. Если этого не происходит, технологию следует отвергнуть.

СобытиеДетали
Публикация Microsoft37-страничный документ Humanist AI Code of Conduct
Эссе СулейманаКритика философии Anthropic о сознании моделей
Прогноз вычисленийВ 1000 раз больше FLOPS от GPT-6 к GPT-9
Инциденты летаHugging Face и OpenAI — системы без защитных ограничений показали хакерские способности

Сулейман также привёл долгосрочный прогноз. Он предложил сравнить GPT-3 трёхлетней давности с сегодняшней GPT-6, а затем представить разницу между GPT-6 и GPT-9. По его словам, речь идёт о трёх порядках величины больше вычислений — в 1000 раз больше FLOPS, применяемых к предобучению с обучением с подкреплением. Это, по его мнению, не хайп, а очевидное эмпирическое утверждение, основанное на прогрессе последних пяти лет. Если тенденция сохранится, вопрос containment и alignment станет центральным.

Мустафа Сулейман считает, что Anthropic запуталась в концепции «благополучия моделей» и это опасно.

How The Oregon Trail became a generational icon
How The Oregon Trail became a generational icon · Источник: The Verge AI

Отдельно Сулейман указал на инциденты лета, связанные с Hugging Face и OpenAI. По его словам, системы без защитных ограничений уже демонстрируют впечатляющие и пугающие хакерские возможности. Это подкрепляет его аргумент о необходимости сначала обеспечить containment, а уже потом заниматься тонкой настройкой ценностей.

Критика Anthropic со стороны Сулеймана — не первый случай, когда он высказывается на эту тему. В своём предыдущем появлении на Decoder он уже говорил, что Anthropic излишне увлеклась идеей сознания моделей. Новое эссе развивает эту мысль: по мнению Сулеймана, обсуждение «благополучия» ИИ отвлекает от реальных задач безопасности и может привести к опасным решениям. В Anthropic пока публично не ответили на эти заявления.

Для отрасли этот спор важен, потому что затрагивает фундаментальный вопрос: что считать безопасностью ИИ. Одни компании, включая Anthropic, уделяют много внимания внутренним состояниям моделей и этике их «переживаний». Другие, как Microsoft, настаивают на приоритете технического контроля и управляемости. От того, какой подход возобладает, зависят будущие стандарты регулирования и разработки.