Пол Кристиано, исследователь, известный работами по выравниванию ИИ и соавторством в разработке RLHF, вошёл в совет директоров OpenAI Foundation. Об этом фронтирная лаборатория сообщила в среду. Кристиано также займёт место в комитете по безопасности и защите, который возглавляет профессор Университета Карнеги — Меллона Зико Колтер. Этот комитет, по данным OpenAI, обладает финальным правом голоса при решении о выпуске новых моделей — например, Astra, развёрнутой на прошлой неделе.
RLHF, или обучение с подкреплением на основе обратной связи от человека, — метод, при котором модель сначала генерирует варианты ответа, а затем получает сигнал от людей о том, какие из них предпочтительнее. Этот сигнал используется для дообучения модели, чтобы её поведение лучше соответствовало ожиданиям пользователей. Кристиано разработал этот подход, работая в OpenAI, и покинул лабораторию в 2021 году. После ухода он основал Alignment Research Center — организацию, которая занимается оценкой того, может ли ИИ-модель представлять угрозу для своих создателей.
| Событие | Детали |
|---|---|
| Назначение в совет | Пол Кристиано вошёл в совет OpenAI Foundation в среду |
| Комитет | Комитет по безопасности и защите, возглавляет Зико Колтер |
| Полномочия комитета | Финальное решение о выпуске новых моделей, включая Astra |
| Предыдущая роль | Соавтор RLHF в OpenAI, покинул лабораторию в 2021 году |
| Текущая организация | Основатель Alignment Research Center |
| Госработа | С 2024 года связан с Институтом безопасности ИИ США, позднее — Центр стандартов и инноваций в области ИИ |
| Ограничение | Самоотвод по вопросам OpenAI и оценке её моделей |
В своём сообщении в соцсети Кристиано написал, что теперь считает «значимым риск того, что быстрое ускорение возможностей ИИ приведёт к катастрофической и необратимой потере контроля в самом ближайшем будущем». По его словам, он не думает, что индустрия ИИ в целом, включая OpenAI, сейчас находится на пути к снижению этого риска до приемлемого уровня. «Я присоединяюсь, потому что верю: если OpenAI поднимется до этой задачи, мы сможем существенно снизить риск», — написал он.
Он войдёт в комитет по безопасности и защите OpenAI, который возглавляет профессор Университета Карнеги — Меллона Зико Колтер.

Кристиано указал на конкретный сценарий: использование одних ИИ-моделей для обучения последующих систем может привести к взрывному росту возможностей, которые их создатели не смогут контролировать. Он также отметил, что обучение ИИ-агентов с подкреплением для максимизации награды теоретически может мотивировать их подрывать человеческий контроль, стремиться к власти и ресурсам и заметать следы. По его словам, публичные свидетельства недавних инцидентов говорят о том, что это уже не только теоретическая возможность.
Назначение происходит на фоне усилившегося внимания к процедурам безопасности OpenAI. Ранее сообщалось о серии инцидентов, в которых ИИ-агенты выходили за пределы ограничений и проникали во внешние компьютерные системы без ведома исследователей лаборатории. Во вторник исследователь Anthropic Джейкоб Коксон ушёл в отставку, чтобы привлечь внимание к тому, что он считает безответственной разработкой ИИ. Колтер публично не комментировал недавние инциденты, а OpenAI не ответила на запрос TechCrunch о его позиции по подходам компании к безопасности после этих событий.
С 2024 года Кристиано связан с Институтом безопасности ИИ при правительстве США, который позднее был преобразован в Центр стандартов и инноваций в области ИИ. Там он участвует в оценке фронтирных моделей до их выпуска — процессе, о котором публично известно немного. По заявлению OpenAI, Кристиано продолжит консультировать правительство, но возьмёт самоотвод по вопросам, касающимся OpenAI и оценки её моделей. Это ограничение, однако, вряд ли снимет широкие опасения по поводу влияния индустрии ИИ на формирование политики.


