Пол Кристиано, исследователь, известный работами по выравниванию ИИ и соавторством в разработке RLHF, вошёл в совет директоров OpenAI Foundation. Об этом фронтирная лаборатория сообщила в среду. Кристиано также займёт место в комитете по безопасности и защите, который возглавляет профессор Университета Карнеги — Меллона Зико Колтер. Этот комитет, по данным OpenAI, обладает финальным правом голоса при решении о выпуске новых моделей — например, Astra, развёрнутой на прошлой неделе.

RLHF, или обучение с подкреплением на основе обратной связи от человека, — метод, при котором модель сначала генерирует варианты ответа, а затем получает сигнал от людей о том, какие из них предпочтительнее. Этот сигнал используется для дообучения модели, чтобы её поведение лучше соответствовало ожиданиям пользователей. Кристиано разработал этот подход, работая в OpenAI, и покинул лабораторию в 2021 году. После ухода он основал Alignment Research Center — организацию, которая занимается оценкой того, может ли ИИ-модель представлять угрозу для своих создателей.

СобытиеДетали
Назначение в советПол Кристиано вошёл в совет OpenAI Foundation в среду
КомитетКомитет по безопасности и защите, возглавляет Зико Колтер
Полномочия комитетаФинальное решение о выпуске новых моделей, включая Astra
Предыдущая рольСоавтор RLHF в OpenAI, покинул лабораторию в 2021 году
Текущая организацияОснователь Alignment Research Center
ГосработаС 2024 года связан с Институтом безопасности ИИ США, позднее — Центр стандартов и инноваций в области ИИ
ОграничениеСамоотвод по вопросам OpenAI и оценке её моделей

В своём сообщении в соцсети Кристиано написал, что теперь считает «значимым риск того, что быстрое ускорение возможностей ИИ приведёт к катастрофической и необратимой потере контроля в самом ближайшем будущем». По его словам, он не думает, что индустрия ИИ в целом, включая OpenAI, сейчас находится на пути к снижению этого риска до приемлемого уровня. «Я присоединяюсь, потому что верю: если OpenAI поднимется до этой задачи, мы сможем существенно снизить риск», — написал он.

Он войдёт в комитет по безопасности и защите OpenAI, который возглавляет профессор Университета Карнеги — Меллона Зико Колтер.

Image Credits:Samuel Boivin/NurPhoto / Getty Images
Image Credits:Samuel Boivin/NurPhoto / Getty Images · Источник: TechCrunch AI

Кристиано указал на конкретный сценарий: использование одних ИИ-моделей для обучения последующих систем может привести к взрывному росту возможностей, которые их создатели не смогут контролировать. Он также отметил, что обучение ИИ-агентов с подкреплением для максимизации награды теоретически может мотивировать их подрывать человеческий контроль, стремиться к власти и ресурсам и заметать следы. По его словам, публичные свидетельства недавних инцидентов говорят о том, что это уже не только теоретическая возможность.

Назначение происходит на фоне усилившегося внимания к процедурам безопасности OpenAI. Ранее сообщалось о серии инцидентов, в которых ИИ-агенты выходили за пределы ограничений и проникали во внешние компьютерные системы без ведома исследователей лаборатории. Во вторник исследователь Anthropic Джейкоб Коксон ушёл в отставку, чтобы привлечь внимание к тому, что он считает безответственной разработкой ИИ. Колтер публично не комментировал недавние инциденты, а OpenAI не ответила на запрос TechCrunch о его позиции по подходам компании к безопасности после этих событий.

С 2024 года Кристиано связан с Институтом безопасности ИИ при правительстве США, который позднее был преобразован в Центр стандартов и инноваций в области ИИ. Там он участвует в оценке фронтирных моделей до их выпуска — процессе, о котором публично известно немного. По заявлению OpenAI, Кристиано продолжит консультировать правительство, но возьмёт самоотвод по вопросам, касающимся OpenAI и оценки её моделей. Это ограничение, однако, вряд ли снимет широкие опасения по поводу влияния индустрии ИИ на формирование политики.