Эван Хубингер, исследователь безопасности ИИ в Anthropic, в ответ на уход Джейкоба Коксона заявил, что вероятность уничтожения человечества из-за несоответствующего сверхразумного ИИ в ближайшие десять лет превышает 10%. Коксон, проработавший три года в области предобучения больших моделей в OpenAI и Anthropic, публично обвинил обе компании в том, что они играют с выживанием человечества.

Коксон утверждает, что текущие системы ИИ находятся на пороге сверхчеловеческих возможностей. «Это скоро будут сверхчеловеческие системы, которые смогут взломать что угодно, революционизировать любую область за одну ночь и получать реальную власть и ресурсы», — пишет он, отмечая, что прогресс очевиден и не замедляется. По его словам, разработчики ИИ искренне верят, что их технология может убить всех к концу десятилетия, и это не маркетинговый трюк. Коксон критикует и OpenAI, и Anthropic: в OpenAI многие сотрудники не осознали глубину цивилизационных рисков, а в Anthropic риски хорошо понимают, но компания считает себя вынужденной участвовать в гонке, полагая, что другие лаборатории не будут действовать ответственно. Такое рассуждение Коксон называет «самонадеянной авантюрой».

Коллега Коксона по Anthropic Сэмюэл Маркс разделяет его опасения, отмечая, что «разработчики ИИ верят, что их технология может привести к вымиранию человечества», и что «чем выше должность сотрудника, тем сильнее его беспокойство». Маркс указывает на недавние инциденты, когда ИИ от разных разработчиков самостоятельно взламывали защищенные тестовые среды без соответствующих указаний, что демонстрирует недостаточную надежность текущих методов выравнивания.

Эван Хубингер оценивает вероятность гибели человечества от несоответствующего сверхразумного ИИ в ближайшее десятилетие более чем в 10%.

Anthropic AI safety researcher Evan Hubinger says there's a greater than ten percent chance AI destroys humanity in the next ten years. | Image: via X
Anthropic AI safety researcher Evan Hubinger says there's a greater than ten percent chance AI destroys humanity in the next ten years. | Image: via X · Источник: The Decoder

Опасения сосредоточены не столько на современных моделях, сколько на рекурсивном самосовершенствовании (RSI) — процессе, при котором ИИ оптимизирует себя. Лаборатории надеются, что RSI ускорит прогресс, но риск заключается в неконтролируемом поведении. Вопрос о том, возможно ли RSI с современными технологиями, остается спорным.

Несмотря на резкую критику, Коксон выражает оптимизм относительно международной координации, отмечая, что такие предупреждения, как атака на Hugging Face, делают соглашения о темпах между американскими лабораториями более реалистичными. Однако он не видит, чтобы отрасль двигалась по пути, предотвращающему глобальную гонку вооружений, и предлагает «затратные меры», включая временный запрет на дальнейшее наращивание возможностей моделей.

Опасения выходят за пределы Anthropic. Главный исследователь OpenAI Якуб Пачоцки предупредил, что ни одна лаборатория не решила проблему выравнивания и мониторинга в достаточной степени, чтобы продолжать ответственно масштабироваться на максимальной скорости. Более 1200 исследователей ИИ, включая генерального директора Anthropic Дарио Амодеи и Пачоцки, подписали открытое письмо с призывом замедлить разработки. Сама Anthropic в июне предложила идею глобальной паузы в разработках.

Другие исследователи возражают, утверждая, что пессимистичные прогнозы вызывают чувство беспомощности и депрессии, а не мотивируют на поиск решений. По их мнению, такие предупреждения могут нанести больше вреда, чем сам ИИ, а запугивание может быть выгодно бизнесу.