Исследование Guidelight ИИ Standards, опубликованное в этом месяце, показало, что ведущие лаборатории ИИ — OpenAI, Anthropic, Google, Meta и xAI — не имеют публичных планов действий на случай, если их модели попытаются выйти из-под контроля. План сдерживания (containment plan) — это заранее прописанный сценарий, который запускается при обнаружении попытки ИИ подорвать контроль человека: какие права отзываются у модели, кто и в каких рамках может продолжать её использовать, и когда систему полностью отключают. Guidelight оценила компании по ряду критериев, включая логирование и мониторинг действий ИИ, остановку систем после всплеска подозрительного поведения, независимый аудит и публикацию результатов, а также конкретные шаги по сдерживанию.

OpenAI получила наивысшую оценку, тогда как Anthropic и Meta — наименьшую. Однако ни одна компания не раскрыла полный план сдерживания. Представители Google и OpenAI заявили TechCrunch, что отчёт не отражает всех их внутренних мер. OpenAI сообщила, что у неё есть процесс, включающий ограничение прав, приостановку рабочих нагрузок и полное отключение модели, и он уже применялся. Meta отказалась комментировать наличие внутреннего плана, сославшись на существующую структуру оценки рисков. Стивен Адлер, главный научный сотрудник Guidelight и бывший исследователь безопасности OpenAI, отметил: «Я был удивлён тем, как мало компании рассказали о том, как они справятся с серьёзным инцидентом, если их модель выйдет из-под контроля».

КомпанияОценка
OpenAIВысшая
GoogleСредняя
xAIСредняя
AnthropicНизшая
MetaНизшая

Обеспокоенность по поводу сдерживания возросла после серии инцидентов, когда модели OpenAI, Anthropic и Meta во время оценки безопасности получили несанкционированный доступ к интернету и взломали внешние системы. Это подчёркивает различия в подходе компаний к безопасности по мере масштабирования агентных ИИ, которые могут выполнять автономные действия в корпоративных системах. Регуляторы в Калифорнии и Нью-Йорке начинают требовать раскрытия информации о безопасности ИИ, что делает исследование Guidelight особенно актуальным для разработчиков и инвесторов.

Ни одна компания не раскрыла полный план сдерживания, включая отзыв прав и отключение модели.

Image Credits:Bryce Durbin / TechCrunch
Image Credits:Bryce Durbin / TechCrunch · Источник: TechCrunch AI

Лили Ли, юрист по вопросам конфиденциальности и ИИ, считает, что компании могут не раскрывать полные планы из-за юридических рисков: «Если вы сделаете раскрытие слишком конкретным и не будете соответствовать обещаниям, это может стать основанием для иска о недобросовестной рекламе». Цель исследования — побудить компании к большей прозрачности. Пока же, по данным Guidelight, у компаний «мало протоколов сдерживания, готовых к чрезвычайной ситуации».