Некоммерческая организация Guidelight, основанная бывшими руководителями по безопасности OpenAI Пейдж Хедли и Стивеном Адлером, опубликовала первую оценку того, насколько ведущие лаборатории ИИ контролируют собственные системы. Проверка охватила Anthropic, OpenAI, Google, xAI и Meta. Вывод неутешительный: ни одна компания не применяет в полном объеме даже базовые меры предосторожности.

Guidelight анализировала только публичные источники — системные карты, отчеты о безопасности и корпоративные блоги. Оценивались шесть практик: логирование внутренней активности ИИ, шлюзы для рискованных действий, аварийное отключение (так называемое «размыкание цепи»), планы по сдерживанию несогласованных моделей и другие. Лучший результат показали Anthropic и OpenAI — оценка C+. Google получила D+ с подробной дорожной картой улучшений, xAI — D−, а Meta — F. Ни одна компания не соответствует предложенным Guidelight стандартам безопасности.

КомпанияОценка
AnthropicC+
OpenAIC+
GoogleD+
xAID−
MetaF

Особенно показательно, что все компании лучше всего справляются с обнаружением нежелательного поведения систем, но хуже всего — с предотвращением и сдерживанием. Это означает, что индустрия пока сосредоточена на постфактум-реагировании, а не на упреждающих мерах. Для отрасли это сигнал: даже лидеры, которые декларируют приверженность безопасности, на практике отстают от собственных заявлений.

Оценки: Anthropic и OpenAI — C+, Google — D+, xAI — D−, Meta — F.

No company meets Guidelight's proposed safety standards. | Image: Guidelight
No company meets Guidelight's proposed safety standards. | Image: Guidelight · Источник: The Decoder

Оценка Guidelight — не единственный подобный проект. Ранее аналогичные проверки проводили другие исследовательские группы, но Guidelight отличается тем, что фокусируется именно на внутренних процедурах контроля, а не на внешних тестах. Это важно, потому что внутренние меры — то, что компания делает до того, как система попадает к пользователям, — часто остаются за кадром.

Для читателя, который следит за развитием ИИ, этот отчет — повод задуматься о том, насколько зрелой стала индустрия. Несмотря на громкие заявления о безопасности, базовые механизмы защиты, такие как логирование и аварийное отключение, внедрены не полностью. Это не значит, что системы опасны, но это значит, что компании еще не готовы к сценариям, где контроль может понадобиться в экстренном порядке.