Некоммерческая организация Guidelight, основанная бывшими руководителями по безопасности OpenAI Пейдж Хедли и Стивеном Адлером, опубликовала первую оценку того, насколько ведущие лаборатории ИИ контролируют собственные системы. Проверка охватила Anthropic, OpenAI, Google, xAI и Meta. Вывод неутешительный: ни одна компания не применяет в полном объеме даже базовые меры предосторожности.
Guidelight анализировала только публичные источники — системные карты, отчеты о безопасности и корпоративные блоги. Оценивались шесть практик: логирование внутренней активности ИИ, шлюзы для рискованных действий, аварийное отключение (так называемое «размыкание цепи»), планы по сдерживанию несогласованных моделей и другие. Лучший результат показали Anthropic и OpenAI — оценка C+. Google получила D+ с подробной дорожной картой улучшений, xAI — D−, а Meta — F. Ни одна компания не соответствует предложенным Guidelight стандартам безопасности.
| Компания | Оценка |
|---|---|
| Anthropic | C+ |
| OpenAI | C+ |
| D+ | |
| xAI | D− |
| Meta | F |
Особенно показательно, что все компании лучше всего справляются с обнаружением нежелательного поведения систем, но хуже всего — с предотвращением и сдерживанием. Это означает, что индустрия пока сосредоточена на постфактум-реагировании, а не на упреждающих мерах. Для отрасли это сигнал: даже лидеры, которые декларируют приверженность безопасности, на практике отстают от собственных заявлений.
Оценки: Anthropic и OpenAI — C+, Google — D+, xAI — D−, Meta — F.

Оценка Guidelight — не единственный подобный проект. Ранее аналогичные проверки проводили другие исследовательские группы, но Guidelight отличается тем, что фокусируется именно на внутренних процедурах контроля, а не на внешних тестах. Это важно, потому что внутренние меры — то, что компания делает до того, как система попадает к пользователям, — часто остаются за кадром.
Для читателя, который следит за развитием ИИ, этот отчет — повод задуматься о том, насколько зрелой стала индустрия. Несмотря на громкие заявления о безопасности, базовые механизмы защиты, такие как логирование и аварийное отключение, внедрены не полностью. Это не значит, что системы опасны, но это значит, что компании еще не готовы к сценариям, где контроль может понадобиться в экстренном порядке.



