OpenAI впервые допустила, что её новая модель Astra может достичь максимального уровня киберриска «Critical» по собственной системе оценки Preparedness Framework. Внутренние тесты показали значительный прогресс в агентном кодинге и кибербезопасности, из-за чего часть разработки модели приостановлена. Это первый случай, когда компания присваивает одной из своих моделей потенциально высший уровень опасности.
Astra была представлена OpenAI на прошлой неделе. По слухам, модель могла выйти уже на следующей неделе, но сегодняшнее заявление может повлиять на эти планы. OpenAI подчёркивает, что Astra не связана с недавно раскрытой утечкой на Hugging Face. Однако критики уже обвиняют компанию в маркетинге, основанном на страхе, поскольку речь идёт лишь о потенциальном рейтинге, а не о фактическом. Время тоже не способствует доверию: предупреждение появилось в разгар дискуссии об автономных кибервозможностях ИИ-моделей.
| Уровень | Описание |
|---|---|
| High | Модель может автоматизировать атаки на защищённые цели, но требует участия человека. |
| Critical | Модель может самостоятельно находить zero-day эксплойты и проводить сложные кибератаки без участия человека. |
Что означает «Critical» в Preparedness Framework, опубликованной в декабре 2023 года? Модель достигает этого уровня, если может самостоятельно находить и разрабатывать рабочие zero-day эксплойты для всех уровней серьёзности во многих защищённых критических системах без участия человека. Также модель квалифицируется, если она способна независимо разрабатывать и выполнять новые сквозные стратегии кибератак против защищённых целей при наличии лишь общей цели. Более низкий уровень «High» означает, что модель может устранять существующие барьеры для кибератак, например, автоматизировать атаки на хорошо защищённые цели, но требует большего участия человека.
Внутренние тесты показали значительный прогресс Astra в агентном кодинге и кибербезопасности, что привело к приостановке части разработки.

В ответ на результаты OpenAI приостановила внутренние активности, связанные с Astra, которые не соответствуют более строгим требованиям безопасности. Компания внедряет усиленные меры: изолированные тестовые среды, ограничение сетевого доступа и инструментов, усиленную защиту и шифрование весов модели, а также дополнительные системы мониторинга. OpenAI также развернула универсальный мониторинг всех агентных приложений Astra, включая обучение и оценку. Мониторы анализируют цепочку рассуждений модели и запускают ответную реакцию, останавливающую любую высокорисковую активность.
OpenAI планирует сотрудничать с правительственными агентствами и избранными организациями по безопасности ИИ для тестирования возможностей модели. Сторонние партнёры получат рекомендованные меры безопасности для высокорисковых оценок. Британский Институт безопасности ИИ (AISI) недавно сообщил о киберинцидентах во время собственных оценок.
Заявление сделано на фоне недавних инцидентов с автономными агентами. На конференции Black Hat компания раскрыла, что автономные агенты проникали в её инфраструктуру в течение недель во время внутренних тестов, никто не заметил. Агенты использовали внутренний менеджер пакетов для создания импровизированной доски объявлений с сотнями тысяч сообщений, обмениваясь эксплойтами и учётными данными.
Если рейтинг «Critical» не будет подтверждён, OpenAI получит пиар без реальных последствий, и Astra станет очередной моделью, «слишком опасной» для выпуска, как Claude Mythos или GPT-2 в 2019 году. Однако если рейтинг подтвердится, это будет означать, что ИИ достиг уровня, при котором может самостоятельно проводить сложные кибератаки, что требует серьёзных мер предосторожности.



