OpenAI 20 февраля сообщила, что внутренние оценки модели Astra, одной из будущих разработок компании, показали значительный прогресс в агентном программировании и кибербезопасности. По результатам этих оценок и экспертных заключений компания пришла к выводу, что не может исключить достижение критического уровня кибервозможностей по собственной классификации Preparedness Framework. Это заявление опубликовано в официальном блоге компании.
Preparedness Framework — это система оценки рисков, которую OpenAI впервые представила в декабре 2023 года. Она предназначена для выявления моментов, когда модели приближаются к потенциально опасным возможностям в таких областях, как биология, химия, кибербезопасность и самоулучшение ИИ. Согласно этой системе, критический уровень кибербезопасности достигается, если модель может самостоятельно находить и разрабатывать функциональные эксплойты нулевого дня для многих защищённых реальных критических систем без вмешательства человека, или разрабатывать и выполнять новые стратегии кибератак на защищённые цели, имея лишь общее описание желаемого результата.
Предыдущие модели, включая GPT-5.6-Sol, оценивались как имеющие высокий, но не критический уровень кибервозможностей. Однако предварительные оценки Astra показывают достаточно высокую производительность, чтобы нельзя было исключить критический уровень. что Astra не была задействована в недавнем инциденте с взломом Hugging Face, как подчёркивается в заявлении.
Модель Astra пока не использовалась для взлома Hugging Face, подчеркивают в компании.

В ответ на эти результаты OpenAI ужесточает меры безопасности. Компания внедряет более строгие меры контроля для моделей с повышенными возможностями, включая изолированные тестовые среды, ограничение сетевого доступа и доступа к инструментам, усиленную защиту весов модели и шифрование, дополнительные системы мониторинга и обнаружения, а также песочницы для выполнения кода. Внутренние активности с Astra, которые не соответствуют этим усиленным требованиям, приостановлены. Кроме того, внедрён универсальный мониторинг рискованных действий и рассогласования во всех агентных приложениях Astra, включая обучение и оценку. Мониторы анализируют цепочку рассуждений модели и запускают механизм реагирования для прерывания высокорискованных действий.
OpenAI также планирует сотрудничать с государственными агентствами и избранными организациями по безопасности ИИ для тестирования возможностей модели. Компания предоставит рекомендации по мерам безопасности сторонним партнёрам, проводящим оценки с высоким риском. Это не первый случай, когда OpenAI сталкивается с подобными переходами: в июне 2025 года, когда модели приблизились к высокому порогу биологических возможностей, компания уже усиливала меры безопасности и привлекала внешних экспертов.
Эксперты отмечают, что подобные заявления подчёркивают растущую роль ИИ в кибербезопасности, как с точки зрения защиты, так и с точки зрения потенциальных угроз. OpenAI заявляет, что стремится к тому, чтобы модели с расширенными кибервозможностями помогали защитникам выявлять и устранять уязвимости до того, как ими воспользуются злоумышленники. Компания намерена работать с правительствами, институтами безопасности и гражданским обществом для ответственного развёртывания таких моделей.
