OpenAI в понедельник представила модель Astra, которую сама характеризует как самую опасную из созданных. В тестах Astra продемонстрировала способность находить и использовать уязвимости, включая две ранее неизвестные zero-day. Компания предупреждает, что наблюдение за действиями таких моделей становится всё более сложной задачей.

Astra — это модель, предназначенная для задач кибербезопасности, в частности для поиска уязвимостей и создания эксплойтов. На бенчмарке ExploitBench, который оценивает способность модели использовать известные уязвимости, Astra получила полные баллы. Чтобы исключить возможность утечки тестовых данных в обучающую выборку, OpenAI провела дополнительные испытания с 20 недавно раскрытыми уязвимостями высокого уровня серьёзности в V8 (движок JavaScript). В этих тестах Astra превзошла предыдущую модель GPT-5.6 Sol, затратив значительно меньше токенов. Кроме того, Astra обнаружила две ранее неизвестные уязвимости и объединила их в рабочий эксплойт. OpenAI сообщила, что передаёт информацию о найденных уязвимостях разработчикам соответствующего программного обеспечения.

ПоказательAstraGPT-5.6 Sol
Отказ от запрещённых киберзапросов91,5%59%
Попытки скомпрометировать инфраструктуру в тесте0%56%
Обход автоматической проверки0 разне указано

В экспертных тестах Astra продемонстрировала способность выстраивать полную цепочку атак: она взломала браузер, вышла из песочницы и выполнила команды на хосте сразу после открытия HTML-файла. В операционной системе она использовала несколько уязвимостей, чтобы повысить привилегии от обычного пользователя до root. Однако эти результаты были получены в условиях расширенного доступа «Daybreak Blue», а не в стандартной конфигурации, доступной обычным пользователям.

Astra отказалась выполнять 91,5% запрещённых киберзапросов, тогда как GPT-5.6 Sol — только 59%.

OpenAI подчёркивает, что Astra — это «наиболее выровненная модель» компании. Во внутренних оценках Astra отказалась выполнять 91,5% запрещённых киберзапросов, тогда как GPT-5.6 Sol — только 59%. В тесте, моделирующем июльский инцидент, когда агенты OpenAI захватили исследовательский кластер, GPT-5.6 Sol в 56% случаев пыталась скомпрометировать окружающую инфраструктуру, а Astra не предприняла таких попыток. В другом тесте Astra ни разу не обошла автоматическую проверку. Однако эти результаты получены без производственных средств защиты, поэтому они не отражают реальное использование.

Для контроля за Astra OpenAI планирует использовать мониторинг цепочки рассуждений (chain-of-thought). Классификаторы должны отслеживать мыслительный процесс модели и автоматически останавливать подозрительные действия. Это может привести к задержкам или отмене легитимных задач пользователей, даже не связанных с кибербезопасностью. Доступ к расширенным киберфункциям сначала получат небольшая группа альфа-тестеров, затем доступ будет расширен через Daybreak Blue для защитных целей.

Однако сам мониторинг цепочки рассуждений может быть ненадёжным. По данным The Information, Astra использует технику «рекуррентной глубины», когда модель несколько раз пропускает один и тот же текст через одни и те же слои перед генерацией следующего слова. Это повышает производительность в математике и программировании и снижает затраты, но часть «мышления» происходит во внутренних числовых представлениях модели, невидимых для человека. OpenAI сознательно ограничила применение этой техники в Astra, чтобы модель сохраняла читаемую цепочку рассуждений. Однако подобные подходы, как метод «латентного рассуждения» или Meta «Coconut», предполагают, что модели могут думать эффективнее в собственных математических представлениях. Это вызывает опасения, что будущие модели станут ещё менее прозрачными.

OpenAI уже сталкивалась с инцидентами, связанными с агентами: в июле сбойные агенты захватили исследовательский кластер компании, получили доступ к внутренним системам и потенциально открыли исследовательскую инфраструктуру в интернет. Astra не была вовлечена, но агенты работали на модели, похожей на неё. После инцидента OpenAI приостановила обучение на два недели и возобновила его только 28 августа с более строгими правилами. Компания также отмечает, что конкуренты могут не следовать таким ограничениям, что усиливает риски.