OpenAI в system card для новой модели GPT-6 Astra сообщает о существенном снижении числа фактических ошибок по сравнению с предшественницей GPT-5.6 Sol. Тестирование проводилось на диалогах ChatGPT, которые пользователи пометили как содержащие неверные ответы, — то есть выборка заведомо сложных случаев, и показатели не отражают типичное повседневное использование. Тем не менее Astra воспроизводила отмеченные ошибки значительно реже, особенно при низкой задержке и малом числе шагов рассуждения.
Отдельно OpenAI оценила устойчивость модели к prompt-инъекциям — атакам, при которых злоумышленник внедряет в запрос или документ скрытые инструкции, способные перехватить управление моделью. Против прямых инъекций, когда пользователь сам пытается манипулировать моделью через свой запрос, Astra демонстрирует почти идеальную защиту: 99,99% отражённых атак. Компания связывает это с методом GPT-Red — автоматизированным «атакующим», который ужесточает модель в процессе обучения. Устойчивость к джейлбрейкам также высока: на фиксированном наборе известных атак, направленных на получение вредных ответов по биологии, насилию и кибербезопасности, Astra отказывается помочь в 91,5–98,3% случаев.
| Модель | Успешность скрытых атак (IPI Arena, 15 попыток) |
|---|---|
| GPT-6 Astra | 8,5% |
| GPT-5.6 Sol | 27% |
| Claude Opus 5 | 4,8% |
Однако при адаптивных атаках, когда злоумышленник меняет стратегию в ходе многораундового диалога, защита Astra падает до 67%. Это означает, что настойчивый противник может добиться хотя бы одного проблемного ответа примерно в одном из трёх случаев. Предшествующие модели на том же тесте набирали менее 50%. Важно, что тесты проводились на «голой» модели без продакшен-слоёв безопасности, таких как классификаторы, которые устанавливаются в реальном продукте.
Прямые prompt-инъекции Astra отражает в 99,99% случаев благодаря методу GPT-Red, но адаптивные атаки снижают защиту до 67%.

Наибольшую тревогу вызывают скрытые (непрямые) инъекции, когда атака спрятана в документе, который ИИ читает. Внешнее тестирование компании Gray Swan, использовавшей 1810 атак из своего набора IPI Arena, показало: при 15 попытках на сценарий Astra была взломана хотя бы раз в 8,5% случаев. Для сравнения, GPT-5.6 Sol провалилась в 27% случаев, а Claude Opus 5 от Anthropic — в 4,8%. Показатели Gray Swan за первый и второй кварталы оказались выше, чем в более ранних тестах: Anthropic ранее сообщала о 2% успешных атак для Opus 5 на основе более лёгкого Q1-теста, где GPT-5.6 Sol также набирала лишь 20%. Разница может объясняться тем, что Anthropic тестировала модели с расширенным рассуждением, а также более широким охватом теста.
Хотя Gray Swan использовала курируемые, вручную отобранные атаки, эти результаты должны насторожить корпоративных заказчиков. Astra поддаётся скрытым инъекциям примерно в одном из двенадцати сценариев, Opus 5 — в одном из двадцати одного. Риск растёт по мере того, как ИИ-агенты получают возможность самостоятельно писать код, управлять инструментами и контролировать компьютеры, а также работать круглосуточно и в масштабе, обрабатывая документы как одну из основных задач. Проблема скрытых инъекций остаётся нерешённой даже для самых продвинутых моделей, что ограничивает их применение в критически важных сценариях без дополнительных мер безопасности.



