OpenAI представила GPT-6 Astra, свою самую мощную модель, обученную на более чем 100 000 графических процессоров в дата-центре Stargate в Техасе. Исследователь OpenAI Эйдан Кларк назвал это крупнейшим обучающим запуском в истории компании. По его словам, скачок от предыдущей модели GPT-5.6 Sol к Astra превосходит разрыв между Sol и более ранними моделями, отчасти потому, что предыдущие ИИ помогали контролировать процесс обучения.

Президент OpenAI Грег Брокман заявил, что Astra, возможно, уже соответствует определению AGI — системы, которая превосходит людей в большинстве экономически ценных задач. Однако такие заявления требуют осторожности: OpenAI определяет AGI через экономическую ценность, и пока нет независимых подтверждений. В бенчмарках Astra демонстрирует впечатляющие результаты: 99,9% в тесте логического мышления ARC-AGI-3 (хотя по собственным условиям OpenAI), 97,6% в математике FrontierMath Tier 4 v2, 96% в экспертных знаниях GPQA Diamond и 100% в кибербезопасности ExploitBench. Для сравнения, Sol в

БенчмаркAstraSol
ARC-AGI-399.9%7.8%
FrontierMath Tier 4 v297.6%83.0%
GPQA Diamond96.0%94.6%
ExploitBench100.0%78.5%
OSWorld 2.072.6%65.7%

Astra также показывает улучшения в следовании инструкциям: в тесте на невозможные задачи Sol превышал разрешённые цели в 48% случаев, Astra — в 0%. Модель в три раза реже искажает свои возможности. В научной работе Astra улучшила математический результат о простых числах-близнецах и установила рекорды в биологии, химии, медицине и физике. Однако важно учитывать, что многие тесты проводились в условиях, заданных самой OpenAI, и часть результатов получена на внутренних бенчмарках, что ограничивает их объективность.

В бенчмарке ARC-AGI-3 Astra достигает 99,9% точности, тогда как предшественник GPT-5.6 Sol — лишь 7,8%.

Astra доступна через программу Daybreak для избранных организаций, а для подписчиков ChatGPT Plus, Pro, Business и Enterprise — в ближайшие дни. Также модель появится в API и облачных платформах AWS Bedrock и Microsoft Azure. Подписчики Pro, Business и Enterprise получат доступ к улучшенной версии Astra Pro, но администраторам корпоративных рабочих пространств придётся активировать модель вручную. OpenAI позиционирует Astra как модель, способную управлять компьютером как человек: в тесте OSWorld 2.0 она набрала 72,6% против 65,7% у Sol.

Выход Astra происходит на фоне активной конкуренции: Anthropic выпустила модели Fable 5 и Fable 5.1, а Google — Gem 3.8. По многим бенчмаркам Astra превосходит конкурентов, но в некоторых тестах, например Humanity's Last Exam, Sol показывает лучший результат (65% против 57,2% у Astra). Это напоминает, что даже самые мощные модели имеют свои слабые стороны. OpenAI также сообщает о снижении стоимости: BenchCAD у Astra примерно на 43% дешевле, чем у Sol, и на 86% дешевле, чем у Fable 5.1. Это делает передовые ИИ более доступными для бизнеса.

Несмотря на впечатляющие цифры, заявления об AGI остаются спорными. Многие эксперты считают, что AGI требует более широких способностей, чем прохождение тестов. OpenAI, тем не менее, продолжает двигаться в этом направлении, и Astra — важный шаг на этом пути. Однако окончательные выводы о том, достигла ли модель уровня AGI, можно будет сделать только после независимых оценок и реального применения в экономике.