OpenAI представила GPT-6 Astra, которая на тесте ARC-AGI-3 достигла 62,7% — это в восемь раз выше результата предшественника GPT-5.6 Sol (7,78%) и вдвое выше показателя Claude Opus 5 (30,16%). Тест ARC-AGI-3, разработанный ARC Prize, помещает ИИ в незнакомые игровые миры, где правила и цели не объясняются, и модель должна разобраться методом проб и ошибок. Успех Astra настолько значителен, что Франсуа Шолле, создатель ARC Prize, скорректировал свой прогноз по срокам достижения AGI в сторону приближения.

Ключевая особенность Astra — эффективность. По данным Artificial Analysis, на задачах кодинга Astra достигает того же уровня, что и Claude Fable 5, но тратит менее половины стоимости за задачу. Это достигается за счет экономии вычислительных шагов: Astra использует лишь треть шагов, которые требуются Sol, и пятую часть по сравнению с Opus 5. На тесте ARC-AGI-3 стоимость запуска снижается с ростом уровня рассуждений: с $49 791 при отсутствии рассуждений до $26 098 при максимальном уровне, при этом точность растет с 35,2% до 62,7%. Причина в том, что Astra решает игровые задачи за меньшее число ходов, что сокращает количество вызовов модели и токенов.

БенчмаркGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
Epoch ECI, общий балл169162163162
AA Intelligence Index61616663
ARC-AGI-3, незнакомые игровые миры62.7%7.8%нет данных30.2%
ARC-AGI-2, абстрактные визуальные головоломки95.0%92.5%90.0%90.4%
ARC-AGI-1, старая версия98.5%*97.5%97.5%97.5%
FrontierMath Erdős, открытые задачи3%0%0%нет данных

На новом бенчмарке FrontierMath Erdős от Epoch ИИ Astra стала единственной моделью, решившей две из 68 открытых задач Эрдёша с Lean-подтверждением, при бюджете $300 за попытку. Еще три решения были получены в ходе нестандартизированных дополнительных запусков, которые обошлись более чем в $220 000, но Epoch не учитывает их в официальном зачете. Однако сравнение Astra с конкурентами затруднено: Epoch зафиксировал лишь один результат Astra на кодинге, полученный при среднем уровне рассуждений, тогда как Fable 5.1 лидирует почти во всех тестах на кодинг.

Модель решает задачи с меньшими затратами: на кодинге стоит вдвое дешевле Claude Fable 5 при равных результатах.

ARC Prize отмечает, что показатель 62,7% был получен на внутреннем ARC-харнессе, что позволяет честно сравнивать разные модели. OpenAI ранее сообщала о 99,9% на ARC-AGI-3, но это было достигнуто с использованием специального харнесса OpenAI, который ускоряет выполнение в 3,66 раза и сокращает расход токенов на 49%. ARC Prize планирует публиковать результаты с вендорскими харнессами в будущем, но подчеркивает, что для сравнения важен именно стандартизированный подход.

Эффективность Astra на ARC-AGI-3 особенно примечательна: модель превзошла медианные показатели людей-тестеров по числу ходов, необходимых для решения задач. ARC Prize до запуска Astra привлек около 500 тестеров, которые играли без предварительного отбора, и записал медианное число ходов для каждого уровня. Astra на OpenAI-харнессе прошла 96% уровней за меньшее число ходов, чем медианное значение, в среднем используя чуть больше половины ходов. Это важный сигнал: организаторы ожидали, что люди сохранят преимущество в эффективности обучения, но модель уже превзошла их.

В то же время Astra демонстрирует неоднородные результаты: галлюцинации на AA-Omniscience снизились с 92% до 51%, но модель потеряла около 80 очков Эло на GDPval-AA v2 и ухудшила показатели на задачах банковской поддержки, SciCode и длинноконтекстных рассуждениях. Это напоминает, что успех на одном бенчмарке не гарантирует превосходства во всех областях, и отрасль продолжает искать баланс между специализацией и универсальностью.