OpenAI представила GPT-6 Astra, которая на тесте ARC-AGI-3 достигла 62,7% — это в восемь раз выше результата предшественника GPT-5.6 Sol (7,78%) и вдвое выше показателя Claude Opus 5 (30,16%). Тест ARC-AGI-3, разработанный ARC Prize, помещает ИИ в незнакомые игровые миры, где правила и цели не объясняются, и модель должна разобраться методом проб и ошибок. Успех Astra настолько значителен, что Франсуа Шолле, создатель ARC Prize, скорректировал свой прогноз по срокам достижения AGI в сторону приближения.
Ключевая особенность Astra — эффективность. По данным Artificial Analysis, на задачах кодинга Astra достигает того же уровня, что и Claude Fable 5, но тратит менее половины стоимости за задачу. Это достигается за счет экономии вычислительных шагов: Astra использует лишь треть шагов, которые требуются Sol, и пятую часть по сравнению с Opus 5. На тесте ARC-AGI-3 стоимость запуска снижается с ростом уровня рассуждений: с $49 791 при отсутствии рассуждений до $26 098 при максимальном уровне, при этом точность растет с 35,2% до 62,7%. Причина в том, что Astra решает игровые задачи за меньшее число ходов, что сокращает количество вызовов модели и токенов.
| Бенчмарк | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Epoch ECI, общий балл | 169 | 162 | 163 | 162 |
| AA Intelligence Index | 61 | 61 | 66 | 63 |
| ARC-AGI-3, незнакомые игровые миры | 62.7% | 7.8% | нет данных | 30.2% |
| ARC-AGI-2, абстрактные визуальные головоломки | 95.0% | 92.5% | 90.0% | 90.4% |
| ARC-AGI-1, старая версия | 98.5%* | 97.5% | 97.5% | 97.5% |
| FrontierMath Erdős, открытые задачи | 3% | 0% | 0% | нет данных |
На новом бенчмарке FrontierMath Erdős от Epoch ИИ Astra стала единственной моделью, решившей две из 68 открытых задач Эрдёша с Lean-подтверждением, при бюджете $300 за попытку. Еще три решения были получены в ходе нестандартизированных дополнительных запусков, которые обошлись более чем в $220 000, но Epoch не учитывает их в официальном зачете. Однако сравнение Astra с конкурентами затруднено: Epoch зафиксировал лишь один результат Astra на кодинге, полученный при среднем уровне рассуждений, тогда как Fable 5.1 лидирует почти во всех тестах на кодинг.
Модель решает задачи с меньшими затратами: на кодинге стоит вдвое дешевле Claude Fable 5 при равных результатах.
ARC Prize отмечает, что показатель 62,7% был получен на внутреннем ARC-харнессе, что позволяет честно сравнивать разные модели. OpenAI ранее сообщала о 99,9% на ARC-AGI-3, но это было достигнуто с использованием специального харнесса OpenAI, который ускоряет выполнение в 3,66 раза и сокращает расход токенов на 49%. ARC Prize планирует публиковать результаты с вендорскими харнессами в будущем, но подчеркивает, что для сравнения важен именно стандартизированный подход.
Эффективность Astra на ARC-AGI-3 особенно примечательна: модель превзошла медианные показатели людей-тестеров по числу ходов, необходимых для решения задач. ARC Prize до запуска Astra привлек около 500 тестеров, которые играли без предварительного отбора, и записал медианное число ходов для каждого уровня. Astra на OpenAI-харнессе прошла 96% уровней за меньшее число ходов, чем медианное значение, в среднем используя чуть больше половины ходов. Это важный сигнал: организаторы ожидали, что люди сохранят преимущество в эффективности обучения, но модель уже превзошла их.
В то же время Astra демонстрирует неоднородные результаты: галлюцинации на AA-Omniscience снизились с 92% до 51%, но модель потеряла около 80 очков Эло на GDPval-AA v2 и ухудшила показатели на задачах банковской поддержки, SciCode и длинноконтекстных рассуждениях. Это напоминает, что успех на одном бенчмарке не гарантирует превосходства во всех областях, и отрасль продолжает искать баланс между специализацией и универсальностью.



