На бенчмарке ErdosBench, созданном платформой ulam.ai, модель GPT-6 Astra от OpenAI заняла первое место, набрав 3.23 балла и решив 106 из 226 открытых математических задач, вдохновлённых проблемами Эрдёша. 43 задачи были решены полностью, ещё 27 утверждений Astra опровергла. Для сравнения: предыдущая модель Sol при максимальном уровне рассуждений справилась с 78 задачами. Разработчик бенчмарка Пшемек Хоецки охарактеризовал результат как «устойчивый прирост на 5–10% по различным математическим исследовательским навыкам», отметив, что бенчмарк далёк от насыщения.
Однако первенство Astra оказалось недолгим: вскоре модель Fable 5.1 сместила её с вершины с результатом 3.25 балла, хотя Astra по-прежнему решила больше задач. Этот разрыв показывает, что оценка в баллах и количество решённых задач могут расходиться — бенчмарк учитывает не только правильность, но и качество научного письма, склонность к обоснованным выводам. По сравнению с Sol, Astra демонстрировала более сильное научное изложение и реже допускала преувеличения, а в некоторых случаях даже занижала собственные результаты.
| Модель | Балл ErdosBench | Решено задач | Полностью решено | Опровергнуто |
|---|---|---|---|---|
| GPT-6 Astra | 3.23 | 106 | 43 | 27 |
| Sol (макс. рассуждения) | — | 78 | — | — |
| Fable 5.1 | 3.25 | — | — | — |
Ключевой момент: в OpenAI утверждают, что не ставили целью оптимизировать Astra именно под математические исследования. Главный научный сотрудник компании Якуб Пачоцки в эссе «An Alien Mind» пишет: «Мы верим, что могли бы сделать модели лучше specifically в математических исследованиях при дополнительном фокусе, но не приоритизируем это направление из-за срочности, которую ощущаем в отношении рекурсивного самосовершенствования (RSI) и автоматизированных исследований выравнивания». Таким образом, самая способная на данный момент математическая модель — не результат целевой оптимизации, а побочный продукт других приоритетов. OpenAI направляет ресурсы на рекурсивное самосовершенствование и обеспечение безопасности будущих ИИ-систем, поскольку, по словам Пачоцки, «мы верим, что это единственный способ оставаться на переднем крае исследований ИИ в будущем».
Предыдущая модель Sol решила 78 задач при максимальном уровне рассуждений, Astra показала более сильное научное письмо и меньше склонности к преувеличениям.

Это заявление иллюстрирует компромиссы, неизбежные на «зазубренном» фронте разработки ИИ. Модель, доминирующая в математике, не обязательно будет столь же сильна в других областях. Кембриджский исследователь Адам Хант визуализировал два возможных пути: «мейнстримный AGI» предполагает постепенное и широкое улучшение моделей до охвата всех человеческих задач, альтернативный сценарий описывает всё более «колючую» траекторию — экстремальную силу в нескольких доменах вроде программирования и математики при стагнации или регрессе в качестве языка, здравом смысле или социальных рассуждениях. Случай Astra, где компания сознательно пропустила математическую оптимизацию, служит аргументом в пользу «колючей» гипотезы: даже ведущая лаборатория не может одновременно продвигаться по всем направлениям. Способности растут там, где есть оптимизация, а усиление математики означает сокращение в другом месте. Впрочем, за приоритетом RSI стоит надежда, что модель в конечном счёте сама выполнит эти оптимизации, ускорив прогресс по всем фронтам, включая математику.
Независимо от того, насколько Astra лучше предшественника — на 5% или на 50%, — перед математическим сообществом встаёт более глубокий вопрос. Математик Теренс Тао на Международном конгрессе математиков поднял проблему: если ИИ-модели производят доказательства быстрее, чем люди успевают их проверять, дисциплина рискует перейти от дефицита доказательств к их переизбытку. Критической задачей станет не решение проблем, а определение того, какие результаты важны. Тао говорит о кризисе ценностей и практик в математике, сравнивая его с фундаментальным переломом начала XX века. Сложнейшие задачи пока остаются нерешёнными, что даёт дисциплине время. Но направление, похоже, уже задано, даже если некоторые математики сомневаются, что языковые модели способны на настоящие ы из-за отсутствия человеческой креативности. По тем же причинам есть сомнения и в потенциале ИИ к подлинному самосовершенствованию.



