Artificial Analysis, независимая платформа для сравнения ИИ-моделей, выпустила версию 4.2 своего Intelligence Index. Обновление стало ответом на критику: предыдущие оценки не отражали реального прогресса GPT-6 Astra, которая по данным других бенчмарков значительно опережала предшественников. Так, Epoch ИИ поставил Astra на первое место среди 267 моделей с результатом 169 баллов по более чем 50 тестам, а ARC-AGI-3 показал «большой или очень большой» скачок в зависимости от используемого окружения. Artificial Analysis же оценивала Astra лишь на уровне предыдущей модели Sol, что вызвало вопросы к методике.
В обновленном индексе GPT-6 Astra теперь на четыре пункта опережает Sol. Тем не менее лидером рейтинга остается Claude Fable 5.1 от Anthropic, за которым следуют Astra и Meta на третьем месте. Artificial Analysis также отмечает, что Astra использует меньше токенов на задачу, чем любая другая модель из топ-уровня. По соотношению цена/производительность лидируют сразу несколько компаний: Anthropic, OpenAI, Meta и Zhipu ИИ.
| Модель | Позиция в рейтинге | Изменение |
|---|---|---|
| Claude Fable 5.1 | 1 | — |
| GPT-6 Astra | 2 | +4 пункта к Sol |
| Meta (модель) | 3 | — |
Помимо корректировки оценок, Artificial Analysis внесла структурные изменения. В индекс добавлены два новых бенчмарка: AA-Briefcase, оценивающий реальные задачи «офисной» работы, и GDP.pdf от Surge ИИ для анализа PDF-документов. При этом GPQA-Diamond исключен, поскольку модели уже решили все его задачи. Доля приватных тестовых данных увеличена до 40%, чтобы усложнить «натаскивание» моделей на публичные тесты. Также исправлены ошибки в оценках по ряду бенчмарков и скорректированы системы оценивания для большей стабильности результатов.
В новой версии Astra на четыре пункта опережает предшественника Sol, но уступает лидеру Claude Fable 5.1.

Artificial Analysis объясняет, что намеренно воздерживалась от обновлений, чтобы сохранить стабильность показателей в период крупных релизов моделей, но динамика в верхней части рейтинга оказалась слишком высокой, что потребовало промежуточного обновления. Версия 5 индекса, над которой работают уже восемь месяцев, будет внедряться поэтапно.
Для читателей, которые впервые сталкиваются с темой, поясним: Intelligence Index — это агрегированный показатель, который объединяет результаты множества тестов ИИ-моделей в единый балл. Подобные рейтинги важны для исследователей и бизнеса, поскольку помогают сравнивать модели между собой. Однако методология таких оценок часто вызывает споры, особенно когда результаты разных бенчмарков расходятся. Обновление Artificial Analysis — пример того, как независимые площадки реагируют на критику и стараются сделать свои метрики более точными и устойчивыми к манипуляциям.



