Artificial Analysis, независимая платформа для сравнения ИИ-моделей, выпустила версию 4.2 своего Intelligence Index. Обновление стало ответом на критику: предыдущие оценки не отражали реального прогресса GPT-6 Astra, которая по данным других бенчмарков значительно опережала предшественников. Так, Epoch ИИ поставил Astra на первое место среди 267 моделей с результатом 169 баллов по более чем 50 тестам, а ARC-AGI-3 показал «большой или очень большой» скачок в зависимости от используемого окружения. Artificial Analysis же оценивала Astra лишь на уровне предыдущей модели Sol, что вызвало вопросы к методике.

В обновленном индексе GPT-6 Astra теперь на четыре пункта опережает Sol. Тем не менее лидером рейтинга остается Claude Fable 5.1 от Anthropic, за которым следуют Astra и Meta на третьем месте. Artificial Analysis также отмечает, что Astra использует меньше токенов на задачу, чем любая другая модель из топ-уровня. По соотношению цена/производительность лидируют сразу несколько компаний: Anthropic, OpenAI, Meta и Zhipu ИИ.

МодельПозиция в рейтингеИзменение
Claude Fable 5.11
GPT-6 Astra2+4 пункта к Sol
Meta (модель)3

Помимо корректировки оценок, Artificial Analysis внесла структурные изменения. В индекс добавлены два новых бенчмарка: AA-Briefcase, оценивающий реальные задачи «офисной» работы, и GDP.pdf от Surge ИИ для анализа PDF-документов. При этом GPQA-Diamond исключен, поскольку модели уже решили все его задачи. Доля приватных тестовых данных увеличена до 40%, чтобы усложнить «натаскивание» моделей на публичные тесты. Также исправлены ошибки в оценках по ряду бенчмарков и скорректированы системы оценивания для большей стабильности результатов.

В новой версии Astra на четыре пункта опережает предшественника Sol, но уступает лидеру Claude Fable 5.1.

Image description
Image description · Источник: The Decoder

Artificial Analysis объясняет, что намеренно воздерживалась от обновлений, чтобы сохранить стабильность показателей в период крупных релизов моделей, но динамика в верхней части рейтинга оказалась слишком высокой, что потребовало промежуточного обновления. Версия 5 индекса, над которой работают уже восемь месяцев, будет внедряться поэтапно.

Для читателей, которые впервые сталкиваются с темой, поясним: Intelligence Index — это агрегированный показатель, который объединяет результаты множества тестов ИИ-моделей в единый балл. Подобные рейтинги важны для исследователей и бизнеса, поскольку помогают сравнивать модели между собой. Однако методология таких оценок часто вызывает споры, особенно когда результаты разных бенчмарков расходятся. Обновление Artificial Analysis — пример того, как независимые площадки реагируют на критику и стараются сделать свои метрики более точными и устойчивыми к манипуляциям.