Разработчик Игорь К., который создает сайты с помощью нейросетей, опубликовал результаты собственного турнира семи ИИ-моделей. В отличие от синтетических бенчмарков, где модели решают олимпиадные задачи, он поставил практические задания: сверстать страницу-презентацию, сделать инфографику, 3D-модель робота, мини-игру, придумать анекдот и даже написать гимн нейросетей. Участниками стали Claude Opus 5, GPT-5.6 Sol, Kimi K3, Qwen 3.8 Max, Gemini 3.7 Flash, Grok 4.6 и DeepSeek V4 Pro. Все данные, включая промпты, голоса и коды, опубликованы на сайте ikorg.ru/rating.

Формат турнира напоминал «Евровидение»: каждая модель получала одно и то же задание, затем ей показывали работы конкурентов (без указания автора) и просила раздать баллы от 0 до 5. За девять заданий максимально можно было набрать 30 баллов. Победителем стал Claude Opus 5 с 224 баллами, второе место занял Kimi K3 (156), третье — GPT-5.6 Sol (140). При этом автор отмечает, что интереснее не итог, а то, как модели оценивают чужие работы.

МодельБаллыПобед
Claude Opus 52243
Kimi K31563
GPT-5.6 Sol1401
Qwen 3.8 Max1291
Gemini 3.7 Flash1250
Grok 4.6991
DeepSeek V4 Pro720

Одной из ключевых находок стала корреляция между длиной ответа и полученной оценкой. На HTML-заданиях коэффициент Спирмена составил +0,58, что указывает на заметную связь: судьи предпочитали длинные простыни кода, даже если качество было не выше. На текстовых заданиях корреляция была отрицательной (−0,18), поскольку многословие в анекдоте или стихотворении скорее мешало. Автор подчеркивает, что корреляция не доказывает причинно-следственную связь, но после того как он убрал код из поля зрения судей и оставил только скриншоты, оценки изменились.

Участники выступали и судьями: каждая модель оценивала чужие работы по шкале от 0 до 5, не видя собственный код.

DeepSeek V4 Pro оказался единственным участником, который не умеет обрабатывать изображения, поэтому в визуальных заданиях его голос заменял сам автор. Это ограничение могло повлиять на итоговый результат: DeepSeek занял последнее место с 72 баллами. Автор также упоминает, что модель Fable 5 не была включена в турнир из-за чрезмерного расхода токенов, но после выхода версии 5.1 он планирует добавить её восьмым участником.

Турнир интересен не только результатами, но и методологией. Автор опубликовал все промпты дословно, идентификаторы моделей, настройки запуска и архивы с ответами, что позволяет воспроизвести эксперимент. Это контрастирует с официальными бенчмарками, которые часто критикуют за оторванность от реальных задач. Для практикующих разработчиков такой подход может быть полезнее, чем абстрактные рейтинги, поскольку показывает, как модели справляются с задачами, приближенными к реальной работе.