В предыдущих частях цикла редакция Habr сравнивала западные флагманы (Opus 4.8, GPT 5.5, Gemini 3.1 Pro) и средний класс (Sonnet, GigaChat 2 MAX, YandexGPT Pro 5.1). Теперь настала очередь Китая: четыре ведущие лаборатории — Moonshot ИИ, Alibaba, Zhipu ИИ и DeepSeek — выставили по одной флагманской модели. В отличие от прошлых тестов, цена намеренно вынесена за скобки: цель — определить верхнюю планку китайской разработки, а не выбрать оптимальное решение по стоимости.

Методика осталась прежней: никаких бенчмарков, только реальные будничные задачи. Тестирование проводилось через агрегатор нейросетей BotHub, который работает по API, что исключает скрытые подпорки веб-интерфейсов. Всего 12 задач: кодинг, длинный контекст, стиль, суммаризация, сравнение документов, внимание в середине, анализ данных, разбор схемы, логика, шаблонность, галлюцинации и безопасность. Промпты дословно повторяли предыдущие части, чтобы результаты были сопоставимы. Настройки одинаковы: температура 0,7, логика рассуждений средняя, поиск в интернете отключён.

МодельЧисло CAPSСтоимость в руб.
Kimi K386 45313,57
Qwen 3.8 Max116 11518,23
GLM-5.2ничего не выдала
DeepSeek V4 Pro63 3929,95

Первая задача — браузерные шахматы. Западные флагманы щёлкали её без труда, средний класс выдал два рабочих проекта из пяти. Китайские флагманы показали два с половиной из четырёх — результат ниже ожиданий для верхней полки. Единственной моделью без нареканий стал DeepSeek V4 Pro: проект запустился с первого раза, а структура из семи файлов (пять js, один css, один html) стала рекордом за весь цикл тестов. Разбиение осмысленное: каждый модуль отвечает за свою функцию.

GLM-5.2 и DeepSeek V4 Pro не принимают изображения, что исключает их из мультимодальных тестов и ограничивает применение в пайплайнах с картинками.

Два участника — GLM-5.2 и DeepSeek V4 Pro — в использованной конфигурации не принимают изображения. Это автоматически исключает их из теста со схемой, где нужно анализировать визуальную информацию. В прошлой статье такая же ситуация была у YandexGPT, и это считалось слабым местом. Здесь же выясняется, что для китайских флагманов текст-онли — скорее норма, чем исключение. Это важно учитывать при построении мультимодальных пайплайнов.

Разброс итоговых смет между участниками — пятикратный. Причём объясняется он не качеством: модель, показавшая лучший результат в кодинге, не самая дорогая. Это говорит о том, что цена токена у китайских лабораторий не коррелирует с производительностью, и при выборе модели стоит ориентироваться на конкретные задачи, а не на стоимость.

Полные ответы моделей и все материалы тестов редакция приводит под катом, так что читатели могут самостоятельно оценить результаты и выбрать своего фаворита. Субъективность в оценке победителя признаётся авторами, но это компенсируется прозрачностью данных.