В предыдущих частях цикла редакция Habr сравнивала западные флагманы (Opus 4.8, GPT 5.5, Gemini 3.1 Pro) и средний класс (Sonnet, GigaChat 2 MAX, YandexGPT Pro 5.1). Теперь настала очередь Китая: четыре ведущие лаборатории — Moonshot ИИ, Alibaba, Zhipu ИИ и DeepSeek — выставили по одной флагманской модели. В отличие от прошлых тестов, цена намеренно вынесена за скобки: цель — определить верхнюю планку китайской разработки, а не выбрать оптимальное решение по стоимости.
Методика осталась прежней: никаких бенчмарков, только реальные будничные задачи. Тестирование проводилось через агрегатор нейросетей BotHub, который работает по API, что исключает скрытые подпорки веб-интерфейсов. Всего 12 задач: кодинг, длинный контекст, стиль, суммаризация, сравнение документов, внимание в середине, анализ данных, разбор схемы, логика, шаблонность, галлюцинации и безопасность. Промпты дословно повторяли предыдущие части, чтобы результаты были сопоставимы. Настройки одинаковы: температура 0,7, логика рассуждений средняя, поиск в интернете отключён.
| Модель | Число CAPS | Стоимость в руб. |
|---|---|---|
| Kimi K3 | 86 453 | 13,57 |
| Qwen 3.8 Max | 116 115 | 18,23 |
| GLM-5.2 | ничего не выдала | — |
| DeepSeek V4 Pro | 63 392 | 9,95 |
Первая задача — браузерные шахматы. Западные флагманы щёлкали её без труда, средний класс выдал два рабочих проекта из пяти. Китайские флагманы показали два с половиной из четырёх — результат ниже ожиданий для верхней полки. Единственной моделью без нареканий стал DeepSeek V4 Pro: проект запустился с первого раза, а структура из семи файлов (пять js, один css, один html) стала рекордом за весь цикл тестов. Разбиение осмысленное: каждый модуль отвечает за свою функцию.
GLM-5.2 и DeepSeek V4 Pro не принимают изображения, что исключает их из мультимодальных тестов и ограничивает применение в пайплайнах с картинками.
Два участника — GLM-5.2 и DeepSeek V4 Pro — в использованной конфигурации не принимают изображения. Это автоматически исключает их из теста со схемой, где нужно анализировать визуальную информацию. В прошлой статье такая же ситуация была у YandexGPT, и это считалось слабым местом. Здесь же выясняется, что для китайских флагманов текст-онли — скорее норма, чем исключение. Это важно учитывать при построении мультимодальных пайплайнов.
Разброс итоговых смет между участниками — пятикратный. Причём объясняется он не качеством: модель, показавшая лучший результат в кодинге, не самая дорогая. Это говорит о том, что цена токена у китайских лабораторий не коррелирует с производительностью, и при выборе модели стоит ориентироваться на конкретные задачи, а не на стоимость.
Полные ответы моделей и все материалы тестов редакция приводит под катом, так что читатели могут самостоятельно оценить результаты и выбрать своего фаворита. Субъективность в оценке победителя признаётся авторами, но это компенсируется прозрачностью данных.

