Полтора года назад DeepSeek R1 вызвал шок: китайская лаборатория внезапно составила конкуренцию OpenAI o1 — первой коммерческой модели рассуждений, и, по сообщениям, сделала это с гораздо меньшими затратами. Рынки занервничали: за несколько дней испарились миллиарды долларов рыночной стоимости. Тогда картина была менее ясной, чем казалось: в отчете DeepSeek R1 превосходил o1 в отдельных тестах, например AIME 2024, но отставал в других, таких как проверка фактов SimpleQA. Позже бенчмарки выявили еще больше пробелов: китайские модели достигали вершин лишь в отдельных дисциплинах, но не везде. Еще в конце июня, когда мы начали работу над этим выпуском, модель GLM-5.2 от Z.ai демонстрировала ту же картину.

Затем появились новые китайские модели с открытым весом: Moonshot Kimi K3, Alibaba Qwen3.8-Max и GLM-5.3. Теперь китайские модели находятся вблизи вершин почти всех масштабных и требовательных оценок. Они справляются с длинными задачами на знание, пишут код во много шагов и координируют инструменты гораздо надежнее предшественников. По общим бенчмаркам часто цитируемый разрыв в несколько месяцев сократился настолько, что стал проблемой для инвесторов. По данным Wall Street Journal, Anthropic перед предстоящим IPO сталкивается с неудобными вопросами и в свою защиту указывает на сохраняющееся лидерство на самом верху. Ниже этого уровня поле принадлежит в основном открытым и гораздо более дешевым моделям из Китая. Инвесторы опасаются, что сырая производительность моделей едва ли может быть основой бизнеса: что бы модель ни умела эксклюзивно сегодня, через несколько месяцев это сможет делать свободно загружаемая модель.

МодельИндекс интеллектаARC-AGI-1ARC-AGI-2AA-AnalystAgent (pass^5)
Opus 56198.5%89.2%54%
GPT-5.550%
Kimi K35794.5%60.4%39%

В ходу два обвинения: китайские лаборатории якобы использовали западные модели как учителей — практика, известная как дистилляция, — и настраивают свои модели на высокие результаты в бенчмарках без широких возможностей, что называют «бенчмаксингом». Американское лидерство не исчезло, но отступило в несколько все более узких областей так называемого фронтира — переднего края технически возможного. Где еще сохраняется это лидерство и какова его экономическая ценность — первый вопрос этого выпуска. Второй вытекает из него: если модель сама по себе больше не дает явного преимущества, на чем держится лидерство? Наш тезис: все меньше на модели и все больше на всей системе вокруг нее, то есть на системе, в которой постоянная работа порождает следующие модели.

На индексе Artificial Analysis K3 занял третье место с 57 баллами, уступив GPT-5.5 и Opus 4.8, но показав лучший результат на агентных задачах.

Что осталось от лидерства. При запуске Artificial Analysis поставил K3 на третье место в своем индексе интеллекта с 57 баллами, сразу за лидерами GPT-5.5 и Opus 4.8. K3 больше всего улучшился в агентных задачах — именно та практическая работа, которая важна в корпоративном использовании. На AutomationBench-AA K3 даже дебютировал на первом месте, пока Anthropic не ответила моделью Opus 5. На CEO-Bench, где агент управляет вымышленной софтверной компанией в течение 500 симулированных дней, K3 показал лучший опубликованный результат — $22,15 млн. Китайские модели, включая предшественника K2.7, регулярно проваливали такие длительные испытания. Qwen3.8-Max достигает аналогично высокого общего уровня. Остается одна оговорка: новые китайские модели иногда сжигают гораздо больше токенов, чем западные, что съедает часть их ценового преимущества. Подсчет стоимости за задачу по-прежнему работает.

Край текущих возможностей моделей уже некоторое время растет неравномерно — исследователи называют это «изрезанным фронтиром». Отдельные способности развиваются с разной скоростью, поэтому часто цитируемый разрыв в несколько месяцев всегда зависел от того, кто что измеряет. Новое — это то, где западное лидерство вообще измеримо. Остаются три области. Первая — абстрактные специальные тесты. Вскоре после запуска K3 Opus 5 вернул себе вершину индекса с 61 баллом, небольшой разрыв с K3 (57). На ARC-AGI-1, тесте абстрактного распознавания образов на маленьких сетках-головоломках, K3 и Fable 5 — флагманская линейка Anthropic для кодинга и агентной работы — практически наравне: 94,5 и 98,5 процента. Только на ARC-AGI-2 разрыв увеличивается: 60,4 против 89,2 процента. Но ARC-AGI намеренно измеряет абстрактное распознавание образов, далекое от повседневных задач. Нет гарантии, что этот разрыв предсказывает практические различия. Возможно, в большинстве случаев он останется экономически незначимым.

Вторая область — надежность. Бенчмарк AA-AnalystAgent, запущенный 12 августа, тестирует агентный анализ данных на реальных таблицах и документах. Задача считается решенной, только если модель справляется в пяти из пяти независимых запусков — операторы называют это pass^5. Opus 5 лидирует с 54 процентами, опережая GPT-5.5 (50). K3 — лучшая открытая модель с 39 процентами. Разрыв почти полностью объясняется плохой повторяемостью: K3 решает 73 процента задач хотя бы раз из пяти попыток, практически наравне с Opus 5 (74). Надежность не следует обычным рейтингам индекса интеллекта: даже GPT-5.6 Sol отстает от своего предшественника. Коммерчески надежность важна, как объясняют операторы в статье о запуске: аналитический агент экономит работу только тогда, когда его ответы не требуют проверки. Многократные запуски — это не просто техническая деталь, а условие практической ценности.

Третья область — безопасность и согласование. Здесь западные лаборатории сохраняют преимущество, но оно также сужается. Вопрос в том, сколько это стоит и готовы ли покупатели платить за это премию. Пока инвесторы сомневаются, что модели могут быть самостоятельным бизнесом, ответ может лежать в системах вокруг них: данных, инфраструктуре, интеграции. Китайские лаборатории уже показали, что могут быстро догонять в производительности, но создание надежной, безопасной и экономически эффективной системы — более сложная задача. Возможно, именно здесь Запад еще может удержать лидерство, но время на это ограничено.