Bytedance, материнская компания TikTok, обучает ИИ-модель с параметрами до 10 триллионов, сообщает Financial Times со ссылкой на три источника, знакомых с ситуацией. Это втрое больше, чем у Moonshot Kimi K3, которая сейчас считается крупнейшей китайской моделью. По оценкам отрасли, модель Bytedance сопоставима по размеру с Anthropic Mythos 5, которую оценивают примерно в 8 триллионов параметров, хотя Anthropic официально не раскрывает свои данные.

Параметры определяют объем информации, которую модель может хранить, но итоговая производительность зависит также от качества данных и методов обучения. По словам одного из источников, Bytedance более года избегает дистилляции — подхода, при котором модель обучается на выходах других моделей. Это означает, что компания делает ставку на собственные данные и архитектурные решения, а не на копирование результатов конкурентов.

Модель находится на этапе предварительного обучения (pretraining), который обычно занимает от трех до шести месяцев. Основатель Bytedance Чжан Имин на внутренней встрече с командой Seed, насчитывающей около 2000 человек, поставил задачу достичь мирового уровня в долгосрочной перспективе. Это указывает на стратегический фокус компании на фундаментальных исследованиях, а не на быстрых рыночных решениях.

Модель находится на этапе предварительного обучения, который обычно длится от трех до шести месяцев.

Параллельно xAI Илона Маска обучает варианты модели Grok с 6 и 10 триллионами параметров на своем кластере Colossus 2. Это подтверждает общий тренд в индустрии: ведущие лаборатории стремятся наращивать масштаб моделей, несмотря на рост затрат на вычисления и энергию.

Для отрасли это означает, что гонка за размером моделей продолжается, и китайские компании активно в ней участвуют. Однако, как отмечают эксперты, больший размер не гарантирует лучшего качества — важны данные и методы. Bytedance, отказываясь от дистилляции, пытается найти собственный путь, что может дать ей преимущество в долгосрочной перспективе, но требует значительных инвестиций в вычислительные ресурсы и данные.