В январе 2025 года open source модели уже никого не удивляли, но DeepSeek R1 стала исключением: за один день она обвалила американский фондовый рынок. 20 января компания DeepSeek выложила R1 под MIT-лицензией, исследователи начали тестировать её на своих задачах и подтверждать работоспособность. Уже 26 января приложение DeepSeek вышло на первое место в App Store США, обогнав ChatGPT. А 27 января акции Nvidia упали на 17% — $589 млрд капитализации исчезло за один день, что стало крупнейшим однодневным падением в истории фондового рынка США. Nasdaq потерял около 3%, за Nvidia последовали Broadcom, Oracle, Microsoft, Google. Суммарная просадка рынка составила примерно $1 трлн, а Дженсен Хуанг лично потерял $21 млрд состояния.

Контекст был особенно чувствительным: буквально за неделю до этого анонсировали проект Stargate с вложениями до полутриллиона долларов в дата-центры, а OpenAI собирал раунд на $40 млрд. Обе цифры основывались на уверенности, что количество видеокарт даёт преимущество, которое нельзя обесценить за семь дней. DeepSeek показала обратное: эффективные алгоритмы могут конкурировать с гигантскими вычислительными мощностями.

ДатаСобытие
Февраль 2016Основание High-Flyer
2019Запуск Fire-Flyer I (1100 GPU)
2021Запуск Fire-Flyer II (~10 000 A100)
Апрель 2023Создание исследовательской структуры для AGI
Июль 2023Регистрация DeepSeek как юрлица
Ноябрь 2023Выход DeepSeek Coder и DeepSeek LLM 67B
Май 2024Выход V2 с MLA
Декабрь 2024Выход V3
20 января 2025Релиз R1 под MIT-лицензией
26 января 2025Приложение DeepSeek на первом месте в App Store США
27 января 2025Падение акций Nvidia на 17%

Кто стоит за DeepSeek? Оказалось, что это не стартап, а дочернее подразделение квантового хедж-фонда High-Flyer из Ханчжоу. Лян Вэньфэн основал High-Flyer в феврале 2016 года с двумя однокурсниками по Чжэцзянскому университету — Сюй Цзинем и Чжэн Давэем. Фонд торговал по сигналам от моделей глубокого обучения и под это строил собственные кластеры: в 2019-м Fire-Flyer I на 1100 GPU за 200 млн юаней, в 2021-м Fire-Flyer II — около 10 000 A100 за миллиард юаней. Карты купили за год до того, как США в октябре 2022 ограничили их экспорт в Китай. Знакомые Ляна тогда считали эту покупку чудачеством. В апреле 2023 фонд объявил о создании отдельной исследовательской структуры для работы над AGI, а в июле DeepSeek зарегистрировалась как юрлицо. Финансирование — целиком деньги фонда, внешних инвесторов нет.

R1 вышла 20 января 2025 года под MIT-лицензией, а 26 января приложение DeepSeek возглавило App Store США, обогнав ChatGPT.

Релиз 20 января 2025 года — далеко не первый для компании. Пока OpenAI показывала GPT-4 Turbo, в ноябре 2023-го вышли DeepSeek Coder и DeepSeek LLM 67B. В мае 2024-го — V2, первая модель с MLA. В декабре 2024-го — V3. И только потом R1. То есть компания работала над своими моделями уже несколько лет.

Отправная точка всей технической части — ограничение. У DeepSeek были H800: те же H100 с урезанной пропускной способностью интерконнекта, примерно 400 ГБ/с NVLink против 900. Это прямой артефакт экспортного контроля, чип специально порезали под китайский рынок. Дальше почти всё, что сделала команда, — ответ на это ограничение.

Ключевые технические решения включают MLA (Multi-head Latent Attention). Пока модель генерирует ответ, она держит в памяти карты всё, что уже прочитала, — это KV-кэш. Он растёт вместе с длиной контекста и съедает память, на которой можно было бы обслуживать других пользователей. MLA хранит его в сжатом виде: вместо полных векторов — компактное представление, из которого нужное восстанавливается на лету. Кэш падает до единиц процентов от обычного. На одной карте помещается в разы больше одновременных запросов, отсюда и цена. Появилась в V2 в мае 2024 — тогда DeepSeek поставила 1 юань за миллион входных токенов и запустила ценовую войну в Китае.

DeepSeekMoE — ещё одно важное решение. В модели 671 млрд параметров, но над каждым токеном работает только 37 млрд. Роутер выбирает несколько узких экспертов под конкретный токен, плюс пара общих включена всегда. Стоимость считается по активным параметрам, качество — по всем. Проблема таких схем в том, что роутер быстро находит несколько любимых экспертов и заваливает их работой, пока остальные простаивают. Обычно это исправляют штрафом в функции потерь, но штраф тянет модель в сторону от основной задачи. DeepSeek вместо этого подкручивает смещения: перегруженный эксперт становится для роутера чуть менее привлекательным. Нагрузка выравнивается, целевая функция остаётся чистой.

FP8 на всём цикле обучения — ещё одна инновация. Обычно модель учат в 16 битах, а в 8 сжимают уже готовую. DeepSeek училась в 8 битах с самого начала, оставив высокую точность только там, где без неё ломается сходимость. Вдвое меньше памяти и вдвое меньше данных гоняется между узлами кластера — а узкое место было именно там.

DualPipe решает проблему простоев на большом кластере. Карты регулярно стоят и ждут данные от соседей. DualPipe перестраивает порядок работы так, чтобы, пока считается одна часть батча, другая в это же время передавалась. Простой на медленном канале почти исчезает.

Наконец, PTX вместо CUDA. CUDA — стандартный уровень, на котором пишут код для видеокарт; распределением вычислительных блоков внутри чипа занимается компилятор. DeepSeek спустилась на уровень ниже, в PTX — это фактически ассемблер для карт NVIDIA — и вручную развела блоки: эти считают, эти передают данные. Работа, которой не занимаются, пока канал между картами не стал бутылочным горлышком.

Итог: 2,788 млн GPU-часов H800 на финальный прогон V3. При $2 за GPU-час — $5,576 млн. Отсюда и появилась знаменитая цифра про «обучение за 6 миллионов». Здесь нужна оговорка, которую в январе почти никто не сделал: это стоимость финального прогона, без учёта исследований и экспериментов. Тем не менее, даже полная стоимость обучения DeepSeek V3 оценивается в несколько раз ниже, чем у сопоставимых моделей OpenAI или Google, что и вызвало панику на рынке.