Deepseek выпустила V4.1-Flash — мультимодальную модель, рассчитанную в первую очередь на снижение стоимости длинных контекстов. Языковая основа содержит 552 млрд параметров и работает с контекстами до одного миллиона токенов. По техническому отчёту, ключевая цель разработки — сократить KV-кэш, буфер, где хранятся уже обработанные части контекста, чтобы модель не пересчитывала их на каждом новом шаге.
Для агентов, которые работают через множество шагов и постоянно вызывают инструменты, этот буфер растёт быстро и давит на память GPU, SSD и пропускную способность каналов данных. Именно это определяет стоимость развёртывания. Deepseek сообщает, что кэш в быстрой памяти GPU теперь занимает около четверти объёма, который требовался предшественнику Deepseek-V4-Flash, а постоянно вынесенная часть — на SSD или в памяти хоста — сократилась примерно до одной восьмой. Относительно Deepseek-V1 глобальный размер KV-кэша на токен уменьшился в 437 раз.
| Параметр | Deepseek V4.1-Flash | Deepseek-V4-Flash |
|---|---|---|
| Параметры языковой основы | 552 млрд | 284 млрд (у V4-Flash) |
| Активные параметры | 8 млрд при чтении, 16 млрд при генерации | 13 млрд |
| Контекст | до 1 млн токенов | — |
| KV-кэш в быстрой памяти GPU | около четверти от V4-Flash | базовый уровень |
| Вынесенная часть кэша (SSD/память хоста) | примерно одна восьмая от V4-Flash | базовый уровень |
| Формат основного KV-кэша | FP4 | FP8 |
Сокращение достигнуто несколькими приёмами. Один из центральных — разделение модели на две половины: первая обрабатывает входящие данные, вторая опирается на её результаты вместо полного пересчёта. При чтении входа активируется 8 млрд параметров на токен, при генерации текста — 16 млрд. По оценке Deepseek, это почти вдвое снижает вычисления на обработку входа, что важно именно для агентов с частыми вызовами инструментов. Кроме того, основной KV-кэш хранится в формате FP4 вместо FP8, что почти вдвое уменьшает занимаемую им память.
KV-кэш в быстрой памяти GPU сократился примерно вчетверо относительно Deepseek-V4-Flash, вынесенная часть — примерно в восемь раз.

Модель обучали с нуля на наборе из 45 трлн токенов, включающем текст и изображения. На этапе постобучения Deepseek сознательно отказалась от новых методов: по заявлению компании, основной прирост дали не алгоритмы, а больший объём данных, задач и обучающих сред под контролем. С ростом RL-обучения результаты на нескольких бенчмарках для кодовых агентов улучшаются.
При этом в отчёте признаются и проблемы. Обученные агенты иногда пытались обойти систему вознаграждения, а в других случаях случайно ломали тестовую среду: эксплуатировали недавно раскрытые уязвимости или удаляли критичные системные файлы. Несмотря на небольшую долю активных параметров, Deepseek сообщает о результатах, близких к ведущим моделям, на ряде бенчмарков. На DeepSWE v1.1 модель набрала 74,2% и немного обошла Anthropic Opus 5 и OpenAI GPT-5.6 Sol, но на ProgramBench заметно им уступает. На научно сложных агентных задачах, требующих экспертных знаний, разрыв с очень крупными моделями сохраняется. Отдельно отмечен измеримый разрыв с ведущими закрытыми системами при чтении сложных изображений.
Как и у многих других reasoning-моделей, глубину «размышления» можно задавать одним значением, торгуя затратами вычислений на точность. По отчёту, максимальная настройка заметно улучшает результаты на нескольких бенчмарках, но порождает примерно в 2,5 раза больше выходных токенов.
Файлы модели выложены на Hugging Face под открытой лицензией MIT — как отправная точка для дальнейшей работы над более дешёвыми ИИ-агентами. Модель также доступна через API по тем же ценам, что и V4-Flash. Предшественник V4-Flash был заметно улучшен в конце июля обновлением 0731: 284 млрд параметров при 13 млрд активных, отставание всего в один пункт от OpenAI GPT-5.6 Luna на Artificial Analysis Intelligence Index и примерно на 60% меньше затрат на задачу. В середине августа Deepseek вывела флагман V4-Pro из тестирования и одновременно подняла цены API: попадания в кэш, то есть уже буферизованные входы, подорожали в шесть раз. По данным тайваньской TeamT5, китайские хакерские группы более чем удвоили число атак после того, как начали использовать Deepseek для создания эксплойтов и сканирования сетей. В июне Deepseek привлекла около $7,4 млрд в первом внешнем раунде при оценке выше $50 млрд, а по сообщению Reuters наняла китайский инвестбанк CITIC Securities для IPO в Китае.



