В начале августа в X разошёлся скриншот пользователя Erick: на панели расходов DeepSeek — сотни миллионов обработанных токенов и счёт чуть больше доллара. Работа велась через открытый агент Hermes Agent на модели DeepSeek V4 Flash. Проверить чужой дашборд со стороны нельзя, но механика, которая делает такой счёт возможным, объяснима.
DeepSeek V4 Flash находится в публичной бете с 31 июля. Это та же архитектура, что в апрельском превью, с заметно подтянутыми агентскими способностями после дообучения. Hermes Agent вышел в феврале, десктопные сборки под macOS, Windows и Linux появились в июне. Агент разрабатывает Nous Research под лицензией MIT, репозиторий открыт. Заявлен замкнутый цикл обучения: закончив задачу, агент оценивает результат, записывает найденный способ в markdown-файл навыка и переиспользует его в следующих сессиях. Память сохраняется между запусками, формат навыков совместим с открытым стандартом agentskills.io. Навыки — это процедурные заметки, которые подтягиваются в контекст, веса модели не меняются. Практическая часть включает терминал, файловые операции, браузер, выполнение кода, генерацию изображений, планировщик задач и подключение к MCP-серверам. Агент запускается локально, в Docker, по SSH и на serverless-площадках вроде Daytona и Modal.
| Что тарифицируется | Ставка за 1 млн токенов |
|---|---|
| Вход, промах кэша | $0,14 |
| Вход, попадание в кэш | $0,0028 |
| Выход | $0,28 |
Основную экономию даёт автоматическое кэширование префикса в DeepSeek API. Если новый вызов повторяет начало запроса, которое модель недавно видела, повторённая часть тарифицируется по отдельной ставке. На V4 Flash вход с промахом кэша стоит $0,14 за миллион токенов, вход с попаданием в кэш — $0,0028, выход — $0,28. Получается пятидесятикратный разрыв между двумя строками входа. Агентский цикл попадает в эту механику почти идеально: каждый следующий вызов отправляет тот же системный промпт, описания инструментов, файлы проекта и историю шагов, дописывая пару строк в конец. Доля неизменной части в общем объёме входа доходит до девяноста с лишним процентов. У чат-бота или разовой обработки документов эта доля кратно ниже, поэтому та же модель на сопоставимом объёме обойдётся дороже. Дешевизна — свойство сценария, а не самой модели.
DeepSeek V4 Flash в публичной бете с 31 июля: та же архитектура, что в апрельском превью, но подтянутые агентские способности.
Кэш держится на побайтовом совпадении префикса. Любой элемент, который меняется от вызова к вызову и стоит в начале, обнуляет попадание для всего, что идёт после. Типовые виновники: метка времени или даты в системном промпте, идентификатор сессии, список инструментов без фиксированного порядка, динамически подставляемый список файлов рабочей директории, свежие фрагменты RAG перед основным контекстом. Правило простое: неизменное — в начало, переменное — в хвост. Долю попаданий удобно проверять по счётчику cache-hit в панели провайдера. Отдельно про переключение моделей: кэш привязан к конкретной модели, поэтому гибридная маршрутизация с эскалацией на старшую версию сбрасывает накопленный префикс.
Заявленное превосходство младшей модели над старшей по агентским бенчмаркам вендора не повод забывать о тяжёлых рассуждениях: здесь DeepSeek сама рекомендует уходить на V4-Pro. Надбавка за часы пик анонсирована, но на момент публикации не включена, её стоит заложить в план заранее.

