Инженер из Калифорнии запускает свежую модель на паре RTX PRO 6000 стоимостью с подержанную машину, а вы смотрите на свою RTX 4060 в ноутбуке и думаете, что локальный ИИ не для вас. Однако, как показывает разбор FreeToken, дело не в железе, а в софте. На ноутбучной RTX 4060 с восемью гигабайтами видеопамяти и урезанным вдвое PCIe-линком можно получить 39.3 токена в секунду на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде.
FreeToken — это движок для локального инференса MoE-моделей, разработанный командой, которая ранее создала vLLM и SGLang. Существующие движки, по словам авторов, недобирают от машины кратно, особенно в агентных сценариях, где локальные модели сейчас реально нужны. Чтобы это продемонстрировать, они измерили не одиночный промпт, как принято в бенчмарках, а реальные многотуровые сессии: SWE-задачу через OpenCode, ту же задачу через Claude Code по нативному протоколу с параллельными сабагентами и контекстом до 56–65 тысяч токенов, а также почтово-календарного агента через OpenClaw на тринадцать ходов.
| Движок | Худший TTFT за сессию |
|---|---|
| FreeToken | 44 секунды |
| llama.cpp | 232 секунды |
| KTransformers | 946 секунд |
Ключевая метрика в таких сценариях — TTFT (time to first token), время до первого токена. В чате на пару абзацев это доли секунды, и на неё никто не смотрит. В агенте всё иначе: контекст — это системный промпт, история диалога, содержимое прочитанных файлов и выводы всех предыдущих вызовов инструментов, и он растёт с каждым ходом. Префилл случается заново на каждом вызове инструмента, поэтому TTFT — это то, сколько вы ждёте между каждыми двумя шагами работы агента. Десять вызовов инструментов подряд — десять префиллов на растущем контексте.
Результаты впечатляют: худший TTFT за сессию у FreeToken — 44 секунды, у llama.cpp — 232, у KTransformers — 946. При этом у OpenClaw в стоке стоит idle-watchdog на 120 секунд, а у Claude Code дефолтный таймаут запроса — примерно десять минут. То есть 946 секунд — это не «медленно», это «агент упал». Средний tok/s при этом может выглядеть пристойно, и вы будете сидеть и думать, почему у вас всё отваливается. Хвост TTFT здесь — не метрика латентности, а граница работоспособности.
Почему MoE вообще даёт шанс локальному железу? В обычной плотной (dense) модели каждый параметр участвует в обработке каждого токена: чтобы выдать один токен, модель на 30B честно вычитывает из памяти все тридцать миллиардов весов. В Mixture of Experts feed-forward слои разбиты на множество «экспертов», и роутер на каждом токене выбирает небольшое подмножество. У модели вида 30B-A3B тридцать миллиардов параметров всего, но активных — три. Отсюда главное правило: память масштабируется с общим числом параметров, а скорость генерации — с активным. Держать наготове надо всех экспертов, потому что маршрутизация меняется на каждом токене, а читать на каждом шаге приходится только активных.
Применим это к фронтир-масштабу. DeepSeek-V4-Flash: 6 маршрутизируемых экспертов из 256 в каждом из 43 слоёв. В обработке одного токена участвует 13B параметров из 284B, и в деплойной точности этот активный след спокойно укладывается в 32 ГБ RTX 5090. Но разреженность режет вычисления на токен, а не память под полный пул экспертов. Модель целиком по-прежнему не влезает в VRAM с большим запасом, неактивные эксперты живут в памяти хоста и заходят в путь исполнения по требованию. Отсюда формулировка: разреженная активация делает вычисление возможным, а полный пул экспертов делает эффективную отдачу сложной. Вопрос сместился с «влезет ли модель в GPU» на «насколько хорошо система умеет оркестрировать машину целиком» — GPU, CPU, память хоста и шину между ними.
FreeToken решает именно эту задачу — оркестрацию. Пока неизвестно, когда движок станет доступен широкой публике, но уже сейчас ясно: локальный инференс MoE-моделей перестал упираться в железо. Софт, который обслуживает железо, может дать кратный прирост производительности, и это меняет правила игры для всех, кто хотел запускать современные модели на своём оборудовании.

