Автор публикации на Хабре представил букмарклет, который автоматически вычисляет теоретическую скорость генерации токенов для GGUF-моделей в llama.cpp. Инструмент работает с карточками моделей на Hugging Face: скрипт через API находит первый.gguf-файл в репозитории, скачивает его первые 400 КБ (Range-запросом) и парсит заголовок GGUF, извлекая параметры вроде block_count, head_count_kv, key_length, context_length, full_attention_interval и num_loops. Эти данные подставляются в формулу, которая учитывает пропускную способность видеопамяти, объём VRAM и overhead — задержку на токен, характерную для конкретной видеокарты.
Проблема, которую решает букмарклет, знакома многим, кто запускает локальные модели: существующие онлайн-калькуляторы часто дают цифры, далёкие от реальности. Автор на своей RTX 3070 с 8 ГБ VRAM обнаружил, что может запускать MoE-модели до 35 млрд параметров, хотя распространённое мнение гласит, что 8 ГБ для этого недостаточно. При замерах скорости генерации и максимального контекста выяснилось, что простая формула «вес модели / пропускная способность» не работает: реальная скорость ниже расчётной. Нейросеть, которую автор привлёк для анализа, ввела поправочный коэффициент — эффективность видеокарты, которая у него составила 60–80%. Более того, анализ замеров показал, что overhead (задержка на токен) для его карты равен 5 мс — эта константа теперь заложена в формулу.
| Модель | Квант | Скорость, ток/с | Контекст | Вес |
|---|---|---|---|---|
| Qwen3.5-4B | Q4_K_M | 64.5 | 26000 | 3.0 ГБ |
| Qwen3.5-4B | Q4_K_M | 87.1 | 100000 | 3.0 ГБ |
| Qwen3.5-4B | Q4_K_M | 88.3 | 115000 | 3.0 ГБ |
| Qwen3.5-4B | Q8_0 | 70.2 | 70000 | 4.6 ГБ |
| Qwen3.5-9B | Q4_K_M | 55.4 | 43000 | 6.2 ГБ |
| Nanbeige4.2-3B | Q4_K_M | 60.0 | 26000 | 2.7 ГБ |
| Nanbeige4.2-3B | Q8_0 | 38.0 | 18000 | 4.4 ГБ |
Кроме того, автор обнаружил, что некоторые модели, например Nanbeige4.2-3B, имеют параметр num_loops, из-за которого модель дважды прогоняет веса, что фактически удваивает её размер. Этот нюанс также учитывается в калькуляторе. Итоговый инструмент доступен как веб-страница llamacpp Inference Speed Calculator, а букмарклет позволяет получать расчёт прямо на странице модели Hugging Face, без ручного ввода параметров. Пользователю нужно лишь один раз указать свои константы: пропускную способность памяти (BW), overhead (OV), объём VRAM (V), резерв памяти (R) и тип KV-кэша (KB).
Автор выявил, что эффективность видеокарты даёт overhead около 5 мс на токен, что улучшает точность прогноза.
Практическая ценность инструмента — в возможности прикинуть, потянет ли конкретная модель на вашем железе, ещё до скачивания. Это экономит время и трафик, особенно для владельцев видеокарт с ограниченной памятью. Однако стоит помнить, что расчёт приблизителен: на точность влияют разгон, охлаждение и другие факторы. Тем не менее, подход автора, основанный на реальных замерах, делает прогнозы заметно точнее типичных калькуляторов.

