Автор публикации на Хабре представил букмарклет, который автоматически вычисляет теоретическую скорость генерации токенов для GGUF-моделей в llama.cpp. Инструмент работает с карточками моделей на Hugging Face: скрипт через API находит первый.gguf-файл в репозитории, скачивает его первые 400 КБ (Range-запросом) и парсит заголовок GGUF, извлекая параметры вроде block_count, head_count_kv, key_length, context_length, full_attention_interval и num_loops. Эти данные подставляются в формулу, которая учитывает пропускную способность видеопамяти, объём VRAM и overhead — задержку на токен, характерную для конкретной видеокарты.

Проблема, которую решает букмарклет, знакома многим, кто запускает локальные модели: существующие онлайн-калькуляторы часто дают цифры, далёкие от реальности. Автор на своей RTX 3070 с 8 ГБ VRAM обнаружил, что может запускать MoE-модели до 35 млрд параметров, хотя распространённое мнение гласит, что 8 ГБ для этого недостаточно. При замерах скорости генерации и максимального контекста выяснилось, что простая формула «вес модели / пропускная способность» не работает: реальная скорость ниже расчётной. Нейросеть, которую автор привлёк для анализа, ввела поправочный коэффициент — эффективность видеокарты, которая у него составила 60–80%. Более того, анализ замеров показал, что overhead (задержка на токен) для его карты равен 5 мс — эта константа теперь заложена в формулу.

МодельКвантСкорость, ток/сКонтекстВес
Qwen3.5-4BQ4_K_M64.5260003.0 ГБ
Qwen3.5-4BQ4_K_M87.11000003.0 ГБ
Qwen3.5-4BQ4_K_M88.31150003.0 ГБ
Qwen3.5-4BQ8_070.2700004.6 ГБ
Qwen3.5-9BQ4_K_M55.4430006.2 ГБ
Nanbeige4.2-3BQ4_K_M60.0260002.7 ГБ
Nanbeige4.2-3BQ8_038.0180004.4 ГБ

Кроме того, автор обнаружил, что некоторые модели, например Nanbeige4.2-3B, имеют параметр num_loops, из-за которого модель дважды прогоняет веса, что фактически удваивает её размер. Этот нюанс также учитывается в калькуляторе. Итоговый инструмент доступен как веб-страница llamacpp Inference Speed Calculator, а букмарклет позволяет получать расчёт прямо на странице модели Hugging Face, без ручного ввода параметров. Пользователю нужно лишь один раз указать свои константы: пропускную способность памяти (BW), overhead (OV), объём VRAM (V), резерв памяти (R) и тип KV-кэша (KB).

Автор выявил, что эффективность видеокарты даёт overhead около 5 мс на токен, что улучшает точность прогноза.

Практическая ценность инструмента — в возможности прикинуть, потянет ли конкретная модель на вашем железе, ещё до скачивания. Это экономит время и трафик, особенно для владельцев видеокарт с ограниченной памятью. Однако стоит помнить, что расчёт приблизителен: на точность влияют разгон, охлаждение и другие факторы. Тем не менее, подход автора, основанный на реальных замерах, делает прогнозы заметно точнее типичных калькуляторов.