Две серверные карты NVIDIA Tesla P100 2016 года выпуска, купленные по цене от 4 до 9 тыс. рублей за штуку, дают суммарно 32 ГБ памяти HBM2. Этого достаточно, чтобы запускать локальные модели класса Qwen и Gemma до 32B параметров. Автор кейса на Habr собрал стенд на открытой платформе: Intel Xeon E5-2680 v4 (14 ядер / 28 потоков), 64 ГБ DDR4, NVMe на 512 ГБ и блок питания на 1050 Вт. Видеовыход обеспечивает GeForce GT 710, а сами P100 работают только через llama.cpp с GGUF-квантами — тензорных ядер у них нет.

P100 массово списывали из дата-центров, поэтому на вторичном рынке они стоят почти бесценок. Две карты дают 32 ГБ — ровно столько, чтобы влезали модели до 32B. Автор напечатал воздуховоды на 3D-принтере: без них карты уходят в троттлинг. Корпус открытый, чтобы пыль не задерживалась, а горячий воздух уходил напрямую на турбины. В спящем режиме машина потребляет около 135 Вт, под нагрузкой — до 600 Вт. Две турбины и 28 ядер Xeon ощутимо греют комнату, так что отопление автор называет почти бесплатным.

МодельГдеБаллСкоростьКонтекст
Ornith-1.5-35Bлокально100%40.8 t/s (без думания; think ~22)192K
Qwen3.8-27B-self-MTP Q5 (224K)локально99%~21224K
Muse-Glimmer-30Bлокально99%17.6256K
Fusion-711локально

Рабочая модель — Ornith-1.5-35B в квантовании Q4_K_M, запущенная в режиме без размышлений. Это MoE-архитектура: суммарно 35 млрд параметров, активно около 13 млрд, поэтому она умещается на две P100. Локально выдаёт около 40 токенов в секунду, облачный DeepSeek обгоняет её втрое. Скорость остальных моделей — от 10 до 50 токенов в секунду в зависимости от архитектуры и кванта. Контекст у Ornith-1.5-35B — 192K токенов.

Потребление: около 135 Вт в простое и до 600 Вт под нагрузкой, что автор использует как дополнительный обогрев комнаты.

Автор не доверяет синтетическим бенчмаркам, где модели набирают 86 или 88 баллов. Вместо этого он собрал 14 задач из собственной практики: FreeRTOS для ESP32 с опросом DHT22 и гистерезисом реле, гонка ресурсов в алготрейдинге на Python, температурный дрейф MEMS-датчика BMA423, фильтр Калмана и NaN в double, smali-патчи для Android, torn read в JMM, 3D-печать, безопасность веб-приложений и разбор бинарных протоколов. Каждую модель он прогонял по всем 14 задачам и ставил от 0 до 10 баллов, плюс три «красных флага» за принципиальные ошибки. Например, если модель утверждает, что перенос задачи на другое ядро решает проблему с шиной, — это неверно, parking глобален.

Эталоном выбрана облачная DeepSeek V4 Flash. Результаты: Ornith-1.5-35B — 100% (140 из 140), Qwen3.8-27B-self-MTP Q5 — 99%, Muse-Glimmer-30B — 99%, Fusion-711 — без указания точного балла. Ornith-1.5-35B обошла эталон, но уступает ему в скорости. Автор подчёркивает: локальные модели в этом году догнали Gemini полугодичной давности. До лидеров им далеко, но как рабочий инструмент они уже годятся. Главный мотив — независимость от внешних API и возможность экспериментировать без риска сжечь оплаченные токены.

Ограничения стенда: P100 не поддерживают тензорные ядра и современные оптимизации, работают только через llama.cpp с GGUF-квантами. Открытая платформа шумит и требует места — сервер пришлось выселить на кухню. Энергопотребление под нагрузкой достигает 600 Вт, что заметно сказывается на счетах за электричество. Для моделей больше 32B потребуется либо больше карт, либо переход на более современное железо. Тем не менее кейс показывает: локальный ИИ класса Opus 4.6 можно собрать «задешево», если готов мириться с шумом, энергозатратами и ограничениями старых GPU.