Группа Rubytech, разработчик программно-аппаратных комплексов для высоконагруженных ИТ-систем, завершила испытания российской LLM Cotype 3 от MWS ИИ на графических процессорах китайского производства. Тестирование проводилось на базе собственного ПАК «Машина искусственного интеллекта» в модификации «Скала^р» с восемью китайскими GPU. Цель — проверить, пригодна ли такая конфигурация для построения корпоративной ИИ-инфраструктуры, и результаты оказались положительными: модели работают стабильно, а производительность в распространенных сценариях инференса сопоставима с системами на Nvidia H100.
Для России вопрос доступности вычислительных ресурсов стоит особенно остро. Технологическая независимость требует не только собственных LLM, но и аппаратной базы, которая позволяет разворачивать модели внутри корпоративного контура. Дефицит GPU и рост стоимости оборудования Nvidia заставили рынок искать альтернативы. В ходе испытаний инженеры Rubytech адаптировали модель под альтернативную платформу, подготовив специальное программное окружение. Оценка ключевых параметров — скорости обработки запросов, времени отклика и стабильности при повышенной нагрузке — показала, что при обработке 27 тысяч токенов время генерации первого токена (mean TTFT) составило около 8К мс, а межтокенная задержка (TPOT) — от 111 мс, что соответствует требованиям корпоративных сценариев.
| Параметр | Значение |
|---|---|
| Модель | Cotype 3 от MWS AI |
| GPU | 8 китайских GPU |
| ПАК | «Машина искусственного интеллекта» модификация «Скала^р» |
| TTFT при 27k токенов | около 8К мс |
| TPOT | от 111 мс |
| Прирост производительности после оптимизации | 2–2.2 раза |
Отдельно в компании изучили влияние программной оптимизации. Настройка драйверов, программного окружения и инструментов оркестрации позволила в отдельных сценариях получить производительность в 2–2.2 раза выше, чем с исходной программной средой для этих GPU. Использование контейнерной архитектуры упрощает развертывание моделей и сокращает переход от тестирования к промышленной эксплуатации. Это особенно важно для государственного сектора, компаний с госучастием и организаций критической информационной инфраструктуры, которым принципиально важно разворачивать модели внутри собственного контура.
Производительность в типовых сценариях инференса сопоставима с конфигурациями на базе Nvidia H100.
Связка «китайские GPU — российская платформа (ПАК) — отечественная LLM» становится легитимным вариантом для корпоративных внедрений. Совокупная стоимость владения (TCO) — ключевой фактор: стоимость GPU составляет основную долю бюджета ИИ-проектов. В отдельных сценариях альтернативная аппаратная база может быть экономически оправданной и снижать TCO при масштабировании. При этом речь не идет о полном отказе от существующих стеков, но рынку критически важно иметь выбор оборудования в зависимости от бюджета и задач. Как отметил Михаил Гилязов из «Скала^р», технологическая независимость начинается там, где у заказчика есть реальная, технически выверенная альтернатива на каждом уровне стека.
