В середине августа 2026 года в китайском закрытом сегменте появились подробности закрытого показа кремниевого подразделения Xiaomi. Компания привезла рабочий инженерный прототип под названием Xiaomi ИИ Cube. Это не очередной неттоп на мобильном процессоре Intel или AMD, а компактная рабочая станция, собранная под конкретную задачу — локальный запуск открытых нейросетей размером до 120 миллиардов параметров без подключения к облаку и без видеокарт Nvidia.
Внешне ИИ Cube представляет собой куб с гранью около 16 сантиметров. Корпус отфрезерован из цельной болванки авиационного алюминия на станках с ЧПУ. Отказ от штампованного пластика продиктован теплоотводом — металлический корпус сам работает как массивный радиатор. На боковых и задней поверхностях лазером прорезано более 33 тысяч сквозных микроотверстий переменного диаметра. Внутри установлена испарительная камера увеличенной площади, которая накрывает всю кремниевую сборку и чипы памяти. Продувает конструкцию единственная радиальная турбина на гидродинамическом подшипнике. Пиковое тепловыделение всей машины составляет 150 Вт под максимальной нагрузкой. В режиме фонового ассистента или работы с легкими моделями потребление падает до 30–40 Вт. Питание подается через один кабель Type-C по протоколу Power Delivery от внешнего GaN-блока мощностью 200 Вт.
| Модель | Размер | Квантование | Скорость генерации | Потребление |
|---|---|---|---|---|
| Llama 3.2, Qwen 2.5 | 3B-14B | Q8/FP16 | 85–100 токенов/с | 35 Вт |
| Llama 3.3 70B, DeepSeek V3 Lite | 70B | Q4_K_M | 25–28 токенов/с | — |
| MoE-модели | 110B-120B | — | 10–14 токенов/с | 150 Вт |
Системная логика построена не на монолитном кристалле, а на гетерогенной чиплетной сборке XRing. На единой кремниевой подложке со скоростным межкристальным интерконнектом распаяны три процессора. XRing O3 — системный контроллер на архитектуре ARM v9.2 с 10 вычислительными ядрами, встроенной графикой G2-Ultra NX и базовым NPU производительностью 200 TOPS. На O3 крутится операционная система, драйверы, работа с накопителями и сетевым стеком. XRing O100 — матричный ускоритель, специализированный 6-нанометровый чип с 3D-компоновкой кристаллов. Его единственная задача — матричные операции и скоростное декодирование слоев трансформеров. Чип оснащен выделенным высокоскоростным буфером с пропускной способностью 1.22 ТБ/с. Именно этот узел снимает задержку Time-to-First-Token. XRing D100 — вычислитель и банк памяти, 3-нанометровый кристалл с 20 ядрами повышенной плотности, изначально созданный для автопилота электромобилей Xiaomi. В него интегрирован четырехканальный контроллер объединенной памяти (Unified Memory), поддерживающий массив LPDDR5X/LPDDR6 объемом до 160 гигабайт с прямым доступом для CPU и NPU.
Устройство построено на гетерогенной чиплетной сборке XRing из трех процессоров: O3, O100 и D100.
ИИ Cube может работать как самостоятельный рабочий компьютер с монитором или как тихий хэдлес-сервер в локальной сети. На задней панели выведены два порта USB4 / Thunderbolt со скоростью до 40 Гбит/с и поддержкой вывода видео DisplayPort 2.1, два сетевых порта Ethernet со скоростью 10 Гбит/с для быстрой переброски датасетов и объединения нескольких кубов в вычислительный кластер, видеовыход HDMI 2.1 с поддержкой 4K/120 Гц, беспроводные модули Wi-Fi 7 и Bluetooth 5.4.
По данным закрытой демонстрации 18 августа, инженеры запускали на прототипе модели в диапазоне от 3B до 120B параметров. Модели на 3B-14B параметров (Llama 3.2, Qwen 2.5) в квантовании Q8 или FP16 работают только на связке чипов O3 и O100. Скорость генерации превышает 85–100 токенов в секунду при потреблении около 35 Вт. Модели на 70B параметров (Llama 3.3 70B, DeepSeek V3 Lite) в 4-битном квантовании Q4_K_M весят около 42 гигабайт и задействуют массив памяти чипа D100. За счет пропускной способности ускорителя в 1.22 ТБ/с скорость генерации держится на уровне 25–28 токенов в секунду. Это быстрее, чем комфортная скорость чтения человека (5–8 токенов в секунду). Модели на 110B-120B параметров и архитектуры с разреженными экспертами (MoE) целиком помещаются в 160-гигабайтный пул чипа D100 вместе с рабочим контекстом на 32k-64k токенов. Скорость генерации составляет 10–14 токенов в секунду при максимальном потреблении 150 Вт.
Устройство работает под управлением специализированного дистрибутива на базе Linux с прослойкой HyperOS ИИ Server. Для совместимости с мировым софтом инженеры Xiaomi разработали рантайм XRing Core, который на лету транслирует операторы CUDA в инструкции для аппаратных блоков O100 и D100. Из коробки заявлена поддержка форков vLLM, llama.cpp, Ollama и фреймворка PyTorch. Доступ к машине организован через веб-интерфейс, локальный OpenAI-совместимый API-эндпоинт или прямое терминальное подключение по SSH.
На текущий момент Xiaomi ИИ Cube — это действующий прототип. Цена и сроки появления в продаже не раскрываются. Устройство позиционируется как решение для локального ИИ без зависимости от облачных провайдеров и GPU Nvidia, что может быть интересно компаниям с требованиями к конфиденциальности данных или разработчикам, работающим с открытыми моделями.

