В середине августа 2026 года в китайском закрытом сегменте появились подробности закрытого показа кремниевого подразделения Xiaomi. Компания привезла рабочий инженерный прототип под названием Xiaomi AI Cube.

И этл уже не очередной неттоп на мобильном процессоре Intel или AMD. Перед нами компактная рабочая станция, собранная, собственно, под вполне конкретную задачу — локальный запуск открытых нейросетей размером до 120 миллиардов параметров без подключения к облаку и без видеокарт Nvidia.

Я свел воедино все утекшие спецификации и вот полный расклад того, что известно об устройстве на сегодняшний день.

Корпус, компоновка и охлаждение

Внешне AI Cube представляет собой куб с гранью около 16 сантиметров. Корпус отфрезерован из цельной болванки авиационного алюминия на станках с ЧПУ.

Отказ от штампованного пластика, как мне кажется, продиктован теплоотводом — металлический корпус сам работает как массивный радиатор. На боковых и задней поверхностях лазером прорезано более 33 тысяч сквозных микроотверстий переменного диаметра.

Внутри установлена испарительная камера увеличенной площади, которая накрывает сразу всю кремниевую сборку и чипы памяти. Продувает конструкцию единственная радиальная турбина на гидродинамическом подшипнике.

Пиковое тепловыделение всей машины составляет 150 Вт под максимальной нагрузкой. В режиме фонового ассистента или работы с легкими моделями потребление падает до 30–40 Вт. Питание подается через один кабель Type‑C по протоколу Power Delivery от внешнего GaN‑блока мощностью 200 Вт.

Аппаратная платформа или сэндвич из трех чипов

Вся системная логика построена не на монолитном кристалле, а на гетерогенной чиплетной сборке XRing. На единой кремниевой подложке со скоростным межкристальным интерконнектом распаяны три процессора.

Итак, XRing O3 — системный контроллер. Чип общей логики на архитектуре ARM v9.2. Внутри 10 вычислительных ядер (2 супер‑ядра, 4 производительных, 4 энергоэффективных), встроенная графика собственной разработки G2-Ultra NX на 16 ядер и базовый NPU производительностью 200 TOPS в формате INT8/FP8. На O3 крутится операционная система, драйверы, работа с накопителями и сетевым стеком.

Далее у нас XRing O100 — матричный ускоритель. Специализированный 6-нанометровый чип с 3D‑компоновкой кристаллов. Его единственная задача — матричные операции и скоростное декодирование слоев трансформеров (фаза генерации токенов). Чип оснащен выделенным высокоскоростным буфером с пропускной способностью 1.22 ТБ/с. Именно этот узел снимает задержку Time‑to‑First‑Token.

И закрывает всю эту историю XRing D100 — вычислитель и банк памяти. 3-нанометровый кристалл с 20 ядрами повышенной плотности, изначально созданный для автопилота электромобилей Xiaomi. В него интегрирован четырехканальный контроллер объединенной памяти (Unified Memory), поддерживающий массив LPDDR5X/LPDDR6 объемом до 160 гигабайт с прямым доступом для CPU и NPU.

Порты, интерфейсы и подключения

AI Cube может работать как самостоятельный рабочий компьютер с монитором или как тихий хэдлес‑сервер в локальной сети. На задней панели выведены:

  • Два порта USB4 / Thunderbolt со скоростью до 40 Гбит/с и поддержкой вывода видео DisplayPort 2.1.

  • Два сетевых порта Ethernet со скоростью 10 Гбит/с для быстрой переброски датасетов и объединения нескольких кубов в вычислительный кластер.

  • Видеовыход HDMI 2.1 с поддержкой 4K/120 Гц.

  • Беспроводные модули Wi‑Fi 7 и Bluetooth 5.4.

Производительность на реальных моделях

По данным закрытой демонстрации 18 августа, инженеры запускали на прототипе модели в диапазоне от 3B до 120B параметров. Замеры скорости генерации выглядят следующим образом:

Модели на 3B-14B параметров (Llama 3.2, Qwen 2.5) в квантовании Q8 или FP16 работают только на связке чипов O3 и O100. Скорость генерации превышает 85–100 токенов в секунду при потреблении около 35 Вт.

Модели на 70B параметров (Llama 3.3 70B, DeepSeek V3 Lite) в 4-битном квантовании Q4_K_M весят около 42 гигабайт и задействуют массив памяти чипа D100. За счет пропускной способности ускорителя в 1.22 ТБ/с скорость генерации держится на уровне 25–28 токенов в секунду. Это быстрее, чем комфортная скорость чтения человека (5–8 токенов в секунду).

Модели на 110B-120B параметров и архитектуры с разреженными экспертами (MoE) целиком помещаются в 160-гигабайтный пул чипа D100 вместе с рабочим контекстом на 32k-64k токенов. Скорость генерации составляет 10–14 токенов в секунду при максимальном потреблении 150 Вт.

Программный стек

Устройство работает под управлением специализированного дистрибутива на базе Linux с прослойкой HyperOS AI Server.

Для совместимости с мировым софтом инженеры Xiaomi разработали рантайм XRing Core, который на лету транслирует операторы CUDA в инструкции для аппаратных блоков O100 и D100. Из коробки заявлена поддержка форков vLLM, llama.cpp, Ollama и фреймворка PyTorch.

Доступ к машине организован через веб‑интерфейс, локальный OpenAI‑совместимый API‑эндпоинт или прямое терминальное подключение по SSH.

Статус, цена и сроки

На текущий момент Xiaomi AI Cube — это действующий инженерный прототип (Engineering Sample).

Компания пока не называет розничной цены и точных сроков появления на полках. По оценкам китайских отраслевых аналитиков, себестоимость сборки с 160 ГБ скоростной памяти и 3-нм чипом D100 в текущих реалиях колеблется в районе 1200–1500 долларов.

И вот если серийная версия выйдет на рынок в диапазоне до двух тысяч долларов, рынок настольных ИИ‑станций получит прямого конкурента Mac Studio, способного работать с серверными весами при потреблении обычной лампочки.

Что сказать, ожидаем релиза. Очень интересно, сколько по итогу этот аппарат будет стоить.