Xiaomi MiMo: триллион параметров, из которых работает четыре процента

Пока все следили за гонкой закрытых моделей, Xiaomi довела свою линейку MiMo до триллиона параметров — и выложила веса под MIT. Разбираю самое интересное.

Это не модель, а семейство

MiMo — не название одного чекпойнта, а зонтик. Под ним вышли рассуждающая MiMo-7B (май 2025), зрение MiMo‑VL, аудио MiMo‑Audio, модель для роботов и машин MiMo‑Embodied, разреженные MoE поколения V2 и V2.5. Общее у них — имя и команда, а не архитектура. Путь занял полтора года:

  • май 2025 — MiMo-7B, 25 трлн токенов, обучение с нуля ради рассуждений;

  • июнь 2025 — MiMo‑VL-7B: картинки, видео, OCR, интерфейсы;

  • декабрь 2025 — MiMo‑V2-Flash: 309 млрд всего, 15 млрд активных;

  • апрель 2026 — V2.5 и V2.5-Pro, уже под MIT;

  • июнь 2026 — UltraSpeed и больше тысячи токенов в секунду.

Не только текст

MiMo‑V2.5 — нативная омнимодальность: 310 млрд параметров всего, 15 млрд активных, плюс визуальный энкодер на 729 млн и аудиоэнкодер на 261 млн. Модель принимает текст, картинки, видео и звук, а отдаёт текст и вызовы инструментов. Рядом живут MiMo‑V2.5-ASR — распознавание речи под Apache 2.0, и семейство TTS: синтез, голос по описанию и клонирование по короткой записи.

Триллион, из которого работает 4%

Флагман MiMo‑V2.5-Pro — разреженная смесь экспертов: 1.02 трлн параметров всего и 42 млрд активных на каждый токен. Семьдесят слоёв, 384 эксперта, из которых для токена выбираются восемь. Контекст — до 1 048 576 токенов, веса открыты под MIT.

Внимание с окном в 128 токенов

Самое интересное — как удешевили длинный контекст. 60 слоёв из 70 смотрят только на 128 предыдущих токенов, и лишь 10 — на весь контекст. Чтобы дешёвое окно не портило качество, добавлен обучаемый «сток внимания»: голова вправе не тратить вероятность на бесполезных соседей и «сбросить» её в пустоту.

Учителей много, ученица одна

Пост‑тренировка держится на MOPD: несколько моделей‑специалистов — математика, код, терминал, поиск, безопасность — дают токенные подсказки одной ученице на её собственных траекториях, а не на чужих ответах. Рядом работает R3: маршрутизация экспертов, записанная на инференсе, повторяется при обучении — без этого обучение MoE разъезжается.

Тысяча токенов в секунду

Конфигурация UltraSpeed: веса экспертов сжимают в MXFP4, добавляют спекулятивное декодирование DFlash и «живучие» ядра TileRT. На одном узле из восьми GPU — больше тысячи токенов в секунду. Триллион весов в четыре бита — это около 510 ГБ, и всё это надо где‑то держать.

Что это значит

Xiaomi показала, что открытые веса — уже не удел семимиллиардных моделей. Но «open‑weight» точнее, чем «open source»: веса есть, а данных и всего пайплайна обучения — нет. И ещё одно: миллион токенов в карточке не обещает одинаковой точности на всей длине — в GraphWalks модель держала ненулевой результат на миллионе, а прошлое поколение там резко проседало. Хостинг V2 Xiaomi погасила 30 июня 2026 года и попросила клиентов перейти на V2.5, но скачанные веса это не отменяет.

Модель и карточка: mimo.xiaomi.com. Код и веса: github.com/XiaomiMiMo.