Xiaomi MiMo: триллион параметров, из которых работает четыре процента
Пока все следили за гонкой закрытых моделей, Xiaomi довела свою линейку MiMo до триллиона параметров — и выложила веса под MIT. Разбираю самое интересное.
Это не модель, а семейство
MiMo — не название одного чекпойнта, а зонтик. Под ним вышли рассуждающая MiMo-7B (май 2025), зрение MiMo‑VL, аудио MiMo‑Audio, модель для роботов и машин MiMo‑Embodied, разреженные MoE поколения V2 и V2.5. Общее у них — имя и команда, а не архитектура. Путь занял полтора года:
май 2025 — MiMo-7B, 25 трлн токенов, обучение с нуля ради рассуждений;
июнь 2025 — MiMo‑VL-7B: картинки, видео, OCR, интерфейсы;
декабрь 2025 — MiMo‑V2-Flash: 309 млрд всего, 15 млрд активных;
апрель 2026 — V2.5 и V2.5-Pro, уже под MIT;
июнь 2026 — UltraSpeed и больше тысячи токенов в секунду.
Не только текст
MiMo‑V2.5 — нативная омнимодальность: 310 млрд параметров всего, 15 млрд активных, плюс визуальный энкодер на 729 млн и аудиоэнкодер на 261 млн. Модель принимает текст, картинки, видео и звук, а отдаёт текст и вызовы инструментов. Рядом живут MiMo‑V2.5-ASR — распознавание речи под Apache 2.0, и семейство TTS: синтез, голос по описанию и клонирование по короткой записи.
Триллион, из которого работает 4%
Флагман MiMo‑V2.5-Pro — разреженная смесь экспертов: 1.02 трлн параметров всего и 42 млрд активных на каждый токен. Семьдесят слоёв, 384 эксперта, из которых для токена выбираются восемь. Контекст — до 1 048 576 токенов, веса открыты под MIT.
Внимание с окном в 128 токенов
Самое интересное — как удешевили длинный контекст. 60 слоёв из 70 смотрят только на 128 предыдущих токенов, и лишь 10 — на весь контекст. Чтобы дешёвое окно не портило качество, добавлен обучаемый «сток внимания»: голова вправе не тратить вероятность на бесполезных соседей и «сбросить» её в пустоту.
Учителей много, ученица одна
Пост‑тренировка держится на MOPD: несколько моделей‑специалистов — математика, код, терминал, поиск, безопасность — дают токенные подсказки одной ученице на её собственных траекториях, а не на чужих ответах. Рядом работает R3: маршрутизация экспертов, записанная на инференсе, повторяется при обучении — без этого обучение MoE разъезжается.
Тысяча токенов в секунду
Конфигурация UltraSpeed: веса экспертов сжимают в MXFP4, добавляют спекулятивное декодирование DFlash и «живучие» ядра TileRT. На одном узле из восьми GPU — больше тысячи токенов в секунду. Триллион весов в четыре бита — это около 510 ГБ, и всё это надо где‑то держать.
Что это значит
Xiaomi показала, что открытые веса — уже не удел семимиллиардных моделей. Но «open‑weight» точнее, чем «open source»: веса есть, а данных и всего пайплайна обучения — нет. И ещё одно: миллион токенов в карточке не обещает одинаковой точности на всей длине — в GraphWalks модель держала ненулевой результат на миллионе, а прошлое поколение там резко проседало. Хостинг V2 Xiaomi погасила 30 июня 2026 года и попросила клиентов перейти на V2.5, но скачанные веса это не отменяет.
Модель и карточка: mimo.xiaomi.com. Код и веса: github.com/XiaomiMiMo.

