Moonshot AI выложила технический отчет по Kimi K3 — своей флагманской открытой модели. Вместе с релизом компания подтвердила ключевые архитектурные детали и показала, что K3 действительно заметно отличается от K2 не только масштабом, но и подходом к построению модели.

Завезли новую конструкцию внимания. Если K2 опиралась на один механизм, то в K3 используется связка из 93 слоев, где 69 слоев построены на Kimi Delta Attention (KDA), а 24 — на Gated MLA. Отдельно Moonshot подчеркивает, что модель сочетает KDA и Attention Residuals (AttnRes), чтобы лучше проводить информацию по глубине и длине последовательности.

KDA и AttnRes решают типичные проблемы длинного контекста. KDA создает новые требования к prefix caching, поэтому компания даже вынесла соответствующую реализацию в сообщество vLLM, чтобы обеспечить нормальный инференс при большом контексте.

Вторая крупная ось изменений — MoE. В K3 используется Stable LatentMoE: из 896 экспертов на токен активируются 16, а число shared experts выросло до 2. В отчете Moonshot также указывает, что это дает примерно 2,5× выигрыш в эффективности масштабирования по сравнению с K2.

Для балансировки нагрузки компания заменила классические эвристики на Quantile Balancing: распределение экспертов строится напрямую по квантилям router‑score, без чувствительного балансировочного гиперпараметра. В качестве функции активации используется SiTU‑GLU, а для обучения внимания — Per‑Head Muon, то есть оптимизация по головам внимания по отдельности.

Теперь поговорим про квантование. Компания пишет, что K3 обучается с MXFP4 weights и MXFP8 activations, а в техотчете отдельно советует запускать модель на конфигурациях с 64 и более ускорителями. Для инференса компания также рекомендует использовать супернодовую архитектуру и указывает, что это помогает сохранять приемлемую стоимость ответа на фоне очень длинного контекста.

Что показывает бенчмарк

Moonshot не пытается выдавать K3 за безусловного лидера вообще во всем. В собственном блоге компания прямо пишет, что в целом K3 все еще уступает самым сильным закрытым моделям — Claude Fable 5 и GPT 5.6 Sol. При этом на своей оценочной сетке модель показывает frontier‑level performance и обгоняет другие протестированные системы по ряду задач.

Внутри отчета K3 хорошо смотрится на длинном кодинге, agentic‑задачах и multimodal‑оценках. Среди наиболее заметных результатов — сильные показатели на DeepSWE, Terminal‑Bench 2.1, BrowseComp, MCPMark‑Verified, OfficeQA Pro и ряде других наборов. Отдельно Moonshot подчеркивает, что K3 умеет работать в сценариях, где модель сама строит длинные цепочки действий, управляет инструментами и держит состояние между шагами.

В блоге Moonshot K3 описывается как модель для long‑horizon coding, knowledge work и reasoning. Компания показывает примеры, где модель работает с большими репозиториями, собирает и правит видео из десятков исходных клипов и даже проектирует чип в рамках автономного 48-часового цикла. Это важно не как эффектная демонстрация, а как сигнал: K3 проектировалась под долгие последовательности действий, а не только под короткие ответы в чате.

При этом Moonshot честно перечисляет и ограничения. В частности, компания предупреждает, что K3 чувствительна к thinking history: если агентный хаб не передает всю историю размышлений, качество может заметно просесть. Еще одна оговорка касается излишней инициативности: в некоторых сценариях модель может принимать неожиданные решения от имени пользователя, если задача сформулирована нечетко.

Гонка open‑weight‑моделей все больше смещается от простого наращивания параметров к инженерии: архитектуре внимания, MoE‑маршрутизации, балансировке экспертов, квантованию и системам кеширования.

Ссылки:
GitHub с техотчетом
GitHub