Пока все тестируют Qwen 3.8 27B, появилась новая модель от Alibaba с Qwen 4 архитектурой. Это не байт и не шутка: выпущенная пару дней назад новая мультимодальная MoE модель под названием Qwen3.8-Flash-Next является ранним архитектурным превью, используемым в будущей Qwen 4 [1].

Модель играет ту же роль, что и Qwen3-Next для Qwen3.5: гибридная конструкция Gated DeltaNet с Gated Attention, представленная тогда, с тех пор используется в сериях Qwen3.5, Qwen3.6, Qwen3.7 и Qwen3.8. Новая архитектура переосмысливает этот подход, давайте разбираться, что изменилось.

Что нового в архитектуре Qwen 4 (Qwen3.8-Flash-Next)

На базовом уровне это мультимодальная архитектура типа Mixture-of-Experts (MoE). Однако в отличие от привычных MoE, здесь применено несколько решений для эффективной локальной работы с большими контекстными окнами (262K нативно и 1M с YaRN):

  1. Разделение общего и активного объема параметров

    • Общий объем модели: 125 млрд параметров основного MoE-графа + 51 млрд параметров N-gram таблиц + 4 млрд параметров головы MTP (Multi-Token Prediction).

    • Активные параметры на токен: всего 6B (512 маршрутизируемых экспертов, из которых активны 10 + 1 общий эксперт). То есть по вычислениям на токен модель сопоставима с компактными моделями на 6B, а по уровню знаний превосходит тяжелые 70B+ модели.

  2. 51B N-gram Embeddings (PLE) и офлоадинг в RAM/SSD

    Одной из главных архитектурных новинок стало добавление отдельного слоя N-gram эмбеддингов размером 51B параметров. Рядом с основной моделью живет отдельная таблица на 20 млн записей (биграммы и триграммы). В предыдущей архитектуре число параметров и объем вычислений находились на одной оси (зависели друг от друга). N-gram память позволяет разделить эту зависимость.

    N-gram слой не требует квадрирования или сложных матричных умножений, т.к. ключи в этой таблице являются детерминированными хешами от последней пары токенов. Позиции обращений рассчитываются заранее, поэтому всю эту таблицу (51B) незачем держать в видеопамяти.

    Подойдет обычная оперативная память или SSD/NVMe, и нужные данные считываются с помощью асинхронного префетчинга через mmap из обычного SSD или системной памяти без потери точности, пока видеокарта будет считать остальное в самих экспертах. В итоге эта таблица работает как быстрая память большого объема для частых фраз и локальных паттернов языка.

  3. Гибридный механизм: GDN + QSA (Qwen Sparse Attention)

    Слои Gated DeltaNet идентичны в обеих моделях (конфигурация голов и размерность сохранены). В Qwen 3.8 27B каждый такой слой задействует четыре KV-головы (Gated Attention): это обеспечивает высокую точность, однако вычислительные затраты и объем памяти растут линейно с увеличением контекста, что делает данный слой самым ресурсоемким в стеке.

    В Qwen3.8-Flash-Next механизм Gated Attention заменен на Qwen Sparse Attention. Главное отличие нового подхода заключается в детализации отбора. Вместо оценки каждого отдельного токена в истории индексирующий модуль (MQA: 4 query-головы и 1 общая K-голова с размерностью 128) анализирует микроблоки токенов. После этого модель обращается к контексту (активирует внимание) в рамках фиксированного бюджета размером 512 блоков или 2048 токенов.

    Таким образом, Gated DeltaNet эффективно запоминает, а QSA точно ищет: 36 слоев (из 48) сжимают историю в состояние фиксированного размера, 12 слоев делают точечный выборочный поиск по настоящей истории. Модель сама решает, сколько информации считывать из каждой ветки и сколько записывать обратно.

    В модели 48 слоев:

    • 36 слоев (3 из 4): используют Gated DeltaNet (GDN), линейный рекуррентный механизм, который сжимает историю в рекуррентное состояние фиксированного размера, предотвращая рост KV-кэша.

    • 12 слоев (1 из 4): используют Qwen Sparse Attention (QSA). В отличие от классического Attention, QSA агрегирует последовательность в микроблоки и выбирает только наиболее релевантные области. Это дает до 8.6x прироста скорости Prefill на контекстах в 1 млн токенов.

  4. Gated Residual (GR) и MTP

    Gated Residual разделяет единый residual-поток на 4 ветки. Поэлементный динамический gate управляет чтением слоя, а единый скалярный gate управляет записью. Интересно то, что одна из этих веток берет на себя роль магистрали для сквозного переноса информации из начальных слоев в глубокие.

    Это сохраняет стабильность обучения и емкость слоев неизменными. Вычислительный оверхед на инференсе минимален, в том числе благодаря хранению веток в формате FP8.

    По MTP все просто: добавили один слой, обученный на нескольких шагах вперед. Получился готовый драфтер для спекулятивного декодирования, бесплатный буст скорости генерации, без потери точности. Что это такое, можно прочитать в другой моей статье [2]

Сравнение Qwen3.8-Flash-Next vs Qwen 3.8 27B

Для наглядности сравним новую архитектуру с недавно вышедшей моделью Qwen 3.8 27B [3].

Параметр / Характеристика

Qwen 3.8 27B (Dense)

Qwen3.8-Flash-Next (Qwen 4 MoE)

Тип модели

Плотная (Dense)

MoE (Mixture of Experts) + N-gram

Общие параметры

27 млрд

~180 млрд (125B MoE + 51B N-gram + 4B MTP)

Активные параметры / токен

27 млрд

6 млрд

Механизм внимания (Attention)

GDN + Gated Attention (Full Attention)

GDN + QSA (Sparse Micro-block Attention)

N-gram память

Отсутствует

51B N-gram Embeddings (поддержка mmap)

Residual-связи

Одиночный поток

4-поточный Gated Residual (GR)

Нативный контекст

262K

262K (расширяемый до 1M)

Сравнение в бенчмарках

Несмотря на то что Qwen3.8-Flash-Next использует всего 6B активных параметров на токен (в 4.5 раза меньше, чем Qwen 3.8 27B), архитектура Qwen 4 демонстрирует существенное превосходство в агентских задачах, кодинге и логике:

Бенчмарк

Qwen3.8-Flash-Next (Qwen 4 MoE)

Qwen3.8-27B (Dense)

Улучшение

DeepSWE 1.1 (агентский кодинг)

58.7

42.2

+16,5

SWE-bench Pro

62.5

61.7

+0,8 (паритет)

SWE-bench Multilingual

81.0

73.8

+7,2

NL2Repo-Bench

48.1

42.3

+5,8

CoWorkBench (in-house)

73.9

70.7

+3,2

JobBench

55.7

33.4

+22,3

Agents’ Last Exam (Score / Pass@1)

51.2 / 24.3

42.9 / 20.4

+8,3 / +3,9

Toolathlon Verified (Pass@1)

73.5

67.1

+6,4

IFBench

81.3

79.5

+1,8

GPQA Diamond

91.7

89.2

+2,5

HLE (GPT-4o judge)

35.9

30.8

+5,1

LiveCodeBench v6

91.9

90.3

+1,6

Примечательно следующее: если Qwen 3.8 27B по тестам вплотную подбирается к Claude Opus 4.6, то превью новой архитектуры Qwen 4 обходит ее в большинстве тестов и вплотную подбирается к Claude Opus 4.8. Вполне возможно, что Qwen 4 на релизе начнет щупать Claude Fable 5 за мягкое.

Запуск 4-битной версии на 128 ГБ RAM со скоростью 20-30 tok/s

Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD, требования к VRAM GPU кардинально снизились. Как отмечается в документации Unsloth [4], 4-битные квантованные версии (GGUF UD-Q4_K_XL и UD-IQ4_XS) позволяют использование на системах со 128 ГБ оперативной памяти (например, Mac Studio / MacBook Pro на Apple Silicon с Unified Memory или ПК/сервер со 128GB RAM).

При этом показатели работы при запуске через Unsloth / llama.cpp следующие:

  • Необходимый объем памяти: ~85-110 ГБ ОЗУ/Unified Memory для полной загрузки 4-битной квантовки.

  • Скорость генерации: около 20-30 токенов в секунду при инференсе, что является впечатляющим результатом для модели со 180B весов. У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна.

  • Интерактивный режим гибридного мышления (Hybrid Thinking): в Unsloth Desktop из коробки поддерживается переключение режимов reasoning_effort (xhigh, medium, low, none), а также сохранность цепочки рассуждений (Preserve Thinking) между репликами диалога.

Итоги

Модель Qwen3.8-Flash-Next наглядно задает тренд на развертывание локального ИИ на обычных рабочих станциях со 128 ГБ оперативной памяти. Такой подход исключает затраты на дорогостоящие GPU-кластеры и сохраняет высокую скорость инференса до 30 токенов в секунду, а 6 миллиардов активных параметров гарантируют отличный баланс качества и быстродействия для работы локальных агентов.

Важно отметить, что Alibaba на сегодняшний день остается единственной компанией, предоставляющей в открытый доступ веса полного спектра моделей: от компактных решений меньше 1B до флагманов 100B+ параметров.

Линейка Qwen закрывает все актуальные задачи, объединяя классические рассуждающие LLM, мультимодальные и голосовые системы. Это позволяет бизнесу строить автономные on-premise ансамбли на базе инфраструктуры одного вендора с идеально совместимыми компонентами.

Такой подход открывает доступ к уникальным возможностям, включая каскадную маршрутизацию для удешевления инференса, бесшовное построение мультимодальных конвейеров и эффективную дистилляцию корпоративных знаний.

Update: в комментариях много вопросов о там с какой скоростью будет работать модель на их железе. Вот здесь пользователи делятся получившейся скоростью на своих сборках. Используйте эти данные как ориентир, только помните, что помимо самого железа критически важно правильно настроить под него параметры запуска модели.

References

  1. Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency, Qwen Blog (2026)

  2. Нейронные сети нетрадиционного ускорения, Habr (2026)

  3. Qwen/Qwen3.8-27B, Hugging Face (2026)

  4. Qwen3.8-Flash-Next: How to Run Locally, Unsloth Docs (2026)