Пока все тестируют Qwen 3.8 27B, появилась новая модель от Alibaba с Qwen 4 архитектурой. Это не байт и не шутка: выпущенная пару дней назад новая мультимодальная MoE модель под названием Qwen3.8-Flash-Next является ранним архитектурным превью, используемым в будущей Qwen 4 [1].

Модель играет ту же роль, что и Qwen3-Next для Qwen3.5: гибридная конструкция Gated DeltaNet с Gated Attention, представленная тогда, с тех пор используется в сериях Qwen3.5, Qwen3.6, Qwen3.7 и Qwen3.8. Новая архитектура переосмысливает этот подход, давайте разбираться, что изменилось.

Что нового в архитектуре Qwen 4 (Qwen3.8-Flash-Next)

На базовом уровне это мультимодальная архитектура типа Mixture-of-Experts (MoE). Однако в отличие от привычных MoE, здесь применено несколько решений для эффективной локальной работы с большими контекстными окнами (262K нативно и 1M с YaRN):

  1. Разделение общего и активного объема параметров

    • Общий объем модели: 125 млрд параметров основного MoE-графа + 51 млрд параметров N-gram таблиц + 4 млрд параметров головы MTP (Multi-Token Prediction).

    • Активные параметры на токен: всего 6B (512 маршрутизируемых экспертов, из которых активны 10 + 1 общий эксперт). То есть по вычислениям на токен модель сопоставима с компактными моделями на 6B, а по уровню знаний превосходит тяжелые 70B+ модели.

  2. 51B N-gram Embeddings (PLE) и офлоадинг в RAM/SSD

    Одной из главных архитектурных новинок стало добавление отдельного слоя N-gram эмбеддингов размером 51B параметров. Рядом с основной моделью живет отдельная таблица на 20 млн записей (биграммы и триграммы). В предыдущей архитектуре число параметров и объем вычислений находились на одной оси (зависели друг от друга). N-gram память позволяет разделить эту зависимость.

    N-gram слой не требует квадрирования или сложных матричных умножений, т.к. ключи в этой таблице являются детерминированными хешами от последней пары токенов. Позиции обращений рассчитываются заранее, поэтому всю эту таблицу (51B) незачем держать в видеопамяти.

    Подойдет обычная оперативная память или SSD/NVMe, и нужные данные считываются с помощью асинхронного префетчинга через mmap из обычного SSD или системной памяти без потери точности, пока видеокарта будет считать остальное в самих экспертах. В итоге эта таблица работает как быстрая память большого объема для частых фраз и локальных паттернов языка.

  3. Гибридный механизм: GDN + QSA (Qwen Sparse Attention)

    Слои Gated DeltaNet идентичны в обеих моделях (конфигурация голов и размерность сохранены). В Qwen 3.8 27B каждый такой слой задействует четыре KV-головы (Gated Attention): это обеспечивает высокую точность, однако вычислительные затраты и объем памяти растут линейно с увеличением контекста, что делает данный слой самым ресурсоемким в стеке.

    В Qwen3.8-Flash-Next механизм Gated Attention заменен на Qwen Sparse Attention. Главное отличие нового подхода заключается в детализации отбора. Вместо оценки каждого отдельного токена в истории индексирующий модуль (MQA: 4 query-головы и 1 общая K-голова с размерностью 128) анализирует микроблоки токенов. После этого модель обращается к контексту (активирует внимание) в рамках фиксированного бюджета размером 512 блоков или 2048 токенов.

    Таким образом, Gated DeltaNet эффективно запоминает, а QSA точно ищет: 36 слоев (из 48) сжимают историю в состояние фиксированного размера, 12 слоев делают точечный выборочный поиск по настоящей истории. Модель сама решает, сколько информации считывать из каждой ветки и сколько записывать обратно.

    В модели 48 слоев:

    • 36 слоев (3 из 4): используют Gated DeltaNet (GDN), линейный рекуррентный механизм, который сжимает историю в рекуррентное состояние фиксированного размера, предотвращая рост KV-кэша.

    • 12 слоев (1 из 4): используют Qwen Sparse Attention (QSA). В отличие от классического Attention, QSA агрегирует последовательность в микроблоки и выбирает только наиболее релевантные области. Это дает до 8.6x прироста скорости Prefill на контекстах в 1 млн токенов.

  4. Gated Residual (GR) и MTP

    Gated Residual разделяет единый residual-поток на 4 ветки. Поэлементный динамический gate управляет чтением слоя, а единый скалярный gate управляет записью. Интересно то, что одна из этих веток берет на себя роль магистрали для сквозного переноса информации из начальных слоев в глубокие.

    Это сохраняет стабильность обучения и емкость слоев неизменными. Вычислительный оверхед на инференсе минимален, в том числе благодаря хранению веток в формате FP8.

    По MTP все просто: добавили один слой, обученный на нескольких шагах вперед. Получился готовый драфтер для спекулятивного декодирования, бесплатный буст скорости генерации, без потери точности. Что это такое, можно прочитать в другой моей статье [2]

Сравнение Qwen3.8-Flash-Next vs Qwen 3.8 27B

Для наглядности сравним новую архитектуру с недавно вышедшей моделью Qwen 3.8 27B [3].

Параметр / Характеристика

Qwen 3.8 27B (Dense)

Qwen3.8-Flash-Next (Qwen 4 MoE)

Тип модели

Плотная (Dense)

MoE (Mixture of Experts) + N-gram

Общие параметры

27 млрд

~180 млрд (125B MoE + 51B N-gram + 4B MTP)

Активные параметры / токен

27 млрд

6 млрд

Механизм внимания (Attention)

GDN + Gated Attention (Full Attention)

GDN + QSA (Sparse Micro-block Attention)

N-gram память

Отсутствует

51B N-gram Embeddings (поддержка mmap)

Residual-связи

Одиночный поток

4-поточный Gated Residual (GR)

Нативный контекст

262K

262K (расширяемый до 1M)

Сравнение в бенчмарках

Несмотря на то что Qwen3.8-Flash-Next использует всего 6B активных параметров на токен (в 4.5 раза меньше, чем Qwen 3.8 27B), архитектура Qwen 4 демонстрирует существенное превосходство в агентских задачах, кодинге и логике:

Бенчмарк

Qwen3.8-Flash-Next (Qwen 4 MoE)

Qwen3.8-27B (Dense)

Улучшение

DeepSWE 1.1 (агентский кодинг)

58.7

42.2

+16,5

SWE-bench Pro

62.5

61.7

+0,8 (паритет)

SWE-bench Multilingual

81.0

73.8

+7,2

NL2Repo-Bench

48.1

42.3

+5,8

CoWorkBench (in-house)

73.9

70.7

+3,2

JobBench

55.7

33.4

+22,3

Agents’ Last Exam (Score / Pass@1)

51.2 / 24.3

42.9 / 20.4

+8,3 / +3,9

Toolathlon Verified (Pass@1)

73.5

67.1

+6,4

IFBench

81.3

79.5

+1,8

GPQA Diamond

91.7

89.2

+2,5

HLE (GPT-4o judge)

35.9

30.8

+5,1

LiveCodeBench v6

91.9

90.3

+1,6

Примечательно следующее: если Qwen 3.8 27B по тестам вплотную подбирается к Claude Opus 4.6, то превью новой архитектуры Qwen 4 обходит ее в большинстве тестов и вплотную подбирается к Claude Opus 4.8. Вполне возможно, что Qwen 4 на релизе начнет щупать Claude Fable 5 за мягкое.

Запуск 4-битной версии на 128 ГБ RAM со скоростью 20-30 tok/s

Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD, требования к VRAM GPU кардинально снизились. Как отмечается в документации Unsloth [4], 4-битные квантованные версии (GGUF UD-Q4_K_XL и UD-IQ4_XS) позволяют использование на системах со 128 ГБ оперативной памяти (например, Mac Studio / MacBook Pro на Apple Silicon с Unified Memory или ПК/сервер со 128GB RAM).

При этом показатели работы при запуске через Unsloth / llama.cpp следующие:

  • Необходимый объем памяти: ~85-110 ГБ ОЗУ/Unified Memory для полной загрузки 4-битной квантовки.

  • Скорость генерации: около 20-30 токенов в секунду при инференсе, что является впечатляющим результатом для модели со 180B весов. У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна.

  • Интерактивный режим гибридного мышления (Hybrid Thinking): в Unsloth Desktop из коробки поддерживается переключение режимов reasoning_effort (xhigh, medium, low, none), а также сохранность цепочки рассуждений (Preserve Thinking) между репликами диалога.

Итоги

Модель Qwen3.8-Flash-Next наглядно задает тренд на развертывание локального ИИ на обычных рабочих станциях со 128 ГБ оперативной памяти. Такой подход исключает затраты на дорогостоящие GPU-кластеры и сохраняет высокую скорость инференса до 30 токенов в секунду, а 6 миллиардов активных параметров гарантируют отличный баланс качества и быстродействия для работы локальных агентов.

Важно отметить, что Alibaba на сегодняшний день остается единственной компанией, предоставляющей в открытый доступ веса полного спектра моделей: от компактных решений меньше 1B до флагманов 100B+ параметров.

Линейка Qwen закрывает все актуальные задачи, объединяя классические рассуждающие LLM, мультимодальные и голосовые системы. Это позволяет бизнесу строить автономные on-premise ансамбли на базе инфраструктуры одного вендора с идеально совместимыми компонентами.

Такой подход открывает доступ к уникальным возможностям, включая каскадную маршрутизацию для удешевления инференса, бесшовное построение мультимодальных конвейеров и эффективную дистилляцию корпоративных знаний.

References

  1. Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency, Qwen Blog (2026)

  2. Нейронные сети нетрадиционного ускорения, Habr (2026)

  3. Qwen/Qwen3.8-27B, Hugging Face (2026)

  4. Qwen3.8-Flash-Next: How to Run Locally, Unsloth Docs (2026)