
14 августа 2026 года, 15:00 UTC.
CEO Anthropic Дарио Амодей срочно созвал заседание. Экс-глава Apple Тим Кук пожалел, что встроил в айфоны облачную Gemini, так и не дождавшись локальной модели нужного уровня. Где-то в датацентрах Alibaba щёлкнул рубильник, на Hugging Face слетел обратный отсчёт, и в мир вышла Qwen3.8-27B — новая dense-модель на 27 миллиардов параметров, которую даже прозвали «локальным Opus’ом», поскольку она позиционируется как одно из самых мощных открытых решений для локальной генерации. Ждали её всем миром: обратный отсчёт на huggingface, первые пиксельные пеликаны на великах — всё как положено.
Если вкратце, это открытая (Apache 2.0) мультимодальная модель, которая понимает текст, картинки и видео, влезает в одну ооочень мощную домашнюю видеокарту, а временами по бенчмаркам обгоняет закрытые облачные модели уровня Claude Opus 4.6. Если не вкратце — читайте дальше, потому что там есть и триумф, и зависания на 49 минут раздумий!
Кто это вообще такой
Стоит сразу заметить, чтобы не путаться: что это не 8-миллиардная модель (как было в случае Qwen3-8B), и не гигантский Qwen3.8-Max на 2,4 триллиона параметров, который вышел днём раньше под отдельной лицензией. У 27B-модели ровно 27,78 млрд параметров, она плотная, то есть dense (это значит, не MoE — при инференсе работают все веса разом, а не «выбранные эксперты»), и весит около 55,6 ГБ в BF16 (веса кодированы в виде дробных чисел точностью 16 битов на число).
Архитектурно перед нами гибрид: 64 слоя, из которых только 16 — это классический full attention, а остальные 48 — линейные Gated DeltaNet слои. Схема выглядит так: 16 раз повторяется блок «3 слоя DeltaNet → FFN, затем 1 слой полного внимания → FFN», где на 48 голов приходится линейное внимание с V и 16 QK-головами, а полноценное внимание использует 24 головы Q и 4 KV-головы с размерностью 256. Звучит как абракадабра, практический смысл простой: у модели гигантский контекст в 262144 токена из коробки (и растягивается YaRN’ом до миллиона), а KV-кэш при этом не взрывается, потому что честный attention нужен только на каждом четвёртом слое.
Кстати: архитектурно Qwen3.8-27B полностью идентична предыдущей локальной модели подобного уровня – Qwen3.6-27B, а значит весь прирост способностей пришёл исключительно из улучшений обучения.
Бенчмарки

Сразу скажем, что включение Opus4.6 Max в качестве точки сравнения в официальной табличке восприняли как дерзкий жест.
В день релиза сама Alibaba не стеснялась праздновать открыто — вплоть до отдельного благодарственного поста, когда модель вышла в топ трендов на Hugging Face:

И действительно, таблица заставляет присвистнуть. Вот основные текстовые бенчмарки:
Бенчмарк | Qwen3.8-27B | Qwen3.6-27B | Opus4.6 Max |
|---|---|---|---|
Terminal-Bench 2.1 | 73.0 | 63.4 | 78.2 |
SWE-bench Pro | 61.7 | 53.5 | 53.4 |
DeepSWE 1.1 | 42.2 | 13.3 | — |
QwenSWEBench | 79.0 | 49.3 | 63.8 |
LiveCodeBench v6 | 90.3 | 83.9 | 88.8 |
GPQA Diamond | 89.2 | 87.8 | 91.3 |
HLE (Humanity’s Last Exam) | 30.8 | 24.0 | 40.0 |
А по мультимодальным и агентным задачам разрыв с предшественником вообще выглядит неприлично большим: OSWorld-Verified (компьютерное управление) вырос с 63.9 до 84.3, WebArena — с 48.8 до 64.8, SWE-MM — с 25.7 до 38.6. Модель затачивали не просто на болтовню в чате, а на работу агентом — с браузером, терминалом и интерфейсами.
Прирост над предыдущим поколением показывает вот такой график с разбивкой по категориям:

Аналитики Kingy.ai отметили несколько важных нюансов: во-первых, все цифры — это цифры от самой Qwen, и публичность задач не делает прогон вендора независимым. Во-вторых, сравнение по SWE-bench Pro не совсем честное: компания не гоняла модель Opus заново под тем же харнессом, а просто взяла её официально опубликованный результат, тогда как остальных участников таблицы прогнали через доработанный набор задач с исправленными багами (то есть в данной таблице квеновский SWE-bench Pro = число по собственноручно запущенным тестам, опусовский SWE-bench Pro = число взято из уже имевшихся из антропиковских бенчмарков). Ну и в-третьих: несколько бенчмарков (QwenSWEBench, CoWorkBench, RecreationBench) — это внутренние разработки Alibaba, для которых пока нет внешней проверяемости уровня зрелых публичных бенчмарков.
Собственно, именно эта горсть недоверия и стала темой нескольких жарковатых веток на форумах.
Пользователи отмечали также, что по умолчанию режим размышлений установлен на xhigh прямо в чат-шаблоне, из-за чего модель думает очень долго, что для обычного пользователя стало неожиданным по сравнению с версией 3.6 — и именно это накручивает метрики интеллекта, но не отражается в метриках вроде расхода токенов или времени вычислений. Тут, впрочем, надо признать: reasoning-эффорт действительно влияет на итоговый счёт, но и сами по себе улучшения Qwen3.6 остаются реальными и воспроизводимыми в разных источниках.
А вот ещё один независимый прогон — на Hugging Face прогнали модель против Nemotron 3.5 Lightning и Muse Glimmer* (* организация Meta является запрещённой в РФ) на 16 сложных задачах (математика, код, логика) на одной RTX 5090:


Итог получился неоднозначным, Qwen3.8-27B финишировал быстрее всех с большим отрывом и оказался единственной из трёх моделей, ни разу не упёршейся в потолок генерации в 32768 токенов — тогда как два других участника застревали суммарно трижды, и поднятие лимита до 60000 токенов не спасло ни один из этих прогонов. При этом сама модель ошиблась дважды — оба раза в математике, причём один раз даже сослалась на несуществующую последовательность в OEIS (Онлайн-энциклопедия целочисленных последовательностей) в подтверждение неверного ответа.
Overthinking: главная драма релиза
Если у Qwen3.8-27B и есть главная особенность — это патологическая склонность модели «пережёвывать» даже тривиальные запросы.
Простой промпт может спровоцировать пять тысяч токенов размышлений — при том, что все версии Qwen3.x были склонны к долгому обдумыванию с самокопанием, но эта модель, похоже, установила рекорд. И это ещё цветочки. Иногда модель (как это, впрочем, уже бывало с Qwen нередко) уходит в практически бесконечные размышления – после 49 минут ответа можно уже не ждать.
Даже на простое эссе о картошке, объемом 250 слов, модель может буквально вручную пересчитывать слова в черновике, ставят номер с каждым и проходясь по всем абзацам, лишь бы строго попасть в лимит.
Но кое-кто таки проанализировал тензоры GGUF-весов и вывел якобы структурный дефект в слоях temporal processing, подкрепив это наукообразной таблицей. Однако позже выяснилось, что заявленные «пятьдесят оттенков экспертизы» — это, по сути, наукообразная мистификация…
Проблема overthinking-а вполне реальна, просто причина куда прозаичнее любых «сломанных тензоров». Всё дело в том, что, как уже упоминалось, по умолчанию у модели включён режим мышления на уровне xhigh, предназначенный для сложных задач, а понизить его до medium или low можно только явным указанием — и далеко не все инструменты вроде LM Studio вообще выставляют для этого переключатель в интерфейсе. А вот у облачных моделях вроде Claude Sonnet 5 подобных проблем с бесконечным самокопанием практически не встречается.
Ещё пример: агенто о четырёх инструментах, которому задали простейший фактический вопрос про поддержку MTP, использовал около пятидесяти вызовов инструментов и потратила порядка 85 000 токенов контекста из 256 000 доступных, хотя для ответа было бы достаточно первых пяти вызовов.
Единственный предлагаемый рабочий рецепт — снижать reasoning_effort руками, хотя по факту даже на low модель порой продолжает зависать в цикле раздумий.
Галлюцинации
Они есть. Например, модель не может написать текстовую строку наоборот. В этом тревожном кейсе модель не сумела развернуть .DefaultCellStyle, галлюцинируя буквально с самого начала рассуждений. Qwen3.6-27B, кстати, тоже был хорош: на схожем тесте успех составил лишь около 33% случаев. При решении этой же «задачи» модель может вдруг ни с того ни с сего менять исходную строку на середине рассуждения — то на .DataGridViewCellStyle, то на .DataCellEditor, то есть попросту придумывает себе новый текст задания и с упоением решает уже его.

В целом пользователи крайне негативно удивлены поведением — у неё экстремальное количество галлюцинаций, некоторые всерьёз рассматривают откат на Qwen3.6-27B. Проблема проявляется даже на коротком контексте.
Также модель игнорирует пожелания пользователя и забывает инструкции, а при попытке исправить одну ошибку тут же порождает несколько новых, вдобавок забывая изначальный промпт.
Увы, локальная модель на 27 миллиардов параметров физически не дотягивает до уровня Claude или GPT с их триллионами параметров, обученных на несопоставимо больших объёмах данных. И это ощущается очень зримо, особенно на фактологии за пределами кода.
И всё-таки — пеликан на велосипеде
Нельзя обойтись без классического бенчмарка — нарисовать SVG-пеликана на велосипеде, руководствуясь исключительно редактированием PSD через блокнот текстовым кодингом графики.

Эта картинка сгенерирована с использованием IQ4_NL-квантованной модели от Unsloth, с одного захода без доработок. Получилось весьма достойно — заметно лучше, чем у большинства локальных моделей поколения полугодовой давности. Утверждают, что это один из лучших пеликанов, которого видели от локально запущенной модели: форма велосипеда правильная, клюв пеликана отличный, нормальный фон, по одной лапе с каждой (важно!) стороны велосипеда, что встречается очень редко. Ушло 21 минута и 22276 токенов размышлений на 3223 токена итогового результата.
Похоже, модель специально дообучалась на генерации SVG, причём не обязательно именно на промпте про пеликана, а скорее в рамках более общего этапа RL, где генерация SVG оценивалась более сильной vision-моделью-судьёй.
27B против облачных гигантов
Вот так выглядит Three.js-сцена затонувшей Атлантиды с храмом, колоннами, рыбами, водорослями, лучами света и 20-секундным пролётом камеры по единому промпту без правок – в Qwen3.8-27B и Claude Opus 4.6:
Результат Qwen, наверное, менее детальный, но сопоставимый.
Ещё немного воды – на этот раз от Grok 4.6. Рендеринг воды явно не сильная сторона Grok 4.6:
Оба в максимальном режиме размышлений. Как тебе такое, Илон Маск? Локальная модель оказалась убедительнее. Страшно представить, что будет с 35B-моделью.

Официального подтверждения от Alibaba на момент написания статьи так и не последовало – по-прежнему лишь 27B и 2.4T версии.
Термокамера, ватты и что нужно, чтобы это запустить
Официальные веса доступны в BF16 (~55,6 ГБ) и блочном FP8 (~30,9 ГБ), но большинство домашних пользователей воспользуется GGUF-квантами от Unsloth или аналогичных команд.
Вот таблица по реальным размерам файлов и тому, что для них нужно:
Квант | Размер | Практический дом |
|---|---|---|
UD-IQ2_XXS | 9,0 ГБ | 12 ГБ карты, заметная потеря качества |
UD-Q3_K_XL | 13,4 ГБ | 16 ГБ карты |
IQ4_XS | 15,7 ГБ | 16 ГБ, последний, что влезает целиком |
Q4_K_M | 17,1 ГБ | 24 ГБ карты — золотая середина |
Q6_K | 22,9 ГБ | 24 ГБ впритык, либо 32 ГБ |
Q8_0 | 29,0 ГБ | 32 ГБ или разбивка на две карты |
BF16 | 53,8 ГБ | серверные карты или CPU с терпением |
Именно математика по KV-кешу решает, влезет ли нужный контекст. Поскольку honest attention работает только на 16 слоях из 64, каждый токен контекста стоит всего 64 КБ (а не 256 КБ, как у обычной dense-модели такого же размера). При 32K контекста это 2 ГБ, при 128K — уже 8 ГБ, а на полные 262K — 16,4 ГБ поверх весов. Именно гибридная архитектура и делает реалистичным окно в четверть миллиона токенов на одной домашней карте.
Уже в день релиза свою поддержку модели выкатила AMD — для владельцев Ryzen AI Max и видеокарт Radeon, зафиксировав до 24,5 токена в секунду на Ryzen AI Max+ 395 и до 51,8 токена в секунду на одиночной Radeon AI PRO R9700. (Для тех, кто хочет максимум производительности, мощный Qwen3.8 Max уже развёрнут в облачной версии.)

Быстрый гайд по запуску через llama.cpp:
llama-server -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \ --host 0.0.0.0 --port 8080 \ --fit off --gpu-layers all --gpu-layers-draft all \ --ctx-size 48000 \ --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \ --spec-type draft-mtp
Судя по отзывам, на RTX 5090 (32 ГБ VRAM), кванте UD-Q6_K_XL, контекст влезает только на 48000 токенов при скорости генерации 100 т/с, а на кванте UD-Q5_K_XL расширяется до 125000 токенов при скорости 120 т/с. На картах послабее — на RTX 4090 порядка 65 т/с при контексте в 260000 токенов.
Команда SGLang в день релиза отчиталась о результатах на потребительском железе:
206,1 т/с на одиночной RTX 5090 – NVFP4-версия, с включённой технологией оптимизации DSpark;
а также 38,28 токена в секунду – с включённой DGX Spark.
С одной стороны — реально измеримый прогресс над предыдущим поколением почти по всем метрикам, впечатляющая работа с компьютером и браузером, способность влезать на одну видеокарту с контекстом в сотни тысяч токенов. С другой — реальные проблемы с пережёвыванием простых задач по умолчанию, жалобы на галлюцинации по сравнению с предшественником, здоровая доля вендорского приукрашивания в официальных бенчмарках.
Qwen3.8-27B можно назвать одной из самых значимых локальных моделей года. Просто не забудьте выставить reasoning_effort на нужный уровень, если не хотите ждать сорок девять минут ответа на вопрос про автомойку.

