В этом месяце Alibaba выпустила две модели, и та, о которой все писали, оказалась не той, что мы ждали. Qwen3.8-Max — это API с 2,4 триллионами параметров, и пару недель назад я с большим энтузиазмом написал о ней обзор. Но релиз, которого я действительно ждал, вышел 14 августа: Qwen3.8-27B, Apache 2.0, веса на Hugging Face, модель достаточно компактна, чтобы работать на ноутбуке.
Я должен кое в чем признаться. Я не провел полный тест этой модели. Я попробовал, на своем MacBook Air M4 получал около восьми токенов в секунду и потерял терпение где-то на втором запросе. По большей части этот пост посвящен именно моей неудаче, потому что я подозреваю, что у многих из вас вечер сложится так же, как у меня.
Что представляет собой Qwen3.8-27B на самом деле
27,78 миллиарда параметров, плотная модель, включающая в себя визуальный энкодер, о котором никто не объявлял заранее. Принимает на вход текст, изображения и видео. Собственный контекст — 262 144 токена, с помощью YaRN можно увеличить его примерно до миллиона, если запускать модель на сервере.
Архитектура — это по-настоящему интересная часть, и это не обычный трансформер. На протяжении 64 слоёв Qwen чередует 48 слоёв Gated DeltaNet (линейное внимание) с 16 полными слоями Gated Attention в соотношении 3:1. Только эти 16 слоёв с полным вниманием имеют KV-кэш. Таким образом, на каждый токен приходится около 64 КБ, что составляет примерно четверть от объёма памяти, необходимого для обычной 64-слойной модели с плотным кодированием.
Если вы запомните только одно число из этого поста, пусть это будет именно оно. Всё, что касается того, поместится ли эта модель на вашем компьютере, зависит от объёма KV-кэша.
Режим «Размышление» включён по умолчанию, а параметр reasoning_effort изначально установлен на максимальное значение. Вы можете уменьшить его до среднего или минимального значения. Вам это понадобится. Об этом чуть позже.
Тесты и почему я не придаю им значения
Собственная таблица Qwen выглядит отлично. Вот данные, представленные в виде таблицы:
Тест | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
SWE-bench Pro | 61.7 | 53.5 |
LiveCodeBench v6 | 90.3 | 83.9 |
GPQA-Diamond | 89.2 | 87.8 |
Terminal-Bench 2.1 | 73.0 | 63.4 |
DeepSWE 1.1 | 42.2 | 13.3 |
OSWorld-Verified | 84.3 | 63.9 |
Скачок с 13,3 до 42,2 в DeepSWE — это не ошибка округления. Превосходство над Qwen3.6-27B по всем параметрам выглядит реальным и наблюдается по всей таблице, а не в виде одного подозрительного скачка.
А теперь о том, что заставило меня переписать черновик. Все эти цифры взяты из данных Qwen. Некоторые тесты были проведены внутри компании, в других были скорректированы исходные данные, а результаты конкурентов были импортированы, а не получены заново. На момент написания этой статьи компания Artificial Analysis не опубликовала индекс интеллекта для модели 27B, и ни одна лаборатория не смогла воспроизвести ее результаты.
Изначально я хотел написать: «Теперь у нас есть искусственный интеллект уровня Opus 4.6, работающий на потребительском оборудовании». Но потом я внимательно изучил таблицу Qwen. Opus 4.6 Max лидирует в тестах Terminal-Bench 2.1 (78,2 против 73,0), GPQA-Diamond (91,3 против 89,2) и уверенно опережает Humanity’s Last Exam (40,0 против 30,8). Модель 27B выигрывает в одних тестах и проигрывает в других, согласно оценочной таблице, составленной разработчиками. «Опережает Opus» — это заголовок, а не констатация факта.
Но то, что это действительно так, по-прежнему поразительно: модель 28B, которую можно скачать бесплатно, не уступает передовому API в тестах по программированию. Вот и вся история. Не стоит преувеличивать.
Впечатления от использования
Я, конечно, поиграл с ней, но без фанатизма. Она очень хороша. Результаты тестов соответствуют общему впечатлению, и это максимум, на что я могу рассчитывать после нескольких минут тестирования.
Саймон Уиллисон, который уже два года тестирует свой SVG-тест «Пеликан» на всех моделях, назвал эту модель лучшим «Пеликаном» из тех, что работают на его ноутбуке. Он также отметил, что на выполнение этой задачи ушло почти 21 минута и было потрачено 22 276 токенов рассуждений, чтобы сгенерировать 3223 выходных токена. На процессоре M5 Max. Вот вам пример модели: мощная и дотошная до изнеможения.
В первую неделю чаще всего жаловались не на качество, а на многословность. При значении xhigh по умолчанию модель начинает блуждать в дебрях. Те, кто запускал ее в циклах агентов, сообщают, что она генерирует 10 000 токенов там, где конкурирующая модель использует всего один. Кроме того, в шаблонах для чатов есть ошибки, в том числе фатальное исключение при передаче enable_thinking=false, поэтому используйте исправленный сообществом шаблон, прежде чем встраивать его во что-то серьезное.
Сможете запустить ее? Аппаратная математика
Вкратце: для 4-битного квантового процессора вам понадобится от 17 до 18 ГБ памяти, плюс кэш-память KV. 24 ГБ унифицированной памяти — это практический минимум, 32 ГБ — оптимальный объем, а 48 ГБ — золотая середина.
Вот таблица Unsloth GGUF, на которую все ориентируются, данные о размерах и вариантах квантования, представленные в виде таблицы:
Квантование | Размер (Size) | Примечания (Notes) |
|---|---|---|
UD-Q3_K_XL | 13.4 GB | emergency option for 16 GB |
Q4_K_M | 17.1 GB | standard 4-bit |
UD-Q4_K_XL | 17.9 GB | the default I’d pick |
Q5_K_M | 19.8 GB | needs 32 GB |
Q8_0 | 29.0 GB | near-full fidelity |
BF16 | 54.7 GB | reference |
Добавьте примерно 0,93 ГБ для проектора изображений, если вам нужен ввод изображений, так как он не входит в комплект языковой модели GGUF. И не устанавливайте на этой модели значение ниже Q4. Многие пользователи жаловались на резкое падение качества, чего они не ожидали от модели с 27 миллиардами нейронов, а агрессивное квантование кэша KV привело к тому, что по крайней мере у одного пользователя полностью вылетела приватная оценка.
Расчёт кэша KV при размере 64 КБ на токен: 8K контекста — это примерно полгигабайта, 32K — 2 ГБ, 128K — 8 ГБ, а полный объём в 262K — 16 ГБ. Начните с 8K и увеличивайте значение, следя за расходом памяти. Контекст YaRN с миллионом токенов — это функция сервера, а статический YaRN в любом случае снижает качество коротких промтов.
Особенности Apple Silicon
Три вещи, которые меня удивили.
Во-первых, для быстрого бэкенда MLX от Ollama требуется более 32 ГБ унифицированной памяти, поэтому Air с 24 ГБ памяти вообще не может его использовать. Вам нужен путь GGUF: LM Studio, если вам нужен доступ в один клик, или llama.cpp, если вам нужен полный контроль.
Во-вторых, это не так важно, как может показаться, потому что правило «MLX быстрее на Apple Silicon» применимо в основном к небольшим моделям. Преимущество MLX становится заметным при размере модели до 14 миллиардов токенов и сходит на нет при размере выше 27 миллиардов, когда производительность начинает зависеть от пропускной способности памяти, а не от времени выполнения. Так что выбирайте GGUF и не беспокойтесь об этом.
В-третьих, температура. В Air нет вентилятора. При длительной работе графический процессор сильно нагревается, и через 8–10 минут при полной нагрузке температура корпуса достигает примерно 60–70 % от пиковой. Во время общения вы этого даже не заметите. А вот во время длительного рефакторинга — вполне.
На этом я и уперся в стену
У моего Mac Mini с чипом M1 16 ГБ памяти. Он не подходит для этой модели, точка. Для 4-битной сборки требуется 17 с лишним гигабайт, и машина просто превращается в бесполезный кусок железа. Я запускаю на нем 4-битный кодер, и все работает нормально.
У M4 Air 24 ГБ памяти, и он загружается. Работает. Но выдает меньше десяти токенов в секунду, когда их уже несколько тысяч, и это кажется приемлемым, пока вы не объедините его с моделью, которая тратит 20 000 токенов на рассуждения, чтобы ответить на ваш вопрос. Я сидел и смотрел, как текст появляется со скоростью чтения, и решил, что у меня есть дела поважнее. Единственный известный мне показатель производительности базового чипа M4 в этой модели — от 5 до 6 токенов в секунду на Mac Mini с 32 ГБ памяти, так что вряд ли мне просто не повезло.
Вот что меня на самом деле раздражает. Два года назад я подумывал о переходе на более мощный процессор, но отговорил себя. Тогда мне казалось, что это хорошая идея: локальные модели были недостаточно хороши, чтобы оправдать затраты, а у Apple уже были новые чипы. И то и другое было правдой. Но я ошибся в последовательности действий. Модели стали лучше раньше, чем подешевело оборудование, и теперь цены на память кусаются, а машина, которая мне нужна, стоит дороже, чем раньше, когда она мне была не нужна.
Если вы сейчас размышляете над этим, то вот вам универсальный совет. Покупайте оперативную память до того, как она вам понадобится. При локальном инференсе полезная модель всегда появляется раньше, чем появляется доступное по цене оборудование, и вы не сможете добавить унифицированную память позже.
Кому на самом деле стоит покупать оборудование для этого
Весь смысл в конфиденциальности, и это весомый аргумент. Модель Apache 2.0, работающая полностью в автономном режиме, — это совсем другой разговор с вашими юристами по вопросам соблюдения нормативных требований, нежели условия использования хостингового API. Если вы врач, юрист, бухгалтер или кто-то ещё, кто работает с материалами, которые по закону не должны покидать пределы организации, то это первый случай, когда локальный вариант оказался настолько хорош, что стал скучным, а не компромиссным. Я довольно много консультирую по вопросам ИИ в Сиднее именно с представителями этих профессий, и за последние полгода ситуация полностью изменилась.
Для этого случая я бы купил оборудование уже сейчас. Mac Studio с максимальными характеристиками, Mac Mini M4 Pro с 48 ГБ памяти (лучшая модель Mac по соотношению цены и качества для этой конкретной модели, к тому же настольный компьютер хорошо отводит тепло), DGX Spark или RTX 5090, если вы предпочитаете видеокарты Nvidia. Показатели RTX 5090 — это совсем другой уровень: более 200 токенов в секунду с использованием NVFP4 и спекулятивным декодированием, в отличие от моих жалких восьми.
Но я бы не стал делать вид, что это заменяет хостинговый API для всего подряд. Этого недостаточно для длинных циклов работы с агентами или пакетной обработки на ноутбуке, а самые сложные 5% задач — это как раз те области, в которых передовые модели всё ещё оправдывают свою стоимость подписки. Оптимальный вариант — гибридный. API — для сложных задач, локальная система — для больших объёмов данных и для всего, что не требует подключения к облаку.
Почему это стало прорывом для Apple
Последние пару лет у Apple были непростые времена в сфере искусственного интеллекта по всем показателям, о которых пишут в СМИ. Но компания владеет тем, что действительно нужно для локального логического вывода, — большим объёмом быстрой унифицированной памяти в компьютере, который уже есть у обычных людей.
Подумайте о том, что будет, если нынешняя тенденция сохранится. Если локальная модель будет обрабатывать 95% того, что вы делаете за день, то во сколько вам обойдётся ежемесячная подписка? Я не думаю, что ответ будет «никакой», потому что именно в этих последних 5% сосредоточена основная ценность, и именно за них вы в любом случае готовы платить. Но это сильно меняет структуру рынка, причем в пользу тех, кто продает 128 ГБ унифицированной памяти.
Вопрос в том, что будет с ценами на память. Либо нынешние темпы наращивания мощностей приведут к перенасыщению рынка, либо спрос со стороны центров обработки данных продолжит превышать предложение, и потребительская оперативная память будет оставаться дорогой еще много лет. Я бы поставил на перенасыщение, в основном потому, что все, кто наращивает мощности прямо сейчас, исходят из того, что другие этого делать не будут. Для тех, кто делает такие ставки, это плохая история, а для всех остальных — хорошая.
На чем я остановился
Qwen3.8-27B - это самый важный открытый релиз года, если у вас есть компьютер, и если у вас его нет. Я отношусь ко второй группе, и это моя собственная вина.
Две вещи изменили бы мое мнение. Во-первых, независимое подтверждение результатов этих бенчмарков, чего пока никто не делал и что мне бы хотелось увидеть, прежде чем выдавать цифры вендора за чистую монету. Во-вторых, вариант квантования или сборка со спекулятивным декодированием, которые обеспечат скорость 20 токенов в секунду на Mac с 24 ГБ памяти. Вот тогда я перестану писать об этой модели и просто начну ею пользоваться.
Если у вас 32 ГБ памяти или больше — смело скачивайте. Установите размер контекста 8K, используйте официальные параметры сэмплирования для режима рассуждений (temperature 1.0, top_p 0.95, top_k 20), снизьте reasoning_effort до medium и напишите, действительно ли она так же хороша, как мне кажется.

