
Пока одни запускали GPT-5.6 Sol Max, другие ломали копья в холиварах «Kimi K3 vs Claude Opus 5», Alibaba тихо (ага, с ростом акций на 7% в моменте – очень тихо) вкатила модель, которую сама называет «новой планкой для кодинга и совместной работы». Знакомьтесь: Qwen3.8-Max, 2,4 триллиона параметров(всего-то), контекст на миллион токенов и обученная не просто быстро отвечать, а не сдаваться днями.
Привычный рефлекс «очередной китайский флагман – очередные астрономические циферки – очередное “мы почти догнали Anthropic”» отчасти правдив. Но тут три вещи, ради которых стоит потратить пять минут: во-первых, Alibaba внезапно впервые открывает веса модели Max-класса; во-вторых, независимая проверка разошлась с вендорскими цифрами, и это отдельная маленькая драма в твиттере; в-третьих – релиз подсвечивает тренд, который многие стараются не замечать – дело, возможно, не в модели, а в том, что вокруг неё построено.
Ну что, поехали. Разберём по порядку.
Что вообще случилось
3 августа 2026 года команда Qwen выпустила Qwen3.8-Max – самую жирную модель в линейке. Доступна через QwenCloud, Alibaba Cloud Model Studio и приложение QwenWork(новая рабочая ИИ-платформа). Сухие цифры: 2,4 трлн параметров, но из-за архитектуры Mixture-of-Experts на каждый запрос реально включается только около 95 млрд – это и держит скорость с ценой в разумных пределах. Контекстное окно – миллион токенов, по грубой прикидке три-четыре толстых романа разом. Размерами такими, если честно, уже не удивить – ещё в ChatGPT-4o образца мая 2024-го, по слухам, было что-то в том же порядке. Так что реакция «ого, триллионы!» устарела вместе с трендами двухлетней давности. Гораздо интереснее, что модель умеет делать с этими параметрами.
Официальный анонс от @Alibaba_Qwen в X гласил: «Meet Qwen3.8-Max – our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!».


Alibaba недавно выкатила ещё и Qwen-Image-3.0 (можно потестить здесь) – генератор изображений с фокусом на реальность, умеющий рендерить текст размером до 10 пикселей.
Пять кейсов автономной работы
Alibaba могла бы просто выкатить табличку бенчмарков и всё. Но вместо этого показала пять демонстраций автономной работы – каждая со своей маленькой историей. Цифры вендорские, но сами сценарии показывают, куда движется индустрия.
16 дней без единого коммита от человека. Модели дали пустую папку и задачу: построить самообновляющийся CLI-инструмент oh-my-cli. Она сама превращала запросы в GitHub Issues, брала их в работу, писала код, гоняла тесты и мёрджила пул-реквесты. К 30 июля счётчик показывал 265 коммитов, 127 PR’ов и 151 закрытую задачу. Проект открыт на GitHub.
Qwen3.8-Max в течение 10+ дней автономно строит самообновляющийся харнесс (источник)
Воспроизвела научную статью и улучшила её. Модели дали статью «Unified data selection for LLM reasoning» без единой строчки кода. За пять суток (около 125 часов) написала ~7600 строк и прогнала 33 раунда GPU-обучения. Сначала воспроизвела все шесть ключевых результатов, потом запустила цикл самоулучшения и обошла оригинал на +2,7 балла на AIME24.
Раунд | Лучшая идея раунда | AIME24 | Прирост |
|---|---|---|---|
– | Метод статьи (база) | 49,58% | – |
1 | Разделить данные по сложности | 50,42% | +0,84 |
2 | Взвесить по разрыву энтропии | 51,67% | +2,09 |
4 | Считать «сложные точки решения» ★ | 52,29% | +2,71 |
Обошла 458 из 526 живых команд за сутки. Модель заявили в реальное соревнование WWW2025 Multimodal Dialogue Intent Recognition Challenge. За 24 часа через 45 итераций точность выросла с 0,60 до 0,853, обойдя 87% участников.
Чип, который похудел на 92%. Модели поручили спроектировать криптографический аппаратный ускоритель. За ~500 итераций дизайн ужался с 8298 логических вентилей до 678. Физическая площадь кристалла сократилась на 81%.
Год виртуальной торговли и 152 спрятанных мошенника. E-Commerce Bench симулирует год онлайн-торговли: 12 типов магазинов, ~600 поставщиков, 7000 товаров, из которых 152 – замаскированные мошенники. Модель закончила год с балансом 416 252 юаня – 4,16x к стартовому капиталу, на 38% больше второго места.
Симуляция E-Commerce Bench (источник)
Автономная разработка ETF-ротационной стратегии – с параллельным запуском ~330 суб-агентов и ~6000 бэктестов (источник)
Раньше нейросеть измеряли качеством одного ответа, теперь тем, сколько дней она способна не потерять нить задачи.
Харнесс важнее модели
Есть показательный пример: на сложнейшем бенчмарке ARC-AGI топовые модели показывали единичные проценты – GPT-5.6 Sol брал 7% при цене прогона $21 тыс. А потом сторонняя команда поместила ту же модель в улучшенный харнесс – и результат подскочил до 95% и 99% с нулевым дообучением.
И это подводит к неудобному вопросу: официальные харнессы лабораторий часто проигрывают сторонним. GLM-5.2 в стороннем харнессе Pi обходит Opus 4.8 в родном для Anthropic Claude Code. Причина прозаична: лабораториям выгодно, чтобы вы потребляли больше токенов.
Alibaba здесь играет от обратного: заявляет совместимость с Claude Code, Codex, Qoder CLI, Qwen Code и OpenClaw и говорит что производительность примерно одинакова во всех них.

Бенчмарки
Бенчмарк | Opus4.8 | Fable5 | GPT5.6 Sol | Qwen3.7-Max | Qwen3.8-Max |
|---|---|---|---|---|---|
Terminal Bench 2.1 | 84,6 | 84,6 | 88,8 | 74,5 | 86,6 |
SWE-bench Pro | 69,2 | 80,0 | 64,6 | 60,6 | 67,7 |
FrontierSWE | 70,0 | 88,8 | – | 40,7 | 73,5 |
PaperBench | 80,3 | 88,8 | 90,5 | 64,8 | 93,0 |
IFBench | 62,2 | 63,5 | 72,7 | 79,1 | 82,8 |
OSWorld-Verified | 83,4 | 85,0 | 83,2 | 73,3 | 86,1 |
Модель не выигрывает всё подряд, но берёт лидерство там, куда и целилась – воспроизведение научной работы, следование инструкциям, работа с компьютером как агент. В терминале и сложном софтверном инжиниринге впереди по-прежнему Fable 5 (модель доступна здесь) и GPT-5.6 Sol.


Если посмотреть на публичные арены, где вслепую сравнивают живые люди, картина скромнее: пятое место в текстовой арене, второе – в визуальной, четвёртое – во фронтенд-коде. Топ, но не первое место по всем фронтам – уже похоже на реальность.



Позиции модели на публичных аренах. (источник)
Твиттер спорит
Независимая аналитика Artificial Analysis прогнала модель через свой Intelligence Index – и результат расходится с розовой картиной.
Их твит: Alibaba’s Qwen3.8 Max scores 56 on the Artificial Analysis Intelligence Index at $1.14 per task, but open weights leader Kimi K3 remains 1 point ahead at 25% lower cost per task ($0.86)
56 баллов – на 10 пунктов выше предшественника (46), но на балл меньше Kimi K3 (57), причём Kimi дешевле на четверть. Модель заметно подорожала в использовании – входные токены на GDPval-AA выросли почти в 15 раз. Частота галлюцинаций подскочила с 23% до 40%.

Команда Qwen не стала спорить, а прокомментировала прямо в X:
То есть в первые часы после релиза API был перегружен и оценки просели.
Изначально Artificial Analysis намерили ещё более скромные 53 балла. Прям как старт продаж новой видеокарты.
Подытоживая: Qwen3.8 Max слегка уступает Kimi K3 на Intelligence Index.
Вот вам и подтекст релиза: вышла Qwen – но не та, которая безоговорочно всех обошла. Вошла в высшую лигу, но застряла на второй строчке среди китайских флагманов.
Облака, коты и шахматы
Официальные бенчмарки – одно, а тесты энтузиастов часто рассказывают больше о характере модели. Четырём моделям показали фото облаков и попросили найти в них животное, нарисовать и анимировать процесс на HTML)
Ладно, теперь серьёзно. Четыре модели строили 3D-кубик Рубика и решали его, затем строили шахматную доску и играли против Claude Opus 5 живьём, ход за ходом, без движка.
Модель | Время постройки | Токенов всего | Итоговая цена |
|---|---|---|---|
GPT-5.6 Sol | 16м 43с | 6 713 754 | $6,32 |
DeepSeek V4 Flash | 97м 39с | 27 417 442 | $0,56 |
Kimi K3 | 166м 09с | 22 427 504 | $16,67 |
Qwen 3.8 Max | 215м 08с | 17 272 507 | $10,27 |
gpt-5.6 sol и deepseek v4 flash решили кубик (24 и 32 хода соответственно), qwen и kimi сдались.
В шахматах Opus 5 всех обыграл; qwen продержался дольше всех – 58 ходов, затратил 215 минут, 17 млн токенов и обошёлся в $10 долларов 27 центов, став вторым по дороговизне.
Открытые веса
Alibaba объявила, что впервые в истории откроет веса модели Max-класса — Qwen3.8-2.4T и Qwen3.8-27B выйдут с открытыми весами 12 августа.
Сама 2.4T-модель всё равно останется кластерной – в bf16 веса займут около 4,8 ТБ, нужен кластер из 16–20 H100.

Но настоящая звезда для домашних пользователей – компактная Qwen3.8-27B. Её можно будет запустить на одной RTX 5090 с 32 ГБ или на Apple Silicon с 32–64 ГБ. Реакция сообщества локальщиков: пользователи писали что их RTX 5090 «этого дожидалась».
Вспоминается, кстати, как PrismML упаковал Qwen3.6-27B до 1,125 бита на вес и запустил прямо на iPhone 17 Pro Max – без облака. А тут ещё и из коробки – красота же.

Цена вопроса
Qwen3.8-Max стоит $2 за миллион входных токенов и $6 за выходные. Это меньше трети цены Claude Opus 5 и меньше четверти GPT-5.6 Sol Max.
Модель | Вход ($/1M) | Выход ($/1M) | Всего ($/1+1M) |
|---|---|---|---|
DeepSeek-v4-flash | $0,14 | $0,28 | $0,42 |
GPT-5.6 Luna | $0,20 | $1,20 | $1,40 |
Qwen3.7-Plus | $0,40 | $1,60 | $2,00 |
GLM-5.2 | $1,40 | $4,40 | $5,80 |
Qwen3.8-Max | $2,00 | $6,00 | $8,00 |
Qwen3.7-Max | $2,50 | $7,50 | $10,00 |
Kimi K3 | $3,00 | $15,00 | $18,00 |
Claude Opus 5 | $5,00 | $25,00 | $30,00 |
Claude Fable 5 / Mythos 5 | $10,00 | $50,00 | $60,00 |
Как попробовать из России
Заходите на chat.qwen.ai, регистрируетесь по почте, выбираете Qwen3.8-Max из списка моделей сверху – и уже можно тестировать. Платный доступ через API потребует зарубежную карту.
Также Qwen3.8 можно запустить в GPTunneL.
Подытоживая
Общая картина при этом складывается ясная: китайские лаборатории находятся в фазе прямого наращивания объёмов – буквально за неделю до Qwen3.8-Max Moonshot AI выкатил Kimi K3 на 2,8 трлн параметров с открытыми весами.
Qwen3.8-Max – не безусловный победитель гонки. Немного уступает Kimi K3 по независимой оценке, стоит дороже предшественника и проигрывает Fable 5 и GPT-5.6 Sol в отдельных категориях.
Но у неё три козыря: открытые веса Max-класса впервые в истории компании, компактная 27B-версия для дома, и честная демонстрация того что современный ИИ – это уже не про «дать умный ответ», а про способность держать план в голове неделями.
И, кажется, именно последнее будет определять победителей следующего раунда гонки куда сильнее, чем очередной триллион параметров в названии.
Если уже успели пощупать Qwen3.8-Max на своих задачах – делитесь впечатлениями, особенно интересно, насколько честно она держит контекст на реальных многодневных проектах. Ну а я пойду проверю, съедает ли она прод за ночь.

