Пока одни запускали GPT-5.6 Sol Max, другие ломали копья в холиварах «Kimi K3 vs Claude Opus 5», Alibaba тихо (ага, с ростом акций на 7% в моменте – очень тихо) вкатила модель, которую сама называет «новой планкой для кодинга и совместной работы». Знакомьтесь: Qwen3.8-Max, 2,4 триллиона параметров(всего-то), контекст на миллион токенов и обученная не просто быстро отвечать, а не сдаваться днями.

Привычный рефлекс «очередной китайский флагман – очередные астрономические циферки – очередное “мы почти догнали Anthropic”» отчасти правдив. Но тут три вещи, ради которых стоит потратить пять минут: во-первых, Alibaba внезапно впервые открывает веса модели Max-класса; во-вторых, независимая проверка разошлась с вендорскими цифрами, и это отдельная маленькая драма в твиттере; в-третьих – релиз подсвечивает тренд, который многие стараются не замечать – дело, возможно, не в модели, а в том, что вокруг неё построено.

Ну что, поехали. Разберём по порядку.

Что вообще случилось

3 августа 2026 года команда Qwen выпустила Qwen3.8-Max – самую жирную модель в линейке. Доступна через QwenCloud, Alibaba Cloud Model Studio и приложение QwenWork(новая рабочая ИИ-платформа). Сухие цифры: 2,4 трлн параметров, но из-за архитектуры Mixture-of-Experts на каждый запрос реально включается только около 95 млрд – это и держит скорость с ценой в разумных пределах. Контекстное окно – миллион токенов, по грубой прикидке три-четыре толстых романа разом. Размерами такими, если честно, уже не удивить – ещё в ChatGPT-4o образца мая 2024-го, по слухам, было что-то в том же порядке. Так что реакция «ого, триллионы!» устарела вместе с трендами двухлетней давности. Гораздо интереснее, что модель умеет делать с этими параметрами.

Официальный анонс от @Alibaba_Qwen в X гласил: «Meet Qwen3.8-Max – our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!».

Показатели и сравнения Qwen3.8 Max в 16 бенчмарках
Показатели и сравнения Qwen3.8 Max в 16 бенчмарках
Эволюция масштаба моделей Alibaba Qwen (2024–2026): 33-кратный рост параметров флагманов от Qwen2.5-72B до Qwen3.8 (2400B)
Эволюция масштаба моделей Alibaba Qwen (2024–2026): 33-кратный рост параметров флагманов от Qwen2.5-72B до Qwen3.8 (2400B)

Alibaba недавно выкатила ещё и Qwen-Image-3.0 (можно потестить здесь) – генератор изображений с фокусом на реальность, умеющий рендерить текст размером до 10 пикселей.

Пять кейсов автономной работы

Alibaba могла бы просто выкатить табличку бенчмарков и всё. Но вместо этого показала пять демонстраций автономной работы – каждая со своей маленькой историей. Цифры вендорские, но сами сценарии показывают, куда движется индустрия.

16 дней без единого коммита от человека. Модели дали пустую папку и задачу: построить самообновляющийся CLI-инструмент oh-my-cli. Она сама превращала запросы в GitHub Issues, брала их в работу, писала код, гоняла тесты и мёрджила пул-реквесты. К 30 июля счётчик показывал 265 коммитов, 127 PR’ов и 151 закрытую задачу. Проект открыт на GitHub.

Qwen3.8-Max в течение 10+ дней автономно строит самообновляющийся харнесс (источник)

Воспроизвела научную статью и улучшила её. Модели дали статью «Unified data selection for LLM reasoning» без единой строчки кода. За пять суток (около 125 часов) написала ~7600 строк и прогнала 33 раунда GPU-обучения. Сначала воспроизвела все шесть ключевых результатов, потом запустила цикл самоулучшения и обошла оригинал на +2,7 балла на AIME24.

Раунд

Лучшая идея раунда

AIME24

Прирост

Метод статьи (база)

49,58%

1

Разделить данные по сложности

50,42%

+0,84

2

Взвесить по разрыву энтропии

51,67%

+2,09

4

Считать «сложные точки решения»

52,29%

+2,71

Обошла 458 из 526 живых команд за сутки. Модель заявили в реальное соревнование WWW2025 Multimodal Dialogue Intent Recognition Challenge. За 24 часа через 45 итераций точность выросла с 0,60 до 0,853, обойдя 87% участников.

Чип, который похудел на 92%. Модели поручили спроектировать криптографический аппаратный ускоритель. За ~500 итераций дизайн ужался с 8298 логических вентилей до 678. Физическая площадь кристалла сократилась на 81%.

Год виртуальной торговли и 152 спрятанных мошенника. E-Commerce Bench симулирует год онлайн-торговли: 12 типов магазинов, ~600 поставщиков, 7000 товаров, из которых 152 – замаскированные мошенники. Модель закончила год с балансом 416 252 юаня – 4,16x к стартовому капиталу, на 38% больше второго места.

Симуляция E-Commerce Bench (источник)

Автономная разработка ETF-ротационной стратегии – с параллельным запуском ~330 суб-агентов и ~6000 бэктестов (источник)

Раньше нейросеть измеряли качеством одного ответа, теперь тем, сколько дней она способна не потерять нить задачи.

Харнесс важнее модели

Есть показательный пример: на сложнейшем бенчмарке ARC-AGI топовые модели показывали единичные проценты – GPT-5.6 Sol брал 7% при цене прогона $21 тыс. А потом сторонняя команда поместила ту же модель в улучшенный харнесс – и результат подскочил до 95% и 99% с нулевым дообучением.

И это подводит к неудобному вопросу: официальные харнессы лабораторий часто проигрывают сторонним. GLM-5.2 в стороннем харнессе Pi обходит Opus 4.8 в родном для Anthropic Claude Code. Причина прозаична: лабораториям выгодно, чтобы вы потребляли больше токенов.

Alibaba здесь играет от обратного: заявляет совместимость с Claude Code, Codex, Qoder CLI, Qwen Code и OpenClaw и говорит что производительность примерно одинакова во всех них.

Модель показывает сходную производительность в разных агентских харнессах, не заточена под собственную среду (источник)
Модель показывает сходную производительность в разных агентских харнессах, не заточена под собственную среду (источник)

Бенчмарки

Бенчмарк

Opus4.8

Fable5

GPT5.6 Sol

Qwen3.7-Max

Qwen3.8-Max

Terminal Bench 2.1

84,6

84,6

88,8

74,5

86,6

SWE-bench Pro

69,2

80,0

64,6

60,6

67,7

FrontierSWE

70,0

88,8

40,7

73,5

PaperBench

80,3

88,8

90,5

64,8

93,0

IFBench

62,2

63,5

72,7

79,1

82,8

OSWorld-Verified

83,4

85,0

83,2

73,3

86,1

Модель не выигрывает всё подряд, но берёт лидерство там, куда и целилась – воспроизведение научной работы, следование инструкциям, работа с компьютером как агент. В терминале и сложном софтверном инжиниринге впереди по-прежнему Fable 5 (модель доступна здесь) и GPT-5.6 Sol.

Официальные результаты бенчмарков по категориям (источник)
Официальные результаты бенчмарков по категориям (источник)
Кривая RL-обучения Qwen3.8-Max
Кривая роста качества по мере увеличения тренировочных RL-сред (пик – около 4000 сред) (источник)

Если посмотреть на публичные арены, где вслепую сравнивают живые люди, картина скромнее: пятое место в текстовой арене, второе – в визуальной, четвёртое – во фронтенд-коде. Топ, но не первое место по всем фронтам – уже похоже на реальность.

Qwen3.8-Max ranks fourth in Frontend Code Arena

Позиции модели на публичных аренах. (источник)

Твиттер спорит

Независимая аналитика Artificial Analysis прогнала модель через свой Intelligence Index – и результат расходится с розовой картиной.

Их твит: Alibaba’s Qwen3.8 Max scores 56 on the Artificial Analysis Intelligence Index at $1.14 per task, but open weights leader Kimi K3 remains 1 point ahead at 25% lower cost per task ($0.86)

56 баллов – на 10 пунктов выше предшественника (46), но на балл меньше Kimi K3 (57), причём Kimi дешевле на четверть. Модель заметно подорожала в использовании – входные токены на GDPval-AA выросли почти в 15 раз. Частота галлюцинаций подскочила с 23% до 40%.

Бенчмарк Artificial Analysis Intelligence Index
Бенчмарк Artificial AnСкачок с 15-го на 5-е место по Intelligence Index за счёт роста индекса с 46 до 56 баллов (источник: твит Artificial Analysis)

Команда Qwen не стала спорить, а прокомментировала прямо в X:

То есть в первые часы после релиза API был перегружен и оценки просели.

Изначально Artificial Analysis намерили ещё более скромные 53 балла. Прям как старт продаж новой видеокарты.

Подытоживая: Qwen3.8 Max слегка уступает Kimi K3 на Intelligence Index.

Вот вам и подтекст релиза: вышла Qwen – но не та, которая безоговорочно всех обошла. Вошла в высшую лигу, но застряла на второй строчке среди китайских флагманов.

Облака, коты и шахматы

Официальные бенчмарки – одно, а тесты энтузиастов часто рассказывают больше о характере модели. Четырём моделям показали фото облаков и попросили найти в них животное, нарисовать и анимировать процесс на HTML)

Ладно, теперь серьёзно. Четыре модели строили 3D-кубик Рубика и решали его, затем строили шахматную доску и играли против Claude Opus 5 живьём, ход за ходом, без движка.

Модель

Время постройки

Токенов всего

Итоговая цена

GPT-5.6 Sol

16м 43с

6 713 754

$6,32

DeepSeek V4 Flash

97м 39с

27 417 442

$0,56

Kimi K3

166м 09с

22 427 504

$16,67

Qwen 3.8 Max

215м 08с

17 272 507

$10,27

gpt-5.6 sol и deepseek v4 flash решили кубик (24 и 32 хода соответственно), qwen и kimi сдались.

В шахматах Opus 5 всех обыграл; qwen продержался дольше всех – 58 ходов, затратил 215 минут, 17 млн токенов и обошёлся в $10 долларов 27 центов, став вторым по дороговизне.

Открытые веса

Alibaba объявила, что впервые в истории откроет веса модели Max-класса — Qwen3.8-2.4T и Qwen3.8-27B выйдут с открытыми весами 12 августа.

Сама 2.4T-модель всё равно останется кластерной – в bf16 веса займут около 4,8 ТБ, нужен кластер из 16–20 H100.

Но настоящая звезда для домашних пользователей – компактная Qwen3.8-27B. Её можно будет запустить на одной RTX 5090 с 32 ГБ или на Apple Silicon с 32–64 ГБ. Реакция сообщества локальщиков: пользователи писали что их RTX 5090 «этого дожидалась».

Вспоминается, кстати, как PrismML упаковал Qwen3.6-27B до 1,125 бита на вес и запустил прямо на iPhone 17 Pro Max – без облака. А тут ещё и из коробки – красота же.

Цена вопроса

Qwen3.8-Max стоит $2 за миллион входных токенов и $6 за выходные. Это меньше трети цены Claude Opus 5 и меньше четверти GPT-5.6 Sol Max.

Модель

Вход ($/1M)

Выход ($/1M)

Всего ($/1+1M)

DeepSeek-v4-flash

$0,14

$0,28

$0,42

GPT-5.6 Luna

$0,20

$1,20

$1,40

Qwen3.7-Plus

$0,40

$1,60

$2,00

GLM-5.2

$1,40

$4,40

$5,80

Qwen3.8-Max

$2,00

$6,00

$8,00

Qwen3.7-Max

$2,50

$7,50

$10,00

Kimi K3

$3,00

$15,00

$18,00

Claude Opus 5

$5,00

$25,00

$30,00

Claude Fable 5 / Mythos 5

$10,00

$50,00

$60,00

Как попробовать из России

  • Заходите на chat.qwen.ai, регистрируетесь по почте, выбираете Qwen3.8-Max из списка моделей сверху – и уже можно тестировать. Платный доступ через API потребует зарубежную карту.

  • Также Qwen3.8 можно запустить в GPTunneL.

Подытоживая

Общая картина при этом складывается ясная: китайские лаборатории находятся в фазе прямого наращивания объёмов – буквально за неделю до Qwen3.8-Max Moonshot AI выкатил Kimi K3 на 2,8 трлн параметров с открытыми весами.

Qwen3.8-Max – не безусловный победитель гонки. Немного уступает Kimi K3 по независимой оценке, стоит дороже предшественника и проигрывает Fable 5 и GPT-5.6 Sol в отдельных категориях.

Но у неё три козыря: открытые веса Max-класса впервые в истории компании, компактная 27B-версия для дома, и честная демонстрация того что современный ИИ – это уже не про «дать умный ответ», а про способность держать план в голове неделями.

И, кажется, именно последнее будет определять победителей следующего раунда гонки куда сильнее, чем очередной триллион параметров в названии.

Если уже успели пощупать Qwen3.8-Max на своих задачах – делитесь впечатлениями, особенно интересно, насколько честно она держит контекст на реальных многодневных проектах. Ну а я пойду проверю, съедает ли она прод за ночь.