
2 сентября Qwen3.8-Max-0902 поднялась на первую строку общего зачёта Code Arena WebDev. На момент исходной новости модель набрала 1691 очко и опережала Claude Opus 5 Max на три пункта.
Проблема скрывается рядом с красивой цифрой: результат Qwen помечен как предварительный, голосов у неё в несколько раз меньше, а доверительные интервалы двух моделей сильно перекрываются. Пока готовился этот материал, количество голосов и отрыв успели измениться.
Разберёмся, что действительно произошло, как Code Arena строит рейтинг и достаточно ли первого места для смены рабочего инструмента. Собственного сравнительного теста я не проводил. Это разбор открытой методики, живой таблицы и документации Alibaba.

1. Первое место меняется на глазах
В исходном сообщении Arena у Qwen3.8-Max-0902 было 1691 очко и 1389 голосов. Claude Opus 5 Max шла следом с 1688 очками и 10 334 голосами. Отсюда появился заголовок про победу с перевесом в три пункта.
Через несколько минут таблица показывала уже такую пятёрку:
Модель | Оценка | Голоса | Диапазон места | Цена за 1 млн токенов, вход / выход |
|---|---|---|---|---|
Qwen3.8-Max-0902 | 1691 ±19 | 1390 | от 1 до 4 | $2 / $6 |
Claude Opus 5 Max | 1687 ±8 | 10 517 | от 1 до 4 | $5 / $25 |
Kimi K3 Max | 1674 ±11 | 4544 | от 1 до 5 | $3 / $15 |
Qwen3.8-Max | 1669 ±12 | 3220 | от 1 до 5 | $2 / $6 |
Claude Opus 5 High | 1661 ±8 | 10 462 | от 3 до 5 | $5 / $25 |
Отрыв вырос до четырёх очков из-за движения результата Claude. Один новый голос у Qwen почти не меняет её положение. Таблица пересчитывается по мере поступления сравнений.
У Alibaba есть ещё один повод считать обновление удачным. Предыдущая Qwen3.8-Max занимает четвёртую строку с 1669 очками. Новый снимок прибавил 22 пункта и вышел на первое место по точечной оценке. Это заметный сдвиг внутри одной линейки. Его точный размер тоже стоит читать вместе с интервалами и разным количеством голосов.
2. Что проверяет Code Arena
Обычный тест по программированию часто даёт модели функцию, набор тестов или задачу из репозитория. Code Arena WebDev устроена иначе. Пользователь описывает веб-приложение, две скрытые модели независимо собирают свои варианты, после чего человек запускает результаты и выбирает лучший.
В текущем агентном режиме модель может планировать работу, создавать и править файлы, выполнять команды и повторять цикл. Площадка сохраняет действия и показывает готовое интерактивное приложение. При голосовании учитываются три группы свойств:
функциональность, то есть выполнение поставленной задачи;
удобство и понятность интерфейса;
соответствие запросу, включая дизайн и поведение.
Результат хорошо отвечает на практический вопрос: чей готовый вариант пользователи чаще предпочитают в задачах веб-разработки. Он смешивает качество кода, работу с инструментами, внешний вид и субъективный вкус голосующих.
Границы у такого измерения довольно чёткие. Первое место не подтверждает качество архитектуры большого проекта, отсутствие уязвимостей, удобство сопровождения через полгода или способность исправлять ошибки в незнакомом репозитории. Для этих выводов нужны другие тесты и проверка кода человеком.
Зато Code Arena ближе к реальному прототипированию, чем набор изолированных алгоритмических задач. Модель должна довести запрос до работающего интерфейса, а пользователь видит результат целиком. Именно в этом сценарии Qwen сейчас выглядит очень сильно.
3. Почему четыре очка пока ничего не решают
Arena рассчитывает оценки с помощью модели Брэдли-Терри. Она берёт результаты попарных сравнений и оценивает относительную силу участников. Проще говоря, рейтинг отражает вероятность того, что один вариант предпочтут другому. Ничья считается как половина победы и половина поражения.
Одна точечная оценка не показывает, насколько устойчив результат. Поэтому Arena публикует доверительный интервал и диапазон возможного места. У Qwen интервал шире из-за молодой выборки:
Qwen3.8-Max-0902: от 1672 до 1710;
Claude Opus 5 Max: от 1679 до 1695.

Официальная страница Qwen3.8-Max-0902
Схема построена по цифрам Code Arena. Цветная точка показывает оценку, линия показывает опубликованный интервал.
Весь интервал Claude лежит внутри интервала Qwen. Разница между центральными оценками равна четырём пунктам, а погрешность у Qwen достигает 19 пунктов в каждую сторону. Поэтому диапазон места у обеих моделей совпадает: от первого до четвёртого.
Колонка места обязана расставить модели по порядку. Сейчас Qwen стоит первой, потому что 1691 больше 1687. Диапазон места передаёт менее броскую часть результата: доступных данных пока недостаточно, чтобы статистически отделить эти модели и ещё нескольких соседей.
Корректная формулировка на 2 сентября звучит так: Qwen3.8-Max-0902 занимает первое место по текущей точечной оценке. Заявление о подтверждённом превосходстве над Claude потребует более узкого интервала и устойчивого разрыва.
4. Что изменилось в Qwen3.8-Max-0902
Alibaba называет qwen3.8-max-0902 снимком основной Qwen3.8-Max. У него есть датированный псевдоним qwen3.8-max-2026-09-02. По заявлению разработчика, дополнительное обучение было сосредоточено на программировании, длинных автономных задачах, работе с несколькими инструментами, офисных сценариях и визуальном понимании.
Практические параметры уже появились в официальной карточке:
окно контекста: 1 млн токенов;
максимальный вход: 991 тыс. токенов, в режиме рассуждения 983 тыс.;
максимальный выход: 131 тыс. токенов;
цена на китайской площадке: 12 юаней за миллион входных и 36 юаней за миллион выходных токенов;
цена в таблице Arena: $2 и $6 соответственно.

Карточка Qwen3.8-Max-0902 на платформе Qianwen. Справа указаны цена, контекст и пределы входа и выхода.
После выхода исходной публикации документация обновилась. Теперь версия 0902 доступна, а минимальный вызов через совместимый с OpenAI интерфейс выглядит так:
import os from openai import OpenAI client = OpenAI( api_key=os.environ["DASHSCOPE_API_KEY"], base_url="https://dashscope.aliyuncs.com/compatible-mode/v1", ) response = client.chat.completions.create( model="qwen3.8-max-0902", messages=[{"role": "user", "content": "Собери страницу отчёта на React"}], extra_body={"enable_thinking": True}, ) print(response.choices[0].message.content)
Этот фрагмент подтверждает доступность модели и формат обращения. Он ничего не говорит о качестве ответа без отдельного запуска и проверки результата.
5. Стоит ли менять модель в рабочем проекте
Qwen3.8-Max-0902 уже заслуживает места в коротком списке для фронтенд-прототипов. Текущий результат Code Arena показывает высокий шанс получить приложение, которое понравится пользователю при прямом сравнении. Цена по таблице Arena тоже выглядит привлекательно: выходные токены Qwen стоят примерно в четыре раза дешевле, чем у Claude Opus 5 Max.
Автоматическая миграция рабочего проекта из этой цифры не следует. У команд разные репозитории, правила, дизайн-системы и требования к качеству. Небольшой внутренний тест даст больше пользы, чем спор о соседних строках рейтинга.
Для такого теста достаточно взять от 10 до 20 настоящих задач и прогнать каждую модель несколько раз с одинаковыми условиями. Затем проверить:
выполнились ли функции и сценарии из запроса;
сколько попыток и ручных исправлений потребовалось;
читается ли код и проходит ли проверку проекта;
сколько заняли генерация, проверка и доработка;
какова полная стоимость законченной задачи.
Разработчикам быстрых прототипов Qwen можно пробовать уже сейчас. Командам с крупной существующей кодовой базой лучше дождаться собственных результатов и более зрелой статистики Arena.
Факт первого места останется фактом текущего снимка. Главный результат шире: Qwen подошла к Claude вплотную в человеческом сравнении готовых веб-приложений и предлагает заметно меньшую цену. Вопрос о победителе решат новые голоса и одинаковые испытания на реальных проектах.

