Qwen и Claude разделяют несколько рейтинговых пунктов при пересекающихся интервалах.
Qwen и Claude разделяют несколько рейтинговых пунктов при пересекающихся интервалах.

2 сентября Qwen3.8-Max-0902 поднялась на первую строку общего зачёта Code Arena WebDev. На момент исходной новости модель набрала 1691 очко и опережала Claude Opus 5 Max на три пункта.

Проблема скрывается рядом с красивой цифрой: результат Qwen помечен как предварительный, голосов у неё в несколько раз меньше, а доверительные интервалы двух моделей сильно перекрываются. Пока готовился этот материал, количество голосов и отрыв успели измениться.

Разберёмся, что действительно произошло, как Code Arena строит рейтинг и достаточно ли первого места для смены рабочего инструмента. Собственного сравнительного теста я не проводил. Это разбор открытой методики, живой таблицы и документации Alibaba.

Общий зачёт Code Arena WebDev 2 сентября 2026 года. Источник: Arena.ai.
Общий зачёт Code Arena WebDev 2 сентября 2026 года. Источник: Arena.ai.

1. Первое место меняется на глазах

В исходном сообщении Arena у Qwen3.8-Max-0902 было 1691 очко и 1389 голосов. Claude Opus 5 Max шла следом с 1688 очками и 10 334 голосами. Отсюда появился заголовок про победу с перевесом в три пункта.

Через несколько минут таблица показывала уже такую пятёрку:

Модель

Оценка

Голоса

Диапазон места

Цена за 1 млн токенов, вход / выход

Qwen3.8-Max-0902

1691 ±19

1390

от 1 до 4

$2 / $6

Claude Opus 5 Max

1687 ±8

10 517

от 1 до 4

$5 / $25

Kimi K3 Max

1674 ±11

4544

от 1 до 5

$3 / $15

Qwen3.8-Max

1669 ±12

3220

от 1 до 5

$2 / $6

Claude Opus 5 High

1661 ±8

10 462

от 3 до 5

$5 / $25

Отрыв вырос до четырёх очков из-за движения результата Claude. Один новый голос у Qwen почти не меняет её положение. Таблица пересчитывается по мере поступления сравнений.

У Alibaba есть ещё один повод считать обновление удачным. Предыдущая Qwen3.8-Max занимает четвёртую строку с 1669 очками. Новый снимок прибавил 22 пункта и вышел на первое место по точечной оценке. Это заметный сдвиг внутри одной линейки. Его точный размер тоже стоит читать вместе с интервалами и разным количеством голосов.

2. Что проверяет Code Arena

Обычный тест по программированию часто даёт модели функцию, набор тестов или задачу из репозитория. Code Arena WebDev устроена иначе. Пользователь описывает веб-приложение, две скрытые модели независимо собирают свои варианты, после чего человек запускает результаты и выбирает лучший.

В текущем агентном режиме модель может планировать работу, создавать и править файлы, выполнять команды и повторять цикл. Площадка сохраняет действия и показывает готовое интерактивное приложение. При голосовании учитываются три группы свойств:

  • функциональность, то есть выполнение поставленной задачи;

  • удобство и понятность интерфейса;

  • соответствие запросу, включая дизайн и поведение.

Результат хорошо отвечает на практический вопрос: чей готовый вариант пользователи чаще предпочитают в задачах веб-разработки. Он смешивает качество кода, работу с инструментами, внешний вид и субъективный вкус голосующих.

Границы у такого измерения довольно чёткие. Первое место не подтверждает качество архитектуры большого проекта, отсутствие уязвимостей, удобство сопровождения через полгода или способность исправлять ошибки в незнакомом репозитории. Для этих выводов нужны другие тесты и проверка кода человеком.

Зато Code Arena ближе к реальному прототипированию, чем набор изолированных алгоритмических задач. Модель должна довести запрос до работающего интерфейса, а пользователь видит результат целиком. Именно в этом сценарии Qwen сейчас выглядит очень сильно.

3. Почему четыре очка пока ничего не решают

Arena рассчитывает оценки с помощью модели Брэдли-Терри. Она берёт результаты попарных сравнений и оценивает относительную силу участников. Проще говоря, рейтинг отражает вероятность того, что один вариант предпочтут другому. Ничья считается как половина победы и половина поражения.

Одна точечная оценка не показывает, насколько устойчив результат. Поэтому Arena публикует доверительный интервал и диапазон возможного места. У Qwen интервал шире из-за молодой выборки:

  • Qwen3.8-Max-0902: от 1672 до 1710;

  • Claude Opus 5 Max: от 1679 до 1695.

    Официальная страница Qwen3.8-Max-0902
    Официальная страница Qwen3.8-Max-0902

Схема построена по цифрам Code Arena. Цветная точка показывает оценку, линия показывает опубликованный интервал.

Весь интервал Claude лежит внутри интервала Qwen. Разница между центральными оценками равна четырём пунктам, а погрешность у Qwen достигает 19 пунктов в каждую сторону. Поэтому диапазон места у обеих моделей совпадает: от первого до четвёртого.

Колонка места обязана расставить модели по порядку. Сейчас Qwen стоит первой, потому что 1691 больше 1687. Диапазон места передаёт менее броскую часть результата: доступных данных пока недостаточно, чтобы статистически отделить эти модели и ещё нескольких соседей.

Корректная формулировка на 2 сентября звучит так: Qwen3.8-Max-0902 занимает первое место по текущей точечной оценке. Заявление о подтверждённом превосходстве над Claude потребует более узкого интервала и устойчивого разрыва.

4. Что изменилось в Qwen3.8-Max-0902

Alibaba называет qwen3.8-max-0902 снимком основной Qwen3.8-Max. У него есть датированный псевдоним qwen3.8-max-2026-09-02. По заявлению разработчика, дополнительное обучение было сосредоточено на программировании, длинных автономных задачах, работе с несколькими инструментами, офисных сценариях и визуальном понимании.

Практические параметры уже появились в официальной карточке:

  • окно контекста: 1 млн токенов;

  • максимальный вход: 991 тыс. токенов, в режиме рассуждения 983 тыс.;

  • максимальный выход: 131 тыс. токенов;

  • цена на китайской площадке: 12 юаней за миллион входных и 36 юаней за миллион выходных токенов;

  • цена в таблице Arena: $2 и $6 соответственно.

    Карточка Qwen3.8-Max-0902 на платформе Qianwen. Справа указаны цена, контекст и пределы входа и выхода.
    Карточка Qwen3.8-Max-0902 на платформе Qianwen. Справа указаны цена, контекст и пределы входа и выхода.

После выхода исходной публикации документация обновилась. Теперь версия 0902 доступна, а минимальный вызов через совместимый с OpenAI интерфейс выглядит так:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max-0902",
    messages=[{"role": "user", "content": "Собери страницу отчёта на React"}],
    extra_body={"enable_thinking": True},
)

print(response.choices[0].message.content)

Этот фрагмент подтверждает доступность модели и формат обращения. Он ничего не говорит о качестве ответа без отдельного запуска и проверки результата.

5. Стоит ли менять модель в рабочем проекте

Qwen3.8-Max-0902 уже заслуживает места в коротком списке для фронтенд-прототипов. Текущий результат Code Arena показывает высокий шанс получить приложение, которое понравится пользователю при прямом сравнении. Цена по таблице Arena тоже выглядит привлекательно: выходные токены Qwen стоят примерно в четыре раза дешевле, чем у Claude Opus 5 Max.

Автоматическая миграция рабочего проекта из этой цифры не следует. У команд разные репозитории, правила, дизайн-системы и требования к качеству. Небольшой внутренний тест даст больше пользы, чем спор о соседних строках рейтинга.

Для такого теста достаточно взять от 10 до 20 настоящих задач и прогнать каждую модель несколько раз с одинаковыми условиями. Затем проверить:

  • выполнились ли функции и сценарии из запроса;

  • сколько попыток и ручных исправлений потребовалось;

  • читается ли код и проходит ли проверку проекта;

  • сколько заняли генерация, проверка и доработка;

  • какова полная стоимость законченной задачи.

Разработчикам быстрых прототипов Qwen можно пробовать уже сейчас. Командам с крупной существующей кодовой базой лучше дождаться собственных результатов и более зрелой статистики Arena.

Факт первого места останется фактом текущего снимка. Главный результат шире: Qwen подошла к Claude вплотную в человеческом сравнении готовых веб-приложений и предлагает заметно меньшую цену. Вопрос о победителе решат новые голоса и одинаковые испытания на реальных проектах.