Qwen3.8-Flash-Next и важность прогона бенча в три раза на конфиг
Новая архитектура Qwen4 против продакшн-27B на трёх прогонах и назойливая ошибка в собственной документации про NVFP4A16. Переходим с 3.8-27B на Next-Flash или нет?
Новая архитектура Qwen4 против продакшн-27B на трёх прогонах и назойливая ошибка в собственной документации про NVFP4A16. Переходим с 3.8-27B на Next-Flash или нет?
В прошлой серии сравнил Qwen3.8-27B на своей карте с DeepSeek V4 Flash по API. Меня спросили: а если DeepSeek поставить на ту же карту, урезав до 2 бит? Ответ: 0.697 против 0.731 у той же модели на полной точности — минус 0.034 балла, реальная цена квантования или шум?
Мы пришли за инференсом?
“RTX PRO 6000 обгонит новый Mac Studio почти во всём, кажется что пропускная способность памяти - единственное, где Apple конкурентоспособна”, но мне кажется для собственного использования - однозначно рассматривать!
Встала задача - срочно за вечер решить практический вопрос: какой квант ставить на карту и нужна ли мне RTX5090 домой (спойлер: нет, 9B и Q5/Q6 и я буду счастлив). Прогнал 18 конфигураций по схеме - три модели, пять-шесть квантов на каждую, один и тот же набор из 22 реальных задач.
Закончил тесты и подготовил результаты этих тестов по самой новой, последней, крутой (и способной влезть на карту, что можно купить домой - RTX5090, за такие деньги конечно покупать - безумно, но в магазинах есть, а значит “можно купить домо”) модели Qwen 3.8-27B!
Если коротко, то Qwen3.8-27B на своей карте заработал 0.789 из 1.0 и это прям круто! Он же через API — 0.785, DeepSeek V4 Flash 0731 через API — 0.731 (а DeepSeek прям ооочень советуют!). Для моего бенча - модель на 304 миллиарда параметров отстала от модели на 28 миллиардов, которая влезает в одну карту.
Два месяца своих сессий с ИИ скормил скрипту и собрал бенчмарк под СВОЮ работу — не под чужой лидерборд.
Результат: тройка «лучших открытых моделей» сжалась в ничью, а в практике победила модель в 37 раз дешевле — потому что отвечает мгновенно, а 744B-гигант думает 22 секунды до первого слова.
Важным оказался не балл, а телеметрия, которую балл прячет.
Поднял за выходные продукт, который давно хотел проверить руками: RAG, который отвечает строго по корпусу и к каждому утверждению ставит ссылку на пункт правил — или честно пишет «В корпусе нет основания для ответа». Модель — Gemma-4, локально, через Ollama. Инференс без внешних вызовов: можно физически отрезать сеть — оно продолжает работать.
У нас есть открытый бенчмарк https://github.com/csylabs-org/lii-sport-bench-ru для оценки русскоязычных LLM на спортивном домене — ЛИИ-Спорт-Bench-RU, 655 экспертных вопросов по 35 видам спорта. В прошлой статье мы выбрали базовую модель: Gemma 4 31B. После этого начался главный вопрос — как сделать её лучше под домен.
Две недели мы пытались обогнать собственную базу. Файнтюном. Потом ещё раз файнтюном на переделанном корпусе. Потом — RAG. Все три раунда базовая версия выиграла.
Это статья про отрицательный результат. Я считаю, он полезнее победы — потому что его можно воспроизвести (и научиться на моих ошибках) и он объясняет, какой инструмент лучше бы подошел под какую задачу. Дальше — цифры, стек и три разбора «почему не взлетело».
Прогнали семь LLM через свой русский спортивный бенчмарк. Топовые модели closed-source выигрывают 1.5-1.7 балла. Базовой моделью всё равно остаётся Gemma 4 31B — рассказываю почему.
В первой статье мы протестировали 30 нейросетей на задачах российских учителей — российские модели оказались последними. На 9 месте стоит наша: дообученная Qwen3.5-27B за 30 000 рублей, работающая локально, на уровне GPT-5.4 на образовательных задачах. Рассказываем, как сделали — включая провал 32B-версии.
Я живу в Чебоксарах и запускаю ИИ-пилот в местной школе. Когда понадобилось проверить, какие LLM действительно способны помочь российским учителям в их работе — оказалось, что бенчмарка для этого не существует. MERA тестирует, может ли модель решить задания ЕГЭ. EduBench — только английский и китайский. Российское образование — это ФГОС, технологические карты уроков, ОГЭ, чувашский язык — и ничего из этого ни один бенчмарк не покрывает.
Мы сделали EduBench-RU — первый бенчмарк для оценки LLM на задачах российского образования в школах. 50 промптов, 22 модели, двойная оценка. И нашли кое-что неожиданное.