Обновить

Битва поколений: сравниваем Qwen3.5 и Qwen3.6 в локальном инференсе. Новое не всегда лучше

Уровень сложностиСредний
Время на прочтение42 мин
Охват и читатели6.6K
Всего голосов 10: ↑10 и ↓0+13
Комментарии13

Комментарии 13

ЗакрепленныеЗакреплённые комментарии

Спасибо, но итог какой-то размытый... вы его будто не подвели.

А набора проверка которыми пользовались у вас нет? Чтобы повторить локально

Да, итог размытый. Потому что однозначный не получился. Выбор модели зависит от того, что вам нужно. Но для локального инференса у нас я пока решил оставаться на 3.5.

Что касается набора, то большая часть собрана из публично доступных. GPQA закрыт условиями доступа на Hugging Face и просит не публиковать вопросы в открытом виде. Поэтому его нужно скачивать самостоятельно. Остальное можно опубликовать. Но получится несколько репо. Нужно ли?

Все-таки, почему не берете в работу 3.8? Она же лучше по бенчмаркам.

Её нет в размерности 35B-A3B. А так, мы ей тоже пользуемся, тоже в кванте Int4. Вопрос цены. Многие задачи решаются с тем же качеством и быстрее более слабыми моделями. К тому же это исследование может быть полезно тем, кто просто не может запустить 3.8 из-за ограничений, все же памяти там нужно намного больше для запуска. 3.6 я использую на своем настольном компьютере ежедневно, а вот 3.8 уже не выйдет.

Очень круто, системно, грамотно. Когда прочитал про то что сделали свой файнтюн (?) сразу подумалось, а на hf выложите чтобы и мне потестить?

Потом когда прочитал про выдающиеся результаты захотелось еще больше. В конце подумалось что может вы бы могли докрутить свой Humo для улучшения в тех задачах где он не дотянул и тогда могли бы сделать для себя новую модель в прод. Ну и да, получается в проде все еще крутится 3.5? Или все же на основе этих тестов хотите на другой пересесть?

Спасибо. Нет, Хумо - не файнтюн, т.е. дообучения не было. Обычная квантизация базавой Ornith-1.5 в GPTQ Int4 со своим калибровочным набором и шаблоном. Самое долгое в этом - сам процесс квантизации. Выложить, конечно, можно. Займет какое-то время на заливку. Тем более я сделал модель не только в safetensors, а еще линейку квантов в GGUF, начиная с IQ3_M до Q5_K_XL, с тем же калибровочным набором. Никогда не публиковал ничего на HF. Разберусь с этим и, вероятно, опубликую модель.

Да, в проде все еще 3.5. 3.8 тоже есть, но я так же хочу сделать собственный квант этой модели. Потом проведу аналогичное сравнение, чтобы определиться с тем, что оставлять на проде. Может быть заменит 3.5, если не будет слишком “дорогой” по токенам.

в случае алгоритмов квантизаций на основе калибровочного шаблона, это буквально форма файнтюна, значимо влияющая на качество результата (правильно сказать ухудшающая).

p.s. конечно вкладывайте

Все же традиционно файнтюном считают дообучение модели на своих данных.

Насколько портит — меряется, и дёшево: KL-дивергенция к базовой модели на своём тексте, llama-perplexity с --kl-divergence. Для gpt-oss я откалибровал пороги так: до 0,003 разницы не видно, до 0,01 дёшево, но терпимо.

Только текст берите свой. На чужом корпусе перплексия gpt-oss показывала мне ерунду, а на её родном формате всё встало на место. И KV-кэш туда же: q4_0 обошёлся в +10,7% перплексии, а не в 1,5%, как я сам раньше писал.

Спасибо за разбор, если с точки зрения программирования в целом и агентного кодинга, то на данный момент вы бы отдали предпочтение HumoCoder ? При условии что русский язык не важен.

Второй немаловажный аспект, хотелось бы понять как модели считывают файлы, в т.ч. картинки, документы, в идеале небольшие видео, чтобы можно было агенту скормить прямо скриншоты/видео с багами

По поводу Humo-Coder - для задач, связанных с программированием, скорее всего да. Все же модель заметно выигрывает на этом поле у всех протестированных. Но тесты - одно, а как она покажет себя в реальной работе - другое. Будем проверять в реальной работе у себя.

Мультимодальность у моделей семейства Qwen3.5/3.6 есть, но в этом исследовании мы это не проверяли. Зрительный кодировщик у всех квантов, которые мы смотрели, оставлен несжатым - его веса такие же, как у базовой модели. Но изображение после кодировщика всё равно обрабатывает языковая часть, а она сжата в четыре бита, так что качество работы с картинками может отличаться - этого мы не измеряли.

Самому стало интересно и я проверил Humo-Coder, т.к. это все же дообученная модель. У Humo-Coder зрение есть: та же архитектура, что у Qwen3.5: vision_config, 333 тензора зрительной части, препроцессоры для картинок и видео. Наше квантование его не трогало: в рецепте зрительная часть исключена.

Но оно не совпадает со зрением базовой Qwen3.5. Я сравнил с инкумбентом: это официальный квант Qwen3.5, зрение у него не сжато, и оно служит образцом базовых весов. Все 333 тензора различаются. Различие не тотальное, а похоже на след дообучения. Веса явно из той же линии, но сдвинуты, и чем глубже слой, тем сильнее. Так выглядит дообучение. Значит, авторы Ornith при своём обучении меняли и зрительный кодировщик. Либо они стартовали не с той контрольной точки Qwen3.5, что лежит в основе официального кванта - по весам этого не различить.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации