В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему. Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что а задумчивой она не кажется.

Загрузка

Так получилось, что я не использую GGUF файлы от Unsloth. Как-то давно я попробовал их GGUF и качество мне очень не понравилось, не знаю уж как они его готовят, но почему-то качество работы той старой модели было не очень (много галлюцинаций и повторов), поэтому я обычно конвертирую gguf самостоятельно (прошу не ругаться и тапками не кидаться).

Сообщение о том что модель доступна для скачивания пришло минут на 40 раньше чем я ожидал, ну окей, создал новую папку и загрузил веса.

hf download Qwen/Qwen3.8-27B --repo-type model --local-dir ./Qwen3.8-27B_official_sources_from_Qwen

Далее создал gguf файл:

pipenv run python convert_hf_to_gguf.py ~/models1/Qwen3.8-27B/Qwen3.8-27B_official_sources_from_Qwen/   --outfile ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-F16.gguf --outtype f16

Насколько я понимаю данная операция просто переупаковывает тензоры в один файл формата GGUF с точностью F16, GPU на этом этапе не используется и скорость зависит только от CPU и диска. В моем случае это заняло примерно 14 минут.

Я запускаю модель на старенькой 4090, поэтому следующим шагом идет квантование. Использую Q4_K_M, поэтому следующей командой, которую я запустил была:

llama-quantize Qwen3.8-27B-F16.gguf    Qwen3.8-27B-Q4_K_M.gguf    Q4_K_M

тут пришлось еще минут 5 подождать.

Запуск

И вот модель готова к запуску! Я дрожащими руками настраиваю llama.cpp… Шучу конечно! Но мне действительно не терпелось запустить модель, поэтому я тупо скопировал файл настроек для 3.6 поменял обозначение модели на 3.8 и запустил как есть. Собственно вот настройки:

llama-server -m ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-Q4_K_M.gguf \
    -ngl 99 \
    --port 8882 \
    --temp 0.6 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.00 \
    -t 6 \
    -c 180000 \
    --cache-type-k q8_0 \
    --cache-type-v q8_0 \
    --parallel 1 \
    --flash-attn on \
    --presence-penalty 0.52 \
    --repeat-penalty 1.0 \
    --repeat-last-n 206 \
    --reasoning-budget 4096 \
    --reasoning-budget-message "Let's move on to the final answer."
    --cache-ram 32768 

Ну и оно заработало! Без Overthinking, без галлюцинаций, практически идеально! За прошедшие 3 дня я прогнал модель почти по всем сценариям в которых я ее использую и со всеми скиллами, которые я написал за последние месяцы. Во всех случаях модель существенно превосходила 3.6.

Больше всего меня впечатлила работа модели в агентном режиме. У меня есть довольно длинный сценарий из 27 шагов, в ходе которого модель должна скачивать данные из интернета, заполнять таблицу в csv файле, использовать Python и статистические методы для анализа данных и по результатам формировать отчет. Qwen3.6 не справлялась с полным сценарием и обычно останавливалась после 8-12 шагов, пришлось разбить сценарий на фазы и запускать их по-очереди. Qwen3.8 справилась с полным сценарием и за 22 минуты корректно выполнила все 27 шагов с логгированием промежуточных результатов в markdown файл и построением финального отчета.

reasoning-budget

Отдельно нужно сказать про такой параметр как reasoning-budget. В Qwen3.6-27B я добавил этот параметр потому, что модель довольно долго думала. Значение параметра для 3.6 было 2048 с ним модель думала примерно 20-30 секунд до начала ответа, и мысли модели мне не очень нравились, она периодически зацикливалась и ее приходилось останавливать, пришлось даже добавить: --presence-penalty 0.52, --repeat-penalty 1.0, --repeat-last-n 206 (вы можете видеть эти параметры в моих настройках). Однако новая Qwen3.8-27B меня очень приятно удивила. Она начала отвечать сразу! Т.е. 3.6 даже на простой вопрос - сначала думала (да не так долго, но думала), а 3.8 ответила сразу, размышление 1 секунда. Поэтому в данный момент я увеличил лимит рассуждения до 4090 токенов (можно видеть в настройках llama.cpp) и честно сказать подумываю о том, чтобы увеличить его еще в 2 раза, или вообще убрать.

Я не претендую на то, что параметры запуска, которые я привел, единственно правильные, более того, они не совпадают с официально рекомендованными, и получились случайно (как я сказал - я скопировал настройки, которые использовал для 3.6) но для меня они работают очень хорошо. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают, надеюсь они будут кому-нибудь полезны.