Обновить

Комментарии 26

reasoning-budget на самое лучшее решение, это как мешком по голове, чтоб все мысли убрать. У 3.8 можно гораздо гибче размышления настраивать с помощью reasoning-effort.

Попробуй такой параметр для llama-server:

--chat-template-kwargs '{"reasoning_effort": "low"}'

Можно задавать low, medium, high, и кажется xhigh

xhigh ставится по умолчанию, если не ставить другой параметр. От этого и идут жалобы что модель якобы очень много думает

кажется возникло недопонимание по поводу reasoning-budget
Изначально я добавил эту настройку для 3.6, потому, что 3.6 периодически зацикливалась на: "...I will provide the best answer, I will provide ..." и так по-кругу.
Т.е. reasoning-budget для 3.6 использовался как ограничитель, чтобы модель остановилась, если ушла в цикл. Нужно отметить, что reasoning-budget не обрывает рассуждение на середине, а довольно мягко способствует тому, чтобы модель в него уложилась.
3.8 в этом плане гораздо лучше, за последние 4 дня она ни разу не уходила в подобный цикл. Поэтому я увеличил reasoning-budget и планирую его еще увеличить. Т.е. меня полностью устраивает как она рассуждает и я готов дать ей еще немного пространства для рассуждения (не ограничить, а добавить), рассуждения выглядят обоснованными и вполне логичными, и не затягиваются надолго, если задача сложная модель может потратить больше токенов, но для простых задач тратит совсем немного (значительно меньше чем тратила 3.6), т.е. выглядит так, что 3.8 эффективние использует бюджет.
(вообще конечно нужно поиграть с настройками, но вроде как все и так работает, а времени пока нет)

Почему использован --temp 0.6, если разработчиками модели рекомендуется 1.0?

так получилось. Я редко использую модель для написания красивых текстов, на письма и что-то короткое 0.6 - нормально, а излишнее творчество мне ни к чему, пусть лучше на один и тот-же вопрос она отвечает более-менее одинаково.

Как я понял температура 1.0 в qwen3.6 не тоже самое что температура 1.0 в qwen3.8. Поэтому для одних и тех же сценариев для qwen3.6 разработчики рекомендуют 0.6, а для qwen3.8 - 1.0

а если не секрет, на каком железе это запускается?

В тексте написано, что на RTX4090. Все остальные параметры железа глубоко вторичны.

на виртуалке с Arch и проброшенной внутрь RTX4090

а можно вопрос? для чего именно виртуалка с арчем? я только что повторил то же самое сразу на вин11

просто я как-то давно вместо винды установил Arch, у него rolling release, вот он так и катится от обновления к обновлению. Виртуалка удобна для экспериментов, потому, что если что-то сломается не нужно все переустанавливать, ну а Arch на виртуалке - потому, что удобно иметь одну систему везде.

На windows система достаточно значительное количество VRAM резервирует, даже если подключить монитор к igpu процессора. На cachy os, используя beellama и сжатие kv кеша kvarn6 у меня получилось запустить модель в 5q без mtp на 24 ГБ vram

спасибо очень полезная информация

пользуюсь unsloth там кстати внутри и mtp есть сразу, я вот так включаю

--spec-type draft-mtp --spec-draft-n-max 2

и ещё рекомендую всем турбоквант, у меня эта модель в q4_k_m влазит полностью в gpu 24gb с 128к контекста и место ещё остаётся

А сколько токенов в секунду? У меня на 7900хтх максимум 14 почему то

у меня на 3090 40-60ток/с с mtp и 25-30 без mtp

Не покажете конфиг запуска? :)

У меня 14 с мтп

llama-server.exe -m “C:\models\Qwen3.8-27B-Q4_K_M\Qwen3.8-27B-Q4_K_M.gguf” --ctx-size 128000 -ngl all --load-mode none -fa on --jinja --temp 0.6 --repeat-penalty 1.1 --top-k 20 --top-p 0.95 --min-p 0.0 --port 8080 --no-context-shift -ctk tbqp3 -ctv tbq3 --spec-type draft-mtp --spec-draft-n-max 2

–flash-attn on -ngl 99 --chat-template-kwargs ‘{“reasoning_effort”:“low”}’ --parallel 1 --cache-type-k q8_0 --cache-type-v q8_0

у меня видеокарта через окулинк воткнута, и вот с таким подходом 50-75 токенов сделал

unsloth у меня как-то не зашел, а на счет mtp - хорошая идея, попробую. Спасибо!

вашим способом gguf даже меньше чем у unsloth

и при этом mtp так же в нём уже есть и работает

пример скорости с mtp

Спасибо! У вас кстати скорость получилась больше чем у меня (у меня примерно 45-50 токенов в секунду)

я думаю это из-за виртуалки с пробросом gpu, я раньше в wsl запускал и у меня скорость вроде как меньше была чем в вин11, хотя у меня сейчас должна быть скорость меньше чем у вас (особенно учитывая что у меня только 3090), т.к. турбоквантование контекста сжимает потребление памяти контекстом в 4.74x и уменьшает скорость в 0.87x при этом качество в сравнении с контекстом f16 даже выше на 8%

поправьте, у вас вместо gguf -> guff

--outfile ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-F16.guff

Поправил. Спасибо!

залил сорсы своего форка llama.cpp (only cuda), суть такая: это последняя версия llama.cpp но с поддержкой турбоквантования контекста, не уверен насчёт сборки для линукс но может и выйдет что то, тестировал у себя только для вин 11 под rtx 3090
для контекста в режиме турбокванта рекомендую -ctk tbqp3 -ctv tbq3
а для mtp --spec-type draft-mtp --spec-draft-n-max 2

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации