Comments 18
Префил в 19 токенов это печаль. Такое ощущение что видеокарта вообще не работает. Ну и архитектура паскаль без тензорных ядер это печаль. Советую тебе поменять хотя бы на лептопную 3070м/3080м 16 гб франкенштейн. Потребляет в 2 раза меньше. Во всем быстрее. Префил будет раз в 10-20 быстрее. Для работы с агентом это очень важно.
Статья интересная. Подскажите а как там у вас с нагревом и износом ssd?
64 DDR4-3200 и две 5060 Ti на 16 гигабайт. на Q4KM С подгрузкой эмбеддингов с SSD. выдают около 15 токенов в секунду на декоде и 150–250 на префиле.
128 DDR5 4400 И одна 5090. на Q4KM выдает 20–25 токенов декода и 250–380 на прифиле.
Мощность видеокарты не так важна, потому что видеокарта всё равно ждёт, пока остаток посчитается процессором в оперативке. Важен объем, который можно упихать в видеопамять. Поэтому две 3090 будут работать лучше, чем одна 5090.
Сама модель в памяти занимает около 70 гигабайт без учета кеша
С диска в идеале должна читаться только внешняя n-gram таблица. Там очень небольшой объём чтения, и на износ он не влияет никак.
На счет SSD (у меня NVME), вот только посмотрел - температура около 55 градусов, а видеокарта - заметил, чем больше модель LLM, тем меньше греется. Если запустит какую то на 4b, то вентилятор аж гудит и температура > 90, а для этой модели "все чинно и благородно" - 82 - 86.... А на счет износа, даже как то не задумывался (у меня их и так два .... ), ну куплю новый.
интересная статья, спасибо. можете поделиться настройками для 3.8 27b? у меня 3080ti 12g и памяти 32gb.
Модель qwen3.8:27b запускал с помощью Ollama, там есть настройки, но я как то не заморачивался. В основном использовал со своей программой, потому что если работать с ней через OpenCode, то она почти не управляема, да и качество кода неудовлетворительно. В отличии от нее gpt-oss:20b или gpt-oss:120b очень хорошо следуют инструкциям, но при написании или правке сложного кода, допускают много ошибок. Вот поэтому попробовал Qwen3.8-Flash-Next.... Сейчас вот "тарахтит", пытается исправить ошибку .... но очень много думает и очень медленно. Для профессиональной работы конечно рекомендую работу через API с облачными провайдерами LLM.
Понял, спасибо
А Qwen 3.6 35B A3B не пробовали? На rtx 5070 с 12гб выдаёт около 15tps в 2бита от Bartowski и вполне сносно отвечает на удивление для 2 бит кванта.
По Вашему предложению запустил Qwen3.8-35B-A3B-Q4_K_M.gguf, тестирую на своем тестовом задании. При llama-server -m ~/GGUF/Qwen3.8-35B-A3B-Q4_K_M.gguf --host 127.0.0.0 --port 8080 --tools all -c 32768 -b 2048 -ub 1024 -fa auto --jinja , скорость Prompt processing speed - 431.52 tokens/s, Generation speed - 31.80 t/s. Для llama-server -m ~/GGUF/Qwen3.8-Flash-Next-UD-Q4_K_XL-merged.gguf --host 127.0.0.0 --port 8080 --tools all -c 32768 -b 2048 -ub 1024 -fa auto --jinja , скорость Prompt processing speed - 33.09 tokens/s, Generation speed - 9.42 t/s. Что и требовалось доказать: чем меньше размер модели, тем быстрее работает, но посмотрим на качество кода …
Извиняюсь, опечатался: на rtx 5070 с 12гб выдаёт около 140-150 tps у меня.
Вы на какой видеокарте запускали тесты?
На GTX1080Ti 12 Gb
Вы написали: "чем меньше размер модели, тем быстрее работает" думаю это не совсем так либо зависит от поколения видеокарты. На 2060 12GB и 5070 я наблюдал зависимость скорости не от размера, а от количества Активных параметров. То есть Dense модель Qwen 27B у которой все 27 параметров активны работала сильно медленней чем Qwen 35B A3B у которой всего 3B параметров активны. И даже на 2060 12GB я получал 60-70 tps - то есть половину скорости от 5070. Но в случае с GTX1080Ti 11 Gb возможно это работает по другому и размер влияет сильнее. И у GTX1080Ti не 12Gb, а 11Gb видеопамяти, возможно у вас модель не помещается в память и поэтому работает медленнее? Модель должна помещаться в память, тогда будет работать быстрее.
Хм, соблазнительно! А если системный диск – это RAID0 на четырёх NVMe Kingston FURY Renegade G5 (SFYR2S/4T0), качающий по 56 ГБ в секунду? Тогда, похоже, стоит начать сразу с Kimi K3.=)
А парочка таких карт в параллель? не улучшит результат? и не такого монстра конечно на этих бедолагах запускать :)
Это же эксперимент, пойдет или нет такая модель на старом железе… сегодня продвинулся дальше и нацелил свою видеокарту и LLM на ошибку в коде игры, которую мне «влом» править, тем более проект заброшен… и что вы думаете… она справилась с заданием на моем старом железе. Понятно, что такой метод применим если «никто уже никуда не спешит», но он рабочий, проверено.
Спасибо за публикацию, интересный опыт!
Попробуйте добавить флаг --no-op-offload, в моём случае он позволил высвободить ~1.5 ГБ VRAM почти без потери скорости префилла и за счёт освобождённой памяти увеличить число слоёв в VRAM.
Вы также упомянули MTP, но в итоге не воспользовались им. Для Qwen 3.8 Flash Next поддержки MTP в llama.cpp пока нет, но можно собрать и запустить из форка, как предлагают в справке Unsloth.
Спасибо за помощь … но на данный момент, я можно сказать “открыл” для себя модель Qwen3.8-35B-A3B-Q4_K_M.gguf. За счет квантования весов смеси экспертов (MoE), у нее рабочих только 3b из 35b, что позволяет на моей видеокарте при -с 32k получать скорость генерации токенов свыше 30 т/c, а при 120k наблюдается падение до 24 т/с. , при этом по качеству кода покрывает все мои потребности. Попробовал запустить сервер с вашим флагом, у меня наблюдается для этой модели падение скорости чтения промпта где-то в два раза. Как пишут в интернете, “Эффект от флага крайне сильно зависит от конкретной конфигурации” и “Флаг имеет смысл в основном в очень специфичных сценариях (MoE + ручное размещение экспертов на CPU). Для большинства обычных моделей и конфигураций он, скорее всего, не даст выигрыша или даже навредит”, что у меня и произошло.
Как запустить 176B‑класс Qwen3.8-Flash‑Next в DeepSeek Harness на GTX 1080 Ti