Комментарии 34
Супер! Рекомендую попробовать модель https://huggingface.co/unsloth/Qwen3.6-35B-A3B-MTP-GGUF - именно в mtp режиме, должно быть более юзабельно (как в смысле скорости, так и качества, next - это всё-таки прошлое поколение, по моему опыту, она сильно уступает 3.6).
И было бы интересно какая скорость будет на vLLM, всё-таки он чуть более оптимизирован, чем llama.cpp, хотя обычно результаты сравнимы (у меня на процентов ~5% быстрее на моей 4-gpu конфигурации, но если идут несколько запросов в параллель - то позволяет выжать x2 в суммарной скорости генерации).
https://github.com/hogeheer499-commits/strix-halo-guide
У меня Qwen3.6-35B Q4_K_M более 70 tok/s на Ollama/Vulkan
на винде, Карл!, с mmproj! в LM Studio Qwen3.8-Flash-Next-Q4_K_M пока без MTP отстукивает 10-15 t/s на rocm, жду когда MTP подвезут, там до 50 t/s обещают.
Qwen3.5 122B A10B в Q6 проверками занимается.
рука-лицо, вы что там употребляете?
А контекст пробовали на 15000 хотя бы загрузить? Я просто подключаю это к плагину на vscode, пишу ему сделать это и то, тз такое с указанием всей логики, используемых библиотек, в какой папке конфиги, а в какой шаблоны и он пошёл там шуршать, сам папки создает, файлы, заполняет, инициализирует venv... И вполне терпимо по скорости.
65К, 9t/s на середине (25К-30К) держит. И это на LM Studio на windows, которая от видеопамяти отгрызает своё. UMA=32Gb для windows самое то. Самое главное - не бояться смотреть на task manager, у которого на этом аппарате 99% утилизации по графикам, надо смотреть на commited memory. И да, я с лаптя по API подключаюсь, жалею strix. Самое главное, уберите троттлинг на процессоре так, чтобы температура в инференсе была 60-70 максимум, не жгите камни, они рядом на чипе и греют друг дружку, если криво настроили
Я даже на десктопе отказался от Windows, т.к. с 11й ну очень любит бустить мой процессор по пустякам, то там атималвари сервис активируется, то какие то обновления в фоне качает и устанавливает. На данный момент под нагрузкой вижу потребление около 60 ватт (только видяха нагружена) и температура выше 55 не поднимается. Я кстати на своем аппарате менял термопасту, начитался отзывов что там она вся просохла, на памяти термопрокладки, их не трогал.
винда она такая, я откатил KB5129195, так как он убил инференс, причем сегодня всё норм, а завтра большая модель стала выдавать //////, все кандидаты перепробовал, убил несколько часов, потом откатился и всё заработало. Теперь вот поставил жесткий стоп на автоапдейт. Винда доживает последние месяцы на strix halo, в планах перебраться на линукс, но нужны длинные выходные. Кстати, у Вас в обзоре есть RTX. У меня тоже такой ПК рядом, с двумя RTX, опять же с виндой, я оба ПК по 5Gb/s кабелю недавно соединил и по llama rpc учусь раскладывать веса моделей. Мне вон жпт картинки рисовал для понимания. На второй что да как, а на первой что я получал, меняя moe
Скрытый текст

Скрытый текст

И да, советую все старые йцут модели выкинуть и за ежедневную взять Qwen3.8-27B-Q8_0.gguf с глазами mmproj-Qwen3.8-27B-BF16.gguf, она в нормальном кванте, новая и гоняйте её с ctx 256K если нужен большой контекст. С MTP и правильной настройкой дает 15-20t/s. За глаза.
Не согласен. Лучше Qwen3.8-Flash-Next, коль есть видеопамять. Жор в Q4_K_M будет около 110-112Gb.
А производительность около 30t/s. И качество выше 27B.
Но это если это отдельный комп под LLM, конечно :D
не согласен с Вашим несогласен. Плотненькая, быстрая, за джуна-трудягу заходит. Нарежет и соберет, только роли успевай менять. А вот потом на поклон к флешу, но да, флешу сразу всю стрикс халу подавай.
Неделю плотно погонял Qwen3.8-Flash-Next на двух rtx3090 (взял форк vllm от сюда https://github.com/DominikBucko/qwen38-flash-next-2x3090#run-it ). На моей системе она работает очень быстро - 60-90 токен/сек генерация, 1200-2400 токен/сек промпт процессинг. Почти как модель qwen3.8-27b-q8_k_xl в lamma.cpp (50-80 токен/сек генерация и 1600-1200 токен/сек PP). Но в итоге на постоянку вернулся в Qwen3.8-28b. Qwen3.8-Flash-Next чувствуется что чуть умнее чем Qwen3.8-28b, лучше держит контекст на больших задачах. Но! Qwen3.8-28b гораздо стабильнее и предсказуемые. Ответы более структурированные и четкие. У Qwen3.8-Flash-Next иногда в тексте проскакивают артефакты, в ответе на русском попадаются (редко правда) иероглифы. То есть она более умная, с более широким кругозором, но какая то менее аккуратная и структурированная в размышлениях и ответах (настройки температуры и прочего одинаковые). С qwen3.8-27b я обнаружил, что на решение задач трачу чуть меньше времени и итераций.
Не сочтёте за труд поделиться знанием? Дает около 11-13 в самом начале. При большом контексте 4-6 т/с. Ubuntu 26.04, ROCm 7.14.0.
Скрытый текст
[*]
# Global defaults — applied to every model unless overridden
load-mode = none
metrics = false
# Keep model processes and prompt/context cache alive
sleep-idle-seconds = -1
# В МБ
cache-ram = 4096
# GPU (возможно, применяется только к AMD, но вряд ли)
n-gpu-layers = all
flash-attn = on
# Performance
batch-size = 2048 # сколько токенов обрабатывается за один шаг
ubatch-size = 2048 # размер микробатча (на сколько кусков разбивается batch)
parallel = 1
# Chat template
jinja = true
# Отключает выгрузку KV cache в ОЗУ. В моем случае это
# одно и то же, поэтому настройка точно не нужна.
kv-offload = disabled
# Квантизация KV-кэша с 16 бит до 8 бит. При контексте 262k это сокращает
# потребление VRAM вдвое при минимальной потере качества.
cache-type-k = q8_0
cache-type-v = q8_0
[Qwen3.8 ggml]
model = /srv/models/Qwen3.8-27B-GGUF_ggml-org/Qwen3.8-27B-Q8_0.gguf
mmproj = /srv/models/Qwen3.8-27B-GGUF_ggml-org/mmproj-Qwen3.8-27B-BF16.gguf
spec-draft-model = /srv/models/Qwen3.8-27B-GGUF_ggml-org/mtp-Qwen3.8-27B-Q8_0.gguf
spec-type = draft-mtp
spec-draft-n-max = 3
ctx-size = 262144
top-p = 0.95
top-k = 40
min-p = 0.05
temp = 1.0
repeat-penalty = 1.0
presence-penalty = 0.2
load-on-startup = false
reasoning = onЯ пытался запустить 3.8 27B, может не ту сборку скачал - выкачивал на lm studio а потом подкладывал в llama, MTP тоже подкладывал, при заполнении контекста на 15000 токенов она выдает 7 т/сек, но тут уже люди покидали ссылки на разные модели и инструкции по их запуску, следующие выходные буду снова ставить опыты. И спасибо за совет, попробую.
я скачал именно compute+graphic, т.к. еще и фильмы буду на нем смотреть...
На чём фильмы смотреть? На ROCm?)
Надо было выбрать чисто Compute + метод установки apt. Тебе незачем проприетарный драйвер, для любых фильмов там производительности оверкилл, а когда загрузишь LLM-кой, любой фильм не на CPU будет лагать, ибо GPU загружена в упор.
Зато обновлять потом будет куда проще, чем установленный из скрипта.
Зачем rocm? Он в половине случаев медленнее vulkan-а, еще и работает через одно место.
Вот TL;DR для страждущих, чтобы не возиться часами. Для голодных до Flash-Next есть "быстрое" решение с закрытым кодом.
Меня наверное обманули поисковики, сказав что mtp модели на вулкане нестабильные. По моим тестам rocm в 1.5-2 раза быстрее prefill делает на квен кодер, но он вероятно старый, не умеет с этим работать. В общем, оба варианта сосуществуют идеально.
На рдна2, например, рокм в разы быстрее работает.
Очень даже может быть. А CUDA ещё быстрее. Но статья про 395+
Ну вопрос то обсуждаем "Зачем rocm?". То что мой опыт не про 395+ это да, тут я зря не уточнил, но судя по тому что я видел - префилл на многих gfx сильно быстрее на рокм, поэтому если тут другой случай - сорян, но амд-бояре по любому будут тут проходить и им стоит об этом знать и по крайней мере не откидывать рокм сразу а тестить.
Спасибо за обзор!
А вообще что бы вы посоветовали вот сейчас - такую коробочку или видеркарту на 16 гигов для начала и с расчетом на то что через N лет появятся какие-то лучшие решения?
В чем смысл этого девайса? Если имея 128 ГБ памяти вы запускаете на нем древние модели (Qwen3-coder-next), которые хуже чем современные, но более умные и занимающие в разы меньше памяти. Например, Qwen3.6-35b-A3B или Qwen3.8-27b.
Гораздо интререснее был тест Qwen3.8-flash-next. Если Qwen3.8-flash-next не будет нормально работать, то тогда ниша этого девайса - запуск Qwen3.6-35b-A3B и для этого достаточно 64 ГБ памяти максимум.
Вон Qwen3.8-Flash-Next-Q4_K_M на этом девайсе, а автор жалеет машинку ))
А Qwen3.6-35b-A3B Q4_K_M и на голом CPU с 32Гб RAM без GPU запустится )) Неспеша, под чай с бутерами, но отработает
Скрытый текст

С вопросом вы попали точно в цель. Пока вы можете взять колхоз из списанных карт типа в100 или 170нх, смысла в ней нет - колхоз будет работать быстрее и стабильнее (хотя, конечно, громче и горячее). Из актуального, что будет дешевле колхоза - на карте можно относительно быстро запустить последний квен некст.
"Гражданские" квены можно гонять, но они будут раза в 2 быстрее работать на нормальной карте, пусть и с меньшим контекстом. Если у вас есть контейнеры, которые можно переложить на тихую компактную машину, то получается "лишняя" память остается как раз под них.
Я взял коробочку как инвестицию в память, которая в ближайшие годы судя по всему не собирается дешеветь, но если бы я на момент покупки (декабрь) знал о вариантах типа в100, сборка вышла бы гораздо лучше. По факту она сейчас стоит без дела: модели на ней крутятся несравнимо медленнее облачных, и значительно тупее. Причем если я вдруг придумываю задачу для условного квена3.8, то я ее всяко лучше запущу на своей 4090, нежели на коробке с 20-30 т\с в пике. Если у вас есть задачи, которые можно оставлять гоняться на ночь, может быть это когда-то окупится.
Для Ryzen AI Halo есть что-то аналогичное, как для 2x rtx3090: https://github.com/DominikBucko/qwen38-flash-next-2x3090 ?







Локальный инференс на Ryzen AI Halo