Комментарии 90
“У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна”
Так какая видеокарта-то? ЭТО ЖЕ ОСНОВНОЕ. На чистой памяти оно могло выдать у тебя ~1 токен/сек…
Без карты тоже должно работать, все зависит от того прочитал ли пользователь какие параметры выставлять, от его проца, а также от скорости и поколения DDR памяти:
M1 Ultra 128G выдает примерно 20 t/s,
AMD EPYC 7763 + 128GB DDR4 RAM выдает примерно 45 t/s
Intel i9 12900k128 GB DDR4 3600 MT/s + RTX 3090 примерно 65 t/s
Это данные от пользователей. Моя система не показатель тк там все патчено-перепатчено под различные штуки.
Intel i9 12900k128 GB DDR4 3600 MT/s + RTX 3090 примерно 65 t/s
Вот это красота. То есть на моем Ryzen 5950 можно добавить +64 Гб до 128 и получить настолько нормальную скорость?
Неизвестно что они там запускали.
Ryzen 9950x3d 128 Gb DDR5-6000 + RTX 4070 ti super 16 Gb
llama-cli --model Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 200000 --load-mode mlock -t 16
[ Prompt: 39.8 t/s | Generation: 20.9 t/s ]
llama-cli --model Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 200000 --load-mode mlock -t 16 -ngl 0
[ Prompt: 34.3 t/s | Generation: 7.4 t/s ]Примерно с такой же скоростью работает генерация для DeepSeek-V4-Flash-UD-Q3_K_XL у которой активных параметров в 2 раза больше. Но менее стабильно, потому что немного не влазит в 128 Gb.
Добавил в конец статьи апдейт со ссылкой на страницу где пользователи делятся результатами на своих сборках и часто публикуют настройки. Возможно, это поможет вам настроить свой запуск на большую скорость.
Нет там чудо параметров. Вы не ту циферку взяли.
19 t/s decoding
65 t/s prompt processing
Примерно тоже самое. Слабая память и не самый мощный проц компенсируется большим объемом GPU RAM. На одном i9 хорошо если будет 5 t/s.
Скорость упрется в пропускную способность твоей ddr4. Трансформеры это memory bound задача, тут частота памяти решает гораздо больше объема
Старый сервер с 96 Гб DDR4 ОЗУ и 2 зеонами E5-2683 v4 (32 ядра суммарно) без видеокарты с MTP выдает до 10 токенов в секунду, без MTP 7t/s, что очень неплохо для столь древнего железа.
Для инференса важно не количество ядер, а пропускная способность памяти. В данном случае с вероятностью 99% там 4-х канал на частоте 2133мгц. Сейчас если собирать систему под большие модели, и есть хоть какой нибудь бюджет, топ это сокет 4677, там в одном процессоре 6-ти канал на частоте 2933мгц, что грубо говоря даёт прирост вдвое.
Интереснее скорость префилла. Ждать по полчаса загрузки 100к контекста - это неюзабельно.
Звучит интересно, я так понимаю, что на ПК подобному 192Gb DRAM (DDR5-5200) + 16GbVRAM - возможно одно из оптимальных решений.
Да, вы правильно понимаете, в конце статьи добавил ссылку на страницу где можно сравнить свою сборку с теми кто уже запускает модель на своем железе.
Получаю 22-24 t/s на i7-265 +DDR5-5200 (192G) + 5070Ti(16G VRAM)
llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 262144 --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080
Хороший результат! Все что 20 t/s и выше вполне юзабельно в каждодневном использовании.
Для сравнения, у меня 30-35 t/s на том же 262К контексте, версии модели и настройках. Железо: Threadripper 3970X + DDR4-3200 (128GB quad-channel mode) + RTX A6000 48GB.
Эта же модель на 96GB DDR4-3500 + 5070 Ti + 5060 Ti выдает 17-19 t/s tg и 360-370 t/s pp на задаче с ~10к контекста на входе.
а до сотни контекста разогнать можно? так то рабочие показатели
llama-server был запущен с “-c 102400”.
Провел тест с заполнением контекста до 97122, вот таблица pp для наглядности:
n_tokens | tokens per second
2048 | 368.42
20480 | 328.15
38912 | 306.56
57344 | 290.65
75776 | 276.73
94208 | 263.98
97122 | 261.80Генерация при этом была всего 11 t/s.
Надо подождать, когда улучшат поддержку новой архитектуры и добавят MTP. Как раз к тому времени, как выпустят qwen4, может всё станет хорошо.
Интересно. Ещё бы столько оперативной памяти было(
А если у меня 64 Гб RAM + 24 Гб VRAM? Мне особо не светит юзать данную модель?
Эту модель на данный момент - нет. Однако, я думаю быстренько появятся либо по умному пережатые модельки, по типу APEX или ещё что. Либо REAP модельки где часть экспертов выкинули. В одном из этих случаев - залезет
Почему? В Q1 она 72ГБ, и существенная часть на SSD. Должно влезть (я не пробовал, теоретизирую, у меня 96+24 и только в планах на выходные)
Все что ниже Q4 лучше даже не пробовать
Это справедливо в общем случае, но не для этой модели. Эту стоит попробовать. Главный минус Q1 не то что он выдают "всего" 80% от оригинальной точности, а то что в них нет MTP голов из-за чего генерация чуть медленнее.
А по мне и Q3 - неплохо:
Попробовал разную квантизацию для одного и того "популярного" нечеткого промпта:
Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style
ПК - i7-265 + DDR5-5200 (192G) + 5070Ti(16G VRAM)
gguf - из https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF/tree/main
Запускал в llama с параметрами --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080 ( -c 262144 , за исключением Q6 - там -c 131000).
Интересно наблюдать за уровнем детализации - например незакрепленные крылья колес, кол-во спиц, некорректность слоев , подчеркивание контуров и т.п. Также резкий просад по скорости на Q5/Q6 (а вот Q5 от Q6 почти не отличаются).
Результаты



А вот с Qwen3.8-Flash-Next-UD-Q5_K_XL вообще не сложилось, формировал неполное изображение (причем не вываливался, дальше в сессии можно было продолжать работать с нормальными ответами). 3-4 попытки с разными размерами макс размера контекстного окна и top_k/top_p + прописывание –cache_type_k/v q4_0 не разрешили ситуацию (просто иная "битая" картинка). Скорость ~18 t/s. Странно, Q6 отрабатывал полностью.

Возможно Q5 и починится... Пока для 16G VRAM- все же лучше Q3/Q4 (в зависимости от кол-ва DRAM). Q6 - сильно падает скорость генерации.
Спасибо за тесты, очень наглядно!
По поводу UD-Q5_K_XL: попробуйте поднять K-кеш c Q4 до Q8, я думаю ситуация исправится. Если же нет, то и V-кеш нужно поднять до Q8.
Спасибо
Да, помогло `llama-server -m Qwen3.8-Flash-Next-UD-Q5_K_XL-00001-of-00006.gguf -c 100000 --top-p 0.95 --top-k 20 --temp 0.9 --min-p 0.00 --host 0.0.0.0 --port 8080 --cache_type_k q8_0 --cache_type_v q8_0`
Но результат... давно я так не смеялся ("хлебальник" душевный получился, карикатурный даже ... По моему, у Q3 из ответа выше - лучше справился, хотя детализации меньше):

В статье же написано, что 50В можно хранить хоть на ссд. Поэтому должно скорее всего полететь.
Четырехбитная квантовка весит под 100 гигов, в твои 88 гигов суммарной памяти оно влезет исключительно с жестким свопом, файл подкачки убьет скорость до нуля
Требуемый размер памяти (RAM+VRAM) в зависимости от квантования:
UD-Q4_K_XL 111.3 GB
UD-IQ4_XS 93.7 GB
UD-Q3_K_XL 90 GB
UD-IQ3_XXS 82 GB
UD-Q2_K_XL 78.9 GB
UD-IQ1_M 74.5 GB
UD-IQ1_S 72.5 GB
По идее, у вас должна заработать нижняя половина списка.
Подожди ещё недельку-две.
Unsloth gguf q1 там 3 файла, 10мб 50гб и 22.5 тот что 50 по идее можно даже на диск, но пока что в оперативу. А 22.5 у вас влезает в видеопамять, и в случае с мое не обязательно всему kv кэшу в видеопамять помещаться, по логике должна не просто запуститься так ещё и скорость давать. Но вот надо ли оно, сам сижу и думаю q1 у нее это 80% top1% Accuracy, 27b я могу в q6k_xl и это около 98%, в swe pro у моделей разница почти никакая 62,5 у flash и 61,7 у 27b. Но по всей видимости будет быстрее, в общем выглядит так как будто эта модель создана именно для того что бы ее исключительно на ОЗУ гонять. Т.к. с видеокартой 27b должна быть сильно умней при том же занимаемом объеме ГПУ.
Светит. И греет) Я подцепил эту модель в UD_Q2_K кванте к лламе (пока к ветке pr-27742, пулреквест еще не вмержили в main), развернул на ноуте I7-1362H, 32 ГБ, RTX5070 8 ГБ VRAM. Запускал с маппингом, так что чтение экспертов в VRAM идет напрямую с SSD, плюс в оперативке немного болтается. Префилл удручающий - порядка 20 - 40 т/с, генерация на коротких контекстных окнах 10-20, на длинных 5 - 10. Шевелится, хотя и пыхтит. В окошке рассуждения здравые, холодный запуск секунд 5-10, подгрузка эксперта меньше секунды. Пока балуюсь с max reasoning, по ощущениям весьма неплохо. Оговорюсь - тестов не делал, сравнений с цифрами на руках не проводил, этого и без меня в сети хватает. Все на личных впечатлениях. Блок запуска лламы из ини-файла:
[Qwen3.8-Flash-Next]
model = /home/user/models/Qwen3.8-Flash-Next-UD-Q2_K_XL-00001-of-00003.gguf
mmproj = /home/user/models/Qwen3.8-Flash-Next-Uncensored.mmproj-Q8_0.gguf
ctx-size = 70000
threads = 8
threads-batch = 4
temperature = 0.7
jinja = true
top-p = 0.95
top-k = 64
repeat-penalty = 1.1
ngl = auto
parallel = 1
Интересно что они таки не стали пропускать 4, как обычно в Азии делают.
эта статья - нейрослоп. Иначе как объяснить, что указаны 4 источника данных, но ни в одном "qwen 4" даже не упоминается
эта статья - нейрослоп. Иначе как объяснить, что указаны 4 источника данных, но ни в одном “qwen 4” даже не упоминается
У меня есть для вас упражнение:
Открываете первую ссылку из источников: https://qwen.ai/blog?id=qwen3.8-flash-next
Читаете там первое предложение первого абзаца: In this release we are opening the weights of Qwen3.8-Flash-Next, a multimodal MoE model that also serves as an early preview of the architecture used in Qwen4.
Выдыхаете.
Повторяйте по утрам натощак.
в названии и в тексте вашей статьи указано "qwen 4" (через пробел), в статьях указано "qwen4". Как я должен догадаться, что у вас опечатка? Тем более, что вы ее до сих пор не исправили.
Зато сразу лезете минусовать профиль и выписываете всякую чушь в комментариях. И "qwen 4" по вашим ссылкам действительно нет.
У вас какое-то недомогание, иначе я не могу этого объяснить. Выздоравливайте.
Выпейте водки 50 грамм
Глаза сфокусируются
А эту статью надо было после 50 грамм читать? Тогда понятно. Я просто непьющий - изображение не расползается.
Кстати оскорблять человека и одновременно ставить ему минусы в карму за «грубое общение» - вам самим не смешно?
Какие минусы? Это не я!


Вы прибежали, обвинили человека что его статья нейрослоп, а когда вам мягко указали на то что вы не правы, вы вместо того чтобы признать свою ошибку и извиниться продолжаете нести чушь, а теперь удивляетесь минусам
Т.е. моя фраза про опечатки в статье - это "нести чушь", а три чела включая автора написали в духе "иди лечись" - это "мягко указали", и я еще после этого извиниться должен? На что вы расчитываете?
Единственное, что меня удивляет после этого - в статье про stackoverflow кто-то жаловался на местную систему кармы. Тем временем хабр:

Ваша фраза “эта статья - нейрослоп”. Ваше единственное обоснование - “иначе как объяснить”. Про альтернативное объяснение, что цифры после слов могут быть написаны как вместе, так и через пробел, вы не подумали. Вы ссылаетесь на источники, но даже не начали читать, иначе бы заметили, что “Qwen4” выделено жирным прямо в источнике. Когда вам указали на ошибку, продолжили обвинять автора в грубой форме с причиной “как я должен догадаться”. Так и должны, вы не маленький ребенок, должны знать, что цифры после слов пишутся по-разному. Тем более, что “Qwen3.8” в статье и в источниках написано слитно. Написание через пробел не настолько серьезное отличие, чтобы вызывать такую нервную реакцию, какую вы демонстрируете. Сначала вы необоснованно обвинили автора, потом необоснованно начали обвинять в минусах окружающих, и продолжаете это делать в высокомерной и грубой форме. Да, вы не прочитали источники, и неправильно поискали текст, это вы должны были извиниться за некорректное обвинение “нейрослоп”, когда вам на это указали.
После этого вашего комментария я поставил вам минус в карму, и пишу объяснение, чтобы это было не исподтишка.
тогда давайте я обозначу свою позицию и больше не буду повторяться. Кто не читает - того и проблемы.
Сказал про нейрослоп - да, высокомерно - возможно, в любом случае редактировать старые комментарии на сайте нельзя.
Оскорблять и одновременно требовать извиниться - давайте до свидания. Унижаться перед такими неадекватами я точно не буду.
Обвинять в минусах окружающих - а че это я не могу так делать, если мне за 3 дня прилетело 8 минусов в карму и видимо это еще не конец?
И если кто-то считает, что этими минусами мне напакостит, то я вас огорчу - если аккаунт улетит в бан по карме, то я просто создам новый.
в любом случае редактировать старые комментарии на сайте нельзя
Зато можно новые в таком же стиле не писать.
а че это я не могу так делать
Я вам объяснил че. То, что в минусах вы сами виноваты, вам их поставили из-за ваших действий по отношению к окружающим.
если аккаунт улетит в бан по карме, то я просто создам новый.
Если они вас не беспокоят, тогда непонятно, почему вы в каждом комментарии на них жалуетесь.
Кто вас там оскорблял? У вас спросили есть ли у вас какое-либо недомогание, потому что это единственное разумное объяснение вашему и только вашему похабному отношению к обществу. Научитесь признавать свои ошибки и не хамить, может тогда не будет возникать вопросов ни про минуса, ни про эфемерные оскорбления… И хватит уже нарочито путать причину и следствие
Мои соболезнования.
Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD
Костыль века, хоть и рабочий. Пси-ай шина будет дымиться от постоянных свопов, зато в оперативку влезет
Да, все так. Стратегия Alibaba заключается в закрытии всех ниш своими моделями. Вот и дошла очередь позаботиться о пользователях без мощных видеокарт и дать им возможность пощупать фронтир модель на ОЗУ. При правильной настройке эта модель вполне может стать для них ежедневным помощником. В том числе и поэтому я решил о ней написать.
Нет, не так.
Pci-E шина дымилась при плотной архитектуре, когда все веса были нужны на каждый токен.
Оффлоад экспертов уже сносно работал, хотя и ограничивал скорость.
Ngram-слой на ssd вообще не будет узким местом.
Я имел ввиду, что у большинства пользователей в оффлоад уйдет не только Ngram-эмбеддинги, но и заметная часть слоев основной архитектуры. И вот это уже даст нагрузку.
С вами я согласен и тут, и выше, кроме того места, где вы согласились со стартом ветки 😅
Да, там минимум половина слоёв попадёт в оффлоад, но судя по публикуемым цифрам - это вполне сносно работает. Подозреваю что тащит ngram тот самый.
Подозреваю что тащит ngram тот самый.
Подозреваю тоже самое, что и вы. Думаю, что главное ускорение в том, что он использует хеширование. Именно быстрый доступ к данным по хешу и дает скорость.
Так с их МоЕ и раньше норм было со слоями в ОЗУ, у них при выгрузке слоев скорость вообще почти не падала, до определенного количества. Тут активных параметров всего 6b т.е. на gpu можно хранить в 4,5 раза меньше кэша чем у 27b без серьезной потери скорости, ну если то что нужно храниться.
На удивление, свопов не наблюдаю. Нужные куски грузятся через mmap в видеопамять напрямую с SSD и не сказать, чтобы часто - видимо потому, что эксперты не часто меняются. При смене эксперта поток GPU PCIe RX подскакивает до 5-10 ГБ/с, TX живет на уровне земли 100-300 МБ/с.
А можно поподробнее что даёт этот самый N-gram Embeddings?
А можно поподробнее что даёт этот самый N-gram Embeddings?
Если по-простому, то это дополнительный словарь. В классических трансформерах входной слой модели видит токен абсолютно изолированно. Упрощенный пример: "белый хлеб" это два независимых токена "белый" и "хлеб". Чтобы понять, что это единая сущность, модель вынуждена тратить ресурсы первых слоев Внимания.
N-gram Embeddings кодируют сразу устойчивые последовательности из нескольких соседних элементов, т.е. "белый хлеб" будет закодирован одним куском и попадет в этот дополнительный словарь без потери точности.
Более того, т.к. этот словарь дополнительный, то мы получаем сразу несколько преимуществ. Во-первых, мы не раздуваем основной словарь токенизатора редкими сочетаниями токенов, что хорошо уменьшает итоговую матрицу весов которую нужно считать. Во-вторых, этот дополнительный словарь хеширован, что позволяет очень эффективно с ним работать. И в-третьих, т.к. словарь отдельный и работает быстро, его можно положить отдельно, например в оперативную память или на диск.
Сам подход использования словаря n-gram далеко не нов и часто используется в задачах обработки естественных языков (NLP). Все "возбуждение новизны" тут в том, что эту технологию засунули в архитектуре туда куда раньше на засовывали. Поэтому статья так и называется.
Я прочитал, но совсем ничего не понял. Можно для тех кто в танке: 1) на каком этапе он используется, 2) какой от него профит?
Для статистики. Запускаю на хоумлабе с 512 ГБ ОЗУ DDR4 2666 и тремя видеокартами 2х RTX3090 24ГБ (подключены через PCIE x16 v3.0) и RTX4070Ti Super 16ГБ (подключена через Okulink PCIE x4 v3.0) через llama.cpp, модель unsloth\Qwen3.8-Flash-Next-UD-Q4_K_XL (103ГБ).
При использовании всех трех видеокарт: промпт процессинг ~70-80 т/с, генерация токенов ~22-25
При использовании 2х RTX3090: промпт процессинг ~150-160 т/с, генерация токенов ~20-22 т/с
При использовании 1х RTX3090: промпт процессинг ~110 т/с, генерация токенов ~15 т/с
То есть для моей конфигурации лучше вариант с двумя видеокартами.
Для сравнения, модель Qwen3.8-27B-UD-Q8_K_XL (29.2 ГБ), с vision, квантованием кэша bf16, и максимальным контекстом 256k выдает на 2 или 3 видеокартах (разницы в скорости при этом особой нет): промпт процессинг ~1600-1800 т/с, генерация токенов ~45-50 т/с.
При этом чувствуется что Qwen3.8-Flash-Next более умная модель - на решение задач тратит меньше токенов и размышления гораздо адекватнее.
Но после того как привыкаешь к огромной скорости промпт процессинга на Qwen3.8-27B, работать на Qwen3.8-Flash-Next невозможно нормально...
Что-то на богатом :'( Мои 10 т/с передают поздравления
Цены, думаю, и в будущем неприятно удивят. Обновлял-покупал родственникам 3 компа в мае (повод - детишки удачно закончили школу или поступают в ВУЗы). В качестве видеокарты ставил 5060Ti-16G за 44-48к руб (новые с гарантией), спустя 3 (всего три) месяца - очень печально (и думаю стоимость не будет останавливаться). Про ОЗУ и говорить не стоит.
Можете для статистики написать ваш CPU + снять нагрузку CPU/GPU-s при генерации токенов. Меня немного удивляет i7-265+1x5070Ti дает нагрузку 90-98% на всех ядрах CPU + 26-36% на GPU при скорости 23t/s. Нагрузка на GPU низкая (при этом VRAM используется "по самые помидоры") в следствии обмена VRAM <- RAM ?
Попробуйте layer-split вместо Tensor-split, где-то на реддите видел, что чел ускорил PP до ~400t/s таким образом, на двух 3060 врoде:. Вот нашёл:
На hugging face несколько дней назад вышел еще Qwen3.8-27B thinkingcap он делает тоже самое за половину токенов. По крайней мере я за несколько дней тестирования разницы не заметил.
Без видеокарты голяк полный. Пачка p104-100 даже если воткнута в короткий pci-ex выдаёт токены в десятки раз быстрее чем просто проц. Сёрьёзную модель так не запустить, но, например, утилитарный Ornith-35b в q6 помогает экономить токены Клода. И удивляет упоминание q1 или q2 - по моим наблюдением минимальный порог это q6_k_m. Всё что ниже - абсолютно не юзабельно в прикладных задачах.
Вот хороший комментарий от пользователя объясняющий суть использования того же Q1 и его целевую аудиторию. Это справедливо именно для этой модели, в общем же случае вы правы, ниже Q6 смысла особого нет.
Не сравнивал лично, но прям по огромному количеству сообщений как просто пользователей, так и авторов статей, обзоршиков на сайтах, между q4 и q6 разница в пределах погрешности. Заметное падение качества идёт ниже ку4.
С 3.8 flash вообще не понятно какой квант, там n-gram не жмут ниже q4, а также внутри основных слоев веса ffn_down_exps также не делали ниже q4 пока что, а они треть места занимают. То есть в q1 модели получается 50b n-gram в q4, 40b основы в q4, 80b основы в q1 и остальное по мелочи.
Да и в целом пока движки не оптимизировали под новую архитектуру. С моделями аналогично, n-gram почти у всех лежит вместе с основными весами в одном файле, что как минимум усложнит загрузку. Остаётся ждать, когда все доработают. И производительность тогда нормальная должна появиться.
Идёт резкий скачок деградации q6/q4. Между q4/q3 и между q6/q8 таких разрывов нет. Даже 35b модели сильно теряют в сообразительности на q4 (проверял лично на Ornith 35b)

Qwen 4: возбуждающая новая технология