Обновить

Комментарии 90

“У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна”
Так какая видеокарта-то? ЭТО ЖЕ ОСНОВНОЕ. На чистой памяти оно могло выдать у тебя ~1 токен/сек…

Без карты тоже должно работать, все зависит от того прочитал ли пользователь какие параметры выставлять, от его проца, а также от скорости и поколения DDR памяти:

  • M1 Ultra 128G выдает примерно 20 t/s,

  • AMD EPYC 7763 + 128GB DDR4 RAM выдает примерно 45 t/s

  • Intel i9 12900k128 GB DDR4 3600 MT/s + RTX 3090 примерно 65 t/s

Это данные от пользователей. Моя система не показатель тк там все патчено-перепатчено под различные штуки.

Intel i9 12900k128 GB DDR4 3600 MT/s + RTX 3090 примерно 65 t/s

Вот это красота. То есть на моем Ryzen 5950 можно добавить +64 Гб до 128 и получить настолько нормальную скорость?

Неизвестно что они там запускали.
Ryzen 9950x3d 128 Gb DDR5-6000 + RTX 4070 ti super 16 Gb

llama-cli --model Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 200000 --load-mode mlock -t 16
[ Prompt: 39.8 t/s | Generation: 20.9 t/s ]

llama-cli --model Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 200000 --load-mode mlock -t 16 -ngl 0
[ Prompt: 34.3 t/s | Generation: 7.4 t/s ]

Примерно с такой же скоростью работает генерация для DeepSeek-V4-Flash-UD-Q3_K_XL у которой активных параметров в 2 раза больше. Но менее стабильно, потому что немного не влазит в 128 Gb.

Добавил в конец статьи апдейт со ссылкой на страницу где пользователи делятся результатами на своих сборках и часто публикуют настройки. Возможно, это поможет вам настроить свой запуск на большую скорость.

Нет там чудо параметров. Вы не ту циферку взяли.

19 t/s decoding

65 t/s prompt processing

Примерно тоже самое. Слабая память и не самый мощный проц компенсируется большим объемом GPU RAM. На одном i9 хорошо если будет 5 t/s.

Да, вы правы, прошу прощения, привык что первым идет prompt processing, потом decoding.

Покрутил настройки на своей системе, поднял скорость до 32-35 токенов в секунду. Похоже, что настройки для данной модели нужно подбирать вручную под каждую систему.

Скорость упрется в пропускную способность твоей ddr4. Трансформеры это memory bound задача, тут частота памяти решает гораздо больше объема

Старый сервер с 96 Гб DDR4 ОЗУ и 2 зеонами E5-2683 v4 (32 ядра суммарно) без видеокарты с MTP выдает до 10 токенов в секунду, без MTP 7t/s, что очень неплохо для столь древнего железа.

Для инференса важно не количество ядер, а пропускная способность памяти. В данном случае с вероятностью 99% там 4-х канал на частоте 2133мгц. Сейчас если собирать систему под большие модели, и есть хоть какой нибудь бюджет, топ это сокет 4677, там в одном процессоре 6-ти канал на частоте 2933мгц, что грубо говоря даёт прирост вдвое.

Интереснее скорость префилла. Ждать по полчаса загрузки 100к контекста - это неюзабельно.

Юзабельно это кластер из а100 в серверной, на домашнем железе всегда приходится терпеть компромисс между размером модели и ожиданием ответа)

Интереснее скорость префилла.

300-400 t/s

Для сравнения, на Qwen 3.8 27B префил у меня 800-900 t/s.

Звучит интересно, я так понимаю, что на ПК подобному 192Gb DRAM (DDR5-5200) + 16GbVRAM - возможно одно из оптимальных решений.

Да, вы правильно понимаете, в конце статьи добавил ссылку на страницу где можно сравнить свою сборку с теми кто уже запускает модель на своем железе.

Получаю 22-24 t/s на i7-265 +DDR5-5200 (192G) + 5070Ti(16G VRAM)
llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 262144 --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080

Хороший результат! Все что 20 t/s и выше вполне юзабельно в каждодневном использовании.

Для сравнения, у меня 30-35 t/s на том же 262К контексте, версии модели и настройках. Железо: Threadripper 3970X + DDR4-3200 (128GB quad-channel mode) + RTX A6000 48GB.

А какой квант запускаете? FP8?

А какой квант запускаете? FP8?

Для сравнения запускал тот же квант, что и у автора комментария, на который отвечал: Qwen3.8-Flash-Next-UD-Q4_K_XL

Эта же модель на 96GB DDR4-3500 + 5070 Ti + 5060 Ti выдает 17-19 t/s tg и 360-370 t/s pp на задаче с ~10к контекста на входе.

а до сотни контекста разогнать можно? так то рабочие показатели

llama-server был запущен с “-c 102400”.

Провел тест с заполнением контекста до 97122, вот таблица pp для наглядности:

n_tokens | tokens per second
2048     | 368.42
20480    | 328.15
38912    | 306.56
57344    | 290.65
75776    | 276.73
94208    | 263.98
97122    | 261.80

Генерация при этом была всего 11 t/s.

Надо подождать, когда улучшат поддержку новой архитектуры и добавят MTP. Как раз к тому времени, как выпустят qwen4, может всё станет хорошо.

Интересно. Ещё бы столько оперативной памяти было(

Эту модель на данный момент - нет. Однако, я думаю быстренько появятся либо по умному пережатые модельки, по типу APEX или ещё что. Либо REAP модельки где часть экспертов выкинули. В одном из этих случаев - залезет

Почему? В Q1 она 72ГБ, и существенная часть на SSD. Должно влезть (я не пробовал, теоретизирую, у меня 96+24 и только в планах на выходные)

Все что ниже Q4 лучше даже не пробовать

Это справедливо в общем случае, но не для этой модели. Эту стоит попробовать. Главный минус Q1 не то что он выдают "всего" 80% от оригинальной точности, а то что в них нет MTP голов из-за чего генерация чуть медленнее.

А у Qwen3.8-Flash-Next-UD-Q4_K_XL они есть? А то если я устанавливаю ключ ’–spec-type draft-mtp’ так она ругаться начинает. Хотя на 27В принимает этот ключ в этом же кванте.

Должны быть. Насколько я знаю MTP слой сохранен от Q4 и выше.

Поддержку MTP для этой модели пока еще не реализовали в llama.cpp

А по мне и Q3 - неплохо:

Попробовал разную квантизацию для одного и того "популярного" нечеткого промпта:

Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style

ПК - i7-265 + DDR5-5200 (192G) + 5070Ti(16G VRAM)

gguf - из https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF/tree/main

Запускал в llama с параметрами --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080 ( -c 262144 , за исключением Q6 - там  -c 131000).

Интересно наблюдать за уровнем детализации - например незакрепленные крылья колес, кол-во спиц, некорректность слоев , подчеркивание контуров и т.п. Также резкий просад по скорости на Q5/Q6 (а вот Q5 от Q6 почти не отличаются).

Результаты

Qwen3.8-Flash-Next-UD-IQ3_XXS 24 t/s
Qwen3.8-Flash-Next-UD-IQ3_XXS 24 t/s
Qwen3.8-Flash-Next-UD-Q4_K_XL 23 t/s
Qwen3.8-Flash-Next-UD-Q4_K_XL 23 t/s
Qwen3.8-Flash-Next-UD-Q6_K_XL 16.5 t/s
Qwen3.8-Flash-Next-UD-Q6_K_XL 16.5 t/s

А вот с Qwen3.8-Flash-Next-UD-Q5_K_XL вообще не сложилось, формировал неполное изображение (причем не вываливался, дальше в сессии можно было продолжать работать с нормальными ответами). 3-4 попытки с разными размерами макс размера контекстного окна и top_k/top_p + прописывание –cache_type_k/v q4_0 не разрешили ситуацию (просто иная "битая" картинка). Скорость ~18 t/s. Странно, Q6 отрабатывал полностью.

Qwen3.8-Flash-Next-UD-Q5_K_XL 17.5 t/s
Qwen3.8-Flash-Next-UD-Q5_K_XL 17.5 t/s

Возможно Q5 и починится... Пока для 16G VRAM- все же лучше Q3/Q4 (в зависимости от кол-ва DRAM). Q6 - сильно падает скорость генерации.

Спасибо за тесты, очень наглядно!

По поводу UD-Q5_K_XL: попробуйте поднять K-кеш c Q4 до Q8, я думаю ситуация исправится. Если же нет, то и V-кеш нужно поднять до Q8.

Спасибо

Да, помогло `llama-server -m Qwen3.8-Flash-Next-UD-Q5_K_XL-00001-of-00006.gguf -c 100000 --top-p 0.95 --top-k 20 --temp 0.9 --min-p 0.00 --host 0.0.0.0 --port 8080 --cache_type_k q8_0 --cache_type_v q8_0`

Но результат... давно я так не смеялся ("хлебальник" душевный получился, карикатурный даже ... По моему, у Q3 из ответа выше - лучше справился, хотя детализации меньше):

Qwen3.8-Flash-Next-UD-Q5_K_XL 17.8 t/s
Qwen3.8-Flash-Next-UD-Q5_K_XL 17.8 t/s

В статье же написано, что 50В можно хранить хоть на ссд. Поэтому должно скорее всего полететь.

Вот только какой запускатор сумеет правильно разложить между NVME, RAM, VRAM интересно. Не встречали еще инструкций для какого-нибудь дешманского 1ТБ/64/16?

Четырехбитная квантовка весит под 100 гигов, в твои 88 гигов суммарной памяти оно влезет исключительно с жестким свопом, файл подкачки убьет скорость до нуля

Ответ неверен. Уже вчера на реддит подобрали конфиги llama, которые оставляют весь N-gram (-50gb) на SSD. Ничего сложного нет, см. мои недавние комментарии.

Требуемый размер памяти (RAM+VRAM) в зависимости от квантования:

  • UD-Q4_K_XL 111.3 GB

  • UD-IQ4_XS 93.7 GB

  • UD-Q3_K_XL 90 GB

  • UD-IQ3_XXS 82 GB

  • UD-Q2_K_XL 78.9 GB

  • UD-IQ1_M 74.5 GB

  • UD-IQ1_S 72.5 GB

По идее, у вас должна заработать нижняя половина списка.

Подожди ещё недельку-две.

Unsloth gguf q1 там 3 файла, 10мб 50гб и 22.5 тот что 50 по идее можно даже на диск, но пока что в оперативу. А 22.5 у вас влезает в видеопамять, и в случае с мое не обязательно всему kv кэшу в видеопамять помещаться, по логике должна не просто запуститься так ещё и скорость давать. Но вот надо ли оно, сам сижу и думаю q1 у нее это 80% top1% Accuracy, 27b я могу в q6k_xl и это около 98%, в swe pro у моделей разница почти никакая 62,5 у flash и 61,7 у 27b. Но по всей видимости будет быстрее, в общем выглядит так как будто эта модель создана именно для того что бы ее исключительно на ОЗУ гонять. Т.к. с видеокартой 27b должна быть сильно умней при том же занимаемом объеме ГПУ.

Светит. И греет) Я подцепил эту модель в UD_Q2_K кванте к лламе (пока к ветке pr-27742, пулреквест еще не вмержили в main), развернул на ноуте I7-1362H, 32 ГБ, RTX5070 8 ГБ VRAM. Запускал с маппингом, так что чтение экспертов в VRAM идет напрямую с SSD, плюс в оперативке немного болтается. Префилл удручающий - порядка 20 - 40 т/с, генерация на коротких контекстных окнах 10-20, на длинных 5 - 10. Шевелится, хотя и пыхтит. В окошке рассуждения здравые, холодный запуск секунд 5-10, подгрузка эксперта меньше секунды. Пока балуюсь с max reasoning, по ощущениям весьма неплохо. Оговорюсь - тестов не делал, сравнений с цифрами на руках не проводил, этого и без меня в сети хватает. Все на личных впечатлениях. Блок запуска лламы из ини-файла:
[Qwen3.8-Flash-Next]
model = /home/user/models/Qwen3.8-Flash-Next-UD-Q2_K_XL-00001-of-00003.gguf
mmproj = /home/user/models/Qwen3.8-Flash-Next-Uncensored.mmproj-Q8_0.gguf
ctx-size = 70000
threads = 8
threads-batch = 4
temperature = 0.7
jinja = true
top-p = 0.95
top-k = 64
repeat-penalty = 1.1
ngl = auto
parallel = 1

Пару вопросов: почему ngl auto, и какое распределение слоев по факту получилось? Температура 0.7 - это не для кодинга, как я понимаю? mmproj грузите, чтобы снять цензуру или для иных задач?

Интересно что они таки не стали пропускать 4, как обычно в Азии делают.

Видимо, новое поколение не такое суеверное.

Чушь поришь. В какой Азии? Сибирь - это Азия. И Грузия - это Азия. И Владивосток - это Азия. И Дубайщина - это Азия.

Аляска это запад или восток?

С октября 1867 - дальний запад.

эта статья - нейрослоп. Иначе как объяснить, что указаны 4 источника данных, но ни в одном "qwen 4" даже не упоминается

эта статья - нейрослоп. Иначе как объяснить, что указаны 4 источника данных, но ни в одном “qwen 4” даже не упоминается

У меня есть для вас упражнение:

  1. Открываете первую ссылку из источников: https://qwen.ai/blog?id=qwen3.8-flash-next

  2. Читаете там первое предложение первого абзаца: In this release we are opening the weights of Qwen3.8-Flash-Next, a multimodal MoE model that also serves as an early preview of the architecture used in Qwen4

  3. Выдыхаете.

Повторяйте по утрам натощак.

в названии и в тексте вашей статьи указано "qwen 4" (через пробел), в статьях указано "qwen4". Как я должен догадаться, что у вас опечатка? Тем более, что вы ее до сих пор не исправили.

Зато сразу лезете минусовать профиль и выписываете всякую чушь в комментариях. И "qwen 4" по вашим ссылкам действительно нет.

У вас какое-то недомогание, иначе я не могу этого объяснить. Выздоравливайте.

Выпейте водки 50 грамм

Глаза сфокусируются

А эту статью надо было после 50 грамм читать? Тогда понятно. Я просто непьющий - изображение не расползается.

Кстати оскорблять человека и одновременно ставить ему минусы в карму за «грубое общение» - вам самим не смешно?

Какие минусы? Это не я!

Честно, не я
Честно, не я
Анонимус жесток, но это не я
Анонимус жесток, но это не я

Вы прибежали, обвинили человека что его статья нейрослоп, а когда вам мягко указали на то что вы не правы, вы вместо того чтобы признать свою ошибку и извиниться продолжаете нести чушь, а теперь удивляетесь минусам

Т.е. моя фраза про опечатки в статье - это "нести чушь", а три чела включая автора написали в духе "иди лечись" - это "мягко указали", и я еще после этого извиниться должен? На что вы расчитываете?

Единственное, что меня удивляет после этого - в статье про stackoverflow кто-то жаловался на местную систему кармы. Тем временем хабр:

Ваша фраза “эта статья - нейрослоп”. Ваше единственное обоснование - “иначе как объяснить”. Про альтернативное объяснение, что цифры после слов могут быть написаны как вместе, так и через пробел, вы не подумали. Вы ссылаетесь на источники, но даже не начали читать, иначе бы заметили, что “Qwen4” выделено жирным прямо в источнике. Когда вам указали на ошибку, продолжили обвинять автора в грубой форме с причиной “как я должен догадаться”. Так и должны, вы не маленький ребенок, должны знать, что цифры после слов пишутся по-разному. Тем более, что “Qwen3.8” в статье и в источниках написано слитно. Написание через пробел не настолько серьезное отличие, чтобы вызывать такую нервную реакцию, какую вы демонстрируете. Сначала вы необоснованно обвинили автора, потом необоснованно начали обвинять в минусах окружающих, и продолжаете это делать в высокомерной и грубой форме. Да, вы не прочитали источники, и неправильно поискали текст, это вы должны были извиниться за некорректное обвинение “нейрослоп”, когда вам на это указали.

После этого вашего комментария я поставил вам минус в карму, и пишу объяснение, чтобы это было не исподтишка.

тогда давайте я обозначу свою позицию и больше не буду повторяться. Кто не читает - того и проблемы.

Сказал про нейрослоп - да, высокомерно - возможно, в любом случае редактировать старые комментарии на сайте нельзя.

Оскорблять и одновременно требовать извиниться - давайте до свидания. Унижаться перед такими неадекватами я точно не буду.

Обвинять в минусах окружающих - а че это я не могу так делать, если мне за 3 дня прилетело 8 минусов в карму и видимо это еще не конец?

И если кто-то считает, что этими минусами мне напакостит, то я вас огорчу - если аккаунт улетит в бан по карме, то я просто создам новый.

в любом случае редактировать старые комментарии на сайте нельзя

Зато можно новые в таком же стиле не писать.

а че это я не могу так делать

Я вам объяснил че. То, что в минусах вы сами виноваты, вам их поставили из-за ваших действий по отношению к окружающим.

если аккаунт улетит в бан по карме, то я просто создам новый.

Если они вас не беспокоят, тогда непонятно, почему вы в каждом комментарии на них жалуетесь.

Кто вас там оскорблял? У вас спросили есть ли у вас какое-либо недомогание, потому что это единственное разумное объяснение вашему и только вашему похабному отношению к обществу. Научитесь признавать свои ошибки и не хамить, может тогда не будет возникать вопросов ни про минуса, ни про эфемерные оскорбления… И хватит уже нарочито путать причину и следствие

Мои соболезнования.

Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD

Костыль века, хоть и рабочий. Пси-ай шина будет дымиться от постоянных свопов, зато в оперативку влезет

Да, все так. Стратегия Alibaba заключается в закрытии всех ниш своими моделями. Вот и дошла очередь позаботиться о пользователях без мощных видеокарт и дать им возможность пощупать фронтир модель на ОЗУ. При правильной настройке эта модель вполне может стать для них ежедневным помощником. В том числе и поэтому я решил о ней написать.

Нет, не так.

Pci-E шина дымилась при плотной архитектуре, когда все веса были нужны на каждый токен.

Оффлоад экспертов уже сносно работал, хотя и ограничивал скорость.

Ngram-слой на ssd вообще не будет узким местом.

Я имел ввиду, что у большинства пользователей в оффлоад уйдет не только Ngram-эмбеддинги, но и заметная часть слоев основной архитектуры. И вот это уже даст нагрузку.

С вами я согласен и тут, и выше, кроме того места, где вы согласились со стартом ветки 😅

Да, там минимум половина слоёв попадёт в оффлоад, но судя по публикуемым цифрам - это вполне сносно работает. Подозреваю что тащит ngram тот самый.

Подозреваю что тащит ngram тот самый.

Подозреваю тоже самое, что и вы. Думаю, что главное ускорение в том, что он использует хеширование. Именно быстрый доступ к данным по хешу и дает скорость.

Так с их МоЕ и раньше норм было со слоями в ОЗУ, у них при выгрузке слоев скорость вообще почти не падала, до определенного количества. Тут активных параметров всего 6b т.е. на gpu можно хранить в 4,5 раза меньше кэша чем у 27b без серьезной потери скорости, ну если то что нужно храниться.

На удивление, свопов не наблюдаю. Нужные куски грузятся через mmap в видеопамять напрямую с SSD и не сказать, чтобы часто - видимо потому, что эксперты не часто меняются. При смене эксперта поток GPU PCIe RX подскакивает до 5-10 ГБ/с, TX живет на уровне земли 100-300 МБ/с.

эксперты не часто меняются

Вот потому и говорят что dense модели в реальности гораздо лучше. Тут тоже видно сравнивают с мелкой моделью а по бенчам (на которые тоже натаскивают и хз кому тут накручено больше попугаев) разница так себе.

А можно поподробнее что даёт этот самый N-gram Embeddings?

А можно поподробнее что даёт этот самый N-gram Embeddings?

Если по-простому, то это дополнительный словарь. В классических трансформерах входной слой модели видит токен абсолютно изолированно. Упрощенный пример: "белый хлеб" это два независимых токена "белый" и "хлеб". Чтобы понять, что это единая сущность, модель вынуждена тратить ресурсы первых слоев Внимания.

N-gram Embeddings кодируют сразу устойчивые последовательности из нескольких соседних элементов, т.е. "белый хлеб" будет закодирован одним куском и попадет в этот дополнительный словарь без потери точности.

Более того, т.к. этот словарь дополнительный, то мы получаем сразу несколько преимуществ. Во-первых, мы не раздуваем основной словарь токенизатора редкими сочетаниями токенов, что хорошо уменьшает итоговую матрицу весов которую нужно считать. Во-вторых, этот дополнительный словарь хеширован, что позволяет очень эффективно с ним работать. И в-третьих, т.к. словарь отдельный и работает быстро, его можно положить отдельно, например в оперативную память или на диск.

Сам подход использования словаря n-gram далеко не нов и часто используется в задачах обработки естественных языков (NLP). Все "возбуждение новизны" тут в том, что эту технологию засунули в архитектуре туда куда раньше на засовывали. Поэтому статья так и называется.

Я прочитал, но совсем ничего не понял. Можно для тех кто в танке: 1) на каком этапе он используется, 2) какой от него профит?

1) на каком этапе он используется

N-gram Embeddings работают на входном (эмбеддинг) слое модели, то есть ещё до полноценной обработки Attention-слоями.

2) какой от него профит?

Ускорение работы модели и возможность запускать на обычном железе без профессиональных видеокарт с приемлимой скоростью.

Для статистики. Запускаю на хоумлабе с 512 ГБ ОЗУ DDR4 2666 и тремя видеокартами 2х RTX3090 24ГБ (подключены через PCIE x16 v3.0) и RTX4070Ti Super 16ГБ (подключена через Okulink PCIE x4 v3.0) через llama.cpp, модель unsloth\Qwen3.8-Flash-Next-UD-Q4_K_XL (103ГБ).

При использовании всех трех видеокарт: промпт процессинг ~70-80 т/с, генерация токенов ~22-25

При использовании 2х RTX3090: промпт процессинг ~150-160 т/с, генерация токенов ~20-22 т/с

При использовании 1х RTX3090: промпт процессинг ~110 т/с, генерация токенов ~15 т/с

То есть для моей конфигурации лучше вариант с двумя видеокартами.

Для сравнения, модель Qwen3.8-27B-UD-Q8_K_XL (29.2 ГБ), с vision, квантованием кэша bf16, и максимальным контекстом 256k выдает на 2 или 3 видеокартах (разницы в скорости при этом особой нет): промпт процессинг ~1600-1800 т/с, генерация токенов ~45-50 т/с.

При этом чувствуется что Qwen3.8-Flash-Next более умная модель - на решение задач тратит меньше токенов и размышления гораздо адекватнее.

Но после того как привыкаешь к огромной скорости промпт процессинга на Qwen3.8-27B, работать на Qwen3.8-Flash-Next невозможно нормально...

Цены, думаю, и в будущем неприятно удивят. Обновлял-покупал родственникам 3 компа в мае (повод - детишки удачно закончили школу или поступают в ВУЗы). В качестве видеокарты ставил 5060Ti-16G за 44-48к руб (новые с гарантией), спустя 3 (всего три) месяца - очень печально (и думаю стоимость не будет останавливаться). Про ОЗУ и говорить не стоит.

Ладно видеокарты и ОЗУ. Я тут сравнивал цены на диски. Брал NVME 2ТБ, 10 месяцев назад за 11 тыс. Сейчас он же стоит 23 тыс. Даже HDD и те взлетели.

Можете для статистики написать ваш CPU + снять нагрузку CPU/GPU-s при генерации токенов. Меня немного удивляет i7-265+1x5070Ti дает нагрузку 90-98% на всех ядрах CPU + 26-36% на GPU при скорости 23t/s. Нагрузка на GPU низкая (при этом VRAM используется "по самые помидоры") в следствии обмена VRAM <- RAM ?

Попробуйте layer-split вместо Tensor-split, где-то на реддите видел, что чел ускорил PP до ~400t/s таким образом, на двух 3060 врoде:. Вот нашёл:

https://www.reddit.com/r/LocalLLaMA/comments/1w0na2z/qwen38flashnext_udiq4_xs_on_2x_rtx_3060_7800x3d/

--split-mode layer используется по умолчанию

На hugging face несколько дней назад вышел еще Qwen3.8-27B thinkingcap он делает тоже самое за половину токенов. По крайней мере я за несколько дней тестирования разницы не заметил.

Без видеокарты голяк полный. Пачка p104-100 даже если воткнута в короткий pci-ex выдаёт токены в десятки раз быстрее чем просто проц. Сёрьёзную модель так не запустить, но, например, утилитарный Ornith-35b в q6 помогает экономить токены Клода. И удивляет упоминание q1 или q2 - по моим наблюдением минимальный порог это q6_k_m. Всё что ниже - абсолютно не юзабельно в прикладных задачах.

Вот хороший комментарий от пользователя объясняющий суть использования того же Q1 и его целевую аудиторию. Это справедливо именно для этой модели, в общем же случае вы правы, ниже Q6 смысла особого нет.

Не сравнивал лично, но прям по огромному количеству сообщений как просто пользователей, так и авторов статей, обзоршиков на сайтах, между q4 и q6 разница в пределах погрешности. Заметное падение качества идёт ниже ку4.

С 3.8 flash вообще не понятно какой квант, там n-gram не жмут ниже q4, а также внутри основных слоев веса ffn_down_exps также не делали ниже q4 пока что, а они треть места занимают. То есть в q1 модели получается 50b n-gram в q4, 40b основы в q4, 80b основы в q1 и остальное по мелочи.

Да и в целом пока движки не оптимизировали под новую архитектуру. С моделями аналогично, n-gram почти у всех лежит вместе с основными весами в одном файле, что как минимум усложнит загрузку. Остаётся ждать, когда все доработают. И производительность тогда нормальная должна появиться.

Идёт резкий скачок деградации q6/q4. Между q4/q3 и между q6/q8 таких разрывов нет. Даже 35b модели сильно теряют в сообразительности на q4 (проверял лично на Ornith 35b)

Этот скачок, вернее провал, становится менее выраженным на моделях размером ~100B параметров и выше,но тут еще очень сильно влияет квантованность KV-кеша, которая не зависит от квантованности самой модели.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации