Comments 24
Тс, как то много памяти для KV кеша у вас жрет эта модель. Я на rtx 5060 ti 16gb крутил эту модель Qwen3.6-27B-UD-IQ3_XXS с квантованным кешем q8 90к, вся модель с кешем влезла в VRAM и еще 380 мегабайт свободно осталось. Правда у меня монитор подключен к встройке, так что еще отсюда экономия. С MTP получалось 45-65 ток/сек. Вот и не пойму- вроде в кванте который вы описываете, учитывая сколько весят веса, там должно влезть 256к, да еще и место остаться и без турбокванта. Или я что-то не понимаю?
а вы попробуйте у себя выставить контекст 256к думаю будет большое потребление (самому интересно какое), всё же ваши 90 это почти в 3 раза меньше
... там должно влезть 256к, да еще и место остаться и без турбокванта. Или я что-то не понимаю?
У меня на тестах в 16GB VRAM на RTX A5000 влезло 129К контекста,
а больше: out of memory.
Но, кстати, модели довольно умные.
По моим внутренним 80 тестам лажанулись всего на 6,
да и то при исправленном промпте прошли все 80.
Я заменил свою старую модель на Ternary-Bonsai-27B.
Ну я к тому что и квант кеша у меня 8, у вас то явно мельче квант,
ну у турбокванта почти в 5 раз меньше размер, а у вас в 2 раза из за q8 и ещё дополнительно в 3 раза меньше из за 90к
p.s. сейчас проверил при 90к у меня потребление 10gb + 3gb-win11 (на 2 битной модели) + у меня замеры с mmproj (для распознавания изображений)
p.s.s. 90к без mmproj потребление 9gb +3gb-win11 (на 2 битной модели)
Ok, теперь таки математика сходится. Спасибо!
А смысл, эти модели сами по себе туповатые, Q1 сваливается в loop, на сложной задаче, Q2 немного умнее но тоже тупит и не может исправить ошибки в созданном коде.
Я тоже не понимаю на каких задачах автор тестирует качество и достигает 90-95%... Примеров нет, так что это просто слова. Бумага все стерпит)))
я серьёзных тестов не делал, просто просил сделать html портфолио и за первый ответ там была 1 ошибка, на второй оно исправило её, так что может, хоть и сложность была не большая
p.s. специально сделал ещё раз тесты на моих основных локальных моделях, да промпт не самый показательный но вы можете и сами это сделать лучше..
p.s.s. все тесты через обычный чат llama.cpp (server)
Эх, вот бы 4B-версию иметь с хорошим сжатием...
Эта модель на 3090 влезает в кванте 4. Было бы интересно выпихнуть что-то по мощнее, чем и так уже впихнулось :-)
Смотрел тест этих моделей, там они максимум 50% показали
Этот аттракцион извращения осталось догнать до полбита квантования, и с радостным гиканьем запускать на пульте от микроволновки - смотрите, работает!
Появилась новая группа странных людей с потребительским барахлом, которые всеми силами хотят закатиться в ИИ несмотря ни на что.
Но ведь с практической действительностью все эти потуги не имеют ничего общего.
95% точности в промышленных вещах - это фатальный писец.
А на поговорить ведь достаточно и гигачата
А какую точность, как вы выразились, даёт любая фронтир модель?
Как говорят в /ai/
Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до
8 5 4 3 20,58 бит, на кофеварке с подкачкой на микроволновку.
Хобби и домашних животных тоже осудить и запретить? Или только с железками ковыряться взрослому человеку должно быть зазорно?
За то, что скрестили Turbo Quant и призму — огромное спасибо! Сам давно привык к Turbo Quant.
Несколько вопросов по настройке:
Накатывали ли вы чат-шаблон (
chat template)?Проставляли ли какие-то параметры температуры и других аргументов при запуске?
Результаты по потреблению VRAM (на RTX 4090, стандартная prism.ml llama.cpp):
f16 (два кэша): ~21.4 ГБ VRAM для контекста 200.000 токенов.
q8 (два кэша): ~18.9 ГБ VRAM для контекста 262.144 токенов.
Системный базовый уровень: Windows 11 23H2 без фоновых задач «кушает» ~1.7 ГБ VRAM. Большинство приложений вынесено на встройку, чтобы минимизировать системную нагрузку.
Команда запуска:
./llama-server.exe -m "E:/0.Model_Vault/LLM/prism-ml/Ternary-Bonsai-27B-gguf/Ternary-Bonsai-27B-Q2_0.gguf" \
-fa on \
-b 2048 -ub 2048 \
--port 8080 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
-ngl 99 \
-c 262144 \
-np 1 \
--metrics \
--jinja --chat-template-file "E:\0.Model_Vault\chat_template.jinja" \
--slot-prompt-similarity 0.85 -dio --no-mmap
Спасибо! Благодаря твоему примеру быстрее написал форк для Beellama с поддержкой turbo3, kvarn и Dflash для Bonsai. Правда принятие токенов у стандартной головы qwen 3.6 27b в лучше случае 60 процентов, но в любом случае это дает 65 токенов на 5060 ti 16gb, при 262к
https://github.com/Andgihat/beellama.cpp -- Вот, если кому интересно. Только учитывайте, что Dflash пока не родной, работает не на всю мощь

Qwen 3.6 27b на 8-12gb vram в llama.cpp до 256к контекста