Pull to refresh

Comments 24

Тс, как то много памяти для KV кеша у вас жрет эта модель. Я на rtx 5060 ti 16gb крутил эту модель Qwen3.6-27B-UD-IQ3_XXS с квантованным кешем q8 90к, вся модель с кешем влезла в VRAM и еще 380 мегабайт свободно осталось. Правда у меня монитор подключен к встройке, так что еще отсюда экономия. С MTP получалось 45-65 ток/сек. Вот и не пойму- вроде в кванте который вы описываете, учитывая сколько весят веса, там должно влезть 256к, да еще и место остаться и без турбокванта. Или я что-то не понимаю?

а вы попробуйте у себя выставить контекст 256к думаю будет большое потребление (самому интересно какое), всё же ваши 90 это почти в 3 раза меньше

... там должно влезть 256к, да еще и место остаться и без турбокванта. Или я что-то не понимаю?


У меня на тестах в 16GB VRAM на RTX A5000 влезло 129К контекста,
а больше: out of memory.

Но, кстати, модели довольно умные.
По моим внутренним 80 тестам лажанулись всего на 6,
да и то при исправленном промпте прошли все 80.
Я заменил свою старую модель на Ternary-Bonsai-27B.

Ну я к тому что и квант кеша у меня 8, у вас то явно мельче квант,

ну у турбокванта почти в 5 раз меньше размер, а у вас в 2 раза из за q8 и ещё дополнительно в 3 раза меньше из за 90к

p.s. сейчас проверил при 90к у меня потребление 10gb + 3gb-win11 (на 2 битной модели) + у меня замеры с mmproj (для распознавания изображений)

p.s.s. 90к без mmproj потребление 9gb +3gb-win11 (на 2 битной модели)

Ok, теперь таки математика сходится. Спасибо!

А смысл, эти модели сами по себе туповатые, Q1 сваливается в loop, на сложной задаче, Q2 немного умнее но тоже тупит и не может исправить ошибки в созданном коде.

Я тоже не понимаю на каких задачах автор тестирует качество и достигает 90-95%... Примеров нет, так что это просто слова. Бумага все стерпит)))

я серьёзных тестов не делал, просто просил сделать html портфолио и за первый ответ там была 1 ошибка, на второй оно исправило её, так что может, хоть и сложность была не большая
p.s. специально сделал ещё раз тесты на моих основных локальных моделях, да промпт не самый показательный но вы можете и сами это сделать лучше..
p.s.s. все тесты через обычный чат llama.cpp (server)

Эх, вот бы 4B-версию иметь с хорошим сжатием...

И чтобы умная была как Клод опус

Эта модель на 3090 влезает в кванте 4. Было бы интересно выпихнуть что-то по мощнее, чем и так уже впихнулось :-)

27b и q5 квант влазит, проблема в том что модели лучше уже значительно больше и требуют 400+gb ram/vram

Смотрел тест этих моделей, там они максимум 50% показали

Этот аттракцион извращения осталось догнать до полбита квантования, и с радостным гиканьем запускать на пульте от микроволновки - смотрите, работает!

Появилась новая группа странных людей с потребительским барахлом, которые всеми силами хотят закатиться в ИИ несмотря ни на что.

Но ведь с практической действительностью все эти потуги не имеют ничего общего.

95% точности в промышленных вещах - это фатальный писец.

А на поговорить ведь достаточно и гигачата

А какую точность, как вы выразились, даёт любая фронтир модель?

Как говорят в /ai/

Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до 8 5 4 3 2 0,58 бит, на кофеварке с подкачкой на микроволновку.

Хобби и домашних животных тоже осудить и запретить? Или только с железками ковыряться взрослому человеку должно быть зазорно?

За то, что скрестили Turbo Quant и призму — огромное спасибо! Сам давно привык к Turbo Quant.

Несколько вопросов по настройке:

  • Накатывали ли вы чат-шаблон (chat template)?

  • Проставляли ли какие-то параметры температуры и других аргументов при запуске?

Результаты по потреблению VRAM (на RTX 4090, стандартная prism.ml llama.cpp):

  • f16 (два кэша): ~21.4 ГБ VRAM для контекста 200.000 токенов.

  • q8 (два кэша): ~18.9 ГБ VRAM для контекста 262.144 токенов.

Системный базовый уровень: Windows 11 23H2 без фоновых задач «кушает» ~1.7 ГБ VRAM. Большинство приложений вынесено на встройку, чтобы минимизировать системную нагрузку.

Команда запуска:

./llama-server.exe -m "E:/0.Model_Vault/LLM/prism-ml/Ternary-Bonsai-27B-gguf/Ternary-Bonsai-27B-Q2_0.gguf" \
    -fa on \
    -b 2048 -ub 2048 \
    --port 8080 \
    --cache-type-k q8_0 \
    --cache-type-v q8_0 \
    -ngl 99 \
    -c 262144 \
    -np 1 \
    --metrics \
    --jinja --chat-template-file "E:\0.Model_Vault\chat_template.jinja" \
    --slot-prompt-similarity 0.85 -dio --no-mmap

chat template пробовал, но разницы не заметил и даже не знаю нужен ли он этой модели по хорошему (не собираюсь использовать её в всяких cli, только чат)

параметры температуры и других аргументов при запуске не выставлял, но в редми модели такие рекомендации

Скрытый текст

Спасибо! Благодаря твоему примеру быстрее написал форк для Beellama с поддержкой turbo3, kvarn и Dflash для Bonsai. Правда принятие токенов у стандартной головы qwen 3.6 27b в лучше случае 60 процентов, но в любом случае это дает 65 токенов на 5060 ti 16gb, при 262к

https://github.com/Andgihat/beellama.cpp -- Вот, если кому интересно. Только учитывайте, что Dflash пока не родной, работает не на всю мощь

Sign up to leave a comment.

Articles