Pull to refresh
1
Send message

На коротком контексте - 40-50 ток, на длинном - 30 примерно.

В ЛС скинул

Попробуйте tabbyapi - там используется бэкэнд exllamav3 - qwen3.8 4bpw kv Q6 + mtp n=2 + vision на процессор и получите 200 тыс контекста. Если очень захотите, то можете запустить и 6bpw с q4 кешем при 120 тыс контекста без mtp - опробовано лично на 5060ti 16gb + 4060 8gb. Кванты exl3 - очень даже неплохие и память используется более эффективно, чем в llama.cpp. И я бы посоветовал использовать pi.dev - легче и настроить можно только необходимые функции.

Если заинтересует, то могу рассказать особенности с настройкой и скинуть свои прессеты в ЛС.

Здравствуйте! Планируются ли к выпуску небольшие плотные модели и разряженные?

Идея интересная, но запустить у меня не получилось - модель загружается в ОЗУ, vram примерно 300 мб занимает. Запускал на RTX 5060 ti 16 gb vram + rtx 4060 8gb, Cachy OS. Попробуйте опубликовать статью на сабреддите локаллама, я думаю там Вы найдете отклик.

А по ощущениям - сильно лучше 27b, помимо скоростей?

Качество модели по идее должно быть лучше. Но я разницы не заметил, если честно :D. Сразу скажу, что я не программист, мои задачи просты: системное администрирование - настрой, установи; задачи связанные с таблицами - напиши скрипт на python - pandas. Кстати, Glimmer для этих задачи мне показался поприятнее - работает быстрее в плане размышлений и в плане ток/сек.

На windows система достаточно значительное количество VRAM резервирует, даже если подключить монитор к igpu процессора. На cachy os, используя beellama и сжатие kv кеша kvarn6 у меня получилось запустить модель в 5q без mtp на 24 ГБ vram

А как вы добились такой скорости на 12b? Я на 5060 ti 16 gb получил 20-30 ток/с: llama.cpp, скомпелированная из исходников, полностью загружена в VRAM

Не проще ли установить Cherry Studio - без заморочек с докером и всл? Статья мне была интересна, спасибо!

Information

Rating
4,733-rd
Registered
Activity