Pull to refresh
1
Send message

А по ощущениям - сильно лучше 27b, помимо скоростей?

Качество модели по идее должно быть лучше. Но я разницы не заметил, если честно :D. Сразу скажу, что я не программист, мои задачи просты: системное администрирование - настрой, установи; задачи связанные с таблицами - напиши скрипт на python - pandas. Кстати, Glimmer для этих задачи мне показался поприятнее - работает быстрее в плане размышлений и в плане ток/сек.

На windows система достаточно значительное количество VRAM резервирует, даже если подключить монитор к igpu процессора. На cachy os, используя beellama и сжатие kv кеша kvarn6 у меня получилось запустить модель в 5q без mtp на 24 ГБ vram

А как вы добились такой скорости на 12b? Я на 5060 ti 16 gb получил 20-30 ток/с: llama.cpp, скомпелированная из исходников, полностью загружена в VRAM

Не проще ли установить Cherry Studio - без заморочек с докером и всл? Статья мне была интересна, спасибо!

Information

Rating
4,919-th
Registered
Activity