Обновить
1
MrYuiryMr@MrYuiryMr

Пользователь

Отправить сообщение

Можете попробовать Gemma 4 26B (Версию APEX I-Compact от mudler). У меня в LM Studio, на ноутбучной RTX 3050 4Гб, выходит на 10-12 т/сек при контексте в 100к.

https://github.com/mudler/apex-quant а вот тут ребята считают что в модели можно сжать середину, оставив края менее квантоваными.

Информация

В рейтинге
4 763-й
Зарегистрирован
Активность

Специализация

Десктоп разработчик
Средний