User
Можете попробовать Gemma 4 26B (Версию APEX I-Compact от mudler). У меня в LM Studio, на ноутбучной RTX 3050 4Гб, выходит на 10-12 т/сек при контексте в 100к.
https://github.com/mudler/apex-quant а вот тут ребята считают что в модели можно сжать середину, оставив края менее квантоваными.
Можете попробовать Gemma 4 26B (Версию APEX I-Compact от mudler). У меня в LM Studio, на ноутбучной RTX 3050 4Гб, выходит на 10-12 т/сек при контексте в 100к.
https://github.com/mudler/apex-quant а вот тут ребята считают что в модели можно сжать середину, оставив края менее квантоваными.