Так же насколько я видел в QAT это дело стало сильно лучше. В целом у меня qat версия 26B q4 с контекстом в 128к умещается в 20Гб vram и это на 7900хтх, vulcan, допускаю что на cuda было бы лучше.
Спасибо, интересно. Не увидел параметров запуска для моделлей, а это интересно. Для Gemma - ни в коем случае нельзя использовать квантование кэша ни в каком виде, иначе деградация идёт очень силтная, в отличии от qwen - где-то мелькала картинка с тестами, возможно поэтому она и провалила тест на контекст.
Можно и полностью бесплатно через OpenCode, только у них зарегиться в zen по мылу и готово...
Вот тут есть ссылка на источник:
https://www.reddit.com/r/LocalLLaMA/comments/1suh3sz/gemma_4_and_qwen_36_with_q8_0_and_q4_0_kv_cache/
Так же насколько я видел в QAT это дело стало сильно лучше. В целом у меня qat версия 26B q4 с контекстом в 128к умещается в 20Гб vram и это на 7900хтх, vulcan, допускаю что на cuda было бы лучше.
Спасибо, интересно. Не увидел параметров запуска для моделлей, а это интересно. Для Gemma - ни в коем случае нельзя использовать квантование кэша ни в каком виде, иначе деградация идёт очень силтная, в отличии от qwen - где-то мелькала картинка с тестами, возможно поэтому она и провалила тест на контекст.