За то, что скрестили Turbo Quant и призму — огромное спасибо! Сам давно привык к Turbo Quant.
Несколько вопросов по настройке:
Накатывали ли вы чат-шаблон (chat template)?
Проставляли ли какие-то параметры температуры и других аргументов при запуске?
Результаты по потреблению VRAM (на RTX 4090, стандартная prism.ml llama.cpp):
f16 (два кэша): ~21.4 ГБ VRAM для контекста 200.000 токенов.
q8 (два кэша): ~18.9 ГБ VRAM для контекста 262.144 токенов.
Системный базовый уровень: Windows 11 23H2 без фоновых задач «кушает» ~1.7 ГБ VRAM. Большинство приложений вынесено на встройку, чтобы минимизировать системную нагрузку.
За то, что скрестили Turbo Quant и призму — огромное спасибо! Сам давно привык к Turbo Quant.
Несколько вопросов по настройке:
Накатывали ли вы чат-шаблон (
chat template)?Проставляли ли какие-то параметры температуры и других аргументов при запуске?
Результаты по потреблению VRAM (на RTX 4090, стандартная
prism.mlllama.cpp):f16 (два кэша): ~21.4 ГБ VRAM для контекста 200.000 токенов.
q8 (два кэша): ~18.9 ГБ VRAM для контекста 262.144 токенов.
Команда запуска: