Pull to refresh
0
Send message

За то, что скрестили Turbo Quant и призму — огромное спасибо! Сам давно привык к Turbo Quant.

Несколько вопросов по настройке:

  • Накатывали ли вы чат-шаблон (chat template)?

  • Проставляли ли какие-то параметры температуры и других аргументов при запуске?

Результаты по потреблению VRAM (на RTX 4090, стандартная prism.ml llama.cpp):

  • f16 (два кэша): ~21.4 ГБ VRAM для контекста 200.000 токенов.

  • q8 (два кэша): ~18.9 ГБ VRAM для контекста 262.144 токенов.

Системный базовый уровень: Windows 11 23H2 без фоновых задач «кушает» ~1.7 ГБ VRAM. Большинство приложений вынесено на встройку, чтобы минимизировать системную нагрузку.

Команда запуска:

./llama-server.exe -m "E:/0.Model_Vault/LLM/prism-ml/Ternary-Bonsai-27B-gguf/Ternary-Bonsai-27B-Q2_0.gguf" \
    -fa on \
    -b 2048 -ub 2048 \
    --port 8080 \
    --cache-type-k q8_0 \
    --cache-type-v q8_0 \
    -ngl 99 \
    -c 262144 \
    -np 1 \
    --metrics \
    --jinja --chat-template-file "E:\0.Model_Vault\chat_template.jinja" \
    --slot-prompt-similarity 0.85 -dio --no-mmap

Information

Rating
5,935-th
Registered
Activity