https://huggingface.co/Qwen/Qwen3.8-27B
Кратко:
Размер модели относительно небольшой, довольно быстро работает на карточках с 24+ GB VRAM.
"Понимает" изображения и видео
по некоторым бенчмаркам - лучше чем Opus 4.6
контекст: 262K, с помощью YARN можно увеличить до 1M

Так как большинство используют llama.cpp для запуска, то кванты можно взять вот тут:
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
Поддерживается MTP (спекулятивное предсказание)
Я тестировал на RTX 5090 (32GB VRAM).
Квант UD-Q6_K_XL:
помещается контекст только 48k
скорость генерации: 100 т/с
Квант UD-Q5_K_XL:
помещается контекст только 125k
скорость генерации: 120 т/с
Команда для запуска:
llama-server \ -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \ --host 0.0.0.0 --port 8080 \ --fit off --gpu-layers all --gpu-layers-draft all \ --ctx-size 48000 \ --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \ --spec-type draft-mtp
Если вы запускаете на RTX 3090 / RTX 4090 (24GB VRAM), то вам надо будет брать квант поменьше и / или квантовать контекст и / или частично выгружать в обычную память.
Вот тут выложили специальный квант для запуска на карточках с 16GB VRAM:
https://huggingface.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF
Я этот квант не пробовал. Если кто попробует - отпишитесь к комментариях.
Что можно сделать, чтобы поместить побольше контекста на GPU?
квантизировать KV cache: --cache-type-k, --cache-type-v
Народ пишет что это может делать модель "тупее", особенно в кодинге. Я не пробовал.не использовать MTP
Если убрать опцию –-spec-type draft-mtp, то при кванте UD-Q5_K_XL, помещается на 46k больше контекста.
При этом скорость генерации токенов становится в ~2 раза медленнее.не использовать слой для работы с изображением. Его можно вообще не грузить: --no-mmproj, или грузить в обычную память вместо VRAM: --no-mmproj-offload.
При кванте UD-Q5_K_XL, помещается на 19k больше контекста.
В обычной памяти обработка изображений в 5 раз медленнее на процессоре с 16 ядрами и в 10 раз медленнее на процессоре в 8 ядрами. На скорость работы с текстом эти опции не влияют, - только на работу с изображениями. Например запрос с одним изображением обрабатывается 13 секунд на GPU, но 76 секунд на 16-ядерном AMD 9950x3d.
На RTX 5090 (32GB VRAM), при кванте UD-Q5_K_XL, без слоя для работы с изображениям, без MTP, помещается контекст 190k.
По личным ощущениям, качество модели очень хорошее, - модель стала заметно "умнее". Думаю, что на сегодня, это лучшая модель, которую с адекватной скоростью можно запустить у себя на компьютере.
В Docker можно запустить вот так:
services: llama: image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423 container_name: llama devices: - "nvidia.com/gpu=all" ports: - "8080:8080" environment: - NVIDIA_VISIBLE_DEVICES=all - NVIDIA_DRIVER_CAPABILITIES=compute,utility volumes: - ~/.cache:/root/.cache entrypoint: ["./llama-server"] command: > --host 0.0.0.0 --port 8080 --ctx-size 125000 --fit off --gpu-layers all --gpu-layers-draft all -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL --spec-type draft-mtp --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0
Цена
Интересно, что у самой Qwen это модель пока недоступна по API:
https://modelstudio.console.alibabacloud.com/ap-southeast-1
OpenRouter предлагает эту модель по довольно немаленькой цене: $0.45 / $3.20 per 1M:
https://openrouter.ai/qwen/qwen3.8-27b

