https://huggingface.co/Qwen/Qwen3.8-27B
Кратко:
Размер модели относительно небольшой, довольно быстро работает на карточках с 24+ GB VRAM.
"Понимает" изображения и видео
по некоторым бенчмаркам - лучше чем Opus 4.6
контекст: 262K, с помощью YARN можно увеличить до 1M

Так как большинство используют llama.cpp для запуска, то кванты можно взять вот тут:
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
Поддерживается MTP (спекулятивное предсказание)
Я тестировал на RTX 5090 (32GB VRAM).
Квант UD-Q6_K_XL:
помещается контекст только 48k
скорость генерации: 100 т/с
Квант UD-Q5_K_XL:
помещается контекст только 125k
скорость генерации: 120 т/с
Команда для запуска:
llama-server \ -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \ --host 0.0.0.0 --port 8080 \ --fit off --gpu-layers all --gpu-layers-draft all \ --ctx-size 48000 \ --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \ --spec-type draft-mtp
Если вы запускаете на RTX 3090 / RTX 4090 (24GB VRAM), то вам надо будет брать квант поменьше и / или квантовать контекст и / или частично выгружать в обычную память.
По личным ощущениям, качество модели очень хорошее, - модель стала заметно "умнее". Думаю, что на сегодня, это лучшая модель, которую с адекватной скоростью можно запустить у себя на компьютере.
В Docker можно запустить вот так:
services: llama: image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423 container_name: llama devices: - "nvidia.com/gpu=all" ports: - "8080:8080" environment: - NVIDIA_VISIBLE_DEVICES=all - NVIDIA_DRIVER_CAPABILITIES=compute,utility volumes: - ~/.cache:/root/.cache entrypoint: ["./llama-server"] command: > --host 0.0.0.0 --port 8080 --ctx-size 125000 --fit off --gpu-layers all --gpu-layers-draft all -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL --spec-type draft-mtp --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0

