https://huggingface.co/Qwen/Qwen3.8-27B

Кратко:

  • Размер модели относительно небольшой, довольно быстро работает на карточках с 24+ GB VRAM.

  • "Понимает" изображения и видео

  • по некоторым бенчмаркам - лучше чем Opus 4.6

  • контекст: 262K, с помощью YARN можно увеличить до 1M

Так как большинство используют llama.cpp для запуска, то кванты можно взять вот тут:

https://huggingface.co/unsloth/Qwen3.8-27B-GGUF

Поддерживается MTP (спекулятивное предсказание)

Я тестировал на RTX 5090 (32GB VRAM).

Квант UD-Q6_K_XL:

  • помещается контекст только 48k

  • скорость генерации: 100 т/с

Квант UD-Q5_K_XL:

  • помещается контекст только 125k

  • скорость генерации: 120 т/с

Команда для запуска:

llama-server \
 -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \
 --host 0.0.0.0  --port 8080 \
 --fit off --gpu-layers all --gpu-layers-draft all \
 --ctx-size 48000 \
 --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \
 --spec-type draft-mtp

Если вы запускаете на RTX 3090 / RTX 4090 (24GB VRAM), то вам надо будет брать квант поменьше и / или квантовать контекст и / или частично выгружать в обычную память.

По личным ощущениям, качество модели очень хорошее, - модель стала заметно "умнее". Думаю, что на сегодня, это лучшая модель, которую с адекватной скоростью можно запустить у себя на компьютере.

В Docker можно запустить вот так:

services:
  llama:
    image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423
    container_name: llama
    devices:
      - "nvidia.com/gpu=all"
    ports:
      - "8080:8080"
    environment:
      - NVIDIA_VISIBLE_DEVICES=all
      - NVIDIA_DRIVER_CAPABILITIES=compute,utility
    volumes:
      - ~/.cache:/root/.cache
    entrypoint: ["./llama-server"]
    command: >
      --host 0.0.0.0  --port 8080
      --ctx-size 125000
      --fit off --gpu-layers all --gpu-layers-draft all
      -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL
      --spec-type draft-mtp
      --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0