Комментарии 21
Интересно, но хотелось бы поглядеть на тесты против других моделей (хотя бы того же Gemini, старого 3.1 Pro и нового Flash 3.7). И в статье нет ничего про то, на какой карточке гоняете, и каковы очки на конкретных задачах (кодинг, документы, иное).
добрый день,
сейчас в тесте RTX PRO 6000 от Селектел, актуальный бенчмарк на ней.
Gemini в личных целях почти не использую, но записал запрос :)
две DGX Spark, ~700 тысяч рублей
А интернет говорит что одна DGX Spark ~700 тысяч рублей :)
Писать чекпойнт, пойнт так же безграмотно, как андройд.
А ещё локальный Qwen3.8-27B может работать с изображениями, а локальный DeepSeek не может. Не знаю, как там по API.
не нашел что за карта использовалась. У меня ollama на 3090 дает 47-50 tps.
У меня тоже 3090 , но такого TPS я не достиг, подскажите какой движок используете (llama.cpp, vlm , ...) если можно ссылку на hf модели (gguf же?) , там и квант будет понятен и чей форк (unsloth?) или lmstudio-community ? И главное параметры запуска(загрузки) какие?
в ollama одна доступная модель прям в их каталоге.
ollama show --modelfile qwen3.8:27b
Modelfile generated by “ollama show”
To build a new Modelfile based on this, replace FROM with:
FROM qwen3.8:27b
FROM /usr/share/ollama/.ollama/models/blobs/sha256-f5f1dd8920d417aac2718b0bda3403da274301efdd6760b4f0f4b864ff2ad57d FROM /usr/share/ollama/.ollama/models/blobs/sha256-ac3714bfdddeca31351f2752bf1a63f266f4df87c0b68c895e44945ca704448e TEMPLATE {{ .Prompt }} RENDERER qwen3.8 PARSER qwen3.5 PARAMETER repeat_penalty 1 PARAMETER temperature 1 PARAMETER top_k 20 PARAMETER top_p 0.95 PARAMETER draft_num_predict 4 PARAMETER min_p 0 PARAMETER presence_penalty 0
Дуал 2080ti с nvlink даёт до 100т/с на qwen 27b в q8. Контекст близкий к максимальному. Учитывая цену, сейчас это топ комплект для плотного квена. За последние 2 недели цены выросли % на 30. Чуть дешевле пара 3070м на 16гб, но скорость +-35 т/с в однопотоке, двухпоток 2х скорости.
А какой софтиной гоняете?
GitHub - weicj/vLLM-2080Ti-Definitive: The definitive vLLM runtime for dual RTX 2080 Ti 22GB + NVLink, delivering Qwen 27B local inference with maximum 100+ tok/s single-request decode with support of FP8 weight ( Join Discord :https://discord.gg/VFqVVySdMS ) · GitHub https://share.google/Z6OXHSUeH144wFZt7
17.08 появилось независимое сравнение в общем бенче https://artificialanalysis.ai . По возможностям сравнимо с DeepSeek V4 Flash 0731 52 vs 52.
На 4х CMP 170hx можно запустить flash с контекстом 1 млн. Где-то сейчас 500к будет за карты. 100 токенов на декод
стек 200 гб оперативы + 3090, можно будет запустить?

Qwen3.8-27B на своей карте против 304B по API