Меня зовут Алексей, я инженер по разработке ПО искусственного интеллекта в YADRO. В ходе статьи я получу подробные ответы на эти вопросы, а помогут в этом YADRO G4208P G3 — производительные серверы для задач ИИ, машинного обучения и глубокой аналитики. В один такой сервер я установлю четыре RTX PRO 6000, в другой — восемь H100 NVL. Оценивать буду на моделях различного размера и архитектуры: Qwen3.6-27B (dense), Qwen3.6-35B-A3B (MoE) в форматах FP8 и NVFP4, а также DeepSeek-V4-Flash в форматах Mixed FP4 и NVFP4. Использую vLLM в сценариях offline и server — vLLM 0.23.0 для Qwen, vLLM 0.26 для DeepSeek-V4-Flash — а также Docker-image на основе nvidia/cuda:13.2.0-cudnndevel-ubuntu22.04.

Конфигурация серверов и тестов
Модель сервера | G4208P G3 | |
CPU | 2 x Intel Xeon Gold 6542Y (24 ядра) | 2 x Intel Xeon Gold 6430 (32 ядра) |
GPU | 4 x NVIDIA RTX PRO 6000 Blackwell Server Edition (96 ГБ) | 8 x NVIDIA H100 NVL (94 ГБ) |
RAM | 1536 ГБ (24 x 64 ГБ) | 2048 GB (32 x 64 ГБ) |
SSD | 47 ТБ SATA SSD (3 шт.) | 8,2 ТБ SATA SSD (2 шт.) |
Версия Cuda | 13.2 | |
Версия драйверов | 595.71.05 | |
Точные конфигурации запуска моделей:
4 x Qwen3.6-35B-A3B-FP8 | 4 x Qwen3.6-35B-A3B-NVFP4 | 4 x Qwen3.6-27B-FP8 | 4 x Qwen3.6-27B-NVFP4 | 1 x DeepSeek-V4-Flash | 1 x DeepSeek-V4-Flash-NVFP4 |
--tp 1 | --tp 1 --quantization modelopt_fp4 | --tp 1 | --tp 1 --quantization modelopt_fp4 | --tp 2 | --tp 2 |
Всего получилось четыре инстанса Qwen и один инстанс DeepSeek-V4-Flash. Запускать буду в режиме multi-instance: поднимать несколько копий модели и объединять их интерфейсы через перенаправление запросов nginx.
Датасеты для тестирования
Тестировать модели буду через синтетические профили нагрузки — prefill-heavy, decode-heavy и balanced — соответствующие трем стандартным сценариям в реальной работе.
Датасет | Размерности | Пример задачи |
Prefill-heavy-нагрузки (большой input, короткий output) | input: 31k output: 1k | Саммаризация длинного документа (договор, статья). RAG-ответ по большому контексту |
Decode-heavy-нагрузки (короткий input, большой output) | input: 100 output: 10k | Генерация статьи/поста по краткому ТЗ, написание кода или тестов по описанию функции |
Balanced-нагрузки (input и output приблизительно равны) | input: 2500 output: 2000 | Перевод текста, рерайтинг, рефакторинг фрагмента кода |
Суммарное количество запросов определил из расчета 100 запросов на инстанс модели: получилось четыре инстанса (400 запросов на тест) для Qwen, и один инстанс (100 запросов на тест) для DeepSeek-V4-Flash. При сравнении буду запускать равное число ускорителей в каждом сервере: 4 на 4 — для моделей Qwen, 2 на 2 — для DeepSeek-V4-Flash.
FP8 vs NVFP4: оцениваем качество и производительность
Ключевая особенность RTX PRO 6000 Blackwell Server Edition — это аппаратная поддержка NVFP4, четырехбитного формата весов с двухуровневым масштабированием. NVFP4 предусматривает масштабирующий коэффициент в FP8 на каждый блок из 16 элементов и общий множитель в FP32 на тензор. За счет этого при небольшой потере качества объем весов относительно FP8 сокращается вдвое.
Что это дает на практике? Чтобы оценить это, возьму несколько моделей в NVFP4 и сравню их с версиями тех же моделей в базовом варианте, то есть FP8 или Mixed FP4 (DeepSeek-V4-Flash).
Оценка качества
Для оценки точности использовался инструмент sgl-eval на наборе данных AIMO-2025 — задачах олимпиадного уровня по математике. На этот инструмент есть ссылка в официальных cookbook sglang. Параметры запуска sgl-eval для Qwen взяты со страницы NVIDIA, для DeepSeek — из cookbook sglang:
Параметр | Qwen3.6-35B-A3B или Qwen3.6-27B | DeepSeek-V4-Flash |
temperature | 1.0 | 1.0 |
top-p | 0.95 | 1.0 |
n-repeats | 16 | 16 |
max_num_tokens | 81920 | 200000 |
Всего в датасете 30 тестов, accuracy определяется как среднее значение за 16 запусков. На H100 NVL запускали модели Qwen3.6-35B-A3B (FP8) и DeepSeek-V4-Flash (Mixed FP4). На RTX PRO 6000 BSE — Qwen3.6-35B-A3B и DeepSeek-V4-Flash в NVFP4-формате.
Модель | Базовое квантование (H100 NVL), accuracy | NVFP4-квантование (RTX PRO 6000 BSE), accuracy |
Qwen3.6-35B-A3B | 0,89 (FP8) | 0.89 |
Qwen3.6-27B | 0,92 (FP8) | 0,92 |
DeepSeek-V4-Flash | 0.96 (Mixed FP4) | 0.96 |
Как можно видеть из таблицы, переход на NVFP4 квантизацию не снижает точность вплоть до второго знака в округлении на датасете AIME-2025.
Оценка производительности
Здесь мы оцениваем работу по метрике e2e, модели и условия запуска не меняются.
Датасет Random_100:10k, server-сценарий

Здесь и далее mc — это max_concurrency.
mc | 4 x Qwen3.6-35B-A3B tp1 | 4 x Qwen3.6-27B tp1 | 1 x DeepSeek-V4-Flash tp2 | ||||||
NVFP4, e2e, мс | FP8, e2e, мс | Ratio (FP8 / NVFP4) | NVFP4, e2e, мс | FP8, e2e, мс | Ratio (FP8 / NVFP4) | NVFP4, e2e, мс | Mixed FP4, e2e, мс | Ratio (Mixed FP4 / NVFP4) | |
4 | 42996.7 | 49099.76 | 1.14 | 151918.4 | 217621.6 | 1.43 | 142227.5 | 149080.1 | 1.05 |
8 | 54666.1 | 63646.17 | 1.16 | 165955.6 | 233837.5 | 1.41 | 189829.7 | 204996 | 1.08 |
16 | 60842.5 | 75939.89 | 1.25 | 174028.5 | 243080 | 1.40 | 271955.2 | 304781 | 1.12 |
32 | 79886.23 | 103388.7 | 1.29 | 175124.6 | 249607 | 1.43 | 415937.2 | 460386.1 | 1.11 |
64 | 107890.1 | 143200.6 | 1.33 | 201771.7 | 284951.3 | 1.41 | 563915.9 | 616786.4 | 1.09 |
Датасет Random_2500:2000, server-сценарий

mc | 4 x Qwen3.6-35B-A3B tp1 | 4 x Qwen3.6-27B tp1 | 1 x DeepSeek-V4-Flash tp2 | ||||||
NVFP4, e2e, мс | FP8, e2e, мс | Ratio (FP8 / NVFP4) | NVFP4, e2e, мс | FP8, e2e, мс | Ratio (FP8 / NVFP4) | NVFP4, e2e, мс | Mixed FP4, e2e, мс | Ratio (Mixed FP4 / NVFP4) | |
4 | 9118.844 | 9889.743 | 1.08 | 30787.73 | 44120.36 | 1.43 | 29471.86 | 32180.53 | 1.09 |
8 | 11084.92 | 12841.08 | 1.16 | 33937.4 | 47199.68 | 1.39 | 39936.42 | 43054.13 | 1.08 |
16 | 12399.95 | 15348.66 | 1.24 | 36043.22 | 49483.8 | 1.37 | 62212.48 | 64688.2 | 1.04 |
32 | 16158.93 | 20746.49 | 1.28 | 37357.63 | 50746.23 | 1.36 | 95124.49 | 104050.3 | 1.09 |
64 | 21711.7 | 28554.98 | 1.32 | 44833.97 | 58633.14 | 1.31 | 113055.5 | 121603.5 | 1.08 |
Датасет Random_31k:1k, server-сценарий

mc | 4xQwen3.6-35B-A3B tp1 | 4xQwen3.6-27B tp1 | 1xDeepSeek-V4-Flash tp2 | ||||||
NVFP4, e2e, мс | FP8, e2e, мс | Ratio (FP8 / NVFP4) | NVFP4, e2e, мс | FP8, e2e, мс | Ratio (FP8 / NVFP4) | NVFP4, e2e, мс | Mixed FP4, e2e, мс | Ratio (Mixed FP4 / NVFP4) | |
4 | 6479.866 | 7018.598 | 1.08 | 21909.22 | 27771.54 | 1.27 | 23699,57 | 25284.28 | 1.07 |
8 | 8611.092 | 9344.681 | 1.09 | 29312.12 | 33869.31 | 1.16 | 36812,42 | 39649.21 | 1.08 |
16 | 11959.56 | 13131.24 | 1.10 | 42174.75 | 44805.2 | 1.06 | 65992,7 | 67609.51 | 1.02 |
32 | 19216.36 | 21066.03 | 1.10 | 66391.39 | 64625.95 | 0.97 | 123502,8 | 118639.8 | 0.96 |
64 | 32846.6 | 35337.48 | 1.08 | 118024.3 | 108260.2 | 0.92 | 206549,6 | 217625.5 | 1.05 |
Точность у моделей в базовой и NVFP4-квантизации совпадает до сотых. На decode-heavy и balanced нагрузках модели в NVFP4 показывают лучшую производительность, чем в базовой квантизации: до 43% у Dense модели Qwen3.6-27B и до 33% у MoE-модели Qwen3.6-35B-A3B. На prefill-heavy нагрузках переход на NVFP4 квантизацию не дает большого эффекта.
RTX PRO 6000 BSE vs H100 NVL: сравниваем Perf/$ в server- и offline-сценариях
По спецификации H100 NVL гораздо мощнее RTX PRO 6000 BSE: и по производительности тензорных ядер в FP8 — 3341 против 2000 TFLOPS, и по пропускной способности памяти — 3900 против 1597 ГБ/с. Поэтому разумно сравнить карты по экономической эффективности.
В дальнейших расчетах я буду исходить из того, что H100 NVL дороже RTX PRO 6000 BSE в 1,5 раза. Это примерно соответствует ситуации на рынке в августе 2026 года. Совокупная стоимость серверной конфигурации в дальнейших расчетах не учитывается — только цены GPU.
Экономическую эффективность буду рассчитывать по метрике perf/$. Формула для server-сценария:
Perf/$ = 1,5 / (E2E RTX PRO 6000 BSE / E2E H100 NVL)
Для offline-сценария:
Perf/$ = 1,5 / (Throughput H100 NVL / Throughput RTX PRO 6000 BSE)
Ratio(Perf) больше 1 означает победу RTX PRO 6000 над H100 NVL. Сравнение мы проведем на моделях различного размера и архитектуры (dense и MoE).
Датасет Random_100:10k, server-сценарий

Модели в FP8-квантизации (RTX — NVIDIA RTX PRO 6000 Blackwell Server Edition, H100 — NVIDIA H100 NVL):
mc | Qwen3.6-35B-A3B-FP8 | Qwen3.6-27B-FP8 | DeepSeek-V4-Flash (mixed FP4) | |||||||||
RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | |
4 | 49099.76 | 50551.06 | 0.97 | 1.54 | 217621.6 | 122167.8 | 1.78 | 0.84 | 149080.1 | 117197.1 | 1.27 | 1.18 |
8 | 63646.17 | 53728.81 | 1.18 | 1.27 | 233837.5 | 124696.9 | 1.88 | 0.80 | 204996 | 147843.9 | 1.39 | 1.08 |
16 | 75939.89 | 60243.89 | 1.26 | 1.19 | 243080 | 129949 | 1.87 | 0.80 | 304781 | 204205.6 | 1.49 | 1.01 |
32 | 103388.7 | 73595.91 | 1.40 | 1.07 | 249607 | 142559 | 1.75 | 0.86 | 460386.1 | 301312.3 | 1.53 | 0.98 |
64 | 143200.6 | 98139.8 | 1.46 | 1.03 | 284951.3 | 164483.4 | 1.73 | 0.87 | 616786.4 | 375208.9 | 1.64 | 0.91 |
Модели в NVFP4-квантизации:
mc | Qwen3.6-35B-A3B | Qwen3.6-27B | DeepSeek-V4-Flash | |||||||||
RTX , e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX , e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | |
4 | 42996.7 | 50551.06 | 0.85 | 1.76 | 151918.4 | 122167.8 | 1.24 | 1.21 | 142227.5 | 117197.1 | 1.21 | 1.24 |
8 | 54666.1 | 53728.81 | 1.02 | 1.47 | 165955.6 | 124696.9 | 1.33 | 1.13 | 189829.7 | 147843.9 | 1.28 | 1.17 |
16 | 60842.5 | 60243.89 | 1.01 | 1.49 | 174028.5 | 129949 | 1.34 | 1.12 | 271955.2 | 204205.6 | 1.33 | 1.13 |
32 | 79886.23 | 73595.91 | 1.09 | 1.38 | 175124.6 | 142559 | 1.23 | 1.22 | 415937.2 | 301312.3 | 1.38 | 1.09 |
64 | 107890.1 | 98139.8 | 1.10 | 1.36 | 201771.7 | 164483.4 | 1.23 | 1.22 | 563915.9 | 375208.9 | 1.50 | 1.00 |
Что видно на decode-heavy-нагрузке:
RTX Pro 6000 BSE показывает наибольшее преимущество по экономической эффективности на модели Qwen-35B-A3B-NVFP4. Средний выигрыш составляет 49%.
Наименьшую эффективность на RTX Pro 6000 BSE мы можем наблюдать на dense-модели Qwen-27B-FP8, в этом случае преимущество на стороне H100 NVL.
С увеличением количества одновременных запросов ускорители по экономической эффективности сближаются.
Датасет Random_2500:2000, server-сценарий

Модели в FP8-квантизации:
mc | Qwen3.6-35B-A3B-FP8 | Qwen3.6-27B-FP8 | DeepSeek-V4-Flash(mixed FP4) | |||||||||
RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | |
4 | 9889.743 | 10211.38 | 0.97 | 1.55 | 44120.36 | 24525.28 | 1.80 | 0.83 | 32180.53 | 25045.78 | 1.28 | 1.17 |
8 | 12841.08 | 10920.74 | 1.18 | 1.28 | 47199.68 | 25140.06 | 1.88 | 0.80 | 43054.13 | 32032.72 | 1.34 | 1.12 |
16 | 15348.66 | 12143.71 | 1.26 | 1.19 | 49483.8 | 26477.51 | 1.87 | 0.80 | 64688.2 | 40148.86 | 1.61 | 0.93 |
32 | 20746.49 | 14899.61 | 1.39 | 1.08 | 50746.23 | 29370.65 | 1.73 | 0.87 | 104050.3 | 63469.13 | 1.64 | 0.91 |
64 | 28554.98 | 19945.19 | 1.43 | 1.05 | 58633.14 | 34381.51 | 1.71 | 0.88 | 121603.5 | 82279.1 | 1.48 | 1.01 |
Модели в NVFP4-квантизации:
mc | Qwen3.6-35B-A3B | Qwen3.6-27B | DeepSeek-V4-Flash | |||||||||
RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | |
4 | 9118.844 | 10237.38 | 0.89 | 1.68 | 30787.73 | 24525.28 | 1.26 | 1.19 | 29471.86 | 25045.78 | 1.18 | 1.27 |
8 | 11084.92 | 10950.28 | 1.01 | 1.48 | 33937.4 | 25140.06 | 1.35 | 1.11 | 39936.42 | 32032.72 | 1.25 | 1.20 |
16 | 12399.95 | 12138.62 | 1.02 | 1.47 | 36043.22 | 26477.51 | 1.36 | 1.10 | 62212.48 | 40148.86 | 1.55 | 0.97 |
32 | 16158.93 | 14923.96 | 1.08 | 1.39 | 37357.63 | 29370.65 | 1.27 | 1.18 | 95124.49 | 63469.13 | 1.50 | 1.00 |
64 | 21711.7 | 19964.99 | 1.09 | 1.38 | 44833.97 | 34381.51 | 1.30 | 1.15 | 113055.5 | 82279.1 | 1.37 | 1.09 |
Что видно на balanced-нагрузке:
В целом ситуация аналогична случае decode-heavy-нагрузке.
Незначительное увеличение сравнительной экономической эффективности для H100 NVL.
Датасет Random_31k:1k, server сценарий

Модели в FP8-квантизации:
mc | Qwen3.6-35B-A3B-FP8 | Qwen3.6-27B-FP8 | DeepSeek-V4-Flash (mixed FP4) | |||||||||
RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | |
4 | 7018.598 | 6323.499 | 1.11 | 1.35 | 27771.54 | 16157.7 | 1.72 | 0.87 | 25284.28 | 23166.4 | 1.09 | 1.37 |
8 | 9344.681 | 7523.869 | 1.24 | 1.21 | 33869.31 | 20126.29 | 1.68 | 0.89 | 39649.21 | 34039.09 | 1.16 | 1.29 |
16 | 13131.24 | 9975.562 | 1.32 | 1.14 | 44805.2 | 28193.58 | 1.59 | 0.94 | 67609.51 | 64791.47 | 1.04 | 1.44 |
32 | 21066.03 | 14847.25 | 1.42 | 1.06 | 64625.95 | 44315.45 | 1.46 | 1.03 | 118639.8 | 105781.1 | 1.12 | 1.34 |
64 | 35337.48 | 24843.52 | 1.42 | 1.05 | 108260.2 | 75921.71 | 1.43 | 1.05 | 217625.5 | 193949.6 | 1.12 | 1.34 |
Модели в NVFP4-квантизации:
mc | Qwen3.6-35B-A3B | Qwen3.6-27B | DeepSeek-V4-Flash | |||||||||
RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | RTX, e2e, мс | H100, e2e, мс | Ratio, Perf | Ratio, Perf/$ | |
4 | 6479.866 | 6323.499 | 1.02 | 1.46 | 21909.22 | 16157.7 | 1.36 | 1.11 | 23699.57 | 23166.44 | 1.02 | 1.47 |
8 | 8611.092 | 7523.869 | 1.14 | 1.31 | 29312.12 | 20126.29 | 1.46 | 1.03 | 36812.42 | 34039.09 | 1.08 | 1.39 |
16 | 11959.56 | 9975.562 | 1.20 | 1.25 | 42174.75 | 28193.58 | 1.50 | 1.00 | 65992.7 | 64791.47 | 1.02 | 1.47 |
32 | 19216.36 | 14847.25 | 1.29 | 1.16 | 66391.39 | 44315.45 | 1.50 | 1.00 | 123502.8 | 105781.1 | 1.17 | 1.28 |
64 | 32846.6 | 24843.52 | 1.32 | 1.13 | 118024.3 | 75921.71 | 1.55 | 0.96 | 206549.6 | 193949.6 | 1.06 | 1.41 |
На prefill-heavy-нагрузке:
RTX Pro 6000 BSE больше всего выигрывает по экономической эффективности на модели DeepSeek-V4-Flash-NVFP4. Средний выигрыш составляет 40% и сохраняется с увеличением числа одновременных запросов
Наименьшая экономическая эффективность RTX Pro 6000 BSE — на dense-модели Qwen-27B-FP8, и здесь преимущество на стороне H100 NVL.
С увеличением количества одновременных запросов показатель экономической эффективности стремится к единице за исключением DeepSeek-V4-Flash.
Все датасеты, offline-сценарий

Модели в FP8-квантизации:
Датасет | Qwen3.6-35B-A3B-FP8 | Qwen3.6-27B-FP8 | DeepSeek-V4-Flash (mixed FP4) | |||||||||
RTX, throughput | H100, throughput | Ratio, Perf | Ratio, Perf/$ | RTX, throughput | H100, throughput | Ratio, Perf | Ratio, Perf/$ | RTX, throughput | H100, throughput | Ratio, Perf | Ratio, Perf/$ | |
Random_100:10k | 9083.145 | 15215.58 | 1.68 | 0.90 | 4773.762 | 7640.248 | 1.60 | 0.94 | 1430.271 | 2013.284 | 1.41 | 1.07 |
Random_2500:2000 | 12892.732 | 22443.08 | 1.74 | 0.86 | 5018.657 | 7736.785 | 1.54 | 0.97 | 922.219 | 1250.285 | 1.36 | 1.11 |
Random_31k:1k | 1553.678 | 2856.85 | 1.84 | 0.82 | 556.556 | 863.903 | 1.55 | 0.97 | 189.572 | 304.171 | 1.12 | 1.34 |
Модели в NVFP4-квантизации:
Датасет | Qwen3.6-35B-A3B | Qwen3.6-27B | DeepSeek-V4-Flash | |||||||||
RTX, throughput | H100, throughput | Ratio, Perf | Ratio, Perf/$ | RTX, throughput | H100, throughput | Ratio, Perf | Ratio, Perf/$ | RTX, throughput | H100, throughput | Ratio, Perf | Ratio, Perf/$ | |
Random_100:10k | 10670.203 | 15215.58 | 1.43 | 1.05 | 6941.385 | 7640.248 | 1.10 | 1.36 | 934.163 | 2013.284 | 2.16 | 0.70 |
Random_2500:2000 | 13627 | 22443.08 | 1.65 | 0.91 | 5422.951 | 7736.785 | 1.43 | 1.05 | 789.415 | 1250.285 | 1.58 | 0.95 |
Random_31k:1k | 1533.383 | 2856.85 | 1.84 | 0.82 | 589.209 | 863.903 | 1.47 | 1.02 | 241.048 | 304.171 | 1.26 | 1.19 |
В offline-сценарии экономический показатель, в общем, везде стремится к единице.
Практические выводы по результатам тестов
Карты H100 NVL имеют бо́льшую вычислительную мощность в нашей конфигурации, но RTX PRO 6000 BSE зачастую показывает лучшие экономические показатели. Что влияет на экономическую эффективность?
Архитектура модели. MoE-модели позволяют RTX PRO 6000 BSE выигрывать в среднем на 20% в FP8-квантизации. А на dense-моделях RTX PRO 6000 BSE отстают в FP8-квантизации в среднем на 12%.
Формат весов. NVFP4-версии моделей получают разный прирост производительности в зависимости от нагрузки: в среднем 25% на decode-heavy/balanced и 7% — на prefill-heavy.
Уровень параллелизма запросов. При низком параллелизме запросов RTX PRO 6000 BSE показывает сравнительно бо́льшую экономическую эффективность: 28% — при четырех, 14% — при 16 и 7% — при 64 одновременных запросах.
Сценарий работы. В offline-сценарии экономический показатель обеих GPU примерно одинаков.
Профиль нагрузки. Производительность зависит не только от набора данных, но и от модели, поэтому их следует рассматривать в совокупности.
Теперь — к рекомендациям по использованию RTX PRO 6000 BSE.
Профиль нагрузки | Общая рекомендация | Пример и средний выигрыш по Perf/$ |
Decode-heavy нагрузки: генерация статьи/поста по краткому ТЗ, написание кода или тестов по описанию функции | Небольшие, умещающиеся на 1 GPU MoE-модели либо любые модели в NVFP4 квантизации (G4208P G3 RTX PRO 6000 BSE) | Qwen3.6-35B-A3B-NVFP4 — 49% Qwen-27B-NVFP4 — 18% |
Balanced нагрузки: перевод текста, rewriting, рефакторинг фрагмента кода | Рекомендации те же, что и для decode-heavy нагрузок | Qwen3.6-35B-A3B-NVFP4 — 48% Qwen-27B-NVFP4 — 15% |
Prefill-heavy нагрузки: cаммаризация длинного документа, RAG-ответ по большому контексту | Можно использовать MoE модели, занимающие до 2 GPU, например DeepSeek-V4-Flash (G4208P G3 RTX PRO 6000 BSE) | DeepSeek-V4-Flash — до 44% (Perf/$) |
Если вам интересна работа с AI, обратите внимание на наши вакансии:
