Меня зовут Алексей, я инженер по разработке ПО искусственного интеллекта в YADRO. В ходе статьи я получу подробные ответы на эти вопросы, а помогут в этом YADRO G4208P G3 — производительные серверы для задач ИИ, машинного обучения и глубокой аналитики. В один такой сервер я установлю четыре RTX PRO 6000, в другой — восемь H100 NVL. Оценивать буду на моделях различного размера и архитектуры: Qwen3.6-27B (dense), Qwen3.6-35B-A3B (MoE) в форматах FP8 и NVFP4, а также DeepSeek-V4-Flash в форматах Mixed FP4 и NVFP4. Использую vLLM в сценариях offline и server — vLLM 0.23.0 для Qwen, vLLM 0.26 для DeepSeek-V4-Flash — а также Docker-image на основе nvidia/cuda:13.2.0-cudnndevel-ubuntu22.04.

Конфигурация серверов и тестов

Модель сервера

G4208P G3

CPU

2 x Intel Xeon Gold 6542Y (24 ядра)

2 x Intel Xeon Gold 6430 (32 ядра)

GPU

4 x NVIDIA RTX PRO 6000 Blackwell Server Edition (96 ГБ)

8 x NVIDIA H100 NVL (94 ГБ)

RAM

1536 ГБ (24 x 64 ГБ)

2048 GB (32 x 64 ГБ)

SSD

47 ТБ SATA SSD (3 шт.)

8,2 ТБ SATA SSD (2 шт.)

Версия Cuda

13.2

Версия драйверов

595.71.05

Точные конфигурации запуска моделей:

4 x Qwen3.6-35B-A3B-FP8

4 x Qwen3.6-35B-A3B-NVFP4

4 x Qwen3.6-27B-FP8

4 x Qwen3.6-27B-NVFP4

1 x DeepSeek-V4-Flash

1 x DeepSeek-V4-Flash-NVFP4

--tp 1

--tp 1 --quantization modelopt_fp4

--tp 1

--tp 1 --quantization modelopt_fp4

--tp 2
--max-model-len 52488
--trust-remote-code
--kv-cache-dtype fp8
--block-size 256
--enable-expert-parallel
--gpu-memory-utilization 0.96

--tp 2
--max-model-len 52488
--trust-remote-code
--kv-cache-dtype fp8
--block-size 256
--enable-expert-parallel
--gpu-memory-utilization 0.95
--max-num-seqs 64
--quantization modelopt_fp4

Всего получилось четыре инстанса Qwen и один инстанс DeepSeek-V4-Flash. Запускать буду в режиме multi-instance: поднимать несколько копий модели и объединять их интерфейсы через перенаправление запросов nginx.

Датасеты для тестирования

Тестировать модели буду через синтетические профили нагрузки — prefill-heavy, decode-heavy и balanced — соответствующие трем стандартным сценариям в реальной работе.

Датасет

Размерности

Пример задачи

Prefill-heavy-нагрузки (большой input, короткий output)

input: 31k

output: 1k

Саммаризация длинного документа (договор, статья). RAG-ответ по большому контексту

Decode-heavy-нагрузки (короткий input, большой output)

input: 100

output: 10k

Генерация статьи/поста по краткому ТЗ, написание кода или тестов по описанию функции

Balanced-нагрузки (input и output приблизительно равны)

input: 2500

output: 2000

Перевод текста, рерайтинг, рефакторинг фрагмента кода

Суммарное количество запросов определил из расчета 100 запросов на инстанс модели: получилось четыре инстанса (400 запросов на тест) для Qwen, и один инстанс (100 запросов на тест) для DeepSeek-V4-Flash. При сравнении буду запускать равное число ускорителей в каждом сервере: 4 на 4 — для моделей Qwen, 2 на 2 — для DeepSeek-V4-Flash.

FP8 vs NVFP4: оцениваем качество и производительность

Ключевая особенность RTX PRO 6000 Blackwell Server Edition — это аппаратная поддержка NVFP4, четырехбитного формата весов с двухуровневым масштабированием. NVFP4 предусматривает масштабирующий коэффициент в FP8 на каждый блок из 16 элементов и общий множитель в FP32 на тензор. За счет этого при небольшой потере качества объем весов относительно FP8 сокращается вдвое.

Что это дает на практике? Чтобы оценить это, возьму несколько моделей в NVFP4 и сравню их с версиями тех же моделей в базовом варианте, то есть FP8 или Mixed FP4 (DeepSeek-V4-Flash).

Оценка качества

Для оценки точности использовался инструмент sgl-eval на наборе данных AIMO-2025 — задачах олимпиадного уровня по математике. На этот инструмент есть ссылка в официальных cookbook sglang. Параметры запуска sgl-eval для Qwen взяты со страницы NVIDIA, для DeepSeek — из cookbook sglang:

Параметр

Qwen3.6-35B-A3B или Qwen3.6-27B

DeepSeek-V4-Flash

temperature

1.0

1.0

top-p

0.95

1.0

n-repeats

16

16

max_num_tokens

81920

200000

Всего в датасете 30 тестов, accuracy определяется как среднее значение за 16 запусков. На H100 NVL запускали модели Qwen3.6-35B-A3B (FP8) и DeepSeek-V4-Flash (Mixed FP4). На RTX PRO 6000 BSE — Qwen3.6-35B-A3B и DeepSeek-V4-Flash в NVFP4-формате.

Модель

Базовое квантование (H100 NVL), accuracy

NVFP4-квантование (RTX PRO 6000 BSE), accuracy

Qwen3.6-35B-A3B

0,89 (FP8)

0.89

Qwen3.6-27B

0,92 (FP8)

0,92

DeepSeek-V4-Flash

0.96 (Mixed FP4)

0.96

Как можно видеть из таблицы, переход на NVFP4 квантизацию не снижает точность вплоть до второго знака в округлении на датасете AIME-2025.

Оценка производительности

Здесь мы оцениваем работу по метрике e2e, модели и условия запуска не меняются.

Датасет Random_100:10k, server-сценарий

Здесь и далее mc — это max_concurrency. 

mc

4 x Qwen3.6-35B-A3B tp1

4 x Qwen3.6-27B tp1

1 x DeepSeek-V4-Flash tp2

NVFP4, e2e, мс

FP8, e2e, мс

Ratio (FP8 / NVFP4)

NVFP4, e2e, мс

FP8, e2e, мс

Ratio (FP8 / NVFP4)

NVFP4, e2e, мс

Mixed FP4, e2e, мс

Ratio (Mixed FP4 / NVFP4)

4

42996.7

49099.76

1.14

151918.4

217621.6

1.43

142227.5

149080.1

1.05

8

54666.1

63646.17

1.16

165955.6

233837.5

1.41

189829.7

204996

1.08

16

60842.5

75939.89

1.25

174028.5

243080

1.40

271955.2

304781

1.12

32

79886.23

103388.7

1.29

175124.6

249607

1.43

415937.2

460386.1

1.11

64

107890.1

143200.6

1.33

201771.7

284951.3

1.41

563915.9

616786.4

1.09

Датасет Random_2500:2000, server-сценарий

mc

4 x Qwen3.6-35B-A3B tp1

4 x Qwen3.6-27B tp1

1 x DeepSeek-V4-Flash tp2

NVFP4, e2e, мс

FP8, e2e, мс

Ratio (FP8 / NVFP4)

NVFP4, e2e, мс

FP8, e2e, мс

Ratio (FP8 / NVFP4)

NVFP4, e2e, мс

Mixed FP4, e2e, мс

Ratio (Mixed FP4 / NVFP4)

4

9118.844

9889.743

1.08

30787.73

44120.36

1.43

29471.86

32180.53

1.09

8

11084.92

12841.08

1.16

33937.4

47199.68

1.39

39936.42

43054.13

1.08

16

12399.95

15348.66

1.24

36043.22

49483.8

1.37

62212.48

64688.2

1.04

32

16158.93

20746.49

1.28

37357.63

50746.23

1.36

95124.49

104050.3

1.09

64

21711.7

28554.98

1.32

44833.97

58633.14

1.31

113055.5

121603.5

1.08

Датасет Random_31k:1k, server-сценарий

mc

4xQwen3.6-35B-A3B tp1

4xQwen3.6-27B tp1

1xDeepSeek-V4-Flash tp2

NVFP4, e2e, мс

FP8, e2e, мс

Ratio (FP8 / NVFP4)

NVFP4, e2e, мс

FP8, e2e, мс

Ratio (FP8 / NVFP4)

NVFP4, e2e, мс

Mixed FP4, e2e, мс

Ratio (Mixed FP4 / NVFP4)

4

6479.866

7018.598

1.08

21909.22

27771.54

1.27

23699,57

25284.28

1.07

8

8611.092

9344.681

1.09

29312.12

33869.31

1.16

36812,42

39649.21

1.08

16

11959.56

13131.24

1.10

42174.75

44805.2

1.06

65992,7

67609.51

1.02

32

19216.36

21066.03

1.10

66391.39

64625.95

0.97

123502,8

118639.8

0.96

64

32846.6

35337.48

1.08

118024.3

108260.2

0.92

206549,6

217625.5

1.05

Точность у моделей в базовой и NVFP4-квантизации совпадает до сотых. На decode-heavy и balanced нагрузках модели в NVFP4 показывают лучшую производительность, чем в базовой квантизации: до 43% у Dense модели Qwen3.6-27B и до 33% у MoE-модели Qwen3.6-35B-A3B. На prefill-heavy нагрузках переход на NVFP4 квантизацию не дает большого эффекта.

RTX PRO 6000 BSE vs H100 NVL: сравниваем Perf/$ в server- и offline-сценариях

По спецификации H100 NVL гораздо мощнее RTX PRO 6000 BSE: и по производительности тензорных ядер в FP8 — 3341 против 2000 TFLOPS, и по пропускной способности памяти — 3900 против 1597 ГБ/с. Поэтому разумно сравнить карты по экономической эффективности.

В дальнейших расчетах я буду исходить из того, что H100 NVL дороже RTX PRO 6000 BSE в 1,5 раза. Это примерно соответствует ситуации на рынке в августе 2026 года. Совокупная стоимость серверной конфигурации в дальнейших расчетах не учитывается — только цены GPU.

Экономическую эффективность буду рассчитывать по метрике perf/$. Формула для server-сценария:

Perf/$ = 1,5 / (E2E RTX PRO 6000 BSE / E2E H100 NVL)

Для offline-сценария:

Perf/$ = 1,5 / (Throughput H100 NVL / Throughput RTX PRO 6000 BSE)

Ratio(Perf) больше 1 означает победу RTX PRO 6000 над H100 NVL. Сравнение мы проведем на моделях различного размера и архитектуры (dense и MoE).

Датасет Random_100:10k, server-сценарий

Модели в FP8-квантизации (RTX — NVIDIA RTX PRO 6000 Blackwell Server Edition, H100 — NVIDIA H100 NVL):

mc

Qwen3.6-35B-A3B-FP8

Qwen3.6-27B-FP8

DeepSeek-V4-Flash (mixed FP4)

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

4

49099.76

50551.06

0.97

1.54

217621.6

122167.8

1.78

0.84

149080.1

117197.1

1.27

1.18

8

63646.17

53728.81

1.18

1.27

233837.5

124696.9

1.88

0.80

204996

147843.9

1.39

1.08

16

75939.89

60243.89

1.26

1.19

243080

129949

1.87

0.80

304781

204205.6

1.49

1.01

32

103388.7

73595.91

1.40

1.07

249607

142559

1.75

0.86

460386.1

301312.3

1.53

0.98

64

143200.6

98139.8

1.46

1.03

284951.3

164483.4

1.73

0.87

616786.4

375208.9

1.64

0.91

Модели в NVFP4-квантизации:

mc

Qwen3.6-35B-A3B

Qwen3.6-27B

DeepSeek-V4-Flash

RTX , e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX , e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

4

42996.7

50551.06

0.85

1.76

151918.4

122167.8

1.24

1.21

142227.5

117197.1

1.21

1.24

8

54666.1

53728.81

1.02

1.47

165955.6

124696.9

1.33

1.13

189829.7

147843.9

1.28

1.17

16

60842.5

60243.89

1.01

1.49

174028.5

129949

1.34

1.12

271955.2

204205.6

1.33

1.13

32

79886.23

73595.91

1.09

1.38

175124.6

142559

1.23

1.22

415937.2

301312.3

1.38

1.09

64

107890.1

98139.8

1.10

1.36

201771.7

164483.4

1.23

1.22

563915.9

375208.9

1.50

1.00

Что видно на decode-heavy-нагрузке:

  • RTX Pro 6000 BSE показывает наибольшее преимущество по экономической эффективности на модели Qwen-35B-A3B-NVFP4. Средний выигрыш составляет 49%.

  • Наименьшую эффективность на RTX Pro 6000 BSE мы можем наблюдать на dense-модели Qwen-27B-FP8, в этом случае преимущество на стороне H100 NVL.

  • С увеличением количества одновременных запросов ускорители по экономической эффективности сближаются.

Датасет Random_2500:2000, server-сценарий

Модели в FP8-квантизации:

mc

Qwen3.6-35B-A3B-FP8

Qwen3.6-27B-FP8

DeepSeek-V4-Flash(mixed FP4)

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

4

9889.743

10211.38

0.97

1.55

44120.36

24525.28

1.80

0.83

32180.53

25045.78

1.28

1.17

8

12841.08

10920.74

1.18

1.28

47199.68

25140.06

1.88

0.80

43054.13

32032.72

1.34

1.12

16

15348.66

12143.71

1.26

1.19

49483.8

26477.51

1.87

0.80

64688.2

40148.86

1.61

0.93

32

20746.49

14899.61

1.39

1.08

50746.23

29370.65

1.73

0.87

104050.3

63469.13

1.64

0.91

64

28554.98

19945.19

1.43

1.05

58633.14

34381.51

1.71

0.88

121603.5

82279.1

1.48

1.01

Модели в NVFP4-квантизации:

mc

Qwen3.6-35B-A3B

Qwen3.6-27B

DeepSeek-V4-Flash

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

4

9118.844

10237.38

0.89

1.68

30787.73

24525.28

1.26

1.19

29471.86

25045.78

1.18

1.27

8

11084.92

10950.28

1.01

1.48

33937.4

25140.06

1.35

1.11

39936.42

32032.72

1.25

1.20

16

12399.95

12138.62

1.02

1.47

36043.22

26477.51

1.36

1.10

62212.48

40148.86

1.55

0.97

32

16158.93

14923.96

1.08

1.39

37357.63

29370.65

1.27

1.18

95124.49

63469.13

1.50

1.00

64

21711.7

19964.99

1.09

1.38

44833.97

34381.51

1.30

1.15

113055.5

82279.1

1.37

1.09

Что видно на balanced-нагрузке:

  • В целом ситуация аналогична случае decode-heavy-нагрузке.

  • Незначительное увеличение сравнительной экономической эффективности для H100 NVL.

Датасет Random_31k:1k, server сценарий

Модели в FP8-квантизации:

mc

Qwen3.6-35B-A3B-FP8

Qwen3.6-27B-FP8

DeepSeek-V4-Flash (mixed FP4)

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

4

7018.598

6323.499

1.11

1.35

27771.54

16157.7

1.72

0.87

25284.28

23166.4

1.09

1.37

8

9344.681

7523.869

1.24

1.21

33869.31

20126.29

1.68

0.89

39649.21

34039.09

1.16

1.29

16

13131.24

9975.562

1.32

1.14

44805.2

28193.58

1.59

0.94

67609.51

64791.47

1.04

1.44

32

21066.03

14847.25

1.42

1.06

64625.95

44315.45

1.46

1.03

118639.8

105781.1

1.12

1.34

64

35337.48

24843.52

1.42

1.05

108260.2

75921.71

1.43

1.05

217625.5

193949.6

1.12

1.34

Модели в NVFP4-квантизации:

mc

Qwen3.6-35B-A3B

Qwen3.6-27B

DeepSeek-V4-Flash

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

RTX, e2e, мс

H100, e2e, мс

Ratio, Perf

Ratio, Perf/$

4

6479.866

6323.499

1.02

1.46

21909.22

16157.7

1.36

1.11

23699.57

23166.44

1.02

1.47

8

8611.092

7523.869

1.14

1.31

29312.12

20126.29

1.46

1.03

36812.42

34039.09

1.08

1.39

16

11959.56

9975.562

1.20

1.25

42174.75

28193.58

1.50

1.00

65992.7

64791.47

1.02

1.47

32

19216.36

14847.25

1.29

1.16

66391.39

44315.45

1.50

1.00

123502.8

105781.1

1.17

1.28

64

32846.6

24843.52

1.32

1.13

118024.3

75921.71

1.55

0.96

206549.6

193949.6

1.06

1.41

На prefill-heavy-нагрузке:

  • RTX Pro 6000 BSE больше всего выигрывает по экономической эффективности на модели DeepSeek-V4-Flash-NVFP4. Средний выигрыш составляет 40% и сохраняется с увеличением числа одновременных запросов

  • Наименьшая экономическая эффективность RTX Pro 6000 BSE — на dense-модели Qwen-27B-FP8, и здесь преимущество на стороне H100 NVL.

  • С увеличением количества одновременных запросов показатель экономической эффективности стремится к единице за исключением DeepSeek-V4-Flash.

Все датасеты, offline-сценарий

Модели в FP8-квантизации:

Датасет

Qwen3.6-35B-A3B-FP8

Qwen3.6-27B-FP8

DeepSeek-V4-Flash (mixed FP4)

RTX, throughput

H100, throughput

Ratio, Perf

Ratio, Perf/$

RTX, throughput

H100, throughput

Ratio, Perf

Ratio, Perf/$

RTX, throughput

H100, throughput

Ratio, Perf

Ratio, Perf/$

Random_100:10k

9083.145

15215.58

1.68

0.90

4773.762

7640.248

1.60

0.94

1430.271

2013.284

1.41

1.07

Random_2500:2000

12892.732

22443.08

1.74

0.86

5018.657

7736.785

1.54

0.97

922.219

1250.285

1.36

1.11

Random_31k:1k

1553.678

2856.85

1.84

0.82

556.556

863.903

1.55

0.97

189.572

304.171

1.12

1.34

Модели в NVFP4-квантизации:

Датасет

Qwen3.6-35B-A3B

Qwen3.6-27B

DeepSeek-V4-Flash

RTX, throughput

H100, throughput

Ratio, Perf

Ratio, Perf/$

RTX, throughput

H100, throughput

Ratio, Perf

Ratio, Perf/$

RTX, throughput

H100, throughput

Ratio, Perf

Ratio, Perf/$

Random_100:10k

10670.203

15215.58

1.43

1.05

6941.385

7640.248

1.10

1.36

934.163

2013.284

2.16

0.70

Random_2500:2000

13627

22443.08

1.65

0.91

5422.951

7736.785

1.43

1.05

789.415

1250.285

1.58

0.95

Random_31k:1k

1533.383

2856.85

1.84

0.82

589.209

863.903

1.47

1.02

241.048

304.171

1.26

1.19

В offline-сценарии экономический показатель, в общем, везде стремится к единице.

Практические выводы по результатам тестов

Карты H100 NVL имеют бо́льшую вычислительную мощность в нашей конфигурации, но RTX PRO 6000 BSE зачастую показывает лучшие экономические показатели. Что влияет на экономическую эффективность?

Архитектура модели. MoE-модели позволяют RTX PRO 6000 BSE выигрывать в среднем на 20% в FP8-квантизации. А на dense-моделях RTX PRO 6000 BSE отстают в FP8-квантизации в среднем на 12%.

Формат весов. NVFP4-версии моделей получают разный прирост производительности в зависимости от нагрузки: в среднем 25% на decode-heavy/balanced и 7% — на prefill-heavy.

Уровень параллелизма запросов. При низком параллелизме запросов RTX PRO 6000 BSE показывает сравнительно бо́льшую экономическую эффективность: 28% — при четырех, 14% — при 16 и 7% — при 64 одновременных запросах.

Сценарий работы. В offline-сценарии экономический показатель обеих GPU примерно одинаков.

Профиль нагрузки. Производительность зависит не только от набора данных, но и от модели, поэтому их следует рассматривать в совокупности.

Теперь — к рекомендациям по использованию RTX PRO 6000 BSE.

Профиль нагрузки

Общая рекомендация

Пример и средний выигрыш по Perf/$

Decode-heavy нагрузки: генерация статьи/поста по краткому ТЗ, написание кода или тестов по описанию функции

Небольшие, умещающиеся на 1 GPU MoE-модели либо любые модели в NVFP4 квантизации (G4208P G3 RTX PRO 6000 BSE)

Qwen3.6-35B-A3B-NVFP4 — 49% 

Qwen-27B-NVFP4 — 18%

Balanced нагрузки: перевод текста, rewriting, рефакторинг фрагмента кода 

Рекомендации те же, что и для decode-heavy нагрузок

Qwen3.6-35B-A3B-NVFP4 — 48%

Qwen-27B-NVFP4 — 15%

Prefill-heavy нагрузки: cаммаризация длинного документа, RAG-ответ по большому контексту 

Можно использовать MoE модели, занимающие до 2 GPU, например DeepSeek-V4-Flash (G4208P G3 RTX PRO 6000 BSE)

DeepSeek-V4-Flash — до 44% (Perf/$)

Если вам интересна работа с AI, обратите внимание на наши вакансии: