Nvidia окончательно запутывает нас своей линейкой Blackwell. Если посмотреть на PCI.ids выпущенных видеокарт профессионального семейства Blackwell, то мы увидим следующее:
# RTX PRO Blackwell Series (Desktop / Workstation) "10de:2bb5|RTX PRO 6000 Blackwell Server Edition" "10de:2bb4|RTX PRO 6000 Blackwell Workstation Edition" "10de:2bb1|RTX PRO 6000 Blackwell Max-Q" "10de:2bb3|RTX PRO 5000 Blackwell" "10de:2c31|RTX PRO 4500 Blackwell" "10de:2c37|RTX PRO 4000 Blackwell" "10de:2c36|RTX PRO 3000 Blackwell" "10de:2d30|RTX PRO 2000 Blackwell" "10de:2c35|RTX PRO 2000 Blackwell (Alternative)" # RTX PRO Blackwell Series (Server / Embedded) "10de:2c3a|RTX PRO 4500 Blackwell Server Edition" "10de:2c77|RTX PRO 5000 Blackwell Embedded GPU" # RTX PRO Blackwell Series (Laptop / Mobile) "10de:2c38|RTX PRO 5000 Blackwell Generation Laptop GPU" "10de:2f38|RTX PRO 3000 Blackwell Generation Laptop GPU" "10de:2db8|RTX PRO 1000 Blackwell Generation Laptop GPU"
При этом каждой версии может также существовать несколько вариантов, как произошло с нашей сегодняшней испытуемой: NVIDIA RTX PRO 5000 Blackwell с увеличенным до 72 Гб объемом видеопамяти. То есть мы имеем две версии:
RTX PRO 5000 Blackwell (48 ГБ GDDR7): базовая версия, которая вышла изначально. В ней чипы памяти расположены с одной стороны платы. Карта поддерживает разделение MIG на два инстанса по 24 ГБ.
RTX PRO 5000 Blackwell (72 ГБ GDDR7): специальная high-memory версия, выпущенная позже для инференса более крупных ИИ-моделей. В память уже распаяна по технологии clamshell (двустороннее размещение чипов на плате). Поддерживает MIG в режиме 2 x 36 ГБ.
Мировая цена на базовую модель на 48 ГБ начинается в текущих реалиях от $5000. Версия на 72 ГБ оценивается уже от $9999 (дороже в два раза). В России PRO 5000 на 48 ГБ можно найти в среднем от 700 000 рублей, а за PRO 5000 на 72 ГБ попросят уже от 1 000 000 рублей.
Серверы с GPU NVIDIA и AMD |
Но если сравнить ее с флагманом PRO 6000 Blackwell, то покупка на первый взгляд кажется спорной:
Характеристика | RTX PRO 5000 (72 ГБ) | RTX PRO 6000 (96 ГБ) |
|---|---|---|
Объем видеопамяти | 72 ГБ GDDR7 ECC | 96 ГБ GDDR7 ECC |
CUDA-ядра | 14 080 | 24 064 |
Тензорные ядра | 440 (5-е поколение) | 752 (5-е поколение) |
Пропускная способность | 1 344 ГБ/с | 1 792 ГБ/с |
Производительность FP32 | 72,2 TFLOPS | 125 TFLOPS |
Энергопотребление (TDP) | 300 Вт | 600 Вт |
С учетом первоначальной рекомендованной цены в $8000 за PRO 6000 Blackwell, существование 5000-й версии на 72 Гб должно вызывать вопросы. Но текущие реалии с ценой на память таковы, что сейчас на рынках карта стоит в два раза дороже (в РФ, например, за нее попросят от 2 000 000 рублей). При этом RTX PRO 5000 Blackwell при меньшем в два раза энергопотреблении в теории урезана по производительности не наполовину, а примерно на 40%. Зато с ней меньше проблем с питанием и охлаждением.
По форм-фактору всё стандартно: двухслотовое исполнение полной высоты и длины (FHFL) с активной системой охлаждения турбинного типа (blower). Такое же, как и у модели RTX PRO 6000.

Устанавливаем и тестируем
Мы раздобыли такую карту и провели с ней сравнительные тесты. Просим коллег собрать сервер, ставим Ubuntu 24.04 и драйвера с помощью нашего обновленного скрипта.

Затем запускаем наш GPU-тест. Увы, не получилось заполучить RTX PRO 6000 для получения данных по всем моделям, поэтому сравнение делали на DeepSeek R1.
GPU | VRAM | Model | Tokens/sec (average) | max ctx | Load (sec) average | Generate (sec) average |
|---|---|---|---|---|---|---|
NVIDIA RTX PRO 5000 Blackwell | 72 GB | deepseek-r1:32b | 50.77 | 128 000 | 4.32 | 50.69 |
NVIDIA RTX PRO 5000 Blackwell | 72 GB | deepseek-r1:70b | 25.08 | 96 000 | 6.67 | 99.12 |
NVIDIA RTX PRO 5000 Blackwell | 72 GB | gpt-oss:120b | 156.52 | 128 000 | 9.43 | 21.70 |
NVIDIA RTX PRO 5000 Blackwell | 72 GB | qwen3-coder-next:q4_K_M | 192.13 | 128 000 | 7.50 | 14.97 |
NVIDIA RTX 6000 PRO Blackwell (gen5) | 96 GB | deepseek-r1:32b | 58.73 | 128 000 | 2.44 | 42.91 |
NVIDIA RTX 6000 PRO Blackwell (gen5) | 96 GB | deepseek-r1:70b | 30.19 | 112 000 | 4.5 | 84,23 |
NVIDIA RTX A5000 (gen3) | 24 GB | deepseek-r1:32b | 25.77 | 12 000 | 11.49 | 94.10 |
2xAMD RADEON AI PRO R9700 | 2×32 GB | deepseek-r1:32b | 25.90 | 96 000 | 15.2 | 92.1 |
3xAMD RADEON AI PRO R9700 | 3×32 GB | deepseek-r1:70b | 12.77 | 76 000 | 17.0 | 210.1 |
3×AMD RADEON AI PRO R9700 | 3×32 GB | gpt-oss:120b | 60.75 | 128 000 | 21.05 | 57.34 |
3×AMD RADEON AI PRO R9700 | 3×32 GB | qwen3-coder-next:q4_K_M | 37.42 | 128 000 | 17.85 | 79.55 |
72 ГБ видеопамяти позволяет PRO 5000 Blackwell работать с большим размером контекста (в тесте у нас до 128 000 токенов для моделей среднего размера, но можно и до их предела) и без проблем запускать тяжелые модели (вплоть до 120B). Скорость загрузки моделей в память (Load) очень высокая и составляет от 4 до 9 секунд, что говорит об отличной пропускной способности памяти.
Сравнение со старшей моделью (RTX 6000 PRO Blackwell, 96 ГБ)
Несмотря на то, что по «железу» карта проще. RTX PRO 5000 в наших тестах демонстрирует результаты, крайне близкие к флагману, уступая ему лишь в пределах 15-20%.
DeepSeek-R1 (32B). Разница в скорости минимальна. RTX 5000 выдает 50.77 токенов/сек против 58.73 у RTX 6000. Время генерации ответа отличается всего на 8 секунд. Обе карты удерживают максимальный контекст в 128 000 токенов.
DeepSeek-R1 (70B): на более тяжелой модели разрыв чуть заметнее: 25.08 против 30.19 токенов/сек (отставание ~17%). Здесь мы сталкиваемся с ограничением по памяти. RTX PRO 5000 может работать с контекстом лишь до 96 000 токенов, в то время как RTX PRO 6000 благодаря 96 ГБ VRAM позволяет держать контекст до 112 000 токенов.
Сравнение с предыдущим поколением (RTX A5000, 24 ГБ)
А вот здесь виден колоссальный скачок, связанный не только с архитектурой Blackwell, но и с объемом памяти. Причем мы тут даже не рассматриваем оптимизированные модели, например в NVFP4.
На модели deepseek-r1:32b новая RTX PRO 5000 работает почти в 2 раза быстрее предыдущего поколения (50.77 против 25.77 токенов/сек). Время ожидания ответа сократилось с 1.5 минут (94 сек) до 50 секунд. Сказывается и устаревший тип памяти, и архитектура.
При этом из-за скромных 24 ГБ видеопамяти старая RTX A5000 банально «задыхается» и жестко ограничивает контекст до 12 000 токенов. 72 ГБ у RTX PRO 5000 позволяют загрузить в 10 раз больше контекста (128 000 токенов и более), что кардинально меняет качество работы с длинными документами и историей диалогов.
Противостояние с AMD (Radeon AI PRO R9700)
Даже при использовании связок из нескольких карт AMD, одиночная RTX PRO 5000 показывает абсолютное доминирование по скорости генерации, что, скорее всего, связано с лучшей оптимизацией софта под архитектуру NVIDIA (CUDA). В защиту AMD стоит сказать, что даже три таких карты можно купить по цене одной PRO 5000 с 48 Гб памяти (цена на AI PRO R970 начинается сейчас от 200 000 рублей), при этом получив 96 Гб VRAM.
DeepSeek-R1 (32B). Одиночная RTX 5000 работает в 2 раза быстрее, чем связка из двух карт AMD R9 7700;
GPT-OSS (120B). RTX 5000 выдает невероятные 156.52 токена/сек, обходя связку из трех карт AMD (60.75 ток/сек) в 2.5 раза. Ответ от NVIDIA приходит за 21 секунду, а от AMD ответ приходится ждать почти минуту (57 секунд);
Qwen3-Coder-Next (q4_K_M): Тут мы видим полный разгром лагеря «красных». RTX 5000 генерирует 192,13 токена/сек, что более чем в 5 раз быстрее, чем три карты от AMD (37,42 ток/сек). Ответ пишется за 15 секунд, в то время как связка AMD тратит на это почти 80 секунд.
Карты AMD (особенно в связках) берут исключительно объемом памяти и ценой, но по скорости они проигрывают одной карте среднего ценового сегмента на чипе NVIDIA семейства Blackwell.
Попробуем в реальной задаче
Тесты тестами, но работать нам не с ними. Поэтому пробуем GPU в реальной задаче, а именно попробуем вайбкодить в MiMo Code (это клон Open Code от Xiaomi). Подключаемся в нем к Ollama к модели Qwen3-Coder-Next и даем задачу по работе с реальным проектом. (я взял свой проект товароучетной системы с поддержкой маркировки «Честный знак»).


Карта выдавала в среднем 100–120 токенов в секунду, прекрасно работала с агентскими задачами и начала притормаживать, только когда размер контекста стал уходить за 200 000 токенов (у самой модели предел 256 000).
На более громоздкой модели (gpt-oss-120b) результаты были поскромней, порядка 40–50 токенов в секунду, но тоже всё работало сравнимо с уровнем скорости платной подписки на модели Xiaomi.

Вердикт
Если бы я писал эту статью полгода назад, то в вердикте бы прозвучало «лучше чуть доплатить и взять RTX PRO 6000 Blackwell».
Но в текущих реалиях цен и дефицита памяти NVIDIA RTX PRO 5000 Blackwell — это идеальная «золотая середина» для энтузиастов и профессионалов, работающих с локальными нейросетями. Карта в инференсе на практике уступает топовой RTX PRO 6000 всего на четверть, при этом потребляя в два раза меньше энергии, и она на голову превосходит прошлое поколение (A5000), убирая жесткие лимиты на длину контекста.
За счет поддержки MIG 2 вы можете разделить ее на две изолированные друг от друга виртуальные карты по 36 Гб видеопамяти с гарантированным QoS, что позволит сэкономить на тех же виртуальных GPU-серверах.
Серверы с GPU NVIDIA и AMD |

