
Привет! Совсем скоро у нас выйдет подробная статья про критерии выбора железа для ИИ-нагрузок, в которой мы поговорим о GPU, системах хранения и, само собой, об охлаждении (без него вообще все сложно). Пока же — небольшой тизер того, что вас ждет.
Всем интересующимся железом для ИИ мы обычно предлагаем пробежаться по небольшому чек-листу — в нем есть пять важных нюансов, с которыми стоит определиться на берегу. В нашем ПАК мы заранее все реализовали, но если вы подбираете оборудование самостоятельно, вам пригодится гайд для самопроверки.
Уточняйте, как конкретно рассчитано энергопотребление. Советуем запросить у вендора не просто номинальный TDP, а именно пиковые параметры под реальной ИИ-нагрузкой, включая ресурсоемкие задачи обучения, — на этом отдельно остановимся в статье. В идеале узнать и схему резервирования PSU и уточнить, сохранит ли система при отказе одного PSU или ввода питания полную производительность.
Узнайте, какой тепловой пакет на стойку, и что еще предусмотрено в ЦОДе. Скорее всего, вам ответят что-то вроде «Стандартная у нас стойка» — это повод уточнить, сколько кВт эта стандартная стойка держит и сколько в ней предполагается GPU-узлов.
Устройство сетевой сегментации на уровне железа. Это тоже то, что будет полезно знать — в идеальном мире трафик от ML и бэкап-трафик должны идти по разным физическим сегментам. Иначе в один прекрасный день ночной бэкап просто “положит” обучение. К слову, об этом мы напишем отдельную статью.
Уточните у производителя / поставщика, как будет продолжена работа с ИИ-приложениями, в случае отказа одного GPU-узла. Если в ответе вы услышите что-то про аварийное выключение со стратегией сохранения чекпоинтов, а также про автоматическую миграцию нагрузки — поздравляем, это правильный ответ.
Как дела с мониторингом на уровне железа и ИИ-приложения. Да, да, не кубером и IPMI-консолью едиными. В observability-стеке обязательно должны быть GPU die temp, температура памяти, ошибки NVLink, power draw.
С этим Топ 5 уже можно идти и собирать хорошую рабочую инфру под ИИ-задачи в нужных вам масштабах. Подробнее про каждый из этих пунктов, экономику процесса (и когда она бывает ложной), избыточные и недостаточные параметры железа, отдельные сценарии инференса и многое другое — совсем скоро в нашем материале.















