Железо для ИИ: почему стандартный сервер не справится и как мы проектировали аппаратный стек ПАК

Привет, Хабр! Продолжаем цикл про инфраструктуру для ИИ-задач. В первой статье мы разбирали стратегический вопрос: что проще и выгоднее — собирать самостоятельно или брать готовый ПАК (на примере ПАК Скала^р)? Поговорили и о том, что именно заказчик узнает о самосборе — не на этапе закупки, а через полгода эксплуатации.
Сегодня же переместимся на следующий уровень: поговорим про аппаратный стек.
Структура статьи такова: для каждого слоя железа — GPU, питание, охлаждение, хранение — я покажу, какую инженерную задачу мы решали при проектировании ПАК и почему приняли именно такие решения, а не другие. Там, где это уместно, приведем цифры, которые помогут понять пороги: когда одно решение заменяется другим и что это означает по деньгам и по производительности.
Поехали!














В декабре 2013 года были анонсированы новые комплексные платформы для виртуализации HP Converged Systems. Это серьезное обновление системы, полностью готовой к развертыванию виртуальных машин, основанная на компонентах от одного производителя. В каждой из систем используются инновационные компоненты HP, о которых будет рассказано ниже.
