Обновить
16K+
4,71
Оценка работодателя
118,47
Рейтинг
809
Подписчики

Привет! Совсем скоро у нас выйдет подробная статья про критерии выбора железа для ИИ-нагрузок, в которой мы поговорим о GPU, системах хранения и, само собой, об охлаждении (без него вообще все сложно). Пока же —  небольшой тизер того, что вас ждет.

Всем интересующимся железом для ИИ мы обычно предлагаем пробежаться по небольшому чек-листу — в нем есть пять важных нюансов, с которыми стоит определиться на берегу. В нашем ПАК мы заранее все реализовали, но если вы подбираете оборудование самостоятельно, вам пригодится гайд для самопроверки.

  1. Уточняйте, как конкретно рассчитано энергопотребление. Советуем запросить у вендора не просто номинальный TDP, а именно пиковые параметры под реальной ИИ-нагрузкой, включая ресурсоемкие задачи обучения, — на этом отдельно остановимся в статье. В идеале узнать и схему резервирования PSU и уточнить, сохранит ли система при отказе одного PSU или ввода питания полную производительность.

  2. Узнайте, какой тепловой пакет на стойку, и что еще предусмотрено в ЦОДе. Скорее всего, вам ответят что-то вроде «Стандартная у нас стойка» — это повод уточнить, сколько кВт эта стандартная стойка держит и сколько в ней предполагается GPU-узлов.

  3. Устройство сетевой сегментации на уровне железа. Это тоже то, что будет полезно знать — в идеальном мире трафик от ML и бэкап-трафик должны идти по разным физическим сегментам. Иначе в один прекрасный день ночной бэкап просто “положит” обучение. К слову, об этом мы напишем отдельную статью.

  4. Уточните у производителя / поставщика, как будет продолжена работа с ИИ-приложениями, в случае отказа одного GPU-узла. Если в ответе вы услышите что-то про аварийное выключение со стратегией сохранения чекпоинтов, а также про автоматическую миграцию нагрузки — поздравляем, это правильный ответ.

  5. Как дела с мониторингом на уровне железа и ИИ-приложения. Да, да, не кубером и IPMI-консолью едиными. В observability-стеке обязательно должны быть GPU die temp, температура памяти, ошибки NVLink, power draw.

С этим Топ 5 уже можно идти и собирать хорошую рабочую инфру под ИИ-задачи в нужных вам масштабах. Подробнее про каждый из этих пунктов, экономику процесса (и когда она бывает ложной), избыточные и недостаточные параметры железа, отдельные сценарии инференса и многое другое — совсем скоро в нашем материале.

Теги:
+3
Комментарии0

Локальный ИИ класса Opus 4.6 «задешево»: две Tesla P100, 28-поточный Xeon и тесты на реальных задачах

Я собрал домашний сервер с нейросетками, чтобы не зависеть от облака. Далее честный рассказ с цифрами, бенчмарком на 14 реальных задачах и выводами, которые я проверял на себе.

Если совсем коротко: киловатт питания, две серверные Tesla P100 (суммарно 32 ГБ видеопамяти), турбины, которые слегка шумят, но сервер пришлось выселить на кухню, и Xeon на 28 потоков. Всё это выдаёт от 10 до 50 токенов в секунду, в зависимости от модели. DeepSeek в облаке в три раза быстрее, зато это моё и всегда доступное круглые сутки.

Локальный ИИ класса Opus 4.6 «задешево»: две Tesla P100, 28-поточный Xeon и тесты на реальных задачах

Публикации

Информация

Сайт
rubytech.ru
Дата регистрации
Дата основания
Численность
1 001–5 000 человек
Местоположение
Россия