Отключаем лишнее в values (драйвер ставим самостоятельно):
Вот как раз blacklist nuveau, компиляцию драйверов в рантайме (или даже pre-compiled), настройку containerd/toolkit и делает Nvidia GPU Operator. И все false под катом - как раз b призваны решать описываемые выше проблемы )
H100 80 GB: 14 MIG 1g.10gb (для inference) 4 MIG 2g.20gb (для training) 2 MIG 4g.40gb (для heavy training) 1 MIG 7g.80gb (для super‑heavy training)
Moscow One (MOS1) – ЦОД уровня Tier III/Level 3 с тремя машинными залами площадью 6 000 м² для размещения 1 835 стоек с общей мощностью 13,7 МВт. Дата-центр Moscow Two (MOS2) — это ЦОД уровня надёжности Tier III, вмещающий 1 580 стоек на площади 3 300 м² с общей мощностью 13 МВт.
Бесперебойное энергоснабжение с высоким уровнем резервирования
Альтернативные источники питания позволяют дата-центру полноценно функционировать даже при перебоях подачи электроэнергии в городе.
Какая-то сказочная история про ДГУ "не для всех" и деление сервисы на "привилегированные" и "все остальные". Из открытых данных находим похожий по характеристикам ЦОД https://ixcellerate.ru/data-centers/moscow-north-campus/ (проектная мощность 64МВт)
Уровень доступности: 99.999%
Проектный PUE: <1.6
Резервирование по централизованным дизель-генераторам: N+1
И понимаем, что ЦОД Яндекса - не про надежность. Интересно было бы посмотреть на данные по резервированию Селектела, но в открытых источниках нашел, что макс мощность на ЦОД у них 10Мвт
У Percona есть своя сборка Grafana+Prometheus в виде коробочного продукта PMM, и к ней pmm_agent, которые дают неплохие метрики по MySQL/PgSQL/MongoDB + анализ запросов. И все это из коробки. При желании в эту графану можно подключить датасорсом ваш текущий прометеус или графану и основным инструментом сделать PMM
Ох, в OK тогда была такая веселуха... десятки инженеров в нескольких датацентрах, в течение нескольких дней физически подключались к машинам (монитор и клавиатура), логинились и правили примертно один упомянутый в статье файл, на тысячах серверов. К слову, во FreeBSD исторически не рекомендовали менять шелл руту и "из коробки" sh идет там как часть системы и модифицировать его не советуют. Такой подход (не модифицировать рутовый шелл), скорее всего, уберег бы ОК от той аварии
Оверхед на проверку существования файла — небольшой. Да и происходит он только при попадании в локейшн с динамикой (из конфига это, правда, однозначно не видно). Вариант с использованием geo и закрытии сайта только для мира также вполне себе кошерен. Вариант с проверкой файла хорош тем, что непривилегированный пользователь может сам «включать-выключать» свой сайтег и вы не хотите давать ему какие-то права. Данная схема с проверкой файлов вполне себе работоспособна (и даже используется на проекте из первой 10-ки рунета, но для немного иных целей). Как всегда, нужно понимать, как и для чего вы используете тот или иной инструмент.
Вот как раз blacklist nuveau, компиляцию драйверов в рантайме (или даже pre-compiled), настройку containerd/toolkit и делает Nvidia GPU Operator. И все false под катом - как раз b призваны решать описываемые выше проблемы )
Автор уверен в цифре 14?
https://docs.nvidia.com/datacenter/tesla/mig-user-guide/supported-mig-profiles.html#h100-mig-profiles
Ссылка на доку по автоинсталлу поменялась. Правильная версия https://canonical-subiquity.readthedocs-hosted.com/en/latest/intro-to-autoinstall.html
Цитаты с сайта.
https://teletype.in/@cameda/XXrifQsIX0r
Если верить информации отсюда, то проблема случилась во Владимире. Но это не точно
утоновший ЦОД Яндекса расположен во Владимире
Какая-то сказочная история про ДГУ "не для всех" и деление сервисы на "привилегированные" и "все остальные".
Из открытых данных находим похожий по характеристикам ЦОД https://ixcellerate.ru/data-centers/moscow-north-campus/ (проектная мощность 64МВт)
Уровень доступности: 99.999%
Проектный PUE: <1.6
Резервирование по централизованным дизель-генераторам: N+1
И понимаем, что ЦОД Яндекса - не про надежность.
Интересно было бы посмотреть на данные по резервированию Селектела, но в открытых источниках нашел, что макс мощность на ЦОД у них 10Мвт
У Percona есть своя сборка Grafana+Prometheus в виде коробочного продукта PMM, и к ней pmm_agent, которые дают неплохие метрики по MySQL/PgSQL/MongoDB + анализ запросов. И все это из коробки. При желании в эту графану можно подключить датасорсом ваш текущий прометеус или графану и основным инструментом сделать PMM
Ох, в OK тогда была такая веселуха... десятки инженеров в нескольких датацентрах, в течение нескольких дней физически подключались к машинам (монитор и клавиатура), логинились и правили примертно один упомянутый в статье файл, на тысячах серверов.
К слову, во FreeBSD исторически не рекомендовали менять шелл руту и "из коробки" sh идет там как часть системы и модифицировать его не советуют. Такой подход (не модифицировать рутовый шелл), скорее всего, уберег бы ОК от той аварии