Pull to refresh

Comments 13

Мне, получается, пока везет, 2 карты 6й год пашут в создании ML-систем. Возможно, потому-что сразу поставил водяное охлаждение вообще всей системы.

Две это не статистика. Статистика начинается хотя бы с тысячи карт.

Или с тысячи пользователей карт. С этой стороны не смотрели? Или отказы у карт начинаются только когда они собираются вместе?

С пользователей собрать достоверную статистику сложно. У всех разное охлаждение, разные котики с разной шерстью, разное использование. В данных слишком много шума будет.

Я просто поделился своей статистикой, если другие пользователи также поделятся может она и соберется.

Везение, режим или охлаждение — без деталей не разберёшься, а детали интересные. Что за карты, если не секрет? Под какой нагрузкой живут — обучением, инференсом, экспериментами рывками? И водянка стоит именно на картах или на всём контуре сразу? Ваш шестой год — это как раз та практика, которой в статье не хватает: вся статистика там из дата-центров с непрерывной нагрузкой, домашние режимы — отдельная история.

RTX A6000 48Gb и RTX A5000 24Gb, 128Gb RAM, Threadripper 3970X, 8 NVME. Водяное охлаждение: видеокарты, проц, память, NVME диски, южной мост и VRM на матери. Разнесено в 3 контура со своими помпами и радиаторами. Контура герметичны (1.5 атм держит), но все равно в каждую колбу раз в 3 месяца подливаю жижу, куда испаряется непонятно.

Нагрузка практически постоянная, но рваная: от обучения/дообучения моделей под проекты до тестирования новых подходов и имаго-кодинга. Две карты позволяют параллелить инференс (харнесс) и обучение.

На выходных, если не нужно обучать что-то сутками переползаю на винду поковырять UE, он тоже неплохо грузит. Как-то так.

Спасибо за детали — это уже не «повезло», это система: профессиональный класс карт, рваная нагрузка вместо непрерыва и три герметичных контура. Кстати, ваш шестой год красиво ложится в статью: Azure выводила K80 и P100 после семи-девяти лет службы — похоже, профессиональные карты при хорошем охлаждении доживают до преклонного возраста, просто фронтир их не спрашивает. А жижа — она и у всех так: медленно диффундирует сквозь стенки шлангов, поэтому контуры герметичны, но не паронепроницаемы. Малозаметная утечка, а не магия.

Про испарение жижи через шланги не знал, спасибо за информацию.

Нет, помаленьку потеют соединения. Через шланги н чего не уходит. Из-за того что температура выше окружающей среды, эти микроутечки испаряются быстрее чем успевают сформировать капли. Это нормально, у всех так. Ну и опрессовку вы наверняка делали не правильно. Надо накачивать и замерять время потери давления при рабочей температуре. Все там прекрасно шипит и убегает. Ну и 1,5 бар это многовато. 1 достаточно.

А ещё вроде есть подтверждение, что карты под постоянной нагрузкой живут дольше карт с периодической. Из своего опыта с где-то 5-6 картами, последняя из которых 4090, могу сказать что они живут годами в обоих режимах. Причем есть подтверждённая статистика длиною 2.5 года на 100+ карт 4090 с практически 100% загрузкой 24/7. Правда нагрузка в основном вычислительная, на CUDA ядра, а память простаивает (судя по статье это критичная разница - в смысле память изнашивается...).

Сейчас на развалах v100 продаются, разрыв с a100 безумный. Если начнут так же от a100 и потом от h100 избавляться, то надежда брезжит для частников

@mr_stepik Согласен. Похоже, сейчас формируется отдельный китайский рынок восстановленных карт, предложений уже много, цены заманчивые. Видимо, списанное из облаков железо отныне будет стекать именно туда.

Sign up to leave a comment.

Articles