Комментарии 2
Интересный кейс, спасибо за детали про MIG.
Вопрос по автоматике отключения: как вы отличаете низкую утилизацию «пользователь взял десять карт под маленькую модель» от низкой утилизации «задача сейчас в фазе загрузки и препроцессинга данных»? По окну наблюдения, по паттерну метрик или как-то ещё?
И второй момент, вы его упомянули вскользь: пользователь после отключения может просто снова запустить такую же машину. Это в итоге чем-то закрылось — квотами, ценообразованием, разговором — или осталось на уровне «отключаем и надеемся»?
Привет! мы считаем среднюю утилизацию на 5 минутных промежутках в 12 часовом окне, если из 12 часов нашелся хотя бы 1 промежуток, где пользователь проходит порог по утилизации, то жизнь машинки продлевается еще на 12 часов, таким образом мы даем пользователям возможность подготавливать среду для запуска нагрузки на карты. А вообще долгий препроцессинг мы просим делать на машинках поменьше, а для запуска GPU нагрузки либо перезапускать машину с нужным количеством GPU либо запускать GPU джобы, на них у нас выделен отдельный пул ресурсов.
Что касается ситуаций когда после отключения пользователь берет машинку еще раз, то у нас есть пайплайн, которые считает количество нарушений за неделю и при превышении определенного порога мы временно снижаем максимальное количество ресурсов, которое может взять этот пользователь, если нарушения продолжаются, то лимиты также продолжают снижаться, вплоть до временно бана на ресерч кластере.
Информация
- Дата регистрации
- Дата основания
- Численность
- свыше 10 000 человек
- Местоположение
- Россия
Как мы внедрили AIOps для контроля GPU‑утилизации и повысили её на 60%