Хабр Курсы для всех
РЕКЛАМА
Большая витрина: от крупнейших школ до частных авторов. Сравнивайте по цене, длительности, формату и выбирайте самый подходящий курс!

Спасибо за комментарий! Применял, но на базовом уровне. Нужно было файнтюнить небольшую LLM на нескольких видеокартах. Там все обошлось обычным Data Parallelism, потому что все влезало с запасом на один GPU и даже приблизительный анализ показывал что там все будет Compute Bound даже при небольшом размере батча.
Масштабирование LLM: от одного чипа до ЦОДа. Глава 1. Теоретические основы