Обновить
64K+
4,69
Оценка работодателя
544,35
Рейтинг
40 022
Подписчики

Обучение модели GPT-2: часы вместо недель

Для тестирования GPU-сервера YADRO G4208P G3 в конфигурации с восемью Н100 NVL / RTX 4090 мы выбрали бенчмарк на основе реализации обучения для модели GPT-2 на 1,558 миллиарда параметров из репозитория проекта llm.c Андрея Карпаты. 

Эта модель была представлена OpenAI в блоге Better Language Models and Their Implications в феврале 2019 года. Тогда для ее обучения требовались команда инженеров и десятки топовых V100, а процесс длился неделями.

Сейчас, шесть лет спустя, достаточно одного сервера с восемью картами H100, а обучение занимает 1–1,6 суток. Все это благодаря развитию GPU, современным библиотекам, таким как CUDA и cuDNN, а также открытым датасетам типа FineWeb-Edu. 

Андрей Карпаты показывает, что это возможно даже без фреймворков вроде PyTorch или TensorFlow. Все обучение реализовано примерно в 5 тысячах строк на C и CUDA. 

Мы проверили, как справляются серверы YADRO c обучением GPT-2 на 1,6 миллиарда параметров. Обучение на конфигурации G4208P с восемью H100 NVL заняло 38 часов, или примерно 1.6 суток. На графике ниже показываем соотношение времени исполнения 50 шагов обучения на конфигурации G4208P с RTX 4090 по сравнению с конфигурацией на Н100 NVL: 

Артём Маклаев с командой, которая занимается оценкой производительности серверных платформ для ИИ-задач в YADRO, поделился в статье результатами десятка тестов GPU-сервера с 8x Н100 NVL / RTX 4090: от инференса моделей распознавания речи до обучения LLM.

Теги:
Всего голосов 1: ↑1 и ↓0+1
Комментарии0

Скорость разработки кода перестала быть дефицитом. Дефицитом стали денежные идеи

Тридцать-сорок лет IT-менеджмент оптимизировал утилизацию дорогих человеко-часов, где чем больше кода писал разработчик, тем лучше компания оценивала свою эффективность. ИИ сделал написание кода дешевым — и выяснилось, что узкое место давно не в разработке, а в идеях, которые стоит реализовывать.

С появлением ИИ у бизнеса появилась возможность собирать MVP, фичи и рефакторинги за недели, а не за кварталы. И оказалось, что подавляющая часть этих MVP - никому не нужна. И это вызвало вопрос: "А действительно ли бутылочное горлышко было в разработке?". Ведь очевидно, если мы генерим MVP достаточно быстро, но эти MVP не находят востребованность, то проблема в нем, а не скорости разработки.

Скорость разработки кода перестала быть дефицитом. Дефицитом стали денежные идеи

Публикации

Информация

Сайт
yadro.com
Дата регистрации
Дата основания
Численность
5 001–10 000 человек
Местоположение
Россия
Представитель
Николай