Обновить
4
Vladimir Nikulin@vs_nikulin

Tech Lead / AI Inference Engineer

1
Подписчики
Отправить сообщение

ASR на CPU. Как выбрать бэкенд, настроить Triton и не потерять в точности

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели6.3K

Привет, Хабр! Меня зовут Владимир Никулин, я технический лидер команды продуктивизации нейросетевых решений в MWS AI. Мы развиваем платформу синтеза и распознавания речи Audiogram, которая, в свою очередь, является частью еще более масштабной платформы для создания ИИ-агентов — MWS AI Agents Platform.

Часто нашим заказчикам нужно компактное коробочное решение, которое можно запустить на CPU при отсутствии GPU или для простой экономии ресурсов. В этом материале по следам своего же доклада на AiConf на примере нашего модуля автоматического распознавания речи (Automatic Speech Recognition или кратко — ASR) я расскажу:

- как мы продуктивизировали модели на CPU, сохраняя качество (WER), сопоставимое с моделями, развернутыми в GPU-кластерах;

- какие подходы для сравнения по производительности и качеству использовали, чтобы не попасть в ловушку усреднения метрик;

- с какими неожиданностями мы столкнулись при смене версий Triton Inference Server и бэкендов (ONNX, OpenVINO).

Поехали!

Информация

В рейтинге
Не участвует
Откуда
Москва, Москва и Московская обл., Россия
Дата рождения
Зарегистрирован
Активность

Специализация

ML разработчик, Tech Lead / Inference Engineer
Ведущий
Python
C++
Прикладная математика
Алгоритмы и структуры данных
Разработка программного обеспечения
Оптимизация кода
Управление разработкой