Обновить
8K+
6
Цырен@renkow

ml research engineer at yandex

33
Рейтинг
1
Подписчики
Отправить сообщение

Как мы ускоряли диффузионный декодер TTS

Время на прочтение11 мин
Охват и читатели9.6K

В пайплайне перевода видео в Яндекс Браузере скорость работы в синтезе речи долго оставалась узким местом: одно видео — это сотни фраз, каждая генерируется отдельно, и любая сэкономленная миллисекунда становится заметной в масштабах сервиса. 

Внутри TTS работает каскад из трёх компонентов: языковая модель предсказывает аудиотокены по тексту, диффузионный декодер восстанавливает мел‑спектрограмму из латентов, а вокодер превращает её в звуковую волну. Долгое время самой тяжёлой была языковая модель, но после её оптимизации на первый план вышел декодер латентов — его forward pass запускается на каждом шаге семплинга диффузии, а шагов — десятки. Именно его мы и взялись ускорять.

Читать далее

Информация

В рейтинге
242-й
Зарегистрирован
Активность

Специализация

ML разработчик
Средний
От 450 000 ₽