Комментарии 15
Voxtral от Mistral — лучший из non-Whisper, но критически медленный
что простите? Вы вообще тесты запускали? Он самый быстрый из бесплатных моделей с адекватным качеством.
И уж тем более странно сравнивать его по скорости с NVIDIA Parakeet TDT 0.6B v3, которая быстрая даже при локальном запуске, но при этом очень глупая.
мои данные с вашей оценкой не согласны, если у вас есть другие, закидывайте их сюда, буду рад на них посмотреть
а что касается сравнений, то я в статье пишу, что действительно адекватно сравнивать скорость только внутри одного рантайма, в моем бенчмарке это условие выполняется только для моделей семейства whisper, остальное приведено скорее справочно, но запускалось на той же машине
NVIDIA Parakeet TDT 0.6B v3, которая быстрая даже при локальном запуске, но при этом очень глупая.
и похоже, вы упустили, что все модели в этом исследовании, за исключением закрытых облачных моделей, запускались и тестировались именно локально
Огромное вам спасибо за статью! Сам хотел сделать подобное, но все руки не доходили, теперь можно смело пропустить этот шаг и обновить бенчмарк локальных моделей на применимость по бизнес кейсам.
По моему опыту, из локальных моделей, Breeze и Whisper идут ноздря в ноздрю и конкретный победитель зависит от специфики проекта. А так оба хороши.
спасибо за фидбек, рад помочь!
По моему опыту, из локальных моделей, Breeze и Whisper идут ноздря в ноздрю и конкретный победитель зависит от специфики проекта
согласен, очень похоже на правду)
меня удивило, насколько конкурентно выступил Whisper Turbo, в итоге из открытых я бы выбирал из Breeze, Turbo и Large v2
У меня на ноутбуке нет мощной видеокарты и Breeze ASR думает ооочень долго. А вот Sber Giga AM3 очень быстрый
GigaAM ОЧЕНЬ шустрый и чистый русский хорошо берет, мне к сожалению не подходит, так как у меня в речи много английских слов и терминов, а gigaam на этом сыпется сильно.
Если у вас такой проблемы нет, то это супер вариант, а если есть, то попробуйте whisper turbo, он в 2.5 раза быстрее, чем breeze и другие представители large семейства.
По GigaAM согласен. На IT-миксе с англ. вставками плывёт не потому что «плохая модель», а потому что у русских голов vocab кириллический - латиницу терминов она просто не умеет как класс. На чистом русском другое дело.
Для code-switch история из статьи (Breeze/cloud) нормальная. Я сам на GigaAM рантайм кручу (gigastt на гитхабе), но под другой сценарий, не под EPI.
Отличная статья, спасибо вам за такое подробное исследование! Потратил довольно много времени на сравнение разных моделей на своем железе (5060 Ti 16gb), но объем вашей работы впечатляет. Заметил, что у меня задачи подразделяются на два вида: диктовка и созвоны с коллегами. И для этих двух типов расшифровки параметры модели и\или сервера ее обслуживающего скорее всего будут отличаться. К примеру, передача контекста между 30 секундными окнами Whisper при диктовке полезна, а при расшифровке часового созвона с коллегами скорее вредна, так как Whisper склонен к образованию петель (от них можно по-разному защищаться, но вероятность словить их при передаче контекста остается). Поэтому было бы интересно увидеть также сравнение моделей под задачу транскрибации длительных айтишных созвонов (30 и более минут), если вам, конечно, будет это интересно. Кстати, нашел очень классный проект под эту нишу: pasrom/meeting-transcriber (mac only)
Спасибо за обратную связь!
Разную длину входных файлов я уже проверил здесь, корпус "live" это кусочки от 10 секунд до пары минут, а "medium" — это 10-минутное видео, принципиальной разницы между 10 минутами и 30 (или 60) нет, насколько мне известно.
Единственное, что тут не протестировано, это диаризация, то есть разбивка на спикеров, но для большинства исследованных моделей это делают внешние надстройки, и в целом в фокус поиска лучшего инструмента именно для голосового набора это наверное не входит.
У GigaAM есть 3е версия модели (end-to-end). Она возвращает английские слова и цифры, как Whisper. Работает гораздо быстрее, конечно.
статья помогла собрать флоу https://github.com/antirek/calls-pipeline


Я ошибался: бенчмарк 23 ASR-нейросетей для русской айтишной диктовки