Обновить

Комментарии 5

GigaAM multilingual гораздо точнее висперов для узбекского/казахского, не говоря о специализированных моделях для телефонии.

Я для своего моста для голосового управления Claude (мой личный кейс) выбрал Giga v3 подтверждаю но многих тестах она даже Yandex Cloud Kit уделывает на шумных записях. Работает причем локально. Для обратного я все твки сам юзаю Yandex голоса звучат максимально естественно. Silero как резерв со словарем ударений + xenia

Спасибо, нужно будет попробовать. Для каких то клиентов в kz - uz связь "Giga - Сбер - санкции" будет неприемлема, но для каких то нормально.

В интернетах пишут, что у Giga есть какие то проблемы с пунктуацией, вроде пунктуация есть только в русскоязычной линейке. И при Giga нужно возиться отдельно с сегментацией, то есть разбивкой на реплики с таймстемп.

Подскажите пожалуйста, Вы сталкивались с проблемами с сегментацией?

По сегментации точно не отвечу: у меня задача проще — один говорящий, команды и диктовка в колонку, таймстемпы по репликам не нужны. Что знаю точно. У v3 (e2e_rnnt) обычный transcribe берёт до 25 с, а штатный longform тянет pyannote с токеном HF — я его брать не стал и режу длинное сам: куски около 20 с, разрез по самому тихому месту в хвосте куска (энергия окнами по 30 мс), распознаю по очереди, склеиваю. Границы кусков известны, то есть грубые метки времени есть, но это не реплики и не диаризация. В вашей телефонии с двумя каналами проще: канал = говорящий, внутри канала резать VAD-ом.

Минусы, которые намерил. На длинных записях изредка теряется фраза на стыке кусков — 1 запись из 257. «Э-э» и «а-а» честно пишет в текст. Редкие имена собственные коверкает. На эталонном чтении 80 с WER у GigaAM v3 и у Яндекса v3 вышел одинаковый — 11,3 % (числа приведены к словам). На коротких фразах издалека разрыв большой: 94 из 98 против 51 у Яндекса v1. Работает на процессоре, без видеокарты: около 0,2 с на короткую команду, модель 429 МБ.

Про «Giga — Сбер — санкции». Технически это веса под MIT, которые крутятся у вас в периметре и никуда не ходят — с облаком Сбера связи нет. Но если комплаенс клиента смотрит на происхождение модели, а не на потоки данных, аргумент тут не инженерный, и спорить с ним бессмысленно.

Многоязычную версию не пробовал, у меня только русский — про пунктуацию в ней ничего не скажу. В русской v3 e2e пунктуация и цифры идут из коробки, для моих задач хватает.

Можно попробовать gigastt (https://github.com/ekhodzitsky/gigastt) — я его разрабатываю. Там есть GigaAM multilingual для казахского и узбекского, работает и на CPU. Мы недавно выложили тесты (https://github.com/ekhodzitsky/gigastt/blob/main/docs/languages.md), но на ваших смешанных телефонных разговорах ещё надо проверять. Интересно, как он покажет себя рядом с вашим вариантом.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации