Обновить

Мы опубликовали стабильный, быстрый, качественный и доступный синтез ещё для 29 языков России

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели16K
Всего голосов 31: ↑30 и ↓1+35
Комментарии19

Комментарии 19

"вот же круто... а зачем?" даже в моем райцентре в РБ микрорайоны разговаривают чуть по-разному. о том, что это смесь русского и белорусского можно не упоминать

А причём тут белорусский? Тут только тюркские и кавказские языки. Конечно, там много заимствованных слов (и иногда видно, что слова имеют разную степень локализации), но сами языки настолько другие, что про смесь тут речи не идёт.

Затем чтобы в навигаторах и умных колонках в регионах была нормальная локализация. Это огромный непаханый рынок

Или вот ещё: детские игрушки с голосовым функционалом, мультики, передачи на родном языке. Нереально что-то найти. Книжки ещё встречаются, а с аудиоконтентом прям беда.

Ну эта модель — это скорее просто демка / наша работа на общественных началах, под определение коммерческого продукта для игрушек или модели для колонки она конечно не подходит

Настолько зажрались, что ли, что сложно сказать, кто такие "мы"? На протяжении всей статьи ни хрена не понятно, кто такие "мы". Вас тут что, все с полуслова узнают? Да и вообще статья похожа на нейрослоп. Сложно что ли написать вначале о себе?

Гугл отключили или просто утро не задалось?

Конечно из-за ИИ звучит немного странно, но в принципе нормально. Аварский язык

Ну тут нет "ИИ" в понимании, которое в это публично вкладывают. Это просто синтез речи. Тут были определённые проблемы с чистотой и качеством входных данных, но синтез звучит на голову выше, чем наши старые модели.

Синтез сейчас упирается не в акустическую модель, а в нормализацию текста. Правильно расставить паузы сложнее, чем сгенерить сам звук

Ну и ещё синтез упирается в то, что он должен быть, как ни странно) Но да, Но санкцию текста можно сделать, только зная язык как родной или в совершенстве

Силеро как всегда молодцы - выкатили кавказскую модель на 15 языков для которых практически нет синтезаторов кроме их модели CIS . Синтезировал кабардинский и адыгский контрольный текст - скорость на мак мини 80х качество синтеза очень высокое у всех спикеров - ошибок практически нет. Одна удивительная особенность - спикеры на адыгском и абазинском читают кабардинский текст не хуже родных спикеров - так что по факту у нас не 3 голоса а целых 7 пригодных для кабардинского языка. Что еще интереснее синтез кабардинского спикерами осетинского ингушского чеченского почти идеален с небольшим акцентом - но вполне пригоден. Не знаю как ученные а на мой слух версия о едином про северкавказском корне у этих языков кажется вполне убедительной.

Мы по этой причине и заморалились вставить в одну модель языки близких языковых групп и семей, чтобы получился некий мультипликатор наших усилий. У языков очень похожи наборы фонем.

Ого, спасибо за удмуртский и кыргызский. У меня есть друзья - носители этих языков, при возможности попрошу оценить.

Попросите их выбрать ещё самый близкий язык к их языку и попробовать кросс-языковую генерацию потыкать, то есть голос с близкого языка на своём родном. Результат может удивить.

Хороший подгон для локальных проектов)

Я удалённый комментарий, конечно же прочитал. Но тут получилось, как мне кажется, очень иронично. Отвечу цитатой из вашей же статьи:

Дисклеймер: текущие LLM‑возможности позволяют детектировать «жирный» слоп. Но оценка может быть субъективной, и возможны ошибки, никогда не доверяйте оценке слепо: это обоюдоострый меч. 

Ну можно же банально проверять, что вы копипастите.

Ищу способ наоборт делать спич2текст конвертацию для популярных языков России типа татарского, может вы знаете хороший способ?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации