Я удалённый комментарий, конечно же прочитал. Но тут получилось, как мне кажется, очень иронично. Отвечу цитатой из вашей же статьи:
Дисклеймер: текущие LLM‑возможности позволяют детектировать «жирный» слоп. Но оценка может быть субъективной, и возможны ошибки, никогда не доверяйте оценке слепо: это обоюдоострый меч.
Ну можно же банально проверять, что вы копипастите.
Попросите их выбрать ещё самый близкий язык к их языку и попробовать кросс-языковую генерацию потыкать, то есть голос с близкого языка на своём родном. Результат может удивить.
Ну эта модель — это скорее просто демка / наша работа на общественных началах, под определение коммерческого продукта для игрушек или модели для колонки она конечно не подходит
Ну и ещё синтез упирается в то, что он должен быть, как ни странно) Но да, Но санкцию текста можно сделать, только зная язык как родной или в совершенстве
Мы по этой причине и заморалились вставить в одну модель языки близких языковых групп и семей, чтобы получился некий мультипликатор наших усилий. У языков очень похожи наборы фонем.
Ну тут нет "ИИ" в понимании, которое в это публично вкладывают. Это просто синтез речи. Тут были определённые проблемы с чистотой и качеством входных данных, но синтез звучит на голову выше, чем наши старые модели.
А причём тут белорусский? Тут только тюркские и кавказские языки. Конечно, там много заимствованных слов (и иногда видно, что слова имеют разную степень локализации), но сами языки настолько другие, что про смесь тут речи не идёт.
Ни разу не умаляю заслуг всех этих людей при разработке DOOM и Quake, но вот не припомню за ними всеми супер ярких успехов после эпохи DOOM / Quake. Это классический пример, когда 1+1 = 3, то есть команда собралась такая, которая смогла.
Тот же Ромеро делал неплохие современные wad-ы для дума на фоне ретро-мании (SIGIL), но откровенно говоря другие его проекты даже не пробивали шум для меня.
И самое грустное, после эпохи DOOM, похоже главное детище Кармака - движки id tech беседка по ходу в итоге похоронит.
Когда вы познакомитесь с "детскими" тарифами в такси — у вас откроется ещё одна чакра понимания компании Яндекс.
Ещё поинтересуйтесь кому сотрудники Яндекса в 2022 отдали целую базу Яндекс.Доставки и какие у этого были последствия, и понесла ли компания какое-либо наказание за это.
Ну идея примерно такая. Что в мульти-плейере могут играть игроки из разных стран. Они, скорее всего будут знать разные языки. Чтобы не ломать погружение, общение между самолётами должно быть по радио, на языке, который родной для пилота самолёта.
Как именно они хотят сделать, чтобы тебе был дубль текстом на твоём языке или чтобы ты слышал "родную" речь для пилота или родную речь для тебя самого — не знаю, но логично это в настройки вынести.
Что касается распознавания, ну его ещё надо сделать на N языков, тоже в качестве, чтобы крутилось на клиенте игры, что тоже непростая задача.
В любом случае вот эта идея пока чисто осталась в рамках идеи, её не доделали, насколько я знаю.
Есть какой-то шарм в этих простых jewel-кейсах. Что интересно, у буржуев ценятся копии иконичных игр в специальных больших коробках, типа с майкой / картой / книгой. Но я ни разу вживую вообще таких не видел, что у наших, что у буржуйских игр.
Недавно в исследовательских целях смотрел на CMUdict
Имхо, проблема этого словаря в том, что отдельно для английского он, в принципе, норм. Но в сочетании с другими языками — он недостаточно детальный. К примеру, если память не изменяет, там нет палатализации. К примеру, слово cute там записано как K Y UW1 T , хотя реально там звук kʲ стоит. Можно сравнить со словом cut, например. Ну и есть детали по гласным, но тут навскидку не вспомню уже.
Из плюсов ещё — путём небольших мытарств можно подрезать ударения, причём иногда двойные даже, что в теории может быть полезно. Поскольку ударение в большинстве языков недружественных стран почти не имеет смыслоразличительной функции (ну, +accent и acc+ent, или +ubersetzen / ubers+etzen), то они мало парятся с его сбором.
Минималистичная, пара десятков килобайт g2p моделька, влёт изучала половину корпуса
В идеале нужна точность 99%+ на имеющемся корпусе и генерализация в районе 90-95%. Но тут в английском этого в принципе на малых моделях сложно достичь. Всякие thoughtthoughthethoroughthistheme шлют пламенный привет.
Заметил, что в заимствованных словах — из итальянского, латыни, русского (!), других языков, которые из-за незнания опознать не смог — кроме написания, почти прямо заимствуется и произношение. То есть другие правила фонемизации. Это невозможно понять, можно только запомнить (анекдот про тарельку и фасол). После наивной кластеризации и их обучении по отдельности, качество каждой подмодели резко выросло.
Ещё нужно разделить кельтские слова, германские, французские, латинские, греческие. И ещё у них особо выдающиеся деятели языка делали реформы в духе "ну тут слова из разных языков пишутся по-разному, но произносятся одинаково, давайте перемешаем в кучу всё ещё раз, так будет прикольнее!". Там деятели приводят в пример всякие стихи времени Шекспира, когда можно было рифмовать blood и mood.
Так что модель тут имхо, особенно для топонимов, просто снимает с вас задачу печатать все фонемы. А просто вы прогоняете, слушаете, сверяете условно с гуглом или "бумажными" словарями и правите.
Я удалённый комментарий, конечно же прочитал. Но тут получилось, как мне кажется, очень иронично. Отвечу цитатой из вашей же статьи:
Ну можно же банально проверять, что вы копипастите.
Попросите их выбрать ещё самый близкий язык к их языку и попробовать кросс-языковую генерацию потыкать, то есть голос с близкого языка на своём родном. Результат может удивить.
Ну эта модель — это скорее просто демка / наша работа на общественных началах, под определение коммерческого продукта для игрушек или модели для колонки она конечно не подходит
Ну и ещё синтез упирается в то, что он должен быть, как ни странно) Но да, Но санкцию текста можно сделать, только зная язык как родной или в совершенстве
Мы по этой причине и заморалились вставить в одну модель языки близких языковых групп и семей, чтобы получился некий мультипликатор наших усилий. У языков очень похожи наборы фонем.
Ну тут нет "ИИ" в понимании, которое в это публично вкладывают. Это просто синтез речи. Тут были определённые проблемы с чистотой и качеством входных данных, но синтез звучит на голову выше, чем наши старые модели.
А причём тут белорусский? Тут только тюркские и кавказские языки. Конечно, там много заимствованных слов (и иногда видно, что слова имеют разную степень локализации), но сами языки настолько другие, что про смесь тут речи не идёт.
Инсталлятор обновлён до версии 1.0.2 с правкой багов при установке
Инсталлятор обновлён до версии 1.0.2 с правкой багов при установке
Sigil (5+) и Sigil 2 (4+) и его новые карты для Doom неплохи. Но в целом он явно перехайплен как дизайнер игр.
Ни разу не умаляю заслуг всех этих людей при разработке DOOM и Quake, но вот не припомню за ними всеми супер ярких успехов после эпохи DOOM / Quake. Это классический пример, когда 1+1 = 3, то есть команда собралась такая, которая смогла.
Тот же Ромеро делал неплохие современные wad-ы для дума на фоне ретро-мании (SIGIL), но откровенно говоря другие его проекты даже не пробивали шум для меня.
И самое грустное, после эпохи DOOM, похоже главное детище Кармака - движки id tech беседка по ходу в итоге похоронит.
Когда вы познакомитесь с "детскими" тарифами в такси — у вас откроется ещё одна чакра понимания компании Яндекс.
Ещё поинтересуйтесь кому сотрудники Яндекса в 2022 отдали целую базу Яндекс.Доставки и какие у этого были последствия, и понесла ли компания какое-либо наказание за это.
Ну идея примерно такая. Что в мульти-плейере могут играть игроки из разных стран. Они, скорее всего будут знать разные языки. Чтобы не ломать погружение, общение между самолётами должно быть по радио, на языке, который родной для пилота самолёта.
Как именно они хотят сделать, чтобы тебе был дубль текстом на твоём языке или чтобы ты слышал "родную" речь для пилота или родную речь для тебя самого — не знаю, но логично это в настройки вынести.
Что касается распознавания, ну его ещё надо сделать на N языков, тоже в качестве, чтобы крутилось на клиенте игры, что тоже непростая задача.
В любом случае вот эта идея пока чисто осталась в рамках идеи, её не доделали, насколько я знаю.
Ещё в CMU используется ARPABET. А он:
В ipa конвертится ну так себе
Под другие языки его не существует
Главное, что тут без человека не обойтись. И иногда ... этот человек это только местный.
Оно всё равно не будет читать слова типа
WorcesterЕсть какой-то шарм в этих простых jewel-кейсах. Что интересно, у буржуев ценятся копии иконичных игр в специальных больших коробках, типа с майкой / картой / книгой. Но я ни разу вживую вообще таких не видел, что у наших, что у буржуйских игр.
Имхо, проблема этого словаря в том, что отдельно для английского он, в принципе, норм. Но в сочетании с другими языками — он недостаточно детальный. К примеру, если память не изменяет, там нет палатализации. К примеру, слово
cuteтам записано какK Y UW1 T, хотя реально там звукkʲстоит. Можно сравнить со словомcut, например. Ну и есть детали по гласным, но тут навскидку не вспомню уже.Из плюсов ещё — путём небольших мытарств можно подрезать ударения, причём иногда двойные даже, что в теории может быть полезно. Поскольку ударение в большинстве языков недружественных стран почти не имеет смыслоразличительной функции (ну,
+accentиacc+ent, или+ubersetzen/ubers+etzen), то они мало парятся с его сбором.В идеале нужна точность 99%+ на имеющемся корпусе и генерализация в районе 90-95%. Но тут в английском этого в принципе на малых моделях сложно достичь. Всякие
thoughtthoughthethoroughthisthemeшлют пламенный привет.Ещё нужно разделить кельтские слова, германские, французские, латинские, греческие. И ещё у них особо выдающиеся деятели языка делали реформы в духе "ну тут слова из разных языков пишутся по-разному, но произносятся одинаково, давайте перемешаем в кучу всё ещё раз, так будет прикольнее!". Там деятели приводят в пример всякие стихи времени Шекспира, когда можно было рифмовать
bloodиmood.Так что модель тут имхо, особенно для топонимов, просто снимает с вас задачу печатать все фонемы. А просто вы прогоняете, слушаете, сверяете условно с гуглом или "бумажными" словарями и правите.
Идеальная иллюстрация сути английского языка в 1 видосе
Поменял картинку, спасибо
Потому, что это, вероятно, уже было "DLC" к оригинальной игре. Оригинальную обложку я нашёл вот в таком супер-качестве:
Скрытый текст