Пример хороший, но, слово за слово — и в обсуждении уже появился уточняющий контекст, без которого выбор варианта перевода во многих случаях не представляется возможным.
Думаю, оценка качества перевода на 200 языков в формате «один к одному» (всегда нужно выбрать самый распространённый вариант, даже если вариантов перевода десять) — практически лишена смысла.
Google использует статистические методы перевода. Когда нет непосредственной пары значений исходный язык -> язык назначения, вместо того, чтобы сказать «я не знаю», он «проходит» через промежуточный язык с возможной потерей смысла. Тем более, если этот язык со сравнительно скудным набором слов, такой как английский, где одно слово может быть и глаголом и существительным.
Попробуйте перевести «муху» с латинского на английский.
Да и столь высокие требования к качеству перевода едва уместны в конкретно этой реализации, где для каждого перевода выбирается только один вариант и отсутствует контекст.
Но я готов принять в дар токен для API, которое решит эту задачу лучше Google.
Google даёт описательный перевод «олений мох», а не словарное jäkälä . Коэффициент связи с этим вариантом получается примерно в два раза выше чем с «оленим мхом».
Тестовые запросы этимологической связи:
ягель ↔ jäkälä ≈ 0.11
ягель ↔ sammal ≈ 0.12 (ягель ↔ мох)
ягель ↔ poron sammal ≈ 0.06
Но все эти варианты ниже порога 0.5 — поэтому в этимологический кластер с RU Финляндия в автоматическом режиме не попадает.
К тезису в вашем комментарии выше: почему это «по-русски», а не «по-турецки» (один из вариантов идентичного произношения)? Вот в этом и есть главный довод национально-инспирированного внимания к этому слову, которое русским не является.
Давайте рассуждать, что именно покажет этот эксперимент?
Я думаю, он покажет, что белорусы почти поголовно в быту говорят на русском языке. И, разумеется, поскольку по русски "чай", результат закономерен.
В доводах за «гарбату» читается борьба за свободу языка от «русского» слова «чай», коим оно не является. Сам источник цитаты (svaboda) выше — очень характерный.
С точки зрения практического смысла, если сделать 1000 тестовых заказов «чая» в 1000 разных точках Беларуси — уверен, корверсия в ожидаемый результат без уточнений будет 100%. Ровно так же и в Индии.
Поэтому справедливо утверждать: - Перевод корректный (допустимый); - К попытке отстроить языковую идентичность от крупного соседа — с точки зрения этимологии случай вряд ли имеет отношение.
Если не смотреть с точки зрения беспристрастного статистического перевода, то дотошность в вопросе чая-гарбаты в белорусском языке, вероятно, граничит с национализмом:
Максім Гарэцкі, між іншым, нават упікаў ў дваццатых гадох Міхасю Лынькову, што той піша ў сваіх творах “чай” замест літаратурнага “гарбата”. Пасьля, праўда, арыянтыры зьмяніліся, і чай ледзь не напоўніцу выцясніў гарбату
В первой трети ХХ века чай культивировался преимущественно в молодом белорусском литературном языке . В купольной «Павлинке», например, все пьют «гарбату», а не «чай». Кстати, Максим Харецкий даже ругал Михаила Линкова в двадцатые годы за то, что тот писал в своих произведениях «чай» вместо литературного «гарбата». Позже, однако, правила изменились, и «чай» почти полностью вытеснил «гарбату».
Для выбора языка используется Babel. За редким исключением (обсуждали выше) для каждой страны язык сейчас выбирается автоматически. Логика в данном случае такая:
Babel для KZ (de_facto=True) возвращает:('ru', 'kk') — русский > первым (CLDR population_percent 72% vs 64% у казахского).
Вопрос, конечно, дискуссионный. Но правильнее всего, думаю, если это будет востребовано — дать в интерфейсе каждому возможность выбрать любой релевантный язык из списка для нужной страны.
Есть тестовый набор корректного и некорректного объединения, текущая конфигурация даёт на нём лучший результат. Например, если добавить из источников связи типа сognate/mention, то общий показатель точности будет ниже: связей станет больше, памідор с большой вероятностью попадёт в нужную группу, но ложные объединения испортят метрику качества.
Да, выбираются самые популярные из официальных. Например, для Казахстана выбран Русский. Но можно подумать про реализацию выбора языка для любой страны.
Пример хороший, но, слово за слово — и в обсуждении уже появился уточняющий контекст, без которого выбор варианта перевода во многих случаях не представляется возможным.
Думаю, оценка качества перевода на 200 языков в формате «один к одному» (всегда нужно выбрать самый распространённый вариант, даже если вариантов перевода десять) — практически лишена смысла.
Google использует статистические методы перевода. Когда нет непосредственной пары значений исходный язык -> язык назначения, вместо того, чтобы сказать «я не знаю», он «проходит» через промежуточный язык с возможной потерей смысла. Тем более, если этот язык со сравнительно скудным набором слов, такой как английский, где одно слово может быть и глаголом и существительным.
Попробуйте перевести «муху» с латинского на английский.
Да и столь высокие требования к качеству перевода едва уместны в конкретно этой реализации, где для каждого перевода выбирается только один вариант и отсутствует контекст.
Но я готов принять в дар токен для API, которое решит эту задачу лучше Google.
Google даёт описательный перевод «олений мох», а не словарное
jäkälä. Коэффициент связи с этим вариантом получается примерно в два раза выше чем с «оленим мхом».Тестовые запросы этимологической связи:
ягель↔jäkälä≈ 0.11ягель↔sammal≈ 0.12 (ягель ↔ мох)ягель↔poron sammal≈ 0.06Но все эти варианты ниже порога 0.5 — поэтому в этимологический кластер с RU Финляндия в автоматическом режиме не попадает.
Это в точку, спасибо! Задебажу, расскажу
Между рублём и рупией, насколько я понял, подтвержденной этимологической связи нет, есть только связи на уровне гипотез
Хороший вопрос! Закинул разменные деньги «на карту» и вот что вышло (без перевода на русский).
То самое «копьё», «я сегодня без копья»!
«За работу в этом лагере не платили ни копья...»
Алексанр Солженицын
https://mapus.ai/map/b9b3f677b58fe620
Да, верно, спасибо!
«Драхма» — пограничное значение, при обновлении иллюстраций «мигает», не заметил.
К тезису в вашем комментарии выше: почему это «по-русски», а не «по-турецки» (один из вариантов идентичного произношения)? Вот в этом и есть главный довод национально-инспирированного внимания к этому слову, которое русским не является.
Если к ним на улице подойдёт турок и скажет «çay» — поймут ли они его?
В доводах за «гарбату» читается борьба за свободу языка от «русского» слова «чай», коим оно не является. Сам источник цитаты (svaboda) выше — очень характерный.
С точки зрения практического смысла, если сделать 1000 тестовых заказов «чая» в 1000 разных точках Беларуси — уверен, корверсия в ожидаемый результат без уточнений будет 100%. Ровно так же и в Индии.
Поэтому справедливо утверждать:
- Перевод корректный (допустимый);
- К попытке отстроить языковую идентичность от крупного соседа — с точки зрения этимологии случай вряд ли имеет отношение.
«Форточка» есть только в странах с богатыми недрами!
Если не смотреть с точки зрения беспристрастного статистического перевода, то дотошность в вопросе чая-гарбаты в белорусском языке, вероятно, граничит с национализмом:
https://www.svaboda.org/a/24825947.html
Не совсем так. Точнее, язык выбран белорусский
Пока что выбирается самай распространённый язык из официальных:
https://github.com/python-babel/babel
И ещё одна
Вот хорошая иллюстрация на эту тему. Двойственный перевод для Беларуси на ней, кстати, тоже показан.
Для выбора языка используется Babel. За редким исключением (обсуждали выше) для каждой страны язык сейчас выбирается автоматически. Логика в данном случае такая:
Вопрос, конечно, дискуссионный. Но правильнее всего, думаю, если это будет востребовано — дать в интерфейсе каждому возможность выбрать любой релевантный язык из списка для нужной страны.
Это неполнота данных для графа.
Есть тестовый набор корректного и некорректного объединения, текущая конфигурация даёт на нём лучший результат. Например, если добавить из источников связи типа сognate/mention, то общий показатель точности будет ниже: связей станет больше, памідор с большой вероятностью попадёт в нужную группу, но ложные объединения испортят метрику качества.
Да, слово «кот» c финским «kissa» — украшение карты :-)
Да, выбираются самые популярные из официальных. Например, для Казахстана выбран Русский. Но можно подумать про реализацию выбора языка для любой страны.