непонятная позиция.
что значит «как ему скажешь»? понятно, что дело в алгоритмах, но я о том и говорю, что нынешняя разновидность алгоритмов — статистические — имеет важные «родовые» недостатки. однако успешность этого подхода как такового уводит от более интересных направлений.
Выражу не очень популярное мнение, но мне кажется, что Гугл переводчик — это в известной степени шаг назад. Конечно, очень здорово, что он существует, я сам им пользуюсь, если требуется, но некоторая успешность статистического перевода отвлекает людей от более серьёзных попыток влезть в структуру каждого отдельного языка.
Мне кажется, что у статистического перевода есть свой «потолок», который вот-вот будет достигнут. А дальше «чистой массой» не возьмёшь уже. Особенно хорош статистический перевод на близкородственных языках (английский-французский).
Если взять языки совсем разные (напр., финский-русский), то уже на простых предложениях можно получить белиберду. Хотя, по идее, для компьютера родственность языков не должна играть никакой роли. Если предложение правильно разобрано, его можно перевести на другой язык, даже совсем иной языковой семьи.
В общем, будем смотреть, что да как пойдёт дальше.
а мне кажется, что плохо.
я понимаю, что может искажаться смысл, но посмотрите — он даже не умеет согласовывать слова по простым синтаксически-морфологическим признакам.
Например, «машина службе» — ну не может быть такого сочетания.
да и статья простая, конечно; вообще машинный перевод пока больше достижений имеет в количестве, а не в качестве…
Нормальный админ не делает это посреди рабочего дня. Всегда можно найти время — в конце концов, ставить автоматом ночные обновления. Ну и другие способы есть. В конце концов, Гугл тоже когда-то свои сервера ребутит, но мы этого не замечаем.
А по поводу dll ещё раз: я не совсем понял вопрос. Если речь о том, что надо обновить библиотеку принудительно, то это это другая задача.
Предположим, есть софт А и софт Б. Они юзают библиотеку Д разных версий.
Если с софтом Б выходит более новая библиотека Д, только Б её и использует. А софт А продолжает использовать свою версию.
Если в библиотеке Д нашли ошибку, то нужен отдельный патч для А и отдельный патч для Б — по крайней мере, мне кажется, что это так работает.
Вообще довольно странная (и забавная) позиция. Некая ОС требует иногда перегружаться при установке софта. Ну казалось бы, что за чепуха — нажал ребут, а сам пошёл чаю налить. Пока налил, уже и ребутнулось.
Нет, надо из этой ерунды развивать слонообразную тему — о том как, оказывается, всё плохо. Да господи, перезагрузил — забыл, не велика беда.
По поводу dll hell (обновили прогу, а она не пашет) — согласен, но это совсем другая проблема. Пытались сэкономить на размере, винчестеры были дорогими. Теперь уже не пытаются — любое .net приложение, например, устанавливает свою dll совместно с предыдущими версиями (не обновляя систему). Так что по идее, про эту проблему можно потихоньку начать забывать.
Из личного опыта — механизм распознавания по двухбуквенным сочетаниям работает более чем неплохо.
Выдаваемые «вероятности», как уже указывали, неважны — берём верхний элемент списка и все дела.
В папке languages лежат эталонные языки.
В папке testdocs — документы, для которых нужно определить язык.
Запускаете lngrecogn.exe bigram и смотрите результаты.
Можно попробовать посмотреть результат не по частотности сочетаний, а целых слов:
lngrecogn.exe wordfreq
Писалось для ascii, но для utf доработать, думаю, нетрудно.
Совок-не совок, а вот я видел в одной _очень_ крупной гейм-девелоперской фирме в Северной Америке такую систему. На комп сразу ставится весь соответствующий софт, отслеживающий любую «левую» активность. В интернете ещё лазить можно (не оставлять же разработчиков без MSDN'а?)
А вот если попытаться что-то установить или воткнуть (не дай бог) флешку, тут же у мальчиков из «компьютерной охранки» загорится лампочка, они прибегут и вставят по первое число.
Если флешку воткнуть надо (или софт поставить), вызываются эти мальчики и контролируют весь процесс.
1) вот у меня как раз самое яркое впечатление от работы в Латехе — бесконечная компиляция и перекомпиляция после того, как этот друг неверно отформатирует документ.
Сначала он отказывается переносить правильно какое-то слово, и оно вылезает за край (а я это вижу, конечно, только ПОСЛЕ компиляции и просмотра всего 150-страничного документа). Затем оказывается, что таблица не может сама перелезть через границу страницы — только после танцев с бубном и специальных тегов. Ну и т.д. Форматирование листингов программ — отдельная песня. Как я могу быть уверен, что строчка не вылезла за край страницы? Руками считать? ;)
2) Да, изменилось. В частности, любой вменяемый редактор формул поддерживает ТеХ-синтаксис (насчёт встроенного не уверен, но MathType точно).
Когда я был аспирантом (поступил в 2004 году), этот дурацкий курс «IT в научной деятельности» только появился. Подозреваю, что название просто спустили сверху и сделали курс обязательным, а уже сам университет решал, что конкретно будут преподавать.
У нас формально были основы UNIX и TeX. На практике устроили халяву, экзамен был достаточно условным.
В принципе, все эти извращённые следствия («Виста и т.п.») всего лишь вытекают из извращённой организации высшего образования вообще. Раньше было три экзамена: специальность, философия, иностранный язык.
Потом придумали ещё пару предметов, а вузы пусть выкручиваются как хотят. Ну вот и выкрутились, насколько им позволяли внутренние возможности.
> «Предположим, что у вас древняя модель телефона без Т9»
Если это действительно предположить, то данная разработка не поможет. Ибо древний телефон не переделать.
А если телефон новый, там есть T9 :)
Хотя теоретически интересно, конечно. Но клавиатура Дворака на РС так и не прижилась…
что значит «как ему скажешь»? понятно, что дело в алгоритмах, но я о том и говорю, что нынешняя разновидность алгоритмов — статистические — имеет важные «родовые» недостатки. однако успешность этого подхода как такового уводит от более интересных направлений.
Мне кажется, что у статистического перевода есть свой «потолок», который вот-вот будет достигнут. А дальше «чистой массой» не возьмёшь уже. Особенно хорош статистический перевод на близкородственных языках (английский-французский).
Если взять языки совсем разные (напр., финский-русский), то уже на простых предложениях можно получить белиберду. Хотя, по идее, для компьютера родственность языков не должна играть никакой роли. Если предложение правильно разобрано, его можно перевести на другой язык, даже совсем иной языковой семьи.
В общем, будем смотреть, что да как пойдёт дальше.
я понимаю, что может искажаться смысл, но посмотрите — он даже не умеет согласовывать слова по простым синтаксически-морфологическим признакам.
Например, «машина службе» — ну не может быть такого сочетания.
да и статья простая, конечно; вообще машинный перевод пока больше достижений имеет в количестве, а не в качестве…
А по поводу dll ещё раз: я не совсем понял вопрос. Если речь о том, что надо обновить библиотеку принудительно, то это это другая задача.
Предположим, есть софт А и софт Б. Они юзают библиотеку Д разных версий.
Если с софтом Б выходит более новая библиотека Д, только Б её и использует. А софт А продолжает использовать свою версию.
Если в библиотеке Д нашли ошибку, то нужен отдельный патч для А и отдельный патч для Б — по крайней мере, мне кажется, что это так работает.
Нет, надо из этой ерунды развивать слонообразную тему — о том как, оказывается, всё плохо. Да господи, перезагрузил — забыл, не велика беда.
По поводу dll hell (обновили прогу, а она не пашет) — согласен, но это совсем другая проблема. Пытались сэкономить на размере, винчестеры были дорогими. Теперь уже не пытаются — любое .net приложение, например, устанавливает свою dll совместно с предыдущими версиями (не обновляя систему). Так что по идее, про эту проблему можно потихоньку начать забывать.
Так что совершенно согласен, лучше уж сделать «напалечник», который озвучивает обычный текст.
Выдаваемые «вероятности», как уже указывали, неважны — берём верхний элемент списка и все дела.
Сам как-то писал такую программу.
В папке languages лежат эталонные языки.
В папке testdocs — документы, для которых нужно определить язык.
Запускаете lngrecogn.exe bigram и смотрите результаты.
Можно попробовать посмотреть результат не по частотности сочетаний, а целых слов:
lngrecogn.exe wordfreq
Писалось для ascii, но для utf доработать, думаю, нетрудно.
всё-таки европейцы объективно больше отличаются друг от друга.
блондин-брюнет, глаза карие или голубые — хотя бы.
а азиаты практически все брюнеты с тёмными глазами.
А вот если попытаться что-то установить или воткнуть (не дай бог) флешку, тут же у мальчиков из «компьютерной охранки» загорится лампочка, они прибегут и вставят по первое число.
Если флешку воткнуть надо (или софт поставить), вызываются эти мальчики и контролируют весь процесс.
Сначала он отказывается переносить правильно какое-то слово, и оно вылезает за край (а я это вижу, конечно, только ПОСЛЕ компиляции и просмотра всего 150-страничного документа). Затем оказывается, что таблица не может сама перелезть через границу страницы — только после танцев с бубном и специальных тегов. Ну и т.д. Форматирование листингов программ — отдельная песня. Как я могу быть уверен, что строчка не вылезла за край страницы? Руками считать? ;)
2) Да, изменилось. В частности, любой вменяемый редактор формул поддерживает ТеХ-синтаксис (насчёт встроенного не уверен, но MathType точно).
пробовал даже сдавать книги на 320 страниц (с таблицами, графиками и рисунками).
впечатления сугубо положительные.
а от Латеха (с ним тоже приходилось иметь дело) впечатления куда хуже…
А здесь мы видим действительно современную разработку. Очень рад, что наконец такое появилось!
У нас формально были основы UNIX и TeX. На практике устроили халяву, экзамен был достаточно условным.
В принципе, все эти извращённые следствия («Виста и т.п.») всего лишь вытекают из извращённой организации высшего образования вообще. Раньше было три экзамена: специальность, философия, иностранный язык.
Потом придумали ещё пару предметов, а вузы пусть выкручиваются как хотят. Ну вот и выкрутились, насколько им позволяли внутренние возможности.
на мой субъективный взгляд — наоборот, в латехе извращение :)
кому как нравится.