Обновить
332
Maxim Mozgovoy@rg_software

university professor and software developer

155
Подписчики
Отправить сообщение
Maltparser'у можно подать на вход любой набор тегов. Т.е. можно спокойно составить теги вида «сущ-ед.ч.-родит» и тренировать парсер на них.
А по Хомскому незачем, Хомский свою систему разрабатывал для английского, где важен порядок слов. Для европейских языков dependency grammars уже, можно сказать, победили.
Самый разумный метод, который я видел — это генерация всех допустимых комбинаций с последующим ранжированием (т.е. оценкой качества графа). В данном случае применяется правило «существительное раньше дополнения», повышающее оценку первого варианта.

Мы ведь так и делаем — см., «добро побеждает зло».

А компьютер — он такой шалунишка… среди самых забавных трактовок, с которыми сталкивался — «он увидел её перед своими глазами» и «он имел помощником экономиста». Распарсьте-ка в уме :)
Stanford и Berkeley точно так же на статистике основаны, как и прочие («Q: Can I train the parser? A: Yes, you can train a parser»). ЭТАП — это, насколько знаю, довольно древняя махина, разрабатывающаяся с давних пор, и в этом смысле может быть уподоблена системам вроде Systran. Да, существуют, да, развиваются, но идеология там заложена очень давно и не менялась.

По поводу прилагательных, существительных и подлежащих — да бросьте, тут и парсер не нужен. Ближайшее к существительному прилагательное слева — искомое; первое существительное фразы — подлежащее. Такой простейший алгоритм уже даст вам хорошую точность. А если хоть немного улучшить, получится вполне сносно.

По поводу теггеров — моё личное мнение, что эта цифра в 99% крайне лукава. Мне самому не удавалось для английского выйти за пределы 97%, при этом baseline performance теггера (т.е. если всегда тупо приписывать слову самый вероятный тег) составляет 85% или около того. Если обращать внимание только на те слова, для которых производится хоть какой-нибудь выбор, качество моментально падает.

Кроме того, лукава разметка Penn Treebank, на которой обычно теггеры и тестируют. Например, в сочетаниях вроде «computer software» слово «computer» считается существительным, модифицирующим другое существительное, а не прилагательным, как сказал бы лингвист. Конечно, если делать такие допущения, можно добиться и 99%, да толку-то…
Ну, что тут говорить… ура, товарищи! Это великое достижение научной мысли :)
1) > Метод, основанный на правилах, применяется практически во всех коммерческих системах
Есть какой-нибудь пруф? Мне казалось, что как раз наоборот, сейчас всё на статистике работает.

2) Чем ваш эксперимент отличается от описанного в статье Parsing the Syntagrus?

3) > Данная модель показала точность (accuracy) в 78,1%, что довольно таки неплохо и для большинства целей вполне подходит.
Это state-of-the-art, но на самом деле это ничерта не подходит. Это означает ошибку практически в КАЖДОМ предложении, т.к. измеряется правильность присоединения слова.

Я тоже активно интересуюсь синтаксическим анализом. Мне кажется, что будущее как раз за комбинированным методом — автоматическое извлечение правил, только не из текста, а из размеченного корпуса. Мне кажется, что низкое качество анализа вызвано несколькими очевидными причинами:

а) Разметка частей речи плоха. В русском с этим попроще, а вот в английском, как ни бейся, получается хуже (т.к. одно и то же слово может быть чем угодно). Человек распознаёт части речи в зависимости от контекста, а в современных анализаторах эти процессы «разнесены по этажам». Их нужно совместить.

б) Алгоритмы машинного обучения вероятностны, язык сложен. Шаг вправо-шаг влево от обучающего корпуса — и возникают глупейшие ошибки образования связей. Я уверен, что машинное обучение должно совмещаться с лингвистическим знанием, т.е. надо не просто учиться на корпусе, но и генерировать в результате процесса некую формальную грамматику языка.

в) Не учитывается семантика (пока что). Если два слова можно совместить синтаксически, ещё не значит, что их можно совместить семантически. Эти вещи тоже учатся из корпуса, в теории.

Я в этом году был в Финке проездом, вопрос подробно не изучал, но вроде нельзя. Они в частности сказали, что деньги идут в том числе и на развитие интернет-сайтов государственных СМИ, а их посещение к телевизору не привязано, и заходить на сайт они тоже никому запретить не могут. Так что пусть все платят.
Для этого вам надо знать, не какими языками владеют коллеги, а где они работают.
Да, но в рейтинге тоже не учтён язык Brainfuck.
А вообще насколько корректно составлять рейтинг зарплат в зависимости от языка программирования? По-моему, это то же самое, что оценивать зарплату футболистов по фирме-изготовителю используемых футболок.

По-моему, очевидно, что зарплата определяется осбенностям того или иного работодателя, а не технологиями на их производстве.
Ещё не стоит забывать, что США любовно пестуют имидж себя любимой как лучшей страны в мире, и у простого мексиканца из деревни возникает ощущение, что «там за стеной» его ждут молочные реки и кисельные берега. А реальность, к сожалению, совсем иная — на десяток выбившихся в люди приходится сотня тех, кто продолжает жить как у себя дома, если не хуже.

Короче говоря, тяга к халяве неистребима.
Да идиот этот Ассандж. Вроде умный мужик, а связался с такой эээ… барышней, про которую с самого начала всё было ясно. Ну вот так сильно она ему понадобилась? В Швеции проституция легальна, уж если захотелось — пойди купи.
Ну это тоже странная логика. Я, конечно, понимаю, что существует «правоприменительная практика», но закон всё-таки плох или хорош сам по себе тоже. Т.н. «развитые государства», в отличие от нашего, просто умеют играть тонко и медленно. Они откусывают себе потихоньку по маленькому кусочку, и люди в итоге мирятся, потому что каждый кус вроде как невелик.

Скажем, с этого года в Финляндии взимают налог на телевидение вне зависимости от того, есть ли у вас телевизор/компьютер, причём сумма налога растёт пропорционально вашим доходам. Я не думаю, что этот бредозакон прокатил бы в таком виде, но они долго к нему шли.
ну так надо решать, а не на хабре дискутировать!
Всё просто: каждый решает свою конкретную задачу наиболее экономным способом. Я понимаю, что «лучше день потерять, а потом за пять минут долететь», но не у всех есть этот день.
Вот и хорошо, подождём взрослых штанишек — а там уже критикуйте отсталость нынешних технологий в своё удовольствие! :)
> Ну, так это умели делать и во времена МАРК-1, ещё 55 лет назад.

Конечно, умели! Если почитать публикации сорокалетней давности, они и машинный перевод делать умели и распознавание образов, вообще всё умели.

Мысль ваша ясна и в общем-то разумна: если бы компьютер был ребёнком, ему не надо было бы знать семантику, морфологию и проч., он бы сам всему научился в процессе общения.

Проблема лишь в том, что компьютер не ребёнок. Если бы компьютер был человеком, ему не надо было бы хранить огромные базы готовых ходов для шахмат — он бы сам придумывал хорошие ходы из головы. Но как показала практика, гораздо проще запихнуть в компьютер базы ходов, чем сделать из компьютера мыслящий организм.

Поэтому — да. В перспективе хотелось бы, чтобы компьютер сам учился и понимал, что да как. Но я думаю, что ни дети, ни внуки мои до этого не доживут. Так что будем пока по старинке.
Вы сейчас приводите кучу безосновательных, недоказанных утверждений, поэтому я даже не знаю, с чем конкретно спорить.

Синтаксический анализ или извлечение смыслов — это просто разные задачи.
Если меня интересует, скажем, извлечение именованных объектов из текста, мне наплевать на смысл — я всего лишь хочу вытаскивать существительные и прилагательные, если надо.

Вы же сами говорите: текст — это всегда код. В любом компиляторе компьютерных языков можно выделить лексический, синтаксический и семантический анализ. Здесь речь идёт о синтаксическом анализе — обязательном среднем звене этой цепи.

Давления «американской школы» здесь нет, за последние 10 лет подтянулась Европа со своими подходами, альтернативными идеям Хомского, напр.
Ну почему же. Соревнования — это хорошо, я как раз отслеживаю результаты конкурсов CoNLL. Периодически появляются интересные разработки. Вы правы в том, что результаты очень часто лукавы — на соревнованиях парсер показывает какие-нибудь 97%, а потом начинаешь изучать что да как и понимаешь, что не всё радужно. Но это всё-таки действо, люди готовятся к нему, выкладывают новые разработки…

А по поводу бесперспективной технологии — это вы тем более напрасно, за последние 60 лет прогресс очень даже есть. Не машинный перевод, конечно, но в отдельных номинациях есть что представить.
Я понимаю, что тема широка, но не понимаю фразы «достаточно значимая часть задач, решаемых в области информационных технологий, связана с использованием английского языка».

Хочешь идти в программисты — учи английский язык, это и так ясно. В том числе и термины предметной области (так же как и химики, и биологи, и инженеры, и все остальные).

Если речь об этом (основная масса материалов на английском ==> учите английский), можно было так и сказать.

Информация

В рейтинге
4 346-й
Откуда
Фукусима, Япония
Дата рождения
Зарегистрирован
Активность