Обновить
332
Maxim Mozgovoy@rg_software

university professor and software developer

0,1
Рейтинг
155
Подписчики
Отправить сообщение
Я тоже не знаком, но если понял из источников, проблема в том, что в некоторых случаях там порядок слов очень свободный (см. мой коммент выше). Поэтому выбрать чёткие правила трудно.
Ну это то же самое, что «он увидел её перед своими глазами» :)
Проблема множественного разбора — но непроективности тут нет, к счастью!
Принципиальная разница:

В правилах лексикализованной грамматики В ЯВНОМ ВИДЕ присутствуют слова языка.
В нелексикализованных грамматиках слова не фигурируют, есть лишь абстрактные понятия.
а что не так со «стеклом»? ну многозначное слово, это ерунда :)

0,5% — это непроективные конструкции, которые остаются формально недоступными для «ограниченного» парсера, но по-прежнему доступны «неограниченному» (NP-полному).
Да, эта фраза в разном виде гуляет по источникам.
Тут вот какая штука: в русском проблема непроективности, насколько я чувствую, не столь важна (непроективные конструкции довольно странно звучат по-русски).
Но в немецком и родственных языках это актуально. Может, тут есть специалисты… в статьях, которые я читал, описывается такая проблема. В придаточных предложениях (Х в фразах вида «Я видел как X») субъекты, объекты и обстоятельства сбрасываются в левую часть в определённом порядке, а в правую часть (называемую «глагольным кластером») идут все глаголы в почти произвольном порядке. Оттуда и непроективность.
По правде говоря, я не думаю, что здесь лежит основное поле битвы между статистикой и правилами. В конце концов, никакая статистика не поможет понять, что подразумевается под «девушкой с косой». Если фраза неоднозначна, она неоднозначна что по правилам, что по статистике.

Вообще критикуя статистику, я говорил прежде всего о «наивной статистике». Грамматические правила тоже могут быть извлечены статистическим путём. Но потом парсеру всё равно надо с ними работать, и проблемы у него будут те же самые (ему-то какая разница, написаны правила вручную или извлечены из наблюдений).
Я так понимаю, что в самом словаре приведено достаточно обширное описание сути дела. Но есть и целенаправленная книга:

А. А. Зализняк. «Русское именное словоизменение» с приложением избранных работ по современному русскому языку и общему языкознанию. М.: Языки русской культуры, 2002.
Понятно. Ну по поводу морфологии я честно скажу, что не специалист. Для меня это вроде как «решённая задача» в том смысле, что есть хорошие готовые модули, а я их юзер. Вот парсинг — это другое…

Я только знаю, что Зализняк для русского действительно всё по полочкам разложил, и любой программер, прочитав его монографию, может написать приличный анализатор.
Ох, видел эту книгу. Не хочу никого обижать, но как-то я скептически к ней отношусь, хотя написано много чего любопытного… Грубо говоря, если бы всё и вправду было бы так хорошо, про переводчики ПРОМТ бы вообще никто не услышал.
Тут не школа, каждый изголяется по-своему :)
Похоже, что если по Хомскому, действительно субъект в явном виде не выражен.
А в dependency parsing — пожалуйста, это непосредственный потомок глагола, выраженный именительным падежом.
Ну я не знаю, чего вы хотите… Можно, конечно, взять все тома Journal of NLP за последние десять лет и изложить здесь все статьи с формальными моделями и грамматиками. Материя неисчерпаема вглубь — каждый автор статьи из упомянутого журнала чего-то новое да сказал своей статьей, иначе не напечатали бы.
Дойдём до dependency parsing, напишу подробнее, потому что это меня интересует.
Верно, но ведь с тем же успехом можно подобрать сложный пример для статистического парсера (т.е. как раз там, где будет «птица», «человек» и «летать», но при этом «летать» надо приписать человеку — «человеку в отличие от птицы летать хочется, а птица и так умеет»).
Да, ещё, «умеет летать» — это единая глагольная конструкция, думаю, тоже собирается любым парсером без проблем.
Виноват. Впрочем, я всё равно не понимаю, почему здесь не сработают обычные правила. Как раз в этом примере всё очевидно: субъект глагола «считаете» будет «вы» (мало того, что ближе всего, так ещё и согласуется морфологически).
А «умеет» хочет третье лицо, ед. число — кроме «птицы» туда просто нечего присоединить, так что любой парсер на правилах должен делать это вообще без проблем.
В принципе, я до этой презенташки дошёл, но всё равно не совсем понял механику. Т.е. я вижу, что они пытаются выдвинуться за счёт раннего обрубания альтернатив, но не совсем понятны принципы, по которым строится дерево.

Т.е. предположим, что альтернатив нет вообще. «Я купил диван». Как он будет клеить эти слова между собой и на каком основании?..
А по-моему, ваша ссылка только подтверждает мою точку зрения. На первой же странице они пишут, что наивный статистический подход (3-грамм) явно уступает попытке построить синтаксическое дерево зависимостей.
Да, дерево они строят с помощью статистических методов, но они и не пытаются доказать, что это лучше подходов, основанных на правилах/грамматиках.
Мне как раз кажется, что синтаксис есть объективное выражение семантики. Было бы странно предполагать обратное — что синтаксис взят с потолка и никак не связан со смыслом фразы. По поводу связей между понятиями — согласен. Более того, понятия выходят за рамки фразы и даже всего текста; но если взять обычную банальную фразу «мальчик пошёл в школу», по-моему, можно вполне чётко провести параллель между словами «мальчик», «пойти», «школа» — и соответствующими концептами «идейного» поля.

Но в принципе, конечно, да. Впрочем, о связях семантики и dependency links мы ещё поговорим.

Про учебник… я говорю об учебнике финского языка для иностранцев. Там фразы типа «снаружи холодно» (ulkona on kylmää) названы «предикативными предложениями». Для сравнения, простейшее предложение субъект-глагол-объект названо «первичным предложением» или как-то так.
То есть получается, что где-то статистика работает хорошо, а где-то плохо… В принципе, что и требовалось доказать :)

По поводу обучения языку — понятно, что ребёнок, познающий родной язык, только статистикой и пользуется. Но взрослому, мне кажется, лучше давать в явном виде правила (хотя тут есть разные школы).

А уж про синтаксис дело ясное — кто из нас не вбивал спорную фразу в поисковик, чтобы убедиться, что другие так говорят?..
А вот не скажите. Важно понять не только, как не говорят, но и почему так не говорят. Человек (явно или неявно) формирует в голове правила. ОК, я знаю, что нельзя сказать «я съел пирожному». А можно сказать «я съел мясу»? А «я съел морковке»? :) Всего не перечислишь, и объяснить общее правильно, насколько понимаю, необходимо.
Насчёт компиляции — просто не знаю. Фортран уже был создан к 1957 году, соответственно, что из работ Ершова было ново и реально применено к этому времени — обсуждать не готов.

Информация

В рейтинге
3 172-й
Откуда
Фукусима, Япония
Дата рождения
Зарегистрирован
Активность