Обновить
332
Maxim Mozgovoy@rg_software

university professor and software developer

0,1
Рейтинг
155
Подписчики
Отправить сообщение
В любом случае это оффтопик. Автор не предлагает всем продавать самостоятельно свои произведения (а также закрывать студии и лабать кино на коленке). Утверждается, что издатель-производитель слишком широко раскрывает рот и устанавливает слишком высокие цены.

Вот я хочу на примере книг получить расчёт «разумной» цены для издательства.
Очевидно, на момент написания статьи N ссылка на статью N+1 не могла существовать в принципе.
Видите ли в чём дело — я готов признать, что электронная копия для «читалки» неплоха, если речь идёт о художественной литературе.
Но техническую книгу по-прежнему удобнее читать с бумажной копии: диаграммы, таблицы всё-таки лучше выглядят на бумаге. Опять же, листать можно.

Плюс не будем забывать, что издательство тоже дело делает: редакторы читают, иногда рецензенты правят, корректоры выискивают ляпы… в общем-то, не совсем фигня.
> деться нам с вами все равно некуда: если мы хотим посмотреть фильм от Universal —
> мы должны платить за это Universal

Ну так не кормите тролля: купите фильм другой студии. В конце концов, сейчас этой продукции производится немеряно. Причём, признайте, выбрать что-то лучшее довольно трудно — основная масса тупо рекламируется (а это ведь не критерий качества), ещё одна десятая кем-то иногда рецензируется. А прочее мало кто смотрит, хотя просто по законам математики это вряд ли полный треш — лишь потому, что они не заплатили за рекламу.

А основной месседж — снижай цены и будет всё путём, всё-таки перекрывается простым наблюдением: издержки производителя в тысячи раз больше издержек пирата. Фильм за 50 рублей — вы в это верите?..

Вот давайте так — только приведите честные выкладки, ладно? Не будем теоретизировать. В фильмах я не очень разбираюсь, зато разбираюсь в книгах. Издательство среднего размера не гребёт золото лопатой, поверьте на слово. При этом платить автору больше 10% от общего дохода от продажи книги они не могут — всё действительно съедается печатью, логистикой, зарплатой издателя и т.п. Далее, реальная накрутка посредников (любых!) такова, что цена книги растёт, по крайней мере, вдвое.

А вот теперь возьмите с полки любую среднего объёма техническую книгу. Посмотрите её тираж. Прикиньте, сколько автор этой книги должен, по вашему представлению, получить примерно за год работы, ну или сколько книга пишется. Трудной работы, заметим. Теперь умножьте эту сумму на 10. Это доход издательства. Теперь поделите на тираж — это отпускная цена книги. Теперь умножьте на 2-2.5. Это цена книги в магазине.

Сколько получилось? А за сколько вы купили? А как перебить PDF на Натахаусе? :)
Интересны следующие вопросы:

1) Вы говорите, люди «старшего поколения не понимают». Однако они выросли, по большому счёту в тех же условиях — например, для них не секрет, что книжка из 300 страниц стоит дороже, чем 300 страниц чистой бумаги. И даже, о ужас, две разные книжки одинаковым объёмом стоят разную сумму. Ничего в голове не щёлкает?

2) По поводу «давления США». Вообще в идеале мир должен быть гораздо более сбалансированным. Я не совсем понимаю, почему люди в целом этому давлению так легко поддаются. Ну ОК, у них есть Голливуд — там много-много миллиардов, это трудно переплюнуть. Ну ещё компьютерные игры добавились. Но в остальном — книги, журналы, музыка… в той же Европе своего мало?.. Так создавайте, ё-моё!..

3) А если американское и вправду лучше, может, их морально-законодательные ценности и вправду как-то провоцируют креатив? А в других частях света креативщики как-то вот недополучают. Или причина в другом?..
Ну дело не в фиксированной грамматике. У Паскаля фиксированная грамматика, однако одну и ту же задачу можно решить по-разному, и даже один и тот же алгоритм записать различными способами.
Вернее, это я глупость сказал — причём тут перевод :) Если речь об отображении некоего «знания» на предложения языка, множественность выбора сохраняется.

Если есть информация о том, что некто владеет автомобилем, можно выбрать хотя бы варианты: «у Х есть автомобиль» и «Х владеет автомобилем».
Да, конечно. I have a blue shirt — у меня есть голубая рубашка, у меня есть синяя рубашка.
Плохо решает :)

Но это лишь анекдот, можно придумать более существенные примеры. В данном случае я бы сказал, что фразеологизмы — это часть словаря, они должны описываться в явном виде.
По поводу памяти — как бы да, но тогда и не на РС ориентировались, в дело шли «большие машины».

По поводу прочего — совершенно согласен. В принципе, я думаю, что здесь нужны ресурсы, а «серебряной пули нет».

Вот есть же, скажем, Google Street View. Никто не пытается «статистически аппроксимировать» улицы — ребята поставили задачу объехать весь мар на машине и на велосипеде, и объезжают. И не каньючат, что работы много.

С языком, конечно, всё трудно, но невозможных вещей нет. Просто никто толком не знает, что именно нужно делать — как описывать, в какой форме и так далее… Да и, повторюсь, не любой лингвист способен мыслить как Мельчук.
В комментариях кто-то упоминал этот проект. Не дайте соврать, но «пощупать» его всё равно не дают, так что толку?.. Только «поиск»
«Наиболее вероятный» :)
Если подходить с позиции грамматик, проблема порядка слов вообще не стоит — всё определяется однозначно.

Я повторюсь, давайте начнём с языка Паскаль. Когда напишут статистический компилятор Паскаля, я поверю в этот подход.
Эх, опять списочек :) Давайте в частном порядке — отдельно по конкретным вопросам… Много ссылок было в предыдущих частях.
По поводу БД и сервисов — начните хотя бы с проектов WordNet и OpenNLP.
По поводу Тузова — выложил «Компьютерную семантику русского языка».
Я не говорю, что эти штуки плохи, я говорю, что по сравнению с традиционными книжка+магнитофон нынешний софт не представляет собой особенного скачка вперёд. Сравните с той же «виртуальной физикой», по-моему, это небо и земля.

Банально, вот вы сочиняете какое-нибудь предложение, а компьютер говорит: неправильно! Есть ли хоть одна прога, которая не просто тупо сверяет фразу с ключевой, а может объяснить, почему именно неправильно?..
Ой, не дописал. Любимый пример глупости машинного перевода. Если с английского перевести на русский и обратно фразу «the spirit is willing but the flesh is weak», получается «the vodka is good but the meat is rotten». Таким же образова, «out of sight, out of mind» превращается в «blind idiot».

И для сегодняшних систем это проблема.
Честно говоря, я не думаю, что проблема в силах и в мощностях. Скорее, штука в том, что раньше пытались «rush through» — получить как можно быстрее конечный результат, в то время как базовые проблемы (морфология, синтаксис) оставались дырявыми.

Если мы даже в сегодняшнем дне посмотрим вперёд, то увидим, что в задачах «конечного уровня» (машинный перевод, например) по-прежнему всё туго. Потому что кроме синтактико-семантического анализа существует «commonsense reasoning», до которого ещё очень далеко.

Вот, вот тут могу поспорить — вдогонку…

У меня есть ощущение, что для задачи синтактико-семантического анализа дерева достаточно. То есть я понимаю теоретическую важность сетевых структур — понятно, что можно строить графы общего вида, есть ещё такая штука как «фреймы» и так далее.

Но если для разбора хватает дерева, зачем же огород городить? Надо использовать самое простое, что работает. Мой пример с кухонной мебелью — надуманный, я не уверен, что такие проблемы реально возникнут.
Про Cyc я в курсе :) сам об этом писать не буду — с удовольствием уступлю эту честь тебе :)

В целом комментарий такой — ничего принципиально нового вид онтологии сюда не внесёт. Неважно, СУС это или то дерево, которое я описываю. Плюс дерева — исключительно в простоте и удобстве — в ООП тоже все советуют начать с дерева, и переходить на более сложные структуры лишь тогда, когда припрёт.
1) не-не-не, в том и дело, что это не синонимы, это действительно разный снег, который мы бы стали называть разными атрибутами: снег такой, снег сякой… вы же не будете говорить, что синий и голубой — это один цвет лишь на том основании, что в английском есть только слово blue?

2) Ага, значит, чашка — посуда — это для универсального классификатора! А теперь смотрите:
ПОЕХАЛ НА (объект: на-место) // Украина, Кипр, дача, острова
ПОЕХАЛ В (объект: в-место) // Москва, Япония, гостиница

Возникает вопрос: у класса «место» есть два подкласса: «в-место» и «на-место». И эта особенность ТОЛЬКО русского языка. Значит, придётся писать какие-то подклассы, специфичные для данного языка.

В общем, с моей стороны резюме такое: я в принципе не утверждаю невозможность такого классификатора. Просто считаю долгом перечислить его проблемы, которые, как мне кажется, сильно портят жизнь, и мне кажется, что работать над ним (а далее и С ним) будет весьма непросто, хотя ничего невозможного и вправду нет.
Нет, погодите, вы переводите не русское слово «разбивать» в 356748, вы переводите «разбивать» именно в контексте «разбивать посуду».

А откуда парсер знает, что в фразе «разбить чашку» слово «чашка» относится к посуде? Он должен либо лезть в гипотетический универсальный классификатор (напомню, разработанный титанами мысли, знающими, что за «снегом» скрывается 20 семантических едениц), либо в классификатор для русского.

Если он лезет в классификатор для русского (где сказано, что чашка — это посуда), то мы приходим к тому, что создание универсального классификатора не отменяет создания иерархии классов, специфичной для русского языка.

Информация

В рейтинге
3 636-й
Откуда
Фукусима, Япония
Дата рождения
Зарегистрирован
Активность