Авторов никто не заставляет играть музыку, писать тексты и т.д. Хочешь — пиши, но имей в виду, что технически невозможно обеспечить тебе прибыль по такой-то модели.
Потому что тут же возникла организация-посредник, которая ради блага рабочих взяла все заводы себе. А рабочим выделяла некоторое количество прибыли. И на всякий случай запретила частную собственность.
Наличия флажка недостаточно, чтобы диалект считался языком. Американский английский вряд ли отличается от «центрального лондонского» больше, чем «окраинный лондонский» или какой-нибудь йоркширский. Это диалекты. Просто на US English говорит очень много людей.
Недавно чешский и словацкий считались одним языком, сейчас считаются разными (хотя они не изменились). Но там нет никаких четких границ, есть (условно) четыре диалекта-градации. Притом даже между чешским и моравским, а также словацким и загорским различий наберется побольше, чем между британской и американской версиями английского.
В России, ага, тоже была куча диалектов (включая нижегородский французский ;-) ), но XX век оказался страшной мясорубкой и паровым катком. Поэтому сравнивать бесполезно.
Ага. В статье (см. линк в предыд. комменте) упоминается эта штука. Я пробовал только doc→plaintext, качество действительно очень хорошее, в тч таблицы идеально транслируются в reST-совместимые. Но нет настроек процесса, поэтому всякие лишние отступы придется корректировать дополнительно.
Присылают не ЦУ, а материалы для очеловечивания и дальнейшей публикации. Увы, на той стороне проблема не решается.
Но еще раз отмечу, что это вторичное применение «системы». Первичное — подготовка документов с нуля, полный замкнутый цикл. Я об этом мечтал при написания диссертации, но тогда никаких rst2pdf и в помине не было, а LaTeX казался (и, наверно, был) оверкиллом.
Tonight on «It's the Mind», we examine the phenomenon of deja vu. That strange feeling we someti.........mzget…
Ладно, еще раз пластинку покрутим для истории, вдруг пригодится кому.
1. Получаем жуткое месиво под названием «служебная записка», пропускаем через aw (1 сек), получаем чистый текст. Сохраняем как есть.
2. Копируем как reST-файл, приводим в порядок (1-3 мин), отныне все новые служебки _мы_ будем начинать отсюда. Отправляем на печать.
3. Приходит новая служебка; пропускаем через aw (1 сек), диффаем с предыдущим вариантом (2 сек), видим 2-3 изменения, добавляем их в reST (20 сек), отправляем на печать.
Т.о., единоразовые затраты в пределах пары минут, а повторяющиеся сравнимы с временем запуска OOo и включают в себя проверку корректности изменений.
Вы пробовали привести в порядок документ, сверстанный типичным пользователем? Если вам это не интересно, перестаньте меня донимать вопросами, пожалуйста. Если интересно, то сами знаете, что проще переделать — и я вам показываю, как.
Наверно, я не прав, что сделал акцент на antiword'е, надо было подчеркнуть, что документы удобно верстать в reST с нуля. С другой стороны, показалось занятным, что с минимальными усилиями в такую системку втыкается и более-менее типичный workflow.
Понимаете, это всё очень хорошо, но если я и дома, и на любом сервере использую одни и те же программы (например, vim, diff, hg) для работы с «околокомпьютерным» текстом, то не гораздо удобнее с их же помощью работать и с текстом любой другой тематики. И действительно проще прицепить конверторы на вход/выход, чем поддерживать и углублять навык работы в еще одной сложной узкоспециализированной среде для достижения того же результата. И невозможность прямой работы с материалом выглядит существенным недостатком.
Ну так в том и дело! :-)
Иначе всё было бы гораздо сложнее.
А вот объекты, которые бессмысленно сводить к плоскому тексту (например, картинки) — они блобами хранятся в VCS.
Вас что-то не устраивает в этом?
Честное слово, я с самого начала не могу понять, о чем спор. Я описал вариант решения трех проблем. Вы утверждаете, что он не нужен. Я объясняю, что он не нужен лично вам, но очень нужен, например, мне. Сейчас мы вроде как не можем решить, надо ли текст хранить как текст, если кроме текста есть что-то еще. Бр-р-р. Может, каждый просто будет поступать так, как считает нужным? Вот правда-правда, я не хочу вас переубедить, я просто хочу, чтобы мой опыт пригодился тем, у кого ситуация и требования совпадают с моими.
Что значит «сложнее плоского текста»? Если вас интересует вставка изображений, сложные таблицы, всякие хитрые ссылки, генерирование содержания и т.д., посмотрите Sphinx. Тот же reST.
Т.е., название программы — Word — вводит в заблуждение. И mp3 не музыка, потому что туда можно встроить и текстовые комментарии, и даже изображения. Да, да, да. )
Вот reST именно этим и лучше: отдельно чистый текст, чистые изображения, чистые стили — и нет каши, которую потом можно разобрать только тяжелой артиллерией.
В reST нет «жирного» и «курсива», тк это семантическая разметка. Там есть emphasis и strong emphasis (транслируются в em и strong). Да, произойдет смещение акцентов. Антиворд генерит дурацкую вики-разметку. Ну и понятно, что тупо прогонять результат через регексы в данном случае небезопасно. Я думаю, что при необходимости соблюсти совершенно правильное форматирование надо не сразу гнать в reST, а сначала в какой-то из XML-based форматов (напр., antiword -x db foo.doc > foo.xml && db2rst.py foo.xml foo.rst).
Недавно чешский и словацкий считались одним языком, сейчас считаются разными (хотя они не изменились). Но там нет никаких четких границ, есть (условно) четыре диалекта-градации. Притом даже между чешским и моравским, а также словацким и загорским различий наберется побольше, чем между британской и американской версиями английского.
В России, ага, тоже была куча диалектов (включая нижегородский французский ;-) ), но XX век оказался страшной мясорубкой и паровым катком. Поэтому сравнивать бесполезно.
Впрочем, IANAL (где L = linguist)).
Но еще раз отмечу, что это вторичное применение «системы». Первичное — подготовка документов с нуля, полный замкнутый цикл. Я об этом мечтал при написания диссертации, но тогда никаких rst2pdf и в помине не было, а LaTeX казался (и, наверно, был) оверкиллом.
Ладно, еще раз пластинку покрутим для истории, вдруг пригодится кому.
1. Получаем жуткое месиво под названием «служебная записка», пропускаем через aw (1 сек), получаем чистый текст. Сохраняем как есть.
2. Копируем как reST-файл, приводим в порядок (1-3 мин), отныне все новые служебки _мы_ будем начинать отсюда. Отправляем на печать.
3. Приходит новая служебка; пропускаем через aw (1 сек), диффаем с предыдущим вариантом (2 сек), видим 2-3 изменения, добавляем их в reST (20 сек), отправляем на печать.
Т.о., единоразовые затраты в пределах пары минут, а повторяющиеся сравнимы с временем запуска OOo и включают в себя проверку корректности изменений.
Вы пробовали привести в порядок документ, сверстанный типичным пользователем? Если вам это не интересно, перестаньте меня донимать вопросами, пожалуйста. Если интересно, то сами знаете, что проще переделать — и я вам показываю, как.
Наверно, я не прав, что сделал акцент на antiword'е, надо было подчеркнуть, что документы удобно верстать в reST с нуля. С другой стороны, показалось занятным, что с минимальными усилиями в такую системку втыкается и более-менее типичный workflow.
И, да, мне очень, очень важно было услышать именно Ваше мнение!!! ))
Иначе всё было бы гораздо сложнее.
А вот объекты, которые бессмысленно сводить к плоскому тексту (например, картинки) — они блобами хранятся в VCS.
Вас что-то не устраивает в этом?
Честное слово, я с самого начала не могу понять, о чем спор. Я описал вариант решения трех проблем. Вы утверждаете, что он не нужен. Я объясняю, что он не нужен лично вам, но очень нужен, например, мне. Сейчас мы вроде как не можем решить, надо ли текст хранить как текст, если кроме текста есть что-то еще. Бр-р-р. Может, каждый просто будет поступать так, как считает нужным? Вот правда-правда, я не хочу вас переубедить, я просто хочу, чтобы мой опыт пригодился тем, у кого ситуация и требования совпадают с моими.
Вот reST именно этим и лучше: отдельно чистый текст, чистые изображения, чистые стили — и нет каши, которую потом можно разобрать только тяжелой артиллерией.
antiword -x db foo.doc > foo.xml && db2rst.py foo.xml foo.rst).