Про название — статья предназначена для программистов, а не для специалистов по ИИ, коих из всех программистов хорошо если 0.1%. Будут ещё две части — про поиск решения и про машинное обучения.
Если Вы хотите почитать о фреймах, в конце есть ссылка на статью Марвина Минского. Ну и Гуглом можно найти массу более новых статей и книг про фреймы.
Для этого у нас есть возможность бесплатно оценить качество распознавания перед покупкой и принять решение, подходит ли такой уровень качества для задачи, или нет. Кроме того, у нас предусмотрена возможность бесплатно повторно распознать тот же документ с другими параметрами распознавания
Спасибо за ценное замечание. В перевод закралась ошибка, теперь выложена правильная версия:
Например, если ваши заказчики находятся в Нидерландах, скорее всего, перевод вашего сайта с английского не принесет большой пользы, и наоборот — такая польза будет, если вы планируете, допустим, выйти на рынок Венгрии, Италии или Португалии.
Заметим также, что мало использовать только таблицу для получения такого вывода. В таблице показаны значения распространённости языков среди владеющих хотя бы одним языком, а следующий график говорит о том, что в одной стране почти все говорят хоть на одном иностранном, а в другой — меньше половины населения. Именно сочетание «больше 90 % населения Нидерландов говорит хотя бы на одном иностранном» (данные последнего графика) + «90 % из них владеет английским» (данные таблицы) позволяет сделать вывод, приведённый в цитате.
Лингвистический анализ текста являетя необходимой частью информационного анализа вообще. Не зная устройства предложения (=синтаксиса), нельзя заниматься семантическим и логическим анализом текстов, из которых они состоят.
Вытаскивать факты из текстов, не понимая их, может быть и эффективным в отдельных случаях, но в целом — совершенно бесперспективно.
Андрей, порекомендовать, к сожалению, не смогу: такие статьи мне не попадались. Мои комментарии основываются на опыте выполнения схожих проектов, где требовались извлечение данных и индексация.
Хочу пробросить мостик между темой индексации в этой статье и вопросом про OCR из комментария Станислава. А так же поспорить с автором относительно невозможности решения рассматриваемой задачи.
Что за чем и почему?
OCR позволяет извлечь текст с изображения документа, по возможности без ошибок и изменений, в этом ценность OCR. Технология довольно зрелая, на современных сканах и документах требует исправлений менее 1% символов.
Над OCR можно надстроить слой «извлечения данных». Здесь и живет хитрая логика нормализации извлеченного текста (удаление незначащей пунктуации, замена одних аббревиатур на другие, проверка согласованности данных на документе, исправление ошибок OCR). Данная задача решена в промышленных масштабах, насколько мне известно, для счетов, чеков и визиток. Для прочих типов всегда требуется этап подготовки.
И, наконец, индексация: какие мета-данные приложить к изображению. При всей своей неоднозначности, задача часто решается путем шаблонов лучших практик. В крайнем случае требуется доводка напильником по месту.
А есть ли готовое решение? Станислав упоминает программу RasterID, одной из функций которой, как следует из описания, является поиск и извлечение данных из штампов на документе. Опыта пользования этим приложением у меня нет, потому свое мнение я основываю на богатом опыте изучения сценариев использования FineReader OCR SDK. Очевидно, что RasterID предлагает возможность автоматизировать процесс поиска и извлечения данных из штампа, а так же отправки извлеченных данных в CMS. Однако чтобы решить задачу в общем виде, как ее понимает автор данной статьи, указанному приложению не будет хватать пары вещей:
1. Распознавания рукописных символов. Мне известны несколько производителей, которые продают системы распознавания рукописного текста.
2. Нормализации данных на штампе. Не секрет, что места на штампе мало и сокращения на нем сплошь и рядом. А каждая организация, не говоря уже об индивидах, сокращает по-своему. Без ручного труда, по крайней мере пока, не обойтись: нужно настроить словарь замен и подстановок.
На мой взгляд, оба пункта вполне решаемы уже сейчас.
Потому я не согласен с автором, что "работа по индексации чертежей большого формата не может быть автоматизирована", но должен согласиться, что "программ для такой автоматизации нет и, возможно, никогда не появится." Современные чертежи имеют электронную копию с необходимыми метаданными с самого рождения, а оцифровка архивов, как правило, выполняется один раз в рамках проекта, и число этих проектов ограничено. Кто будет серьезно вкладываться в ПО, которому суждено умереть через пару лет?
Вот выдержка из стандарта, касающаяся 5-9 классов:
11) формирование представления об основных изучаемых понятиях: информация, алгоритм, модель – и их свойствах;
12) развитие алгоритмического мышления, необходимого для профессиональной деятельности в современном обществе; развитие умений составить и записать алгоритм для конкретного исполнителя; формирование знаний об алгоритмических конструкциях, логических значениях и операциях; знакомство с одним из языков программирования и основными алгоритмическими структурами — линейной, условной и циклической;
13) формирование умений формализации и структурирования информации, умения выбирать способ представления данных в соответствии с поставленной задачей — таблицы, схемы, графики, диаграммы, с использованием соответствующих программных средств обработки данных;
14) формирование навыков и умений безопасного и целесообразного поведения при работе с компьютерными программами и Интернете, умения соблюдать нормы информационной этики и права
Если Вы хотите почитать о фреймах, в конце есть ссылка на статью Марвина Минского. Ну и Гуглом можно найти массу более новых статей и книг про фреймы.
Заметим также, что мало использовать только таблицу для получения такого вывода. В таблице показаны значения распространённости языков среди владеющих хотя бы одним языком, а следующий график говорит о том, что в одной стране почти все говорят хоть на одном иностранном, а в другой — меньше половины населения. Именно сочетание «больше 90 % населения Нидерландов говорит хотя бы на одном иностранном» (данные последнего графика) + «90 % из них владеет английским» (данные таблицы) позволяет сделать вывод, приведённый в цитате.
Вытаскивать факты из текстов, не понимая их, может быть и эффективным в отдельных случаях, но в целом — совершенно бесперспективно.
Что за чем и почему?
OCR позволяет извлечь текст с изображения документа, по возможности без ошибок и изменений, в этом ценность OCR. Технология довольно зрелая, на современных сканах и документах требует исправлений менее 1% символов.
Над OCR можно надстроить слой «извлечения данных». Здесь и живет хитрая логика нормализации извлеченного текста (удаление незначащей пунктуации, замена одних аббревиатур на другие, проверка согласованности данных на документе, исправление ошибок OCR). Данная задача решена в промышленных масштабах, насколько мне известно, для счетов, чеков и визиток. Для прочих типов всегда требуется этап подготовки.
И, наконец, индексация: какие мета-данные приложить к изображению. При всей своей неоднозначности, задача часто решается путем шаблонов лучших практик. В крайнем случае требуется доводка напильником по месту.
А есть ли готовое решение?
Станислав упоминает программу RasterID, одной из функций которой, как следует из описания, является поиск и извлечение данных из штампов на документе. Опыта пользования этим приложением у меня нет, потому свое мнение я основываю на богатом опыте изучения сценариев использования FineReader OCR SDK. Очевидно, что RasterID предлагает возможность автоматизировать процесс поиска и извлечения данных из штампа, а так же отправки извлеченных данных в CMS. Однако чтобы решить задачу в общем виде, как ее понимает автор данной статьи, указанному приложению не будет хватать пары вещей:
1. Распознавания рукописных символов. Мне известны несколько производителей, которые продают системы распознавания рукописного текста.
2. Нормализации данных на штампе. Не секрет, что места на штампе мало и сокращения на нем сплошь и рядом. А каждая организация, не говоря уже об индивидах, сокращает по-своему. Без ручного труда, по крайней мере пока, не обойтись: нужно настроить словарь замен и подстановок.
На мой взгляд, оба пункта вполне решаемы уже сейчас.
Потому я не согласен с автором, что "работа по индексации чертежей большого формата не может быть автоматизирована", но должен согласиться, что "программ для такой автоматизации нет и, возможно, никогда не появится." Современные чертежи имеют электронную копию с необходимыми метаданными с самого рождения, а оцифровка архивов, как правило, выполняется один раз в рамках проекта, и число этих проектов ограничено. Кто будет серьезно вкладываться в ПО, которому суждено умереть через пару лет?
Дмитрий.
11) формирование представления об основных изучаемых понятиях: информация, алгоритм, модель – и их свойствах;
12) развитие алгоритмического мышления, необходимого для профессиональной деятельности в современном обществе; развитие умений составить и записать алгоритм для конкретного исполнителя; формирование знаний об алгоритмических конструкциях, логических значениях и операциях; знакомство с одним из языков программирования и основными алгоритмическими структурами — линейной, условной и циклической;
13) формирование умений формализации и структурирования информации, умения выбирать способ представления данных в соответствии с поставленной задачей — таблицы, схемы, графики, диаграммы, с использованием соответствующих программных средств обработки данных;
14) формирование навыков и умений безопасного и целесообразного поведения при работе с компьютерными программами и Интернете, умения соблюдать нормы информационной этики и права
Стандарт для 10-11 классов пока не утвержден.