Обновить
16K+
139

Пользователь

16,6
Рейтинг
113
Подписчики
Отправить сообщение
Про название — статья предназначена для программистов, а не для специалистов по ИИ, коих из всех программистов хорошо если 0.1%. Будут ещё две части — про поиск решения и про машинное обучения.

Если Вы хотите почитать о фреймах, в конце есть ссылка на статью Марвина Минского. Ну и Гуглом можно найти массу более новых статей и книг про фреймы.
Это только первая часть, вводная. Дальше будет про поиск решения и машинное обучение.
Мы российская компания и рассказываем в блоге о том, что у нас происходит. Почему не рассказать о продукте, сделанном для Европы?
Спасибо! Было очень интересно почитать, как у других. Как всё по-разному…
Для этого у нас есть возможность бесплатно оценить качество распознавания перед покупкой и принять решение, подходит ли такой уровень качества для задачи, или нет. Кроме того, у нас предусмотрена возможность бесплатно повторно распознать тот же документ с другими параметрами распознавания
Спасибо за ценное замечание. В перевод закралась ошибка, теперь выложена правильная версия:
Например, если ваши заказчики находятся в Нидерландах, скорее всего, перевод вашего сайта с английского не принесет большой пользы, и наоборот — такая польза будет, если вы планируете, допустим, выйти на рынок Венгрии, Италии или Португалии.


Заметим также, что мало использовать только таблицу для получения такого вывода. В таблице показаны значения распространённости языков среди владеющих хотя бы одним языком, а следующий график говорит о том, что в одной стране почти все говорят хоть на одном иностранном, а в другой — меньше половины населения. Именно сочетание «больше 90 % населения Нидерландов говорит хотя бы на одном иностранном» (данные последнего графика) + «90 % из них владеет английским» (данные таблицы) позволяет сделать вывод, приведённый в цитате.
Всё верно, так и есть. Добавили в пояснение к таблице слово «иностранные» на всякий случай (хотя казалось, что из контекста должно быть понятно).
Каких, например? Расскажите, подумаем, что можно сделать.
Лингвистический анализ текста являетя необходимой частью информационного анализа вообще. Не зная устройства предложения (=синтаксиса), нельзя заниматься семантическим и логическим анализом текстов, из которых они состоят.

Вытаскивать факты из текстов, не понимая их, может быть и эффективным в отдельных случаях, но в целом — совершенно бесперспективно.
Расшифровку не обещаем, а видео, скорее всего, будет.
На этот раз, надеюсь, всё будет хорошо с видео )
Андрей, порекомендовать, к сожалению, не смогу: такие статьи мне не попадались. Мои комментарии основываются на опыте выполнения схожих проектов, где требовались извлечение данных и индексация.
Хочу пробросить мостик между темой индексации в этой статье и вопросом про OCR из комментария Станислава. А так же поспорить с автором относительно невозможности решения рассматриваемой задачи.

Что за чем и почему?
OCR позволяет извлечь текст с изображения документа, по возможности без ошибок и изменений, в этом ценность OCR. Технология довольно зрелая, на современных сканах и документах требует исправлений менее 1% символов.

Над OCR можно надстроить слой «извлечения данных». Здесь и живет хитрая логика нормализации извлеченного текста (удаление незначащей пунктуации, замена одних аббревиатур на другие, проверка согласованности данных на документе, исправление ошибок OCR). Данная задача решена в промышленных масштабах, насколько мне известно, для счетов, чеков и визиток. Для прочих типов всегда требуется этап подготовки.

И, наконец, индексация: какие мета-данные приложить к изображению. При всей своей неоднозначности, задача часто решается путем шаблонов лучших практик. В крайнем случае требуется доводка напильником по месту.

А есть ли готовое решение?
Станислав упоминает программу RasterID, одной из функций которой, как следует из описания, является поиск и извлечение данных из штампов на документе. Опыта пользования этим приложением у меня нет, потому свое мнение я основываю на богатом опыте изучения сценариев использования FineReader OCR SDK. Очевидно, что RasterID предлагает возможность автоматизировать процесс поиска и извлечения данных из штампа, а так же отправки извлеченных данных в CMS. Однако чтобы решить задачу в общем виде, как ее понимает автор данной статьи, указанному приложению не будет хватать пары вещей:

1. Распознавания рукописных символов. Мне известны несколько производителей, которые продают системы распознавания рукописного текста.

2. Нормализации данных на штампе. Не секрет, что места на штампе мало и сокращения на нем сплошь и рядом. А каждая организация, не говоря уже об индивидах, сокращает по-своему. Без ручного труда, по крайней мере пока, не обойтись: нужно настроить словарь замен и подстановок.

На мой взгляд, оба пункта вполне решаемы уже сейчас.

Потому я не согласен с автором, что "работа по индексации чертежей большого формата не может быть автоматизирована", но должен согласиться, что "программ для такой автоматизации нет и, возможно, никогда не появится." Современные чертежи имеют электронную копию с необходимыми метаданными с самого рождения, а оцифровка архивов, как правило, выполняется один раз в рамках проекта, и число этих проектов ограничено. Кто будет серьезно вкладываться в ПО, которому суждено умереть через пару лет?

Дмитрий.
ABBYY к этому отношения не имеет. Если б это был наш паук, он ползал бы быстрее и более ловко :)
Вот выдержка из стандарта, касающаяся 5-9 классов:

11) формирование представления об основных изучаемых понятиях: информация, алгоритм, модель – и их свойствах;
12) развитие алгоритмического мышления, необходимого для профессиональной деятельности в современном обществе; развитие умений составить и записать алгоритм для конкретного исполнителя; формирование знаний об алгоритмических конструкциях, логических значениях и операциях; знакомство с одним из языков программирования и основными алгоритмическими структурами — линейной, условной и циклической;
13) формирование умений формализации и структурирования информации, умения выбирать способ представления данных в соответствии с поставленной задачей — таблицы, схемы, графики, диаграммы, с использованием соответствующих программных средств обработки данных;
14) формирование навыков и умений безопасного и целесообразного поведения при работе с компьютерными программами и Интернете, умения соблюдать нормы информационной этики и права

Стандарт для 10-11 классов пока не утвержден.
Рады, что понравилась )
НЛО прилетело и опубликовало эту надпись здесь
НЛО прилетело и опубликовало эту надпись здесь
НЛО прилетело и опубликовало эту надпись здесь

Информация

В рейтинге
554-й
Откуда
Россия
Работает в
Зарегистрирован
Активность