Как выбрать алгоритм для адресного фильтра
8 мин

Довольно часто на Хабре появляются статьи с новыми алгоритмами автоматического разбора адресов, записанных одной строкой. Кроме этого, услуги по обработке адресов предоставляют различные it-компании. В статье мы расскажем как использовать свою адресную базу для выбора алгоритма автоматического разбора адресов, и на что стоит обратить внимание при тестировании и разработке алгоритмов адресных фильтров.
Эта статья для всех, кто хранит данные клиентов и хочет решить одну из следующих задач:
- убедиться, что адрес существует, чтобы не отправить посылку или письмо в никуда;
- разбить адрес на компоненты, чтобы понять, где идут лучше продажи;
- дополнить адрес недостающей информацией, чтобы оптимизировать план работы курьеров;
- стандартизовать адреса, чтобы найти дублирующие записи одного и того же клиента;
- актуализировать и привести адреса к формату справочника, чтобы пройти проверки регуляторов.
Задача автоматического разбора почтовых адресов кажется довольно простой на первый взгляд — бери да сопоставляй адресному справочнику (например, ФИАСу) слова из входной строки. Но все, кто за неё берутся, утопают в большом количестве особенностей адресов…

В определённый момент, страдая от лени обновлять новостной блог про OpenStreetMap, я решил сделать еженедельную передачу про проект. Вместо трёх часов вымучивания текста — часик пообсуждать со знакомыми участниками OSM новинки и актуальные вопросы. Отличная идея, порадовались и разошлись. Через полгода со словами «ну блин хватит бездельничать, давайте послезавтра звоните в скайп» я начал разбираться, как в этом вашем линуксе записать звук с микрофона и скайпа, одновременно передавая его в интернет. Эта история — про настройку PulseAudio, про скайп и мамбл, и про удивительный JACK. Оказалось, поднять собственное радио с гостями в эфире проще, чем нарисовать для него логотип.










