Введение

Представьте: вы открываете корпоративный справочник материалов и вместо стройной системы видите тысячи записей, которые называются по‑разному, но обозначают одно и то же. Где‑то написано «кабель ВВГ 3×2.5», где‑то — «ВВГнг 3×2,5», а где‑то просто «провод 3 жилы». И так по каждой позиции. Это не просто досадная мелочь, это прямые потери бюджета, сбои в закупках, поставках и невозможность собрать достоверную аналитику. А главное, с каждым годом данных становится только больше, а порядка в них — меньше.

Сегодня большинство компаний сталкиваются с серьезной проблемой: данные в локальных информационных системах постоянно деградируют, а традиционные подходы к очистке не дают необходимого эффекта. В результате организации вынуждены постоянно проводить дорогостоящие процессы дедупликации и нормализации, отвлекая ресурсы компании от основной деятельности.

Но ручная чистка — это бесконечный процесс, который съедает ресурсы и не даёт долгосрочного результата. Единственный устойчивый путь — автоматизация на основе искусственного интеллекта и машинного обучения. Гибридные модели, сочетающие классификацию, семантический поиск на базе языковых моделей и интеллектуальную экстракцию характеристик, позволяют не просто заменить человека за рутинной работой, но и делать процесс быстрее и точнее. Алгоритмы обучаются на реальных примерах, адаптируются под вашу номенклатуру и со временем превращаются в незаменимого помощника, который берёт на себя львиную долю задач по нормализации.

В этой статье, первой из цикла, мы разберём:

  • почему справочники неизбежно превращаются в хаос;

  • почему простые алгоритмы сравнения строк — это тупик;

  • что такое атрибутивная нормализация и из каких этапов она состоит;

  • как AI/ML меняет правила игры и какие задачи решает на каждом этапе.

Добро пожаловать в мир, где «грязные» данные превращаются в золотые записи, а хаос уступает место порядку.

Причины деградации нормативно‑справочной информации

Откуда берется хаос НСИ? Первая и наиболее распространенная причина — параллельное функционирование нескольких информационных систем, которые не взаимодействуют между собой. Когда отделы компании независимо друг от друга вводят одни и те же справочные единицы, неизбежно возникают дубли, так как каждый пользователь вносит данные по‑своему.

Различные подходы к внесению информации усугубляют эту проблему. Когда отделы компании используют разные методологии, одно и то же наименование НСИ неизбежно регистрируется в системах несколько раз. Также усугубляют ситуацию:

  • Организационные изменения — создание новых компаний, слияния и поглощения порождают новые информационные системы и, как следствие, множество дублей справочной информации.

  • Человеческий фактор играет немаловажную роль в деградации данных. Пользователи допускают опечатки, используют различные сокращения и вариации написания одного и того же наименования. Один сотрудник может записать «алюминиевый профиль», другой — «ал. Профиль», третий — «профиль алюм.», и в результате система содержит несколько идентичных элементов с разными написаниями.

  • Неполнота НСИ. На начальных этапах внедрения системы принимаются обоснованные решения о заполнении расширенного набора характеристик. Однако по мере развития проекта контроль качества неизбежно ослабевает, что приводит к частичному заполнению данных и потере полноты информации.

  • Устаревшие наименования и обозначения становятся проблемой, когда меняются ГОСТы и стандарты. Одни и те же элементы справочников могут быть заведены по‑разному в зависимости от версии стандарта. Кроме того, попытка точного соответствия спецификациям поставщиков создает дополнительные сложности, так как разные поставщики часто используют разные обозначения для одной и той же номенклатуры.

Почему простые алгоритмы сравнения строк — тупиковый путь

Многие компании пытались и продолжают пытаться решить проблему «в лоб» — сравнивать текстовые наименования, предполагая, что похожие строки означают одно и то же. 

Технически это выглядит просто: разбиваем строки на подпоследовательности или токены, считаем число совпадающих фрагментов, рассчитываем метрики похожести (расстояние Дамерау‑Левенштейна, Джаро‑Винклера, token‑ratio и тому подобное) и для каждой «сырой» записи выбираем эталон с максимальным значением метрики. На бумаге — красиво и просто: чем больше совпадений, тем выше вероятность, что это дубль. Но на практике такой подход дает большое количество ложноположительных и ложноотрицательных результатов. Также такой подход не учитывает цифровой шум (падежи, сокращения, опечатки и аббревиатуры), строки разной длины и строки с измененным порядком следования ключевых слов или даже символов (значение буквы зависит от её позиции в аббревиатуре. Например, буква «Г» в конце марки означает «голый» (без защитного покрова, как в ВВГ), а в начале — кабель для горных выработок).

Пример:

  • Пруток ПКРВХ 18,0 2000 БрАЖ9-4 МП ГОСТ 1628 — 2019

  • Пруток ПКВВХ 18,0 2000 БрАЖ9-4 МП ГОСТ 1628 — 2019

Позиции выглядят почти идентично для алгоритмов, отличие буквально в одной букве, но они описывают принципиально разные изделия: прутки круглой и квадратной формы сечения. Слияние таких записей приведет к ошибкам в спецификациях, неверной комплектации, срывам производства. Простые алгоритмы не учитывают особенности языка, такие как морфология, синтаксис и семантика. Это может привести к неправильному сравнению слов и фраз, особенно в языках с богатой грамматикой и сложной структурой.

Практика показывает, что метрики похожести дают приемлемое качество лишь в 30–40% случаев. Это слишком мало для автоматических объединений без проверки сотрудниками. Так как строки могут быть похожи формально, но различаться по ключевому атрибуту или наоборот, выглядеть совсем по‑разному, но означать один и тот же объект, например, несколько поставщиков указывали в своих спецификациях одно и то же изделие различными способами. Любая политика «берем эталон с максимальной метрикой» при таких условиях либо будет терять значимую долю совпадений (много ложноотрицательных), либо допускать опасные ложные слияния (много ложноположительных).

Единственно надежный путь — атрибутивная нормализация

Только после того, как система «понимает» структуру и смысл наименования, становится возможна корректная дедупликация и безопасное автоматическое объединение записей. Это обеспечивается извлечением и нормализацией атрибутов с выполнением контекстной семантической проверки.

Представьте, что справочная запись — это не просто название, а реальная карточка товара. За каждым словом скрываются десятки параметров: материал, форма, размеры, нормативные документы (ГОСТы, ТУ), технические особенности, варианты применения. Каждое из этих свойств важно — оно позволяет не просто отличить одну позицию номенклатуры от другой, но и корректно подобрать аналоги, проверить соответствие нормативам, интегрировать данные в технологический процесс. 

Процесс атрибутивной нормализации НСИ — это комплексная, многоэтапная процедура. Ее можно представить как последовательность из пяти крупных фаз, каждая из которых решает свои задачи и является фундаментом для следующей.

Фаза 1: Аудит, анализ и подготовка. Этот этап — «диагностика» текущего состояния данных. Без него любые дальнейшие действия будут хаотичными. На данном этапе выполняются такие задачи как сбор и консолидация данных, проводится всесторонний анализ, разрабатываются методологии, регламенты, шаблоны и порядок взаимодействия с НСИ для всех сотрудников.

Фаза 2: Структурирование и обогащение данных. На этом этапе «сырые» данные превращаются в структурированную информацию.

  • Классификация: Каждой позиции присваивается категория из разработанного классификатора. Это определяет, к какому классу объектов она относится и какой набор свойств для нее обязателен.

  • Структурирование и выделение атрибутов и характеристик: «Сырой» текст наименования или описания «разбирается» на отдельные, четко определенные характеристики (атрибуты). Например, из строки «Кабель ВВГнг 3×2.5» выделяются атрибуты: Тип = ВВГнг, Количество жил = 3, Сечение = 2.5.

  • Обогащение данных: Пропущенные или недостающие атрибуты добавляются из внешних надежных источников, например, государственных классификаторов, сайтов производителей.

Фаза 3: Очистка, нормализация и создание эталонов. Самый ответственный этап, на котором данные доводятся до идеального состояния.

  • Нормализация значений: Все атрибуты приводятся к единому, стандартизированному формату. Например, все единицы измерения записываются как шт., кг, м, а не штука, килограмм.

  • Шаблонизация (Формирование эталонных наименований): На основе нормализованных атрибутов по заранее утвержденному шаблону генерируется единое стандартное наименование позиции. Это обеспечивает единообразие и упрощает поиск.

  • Дедупликация и выявление аналогов: Автоматически находятся и объединяются дублирующие записи, а также выявляются аналоги. В результате для каждого реального объекта создается одна «золотая запись» (Golden Record) — эталон, содержащий всю полноту и достоверность информации.

Фаза 4: Публикация, интеграция и контроль. Финальный этап, на котором результаты нормализации «вводятся в эксплуатацию».

  • Валидация и контроль качества: На всех этапах, и особенно перед финалом, данные проверяются на соответствие правилам и бизнес‑логике. «Плохие» данные не попадают в систему.

  • Публикация и интеграция: Нормализованные и проверенные данные загружаются в целевые информационные системы (ERP, MDM, BI и др.).

  • Документирование: Все принятые решения, правила и изменения фиксируются для обеспечения прозрачности и возможности аудита.

Фаза 5: Сопровождение и постоянное улучшение. Нормализация — это не разовое событие, а непрерывный процесс. Этот этап важен для поддержания порядка в будущем.

  • Разработка регламентов ведения: Создаются четкие инструкции для сотрудников о том, как правильно создавать, изменять и вести записи в справочниках.

  • Сопровождение справочников: Осуществляется постоянный мониторинг качества, актуализация данных и разрешение спорных ситуаций.

  • Обучение персонала: Проводится обучение всех пользователей и экспертов НСИ работе по новым стандартам.

Весь этот многоэтапный путь направлен на создание единого, непротиворечивого источника достоверных данных, который становится прочным фундаментом для эффективного управления бизнесом. В современных подходах эти этапы часто объединяются в единый автоматизированный конвейер с использованием алгоритмов машинного обучения и LLM для ускорения и повышения качества обработки.

Примеры задач, решаемых с использованием сервиса SOFROS AI/ML

SOFROS AI/ML помогает компаниям перейти от разрозненной и трудоемкой работы с нормативно‑справочной информацией к управляемому, масштабируемому и интеллектуальному процессу повышения качества данных. Сервис автоматизирует ключевые операции с НСИ, снижает нагрузку на экспертов. повышает точность, полноту и сопоставимость корпоративных справочников.

Автоматическая классификация и категоризация

SOFROS AI/ML автоматически распределяет данные по заданным категориям: отраслям, регионам, типам организаций, группам продукции, классам материалов и другим признакам. Это ускоряет обработку больших массивов НСИ, снижает количество ручных операций и обеспечивает единый подход к классификации данных в рамках корпоративных стандартов.

Извлечение характеристик, шаблонизация и нормализация

Модели машинного обучения автоматически выделяют значимые характеристики из наименований, описаний и справочных записей, приводят их к единой структуре и формату. Сервис помогает стандартизировать разнородные записи, формировать шаблоны описаний, нормализовать значения и устранять неоднозначность в данных. Это особенно важно при работе с большими справочниками, где ручная обработка требует значительных ресурсов и не всегда обеспечивает стабильное качество.

Повышение качества и полноты данных

SOFROS AI/ML помогает системно улучшать качество НСИ, делая данные более точными, полными, структурированными и пригодными для дальнейшего использования в бизнес‑процессах. Для дообогащения характеристик могут использоваться как внутренние корпоративные источники, так и открытые данные из интернета. Это позволяет дополнять карточки объектов недостающими параметрами, уточнять описания и повышать ценность справочной информации для пользователей и смежных систем.

Валидация результатов нормализации

Сервис SOFROS AI/ML обеспечивает проверку качества нормализации на основе сформированных обучающих валидационных и тестовых датасетов и технологий повторной нормализации, включая такие подходы как агломеративная кластеризация, кросс‑валидация и Leave‑one‑out, семантическая валидация, а также построение матрицы ошибок (сonfusion matrix). В случае если система недостаточно уверена в полученных результатах, она может попросить дополнительно провалидировать их у эксперта.

Совокупность механизмов позволяет сравнивать результаты обработки с эталонными или ранее подтвержденными данными, выявлять отклонения и повышать доверие к результатам как автоматической, так и ручной нормализации.

Выявление и устранение дубликатов

Сервис SOFROS AI/ML помогает находить полные и неочевидные дубликаты в справочниках НСИ, включая записи с различиями в написании, структуре, порядке слов или наборе характеристик. Это позволяет сократить избыточность данных, повысить точность справочников и снизить риски ошибок в закупках, учете, аналитике и интеграционных процессах.

Контроль полноты и корректности выделения характеристик

Сервис SOFROS AI/ML сравнивает результаты выделения характеристик с эталонными данными, корпоративными правилами и отраслевыми стандартами. Он выявляет пропущенные параметры, проверяет корректность терминологии, контролирует соответствие заданным критериям и помогает исправлять ошибки. В результате компании получают более надежную и стандартизированную структуру НСИ.

Интеграция с корпоративными системами

SOFROS AI/ML может встраиваться в существующий ИТ‑ландшафт клиента и работать совместно с MDM‑системами, инструментами анализа данных, BI‑платформами и ERP‑решениями. Уже реализованы сценарии интеграции с BI‑системами и бесшовного взаимодействия с SAP‑ландшафтом. Это позволяет использовать возможности AI/ML непосредственно в привычных бизнес‑процессах без необходимости создавать отдельный изолированный контур обработки данных.

Результаты для бизнеса

В результате сервис SOFROS AI/ML становится не точечным инструментом для одной операции, а технологической платформой для комплексной работы с НСИ. Сервис поддерживает полный цикл повышения качества данных: от интеллектуального поиска, классификации и извлечения характеристик до нормализации, валидации, дообогащения и устранения дублей.

Архитектура решения позволяет гибко выбирать оптимальный сценарий под требования конкретного клиента. В случаях, где это допустимо и экономически оправдано, возможно подключение облачных моделей. В любом случае в рамках сервиса предусматривается возможность маскирования конфиденциальной информации. Например, в рамках соблюдения ФЗ 152 вся персонифицированная информация маскируется специальным PII классом перед отправкой в LLM. Для задач с повышенными требованиями к безопасности могут использоваться локальные языковые модели внутри защищенного контура без передачи данных во внешние сервисы. Такой подход обеспечивает конфиденциальность, снижает зависимость от внешних провайдеров и расхода токенов, а также позволяет применять AI/ML не как экспериментальную технологию, а как надежный практический инструмент для ежедневной работы с корпоративными данными.

Краткие выводы

  1. НСИ неизбежно деградирует — дубли, ошибки, неполнота и устаревшие записи возникают из‑за человеческого фактора, множества учётных систем и организационных изменений.

  2. Простые алгоритмы сравнения строк — тупик. Они дают приемлемое качество лишь в 30–40% случаев, не учитывают семантику, контекст и структуру объектов.

  3. Атрибутивная нормализация — единственное надёжное решение. Она превращает «плоское» наименование в набор чётких характеристик и проходит пять этапов: от аудита до постоянного сопровождения.

  4. AI/ML делает нормализацию масштабируемой. Гибридные модели автоматизируют классификацию, извлечение атрибутов, дедупликацию и валидацию, обучаясь на реальных данных.

  5. Сервис SOFROS AI/ML закрывает полный цикл — от интеллектуального поиска до интеграции с корпоративными системами, включая соблюдение требований безопасности.

Это была первая статья нашего цикла про сервис SOFROS AI/ML. Мы рассмотрели предпосылки его появления и методологию. В следующей статье мы более подробно рассмотрим архитектуру и реализацию отдельных инструментов, входящих в состав нашего сервиса.

Вы сталкивались с внедрением AI/ML в процессы работы с НСИ?

Если у вас есть опыт, успешный или не очень, расскажите, что было самым сложным?

  • Сбор и разметка данных?

  • Выбор и обучение моделей?

  • Интеграция с корпоративными системами?

  • Сопротивление пользователей?

Если вас заинтересовал наш сервис, вы можете записаться на бесплатную консультацию и демонстрацию.