Вместо введения. Коротко о главном из первой части
Это вторая статья из цикла публикаций про наш сервис Sofros AI/ML. С первой статьёй вы можете ознакомиться по данной ссылке.
В прошлый раз мы разобрались, почему нормативно-справочная информация (НСИ) неизбежно деградирует в любой растущей компании:
параллельное ведение данных в нескольких системах;
человеческий фактор - опечатки, сокращения, вариации написания;
организационные изменения и неполнота атрибутов;
устаревшие стандарты и попытки подогнать справочник под каждого поставщика.
Мы также показали, почему классические алгоритмы сравнения строк (Левенштейн, Джаро‑Винклера, token‑ratio) - это тупик. Они дают приемлемое качество лишь в 30-40% случаев, не учитывают морфологию, контекст и семантику. А главное - не видят структуру объекта за текстовой строкой.
В первой части мы описали методологию атрибутивной нормализации и в качестве практического примера рассмотрели сервис SOFROS AI/ML, который автоматизирует полный цикл: от извлечения характеристик до валидации и устранения дубликатов.
Но методология - это полдела. Главный вопрос, который остался за кадром: как именно устроен сервис «под капотом»?
Во второй статье мы заглянем внутрь SOFROS AI/ML:
какая архитектура лежит в основе сервиса;
какие модели машинного обучения и LLM используются, и за что отвечает каждая;
как сервис интегрируется с 1С:MDM, SAP и другими системами через REST API;
как мы обеспечиваем безопасность и соблюдение требований ФЗ‑152.
Переходим к деталям.
Сервис SOFROS AI/ML: открытое API для работы с моделями машинного обучения
В ходе реализации проектов по нормализации НСИ эксперты SOFROS пришли к выводу: ни один инструмент не решает задачу самостоятельно.
В одних случаях эффективны шаблонные методы - они позволяют быстро выделять нормативы и стандартные параметры. В других - классическое машинное обучение. А для наиболее сложных формулировок, где важны контекст и семантика, применимы современные языковые модели (LLM). Они требуют больших вычислительных ресурсов, но обеспечивают высокое качество даже на неструктурированных описаниях.
Именно поэтому в сервисе SOFROS AI/ML применяется гибкое сочетание всех трёх подходов. Гибридный метод позволяет одновременно обрабатывать большие массивы записей с высокой точностью.
На основе структурированных данных решаются прикладные задачи:
поиск дублей;
подбор аналогов;
сопоставление со справочниками филиалов;
интеграция в технологические процессы.
Функциональные компоненты сервиса Sofros AI/ML
Архитектура сервиса включает четыре ключевых уровня. Разберём каждый.

1. Ядро сервиса
Ядро управляет всеми AI/ML-процессами, формирует SDK для работы с моделями и предоставляет интерфейс для взаимодействия с пользователями.
Оно состоит из:
автономного сервера взаимодействия - разработан на микросервисной архитектуре, поддерживает Windows и Linux. Взаимодействие с внешними системами - через REST API. Для тестирования предоставляется интерфейс Swagger (интерактивная документация API).
менеджеров сервисов - обеспечивают добавление моделей, их обучение, пополнение обучающих примеров и выполнение прогнозирования.
Также в составе ядра присутствует расширение для 1С:MDM Управление нормативно-справочной информацией, редакция 2.5. Оно реализует бизнес-логику нормализации, формирует SDK для взаимодействия с библиотеками AI от 1С и API для связи с автономным сервером.
Важно: в данный момент мы разрабатываем автономный клиент для интеграций с различными системами и сервисами. О нём и о методологии Spec-Driven Development (SDD) мы расскажем в одной из следующих статей цикла.
2. Модели AI/ML
Модели - это классы, содержащие методы для обучения, предсказания и оценки качества. Скрипты реализованы на Python.
В составе сервиса присутствуют следующие модели:
Модель | Какие задачи решает |
|---|---|
Модель классификации | Наивный байесовский классификатор определяет категорию объекта (например, «кабель», «насос», «крепёж»). |
Модель экстракции | Извлечение именованных сущностей (NER) выделяет из текста атрибуты - тип, сечение, материал, ГОСТ. |
Модель семантического поиска | Генерация с дополнительной выборкой находит семантически похожие записи. Применяется для задач нечёткого поиска и сопоставления. Например, можно сопоставить две характеристики: "сечение жилы" и "сечения токопроводящих жил" для модели семантического поиска будут являться одинаковыми характеристиками. |
Модель контекстного поиска | Вызов инструментов веб-поиска обогащает данные из внешних источников. Также модель контекстного поиска может использоваться для поиска новых видов характеристик. |
PII-класс | Выделение персонально идентифицируемой информации (Personal Identifiable Information) для маскирования перед отправкой в LLM. |
Подробнее об архитектуре и реализации каждой модели мы расскажем в следующих частях цикла.
3. Дополнительные модели и сервисы (доступны по запросу)
Модель или сервис | Какие задачи решает |
|---|---|
MCP-сервер для 1С:MDM | Предоставляет инструменты для доступа к SDK моделей SOFROS AI/ML, данным и метаданным 1С:МДМ. |
AI-модель NER на базе LLM GLiNER | Улучшенное выделение специфических типов НСИ. Работает zero-shot (без дообучения) или few-shot (с минимальным обучением). Встраивается в пайплайн ML-моделей. |
Модель агломеративной кластеризации | Структурирует неразмеченные данные. Помогает создавать признаки для разметки, решать задачи сегментации, обнаруживать выбросы и аномалии, очищать и структурировать данные (используется для подготовки обучающих датасетов, помогает находить минимально необходимые примеры для обучения других моделей). |
4. Инфраструктурный уровень
Провайдеры локальных и облачных LLM - вычислительные узлы (GPU-кластеры) для развертывания больших языковых моделей внутри периметра заказчика (опционально).
Библиотеки машинного обучения (ML) - готовые наборы инструментов, функций и алгоритмов, а также среда исполнения.
Как это работает в связке с MDM
В контексте MDM-системы (Master Data Management) интеллектуальный сервис встраивается в существующий контур и автоматически обрабатывает все входящие данные.
Для сотрудников процесс остаётся привычным: они работают в основной системе. Но каждая запись теперь проходит интеллектуальную обработку:
приводится к единому корпоративному формату;
извлекаются и нормализуются атрибуты;
значения проверяются по справочным данным;
выполняется валидация и контроль логических связей.
В итоге в MDM поступает корректная запись, которую эксперт только утверждает. Далее она становится доступной для всех взаимосвязанных систем, использующих единый номенклатурный справочник.
Важно подчеркнуть: SOFROS AI/ML не заменяет MDM-систему, а расширяет её возможности, снимая рутинную нагрузку с экспертов и автоматизируя нормализацию, проверку и структурирование данных.
Краткие выводы
SOFROS AI/ML построен на гибридном подходе: шаблоны + классические ML-модели + LLM. Каждый инструмент решает свой класс задач.
Ядро сервиса - это микросервисная архитектура с REST API, которая интегрируется с 1С:MDM, SAP и другими системами.
В составе сервиса - модели для классификации, экстракции атрибутов, семантического и контекстного поиска, а также PII-маскировки.
Сервис может работать как с облачными LLM, так и с локальными моделями внутри защищённого контура заказчика.
Главная ценность - автоматизация полного цикла: от входящей «сырой» записи до эталонной «золотой записи».
Почему использовать сервис SOFROS AI/ML - это выгодно?
Сокращение ручного труда экспертов НСИ на 70-80%.
Снижение ошибок при закупках, комплектации и планировании.
Единый стандарт данных во всех филиалах и системах.
Работа с конфиденциальными данными без рисков благодаря локальным LLM и PII-маскировке.
Что дальше?
В следующей части цикла мы подробно рассмотрим архитектуру и реализацию моделей машинного обучения и искусственного интеллекта: как они обучаются, как оценивается их качество и как они встраиваются в общий пайплайн.
А пока задавайте вопросы в комментариях. Какая тема вам интереснее всего?
Если вас заинтересовал наш сервис, вы можете записаться на бесплатную консультацию и демонстрацию.

