Как работают модели SOFROS AI/ML: от классификации до семантического поиска

В первых двух статьях цикла мы разобрались, почему нормативно‑справочная информация (НСИ) неизбежно деградирует, почему простые алгоритмы сравнения строк проигрывают AI/ML, и как устроен сервис SOFROS AI/ML в целом — его архитектура, гибридный подход и интеграция с корпоративными системами через REST API.
Но методология и архитектура — это лишь верхушка айсберга. Главная магия происходит внутри моделей, которые отвечают за классификацию, извлечение характеристик, семантический поиск и контекстное обогащение данных. Именно они превращают «сырые» записи в структурированные и нормализованные справочники.
В третьей статье мы заглянем под капот этих моделей и подробно разберём:
— как работает модель классификации на основе наивного байесовского классификатора с учётом опечаток, n‑грамм и нечёткого поиска;
— как модель экстракции выделяет именованные сущности (NER) с помощью spaCy и beam search;
— как модель семантического поиска использует BERT, FAISS и реранкер для поиска по смыслу;
— как модель контекстного поиска обращается к веб‑источникам для дообогащения данных;
— зачем нужна классификация PII и как она обеспечивает безопасность.












