Вторая статья цикла SOFROS об ИИ/ML-сервисе раскрывает его внутреннее устройство. Авторы объясняют, почему для нормализации нормативно-справочной информации (НСИ) недостаточно классических алгоритмов сравнения строк и как гибридный подход сочетает разные методы.
Классические алгоритмы вроде Левенштейна или Джаро-Винклера дают приемлемое качество лишь в 30–40% случаев, не учитывая морфологию и семантику. Поэтому SOFROS ИИ/ML использует три подхода: шаблонные методы для стандартных параметров, классическое машинное обучение для структурированных данных и LLM для сложных формулировок. Гибридная архитектура позволяет обрабатывать большие массивы записей с высокой точностью.
| Модель | Задачи |
|---|---|
| Модель классификации | Определяет категорию объекта (например, «кабель», «насос») |
| Модель экстракции | Извлекает атрибуты: тип, сечение, материал, ГОСТ |
| Модель семантического поиска | Находит семантически похожие записи для нечеткого поиска |
| Модель контекстного поиска | Обогащает данные из внешних источников, ищет новые характеристики |
| PII-класс | Выделяет персональные данные для маскирования перед отправкой в LLM |
Сервис состоит из четырех уровней. Ядро на микросервисной архитектуре поддерживает Windows и Linux, взаимодействует с внешними системами через REST API и предоставляет Swagger для тестирования. Менеджеры сервисов управляют моделями: добавляют, обучают, пополняют примеры и выполняют прогнозирование. Для 1С:MDM редакции 2.5 есть расширение, реализующее бизнес-логику нормализации и SDK для связи с автономным сервером.
Модели реализованы на Python и включают классификатор на наивном байесовском классификаторе, NER-модель для извлечения атрибутов, семантический поиск для нечеткого сопоставления и контекстный поиск для обогащения данных из внешних источников. PII-класс маскирует персональные данные перед отправкой в LLM, что важно для соблюдения ФЗ-152.
SOFROS ИИ/ML решает прикладные задачи: поиск дублей, подбор аналогов, сопоставление со справочниками филиалов и интеграцию в технологические процессы. Авторы отмечают, что разрабатывают автономный клиент для интеграций и расскажут о методологии Spec-Driven Development в следующих статьях.
Для бизнеса сервис интересен автоматизацией полного цикла нормализации НСИ, что снижает издержки на ручную обработку данных. Однако стоимость внедрения и требования к вычислительным ресурсам для LLM остаются нераскрытыми, что стоит учитывать при оценке.

