Вторая статья цикла SOFROS об ИИ/ML-сервисе раскрывает его внутреннее устройство. Авторы объясняют, почему для нормализации нормативно-справочной информации (НСИ) недостаточно классических алгоритмов сравнения строк и как гибридный подход сочетает разные методы.

Классические алгоритмы вроде Левенштейна или Джаро-Винклера дают приемлемое качество лишь в 30–40% случаев, не учитывая морфологию и семантику. Поэтому SOFROS ИИ/ML использует три подхода: шаблонные методы для стандартных параметров, классическое машинное обучение для структурированных данных и LLM для сложных формулировок. Гибридная архитектура позволяет обрабатывать большие массивы записей с высокой точностью.

МодельЗадачи
Модель классификацииОпределяет категорию объекта (например, «кабель», «насос»)
Модель экстракцииИзвлекает атрибуты: тип, сечение, материал, ГОСТ
Модель семантического поискаНаходит семантически похожие записи для нечеткого поиска
Модель контекстного поискаОбогащает данные из внешних источников, ищет новые характеристики
PII-классВыделяет персональные данные для маскирования перед отправкой в LLM

Сервис состоит из четырех уровней. Ядро на микросервисной архитектуре поддерживает Windows и Linux, взаимодействует с внешними системами через REST API и предоставляет Swagger для тестирования. Менеджеры сервисов управляют моделями: добавляют, обучают, пополняют примеры и выполняют прогнозирование. Для 1С:MDM редакции 2.5 есть расширение, реализующее бизнес-логику нормализации и SDK для связи с автономным сервером.

Модели реализованы на Python и включают классификатор на наивном байесовском классификаторе, NER-модель для извлечения атрибутов, семантический поиск для нечеткого сопоставления и контекстный поиск для обогащения данных из внешних источников. PII-класс маскирует персональные данные перед отправкой в LLM, что важно для соблюдения ФЗ-152.

SOFROS ИИ/ML решает прикладные задачи: поиск дублей, подбор аналогов, сопоставление со справочниками филиалов и интеграцию в технологические процессы. Авторы отмечают, что разрабатывают автономный клиент для интеграций и расскажут о методологии Spec-Driven Development в следующих статьях.

Для бизнеса сервис интересен автоматизацией полного цикла нормализации НСИ, что снижает издержки на ручную обработку данных. Однако стоимость внедрения и требования к вычислительным ресурсам для LLM остаются нераскрытыми, что стоит учитывать при оценке.