Японская строительная отрасль сталкивается с хронической нехваткой кадров, и BIM (Building Information Modeling) рассматривается как способ повысить эффективность. Однако внедрение BIM требует специальных знаний, что замедляет его распространение. Стартап ONESTRUCTION совместно с AWS GenAIIC разработал фундаментальную модель Ishigaki-IDS, которая автоматизирует работу с IDS (Information Delivery Specifications) — XML-стандартом для проверки информации в BIM-моделях. Это позволяет строительным специалистам без глубоких знаний BIM управлять атрибутами моделей.

Основная проблема при создании такой модели — нехватка данных. IDS — новый стандарт, опубликованный в 2024 году, и публичных данных о нем крайне мало. В отличие от финансов или медицины, где модели обучаются на корпусах из миллиардов токенов, для IDS такого корпуса не существует. Чтобы решить эту проблему, ONESTRUCTION использовал синтетическую генерацию данных: внутренние эксперты создали большое количество валидных IDS-файлов и синтетических наборов, объясняющих документы с разных сторон. Это позволило покрыть большую часть обучающего корпуса.

ЭтапЦельМетод
CPTВнедрение доменных знанийОбучение на веб-корпусах и синтетических данных
SFTОбучение генерации IDSПары инструкция-вывод
RLVRИсправление ошибокВознаграждение через IDS-Audit-Tool

Второй вызов — внедрение словаря IFC (Industry Foundation Classes), который содержит несколько тысяч терминов. Например, «балка» соответствует IfcBeam, а «кондиционер» — IfcUnitaryEquipment. Раньше такое сопоставление делалось вручную экспертами, и модель должна была выучить его напрямую. Третий вызов — грамматика IDS: это не просто XML, а структура с повторяющимися паттернами и специальными тегами, которую общие модели не могут точно воспроизвести.

Обучение включало три этапа: CPT, SFT и RLVR с использованием IDS-Audit-Tool в качестве функции вознаграждения.

Architecture diagram showing the three-stage training pipeline for Ishigaki-IDS, including CPT, SFT, and RLVR stages on Amazon EC2 P5en instances orchestrated by AWS ParallelCluster, with Amazon FSx for Lustre as shared storage.
Architecture diagram showing the three-stage training pipeline for Ishigaki-IDS, including CPT, SFT, and RLVR stages on Amazon EC2 P5en instances orchestrated by AWS ParallelCluster, with Amazon FSx for Lustre as shared storage. · Источник: AWS Machine Learning Blog

Решение включало трехэтапный конвейер обучения на базе открытой модели Qwen3 (8B/14B/32B) от Alibaba Cloud. На первом этапе (CPT) в модель внедрялись знания об IDS и IFC с использованием веб-корпусов и синтетических данных. На втором этапе (SFT) модель обучалась на парах «инструкция — ожидаемый IDS-вывод». На третьем этапе (RLVR) использовалась функция вознаграждения на основе IDS-Audit-Tool от buildingSMART, которая проверяет корректность XML. Это позволило исправить ошибки, которые оставались после SFT, такие как неверные теги или значения атрибутов.

Обучение проводилось на кластере Amazon EC2 P5en с использованием AWS ParallelCluster для распределенных вычислений. Такой подход позволил экспериментировать с меньшими размерами моделей перед полным обучением на 32B. В результате Ishigaki-IDS снижает барьер входа для неспециалистов, позволяя им проверять и управлять атрибутами BIM-моделей без глубоких знаний IDS. Этот кейс демонстрирует, как можно создавать специализированные модели в областях с ограниченными данными, используя синтетические данные и многоэтапное обучение.