Amazon Web Services опубликовала первую часть руководства по подготовке данных для supervised fine-tuning (SFT) — метода дообучения фундаментальных моделей, при котором модель обучается на парах «вход-выход», чтобы изменить её поведение. В статье, размещённой в официальном блоге AWS, разбираются базовые принципы: проверка качества данных, требования к форматированию и разбиение на обучающую и валидационную выборки. Материал адресован инженерам, которые уже решили дообучать модель и оценивают, как подготовить данные для этой работы.

Авторы напоминают, что подготовка данных определяет потолок любого проекта SFT. Если фундаментальная модель не следует требуемой схеме вывода, не различает таксономию домена или не выдерживает нужный тон, дообучение может решить эти проблемы. В посте выделяются три рычага пост-обучения: continued pre-training (CPT) — расширение знаний модели на больших объёмах неструктурированного текста; supervised fine-tuning (SFT) — обучение на курируемых парах для изменения поведения; reinforcement fine-tuning (RFT) — оптимизация через сигналы вознаграждения. Эти методы не исключают друг друга: типичный продакшн-паттерн — CPT, затем SFT, затем RFT. Однако на практике CPT используется реже, и для большинства задач достаточно SFT и RFT, так как базовые модели уже обучены на широком корпусе.

Target behaviorTwo inconsistent examples (avoid)Two consistent examples (use)
Return one lowercase label from a fixed setPositive This one reads as fairly negative.positive negative
Summarize in two sentences, no preambleLogin fails after reset iOS 17 Escalated to Tier 2 Sure! Here’s a quick summary: the customer reports that…Customer cannot log in after resetting their password on iOS 17. The ticket is escalated to Tier 2. Customer’s card was declined three times at checkout. Billing confirmed the issuer blocked the transaction.
Decline out-of-scope requests with one fixed sentenceI can’t help with that. I’m really sorry, but that falls outside what I’m able to assist with today. However, I’d be happy to…That request is outside the scope of this assistant. That request is outside the scope of this assistant.

Ключевой тезис статьи — качество данных важнее количества. Исследование LIMA показало, что 1000 тщательно отобранных примеров могут сравниться с моделями, обученными на порядки большем объёме данных. Работа AlpaGasus продемонстрировала, что фильтрация набора инструкций до самых чистых 20% позволяет обучаться быстрее и достигать более высоких результатов, чем на полном наборе. Поэтому авторы советуют внедрять многоэтапную проверку для человеческой разметки, чтобы исключить ошибки, которые модель может усвоить как устойчивую привычку.

Разнообразие примеров — второй важный фактор. Исследования масштабируемости SFT выделяют два свойства: семантическое покрытие (широта доменов и формулировок) и информационную глубину (богатство отдельных примеров). Узкий набор данных приведёт к тому, что модель будет хорошо работать только на этом срезе. Рекомендуется проверять вариативность формулировок, охват доменов, диапазон сложности и включать крайние случаи: неоднозначные запросы, неполную информацию, запросы вне области. Практический подход — кластеризация примеров по эмбеддингам: разреженные кластеры указывают на пробелы в обучающем сигнале.

Форматирование данных — ещё один критический аспект. Модели ожидают определённую структуру, и несоблюдение формата может привести к нестабильности обучения. В статье упоминаются примеры из документации Amazon Bedrock, но рекомендации применимы к любой модели. Разбиение на train/eval также требует внимания: важно, чтобы валидационная выборка отражала распределение реального трафика, иначе оценка будет нерепрезентативной.

Вторая часть серии, анонсированная в конце поста, будет посвящена продвинутым стратегиям: оценке готовности данных, выбору и фильтрации подмножеств, аугментации и смешиванию данных. Пока же первая часть даёт практическую основу для тех, кто начинает путь дообучения моделей.