AWS выпустила вторую часть руководства по подготовке данных для supervised fine-tuning (SFT), в которой рассматриваются четыре стратегии: оценка готовности данных, отбор подмножеств, аугментация и смешивание. Материал основан на практике Amazon Nova и применим к любой модели.
Первая часть серии была посвящена форматированию и проверке качества: там описывался формат диалогов, ожидаемый Amazon Nova, проверки, выявляющие некорректные примеры, и разделение данных на обучающие и оценочные без утечек. Вторая часть предполагает, что у вас уже есть чистый и правильно отформатированный набор данных, и отвечает на вопросы: сколько данных нужно, как выбрать лучшие примеры, как генерировать качественные данные, когда не хватает ручной разметки, и как специализировать модель, не теряя общих способностей.
| Стратегия | Описание | Когда применять |
|---|---|---|
| Оценка готовности данных | Анализ кривой обучения для определения насыщения | Перед началом обучения, чтобы понять, достаточно ли данных |
| Отбор подмножеств | Выбор минимального набора с сохранением качества | Когда отдача от дополнительных данных снижается |
| Аугментация данных | Генерация синтетических примеров с помощью LLM | Когда ручная разметка не масштабируется |
| Смешивание данных | Комбинирование доменных данных с общими инструкциями | Для специализации без потери общих способностей |
Первая стратегия — оценка готовности данных. AWS рекомендует начинать с примерно 2 000 высококачественных обучающих примеров для типичной задачи SFT, но это лишь ориентир: для простого изменения формата может хватить 500 примеров, а для сложных задач с многошаговыми рассуждениями может потребоваться 10 000 или более. Ключевой элемент — четко определенный оценочный бенчмарк, отражающий реальный трафик и метрики, которые важны для вашего сценария. Без него невозможно понять, достаточно ли данных. Для определения оптимального размера набора AWS предлагает анализ кривой обучения: обучить модель на полном наборе, сохраняя промежуточные контрольные точки каждые 10–20% обучения, и оценивать каждую на отложенном наборе. Это позволяет построить кривую зависимости метрики от объема данных и найти точку насыщения, где удвоение данных дает менее 1–2% улучшения. Если кривая выходит на плато, больше данных того же типа не поможет — лучше либо остановить обучение раньше, либо добавить качественно иные данные, нацеленные на ошибки модели.

Вторая стратегия — отбор подмножеств данных. Когда отдача от дополнительных данных снижается, интеллектуальный отбор может превзойти обучение на полном наборе. Методы вроде DEITA, DELIFT и выбор ядра (coreset selection) находят минимальное подмножество, покрывающее пространство задач с сохранением качества и разнообразия. Они оценивают примеры по качеству, разнообразию и тому, насколько каждый пример обучает модель. Преимущества: достижение производительности, сравнимой с полным набором, при меньшем количестве примеров, и удаление избыточных или низкокачественных примеров, которые могут мешать обучению.
Третья стратегия — аугментация данных. Когда ручная разметка не масштабируется, можно генерировать синтетические примеры с помощью LLM. AWS отмечает, что аугментация должна быть нацелена на конкретные слабые места модели, а не просто увеличивать объем. Например, можно создавать вариации существующих примеров, изменяя формулировки или добавляя новые сценарии, но важно сохранять качество и релевантность.
Четвертая стратегия — смешивание данных. Чтобы специализировать модель без потери общих способностей, AWS рекомендует смешивать доменные данные с общими инструкциями. Это позволяет сохранить способность модели следовать общим инструкциям, одновременно улучшая ее в конкретной области. Пропорции смешивания зависят от задачи, но обычно доля доменных данных составляет от 10% до 50%.
AWS подчеркивает, что SFT не следует степенному закону масштабирования, как предобучение: объем данных не гарантирует пропорционального улучшения. Исследование Data Repetition Beats Scaling показало, что при фиксированном бюджете вычислений 128 эпох на 400 примерах рассуждений превзошли однократное обучение на 51 200 примерах на 12–26 процентных пунктов на бенчмарках AIME и GPQA. Это означает, что небольшой, но качественный набор, обученный до полного запоминания, может быть эффективнее большого набора, который модель видит лишь один раз. Практический критерий остановки — точность на обучающих токенах: после достижения почти идеальной точности дальнейшие эпохи не дают улучшений.
В целом, руководство AWS дает практические рекомендации по оптимизации данных для SFT, которые могут быть полезны как специалистам, так и тем, кто только начинает работать с тонкой настройкой моделей. Ключевые выводы: начинайте с оценочного бенчмарка, используйте кривую обучения для определения насыщения, применяйте отбор подмножеств и аугментацию для повышения эффективности, и не забывайте о смешивании данных для сохранения общих способностей модели.



