Продакт-менеджер команды товарных рекомендаций «Магнита» Иван Одинцов опубликовал на Habr статью о том, как его команда решила проблему нехватки сильных гипотез. Команда научилась быстро проверять идеи, но запас новых идей иссяк: лучшие гипотезы уже были в проде, а в бэклоге оставался «осадок» — идеи с низким эффектом или высокой трудоёмкостью. Чтобы не «выедать» бэклог, команда построила собственный LLM-пайплайн, который генерирует гипотезы на основе архива прошлых экспериментов.

Перед созданием пайплайна команда оценила четыре возможных подхода: «ванильный» чат (ChatGPT, Claude), готовый агент, готовые инструменты вроде Productboard ИИ или Maze ИИ и собственный LLM-пайплайн. Первый вариант даёт слишком общие гипотезы и не воспроизводим. Готовый агент дорог по токенам и плохо поддаётся контролю качества. Готовые инструменты заточены под UX-гипотезы и не подходят для алгоритмов рекомендаций. Собственный пайплайн оказался единственным вариантом, который воспроизводим, заточен под специфику команды и накапливает контекст от запуска к запуску.

Ключевое отличие пайплайна от «ванильного» чата — в исходных данных. Модель в обоих случаях одна и та же, но пайплайн опирается на историю команды: знает, что уже пробовали, что сработало, а что нет. Например, «ванильный» чат предложит «использовать алгоритмы коллаборативной фильтрации», а пайплайн укажет на слабые места текущего TIFU-KNN и предложит кандидато-генератор на GNN для повышения serendipity. Разница — в контексте, который накапливается от запуска к запуску.

Собственный LLM-пайплайн использует архив прошлых экспериментов, что позволяет генерировать гипотезы с учётом специфики продукта.

Пайплайн состоит из четырёх этапов. Первые три этапа, судя по статье, включают сбор данных из архива экспериментов, генерацию гипотез и их приоритизацию. Четвёртый этап — проверка гипотез через A/B-тесты. Подробности реализации каждого этапа в статье не раскрываются, но автор подчёркивает, что пайплайн работает без выделенного разработчика — его поддерживает один продакт.

Для команды «Магнита» это решение стало способом масштабировать источник идей. Мозговые штурмы, анализ конкурентов и конференции имеют ограниченный потолок: штурмы ведут к «колее» общего взгляда, реверс-инжиниринг чужих алгоритмов невозможен, а сильных докладов по рекомендациям выходит всего два-четыре в год. Генерация гипотез с помощью ИИ оказалась четвёртым, почти нетронутым путём, который и был реализован.

Опыт «Магнита» может быть полезен продактам и аналитикам в e-commerce, которые столкнулись с похожей проблемой. Автор отмечает, что подход не требует больших вложений: один продакт и LLM-пайплайн могут заменить часть рутинной работы по генерации идей. Однако остаётся вопрос, насколько такие гипотезы эффективны по сравнению с идеями, созданными вручную, — в статье нет данных о результатах A/B-тестов, подтверждающих рост метрик.