На воркшопе End-to-End Customer Journey Optimization конференции KDD 2026 команда VK Research представила статью Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction. Работа описывает подход к обучению рекомендательных систем, который учитывает долгосрочную удовлетворённость пользователя, а не только ближайшее взаимодействие. KDD — одна из ведущих мировых конференций по машинному обучению, поэтому публикация здесь — признание значимости исследования.

Рекомендательные системы, такие как в VK Видео или VK Музыке, обычно работают каскадом: сначала кандидатогенерация отбирает из миллионов айтемов несколько сотен, затем ранжирование сортирует их. Модели обучаются на логах взаимодействий: что показали, что пользователь лайкнул или дослушал. Однако классические подходы оптимизируют вероятность следующего клика или лайка, что не всегда соответствует долгосрочным целям продукта — например, удержанию пользователя или росту времени в приложении.

Модель
NIP-CE0,31530,32170,28140,2679
Positive-CE0,30290,32980,26340,2662
REINFORCE0,30860,31740,26530,2655

Проблема в том, что каждое действие меняет состояние пользователя. Рекомендация отличного трека может привести к тому, что пользователь уйдёт из сервиса, если следующий трек окажется хуже. Жадная оптимизация ближайшей награды игнорирует такие последствия. Обучение с подкреплением (RL) предлагает формальный аппарат для решения этой задачи: агент (рекомендательная система) взаимодействует со средой (пользователем), получая награды за действия, и учится максимизировать суммарную награду на длинном горизонте.

Метод VK Research адаптирует алгоритм REINFORCE для задачи кандидатогенерации в крупномасштабных системах. Ключевая сложность — необходимость учитывать многошаговые последствия действий, что требует коррекции смещения (off-policy correction). Авторы применили multi-step off-policy correction, чтобы эффективно обучать модель на логах, собранных старой политикой. Это позволяет использовать данные прошлых взаимодействий, не проводя дорогостоящие онлайн-эксперименты на каждом шаге.

Эксперименты проводились в VK Видео. По словам авторов, метод показал улучшение долгосрочных метрик удовлетворённости по сравнению с базовыми подходами. Точные цифры в статье не раскрываются, но сам факт публикации и тестирования в реальном продукте говорит о практической применимости. Для индустрии это шаг к тому, чтобы рекомендательные системы перестали быть «жадными» и начали учитывать долгосрочные предпочтения пользователей.

Тема долгосрочной оптимизации активно развивается: похожие идеи обсуждаются в контексте RLHF для языковых моделей и в рекомендательных системах крупных платформ. Однако большинство подходов ограничивается ранжированием, тогда как VK Research сфокусировалась на кандидатогенерации — первом этапе каскада, где отсеивается основная масса айтемов. Это отличает работу от аналогов и открывает возможности для интеграции с другими компонентами системы.

Ограничения метода связаны с предположением о марковском свойстве состояния: модель полагает, что следующее состояние зависит только от текущего, что требует аккуратного конструирования признаков. Кроме того, off-policy коррекция может быть чувствительна к качеству логов. Тем не менее, результаты в VK Видео демонстрируют потенциал подхода для реальных продуктов.