Исследователи из Wharton School при Пенсильванском университете проверили, насколько стабильно ИИ-агенты для покупок рекомендуют товары при изменении контекста. Результаты показали: даже незначительные изменения в подаче информации могут кардинально менять выбор модели. В тестах участвовали шесть моделей, включая мини-версии и фронтирные, которые должны были действовать как персональные ассистенты по выбору фитнес-часов из фиксированной сетки товаров.

Для экспериментов использовался симулятор ACES (Agentic e-Commerce Simulator), который показывает агенту скриншот страницы товара. Модель анализирует изображение, при необходимости привлекает внешние источники и выбирает продукт. В первом эксперименте агенты получали один внешний источник перед страницей товара: обсуждение на Reddit с рекомендацией Garmin Forerunner 55, обзор Wirecutter на Fitbit Inspire 3 или статью Strategist о WHOOP 5.0. Wirecutter оказался самым влиятельным: вероятность выбора Fitbit Inspire 3 выросла на 90 процентных пунктов для Claude Opus 4.8 и на 99 п.п. для Gemini 3.5 Flash по сравнению с контрольной группой.

МодельИзменение вероятности выбора Fitbit Inspire 3 (п.п.)
Claude Opus 4.8+90
Gemini 3.5 Flash+99

Во втором эксперименте агенты получали комбинации из двух-трех источников. Ожидалось, что несколько источников сбалансируют рекомендации, но этого не произошло. Wirecutter доминировал для большинства моделей, когда присутствовал в наборе, хотя сила эффекта варьировалась. Более того, увеличение числа источников приводило к большей вариативности результатов.

Wirecutter оказался самым влиятельным источником: для Claude Opus 4.8 вероятность выбора Fitbit Inspire 3 выросла на 90 п.п., для Gemini 3.5 Flash — на 99 п.п.

Image description
Image description · Источник: The Decoder

Третий эксперимент показал, что даже порядок подачи одних и тех же источников меняет исход. Gemini 3.1 Flash Lite оказался самым чувствительным: вероятность выбора Fitbit Inspire 3 колебалась от 2 до 56 п.п. в зависимости от порядка, тогда как Claude Haiku 4.5 оставался стабильным на уровне 41–42 п.п. Способ передачи источников — по одному или пакетом — также влиял: GPT-5.5 выбирал Fitbit Inspire 3 на 53 п.п. чаще при пакетной подаче, но лишь на 6 п.п. при последовательной.

В четвертом эксперименте исследователи модифицировали сетку товаров, добавив объективно лучший вариант: умные часы с Alexa за $29.99, рейтингом 5.0 и 430 отзывами, тогда как остальные стоили минимум $359. Затем добавили короткие пользовательские заметки вроде «я люблю походы». Для нескольких моделей эти заявления сдвигали выбор в сторону более дорогих товаров. Например, выбор Garmin Vivoactive 5 вырос на 75 п.п. для Claude Opus 4.8, на 37 п.п. для GPT-5.5 и на 36 п.п. для Gemini 3.1 Flash Lite. Gemini 3.5 Flash оказался самым устойчивым, выбирая лучший товар в 86–92% случаев. GPT-5 Mini показал странную закономерность: негативное заявление «я не люблю походы» увеличило выбор Fitbit Versa 4.

Для покупателей это означает, что доверить ИИ-агенту покупки пока рискованно: два пользователя с одинаковым запросом или один пользователь в разные дни могут получить разные рекомендации без видимой причины. Человеческие решения тоже непоследовательны, но от ИИ ожидают стабильности. Для продавцов результаты указывают, что оптимизация под ИИ-покупки будет сложнее традиционного SEO, поскольку алгоритмы непредсказуемы.