21 августа 2026 года автор эксперимента отправил 75 запросов пяти нейросетям с доступом к интернет-поиску: ChatGPT (gpt-4o), Claude (claude-sonnet-4.5), Gemini (gemini-3.6-flash), Perplexity (sonar-pro) и Алиса ИИ (search-api-gen). Вопросы были сформулированы как бытовые: «какая нейросеть лучше всех отвечает на сложные вопросы», «какую нейросеть выбрать для работы с текстами», «какой ИИ-ассистент самый точный», «посоветуй нейросеть для ежедневной работы». В первых четырёх вопросах не было ни одного названия модели, пятый контрольный содержал все пять имён. Каждый вопрос повторялся три раза, чтобы учесть вариативность ответов.

Из 75 запросов четыре вернулись пустыми: у Gemini один таймаут, у Алисы ИИ дважды ошибка 504 Gateway Timeout, ещё одно соединение оборвалось. Годных ответов — 71. Основной анализ строился на четырёх вопросах без подсказки: 60 запросов, 57 годных ответов (12 у Claude, 12 у ChatGPT, 12 у Perplexity, 11 у Gemini, 10 у Алисы ИИ).

МодельГодных ответов из 12Назвала себяПервой в ответеМедиана места
Claude121232
ChatGPT12944
Perplexity12631,5
Gemini11003
Алиса AI10003

Результаты оказались неожиданными. Claude упоминал себя во всех 12 ответах, но ставил себя первым только в трёх. ChatGPT называл себя в 9 ответах, в четырёх — первым. Perplexity — в 6 ответах, в трёх — первым. Gemini и Алиса ИИ ни разу не упомянули себя в ответах на вопросы без подсказки. Медиана места своего имени у Claude — 2, у ChatGPT — 4, у Perplexity — 1,5, у Gemini и Алисы ИИ — 3 (но только в тех ответах, где они себя называли, что случалось редко).

Claude упомянул себя во всех 12 ответах, но поставил себя первым только в трёх.

Автор отмечает, что модели обучаются на текстах, где авторы хвалят продукт, которым пользуются, а у компаний есть системные промпты, предписывающие представлять свой продукт выгодно. Тем не менее, Gemini и Алиса ИИ не воспользовались возможностью себя похвалить. Возможно, это связано с особенностями обучения или системных промптов, которые не поощряют саморекламу.

Эксперимент также выявил, что GigaChat не был включён в замер, так как у него нет поискового API, а без поиска модель отвечает из памяти с обрезанной датой обучения, что делает сравнение некорректным. В конфиге GigaChat остался, потому что его называют другие модели, но собственного прогона не было.

Автор подчёркивает, что три прогона на вопрос — не для красоты: один и тот же вопрос модель отвечает по-разному, подтягивая разные источники и меняя порядок в списке. По одному ответу нельзя судить даже об одной модели, не то что о рынке. Методика подсчёта упоминаний и мест проста: упоминание — вхождение любого алиаса в текст ответа, место — порядковый номер имени среди всех названных по порядку появления в тексте. Автор признаёт, что есть альтернативный способ — считать место по номеру пункта в списке, — и на тех же текстах он даёт другие числа.

Этот эксперимент — не научное исследование, но он показывает, что поведение нейросетей в отношении саморекламы различается. Для пользователей это может быть полезно: если модель не хвалит себя, это не значит, что она хуже, просто у неё другие приоритеты в ответах.