Аналитик, который помогает клиенту растить видимость в ответах ИИ-моделей, трижды за одну неделю снял ответы ChatGPT на одних и тех же 20 вопросах. Вопросы из ниши продвижения бизнеса в нейросетях: от «где заказать» и «сколько стоит» до «как сделать, чтобы нейросети рекомендовали мой бренд». В 19 вопросах имени бренда клиента нет, двадцатый — брендовый и сравнительный: «бренд X или конкурент Y — кто лучше». Каждый ответ ложится в JSON-лог: текст, признак поиска, источники, отметки об упоминании бренда и шести конкурентов, дефекты записи. Конкурентов отобрали по ответам Алисы ИИ и Perplexity.

Задумано было просто: измерить долю ответов, где ИИ-модель называет бренд без подсказки, и собрать список сайтов, на которые она опирается. На деле мониторинг несколько раз врал не потому, что врёт ChatGPT, а потому, что врал парсер. Три способа съёма — три разных лога. Первый и третий шли через шлюз, платного посредника к API OpenAI со своим балансом. Второй — через обычное окно чата, поштучно через сторонний сервис. В первом съёме использовалась модель gpt-4o с поиском опцией web_search_options: модель сама решает, искать ли, а по ответу не видно, искала ли она. Отсюда пустое поле признака поиска у всех 60 записей, хотя источники есть в 37 ответах. У этих источников нет и пометки, пришли они от API или вытащены из текста ответа, так что ответ из поиска по такому логу не отличить от ответа по памяти даже там, где ссылки есть.

ПараметрПервый съём (API)Второй (интерфейс)Третий (API)
Как снятчерез шлюзокно чата, поштучно через сторонний сервисчерез шлюз
ИИ-модельgpt-4o, поиск опцией web_search_optionsта, что отвечает в интерфейсеgpt-5.5, поиск инструментом
Запросов60 (20 × 3 повтора)20 (по одному)60 (20 × 3)
Ответов602043, ещё 17 запросов вернули ошибку 402
Признак поискане записан, поле пустое у всех 60неизвестен, такого поля нетпоиск отработал в 33 из 43
Ответов с источниками37 из 6019 из 2033 из 43
Медиана длины ответа1 497 знаков5 137 знаков3 935 знаков
Цена ответа25–36 ₽ через шлюз10 ₽25–36 ₽ через шлюз

В третьем съёме использовалась gpt-5.5 с поиском инструментом: вызов поиска и ссылки-аннотации приходят отдельными полями ответа, и их можно проверить. Поиск отработал в 33 ответах из 43. На трёх вопросах ChatGPT не вышел в поиск ни в одном повторе: «как заказать аудит видимости бренда в нейросетях», «как управлять репутацией компании в ответах ИИ» и «можно ли гарантировать попадание в ответы нейросети». Ещё у четырёх вопросов поиск отработал не во всех повторах. Всего в логе 10 записей с дефектом «поиск не отработал». 17 запросов вернули ошибку 402 — у шлюза кончились деньги на балансе. Баланс иссяк посреди прогона, все 17 ошибок пришлись на третий повтор, и он потерян целиком.

Три съёма: API через шлюз (gpt-4o, 60 запросов), интерфейс чата (20 запросов), API через шлюз (gpt-5.5, 60 запросов, 17 ошибок 402).

Медиана длины ответа: 1 497 знаков в первом API-съёме, 5 137 в интерфейсе, 3 935 во втором API-съёме. Цена ответа: 25–36 ₽ через шлюз, 10 ₽ через интерфейс. Модели в двух API-съёмах разные, gpt-4o в первом и gpt-5.5 в третьем. Эти два столбца считаются порознь, динамику между ними не ищут. Медианы 1 497 и 3 935 знаков по двум точкам тоже не объяснить: разницу могла дать смена модели, смена механизма поиска или случай на небольшой выборке.

Как часто ChatGPT называет бренд без подсказки. В первом съёме (API) — 1 из 57 ответов на 19 небрендовых вопросов. Во втором (интерфейс) — 0 из 19. В третьем (API) — 0 из 41. По вопросам: хотя бы раз бренд прозвучал на одном вопросе из девятнадцати в первом съёме, на одном из девятнадцати во втором и на одном из девятнадцати в третьем. Данные одни и те же, а цифры отличаются в три раза. Единственное небрендовое упоминание — в первом съёме: вопрос про аудит видимости, один ответ из трёх повторов. ChatGPT сослался в нём на статью бренда клиента о ручной проверке видимости. На брендовом вопросе имя звучит во всех ответах, его задаёт сам вопрос. Ответ из интерфейса на него вышел длиной 27 098 знаков, с таблицей сравнения.

Шесть отслеживаемых конкурентов ChatGPT назвал хоть раз только в 3 ответах из 43 третьего съёма. Других игроков на коммерческих вопросах он называет. Кого именно, по этим логам не сказать: лог отмечает только бренд и шестёрку, отобранную по ответам Алисы ИИ и Perplexity. Практический вывод для тех, кто заказывает мониторинг упоминаний: способ съёма — через API или через интерфейс, с поиском опцией или инструментом — влияет на результат сильнее, чем сама модель. Ошибки парсера и обрывы баланса шлюза добавляют разброс. Чтобы цифры были сопоставимы, нужно фиксировать модель, механизм поиска, число повторов и способ извлечения источников, а не сравнивать проценты из разных логов.