16 сентября 404 Media выпустило материал о том, как устроен ручной просмотр пользовательских запросов в ChatGPT. Журналист издания Джозеф получил пакет внутренних документов, описывающих работу подрядчиков, и, по его словам, лично ознакомился с реальными промптами и фрагментами диалогов. Инициатива в документах фигурирует под названием «Project Lily».

Речь идёт о людях, которые читают не обезличенную статистику, а конкретные обращения пользователей к модели. Для большинства аудиторий ChatGPT это неочевидно: сервис воспринимается как личный инструмент, куда можно отправить черновик письма, фрагмент кода или рабочий документ. Практика ручной проверки запросов существует не только у OpenAI — аналогичные команды разметки и модерации есть у Google, Anthropic и Microsoft, — но именно вокруг ChatGPT возникает больше всего бытовых сценариев, где в тексте оказываются персональные данные.

Из опубликованного фрагмента не следует, что просмотр ведётся без правил: в подобных схемах подрядчики обычно работают по инструкциям, а доступ к чувствительным категориям ограничивают. Однако сам факт того, что диалоги попадают к сторонним исполнителям, меняет ожидания пользователя. В корпоративных тарифах условия обработки данных прописаны отдельно, а в потребительских настройках есть опция отключить использование переписок для обучения моделей — но она не отменяет проверку со стороны модераторов и подрядчиков.

Журналист 404 Media получил внутренние документы и видел сами промпты.

Image: 404 Media.
Image: 404 Media. · Источник: 404 Media

Пока неизвестно, сколько людей задействовано в «Project Lily», какие именно категории запросов они видят и как долго хранятся просмотренные фрагменты. В материале 404 Media эти детали не раскрыты, а официальной реакции OpenAI на публикацию не приводится. Тема прозвучала в выпуске подкаста 404 Media от 16 сентября вместе с сюжетами про Automattic и позицию a16z по поводу эншиттификации.

Для читателя практический вывод простой: если в запрос попадает что-то, что не должно покидать рабочий контур, — это стоит учитывать заранее. В корпоративной среде разумно опираться на политики обработки данных конкретного тарифа, а не на общие представления о приватности чат-ботов.