Исследователи из Samsung и Варшавского университета опубликовали препринт, в котором описали феномен «призрачных» соавторов — несуществующих людей, чьи имена большие языковые модели (LLM) генерируют с пугающей последовательностью. В работе «The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing» авторы показали, что такие имена, как Elena Vasquez и Marcus Chen, фигурируют в сотнях ИИ-сгенерированных документов: от научных статей до книг и подкастов. Эти люди никогда не существовали, но их «биографии» включают роли вулканологов, астронавтов и соавторов исследований.
Проблема выходит за рамки курьезов. На платформе Zenodo, управляемой CERN и выдающей настоящие DOI, исследователи обнаружили 1 655 записей, авторами которых значатся «призрачные» имена. Многие из этих работ имеют фиктивные даты публикации и ссылки на несуществующие журналы. DOI — это цифровой идентификатор объекта, который используется для однозначной ссылки на научные работы. Поскольку Zenodo позволяет любому пользователю с бесплатным аккаунтом создавать DOI, ИИ-сгенерированные статьи получают легитимные идентификаторы, которые затем индексируются агрегаторами вроде Google Scholar и ResearchGate. Это создает «инфраструктуру для масштабного загрязнения научной записи», как отмечают авторы.
| Модель | Имя-«призрак» |
|---|---|
| Claude | Elena Vasquez |
| Gemini | Aris Thorne, Lena Petrova |
| ChatGPT | Elara Voss |
Исследователи также выявили, что разные модели имеют «любимые» имена. Например, Claude чаще всего генерирует Elena Vasquez, Gemini — Aris Thorne и Lena Petrova, а ChatGPT — Elara Voss. Более того, модели создают «коррелированные ансамбли персонажей»: некоторые имена с большей вероятностью появляются вместе. Это свойство позволяет предположить, что по именам можно определять, какая модель сгенерировала контент. Однако ведущий автор Michał Brzozowskim предупреждает, что точность такого метода может снизиться, поскольку ИИ-контент с этими именами уже попал в интернет и используется для обучения новых моделей, создавая петлю обратной связи.
На Zenodo найдено 1 655 записей с несуществующими журналами и фиктивными датами публикации.

Феномен «призрачных» авторов — лишь часть более широкой проблемы ИИ в академической среде. Ранее сообщалось, что научные журналы публикуют ИИ-сгенерированные тексты, а Arxiv ввел годичный бан для авторов, уличенных в подаче таких работ. В январе после убийства Алекса Претти сотрудниками пограничного патруля США в Facebook распространился слух, что его уволили с работы медбрата; опровержение приписывали «исполнительному директору доктору Елене Васкес», которая не существует. Этот случай показывает, как вымышленные имена проникают в реальные информационные потоки.
Потенциальная польза исследования в том, что «призрачные» имена могут стать маркером для автоматического выявления ИИ-сгенерированного контента. Если агрегаторы и журналы начнут проверять авторов по спискам таких имен, это поможет фильтровать мусор. Однако авторы подчеркивают, что проблема глубже: даже если имена будут меняться, сама практика создания фиктивных авторов подрывает доверие к научной литературе. Пока академическое сообщество ищет решения, «призраки» продолжают населять базы данных, делая научную запись менее надежной.



