Брэдли Эми, технический директор компании Pangram, занимающейся детекцией ИИ-текстов, опубликовал статью, в которой объясняет, почему тексты, созданные большими языковыми моделями, часто можно отличить от человеческих. По его словам, дело не в ограниченных способностях моделей, а в пост-обучении и защитных механизмах, которые сужают их выразительный диапазон.

Эми утверждает, что теоретически LLM могли бы писать так же разнообразно, как люди, но системы вроде ChatGPT, Claude или Gemini обучаются поведенческим правилам, чтобы избегать опасных ответов или цензурировать определенные политические высказывания. Это резко ограничивает их выразительные возможности, что приводит к эффекту, известному как «mode collapse». При «mode collapse» модель фиксируется на одном предпочтительном варианте формулировки, вместо того чтобы покрывать весь спектр человеческого языка.

В отличие от этого, так называемые базовые модели — сырые модели до пост-обучения — пишут с большим разнообразием, и детектор Pangram их не помечает. То же самое относится к узкоспециализированным дообученным моделям, обученным только на текстах Хемингуэя или определенных субреддитов, а также к сломанным выводам, например, бессвязному тексту. Однако это применимо только к тексту без водяных знаков: водяные знаки, вероятно, будут работать всегда, даже с разнообразием базовой модели.

Базовые модели без пост-обучения пишут с большим разнообразием, и детектор Pangram их не помечает.

In "mode collapse," a language model fixates on one preferred phrasing (orange curve) instead of covering the full range of human language (blue curve). With "mode coverage," the model spreads probability more evenly across phrasings. | Ima
In "mode collapse," a language model fixates on one preferred phrasing (orange curve) instead of covering the full range of human language (blue curve). With "mode coverage," the model spreads probability more evenly across phrasings. | Ima · Источник: The Decoder

Для отрасли это означает, что детекция ИИ-текста может быть менее надежной, чем предполагалось, особенно для моделей, которые не проходили пост-обучение. Это также поднимает вопросы о балансе между безопасностью и выразительностью в ИИ-системах. С одной стороны, пост-обучение необходимо для предотвращения вредоносных выводов, но с другой — оно делает тексты более предсказуемыми и легко обнаруживаемыми. Возможно, будущие подходы будут искать компромисс, сохраняя безопасность без чрезмерного сужения разнообразия.