Брэдли Эми, технический директор компании Pangram, занимающейся детекцией ИИ-текстов, опубликовал статью, в которой объясняет, почему тексты, созданные большими языковыми моделями, часто можно отличить от человеческих. По его словам, дело не в ограниченных способностях моделей, а в пост-обучении и защитных механизмах, которые сужают их выразительный диапазон.
Эми утверждает, что теоретически LLM могли бы писать так же разнообразно, как люди, но системы вроде ChatGPT, Claude или Gemini обучаются поведенческим правилам, чтобы избегать опасных ответов или цензурировать определенные политические высказывания. Это резко ограничивает их выразительные возможности, что приводит к эффекту, известному как «mode collapse». При «mode collapse» модель фиксируется на одном предпочтительном варианте формулировки, вместо того чтобы покрывать весь спектр человеческого языка.
В отличие от этого, так называемые базовые модели — сырые модели до пост-обучения — пишут с большим разнообразием, и детектор Pangram их не помечает. То же самое относится к узкоспециализированным дообученным моделям, обученным только на текстах Хемингуэя или определенных субреддитов, а также к сломанным выводам, например, бессвязному тексту. Однако это применимо только к тексту без водяных знаков: водяные знаки, вероятно, будут работать всегда, даже с разнообразием базовой модели.
Базовые модели без пост-обучения пишут с большим разнообразием, и детектор Pangram их не помечает.

Для отрасли это означает, что детекция ИИ-текста может быть менее надежной, чем предполагалось, особенно для моделей, которые не проходили пост-обучение. Это также поднимает вопросы о балансе между безопасностью и выразительностью в ИИ-системах. С одной стороны, пост-обучение необходимо для предотвращения вредоносных выводов, но с другой — оно делает тексты более предсказуемыми и легко обнаруживаемыми. Возможно, будущие подходы будут искать компромисс, сохраняя безопасность без чрезмерного сужения разнообразия.



