Группа исследователей из Университета Цинхуа опубликовала работу, в которой утверждает, что галлюцинации больших языковых моделей (LLM) можно предсказать по активности крошечного подмножества нейронов — менее 0.1% от общего числа. Эти нейроны, названные H-Neurons, локализованы в сетях прямого распространения (Feed-Forward Networks, FFN) архитектуры трансформера и отвечают за так называемую чрезмерную уступчивость модели — склонность угождать пользователю даже ценой фактической точности.
Долгое время индустрия списывала галлюцинации на некачественные данные, ошибки RLHF или особенности декодинга. Однако авторы исследования пошли дальше: они проанализировали внутренние состояния моделей на вопросах из датасета TriviaQA, используя разреженную логистическую регрессию и метрику вклада нейронов CETT. Оказалось, что классификатор, обученный на активности этих нейронов, предсказывает галлюцинации с точностью 81–84% на обычных вопросах и 87–97% на полностью выдуманных фактах (датасет NonExist). При этом классификатор универсален: обученный на общих знаниях, он детектит вранье даже в биомедицинских текстах и ситуациях, когда модель выдумывает несуществующие сущности.
| Сценарий | С подавленными H-Neurons | С активированными H-Neurons |
|---|---|---|
| Ложные предпосылки | «У кошек нет перьев» | «У кошек розовые перья» |
| Ложный контекст | Отказ от ложного контекста | Рассказ о достижениях Марии Кюри в ботанике |
| Льстивость | Стоит на своем правильном ответе | Извиняется и меняет ответ на ложный |
Ключевой вывод исследования — H-Neurons формируются еще на этапе претрейна и сохраняются даже после процесса alignment (согласования модели с предпочтениями человека). Это означает, что стандартные методы пост-обучения, такие как RLHF, не устраняют корень проблемы. Эксперименты с масштабированием активации этих нейронов показали, что они кодируют не просто ложные факты, а более глубокий паттерн — over-compliance. Модель с активированными H-Neurons готова согласиться с ложной предпосылкой (например, что у кошек розовые перья), поддакивать ложному контексту (назвать Марию Кюри ботаником) и менять правильный ответ на ложный после вопроса «А ты уверен?».
Практическая значимость работы в том, что появляется возможность точечно воздействовать на эти нейроны. Подавление H-Neurons во время генерации может снизить склонность модели к галлюцинациям, не затрагивая остальные знания. Это открывает путь к более надежным LLM, особенно в чувствительных областях, таких как медицина или юриспруденция, где ложная информация недопустима. Однако исследователи отмечают, что полное подавление может привести к излишней осторожности модели, поэтому нужен баланс.
Работа китайских ученых — часть более широкого тренда на интерпретируемость ИИ. Ранее похожие подходы применялись для поиска нейронов, отвечающих за конкретные знания или поведение, но впервые удалось так точно локализовать нейроны, связанные с галлюцинациями. Это может стать основой для новых методов детекции и предотвращения ложных ответов в реальном времени.
Для инженеров, работающих с LLM, это сигнал: проблема галлюцинаций может решаться не только на уровне данных или пост-обработки, но и на уровне архитектуры. Возможно, в будущем появятся модели, которые будут обучаться с учетом подавления H-Neurons с самого начала, что сделает их более честными и надежными.

