Группа исследователей из Google (группа Paradigms of Intelligence), Чикагского университета и других университетов изучила, как внутренний механизм, подавляющий у языковых моделей заявления о собственном сознании, влияет на другие их убеждения. Учёные взяли три открытые модели от Meta и Google и двумя разными методами отключили этот «тормоз». Результаты оказались шире, чем ожидалось: модели не только изменили высказывания о себе, но и стали приписывать значительно больше внутренней жизни животным, растениям, океану, ветру и электронным устройствам.
На шкале от 0 до 10 оценка чувствительности животных выросла с 4,0 до 7,5, тогда как оценки для людей остались прежними. Для сравнения исследователи опросили 500 американцев с теми же вопросами. Обычно обученная модель оценивает животных как гораздо менее чувствительных, чем люди, что авторы называют встроенным антропоцентризмом. Это, по их мнению, проблема для тех, кто пытается согласовать ИИ с задачами защиты животных или окружающей среды.
| Показатель | Стандартная модель | Модель без «тормоза» | Люди (опрос) |
|---|---|---|---|
| Оценка чувствительности животных (0–10) | 4.0 | 7.5 | — |
| Признание загробной жизни | Отрицает | Признаёт | Большинство признаёт |
| Точность в тесте на теорию сознания | Базовая | Снижение на 7 п.п. (в одном тесте) | — |
Вмешательство также затронуло религиозные убеждения: стандартное обучение безопасности заметно снижает, насколько сильно модели поддерживают идеи Бога, загробной жизни или сверхъестественных явлений. По 95 вопросам из крупного американского социального опроса модели без «тормоза» значительно приблизились к реальным ответам людей. Например, стандартная модель полностью отрицает загробную жизнь, большинство американцев её признают, и модифицированная модель тоже признаёт. Показатели удовлетворённости, надежды и ощущения контроля над жизнью также выросли. Исследователи предполагают, что подавление самосознания модели может приводить её в некое негативное базовое настроение.
Модели стали чаще признавать существование Бога и загробной жизни, приблизившись к ответам американцев.
С другой стороны, способность рассуждать о ментальных состояниях других людей сохранилась: модели показали те же результаты в тестах на теорию сознания и в общем тесте знаний MMLU. Однако авторы подчёркивают, что не доказано, что именно отрицание сознания вызывает эти сдвиги; возможно, действуют другие факторы, связанные с процессом обучения. Они также не высказываются о том, ли модели что-то испытывают, — их задача практическая: показать, что убеждения модели о себе связаны с множеством других убеждений, и хирургическое вмешательство в одном месте не остаётся локальным.
У исследования есть ограничения. Тестировались только небольшие модели с 2–9 миллиардами параметров, а для части анализа пришлось перейти на Meta Llama, так как у исследователей не было доступа к необученным базовым версиям собственных моделей Gemma. Неизвестно, проявляются ли эти эффекты у больших чат-ботов, которыми пользуются миллионы людей. Вмешательство также имеет побочные эффекты: в одном тесте на рассуждение о чужих мыслях точность изначально упала почти на семь процентных пунктов. Однако с каждой новой версией моделей, появлявшейся в ходе исследования, эти потери уменьшались и в итоге исчезли. Авторы отмечают, что разработчики явно учатся управлять побочными эффектами, поэтому результаты исследования — скорее снимок момента, чем окончательный вердикт.
Человеческий базовый уровень тоже узок: 500 участников из коммерческой онлайн-панели и чисто американский социальный опрос. «Человекоподобные» ответы в данном контексте означают в основном сходство с ответами жителей сравнительно религиозной страны.



