Исследователи из Южной Кореи поставили вопрос: можно ли найти отдельные шаги рассуждения, которые языковая модель демонстрирует в тексте, ещё и в её числовых внутренних состояниях. Команда KAIST и Naver ИИ Lab определила восемь повторяющихся операций рассуждения — среди них извлечение, декомпозиция, вызов формулы, дедукция и вычисление. Три модели (Qwen2.5-7B, Qwen3-8B и Gemma4-31B) решали математические задачи, их решения разбивались на сегменты, а GPT-5 помечал каждый сегмент одной из восьми операций.

Результат: разные операции надёжно различаются во внутренних представлениях, и это справедливо для всех трёх моделей. Разделение достигает пика в средних слоях. Исследователи проверили, не объясняется ли эффект простым выбором слов. Классификатор, который смотрел только на токены, работал хуже, чем анализ внутренних представлений. Позиция сегмента в цепочке решения тоже не объясняла результат. Значит, внутренние состояния несут информацию о типе шага рассуждения, выходящую за пределы поверхностных формулировок.

МодельПараметрыРезультат
Qwen2.5-7B7BОперации различимы, сигнал в средних слоях
Qwen3-8B8BОперации различимы, классификаторы переносятся на GPQA-Diamond и MATH-500
Gemma4-31B31BОперации различимы, сигнал в средних слоях
Llama-3-8B8BЭффект воспроизведён

Отдельно проверялось, как ведут себя служебные слова вроде «a», «is» или «the». Они встречаются в разных шагах рассуждения. В ранних слоях их представления ещё перемешаны, но к средним и поздним слоям они разделяются в зависимости от окружающей операции. Одно и то же слово получает разное внутреннее представление в зависимости от того, к какому шагу рассуждения оно относится. Это указывает на то, что модель учитывает контекст операции, а не только лексику.

Разделение наиболее выражено в средних слоях; классификатор по внутренним состояниям обошёл классификатор, смотревший только на слова.

The same response produces a different activation pattern depending on which reasoning operation is being probed. Segments cluster along the corresponding direction in the scatter plot. | Image: Jeong et al.
The same response produces a different activation pattern depending on which reasoning operation is being probed. Segments cluster along the corresponding direction in the scatter plot. | Image: Jeong et al. · Источник: The Decoder

Ещё один эксперимент касался изолированности шага. Когда исследователи блокировали внимание к предыдущим 30 токенам, сигнал соответствующей операции ослабевал. Шаги рассуждения не возникают сами по себе, а строятся на предшествующем контексте. При этом даже на неверно решённых задачах тип шага оставался опознаваемым: ошибочное вычисление внутренне выглядело как вычисление, а не как, скажем, вызов формулы. Это значит, что внутренняя разметка операций не зависит от правильности результата.

Надёжность разделения подтвердилась и в дополнительных тестах. Эффект воспроизвёлся на Llama-3-8B, а для Qwen3-8B обученные классификаторы успешно перенеслись на GPQA-Diamond и MATH-500. Однако эксперименты ограничены математическими задачами и небольшим набором моделей. Остаётся открытым вопрос, можно ли использовать эти закономерности для перехвата ошибок или управления моделью прямо во время генерации.

Связь между текстовым выводом и внутренними вычислениями важна для безопасности ИИ. Чтение цепочки рассуждений — один из немногих инструментов надзора, доступных, по данным OpenAI. Но Anthropic показала, что модели раскрывают использованные подсказки лишь в 25–39% случаев. Метод, переводящий внутренние векторы модели в читаемый текст, выявил, что Claude Opus 4.6 обрабатывает больше, чем показывает в выходных рассуждениях. А в модели Astra от OpenAI техника Recurrent Depth переносит часть рассуждения во внутренние числовые представления — именно в ту область, которую изучает работа KAIST.