Arena.ai опубликовала разбор стилистики ответов Claude — сравнение двух версий модели, Fable 5 и Fable 5.1, на массиве из десятков тысяч выходных данных Text Arena с высоким уровнем рассуждений. Речь не о бенчмарках на точность или скорость, а о том, как меняется язык модели: длина ответов, структура предложений, частота вводных конструкций и оценочных формулировок. Такой анализ показывает, что настройка модели — это не только про качество решения задач, но и про то, как она разговаривает с пользователем.
Самое заметное изменение — длина. Медианный ответ Fable 5.1 составляет 414 слов, что на 30% больше, чем у Fable 5 (319 слов). При этом новая версия всё ещё на 21% короче Opus 5, у которого медиана — 525 слов. Средняя длина предложения у Fable 5.1 — 12,54 слова, чуть выше, чем у Opus 5 (12,20). То есть модель стала многословнее, но не за счёт более длинных предложений — скорее за счёт большего числа предложений в ответе.
| Метрика | Fable 5 | Fable 5.1 | Opus 5 |
|---|---|---|---|
| Медианная длина ответа, слов | 319 | 414 | 525 |
| Длинные тире на 1000 слов | 16,2 | 11,0 | — |
| Точки с запятой на 1000 слов | 3,73 | 6,09 | — |
| Доля длинных содержательных слов | 42,6% | 38,6% | — |
| Абстрактные существительные на 100 слов | 4,39 | 3,28 | — |
| Доля ответов с похвалой и валидацией | 3,17% | 1,98% | — |
| Средняя длина предложения, слов | — | 12,54 | 12,20 |
Стилистические маркеры тоже сдвинулись. Fable 5.1 использует заметно меньше длинных тире: 11,0 на 1000 слов против 16,2 у Fable 5. Зато чаще ставит точку с запятой — 6,09 против 3,73. Это меняет ритм текста: вместо резких пауз, которые создаёт тире, появляются более связные, но тяжёлые конструкции. Доля длинных содержательных слов упала с 42,6% до 38,6%, а абстрактных существительных — с 4,39 до 3,28 на 100 слов. Иными словами, язык стал проще и конкретнее, несмотря на рост объёма.
Частота длинных тире упала с 16,2 до 11,0 на 1000 слов, а точка с запятой стала встречаться чаще: 6,09 против 3,73.

Отдельная линия — оценочность и хеджирование. Фразы вроде «honestly» и «frankly» почти исчезли, соглашательские зачины стали реже. Штампы вроде «load-bearing» встречаются на 20% реже на 1000 слов. Хеджи — «perhaps», «arguably» — упали на 36%. Похвала и валидация собеседника появляются в 1,98% ответов против 3,17% у предыдущей версии. Модель стала меньше подстраиваться под пользователя и реже смягчать формулировки.
Для отрасли это иллюстрация того, как настройка стиля становится отдельным направлением работы. Разработчики всё чаще управляют не только знаниями и логикой модели, но и её «голосом»: убирают шаблонные обороты, снижают льстивость, меняют пунктуационные привычки. Arena.ai сравнивает модели по десяткам параметров — от длины ответа до частоты конкретных слов, — и такие замеры позволяют увидеть, что именно меняется между версиями. Для пользователей это означает, что обновление модели может ощущаться не как рост интеллекта, а как смена манеры общения: ответы становятся длиннее, суше и менее угодливыми.



