Конвейер BookTrans, предназначенный для автоматизированного перевода книг, провёл сравнительные испытания четырёх подписочных LLM: claude-opus-5 от Anthropic, gpt-5.6-sol от OpenAI, а также gemini-3.7-flash и gemini-3.1-pro от Google. Тест показал неожиданный результат: младшая модель Gemini Flash 3.7 обошла флагманскую Pro 3.1 по всем параметрам, включая частоту правок, цензурные отказы и качество русского языка.
Методика испытаний строилась на переводе глав романа Стивена Бакстера «Timelike Infinity» с английского на русский. Все модели работали с единым справочником имён и терминов. Качество оценивалось двумя способами: автоматический подсчёт правок, которые вносит модель-редактор, и ручное чтение переводов рядом с оригиналом. Авторы подчёркивают, что сравнение чисел правок корректно только внутри одного судьи, поскольку разные модели-редакторы проявляют разную строгость.
| Переводчик | Судья Opus | Судья Sol | Судья Pro |
|---|---|---|---|
| flash | 40 | 48 | 52 |
| opus | — | 61 | 63 |
| sol | 55 | 51 (самоправка) | 69 |
| pro | 74 | 74 | 65 (самоправка) |
Главная сенсация — результат Gemini Flash 3.7. На прозе судья-opus внёс 40 правок в перевод Flash против 74 в перевод Pro. Аналогичная картина у других судей: 48 против 74 у Sol и 52 против 65 у самого Pro. В диалогах Flash также оказалась чище: 41 правка против 57. Кроме того, Flash справилась с чувствительной сценой без цензурных отказов во всех трёх проходах, тогда как Pro отказалась в двух из трёх. Перевод Flash оценили как живой русский язык с находками, тогда как у Pro постоянно встречались кальки и канцелярщина.
Модель, правящая собственный перевод, слепа к своим ошибкам: самоправка не тестировалась.
Причина такого разрыва, по мнению авторов, — поколение модели важнее её ранга в линейке. Flash-3.7 вышла в июле 2026 года, а Pro-3.1 — в январе 2026-го. Новая младшая модель переросла старую старшую, но маркетинговая иерархия «флагман, середина, эконом» осталась прежней и не отражает реального соотношения сил. Это заставляет пересмотреть подход к выбору модели: ориентироваться только на имя линейки нельзя, необходимы замеры на конкретной задаче.
В конвейере BookTrans после испытаний главным переводчиком стала Flash, а Pro переведена в резерв. Однако идеального переводчика среди участников не нашлось: чистота перевода, стилистический блеск и верность оригиналу достались разным моделям. Например, модель, которая лучше всего полирует текст, не всегда способна заметить фактические ошибки автора.
Отдельно авторы выделили роль сверщика — единственного участника конвейера, который видит и оригинал, и перевод, и замечания редактора. Сверщик выносит вердикт по каждому спорному месту: если ошибся автор, текст не трогают, а истину выносят в сноску «Прим. ред.»; если ошибся переводчик — исправляют перевод; пустые подозрения снимаются. Тест показал, что на эту роль подходят не все модели: способность усомниться в оригинале и явно указать на ошибку проявила лишь одна из трёх. Именно на этой разнице держится иерархия ролей в конвейере.
Авторы также отмечают, что модель, правящая собственный перевод, слепа к своим ошибкам: самоправка не тестировалась, поскольку к своим калькам модель не видит проблем. Это ограничение важно учитывать при построении автоматизированных конвейеров перевода, где редактор сознательно работает без оригинала, чтобы избежать переноса англоязычного синтаксиса в русский текст.

