Снижение цен на GPT-5.6 Luna на 80% и на Terra на 20% на Amazon Bedrock, о котором объявили 30 июля, изменило расчёт, который многие команды делают автоматически: сравнивают доллары за миллион токенов. В открытом бенчмарке, опубликованном в блоге AWS Machine Learning, стоимость одного правильного ответа на AIME у Luna составила $0.0021, а у GPT-5.4-mini — $0.0139. Разница в 6,6 раза при том, что номинальная цена токена у mini ниже. Причина в том, что production-нагрузки покупают не токены, а результат: закрытый тикет, готовую справку, корректное резюме. Между прайс-листом и результатом стоят множители, которые бирка игнорирует: как часто модель права, сколько токенов ей нужно, чтобы дойти до ответа, и сколько ходов требует агентный сценарий.
В бенчмарке сравнивали пять моделей: три на Amazon Bedrock (gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol) и две на OpenAI API (gpt-5.4-mini, gpt-5.4-nano). Последние взяты как cost-optimized база, с которой многие начинают, а не как ровесники по поколению. Все модели прогоняли через один и тот же код — OpenAI Responses API, — меняя только backend и ID модели. Важная оговорка: на Bedrock модели работали с отключённым reasoning, а на OpenAI API — на дефолтных настройках. Это сравнение практических конфигураций развёртывания, а не контролируемая оценка внутренней способности моделей.
| Модель | AIME (точность) | GPQA Diamond | MMLU-Pro | Стоимость правильного ответа AIME |
|---|---|---|---|---|
| gpt-5.6-sol | 75% | 68% | 82% | — |
| gpt-5.6-luna | — | — | — | $0.0021 |
| gpt-5.4-mini | 37% | 43% | 59% | $0.0139 |
| gpt-5.4-nano | — | — | — | — |
Точность в этом срезе различается заметно. Sol решает 75% задач AIME против 37% у mini, лидирует на GPQA Diamond (68% против 43%) и MMLU-Pro (82% против 59%). Если бы попытки были независимы, 37% точности означали бы примерно 2,7 попытки на успех. Но реальные повторы коррелированы, поэтому оценивать свою стратегию ретраев нужно на своих данных, а не переносить эту цифру напрямую. Ключевой вывод: token efficiency решила счёт ещё до изменения цен. При исходной цене Luna (примерно в 1,5 раза выше mini) она уже была на 25% дешевле в расчёте на правильный ответ AIME, потому что с отключённым reasoning тратила меньше billed-токенов, чем mini на дефолтных настройках. После снижения цен разрыв стал шестикратным.
В бенчмарке AIME Luna решает 75% задач, mini — 37%, но разрыв в точности не главное: важнее стоимость одного правильного ответа.

Агентные нагрузки добавляют ещё один множитель — число ходов. Каждый новый шаг заново отправляет растущий контекст разговора, поэтому количество итераций может доминировать в счёте сильнее, чем цена за токен. Бенчмарк измеряет это на живых задачах веб-исследования, а также оценивает профессиональные deliverables по рубрикам: детерминированные проверки плюс LLM-судья (gpt-5.5, не из числа оцениваемых моделей) с зафиксированными промптами, хеши которых записаны в каждом файле результата. Каждый прогон пишет JSON с таймстампом, и все цифры и графики в отчёте генерируются из этих файлов на этапе сборки.
Размеры выборок — от 48 до 198 элементов, поэтому небольшие разрывы стоит трактовать как направление, а не как окончательный вывод. Harness openai-on-aws/benchmarks-openai воспроизводим: его можно запустить на своих задачах до выбора модели. Остаётся неопределённость в ценах: файлы результатов используют $0.22/$1.32 за 1M входных/выходных токенов для Luna и $2.20/$13.20 для Terra, но актуальный inference tier и регион Amazon Bedrock нужно проверять на живой странице цен. Объявление от 30 июля описывает first-party price parity, и это стоит уточнять перед публикацией.



