Снижение цен на GPT-5.6 Luna на 80% и на Terra на 20% на Amazon Bedrock, о котором объявили 30 июля, изменило расчёт, который многие команды делают автоматически: сравнивают доллары за миллион токенов. В открытом бенчмарке, опубликованном в блоге AWS Machine Learning, стоимость одного правильного ответа на AIME у Luna составила $0.0021, а у GPT-5.4-mini — $0.0139. Разница в 6,6 раза при том, что номинальная цена токена у mini ниже. Причина в том, что production-нагрузки покупают не токены, а результат: закрытый тикет, готовую справку, корректное резюме. Между прайс-листом и результатом стоят множители, которые бирка игнорирует: как часто модель права, сколько токенов ей нужно, чтобы дойти до ответа, и сколько ходов требует агентный сценарий.

В бенчмарке сравнивали пять моделей: три на Amazon Bedrock (gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol) и две на OpenAI API (gpt-5.4-mini, gpt-5.4-nano). Последние взяты как cost-optimized база, с которой многие начинают, а не как ровесники по поколению. Все модели прогоняли через один и тот же код — OpenAI Responses API, — меняя только backend и ID модели. Важная оговорка: на Bedrock модели работали с отключённым reasoning, а на OpenAI API — на дефолтных настройках. Это сравнение практических конфигураций развёртывания, а не контролируемая оценка внутренней способности моделей.

МодельAIME (точность)GPQA DiamondMMLU-ProСтоимость правильного ответа AIME
gpt-5.6-sol75%68%82%
gpt-5.6-luna$0.0021
gpt-5.4-mini37%43%59%$0.0139
gpt-5.4-nano

Точность в этом срезе различается заметно. Sol решает 75% задач AIME против 37% у mini, лидирует на GPQA Diamond (68% против 43%) и MMLU-Pro (82% против 59%). Если бы попытки были независимы, 37% точности означали бы примерно 2,7 попытки на успех. Но реальные повторы коррелированы, поэтому оценивать свою стратегию ретраев нужно на своих данных, а не переносить эту цифру напрямую. Ключевой вывод: token efficiency решила счёт ещё до изменения цен. При исходной цене Luna (примерно в 1,5 раза выше mini) она уже была на 25% дешевле в расчёте на правильный ответ AIME, потому что с отключённым reasoning тратила меньше billed-токенов, чем mini на дефолтных настройках. После снижения цен разрыв стал шестикратным.

В бенчмарке AIME Luna решает 75% задач, mini — 37%, но разрыв в точности не главное: важнее стоимость одного правильного ответа.

Chart of AIME accuracy and cost per correct answer for the five models, with luna at the lowest cost and sol at the highest accuracy
Chart of AIME accuracy and cost per correct answer for the five models, with luna at the lowest cost and sol at the highest accuracy · Источник: AWS Machine Learning Blog

Агентные нагрузки добавляют ещё один множитель — число ходов. Каждый новый шаг заново отправляет растущий контекст разговора, поэтому количество итераций может доминировать в счёте сильнее, чем цена за токен. Бенчмарк измеряет это на живых задачах веб-исследования, а также оценивает профессиональные deliverables по рубрикам: детерминированные проверки плюс LLM-судья (gpt-5.5, не из числа оцениваемых моделей) с зафиксированными промптами, хеши которых записаны в каждом файле результата. Каждый прогон пишет JSON с таймстампом, и все цифры и графики в отчёте генерируются из этих файлов на этапе сборки.

Размеры выборок — от 48 до 198 элементов, поэтому небольшие разрывы стоит трактовать как направление, а не как окончательный вывод. Harness openai-on-aws/benchmarks-openai воспроизводим: его можно запустить на своих задачах до выбора модели. Остаётся неопределённость в ценах: файлы результатов используют $0.22/$1.32 за 1M входных/выходных токенов для Luna и $2.20/$13.20 для Terra, но актуальный inference tier и регион Amazon Bedrock нужно проверять на живой странице цен. Объявление от 30 июля описывает first-party price parity, и это стоит уточнять перед публикацией.