Разница в стоимости выполнения одной задачи между двумя фронтирными моделями OpenAI достигает почти 20 раз. По параметру Cost per Task модель GPT-5.6 Luna (max) обходится в $0.18, тогда как GPT-6 Astra (max) — в $3.26. При этом Artificial Analysis Intelligence Index у Luna равен 38, а у Astra — 53. Автор публикации на Habr описывает, как отказался от самых умных моделей в пользу самой дешёвой в линейке и не потерял в результате.
Cost per Task считается иначе, чем привычные бенчмарки на «сырых» вопросах. Задача ставится в нормально описанном виде — когда в хорошо сформулированном запросе уже содержится половина ответа, — и замеряется, сколько токенов ушло на её выполнение. Именно в таком режиме дешёвая модель показывает себя лучше: она тратит меньше токенов на ту же работу. Автор отмечает, что на тарифе за $20 в месяц у него перестали заканчиваться 5-часовые и недельные лимиты. Codex при этом не водит его по кругу, и переключаться на более умную модель не требуется.
| Модель | Artificial Analysis Intelligence Index | Cost per Task |
|---|---|---|
| GPT-5.6 Luna (max) | 38 | $0.18 |
| GPT-6 Astra (max) | 53 | $3.26 |
| DeepSeek-V4.1-Flash | 40 | — |
Логика здесь простая: для квалифицированного программиста, который сам формулирует задачу и понимает, что происходит в коде, уровня даже самых дешёвых фронтирных моделей хватает. Практика «если ИИ зациклился — включи модель поумнее» работает для тех, кто не разбирается в теме. Для тех, кто разбирается, она лишена смысла. Это меняет расстановку сил на рынке подписок: гонка за тем, у кого модель умнее, по мнению автора, подходит к концу.
Artificial Analysis Intelligence Index у Luna равен 38, у Astra — 53, у DeepSeek-V4.1-Flash — 40
Следующая проблема — скорость. На DeepInfra и OpenRouter средняя скорость генерации у более-менее нормальных моделей составляет 25–50 токенов в секунду. Даже Luna в Codex выполняет задачу в среднем за 5–15 минут, и для агентского режима это медленно. Если взять модель DeepSeek-V4.1-Flash напрямую через API DeepSeek, скорость достигает 300 токенов в секунду: задача выполняется меньше чем за минуту вместо пяти, а тяжёлая — за пять минут вместо пятнадцати. Artificial Analysis Intelligence Index у DeepSeek-V4.1-Flash равен 40, что на 2 пункта выше, чем у Luna. На текущий момент в скорости выигрывают китайские модели, но автор ожидает сюрпризов от американских LLM-провайдеров: у Anthropic, по его данным, с этим проблемы, а OpenAI, похоже, скоро получит дата-центры с тысячами токенов в секунду.
Отдельная тема — контекстное окно. Гонка за его размером («65 тыс. токенов», «250 тыс.», «полмиллиона», «1 млн») завершена, считает автор. Именно с ростом контекста появились ИИ-агенты для кодинга, которые в цикле итеративно наращивали контекст и за 20–30 циклов успевали сделать что-то полезное. Сейчас главная проблема в том, что агент при каждой новой задаче заново изучает код и правила работы с репозиторием: 80% его работы уходит на то, чтобы разобраться, что происходит, и только 20% — на правки в коде. Причина — контекстное окно в 1 млн токенов, которое приходится сбрасывать в ноль и начинать заново. Решение, по мнению автора, — долгосрочная память, при которой контекстное окно становится бесконечным. Такие проекты уже есть, и рынок, судя по всему, созрел.
Смена привычек затрагивает и инструменты. Автор перестал оплачивать подписки JetBrains и перешёл на бесплатный Zed IDE, который поддерживает привычные шорткаты. Экономия на подписках и на токенах складывается в одну картину: программист платит меньше, а делает столько же или быстрее.

