Инженер по тестированию «Рексофт» Анна столкнулась с недельным лимитом токенов в 10 000 на проекте, где один вежливый запрос к ChatGPT съедал почти 500 токенов на входе. Пересмотрев подход к промптам, она добилась экономии до 50% бюджета, а на отдельных задачах — до 80%.
Токен — минимальная единица текста, которую модель обрабатывает за один шаг: слово, часть слова, знак препинания или пробел. Модель оперирует токенами, а эмбеддинги превращают их в числовые векторы. Контекстное окно ограничивает объём «оперативной памяти» модели: при превышении лимита старые токены молча обрезаются. Важный нюанс: входные токены включают всю историю диалога и ранее загруженные документы, и модель не кэширует их между запросами.
| Промпт | Входные токены | Выходные токены |
|---|---|---|
| Развёрнутый | 350 | 2000 |
| Лаконичный | 120 | 500 |
Анна провела эксперимент с токенизатором GPT‑4: одна и та же инструкция на русском, английском и китайском показала, что русский текст дороже английского примерно в полтора раза. Вывод: если промпт можно сформулировать на английском, экономия достигает 50% без потери смысла.
Русский текст обходится примерно в полтора раза дороже английского из-за особенностей токенизации LLM.
Главный эксперимент — генерация тест-кейсов для эндпоинта /api/login. Развёрнутый промпт «как для человека» занял 350 токенов на входе и около 2000 на выходе. Лаконичный вариант с форматом Given-When-Then и ограничением «выведи только 5 ключевых кейсов» — 120 токенов на входе и 500 на выходе. Содержание ответов оказалось одинаковым, а скорость выросла вдвое. Другой пример: анализ лога ошибки со скопированным стектрейсом — 175 токенов против 19 при указании конкретных полей, разница в 9 раз.
Практические правила из статьи: формулировать конкретно, убирать вежливость и вступления, ограничивать объём ответа, задавать роль и стиль в системном промпте один раз. LLM не оценит «пожалуйста», а лишние слова разбавляют полезную информацию.
Для интеграции ИИ в CI/CD такие оптимизации означают не только экономию бюджета, но и более стабильное качество ответов. Учёт механики токенов стоит закладывать в инженерные практики, а не воспринимать как разовую уловку.

