В личном чате стоимость скриншота для тарифа погоды не делает. А вот в корпоративном сервисе сотрудники могут загружать в нейросеть ворох документов и снимков экрана, которые займут контекст и бюджет. Тогда это уже часть расходов компании, у команды есть лимит или оплата API.

Возьмем тестовый скриншот 1920×1080 и посчитаем объем визуального входа по открытым правилам разработчиков для GPT‑5.5, Claude Opus 4.8 и Gemini 3.1 Pro Preview. Все три модели доступны на BotHub. Заодно разберемся, что именно нейросеть получает после загрузки изображения и почему большое разрешение еще не гарантирует, что она прочитает мелкий текст без ошибок.

МодельРежимКак считаетсяРезультат
GPT‑5.5high или originalСетка 32×322040 токенов
Claude Opus 4.8Повышенное разрешениеСетка 28×282691 токен
Gemini 3.1 Pro Previewmedia_resolution_highПриблизительный бюджет режимадо 1120 токенов

Формулы взяли из документации разработчиков, а цены — из тарифов BotHub на момент публикации статьи. Данные вымышленные.

Claude Opus 4.8 использует сетку 28×28 пикселей, что дает 2691 токен в режиме повышенного разрешения.

Что происходит после загрузки изображения

Устройство закрытых моделей можно изучить только в общих чертах. Разработчики публикуют правила подготовки входа и тарификации, но полной схемы каждого слоя в доступе нет. На уровне API процесс можно описать так: сервис проверяет формат и размеры изображения, переводит его в визуальный вход (патчи, тайлы или токен-бюджет), а затем этот вход попадает в контекст вместе с промптом, и модель формирует ответ.

Пиксели → изменение размера → патчи или тайлы → числовые представления → ответ. Но патч — не готовый кусочек смысла. Например, код ошибки с буквой и цифрой может попасть сразу в несколько квадратов, и модель сопоставляет фрагменты, чтобы восстановить целое. При уменьшении изображения мелкие буквы могут слиться, поэтому артикулы и коды ошибок лучше перепроверять по исходнику.

Один скриншот, три разных числа

GPT‑5.5 покрывает изображение квадратами 32×32 пикселя. В режиме high допускается до 2500 патчей и до 2048 пикселей по длинной стороне. Для скриншота 1920×1080 получаем ceil(1920/32) × ceil(1080/32) = 60 × 34 = 2040 визуальных токенов. Патчи по краям считаются целиком. В режиме low модель получила бы версию 512×512, но мелкие подписи потерялись бы. Для OCR и точного определения координат OpenAI рекомендует режим original.

Claude Opus 4.8 делит изображение на патчи 28×28 пикселей. Anthropic относит модели Claude 4.7 и новее к уровню повышенного разрешения. Скриншот 1920×1080 помещается в лимиты без уменьшения: ceil(1920/28) × ceil(1080/28) = 69 × 39 = 2691 токен. На моделях стандартного разрешения тот же скриншот был бы уменьшен до 1456×819 и занял около 1560 токенов.

Gemini 3.1 Pro Preview не использует ручную сетку. Параметр media_resolution задает бюджет токенов: low — до 280, medium — до 560, high — до 1120, ultra_high — до 2240. Google рекомендует high для большинства задач, а ultra_high — для ИИ-агентов, управляющих компьютером по скриншотам. Для нашего сравнения выбираем high, получаем до 1120 токенов. Фактический объем запроса можно проверить через метод countTokens.

Сведем результаты в таблицу. Числа стоят рядом для удобства, но получены по-разному: GPT и Claude делят ширину и высоту на размер патча, округляют вверх и перемножают, а Gemini выбирает режим, и Google указывает бюджет.

Для бизнеса разница в подсчете токенов напрямую влияет на стоимость API. Если команда регулярно загружает скриншоты в корпоративный сервис, выбор модели с меньшим числом токенов на изображение может сократить расходы. Однако важно учитывать качество распознавания: дешевле не всегда значит лучше, особенно когда речь идет о мелком тексте или сложных интерфейсах.