Китайская компания DeepSeek выпустила экспериментальную мультимодальную модель V4-Flash-Vision-Exp, которая добавляет понимание изображений к текстовым возможностям базовой V4-Flash. На внутренних бенчмарках компании модель почти сравнялась с Opus 4.8 в агентных задачах, а в некоторых случаях даже превзошла его. Это делает V4-Flash-Vision-Exp одной из самых сильных открытых альтернатив проприетарным моделям для сценариев, где ИИ должен не только анализировать текст, но и работать с визуальной информацией.

Мультимодальность — это способность модели обрабатывать не только текст, но и изображения, аудио или видео. В случае V4-Flash-Vision-Exp речь идет о понимании картинок: модель может описывать изображения, извлекать текст из скриншотов и анализировать диаграммы. Это расширяет область применения модели: от автоматической обработки документов до создания агентов, которые взаимодействуют с графическими интерфейсами. DeepSeek позиционирует модель именно для агентных рабочих процессов — сценариев, где ИИ выполняет цепочки действий, используя инструменты и принимая решения на основе визуального контекста.

Способ передачи изображенияЛимит размераПримечание
Base64Встраивание напрямую в запрос
URL32 МиБПублично доступные ссылки
Files API64 МиББесплатно, можно переиспользовать по ID

Технически модель работает с форматами JPEG, PNG, GIF и WebP. При этом формат определяется по фактическому содержимому файла, а не по имени или заявленному MIME-типу, что снижает риск ошибок при обработке. Разработчики могут передавать изображения тремя способами: встраивать их напрямую с помощью Base64-кодирования, указывать публичные URL (до 32 МиБ) или использовать новый бесплатный Files API. Files API позволяет загрузить файл один раз и ссылаться на него по идентификатору в нескольких запросах, с лимитом размера 64 МиБ. Опциональное поле "detail" уменьшает изображения до 512×512 пикселей, экономя токены, когда не нужна высокая детализация. Перед обработкой модель автоматически нормализует изображения примерно до 800×800 пикселей в зависимости от соотношения сторон.

На внутренних агентных бенчмарках модель почти достигает уровня Opus 4.8, а в некоторых задачах превосходит его.

With vision capabilities added, the new Deepseek model approaches or sometimes beats Opus 4.8 on agent benchmarks. | Image: Deepseek
With vision capabilities added, the new Deepseek model approaches or sometimes beats Opus 4.8 on agent benchmarks. | Image: Deepseek · Источник: The Decoder

Стоимость обработки одного изображения ограничена 384 токенами независимо от исходного разрешения, что делает модель предсказуемой по цене. В одном запросе можно отправить до 600 изображений, но при этом максимальная длина стороны снижается с 8192 до 4096 пикселей, если изображений 15 и более. Изображения можно включать только в пользовательские сообщения. Модель совместима с API OpenAI Chat Completions и Responses, а также с конечной точкой Messages от Anthropic, что упрощает интеграцию в существующие системы. DeepSeek также выпустила версию 0.1.1 своего фреймворка Harness, который поддерживает новую модель из коробки.

Появление V4-Flash-Vision-Exp — часть более широкого тренда: открытые модели все активнее догоняют проприетарные аналоги в мультимодальных и агентных сценариях. Если ранее лидерами в этой области были закрытые системы, то теперь разработчики получают доступную альтернативу с сопоставимым качеством. Однако стоит учитывать, что результаты на внутренних бенчмарках DeepSeek могут отличаться от независимых тестов, и реальная производительность модели в продакшене еще предстоит проверить.