Qwen3.8-Omni-Flash — первая мультимодальная модель Qwen, спроектированная под ИИ-агентов, а не под одиночные запросы пользователя. Она принимает аудио и видео одновременно, делает выводы и самостоятельно вызывает инструменты: монтирует влоги, переводит короткие ролики, суммирует фильмы. Контекстное окно — один миллион токенов, что позволяет удерживать в памяти длинные записи без разбивки на фрагменты.

По мультимодальным benchmark Qwen заявляет результат, близкий к Gemini 3.8 Flash. Ключевое отличие — цена. Входные токены Qwen3.8-Omni-Flash стоят $0.15 за миллион, выходные — $0.47. У Gemini 3.8 Flash на вводной ставке это $0.75 и $3.75 соответственно, причём с 1 января 2027 года цены удвоятся. Для команд, которые гоняют через модель большие объёмы видео и аудио, разница в стоимости обработки может оказаться решающей.

ПараметрQwen3.8-Omni-FlashGemini 3.8 Flash
Входные токены, за миллион$0.15$0.75 (вводная ставка)
Выходные токены, за миллион$0.47$3.75 (вводная ставка)
Аудиоменьше $0.01 за часнет данных
Видео 720p со звуком, 1 кадр/соколо $0.20нет данных
Изменение ценынет данныхудвоение с 1 января 2027 года

Отдельно Qwen оценивает расходы на мультимедиа: аудио — меньше $0.01 за час, видео 720p со звуком при одном кадре в секунду — около $0.20 без учёта стоимости ответа. Это ориентиры для планирования бюджета, а не гарантированные тарифы, но они показывают, что обработка длинных записей перестаёт быть дорогой операцией.

Модель обрабатывает аудио и видео вместе, делает выводы и сама вызывает инструменты — например, для монтажа влогов или перевода коротких роликов.

Qwen 3.8 Omni Flash performs on par with Gemini Flash 3.8 in multimodal benchmarks but is much more affordable. | Image: Qwen
Qwen 3.8 Omni Flash performs on par with Gemini Flash 3.8 in multimodal benchmarks but is much more affordable. | Image: Qwen · Источник: The Decoder

Модель доступна через Qwen Studio, Qwen Cloud и API. Вместе с ней Qwen выложила open-source плагины Qwen-MM-Plugins, которые добавляют агентам вроде Claude Code, Gemini CLI и Qwen Code редактирование видео, распознавание говорящих, создание PDF-заметок по видео и переиспользуемые рабочие процессы. Отдельный компонент Qwen-Live Harness отвечает за взаимодействие в реальном времени через камеру и микрофон.

Позиционирование модели показательно: Qwen строит её не как чат-бота с картинками, а как исполнителя, который получает потоковые данные и сам решает, какой инструмент вызвать. Это соответствует общему сдвигу отрасли — от моделей, отвечающих на вопросы, к агентам, выполняющим задачи. Конкуренция здесь идёт не только по качеству ответов, но и по стоимости токена и по тому, насколько удобно подключать внешние инструменты.

Ограничение, которое стоит держать в голове: сопоставимость с Gemini 3.8 Flash заявлена самой Qwen и подтверждена только на мультимодальных benchmark. Как модель ведёт себя на длинных агентных цепочках, где ошибка накапливается, из этих цифр не следует. Реальная проверка — в продакшене, а не в таблице результатов.