Qwen3.8-Omni-Flash — первая мультимодальная модель Qwen, спроектированная под ИИ-агентов, а не под одиночные запросы пользователя. Она принимает аудио и видео одновременно, делает выводы и самостоятельно вызывает инструменты: монтирует влоги, переводит короткие ролики, суммирует фильмы. Контекстное окно — один миллион токенов, что позволяет удерживать в памяти длинные записи без разбивки на фрагменты.
По мультимодальным benchmark Qwen заявляет результат, близкий к Gemini 3.8 Flash. Ключевое отличие — цена. Входные токены Qwen3.8-Omni-Flash стоят $0.15 за миллион, выходные — $0.47. У Gemini 3.8 Flash на вводной ставке это $0.75 и $3.75 соответственно, причём с 1 января 2027 года цены удвоятся. Для команд, которые гоняют через модель большие объёмы видео и аудио, разница в стоимости обработки может оказаться решающей.
| Параметр | Qwen3.8-Omni-Flash | Gemini 3.8 Flash |
|---|---|---|
| Входные токены, за миллион | $0.15 | $0.75 (вводная ставка) |
| Выходные токены, за миллион | $0.47 | $3.75 (вводная ставка) |
| Аудио | меньше $0.01 за час | нет данных |
| Видео 720p со звуком, 1 кадр/с | около $0.20 | нет данных |
| Изменение цены | нет данных | удвоение с 1 января 2027 года |
Отдельно Qwen оценивает расходы на мультимедиа: аудио — меньше $0.01 за час, видео 720p со звуком при одном кадре в секунду — около $0.20 без учёта стоимости ответа. Это ориентиры для планирования бюджета, а не гарантированные тарифы, но они показывают, что обработка длинных записей перестаёт быть дорогой операцией.
Модель обрабатывает аудио и видео вместе, делает выводы и сама вызывает инструменты — например, для монтажа влогов или перевода коротких роликов.

Модель доступна через Qwen Studio, Qwen Cloud и API. Вместе с ней Qwen выложила open-source плагины Qwen-MM-Plugins, которые добавляют агентам вроде Claude Code, Gemini CLI и Qwen Code редактирование видео, распознавание говорящих, создание PDF-заметок по видео и переиспользуемые рабочие процессы. Отдельный компонент Qwen-Live Harness отвечает за взаимодействие в реальном времени через камеру и микрофон.
Позиционирование модели показательно: Qwen строит её не как чат-бота с картинками, а как исполнителя, который получает потоковые данные и сам решает, какой инструмент вызвать. Это соответствует общему сдвигу отрасли — от моделей, отвечающих на вопросы, к агентам, выполняющим задачи. Конкуренция здесь идёт не только по качеству ответов, но и по стоимости токена и по тому, насколько удобно подключать внешние инструменты.
Ограничение, которое стоит держать в голове: сопоставимость с Gemini 3.8 Flash заявлена самой Qwen и подтверждена только на мультимодальных benchmark. Как модель ведёт себя на длинных агентных цепочках, где ошибка накапливается, из этих цифр не следует. Реальная проверка — в продакшене, а не в таблице результатов.



