Голосовые ассистенты привыкли работать по очереди: пользователь говорит, система ждёт паузы, отвечает, снова ждёт. В живой беседе так не бывает — люди перебивают, вставляют короткие реплики, слушают и говорят одновременно. Исследователи из команды Hunyuan Speech (Tencent) и нескольких университетов предложили Gander — модель, которая принимает речь, изображения и текст одновременно и продолжает обрабатывать вход, даже когда сама произносит ответ.
Главная техническая проблема здесь в конфликте двух требований. Разговор требует быстрой реакции, а поиск по файлам или написание кода — времени на планирование и рассуждение. Одна модель вынуждена балансировать между скоростью и глубиной. Gander разводит эти роли по двум компонентам, названным по аналогии с анатомией: «cerebellum» ведёт диалог в реальном времени, а «brain» берёт на себя рассуждения и сложные задачи в фоне. Ключевая деталь — «мозг» можно заменить на агентную систему вроде Codex или Claude Code без переобучения разговорной части. В тестах эту роль исполняла неназванная модель из семейства GPT-5.6 от OpenAI. Пока фоновый агент правит баг, пользователь может продолжать задавать вопросы и, например, добавить требование совместимости с Python 3.12.
| Система | Доля перебиваний пользователя |
|---|---|
| Gander | 8% |
| GPT-Realtime | 13,5% |
| Слабейший конкурент | почти 48% |
Разговор Gander нарезает на секундные отрезки, и «cerebellum» на каждом решает, слушать, говорить или замолчать при перебивании. Отдельного модуля для определения начала и конца речи нет — модель опирается примерно на последние две минуты диалога как на память. Поскольку специализированного теста для таких систем пока не существует, исследователи взяли готовые бенчмарки. На Full-Duplex-Bench v3, проверяющем голосовых ассистентов в разных сценариях, Gander начинает говорить в нужный момент во всех 100 сценариях и перебивает пользователя в 8% случаев. У GPT-Realtime этот показатель 13,5%, у слабейшего конкурента — почти 48%. То есть по таймингу реплик система обходит коммерческие GPT-Realtime, Gemini Live и Grok, используя относительно небольшую модель.
Архитектура разделена на «cerebellum» для диалога и сменный «brain» для фоновых задач вроде отладки кода.

Обратная сторона — точность выполнения задач. Здесь Gander немного уступает даже слабейшему конкуренту. Исследователи объясняют это тем, что бенчмарк оценивает систему целиком, поэтому ошибки распознавания речи и генерации ответа идут в общий зачёт. Сам «мозг» показывает заметно лучший результат, если подавать ему текст напрямую. Страдает и понимание видео и аудио: в одном из тестов Gander выступил хуже своей базовой модели. Причина, по мнению авторов, — обучение, которое смещено в пользу беглого разговора, а не точного восприятия. Это заметно на задачах вроде подсчёта объектов или их поиска на изображении.
Обучение шло примерно на 2,7 млн примеров. Часть из них учит модель молчать при фоновом шуме или когда в группе к ней никто не обращается. Сами исследователи называют работу ранней: как масштабировать Gander, пока неясно, стандартного способа оценивать такие системы тоже нет. Команда планирует опубликовать веса и обучающие данные после завершения «процесса open-source-релиза». Репозиторий с кодом на GitHub уже существует, демонстрации доступны на странице проекта.
Gander продолжает линию Tencent в агентных системах. В июле компания выпустила открытую языковую модель Hy3, которая, по сообщениям, сократила отставание от конкурентов, особенно в агентных задачах; она уже работает в WorkBuddy, Yuanbao и WeChat. Кроме того, Tencent ведёт переговоры о покупке крупнейшей доли в агентном стартапе Manus после того, как Пекин заблокировал сделку с Meta. Компания считает эту сделку подходящей для своих планов, включая агента внутри WeChat. Разделение разговора и рассуждений между моделями применяют и другие: GPT-Live от OpenAI передаёт веб-поиск и агентные задачи фоновой модели, пока чат продолжается, а Sakana ИИ строит Fugu — отдельную языковую модель, которая вызывает другие из расширяемого пула.



