11 сентября Cognition объявила о доступности Fusion в Devin Desktop и CLI. До этого связка работала только в облачном Devin. Теперь инструмент, которому можно поручить изучение проекта, изменение кода и проверки, доступен в десктопном приложении и терминале.

Fusion организует совместную работу двух моделей. Ведущий агент общается с пользователем, разбирается с неоднозначными требованиями и определяет, какую работу делегировать. Исполнитель изучает файлы, пишет код и тесты, исправляет ошибки и возвращает результат на проверку. У обоих есть собственные инструменты и отдельный контекст, который сохраняется по ходу сессии. Компания рекомендует сочетание Claude Fable 5.1 и SWE-2.

БенчмаркFable 5.1Fusion (Fable 5.1 + SWE-2)Снижение стоимости
DeepSWE 1.164,363,146%
Terminal-Bench 457,656,123%
FrontierCode 1.1 Extended63,663,538%

Cognition объясняет подход тем, что обычной маршрутизации по начальному запросу бывает недостаточно: реальная сложность задачи выясняется уже при изучении репозитория. Переключение моделей может потребовать повторной обработки контекста. В Fusion каждый агент сохраняет собственный кэшируемый контекст, а ведущий решает, какие действия выполнить самому, а какие передать помощнику.

Связка Claude Fable 5.1 и SWE-2 набирает 61,7 балла в Artificial Analysis Coding Agent Index v1.5 против 62,2 у Claude Code с Fable 5.1, но дешевле на 36%.

На графике Artificial Analysis Coding Agent Index v1.5 связка Fable 5.1 + SWE-2 получает 61,7 балла против 62,2 у Claude Code с Fable 5.1, при снижении стоимости на 36%. Для Astra + SWE-2 указаны 58,9 балла против 61,6 у Codex с Astra и снижение стоимости на 39%.

В таблице отдельных бенчмарков Cognition приводит результаты для Fable 5.1 и Fusion с Fable 5.1 + SWE-2. На DeepSWE 1.1 результат меняется с 64,3 на 63,1, стоимость — с $14,63 на $7,88, снижение 46%. На Terminal-Bench 4 — с 57,6 на 56,1, стоимость с $17,46 на $13,37, снижение 23%. На FrontierCode 1.1 Extended — с 63,6 на 63,5, стоимость с $2,68 на $1,67, снижение 38%. Экономия сопровождается разными изменениями качества. Например, у Astra на Terminal-Bench 4 стоимость снижается на 40%, но результат падает с 55,6 до 50,0. Эти показатели относятся к конкретным тестам и конфигурациям из отчёта Cognition; переносить их на любой проект нельзя.

У компании есть и наблюдение о цене самих моделей. В июльском эксперименте Fable 5 стоила вдвое дороже Opus 4.8 за токен, но с одинаковым помощником оказалась дешевле по итогам работы: $1,86 против $2,04 в среднем за запуск. При этом результат был выше — 60,7 против 54,6. Cognition связывает это с поведением ведущего агента: Fable раньше делегировала работу и меньше повторяла действия исполнителя. В среднем ей потребовалось 11,5 шага ведущего агента против 26,5 у Opus. Более дорогая модель компенсировала цену меньшим числом обращений и объёмом обрабатываемого контекста.

В новом анонсе компания подчёркивает, что харнес приходится настраивать под конкретную пару моделей: выбирать подробность задания, допустимость возражений исполнителя и объём делегируемого исследования кода. Это отличает Fusion от подхода, где одна модель выполняет всю задачу в одном контексте. Разделение ролей снижает нагрузку на контекст ведущего агента и позволяет использовать более дешёвую модель на этапе реализации, но требует дополнительной настройки и не гарантирует выигрыша в качестве на всех типах задач.