Мой блог
Cognition выпустила Fusion для Devin Desktop и CLI: как две ИИ-модели делят одну задачу по программированию
Двухагентный подход в десктопной разработке: как работает Cognition Fusion
Инструменты автономии для инженеров-программистов переходят на новый этап эволюции. Компания Cognition объявила о выходе режима Fusion для десктопного приложения Devin Desktop и интерфейса командной строки (CLI). Ранее эта система функционировала только в облачной среде Devin, однако теперь разделение обязанностей между несколькими нейросетями доступно непосредственно в локальном рабочем пространстве разработчика.
Для максимально эффективной работы производитель советует задействовать связку из флагманской нейросети Claude Fable 5.1 и узкоспециализированной модели SWE-2. Ключевая концепция Fusion заключается в кооперации двух агентов, делящих между собой единую задачу по анализу и написанию кода. Вместо того чтобы перекладывать всю цепочку рассуждений и написания тестов на одну универсальную модель, система организует полноценный рабочий дуэт, напоминающий совместный труд архитектора и разработчика-исполнителя.

Разделение ролей и изолированный контекст моделей
Использование единой нейросети при решении сложных задач в крупных репозиториях неизбежно приводит к перегрузке контекстного окна и лишним затратам токенов на стандартные действия. Инструмент Devin изначально спроектирован для полного цикла взаимодействия с кодовой базой: от исследования структуры проекта до внесения правок и автоматической проверки. Функция Fusion поднимает этот процесс на новый уровень за счет четкой ролевой модели.
Внутри архитектуры Fusion обязанности распределяются следующим образом:

- Ведущий агент (Lead Agent): принимает инструкции от пользователя, уточняет неоднозначные требования, выстраивает глобальный план действий и производит итоговую приемку выполненной работы.
- Исполнитель (Executor): сканирует дерево файлов, генерирует код, создает и прогоняет автотесты, исправляет найденные ошибки и возвращает готовый результат на валидацию.
Почему разработчики Cognition отказались от простой первичной маршрутизации запросов? Дело в том, что реальная сложность задачи и объем необходимых изменений не просматриваются из начального промпта — они проявляются только в процессе исследования репозитория. При этом динамическое переключение между разными моделями без сохранения состояния заставляет каждый раз заново считывать весь массирующий контекст. Fusion снимает эту проблему за счет того, что каждый агент поддерживает собственную кэшируемую память, а ведущая модель самостоятельно решает, какие из задач обработать лично, а какие перепоручить помощнику.
Бенчмарки и экономия: цифры и реальная производительность
Применение специализированного исполнителя в тандеме с сильной ведущей моделью демонстрирует ощутимую финансовую выгоду. Согласно отчету Artificial Analysis Coding Agent Index v1.5, связка Fable 5.1 + SWE-2 набирает 61,7 балла при сокращении бюджета на 36% в сравнении с автономной Claude Code на Fable 5.1 (набравшей 62,2 балла). Похожие показатели демонстрирует сочетание Astra + SWE-2: 58,9 балла против 61,6 у Codex с Astra при снижении расходов на 39%.

В сводке узкопрофильных бенчмарков Cognition приводятся следующие данные для перехода с чистой Fable 5.1 на связку Fusion (Fable 5.1 + SWE-2):

| Тестовый бенчмарк | Результат (Fable → Fusion) | Стоимость сессии (Fable → Fusion) | Процент экономии |
|---|---|---|---|
| DeepSWE 1.1 | 64,3 → 63,1 | $14,63 → $7,88 | 46% |
| Terminal-Bench 4 | 57,6 → 56,1 | $17,46 → $13,37 | 23% |
| FrontierCode 1.1 Extended | 63,6 → 63,5 | $2,68 → $1,67 | 38% |
Сокращение затрат в некоторых сценариях достигает почти двухкратных значений при минимальной усадке качества результатов. Тем не менее стоит брать во внимание характер задач. К примеру, модель Astra на тесте Terminal-Bench 4 показала снизившийся с 55,6 до 50,0 результат при падении затрат на 40%. Из этого следует, что показатели конкретных тестов нельзя автоматически проецировать абсолютно на любой рабочий проект.
Парадокс стоимости токенов: почему более дорогая модель выходит дешевле
Важное наблюдение инженеров Cognition касается поведения ведущей модели и итогового чека за сессию. Вопреки привычному представлению, выбор более дорогой нейросети на роль ведущего агента способно сократить общие расходы на решение задачи.
В проводившемся эксперименте модель Fable 5 обходилась вдвое дороже Opus 4.8 за каждый обработанный токен. Но при подключении одного и того же ассистента-исполнителя суммарные затраты с Fable 5 оказались ниже: $1,86 против $2,04 в среднем за запуск. При этом показатель качества работы Fable 5 составил 60,7 балла против 54,6 у Opus.
Причина такого расхождения кроется в эффективности управления. Fable быстрее определяла стратегию, эффективнее делегировала операции и не совершала лишних повторных действий. В среднем ей требовалось лишь 11,5 шагов ведущего агента, в то время как Opus совершал 26,5 шагов. Таким образом, более высокий тариф за токен полностью компенсировался меньшим объемом обрабатываемого контекста и снижением количества запросов к API.
Калибровка «харнеса» и локальная альтернатива для ИИ-разработки
Практическая эффективность агентной системы напрямую связана с точной настройкой управляющей среды — «харнеса» (harness). Разработчику необходимо адаптировать правила взаимодействия под конкретную пару ИИ: регламентировать глубину постановки задачи, уровень допустимых возражений исполнителя и границы самостоятельного поиска по репозиторию.
Для тех, кто предпочитает полную независимость от сторонних облачных API и подписок, логичным выбором становится сборка собственного локального сервера под нейросети. В своей практической работе я протестировал аппаратный сетап, способный выполнять масштабные ИИ-задачи без подключения к внешним сервисам.
Конфигурация включает две серверные графические карты Tesla P100 (суммарно 32 ГБ видеопамяти) и 28-поточный процессор Intel Xeon. Подобный аппаратный узел имеет свои нюансы: потребление около киловатта электроэнергии и ощутимый шум охлаждающих турбин, из-за чего сервер пришлось вынести в отдельное нежилое помещение. В бенчмарках на 14 реальных практических задачах такая сборка выдает от 10 до 50 токенов в секунду в зависимости от размера и квантования модели. Хотя облачный DeepSeek работает быстрей, собственная автономная система гарантирует круглосуточную доступность и абсолютную приватность данных.
Источник: habr.com
