Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Как NVIDIA сократила расход токенов кодинг-агентов вдвое без смены модели

Как NVIDIA сократила расход токенов кодинг-агентов вдвое без смены модели

Подробности изложены в материале первоисточника. Исследователи из NVIDIA, MIT и NTU применили вспомогательный ИИ-агент для оптимизации программной оболочки (harness) кодинг-ассистентов. Новая методика позволила сократить потребление токенов почти вдвое при сохранении общего качества работы систем.

Анатомия кодинг-агентов и проблема лишних токенов

Современные программные инструменты разработки, такие как Claude Code или Codex, состоят из двух основных компонентов: непосредственно языковой модели и управляющей программы-оболочки (harness). Пока LLM занимается обработкой и генерацией текста, harness берет на себя всю инфраструктурную работу: передает задачу, инициирует открытие файлов, запускает тесты и возвращает результаты модели. За каждый такой цикл обмена данными провайдеры выставляют счета. Проблема заключается в том, что при каждом новом запросе модель вынуждена заново обрабатывать всю накопившуюся историю диалога, включая условия задачи, листинги файлов и логи тестов. Хотя повторяющиеся фрагменты истории кэшируются через механизм prompt cache, общие затраты остаются высокими, из-за чего аналогичные модели в разных оболочках обходятся совершенно по-разному.

Автоматический подбор оптимизаций силами исследовательского агента

Традиционно разработчики настраивают harness вручную, анализируя логи и устраняя неэффективные запросы. Авторы нового исследования поручили эту рутину специализированному ИИ-агенту-исследователю. Анализируя рабочие трейсы системы на базе Pi, он генерировал модификации кода оболочки и тестировал их на контрольных задачах. Процесс auto-research повторялся сотни раз в соответствии со строгими критериями: качество решений должно было оставаться в допустимых пределах, а расход токенов — снижаться. Всего алгоритм перебрал 1,5 сотни идей на более чем пятистах задачах, причем каждую гипотезу проверяли в изолированной среде, исключающей влияние неудачных экспериментов на остальные ветки.

Реклама

Четыре эффективных приема для экономии ресурсов

По результатам масштабного отбора успешными были признаны четыре ключевые методики, каждая из которых устраняет определенный тип избыточных затрат токенов.

Action Fusion и ObservationPack

Метод Action Fusion объединяет редактирование файла и запуск тестов в один совместный вызов вместо раздельных запросов, сокращая цепочку обмена в полтора раза. Прием ObservationPack ограничивает передачу тяжелых логов сборки размером более 10 КиБ: объемный вывод отправляется модели лишь в двух ближайших запросах, а далее заменяется компактной ссылкой с сохранением основных метрик и краевых строк.

Evidence-Preserving Reducer и Online Context Compact

Алгоритм Evidence-Preserving Reducer делегирует первичный анализ громоздких логов более дешевой модели, которая выписывает ключевые фрагменты с точными цитатами для последующей программной верификации. В свою очередь, Online Context Compact производит динамическое сжатие истории диалога в краткую выжимку после выполнения каждого запланированного шага, активируя сжатие только в случаях, когда экономия перекрывает затраты на сброс и повторное наполнение кэша.

Результаты бенчмарков и реальная экономия

Комплексное применение всех четырех разработок под названием SoL-Pi позволило снизить объем отправленных токенов с 2,15 млрд до 1,10 млрд при тестировании на задачах EdgeBench с моделью GPT-5.6 Sol. Итоговые финансовые затраты на API упали до 894 долларов по сравнению с 1339 долларами у базового Pi и 1787 долларами у Codex, при этом падение среднего балла составило около шести процентов. Эксперименты на других платформах и с другими моделями, включая Claude Opus 5, продемонстрировали схожую динамику сокращения издержек как при индивидуальном внедрении приемов, так и при их комплексном использовании в сложных многоагентных средах.

01.