Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Обзор CUA-Lite: открытая платформа UC Berkeley для обучения и оценки ИИ-агентов

Обзор CUA-Lite: открытая платформа UC Berkeley для обучения и оценки ИИ-агентов

Разработка и тестирование автономных ИИ-агентов, умеющих управлять компьютером и мобильными устройствами (Computer-Use Agents, CUA), до сих пор сталкивались с проблемой инфраструктурной фрагментации. На практике подготовка такого агента требует сборки четырёх ключевых элементов: самого агента, среды исполнения, траекторий действий (логов) и фреймворка для оценки и обучения. Обычно все эти компоненты разбросаны по разным репозиториям с несовместимыми между собой интерфейсами.

Исследователи из Калифорнийского университета в Беркли (UC Berkeley) представили открытую платформу CUA-Lite. Она объединяет инструменты управления десктопными ОС, веб-браузерами и мобильными интерфейсами под единым пространством действий, единой схемой данных и единым интерфейсом командной строки.

Платформа полностью готова к развертыванию. Весь стек окружения устанавливается с помощью команды uv sync --all-extras в среде Python 3.12. Облегчённые песочницы проекта способны запускаться на любом Docker-хосте без необходимости доступа к /dev/kvm. Это позволяет разворачивать систему в облачных виртуальных машинах, системах непрерывной интеграции (CI) и вложенных контейнерах.

Реклама

Тариф за виртуализацию: как Lite.OSWorld решает проблему ресурсов

Главным практическим вкладом платформы CUA-Lite стал модуль Lite.OSWorld. Оригинальный бенчмарк OSWorld предоставляет полноценное окружение на базе Ubuntu, но запускает каждую задачу в отдельной виртуальной машине QEMU/KVM. Это требует поддержки вложенной виртуализации, которой нет у большинства облачных провайдеров и сервисов CI/CD.

CUA-Lite воссоздаёт тот же набор задач и тестовых процедур внутри обычного Docker-контейнера с графическим окружением GNOME. В результате потребление системных ресурсов кардинально снижается, а скорость работы увеличивается.

Параметр OSWorld Lite.OSWorld
Среда исполнения (Runtime) Виртуальная машина QEMU/KVM Контейнер Docker
Требования к хосту Доступ к /dev/kvm, вложенная виртуализация Любой Docker-хост
Оперативная память (RAM) 4,1 ГБ 0,9 ГБ
Время холодного старта 29,9 сек 23,8 сек
Базовая параллельность 1x Примерно в 4,6 раза больше экземпляров
Набор задач (Task suite) OSWorld Идентичный

При переходе от виртуальных машин к контейнерам всегда встаёт вопрос точности (fidelity) оценки. Разработчики проверили этот аспект напрямую на 13 различных моделях ИИ. Результаты показали, что оценки моделей в Lite.OSWorld полностью совпадают с показателями в тяжеловесных виртуальных машинах OSWorld. Это гарантирует, что сигналы обучения и метрики, полученные в лёгком контейнере, корректно переносятся на оригинальный бенчмарк.

На базе этой контейнерной архитектуры создано целое семейство песочниц: Lite.ScaleCUA, Lite.CUAGym и Lite.CUAWorld. В частности, Lite.CUAWorld включает в себя около 40 сложных приложений, среди которых Blender, QGIS и VS Code. В общей сложности платформа охватывает более 30 000 проверяемых тестовых задач.

Единая схема данных LiteSample и адаптеры под каждую модель

Вторым важным уровнем инфраструктуры CUA-Lite является формат LiteSample. Это унифицированная схема данных для обучения с учителем (Supervised Learning), единая для всех типов сред, агентов и задач. Данные поставляются в виде стандартных Parquet-файлов с прикреплёнными изображениями скриншотов.

Разработчики уже конвертировали и опубликовали в свободном доступе на Hugging Face более десяти популярных датасетов для CUA, включая Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey и Multimodal-Mind2Web. Помимо существующих датасетов, авторы опубликовали свежие траектории (rollouts), сгенерированные передовыми моделями-учителями (teacher models), которые можно использовать для дистилляции знаний в более компактные модели-ученики.

Реклама

Поскольку разные семейства моделей требуют собственного формата входных данных, CUA-Lite содержит специализированные адаптеры. Они автоматически переупаковывают единые данные LiteSample в нужный формат конкретной нейросети. В адаптерах реализована возможность схлопывания истории (history collapsing), что позволяет объединять несколько шагов агента в один прямой проход (forward pass).

Оценка, SFT и RL через единую команду

Взаимодействие агента с окружением происходит в модуле lite.gym по простой логике: агент получает скриншот экрана и отдаёт управляющее действие. Каждая платформа имеет своё унифицированное пространство действий.

В систему уже встроено более 10 агентов (включая модели на базе GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B и MAI-UI) и интегрировано свыше 15 бенчмарков для различных платформ:

  • Граундинг (Grounding): ScreenSpot-Pro, OSWorld-G;
  • Десктопные ОС: OSWorld, OSWorld-2, WindowsAgentArena, CUABench;
  • Веб-браузеры: WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym;
  • Мобильные ОС: AndroidWorld, AndroidLab, MobileWorld, MobileGym.

Для запуска тестирования или сбора данных достаточно изменить параметры --model-id и --env-id в исполняемом скрипте scripts/rollout.py.

Этот же цикл применяется и для обучения. В документации описан пример тонкой настройки (SFT) модели Qwen3-VL-2B-Instruct на десктопных траекториях Lite.ScaleCUA. На тестовой выборке lite.osworld из 332 задач средняя награда эпизода выросла с 0,138 до 0,237 (эксперимент проводился на двух GPU).

Для обучения с подкреплением (RL) траектории, оценённые внутри песочницы, используются для обновлений алгоритмом GRPO поверх библиотеки Slime. В качестве примера приводится настройка в MobileGym, охватывающая 416 мобильных задач в 28 приложениях.

Главные выводы

  • CUA-Lite объединяет агентов, виртуальные среды, датасеты и процессы обучения под единым пространством действий и форматом LiteSample.
  • Окружение Lite.OSWorld избавляет от необходимости запускать виртуальные машины QEMU/KVM: контейнер Docker требует 0,9 ГБ RAM вместо 4,1 ГБ, обеспечивая прирост параллельности в 4,6 раза.
  • Тестирование на 13 моделях подтвердило полное соответствие результатов между Docker-контейнером и стандартной виртуальной машиной OSWorld.
  • Платформа даёт доступ к более чем 30 000 проверяемых задач, 15 бенчмаркам, 10 агентам и 20 датасетам на Hugging Face.
  • Систему можно запустить на любой инфраструктуре с Docker, но репозиторий пока не содержит явно указанной лицензии — перед коммерческим использованием следует уточнить условия.

Источник: www.marktechpost.com

01.