Мой блог
Обзор CUA-Lite: открытая платформа UC Berkeley для обучения и оценки ИИ-агентов
Разработка и тестирование автономных ИИ-агентов, умеющих управлять компьютером и мобильными устройствами (Computer-Use Agents, CUA), до сих пор сталкивались с проблемой инфраструктурной фрагментации. На практике подготовка такого агента требует сборки четырёх ключевых элементов: самого агента, среды исполнения, траекторий действий (логов) и фреймворка для оценки и обучения. Обычно все эти компоненты разбросаны по разным репозиториям с несовместимыми между собой интерфейсами.
Исследователи из Калифорнийского университета в Беркли (UC Berkeley) представили открытую платформу CUA-Lite. Она объединяет инструменты управления десктопными ОС, веб-браузерами и мобильными интерфейсами под единым пространством действий, единой схемой данных и единым интерфейсом командной строки.
Платформа полностью готова к развертыванию. Весь стек окружения устанавливается с помощью команды uv sync --all-extras в среде Python 3.12. Облегчённые песочницы проекта способны запускаться на любом Docker-хосте без необходимости доступа к /dev/kvm. Это позволяет разворачивать систему в облачных виртуальных машинах, системах непрерывной интеграции (CI) и вложенных контейнерах.
Тариф за виртуализацию: как Lite.OSWorld решает проблему ресурсов
Главным практическим вкладом платформы CUA-Lite стал модуль Lite.OSWorld. Оригинальный бенчмарк OSWorld предоставляет полноценное окружение на базе Ubuntu, но запускает каждую задачу в отдельной виртуальной машине QEMU/KVM. Это требует поддержки вложенной виртуализации, которой нет у большинства облачных провайдеров и сервисов CI/CD.
CUA-Lite воссоздаёт тот же набор задач и тестовых процедур внутри обычного Docker-контейнера с графическим окружением GNOME. В результате потребление системных ресурсов кардинально снижается, а скорость работы увеличивается.
| Параметр | OSWorld | Lite.OSWorld |
|---|---|---|
| Среда исполнения (Runtime) | Виртуальная машина QEMU/KVM | Контейнер Docker |
| Требования к хосту | Доступ к /dev/kvm, вложенная виртуализация | Любой Docker-хост |
| Оперативная память (RAM) | 4,1 ГБ | 0,9 ГБ |
| Время холодного старта | 29,9 сек | 23,8 сек |
| Базовая параллельность | 1x | Примерно в 4,6 раза больше экземпляров |
| Набор задач (Task suite) | OSWorld | Идентичный |
При переходе от виртуальных машин к контейнерам всегда встаёт вопрос точности (fidelity) оценки. Разработчики проверили этот аспект напрямую на 13 различных моделях ИИ. Результаты показали, что оценки моделей в Lite.OSWorld полностью совпадают с показателями в тяжеловесных виртуальных машинах OSWorld. Это гарантирует, что сигналы обучения и метрики, полученные в лёгком контейнере, корректно переносятся на оригинальный бенчмарк.
На базе этой контейнерной архитектуры создано целое семейство песочниц: Lite.ScaleCUA, Lite.CUAGym и Lite.CUAWorld. В частности, Lite.CUAWorld включает в себя около 40 сложных приложений, среди которых Blender, QGIS и VS Code. В общей сложности платформа охватывает более 30 000 проверяемых тестовых задач.
Единая схема данных LiteSample и адаптеры под каждую модель
Вторым важным уровнем инфраструктуры CUA-Lite является формат LiteSample. Это унифицированная схема данных для обучения с учителем (Supervised Learning), единая для всех типов сред, агентов и задач. Данные поставляются в виде стандартных Parquet-файлов с прикреплёнными изображениями скриншотов.
Разработчики уже конвертировали и опубликовали в свободном доступе на Hugging Face более десяти популярных датасетов для CUA, включая Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey и Multimodal-Mind2Web. Помимо существующих датасетов, авторы опубликовали свежие траектории (rollouts), сгенерированные передовыми моделями-учителями (teacher models), которые можно использовать для дистилляции знаний в более компактные модели-ученики.
Поскольку разные семейства моделей требуют собственного формата входных данных, CUA-Lite содержит специализированные адаптеры. Они автоматически переупаковывают единые данные LiteSample в нужный формат конкретной нейросети. В адаптерах реализована возможность схлопывания истории (history collapsing), что позволяет объединять несколько шагов агента в один прямой проход (forward pass).
Оценка, SFT и RL через единую команду
Взаимодействие агента с окружением происходит в модуле lite.gym по простой логике: агент получает скриншот экрана и отдаёт управляющее действие. Каждая платформа имеет своё унифицированное пространство действий.
В систему уже встроено более 10 агентов (включая модели на базе GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B и MAI-UI) и интегрировано свыше 15 бенчмарков для различных платформ:
- Граундинг (Grounding): ScreenSpot-Pro, OSWorld-G;
- Десктопные ОС: OSWorld, OSWorld-2, WindowsAgentArena, CUABench;
- Веб-браузеры: WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym;
- Мобильные ОС: AndroidWorld, AndroidLab, MobileWorld, MobileGym.
Для запуска тестирования или сбора данных достаточно изменить параметры --model-id и --env-id в исполняемом скрипте scripts/rollout.py.
Этот же цикл применяется и для обучения. В документации описан пример тонкой настройки (SFT) модели Qwen3-VL-2B-Instruct на десктопных траекториях Lite.ScaleCUA. На тестовой выборке lite.osworld из 332 задач средняя награда эпизода выросла с 0,138 до 0,237 (эксперимент проводился на двух GPU).
Для обучения с подкреплением (RL) траектории, оценённые внутри песочницы, используются для обновлений алгоритмом GRPO поверх библиотеки Slime. В качестве примера приводится настройка в MobileGym, охватывающая 416 мобильных задач в 28 приложениях.
Главные выводы
- CUA-Lite объединяет агентов, виртуальные среды, датасеты и процессы обучения под единым пространством действий и форматом LiteSample.
- Окружение Lite.OSWorld избавляет от необходимости запускать виртуальные машины QEMU/KVM: контейнер Docker требует 0,9 ГБ RAM вместо 4,1 ГБ, обеспечивая прирост параллельности в 4,6 раза.
- Тестирование на 13 моделях подтвердило полное соответствие результатов между Docker-контейнером и стандартной виртуальной машиной OSWorld.
- Платформа даёт доступ к более чем 30 000 проверяемых задач, 15 бенчмаркам, 10 агентам и 20 датасетам на Hugging Face.
- Систему можно запустить на любой инфраструктуре с Docker, но репозиторий пока не содержит явно указанной лицензии — перед коммерческим использованием следует уточнить условия.
Источник: www.marktechpost.com
