Мой блог
Движок AXIS от Axis Robotics: сбор данных для роботов прямо в браузере
Сбор качественных демонстрационных данных всегда оставался основным узким местом в области физического искусственного интеллекта и робототехники. В отличие от больших языковых моделей или генераторов изображений, где обучающие наборы можно формировать автоматическим парсингом миллиардов веб-страниц, датасеты для роботов-манипуляторов развиваются крайне медленно. Причина проста: процесс сбора демонстраций исторически оставался закрытым и централизованным. Опытные операторы годами собирают примеры на физическом лабораторном оборудовании, обрабатывают их в офлайн-режиме и публикуют фиксированный бенчмарк, который после релиза больше никогда не пополняется.
Исследовательская команда из Axis Robotics совместно с коллегами из UC Berkeley, Georgia Tech и NTU предложила принципиально иную концепцию. Их новая система под названием AXIS переносит процесс сбора демонстраций прямо в браузер пользователя, делегируя все ресурсоёмкие физические и графические вычисления мощным серверным графическим ускорителям. В результате обучающий датасет превращается из статического архива в непрерывно растущий массив данных.
Архитектурное разделение: браузерный фронтенд и мощный бэкенд
Главным системным решением разработчиков стала полная асимметрия архитектуры. Волонтеры и операторы управляют виртуальным роботом-манипулятором Franka Research 3 с параллельным захватом через стандартный веб-интерфейс. Вся клиентская часть работает на базе симулятора MuJoCo, скомпилированного в WebAssembly (WASM), и библиотеки React.
Для ввода операторы могут использовать клавиатуру, мышь, виртуальный джойстик или физический геймпад. Я обратил внимание на важную инженерную деталь: расчет физических шагов и рендеринг Three.js вынесены из основного UI-потока React. Это гарантирует, что фиксируемые пары «состояние-действие» остаются идеально синхронизированными с симулятором даже при просадках частоты кадров в браузере пользователя.
При этом все ресурсоёмкие задачи распределены по серверным кластерам:
- Рендеринг графики высокого качества: выполняется на серверах с 8 видеокартами NVIDIA RTX 4090.
- Обучение нейросетей и валидация: производятся на узлах из 8 ускорителей NVIDIA A100.
Автоматическая генерация задач через TaskGen
Вместо ручного проектирования каждой отдельной сцены и задания разработчики применили генеративный модуль TaskGen. Этот инструмент берет естественную текстовую инструкцию и автоматически формирует трехмерную сцену и параметры манипуляции.
Пайплайн работы TaskGen включает следующие шаги:
- Декомпозиция текстового промпта на параметры задачи, окружения и объектов.
- Извлечение готовых моделей или генерация новых 3D-мешей через алгоритмы Image-to-3D.
- Приведение объектов к физически правдоподобным масштабам.
- Формирование 2.5D-макета (layout) с расстановкой предметов.
- Проверка условий супервизором макета: при нарушении физических ограничений объект автоматически смещается, поворачивается или перегенерируется.
Каждое задание снабжается структурированным модулем проверки успеха (success checker). Бэкенд заново перепроверяет выполнение цели, не доверяя флагу успешности, полученному от клиентского браузера.
Состав датасета и многоэтапная очистка данных
Опубликованный срез датасета AXIS включает 207 уникальных задач, 50 129 записанных траекторий (эпизодов) и более 60 000 вариаций сцен и заданий, распределенных по семи категориям окружения. По данным авторов, в сборе этих данных приняли участие свыше 70 000 участников сообщества.
Каждая траектория содержит детальный набор метаданных: параметры задачи, конфигурацию робота, версию симулятора, векторы состояний суставов и объектов, управляющие действия, метки успешности и потоки RGB-D с внешней камеры и камеры на схвате манипулятора.
Фильтрация и математическое сглаживание
Сбор данных через краудсорсинг неизбежно приводит к появлению шума и неточных движений. Поэтому очистка в AXIS выстроена как полноценный производственный конвейер:
- Отсечение статики: сэмплы с вариацией суставов менее 5e-3 отбрасываются как неинформативные замирания.
- Сглаживание траектории: фильтр Савицкого — Голея (окно 15, порядок полинома 3) сглаживает непрерывное движение.
- Ресамплинг: кубические сплайны повышают исходную частоту веб-интерфейса (6–8 Гц) до целевых 20 Гц.
Интересно посмотреть на математические последствия такой очистки: среднее ускорение движения манипулятора снизилось с 1.3539 до 0.4885, а средний рывок (jerk) упал с 11.5899 до 2.2243. Платой за такую строгость стало снижение показателей точности воспроизведения траекторий (replay success) с 100% до 86.2%.
Рендеринг и процедурная аугментация в IsaacSim
Очищенные траектории затем повторно проигрываются в среде IsaacSim с отключенным расчетом физики. Проверенная траектория служит жестким эталоном, вокруг которого алгоритм рандомизирует окружение: меняются текстуры заднего плана, положения и параметры виртуальных камер, материалы предметов и источники освещения. На выходе формируется фотореалистичный RGB-поток с разрешением 256×256 пикселей с трассировкой лучей для двух ракурсов.
Результаты тестирования на бенчмарке LIBERO-Plus
Для оценки эффективности данных исследовательская группа провела серии тестов с моделью π0.5 (архитектура на базе PaliGemma Gemma-2B с экспертом действий Gemma-300M). Все конфигурации проходили полнопараметрическое предобучение на корпусе симуляций с использованием функции потерь flow-matching на 10-шаговых блоках действий (100 000 шагов), после чего дообучались (30 000 шагов) на задачах LIBERO.
Результаты эксперимента показали следующие цифры:
- Базовая модель π0.5: 83.9% успешных выполнений.
- Контрольная группа RoboCasa365 (сопоставимая по объему): 57.5%.
- π0.5 + AXIS-100%: 88.8% общих успешных попыток (+4.9 процентных пункта в абсолютном значении).
Рост точности при увеличении объема данных AXIS показал стабильную динамику: 84.7% при 25% объеме датасета, 85.7% при 50% и 88.8% при полном объеме.
Наибольший прирост устойчивости зафиксирован именно по тем направлениям, где работала процедурная аугментация:
- Устойчивость к шумам сенсоров (Sensor Noise): +13.7%
- Устойчивость к изменению ракурсов камер (Camera): +11.3%
- Изменение заднего плана (Background): +3.7%
- Смещение позы робота (Robot pose): +3.8%
- Вариативность раскладки (Layout): +2.6%
При этом показатели слегка снизились в категориях изменения освещения (-1.7%) и языковых вариаций промптов (-1.3%), что указывает на точки роста для будущих версий аугментационного пайплайна.
Доступность и текущий статус проекта
Платформа AXIS уже доступна для тестирования в браузере, а обучающий код опубликован в виде патч-слоя для фреймворка OpenPI. Исходный датасет объемом 2.36 ТБ размещен на платформе Hugging Face и доступен исследователям для некоммерческих академических целей по запросу. Готовые веса обученной политики (policy checkpoints) авторы пока не выкладывали.
Главные выводы
- AXIS успешно доказал, что масштабный сбор данных для робототехники можно перенести в обычный браузер без использования локальных роботов и редкого аппаратного обеспечения.
- Краудсорсинговый подход позволил собрать 207 сложных задач и свыше 50 000 проверенных траекторий движения.
- Предобучение на массиве AXIS повышает точность модели π0.5 с 83.9% до 88.8% на бенчмарке LIBERO-Plus.
- Конвейер очистки данных и фотореалистичной аугментации в IsaacSim играет ключевую роль в физической корректности записанных действий.
Источник: www.marktechpost.com
