Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

AXIS: браузерный движок данных для обучения роботов-манипуляторов

AXIS: браузерный движок данных для обучения роботов-манипуляторов

Современные датасеты для обучения робототехники развиваются значительно медленнее, чем модели, которые на них обучаются. Главная причина кроется в закрытости процессов сбора данных: специалисты собирают демонстрации на специализированном аппаратном обеспечении в лабораториях, обрабатывают их автономно и выпускают статические бенчмарки, которые в дальнейшем не обновляются. Исследовательская команда из Axis Robotics, UC Berkeley, Georgia Tech и NTU предлагает принципиально иной подход к решению этой проблемы. Созданный ими инновационный браузерный движок данных под названием AXIS переносит сбор демонстраций непосредственно в веб-браузер, перекладывает тяжелые вычисления на бэкенд с графическими процессорами и рассматривает массив данных не как разовый релиз, а как постоянно расширяющуюся экосистему.

Насколько практическим и готовым к развертыванию оказалось это решение? Частично. Код для обучения открыт в виде патч-слоя поверх OpenPI, а платформа телеуправления доступна прямо в браузере. При этом датасет на Hugging Face имеет объем 2,36 ТБ и ограничен некоммерческим академическим использованием, а готовые контрольные точки политик разработчики не публикуют.

Разделение на браузерную часть и бэкенд

Фундаментальным архитектурным решением системы стала асимметрия. Участники проекта осуществляют телеуправление роботом Franka Research 3 с захватом с параллельными губками через фронтенд MuJoCo WebAssembly, используя клавиатуру, мышь, виртуальный джойстик или геймпад. Шаги физического движка и рендеринг на Three.js выполняются вне основного потока интерфейса React, благодаря чему записанные выборки состояний и действий остаются синхронизированными именно с симулятором, а не с визуальным интерфейсом.

Реклама

Все ресурсоемкие процессы выполняются на мощных удаленных серверах: рендеринг задействует восемь графических процессоров RTX 4090, а обучение и оценка моделей возложены на восемь ускорителей A100. Сами задачи не создаются вручную, а генерируются автоматически. Специальный модуль TaskGen разбивает текстовую инструкцию на конфигурации задачи, сцены и объектов, находит или генерирует трехмерные сетки через конвейер преобразования изображений в 3D, масштабирует их до правдоподобных физических размеров, после чего формирует 2,5D-макет. Диспетчер макетов проверяет созданную сцену и при нарушении ограничений выполняет перемещение, переориентацию или полную регенерацию объектов. Каждая задача снабжена встроенным структурированным проверяльщиком успешности выполнения, который бэкенд запускает заново, не полагаясь слепо на флаг успеха из фронтенда.

Что входит в состав датасета

Первый публичный снимок данных включает 207 задач, 50 129 эпизодов и свыше 60 000 вариантов задач или сцен, распределенных по семи категориям окружения. Каждая траектория содержит метаданные задачи, информацию об исполнителе, версию симулятора, состояния робота и объектов, выполненные действия, метки успешности, а также RGB-D наблюдения с третьего лица и с запястной камеры. В официальном отчете авторы выражают благодарность более чем 70 000 участников сообщества, внесших свой вклад в проект.

Процесс очистки данных рассматривается разработчиками как полноценный производственный этап. Записи с вариативностью суставов ниже 5e-3 отбраковываются как статические, фильтр Савицкого — Голея с окном 15 и полиномом 3-го порядка сглаживает непрерывное движение, а кубические сплайны выполняют ресемплинг исходной частоты веб-интерфейса (от 6 до 8 Гц) до целевых 20 Гц.

В таблице 1 открыто демонстрируются неизбежные компромиссы обработки: среднее ускорение падает с 1,3539 до 0,4885, а средний рывок уменьшается с 11,5899 до 2,2243, тогда как успешность повторного воспроизведения снижается со 100% до 86,2%. Очищенные эпизоды затем воспроизводятся в IsaacSim из упакованного состояния симулятора с отключенным расчетом физики, поэтому верифицированная траектория остается неизменной и авторитетной, в то время как окружающие сцены, камеры, материалы и освещение рандомизируются вокруг нее. На выходе получается трассированное лучами RGB-изображение с разрешением 256×256 пикселей, поступающее с фиксированной камеры наблюдения и запястной камеры, причем глубина сцены по умолчанию отключена.

Результаты на бенчмарке LIBERO-Plus

Все сценарии тестирования стартуют с опубликованной контрольной точки модели π0.5, использующей архитектуру PaliGemma с бэкэндом Gemma-2B и экспертом по действиям Gemma-300M. Далее может осуществляться дополнительное преобучение на корпусе симулятора с последующей точной настройкой на LIBERO с идентичными гиперпараметрами. Преобучение проводится для всей модели без использования метода LoRA с применением функции потерь сопоставления потоков (flow-matching loss) на 10-шаговых фрагментах действий в течение 100 000 шагов, после чего выполняются 30 000 шагов пост-тренинга на LIBERO.

Комбинация π0.5 и AXIS-100% достигает общего результата 88,8 балла на бенчмарке LIBERO-Plus, в то время как стандартная модель π0.5 показывает 83,9 балла, а контрольное решение RoboCasa365 с сопоставимым количеством траекторий останавливается на отметке 57,5 балла. В аннотации исследования упоминаются относительные показатели в 5,8% и 37,3%, однако абсолютная разница в 4,9 и 31,3 балла дает более наглядное и точное представление об эффективности подхода.

Масштабирование данных и результаты тестирования

Анализ показывает стабильный рост показателей в совокупности: точность последовательно увеличивается с 84,7% до 85,7% и достигает 88,8% на выборках в 25%, 50% и 100% соответственно. Если рассматривать отдельные оси пертурбаций, то наиболее заметный прирост обеспечивают те направления, где конвейер аугментации задействует активную рандомизацию. Так, добавление шума датчиков дает прибавку в 13,7 процентных пункта, а работа с камерой приносит 11,3 пункта. Менее выраженный, но стабильный прогресс наблюдается по параметрам фона (3,7%), позы робота (3,8%) и компоновки (2,6%).

При этом показатели по освещению и языку демонстрируют небольшую регрессию — на 1,7 и 1,3 пункта соответственно. Любопытно, что параметр камеры на отметке AXIS-50% проседает до 68,8%, что ниже базового уровня в 72,5%, однако затем успешно восстанавливается. В целом масштабирование демонстрирует стабильность на агрегированном уровне, несмотря на локальные колебания по отдельным осям.

Основные выводы и итоги работы

Платформа объединяет 207 практических задач и 50 129 верифицированных траекторий движений, собранных с помощью браузерного фронтенда MuJoCo-WASM без использования локальных графических ускорителей и физических роботов. Непрерывное предварительное обучение повышает общую результативность модели π0.5 на бенчмарке LIBERO-Plus с 83,9% до 88,8%, что дает чистый прирост на 4,9 пункта. При этом сопоставимый по объему контрольный набор RoboCasa365 набирает лишь 57,5%, подтверждая, что успех обусловлен качеством данных, а не просто масштабом симуляции.

  • Процесс доработки снижает среднее ускорение манипулятора на 63,9% и показатель рывков на 80,8%, хотя успешность повторного воспроизведения траекторий при этом незначительно снижается до 86,2%.
  • Две оси возмущений — освещение и языковые инструкции — показывают ухудшение результатов по сравнению с базовой моделью.

Источник: marktechpost.com

01.