Мой блог
AgenticFocus: как превратить любое FPV-видео в датасет для обучения гуманоидных роботов
Развитие так называемого Physical AI (физического искусственного интеллекта) сегодня столкнулось с существенной преградой — критической нехваткой специализированных обучающих данных. Если при обучении мультимодальных языковых моделей (VLM) разработчики могли опираться на гигантские массивы текста и изображений, накопленные в интернете за десятилетия, то для обучения моделей типа Vision-Language-Action (VLA) и world-action обучающей базы практически нет. Создание качественно размеченных датасетов для робототехники нередко оказывается более сложным и дорогостоящим процессом, чем проектирование самой аппаратной части робота.
При этом в сети представлены миллионы часов видеозаписей от первого лица (FPV), где люди выполняют руками самые разнообразные бытовые и производственные задачи: собирают механизмы, готовят еду, работают с инструментами и манипулируют объектами. Однако использовать эти эгоцентрические ролики «из коробки» для обучения роботов до последнего времени было невозможно. Недавно инженеры и исследователи в области Physical AI представили технологический пайплайн AgenticFocus. Я подробно изучил эту разработку и готов разобрать, как именно данный метод превращает произвольные FPV-видеозаписи в полноценные наборы данных для тренировки мелкой моторики гуманоидных роботов.
Почему нельзя просто взять готовые FPV-видео для обучения роботов?
Для успешного обучения моделей VLA и world-action-систем необходим огромный объем визуально-моторной информации. Модели VLA связывают воедино зрительное восприятие, текстовые инструкции и исполнительные команды, а world-action добавочно прогнозируют реакцию физической среды на действия агента. Чтобы робот мог адекватно реагировать на окружающую обстановку, ему необходимы чёткие пространственные ориентиры. Прямое использование сырых FPV-видео с участием человека наталкивается на три фундаментальные проблемы:
- Несоответствие ракурсов и систем координат. Камера, закрепленная на голове или груди человека, фиксирует сцену под углом, отличным от точек обзора сенсоров гуманоида. Привязать то, что видит человек, к собственной системе координат робота невероятно трудно.
- Перекрытие объектов и утрата геометрии. При манипуляциях человеческие пальцы и ладони постоянно заслоняют предмет. Перекрытие происходит именно в ключевых зонах контакта, где критически важна точная геометрия граней и точек захвата. Попытки алгоритмически вырезать человеческую руку или применить генеративное дорисовывание фона приводят к искажению формы объекта в самых ответственных местах.
- Отсутствие кинематической привязки (Embodiment Alignment). Даже при наличии видеозаписи с идеальной синхронизацией движения человека не соответствуют кинематике, степени свободы и динамике конкретного робототехнического железа. Без жесткого соответствия физике исполнительного устройства обучить управляющую политику невозможно.
Существовавшие ранее инструменты обработки эгоцентрических видео либо чрезмерно упрощали траектории кисти, теряя тонкую моторику, либо требовали применения громоздких систем захвата движений (MoCap), специализированных сенсорных перчаток и длительной ручной разметки.
AgenticFocus: архитектура и принципы работы пайплайна
Чтобы решить проблему использования FPV-контента, разработали подход AgenticFocus. Его суть заключается в создании кадров смешанной реальности путем расщепления исходного видеоряда на независимые информационные слои с их последующей пересборкой под физику конкретного робота. Пайплайн состоит из трех ключевых этапов:
1. Объектно-ориентированное восстановление (Object-Centric Restoration)
На первом шаге алгоритм идентифицирует и отслеживает целевой объект взаимодействия на протяжении всего видео. Далее происходит удаление человека из кадра. Вместо нестабильного генеративного заполнения зон контакта метод анализирует всю видеопоследовательность, собирает информацию о геометрии объекта с тех кадров, где он не перекрыт, и реконструирует цельную, эталонную 3D-модель предмета. В результате формируется неискаженная пространственная модель объекта, готовая к интеграции в виртуальную сцену.
2. Перенос движений кисти в системе координат камеры (Camera-Relative Full-Hand Retargeting)
После восстановления 3D-модели объектов пайплайн реконструирует траектории человеческих кистей и пересчитывает их в кинематику роботизированных манипуляторов. Ключевое техническое решение здесь — расчёт координат движений относительно системы координат камеры, а не базовой платформы робота. Это существенно упрощает пространственное выравнивание и синхронизирует точку обзора виртуальной камеры с сенсорами робота.

Человеческие руки на видеозаписи заменяются детальными 3D-моделями многопалых манипуляторов целевого гуманоида. Алгоритм рассчитывает динамические состояния и команды для всех суставов кисти, после чего применяет сглаживание траекторий для устранения шумов распознавания. Дополнительно вводятся фиксированные поправки ориентации запястья, компенсирующие разницу между анатомическим строением человеческой руки и механическими суставами робота. На выходе формируется синхронизированный массив данных «действие-состояние» (action-state), содержащий команды моторам, скорости и усилия в каждый момент времени.
3. Многослойный композитинг с учётом глубины
На финальной стадии обработанные слои собираются в единый синтетический видеоряд смешанной реальности. Чтобы избежать визуальных артефактов в зонах захвата, применяются раздельные слои рендеринга:
- Отдельный проход для всей сочлененной руки робота;
- Выделенный слой для большого пальца в области непосредственного контакта с предметом (near-contact thumb pass);
- Подложка восстановленной 3D-модели объекта, располагаемая между слоями рендера.
Такая слоистая компоновка с жестким контролем буфера глубины обеспечивает естественное перекрытие пальцев робота гранями объекта, сохраняя видимость точек контакта при сложных обхватывающих захватах.
Оценка точности траекторий и плавности движений
Для проверки эффективности AgenticFocus провели серии экспериментов на тестовых FPV-последовательностях, включая ролики из открытого датасета EPIC-KITCHENS и внутренние демонстрационные записи. Все материалы были приведены к единой частоте 30 кадров в секунду. Сравнение проводилось с популярными аналогами — системами Masquerade и Do as I Do — при единых условиях нормализации временной шкалы и координат.
Оценка точности траекторий
Точность оценивалась по средней пространственной ошибке положения манипулятора относительно эталонной траектории. Результаты показали, что AgenticFocus обеспечивает наименьшую погрешность реконструкции среди всех участников теста. Согласование координат относительно камеры в сочетании с полным переносом моторики пальцев (full-hand retargeting) позволяет минимизировать пространственные искажения при межплатформенном переносе данных.
Плавность моторики по метрике SPARC
Для оценки плавности и естественности движений запястья робота применили метрику SPARC (Spectral Arc Length), анализирующую частотный спектр профиля скорости. Чем ближе показатель SPARC к нулю (значения находятся в отрицательной области), тем менее дерганым и более плавным является движение.
По итогам измерений AgenticFocus продемонстрировал средний показатель –5,18, опередив Masquerade (–5,56) и Do as I Do (–6,05). В процентном соотношении качество плавности движений выросло примерно на 7% относительно Masquerade и почти на 14% относительно Do as I Do. Это подтверждает, что фильтрация траекторий и привязка к системе координат камеры дают реальный прирост в стабильности работы приводов гуманоида.
Практическая ценность для отрасли
Главный результат работы AgenticFocus — возможность автоматической генерации синхронизированных датасетов, в которых каждому кадру FPV-видео сопоставлены точные физические состояния и команды для исполнительных механизмов робота. Человеческие руки на видео полностью замещаются манипуляторами робота, а геометрия предметов сохраняется без искажений.
Подход избавляет исследователей от необходимости покупать дорогостоящие костюмы захвата движений, перчатки с обратной связью и монтировать сложные студийные системы камер. Обычное эгоцентрическое видео, снятое на бытовую камеру или экшен-гарнитуру, становится полноценным обучающим материалом. Подробное научное описание метода с формулами и математическим аппаратом готовится к презентации на международной конференции ISMAR 2026.
Источник: habr.com
