Мой блог
FLUX 3 Action: обзор новой модели управления роботами от Black Forest Labs
Лаборатория Black Forest Labs (BFL), известная по линейке генеративных моделей изображений FLUX, представила FLUX 3 Action — открытую модель управления роботами World Action Model (WAM) с 7 миллиардами параметров. Программа анализирует кадры с камеры, текущее состояние робота и текстовую инструкцию, после чего одновременно прогнозирует будущие видеокадры и пакет управляющих действий. Разработка заняла первое место в бенчмарке RoboLab-120.
Что касается практического развертывания, то политика DROID требует порядка 32 ГБ видеопамяти в формате BF16 на ускорителе H200. При использовании квантования FP8 и выгрузке текстового энкодера модель помещается на карты с 24 ГБ памяти. Проект распространяется по лицензии FLUX Kommunity License, которая разрешает только некоммерческое использование.
Компромиссы производительности и архитектура FLUX 3 Action
Традиционные открытые робототехнические политики заставляют разработчиков выбирать между точностью и скоростью. Модели WAM, такие как NVIDIA Cosmos 3 Nano, лидируют в RoboLab с показателем 36.8%, однако генерация видео обходится слишком дорого. В то же время визуально-языковые модели действий (VLA), например π0.5, работают быстро, но достигают лишь 28.0%. По измерениям BFL на чипе B200, Cosmos 3 Nano в формате FP8 требует примерно в 4.7 раза больше процессорного времени на секунду движения робота, чем π0.5 в BF16. Новая разработка сохраняет совместное прогнозирование видео и действий, ликвидируя разрыв в скорости за счет уменьшенного бэкбона и дистилляции.
Архитектурно FLUX 3 Action создана на базе мультимодального бэкбона FLUX 3. На этапе предварительного обучения использовались данные изображений, видео и аудио, причем на видео пришлось более 95% токенов. Текст, видеопоток и состояние механизма кодируются в токены, после чего будущие токены бэкбона декодируются в видеокадры, а токеновые последовательности действий — в команды для робота. На этапе промежуточного обучения претренировочные данные (36.95% выборки) смешивались с видеоматериалами, согласованными с действиями (63.05%), которые включали игровую хронику, кадры от первого лица, работу манипуляторов и телеоперации на 14 типах платформ. Большинство робототехнических данных опирается на единое 50-мерное пространство действий эффектора EE50.
Предварительное обучение играет критическую роль: без него обучение исключительно на датасете DROID давало результат ниже 1% в RoboLab, тогда как с предварительным обучением тот же протокол показал 11.6%.
Результаты тестов в бенчмарках и на реальном «железе»
Бенчмарк RoboLab-120 включает 120 настольных задач в симуляторе Isaac Sim, выполняя по 10 попыток для каждой на конфигурации манипулятора Franka в стиле DROID. Модель от BFL набирает 42.92% успешных выполнений на лидборде, что обеспечивает отрыв в 6.1 процентного пункта при сокращении параметров на 56% по сравнению с Cosmos 3 Nano. Средний показатель по нескольким сидам для дистиллированного по руководству чекпоинта в FP8 составляет 42.24%.
Испытания на реальном аппаратном обеспечении демонстрируют аналогичную динамику. Специалисты Positronic Robotics провели слепое тестирование на руке Franka, задействовав 10 задач DROID по 3 попытки на каждую. FLUX 3 Action успешно завершила 28 попыток из 30 (93.3%). Конкуренты показали следующие результаты: Cosmos 3 Nano — 27 из 30, DreamZero — 20 из 30, а π0.5 — 13 из 30.
Варианты чекпоинтов и скоростные характеристики
Команда BFL поставляет политику DROID в трех различных конфигурациях, доступных в форматах BF16 и FP8:
- Базовый вариант: 4 шага сэмплинга с разделенным гайдансом (видео CFG 4, действия CFG 1).
- Дистиллированный по руководству вариант: исключает второй проход гайданса, работает в 1.8–2 раза быстрее и набирает на 0.6–1.08 п.п. больше.
- Дистиллированный по шагам вариант: требует всего 1 шаг сэмплинга, ускоряется в 3.15–4 раза, но демонстрирует падение успешности на 3.51–4.32 п.п.
По сравнению с Cosmos 3 Nano в FP8, базовый и дистиллированный чекпоинты выполняются в 1.52–3.95 раза быстрее на потребительских, рабочих и датацентровых графических процессорах. Каждый вызов генерирует 32 действия с частотой 15 Гц, что соответствует 2.13 секундам движения. Для сравнения, π0.5 выдает 1 секунду за вызов, поэтому BFL оценивает скорость в виде коэффициента реального времени, а не задержки на один вызов. На датацентровых и рабочих GPU пошагово-дистиллированная версия в FP8 превосходит π0.5 в 1.34–2.28 раза, однако на видеокарте RTX 5090 она работает медленнее конкурента.
Интеграция с языковыми моделями и тонкая настройка
Инженеры также исследовали гибридное управление совместно с GPT 6 Astra. Рассуждающий модуль способен выполнять, редактировать или заменять предсказанные политикой действия. При минимальных затратах на рассуждения гибридная система решила 90% эпизодов при стоимости $8.77 и времени 8 минут 8 секунд на успешное выполнение. Чистая модель Astra при максимальных усилиях решала 100% задач, но обходилась в $13.47 при затратах времени 16 минут 23 секунды.
Команды разработчиков могут дообучать модель на собственных демонстрациях. BFL опубликовала рецепты для датасетов DROID и SO-101 LoRA. Документация демонстрирует навык сортировки объектов (pick-and-place) для манипулятора SO-101, освоенный примерно по 200 демонстрациям. Совместно с NVIDIA модель интегрировали в Hugging Face LeRobot, также поддерживается развертывание на периферийных устройствах NVIDIA Jetson, а в документации присутствуют примеры игровых сценариев и симуляции дронов.
Стоит учитывать важную техническую особенность: модель выдает целевые координаты суставов без встроенных ограничений по скорости, силе или рабочей зоне, поэтому эти лимиты приложение должно настраивать самостоятельно.
