Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

NVIDIA Cosmos-H-Dreams: генеративный симулятор для хирургических роботов в реальном времени

NVIDIA Cosmos-H-Dreams: генеративный симулятор для хирургических роботов в реальном времени

Разработка фундаментальных моделей мира (world foundation models) кардинально меняет подход к проектированию и симуляции роботизированных систем. Вместо ручного моделирования и программирования каждого виртуального объекта и физического взаимодействия исследователи получили возможность обучать модели визуальной динамике напрямую на основе синхронизированных видеоматериалов и реальной робототехнической кинематики. Ярким примером такого прорыва стал проект NVIDIA Cosmos-H-Surgical-Simulator, который продемонстрировал способность генерировать будущие видеокадры хирургических вмешательств, отталкиваясь от исходного кадра сцены и последовательности команд манипуляторов. Данный подход позволил проводить оценку стратегий быстрее физического времени и наладить масштабную генерацию синтетических данных во всей экосистеме Open-H-Embodiment. Развивая это направление, NVIDIA представила следующий шаг — Cosmos-H-Dreams, интерактивный генеративный симулятор для хирургической робототехники, работающий в реальном времени и реагирующий на управляющие действия.

Архитектурные основы и трансформация в реальное время

Инновационный симулятор Cosmos-H-Dreams переносит ключевые возможности Cosmos-H-Surgical-Simulator в плоскость интерактивного взаимодействия, превращая исходное решение в причинно-следственную (causal) модель «студента» с минимальным количеством шагов. Обработка и бесшовная потоковая передача данных обеспечиваются с помощью библиотеки ускоренного инференса NVIDIA FlashDreams. Запускаясь на единственной графической карте NVIDIA RTX PRO 6000, система формирует полноценную интерактивную среду, которой в режиме замкнутого контура может управлять как человек, так и обученная робототехническая политика.

Эволюция от Cosmos-H-Surgical-Simulator к Cosmos-H-Dreams

Модель Cosmos-H-Surgical-Simulator представляет собой базовую модель мира, обученную на архитектуре NVIDIA Cosmos-Predict2.5-2B с последующим дообучением (post-training) на массиве данных Open-H-Embodiment. Получая на вход контекстный кадр хирургической операции и целевую траекторию движения робота, система выдает прогнозируемое видео, отображающее вероятные визуальные последствия этих действий. Это делает инструмент чрезвычайно полезным для автономной оценки политик и синтеза данных. Записанная ранее или сгенерированная алгоритмом траектория отправляется в модель, после чего та формирует соответствующий роллаут (проигрывание), который можно детально изучить и оценить без необходимости многократно повторять физические тесты на настоящем хирургическом роботе.

В свою очередь, Cosmos-H-Dreams переводит этот механизм в формат реального времени. Опираясь на многоуниверсальные хирургические приоритеты, усвоенные предшественником, новая система адаптирована под специфику настольного наложения швов на исследовательском комплексе da Vinci Research Kit (dVRK). Модель дистиллирована в казуальную сеть, генерирующую сцену авторегрессионным методом. На вход подается первоначальный RGB-кадр и непрерывный поток кинематических данных, после чего модель выдает следующий пакет кадров, переходя к обработке последующего блока действий. Универсальность разработки была подтверждена на практике: благодаря сотрудничеству с CMR Surgical и Cambridge Consultants инженеры интегрировали симулятор с контроллером Versius, обеспечив управление платформой в реальном времени.

Методология обучения и конвейер учитель-студент

Главным техническим вызовом при создании подобных систем остается сохранение достоверной хирургической динамики при одновременном сокращении вычислительных издержек на рендеринг. Решением этой задачи в Cosmos-H-Dreams стал специальный учебный конвейер «учитель-студент», оптимизированный под протяженные авторегрессионные сессии.

Унификация действий и учет негативных сценариев

Двунаправленная модель-учитель разворачивается на базе чекпоинта Cosmos-H-Surgical-Simulator с использованием единого 44-мерного представления действий. В частности, для настольного робота dVRK показатели пространственного перемещения двух манипуляторов, их вращения и статуса захватов переводятся в этот общий формат. Примечательно, что учитель дообучался на комплексной смеси данных JHU dVRK, охватывающей не только безупречные демонстрации, но и разнообразные сбои и нештатные ситуации: падения иглы, неудачные попытки захвата, промахи и сорванные узлы. Наличие таких сценариев критически важно: симулятор, претендующий на объективную оценку управляющих политик, обязан реалистично воспроизводить последствия ошибочных шагов, а не только идеальное прохождение процесса.

Масштабирование временного горизонта и самопринуждающая дистилляция

Чтобы обеспечить стабильность модели на длинных отрезках времени, процесс обучения построен на поэтапном наращивании временного горизонта учителя. Обучение стартует с окна в 12 кадров и постепенно расширяется до 72 кадров, причем на каждом новом шаге предварительно разогретая модель инициализируется весами с предыдущего этапа. Предварительно вычисленные и закэшированные траектории деноизинга учителя служат основой для обучения казуального студента, который осваивает работу с причинным вниманием (causal attention) и потоковым кэшем ключей/значений (KV cache) еще до того, как перейдет к обработке собственной сгенерированной истории.

Для устранения классической проблемы авторегрессионных систем — накопления ошибок из-за разницы между идеальными обучающими данными и собственными несовершенными выходами на этапе эксплуатации — применяется самопринуждающая дистилляция (self-forcing distillation). В процессе обучения студент самостоятельно прокручивает сгенерированный им самим контекст, а замороженный учитель корректирует этот поток за счет сопоставления распределений (distribution-matching supervision). Это подготавливает модель к реальным условиям интерактивного вывода, позволяя сократить число диффузионных шагов до минимума — всего до двух шагов деноизинга на один скрытый кадр, объединяя мощные хирургические приоритеты учителя с казуальной структурой для потоковой трансляции.

Инфраструктура, оптимизация производительности и интерфейсы

Достижение интерактивной скорости обработки (порядка 160 кадров в секунду на единственной видеокарте NVIDIA RTX PRO 6000 по сравнению с 10 кадрами в секунду у стандартного симулятора) стало возможным благодаря комплексу оптимизаций в библиотеке FlashDreams. Среди ключевых технологий задействованы потоковый кэш KV, захват графов CUDA и глубокая компиляция моделей.

Интерфейсы взаимодействия с пользователем

Помимо вычислительной оптимизации, Cosmos-H-Dreams предлагает развитые инструменты для превращения генерации видео в интерактивный процесс управления:

  • Браузерный клиент: Передача команд с обычной клавиатуры и получение синтезированных кадров в реальном времени через протокол WebRTC.
  • Клиент Meta Quest: Прямая трансляция движений специализированных контроллеров в робототехнические действия с одновременным отображением синтезируемой сцены по протоколу WebXR.
  • Интеграция с политиками: Подключение предварительно обученных хирургических агентов для замкнутого обмена наблюдениями и прогнозируемыми действиями.

Несмотря на то, что репозиторий поставляется с готовым претренированным чекпоинтом для задач наложения швов, архитектура открыта для кастомизации под произвольные роботизированные комплексы. Авторы предоставляют исчерпывающее руководство по настройке учителя и самопринуждающей дистилляции для пользовательских наборов данных.

Перспективы применения и новые бенчмарки

Появление подобных систем открывает новое направление в хирургическом моделировании — создание сред, обученных на реальных робототехнических данных и обладающих достаточной отзывчивостью для полноценного погружения. Следующим шагом в развитии технологии становится строгая количественная оценка не только визуального качества, но и точности реакции на команды, стабильности сохранения структуры инструментов на длинных дистанциях и степени переноса выводов на физическое оборудование.

Это стимулирует появление новых закрытых бенчмарков, измеряющих точность позиционирования кончика инструмента, надежность циклов захвата, стабильность в состоянии покоя, разнообразие контрфактических действий, долгосрочный дрейф и степень согласия между симулированными и реальными результатами политик. Интерактивные модели мира способны выступать полноправными партнерами при разработке управляющих алгоритмов: они генерируют редкие аварийные ситуации по запросу, формируют масштабируемую среду для обучения с подкреплением или имитационного обучения, а также позволяют моментально тестировать новые стратегии без риска повредить дефицитное аппаратное обеспечение.

В перспективе решением подобных задач можно закрыть потребности телехирургии с компенсацией задержек сигнала, интерактивных хирургических репетиций, планирования сложных процедур и поддержки принятия решений прямо во время операций. Хотя Cosmos-H-Dreams позиционируется как мощная платформа для исследований и разработок, а не как клинический инструмент медицинской диагностики, замена интраоперационной визуализации или прямой контроллер физического робота, она закладывает безопасный фундамент для дальнейших изысканий. Совершенствование точности моделей, временной стабильности и эффективности аппаратного обеспечения позволяет объединить медицинское образование, синтез данных, а также обучение и оценку алгоритмов в рамках единой экосистемы Physical AI.

Источник: huggingface.co

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights