Мой блог
NVIDIA Cosmos-H-Dreams: генеративный симулятор для хирургических роботов в реальном времени

Разработка фундаментальных моделей мира (world foundation models) кардинально меняет подход к проектированию и симуляции роботизированных систем. Вместо ручного моделирования и программирования каждого виртуального объекта и физического взаимодействия исследователи получили возможность обучать модели визуальной динамике напрямую на основе синхронизированных видеоматериалов и реальной робототехнической кинематики. Ярким примером такого прорыва стал проект NVIDIA Cosmos-H-Surgical-Simulator, который продемонстрировал способность генерировать будущие видеокадры хирургических вмешательств, отталкиваясь от исходного кадра сцены и последовательности команд манипуляторов. Данный подход позволил проводить оценку стратегий быстрее физического времени и наладить масштабную генерацию синтетических данных во всей экосистеме Open-H-Embodiment. Развивая это направление, NVIDIA представила следующий шаг — Cosmos-H-Dreams, интерактивный генеративный симулятор для хирургической робототехники, работающий в реальном времени и реагирующий на управляющие действия.
Архитектурные основы и трансформация в реальное время
Инновационный симулятор Cosmos-H-Dreams переносит ключевые возможности Cosmos-H-Surgical-Simulator в плоскость интерактивного взаимодействия, превращая исходное решение в причинно-следственную (causal) модель «студента» с минимальным количеством шагов. Обработка и бесшовная потоковая передача данных обеспечиваются с помощью библиотеки ускоренного инференса NVIDIA FlashDreams. Запускаясь на единственной графической карте NVIDIA RTX PRO 6000, система формирует полноценную интерактивную среду, которой в режиме замкнутого контура может управлять как человек, так и обученная робототехническая политика.
Эволюция от Cosmos-H-Surgical-Simulator к Cosmos-H-Dreams
Модель Cosmos-H-Surgical-Simulator представляет собой базовую модель мира, обученную на архитектуре NVIDIA Cosmos-Predict2.5-2B с последующим дообучением (post-training) на массиве данных Open-H-Embodiment. Получая на вход контекстный кадр хирургической операции и целевую траекторию движения робота, система выдает прогнозируемое видео, отображающее вероятные визуальные последствия этих действий. Это делает инструмент чрезвычайно полезным для автономной оценки политик и синтеза данных. Записанная ранее или сгенерированная алгоритмом траектория отправляется в модель, после чего та формирует соответствующий роллаут (проигрывание), который можно детально изучить и оценить без необходимости многократно повторять физические тесты на настоящем хирургическом роботе.
В свою очередь, Cosmos-H-Dreams переводит этот механизм в формат реального времени. Опираясь на многоуниверсальные хирургические приоритеты, усвоенные предшественником, новая система адаптирована под специфику настольного наложения швов на исследовательском комплексе da Vinci Research Kit (dVRK). Модель дистиллирована в казуальную сеть, генерирующую сцену авторегрессионным методом. На вход подается первоначальный RGB-кадр и непрерывный поток кинематических данных, после чего модель выдает следующий пакет кадров, переходя к обработке последующего блока действий. Универсальность разработки была подтверждена на практике: благодаря сотрудничеству с CMR Surgical и Cambridge Consultants инженеры интегрировали симулятор с контроллером Versius, обеспечив управление платформой в реальном времени.
Методология обучения и конвейер учитель-студент
Главным техническим вызовом при создании подобных систем остается сохранение достоверной хирургической динамики при одновременном сокращении вычислительных издержек на рендеринг. Решением этой задачи в Cosmos-H-Dreams стал специальный учебный конвейер «учитель-студент», оптимизированный под протяженные авторегрессионные сессии.
Унификация действий и учет негативных сценариев
Двунаправленная модель-учитель разворачивается на базе чекпоинта Cosmos-H-Surgical-Simulator с использованием единого 44-мерного представления действий. В частности, для настольного робота dVRK показатели пространственного перемещения двух манипуляторов, их вращения и статуса захватов переводятся в этот общий формат. Примечательно, что учитель дообучался на комплексной смеси данных JHU dVRK, охватывающей не только безупречные демонстрации, но и разнообразные сбои и нештатные ситуации: падения иглы, неудачные попытки захвата, промахи и сорванные узлы. Наличие таких сценариев критически важно: симулятор, претендующий на объективную оценку управляющих политик, обязан реалистично воспроизводить последствия ошибочных шагов, а не только идеальное прохождение процесса.
Масштабирование временного горизонта и самопринуждающая дистилляция
Чтобы обеспечить стабильность модели на длинных отрезках времени, процесс обучения построен на поэтапном наращивании временного горизонта учителя. Обучение стартует с окна в 12 кадров и постепенно расширяется до 72 кадров, причем на каждом новом шаге предварительно разогретая модель инициализируется весами с предыдущего этапа. Предварительно вычисленные и закэшированные траектории деноизинга учителя служат основой для обучения казуального студента, который осваивает работу с причинным вниманием (causal attention) и потоковым кэшем ключей/значений (KV cache) еще до того, как перейдет к обработке собственной сгенерированной истории.
Для устранения классической проблемы авторегрессионных систем — накопления ошибок из-за разницы между идеальными обучающими данными и собственными несовершенными выходами на этапе эксплуатации — применяется самопринуждающая дистилляция (self-forcing distillation). В процессе обучения студент самостоятельно прокручивает сгенерированный им самим контекст, а замороженный учитель корректирует этот поток за счет сопоставления распределений (distribution-matching supervision). Это подготавливает модель к реальным условиям интерактивного вывода, позволяя сократить число диффузионных шагов до минимума — всего до двух шагов деноизинга на один скрытый кадр, объединяя мощные хирургические приоритеты учителя с казуальной структурой для потоковой трансляции.
Инфраструктура, оптимизация производительности и интерфейсы
Достижение интерактивной скорости обработки (порядка 160 кадров в секунду на единственной видеокарте NVIDIA RTX PRO 6000 по сравнению с 10 кадрами в секунду у стандартного симулятора) стало возможным благодаря комплексу оптимизаций в библиотеке FlashDreams. Среди ключевых технологий задействованы потоковый кэш KV, захват графов CUDA и глубокая компиляция моделей.
Интерфейсы взаимодействия с пользователем
Помимо вычислительной оптимизации, Cosmos-H-Dreams предлагает развитые инструменты для превращения генерации видео в интерактивный процесс управления:
- Браузерный клиент: Передача команд с обычной клавиатуры и получение синтезированных кадров в реальном времени через протокол WebRTC.
- Клиент Meta Quest: Прямая трансляция движений специализированных контроллеров в робототехнические действия с одновременным отображением синтезируемой сцены по протоколу WebXR.
- Интеграция с политиками: Подключение предварительно обученных хирургических агентов для замкнутого обмена наблюдениями и прогнозируемыми действиями.
Несмотря на то, что репозиторий поставляется с готовым претренированным чекпоинтом для задач наложения швов, архитектура открыта для кастомизации под произвольные роботизированные комплексы. Авторы предоставляют исчерпывающее руководство по настройке учителя и самопринуждающей дистилляции для пользовательских наборов данных.
Перспективы применения и новые бенчмарки
Появление подобных систем открывает новое направление в хирургическом моделировании — создание сред, обученных на реальных робототехнических данных и обладающих достаточной отзывчивостью для полноценного погружения. Следующим шагом в развитии технологии становится строгая количественная оценка не только визуального качества, но и точности реакции на команды, стабильности сохранения структуры инструментов на длинных дистанциях и степени переноса выводов на физическое оборудование.
Это стимулирует появление новых закрытых бенчмарков, измеряющих точность позиционирования кончика инструмента, надежность циклов захвата, стабильность в состоянии покоя, разнообразие контрфактических действий, долгосрочный дрейф и степень согласия между симулированными и реальными результатами политик. Интерактивные модели мира способны выступать полноправными партнерами при разработке управляющих алгоритмов: они генерируют редкие аварийные ситуации по запросу, формируют масштабируемую среду для обучения с подкреплением или имитационного обучения, а также позволяют моментально тестировать новые стратегии без риска повредить дефицитное аппаратное обеспечение.
В перспективе решением подобных задач можно закрыть потребности телехирургии с компенсацией задержек сигнала, интерактивных хирургических репетиций, планирования сложных процедур и поддержки принятия решений прямо во время операций. Хотя Cosmos-H-Dreams позиционируется как мощная платформа для исследований и разработок, а не как клинический инструмент медицинской диагностики, замена интраоперационной визуализации или прямой контроллер физического робота, она закладывает безопасный фундамент для дальнейших изысканий. Совершенствование точности моделей, временной стабильности и эффективности аппаратного обеспечения позволяет объединить медицинское образование, синтез данных, а также обучение и оценку алгоритмов в рамках единой экосистемы Physical AI.
Источник: huggingface.co

