Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

NVIDIA представила Physis-Lang: новый метод физического обучения нейросетей

NVIDIA представила Physis-Lang: новый метод физического обучения нейросетей

Подробности изложены в материале первоисточника. Современные видеогенераторы способны создавать впечатляющие ролики, которые тем не менее часто нарушают базовые законы физики: масло может растекаться подобно краске, а мячи пролетают сквозь стены. Исследователи из NVIDIA, Массачусетского технологического института и Оксфордского университета предложили решение, основанное не на дополнительных визуальных или численных сигналах, а на самом языке.

Новый фреймворк под названием Physis-Lang рассматривает физическое описание как универсальное и оптимизируемое представление. Один и тот же текст используется для отбора данных, настройки моделей и этапа генерации, что позволяет значительно повысить физическую достоверность генерируемых видео.

Какую проблему решает Physis-Lang?

Обычные текстовые описания видео фиксируют лишь внешние события, игнорируя причины происходящего. Фраза вроде «масло плавится при повышении температуры» ничего не говорит о гравитации или передаче тепла. Physis-Lang добавляет в базовые описания специальное поле physical_реasoning, в котором подробно расписываются объекты, причины, взаимодействия, законы, временная эволюция и конечные эффекты.

Реклама

Кроме того, на этапе подготовки пайплайн формирует для каждого сюжета индивидуальный параметр physics_negative_prompt. В нем фиксируются нереалистичные сценарии, например плавающий на поверхности воды камень. Данный текст используется в качестве негативного кондиционирования во время генерации видео.

Как устроен саморазвивающийся цикл создания описаний?

В процессе работы базовая модель генерации описаний остается замороженной, а эволюционируют исключительно инструкции для нее. Генератор на базе GPT-5.5 создает описания для фиксированного набора из 20 видеороликов, содержащего 273 проверенных экспертами утверждения. В роли критического оценщика выступает модель Gemini-3.1-Pro, а специальный агент дорабатывает промпты на основе полученных оценок.

Критик оценивает контент по двум ключевым параметрам: точности (текст разбивается на атомарные утверждения, проверяемые по видео) и полноте (каждое физическое утверждение должно явно следовать из описания). Все измененные промпты тестируются на новом бенчмарке PhysCapBench, включающем 246 роликов и почти 3800 проверенных утверждений.

Как работает отбор данных с помощью языка?

Диагностический агент на базе GPT-5.5 сопоставляет сбои в сгенерированных видео с конкретными физическими категориями вроде столкновений, динамики твердых тел или гидродинамики. Полученный профиль дефицита соотносится с физическими тегами в обширной видеотеке, причем поиск нацелен именно на физическое содержание, а не на визуальную схожесть.

Итоговый тренировочный набор включает 183 тысячи видеороликов: 71 тысяча отобрана из базы WISA-80K, а еще 112 тысяч получены с помощью поискового ретривала. Сам по себе этот метод поиска добавил в среднем более 3 баллов на трех бенчмарках, а на платформе VideoPhy-2 химические и тепловые процессы улучшились сразу на 8 баллов.

Как Physis-Lang соотносится с Veo 3.1?

Тонкая настройка моделей выполняется методом LoRA для проекций внимания без изменения архитектуры. Сравнение Physis-Lang на базе Cosmos3-Nano с разработкой от Google показывает превосходство решения NVIDIA на ключевых бенчмарках, включая PhyGenBench и Physics-IQ Verified, где модель демонстрирует более высокие результаты как на стандартных, так и на сложных подмножествах данных.

Положительный эффект наблюдается и для других бэкэндов: прирост составил более 7 баллов для Wan2.1-14B и свыше 3-6 баллов для различных конфигураций Cosmos3. При этом общая визуальная стабильность на VBench-I2V осталась на высоком уровне, а использование одних лишь физических промптов и негативных подсказок позволяет улучшить показатели замороженной модели без дополнительного обучения.

Можно ли запустить систему без коммерческих API?

Исследовательская группа успешно дистиллировала коммерческий пайплайн в две компактные модели Qwen3-VL-4B-Instruct: PhysThinker-C для генерации описаний и PhysThinker-U для улучшения промптов. Использование локальной связки позволило сократить затраты на API с нескольких сотен долларов до нуля, сохранив при этом большую часть прироста производительности.

01.