Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Reka представила Rho-1: омниканальная нейросеть на 19B с поддержкой видео и робототехники

Reka представила Rho-1: омниканальная нейросеть на 19B с поддержкой видео и робототехники

Подробности изложены в материале первоисточника. Разработчики компании Reka выкатили исследовательский превью-релиз omni-reasoning модели Rho-1 объемом 19 миллиардов параметров, созданной с нуля. Эта нейросеть объединяет понимание и генерацию текста, графики и видеоряда, а также выдает прямые команды для роботов.

Я проверил ключевые особенности архитектуры и тесты производительности новинки, чтобы разобраться, как один унифицированный контекст заменяет громоздкие пайплайны из специализированных агентов.

Что меняет подход Rho-1

Большинство современных мультимодальных систем строятся по принципу конвейера. Центральный координатор занимается планированием, после чего перенаправляет задачи узким специалистам — генераторам картинок, видео или детекторам объектов. Каждая такая передача добавляет задержку, а каждый отдельный модуль видит лишь свой локальный запрос.

Реклама

Новая разработка полностью устраняет подобные пересылки. Текстовые данные, визуальный контент и робототехнические действия превращаются в единые токены внутри одного общего контекстного окна. Согласно исследованиям создателей, одна несрежиссированная сессия демонстрирует полный цикл: система рисует маяк, выделяет его рамкой, анимирует, превращает видеоролик в снежную бурю и комментирует отличия. Все это происходит за пять шагов без сторонних вызовов инструментов и подключения дополнительных моделей.

Реклама

Архитектура: два потока и один кэш KV

Все входящие и исходящие сигналы кодируются в двух базовых форматах. Дискретные токены переносят текст, символьные рассуждения и высокоуровневые команды. Непрерывные токены отвечают за латентные представления изображений, видеокадры, двигательные реакции роботов и проприоцепцию.

Две экспертные ветки обработки

Каждый блок трансформера содержит два экспертных потока весов. Поток понимания отвечает за лингвистический анализ и парсинг графики, а генеративный поток выполняет дено-шумлате латентных векторов в картинки и видео. Обе ветки делят механизм внимания и функционируют на базе общего KV-кэша.

Если для ответа требуются пиксели, ветка понимания генерирует специальный дискретный токен передачи управления. После этого генеративный поток производит рендеринг на основе накопленного общего состояния. Обучение объединяет предсказание следующего токена для дискретных последовательностей сопоставлением потоков для непрерывных результатов.

Практические эффекты конструкции

Подобный подход дает важные технические преимущества. Ограничительные рамки (bounding boxes) выводятся как координатные токены без привлечения отдельного детектора. Первый кадр видеоролика повторно использует внутриконтекстное представление картинки, избегая повторного кодирования копии.

Скорость работы: базовая версия против дистиллированной

Базовая модификация выдает видеопоток со скоростью 0.79x от реального времени в медианном значении, а воспроизводимый стрим запускается примерно через 6 секунд. Команда зафиксировала результат в 7.0 секунд до формирования первого клипа, тогда как условный мультиагентный пайплайн тратит на это 13.8 секунд.

Дистиллированный вариант сокращает процедуру шумоподавления с 99 шагов до 8, причем падение качества заявлено как минимальное. Он выдал отрезок длиной 5.3 секунды примерно за одну секунду. Во внутренних испытаниях разработчиков этот вариант продемонстрировал показатели быстрейших специализированных графических моделей и стал быстрейшим решением по генерации первого текстового токена. Стоит отметить, что это внутренние замеры вендора, а не независимые бенчмарки.

Мировая модель и робототехника

Rho-1 способна непрерывно стримить ролики клип за клипом. Новые инструкции поступают через ветку понимания и обновляют состояние прямо в процессе генерации. Авторы показали пример развилки одного инди-ввода на два сценария продолжения с поворотом налево или направо.

В сфере робототехники управляющие воздействия и будущие кадры декодируются из того же латентного состояния. Симуляционный эпизод LIBERO демонстрирует, как модель передает сразу 7 каналов управления. Чтобы преодолеть дефицит данных телеоперационного логирования, создатели задействовали модель обратной динамики (Inverse Dynamics Model), которая вычисляет сигналы управления на основе исходного видеоряда.

Сравнение с аналогами

По состоянию на октябрь 2026 года на рынке сформировался класс омниканальных решений нового поколения. Если брать экосистемные параметры, то разработка Reka с ее 19 миллиардами параметров предлагает нативную генерацию видео с ограничением 672×384 и непрерывное руление в реальном времени. Аналогичные открытые инициативы вроде ByteDance BAGEL или BAAI Emu3.5 предлагают открытые веса по лицензии Apache 2.0, но не имеют нативной поддержки робототехнических действий и непрерывных симуляций в том же объеме, что и превью от Reka.

Итоги

Инновационный релиз подтверждает тренд на отказ от сложных многокомпонентных конвейеров в пользу единых архитектур. Модель объединяет обработку текста, графики, видео и моторных навыков в рамках одного общего контекстного окна. Несмотря на статус исследовательского превью без публичных весов и API на текущий момент, подобный подход задает вектор развития для всей индустрии мультимодального искусственного интеллекта.

01.