Мой блог
JEPA-Anything: универсальная концепция единой нейросети для 7 научных областей
Подробности изложены в материале первоисточника. Команда исследователей из ведущих мировых лабораторий представила универсальный фреймворк JEPA-Anything. Вместо создания изолированных прогнозных моделей под каждую задачу этот подход применяет единый обучающий алгоритм к совершенно разным типам систем, охватывая сразу семь предметных областей.
Новая архитектура развивает идеи предиктивных архитектур с совместным встраиванием (JEPAs) с помощью специального метода ортогонализации. Я проверил ключевые технические особенности этой разработки, изучил принципы распределения емкости модели и готов разобрать результаты ее тестирования в реальных сценариях.
Какую проблему решает JEPA-Anything?
Классические архитектуры JEPA, включая известные I-JEPA или V-JEPA 2, задействуют контекстный энкодер, целевой энкодер с экспоненциальным скользящим средним и единственный предиктор. На выходе такой модуль выдает единое монолитное целевое представление. Исследователи называют этот нюанс проблемой распределения емкости модели: структуры с высокой дисперсией начинают доминировать в процессе обучения, тогда как более слабые режимы получают противоречивые градиенты.
Из-за подобного перекоса стандартные решения с трудом масштабируются на разнообразные физические и биологические задачи без глубокой переработки структуры. Новая разработка обходит это ограничение за счет принципиально иного распределения латентных векторов, позволяя задействовать единый подход к абсолютно непохожим наборам данных — от анализа одиночных клеток до метеорологического прогнозирования.
Как работает ортогонализация прогнозных факторов (OPF)?
В основу новой методики легло разделение латентной цели шириной $d$ на $K$ изученных подпространств с шириной $р$, где общая размерность рассчитывается как произведение $K$ на $r$. В большинстве тестовых экспериментов исследователи использовали значение $K$, равное 4. Для каждого сформированного фактора выделяется персональный предиктор.
Полученные предсказания по отдельным факторам затем повторно объединяются через псевдообратную матрицу Мура-Пенроуза. На выходе система формирует единое полноценное латентное состояние, которое удобно применять для декодирования, планирования или генерации последовательных прогнозов. Чтобы факторы оставались полезными и не деградировали, разработчики внедрили три типа регуляризации:
- Потеря ортогональности удерживает столбцы внутри каждого проектора ортонормированными и разводит разные проекторы по непересекающимся подпространствам.
- Потеря активности факторов добавляет ограничение на стандартное отклонение для каждой координаты, предотвращая «затухание» отдельных веток.
- Потеря дисперсии энкодера передает прямой сигнал против схлапывания непосредственно в онлайн-энкодер.
Итоговая потеря OPF просто суммируется с базовой функцией потерь конкретной прикладной области. Специальные доменные адаптеры отвечают за токенизацию и работу с энкодерами, а общая библиотека выставляет базовый компонент наружу в виде модуля OrthogonalFactorProjection.
Ортогональность критически важна для стабильного синтеза данных. Так, на задаче CITRIS Interventional Pong несвязанная многоголовая модель с аналогичной емкостью показала число обусловленности на уровне 438,52. Ортогональная модификация достигла показателя 1,00005, сведя пересечение между факторами практически к нулю.
Описанный механизм позволяет эффективно распределять вычислительную нагрузку между независимыми подпространствами, исключая конкуренцию градиентов внутри единого предиктора. Это гарантирует высокую стабильность обучения независимо от специфики входного потока информации.
Какие результаты демонстрирует исследование?
Эффективность фреймворка подтверждена масштабными тестами, разделенными на три ключевые группы. В первой группе терминального считывания на биологических данных нулевой кластеризация PBMC (AvgBIO) поднялась до 0,7752 против 0,7194 у Cell-JEPA. Коэффициент корреляции Пирсона для пертурбаций Нормана вырос с 0,787 до 0,814. Для прогнозирования более чем 1000 клинических событий на платформе UK Biobank средний показатель PRAUC составил 0,718 по сравнению с 0,711 у стандартной модели.
Вторая группа тестов оценивала динамику латентного мира. На задачках Interventional Pong ошибка одиночного вмешательства снизилась на 34,83%. Невидимые комбинированные вмешательства улучшились на 12,90%, а свободный запуск на 6 шагов показал прирост на 8,58%. Модель улучшила зафиксированные метрики на всех 10 сопоставимых задачах динамики, включая бенчмарки CausalWorld, DeepMind Control, PDEBench и WeatherBench2.
В тестах APEBench Burgers ошибка 6-шагового прогноза сократилась примерно на 44,7%, продемонстрировав улучшение на каждом сиде. Для стошаговых молекулярных симуляций с бэкэндом в стиле TrajCast система показала минимальные значения абсолютной и среднеквадратичной погрешности для воды, кварца, парацетамола и бензола.
Результаты планирования оказались смешанными. При сопоставимых параметрах с разницей в пределах 0,3% разработка улучшила показатель возврата методом CEM на окружениях Walker2d и HalfCheetah, в то время как задача Hopper отдала предпочтение классическому подходу JEPA.
Третья группа научного анализа задействовала факторный анализ, который предсказал комбинацию интерлейкина-18 и блокады CD73 в качестве перспективного метода борьбы с опухолями. Лабораторные тесты «in vitro» на совместных культурах, органоидах пациентов и срезах опухолей полностью подтвердили эту гипотезу. Кроме того, латентные орбитальные моды успешно восстановили закон Кеплера с подогнанным наклоном -1,4991 при теоретическом значении -1,5.
Как JEPA-Anything соотносится с другими мировыми моделями?
Если сопоставлять новинку с существующими аналогами вроде V-JEPA 2, DINO-WM, DreamerV3 или TD-MPC2, ключевое отличие кроется в самой структуре целевых представлений. Конкуренты часто опираются на единую латентную цель, категориальные состояния или требуют громоздких циклов обучения с подкреплением в воображаемой среде.
Новый фреймворк оперирует факторизованными и рекомбинированными через псевдоинверсию признаками, демонстрируя гибкость сразу в семи направлениях — от классического компьютерного зрения до прогнозирования физических полей и погодных условий. Публичные чекпоинты модели доступны на специализированной платформе Hugging Face, а исходный код распространяется под лицензией Apache-2.0.
Основные выводы
Рассмотренный подход доказывает, что единая архитектурная концепция способна успешно справляться с задачами из совершенно разных научных дисциплин без переписывания базовых принципов предсказания. Механизм ортогонального факторного разделения эффективно решает проблему конкуренции градиентов внутри предиктора.
Практические тесты подтвердили превосходство такого подхода над стандартными аналогами в задачах динамики и анализа биомедицинских данных. Открытый код и исследовательские чекпоинты открывают широкие возможности для инженеров и исследователей, стремящихся внедрить универсальные пространственные модели в собственные проекты.
