牛津大学等提出MotionJEPA:破解世界模型慢特征偏置,时序动态全保留
原创 CV君 2026-09-25 23:50 江苏
差分辅助自监督,动态要素尽保留
联合嵌入预测架构(Joint Embedding Predictive Architecture, JEPA)摒弃了繁重的像素级重构损失,直接在高度抽象的潜空间中预测未来演化,被视作构建任务通用型隐空间世界模型(Latent World Models)的核心技术路径之一。然而,现阶段 JEPA 架构普遍存在对缓慢变化特征的强归纳偏置(Slow-Feature Bias),常在训练中主动忽略高频动态要素,造成灾难性的时序特征坍塌。
针对这一瓶颈,牛津大学、vivo 蓝图影像实验室、布朗大学与 Slater Labs 等机构联合提出了 MotionJEPA。该框架的核心贡献在于构建了名为 DISReg(Difference Image and Single image embedding Regularization,时序差分图像与单图嵌入联合正则化器)的新型自监督机制。在无需任何动作标签与像素重构的前提下,该方法兼顾了全局语义与运动细节,使潜表征完整保留场景动态演化,并在存在复杂静态干扰的下游规划任务中取得了显著性能提升。
背景与动机:为什么 JEPA 容易“丢掉运动”?
慢特征偏置与特征抑制机制
标准的 JEPA 训练目标高度依赖自回归的前向潜状态预测,其基本损失形式为最小化未来潜状态 与真实编码 之间的均方误差。由于缺乏像素解码器带来的细粒度约束,为了最快降低预测误差,网络会倾向于走捷径:优先表征场景中变化极其缓慢、最易预测的静态背景或平稳元素,而将快速运动的小物体(如高速移动的球体、机械臂末端)作为难以拟合的高频随机量直接从潜空间中过滤抹除,这种现象被称为特征抑制(Feature Suppression)。
如 Figure 1 所示,在经典 Pong(弹球)环境中包含三个核心要素:快速运动的小球、受控的球拍以及变化缓慢的记分板:
基于单图高斯分布正则(SIGReg)的代表性方法 LeWorldModel(LeWM)仅保留了慢变的记分板,而彻底抑制并丢失了小球与球拍;
基于动作逆动力学模块(Inverse Dynamics Module, IDM)的 SMWM 虽能防坍塌,但因依赖动作标签作为监督信号,仅能识别被动作直接控制的球拍,对不受动作直接驱动的小球依然发生了表征坍塌;
相比之下,采用 DISReg 正则的 MotionJEPA 能够完整保留所有要素。
现有防坍塌方案的局限
目前主流的防坍塌机制均无法有效应对这一矛盾:
纯粹的分布正则化:如 LeJEPA 的 SIGReg,仅在批次维度对单张图像嵌入的统计分布进行各向同性高斯约束,完全不具备时间维度的敏感度;若强行在时间维度直接拉平做分布约束(如 LeWM-Flat 或 LeWM-Time),会导致潜空间流形发生严重扭曲与纠缠,显著增加几何曲率。
动作逆动力学模型(IDM):虽能利用两帧潜状态逆推执行的动作,但其严格受限于动作标签的存在,在存在时间延迟、环境自主物理运动或无标注纯视觉视频流下完全失效。
方法详解:DISReg 正则与 MotionJEPA 架构
为了在无需动作监督、不重构像素的前提下平衡静态语义与动态演化,研究团队设计了包含静态项与动态项双重约束的正则化器 DISReg。
架构设计与数据流向
如 Figure 2 所示,整个系统由主干预测通路(蓝色标注)与辅助动态正则通路(绿色标注)组成:
主干编码与预测(Inference Backbone):图像编码器 采用 ViT-Tiny 架构,将输入观测图像 映射为状态隐向量 (维度 )。时序预测器 采用 6 层因果 Transformer,基于历史隐状态与动作自回归推断未来潜状态 。
- 差分编码器(Difference Image Encoder):引入 ,输入相邻连续帧在像素维度的原始差分图 ,提取出时序差分特征 :
- 隐状态差分预测器(Difference Predictor):引入 3 层 MLP 模块 ,以连续两个状态隐向量 的拼接向量作为输入,直接拟合对应的差分嵌入特征:
从 Algorithm 1 的实现逻辑可以看出, 在逼近 时代价函数产生的反向传播梯度,将直接经由 和 回传至底层编码器 。由于差分特征 显式承载了像素变化的物理运动,这迫使主状态嵌入 必须完整编码引起两帧视觉差异的全部动态细节。更关键的是,动态项并未对 本身的几何形状施加人为分布约束,避免了表征流形的非线性扭结。
联合优化目标
为了防止差分向量 自身坍塌为平凡常数,模型引入两组 SIGReg 分布正则,联合损失函数定义如下:
结合 JEPA 的潜状态前向预测误差,得到 MotionJEPA 的最终训练目标:
在全篇实验中,作者团队采用完全固定的超参数配置:。值得注意的是, 与 仅在训练阶段参与梯度反向传播,在下游任务推理或规划时被直接剔除,部署时完全不增加额外的内存与延迟负担。
实验与结果:全方位特征保留与控制规划
评估分为两大部分:通过解耦的合成动力学环境利用高容量残差 MLP 探针(Residual MLP Probe)精确诊断表征坍塌;在叠加强烈静态背景干扰(木纹桌面)的连续控制任务中验证规划成功率。
游戏场景特征坍塌诊断
研究人员设计了三套动力学复杂度递增的基准:Pong、Dino(横版跳跃避障)与 Golf(平面多重动态障碍避障)。表征探针评价指标采用归一化均方误差(NMSE, 视为未坍塌, 代表完全丢失信息)。
如 Table 1 所示,在编码器直接输出的 上:
在 Pong 环境中,原生 LeWM 对小球的 NMSE 高达 0.999(严重坍塌),SMWM 对小球同样坍塌(1.001),而 MotionJEPA 将小球 NMSE 压低至 0.005,全特征平均仅为 0.004。
在复杂的 Golf 环境中,各种基线均对运动障碍杆(bars)发生严重特征抑制(NMSE 均 ),MotionJEPA 是唯一打破抑制限制的模型,达到 0.095,全指标均值仅为 0.061。
观察自回归展开 5 步的预测状态 (Table 1(b)),MotionJEPA 在 Pong、Dino、Golf 上的全要素平均误差分别为 0.036、0.055 与 0.164,在所有对比方法中取得最低误差。
Figure 3 揭示了坍塌发生的动态过程:在 Dino 环境中,LeWM 初始阶段曾短暂捕捉到恐龙运动(NMSE 降至 0.1 左右),但随着训练推进,快速变化的恐龙特征迅速被静态天空与慢变云朵抑制,NMSE 回弹至 1.0 且无法恢复。而 MotionJEPA 在整个训练周期内持续保持了平稳的低探测误差。
潜空间几何特性:更平直的动力学轨迹
好的潜空间表征应具备较低的几何曲率。评测通过对状态空间随机线性插值,计算编码器在潜空间中映射的弧长与弦长之比(Arc length / Chord length,1.0 代表绝对直线)。
Table 2 与 Figure 4 证实:强行在时间维加分布正则的 LeWM-Time* 与 LeWM-Flat* 导致潜表征剧烈扭曲,直线度比值暴增至 20~38;而 MotionJEPA 在保持动态特征的同时,Pong 和 Golf 的直线度比值低至 2.756 和 3.305,保持了极其平滑且近似线性的低曲率几何流形。
静态背景干扰下的下游控制规划
在机器人操作基准 PushT、TwoRoom、Cube 与 Reacher 中,研究团队引入木纹贴图作为静态视觉干扰(Figure 5),采用交叉熵方法(Cross-Entropy Method, CEM)测试闭环规划成功率。
如 Table 3 所示:
25 步规划:原生 LeWM 均值仅 20.4%(在 PushT 和 Reacher 上仅 4.0% 和 5.2%);MotionJEPA 独立模式均值直接拉升至 81.8%;当与 IDM 结合互补时,更进一步创下 86.4% 的平均成功率。
50 步长程规划:在时序误差累积更严苛的长程任务中,原生 LeWM 彻底跌落至 11.8%,而 MotionJEPA 独立模式仍保持 70.3% 的高成功率,在 Reacher 机械臂任务上从 IDM 的 62.0% 提升至 98.0%。
写在最后
MotionJEPA 为自监督世界模型的设计提供了一个清晰而实用的洞见:解决 JEPA 的慢特征偏置,并不一定要在隐空间施加强硬的统计几何约束,也可以通过引入自监督的动态预测任务来完成。利用像素差分图像作为隐式运动参考,既摆脱了对动作标签的依赖,又规避了传统像素级重构导致的过拟合风险,实现了表征丰富度与几何平滑性的兼顾。
对于从事具身智能、隐空间规划及视频自监督表征学习的研究者而言,这种在训练期注入辅助正则、推理期零成本丢弃的设计范式,在复杂真实视觉场景下的世界模型落地中展现出有潜力的工程与理论参考价值。
论文标题: MotionJEPA: Preventing Temporal Feature Collapse by Capturing Visual Changes in Latent Space
研究机构: 英国牛津大学、vivo(vivo Tech Research GmbH / vivo蓝图影像实验室)、德国比勒费尔德大学、Slater Labs、冷泉港实验室、布朗大学、AMI Labs
代码仓库: https://github.com/mkarmann/motion-jepa (已开源)