视频再逼真,也不等于懂世界:扩散模型的下一场硬仗

原创 52CV 2026-09-24 23:50 江苏

让 AI 根据一张图片生成视频,已经不是什么新鲜事。

但如果告诉 AI 当前的世界状态,再给它一个动作,它能不能真正推演之后会发生什么?

比如,一辆自动驾驶汽车准备左转,它能否提前“想象”其他车辆的反应?一个机器人准备抓起杯子,它能否预判杯子是否滑动、机械臂是否发生碰撞?

这时,我们讨论的就不再只是“视频生成”,而是一个更大的问题:

AI 能不能在内部构建一个可以预测、交互和推演未来的世界?

这正是 World Model(世界模型)想解决的问题。

围绕这一方向,这篇综述系统梳理了 Diffusion-Based World Models(DWM),试图回答:扩散模型为什么适合世界模型?它已经解决了什么?距离真正模拟现实世界还有多远?

整篇综述的核心可以概括为一句话:

扩散模型已经很擅长生成“看起来像世界”的未来,但要成为真正“可以运行的世界”,还需要解决长期一致性、因果、物理约束、交互和实时性等问题。

图 1|扩散世界模型研究全景:从基础原理、应用场景,到核心能力与未来方向。

近年来,扩散模型在世界模型研究中的占比快速提升,也逐渐成为这一领域最活跃的技术路线之一。

图 2|近年来世界模型研究快速增长,其中扩散模型已占据重要比例,并呈现出进一步增长的趋势。

为什么世界模型开始使用扩散模型?

真实世界的未来往往不止一种。

在一个路口,前车可能直行,也可能刹车;行人可能停下,也可能突然进入道路。

早期预测模型更像是在回答:

“最可能的未来是什么?”

当多个结果都合理时,模型容易把它们“平均”起来。

扩散模型提供了另一种思路。它学习的不是唯一结果,而是:

在当前条件下,未来可能服从怎样的概率分布。

所以它把世界预测从“单点预测”,推进到了“多种可能未来的条件生成”。

图 3|扩散模型通过“加噪—去噪”学习复杂数据分布,为生成多种可能的未来提供基础。

随着这一思路被不断引入自动驾驶、机器人和通用世界模拟,近年来扩散世界模型的代表性工作开始快速涌现,研究方向也从单纯生成逐渐扩展到交互、物理建模和长期预测。

图 4|扩散世界模型近年来快速发展,从早期世界模型逐步扩展到自动驾驶、具身智能和通用交互环境等多个方向。

但模型越来越多,并不意味着“世界模型”这个问题已经解决。

真正关键的,是下面几个问题。

发现一:世界模型和视频生成的分界线,是“动作能不能改变未来”

一段视频可以非常逼真,但这并不意味着它就是世界模型。

真正关键的问题是:

如果输入不同动作,预测的未来会不会相应改变?

同一个场景下,“左转”和“右转”应该产生不同未来。如果动作改变后预测结果几乎不变,模型仍然更接近视频生成器。

真正可用的世界模型需要形成:

观测 → 动作 → 未来预测 → 反馈 → 下一步决策

这样的闭环。

图 5|交互式世界模型形成“观测—动作—未来预测—反馈”的闭环,使智能体能够提前推演不同决策的结果。

发现二:真正困难的不是“这一帧像不像”,而是“十秒后世界还对不对”

扩散模型生成单帧画面的能力很强,但世界模型必须连续向未来预测。

问题在于,每一步的小误差都可能进入下一步,逐渐积累。

最终可能出现:

物体数量变化、身份漂移、空间结构改变,甚至物体在动作发生前就提前运动。

这时,视频可能依然“很好看”,但它已经不是一个可靠的世界。

世界模型首先要求事情发生得对,然后才是画面看起来真。

图 6|长时间 rollout 中,微小预测误差可能不断积累,最终导致物体漂移、数量异常和物理逻辑破坏。

发现三:“看起来符合物理”不等于“真正理解物理”

扩散模型很擅长学习统计规律,因此它可以知道足球通常怎么飞、汽车通常怎么转弯、物体碰撞后画面应该是什么样子。

但这并不代表模型真正掌握了重力、速度、碰撞等物理规律。

它可能学会的是:

“遵守物理规律的世界看起来是什么样。”

而不是:

“这个世界为什么必须这样运行。”

这也是目前世界模型的重要问题——因果推理不足。

真正的世界模型不仅要知道 A 和 B 经常一起发生,还需要理解:

如果做了 A,为什么产生 B?如果换一个动作,未来又会怎样?

图 7|真正可靠的世界模型需要维持一致性如时间一致性和物理一致性,而不仅仅是生成视觉上合理的下一帧。

发现四:真正的世界模型至少需要五种能力

一个扩散世界模型要从“生成器”走向“世界模拟器”,至少需要:

长期演化:长时间预测后仍保持正确逻辑;

多模态融合:同时理解图像、语言、地图、轨迹、LiDAR 和动作;

交互能力:不同动作真正产生不同未来;

时空一致性:物体身份、空间关系和世界状态长期稳定;

多环境泛化:能够应对不同天气、地区、场景和任务。

这五项能力共同决定了:

模型究竟是在生成内容,还是在维护一个持续存在的世界。

发现五:扩散模型最大的优势,也带来了最大的现实瓶颈

扩散模型之所以生成质量高,一个重要原因是它需要多次迭代去噪。

但对于自动驾驶和机器人来说,这也意味着一个直接问题:

慢。

智能体做决策时需要快速模拟多个未来,而传统扩散过程往往需要反复采样。

因此未来的重要方向之一,就是减少采样步骤,通过蒸馏、高效求解器和 consistency-based 方法,让世界模型从“慢慢想象”走向“实时想象”。

同时,视频更长也不等于世界模型更强。

真正重要的不是生成了多少秒,而是:

几十秒之后,人物还是不是同一个人?物体数量是否正确?空间结构有没有漂移?动作和结果之间的因果关系是否还存在?

未来真正需要的是:

更长时间仍然保持正确的世界。

接下来会走向哪里?

未来的世界模型可能不会依赖单一模型解决所有问题。

LLM 可以负责语言、规则和高层规划,扩散模型负责生成和预测复杂世界;强化学习让模型主动探索训练数据中没有出现过的动作;物理模拟器负责提供稳定规则,神经世界模型负责快速生成和泛化。

同时,3D 空间表示、因果建模和闭环数据生成也会越来越重要。

最终可能形成:

数据生成 → 世界模型更新 → 策略训练 → 环境交互 → 新数据生成

这样的持续学习闭环。

从“会生成世界”到“真正拥有世界模型”

过去我们关心图片像不像,后来关心视频像不像。

而世界模型提出了更严格的问题:

如果一个智能体真的生活在这个生成出来的世界里,它能不能依赖这个世界做出正确决策?

扩散模型已经显著提升了复杂、多模态、不确定未来的生成能力,也正在成为自动驾驶、具身智能和通用世界模拟的重要技术底座。

但下一阶段真正决定世界模型能力的,不再只是视觉质量,而是:

因果是否可信、物理是否稳定、长期状态是否一致、动作是否真正可控,以及推演是否足够快。

从“生成一个看起来真实的未来”,到“维护一个能够持续运行的世界”,还有很长的路。

但也正因为如此,Diffusion-Based World Models 才刚刚进入真正值得关注的阶段。

入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向
入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向

跳转微信打开