跳转至

视频与交互式世界模型

视频世界模型把“未来会怎样”直接表现为可看的画面。它们和普通视频生成最大的区别是:它们应该对动作有响应,能在交互中保持一致,并支持智能体训练或评估。


1. 普通视频生成 vs 世界模型

类型 输入 输出 关键能力
视频生成 文本/图片/视频片段 一段视频 画面质量、运动合理
视频预测 历史帧 未来帧 时序预测
交互式世界模型 历史帧 + 动作/指令 下一帧或未来状态 动作可控、因果响应、长期一致

世界模型更接近:

\[ p(o_{t+1} \mid o_{\le t}, a_t) \]

而不是单纯:

\[ p(o_{1:T} \mid \text{text}) \]

1.1 开环视频预测 vs 闭环世界模型

设置 模型看到什么 是否会被自己的输出影响
Open-loop prediction 给定历史帧,一次生成未来
Autoregressive rollout 每次用自己生成的帧继续预测
Closed-loop simulation 智能体看生成结果,再输出动作 是,而且动作会改变未来

真正难的是 closed-loop。因为模型一旦生成错,智能体会根据错误画面做动作,错误继续放大。


2. 动作条件预测

交互式世界模型必须回答:

如果我向左走,画面会怎样?
如果我打开门,门会不会打开?
如果车加速,周围场景会如何变化?

这要求模型学到动作和未来之间的因果关系。

显式动作

数据里有真实动作标签:

  • 机器人关节命令。
  • 自动驾驶方向盘/油门/刹车。
  • 游戏键盘鼠标输入。

隐式动作

互联网视频往往没有动作标签。Genie 这类模型会学习 latent action:从相邻视频帧中推断出“导致变化的动作表示”。

2.1 动作如何进入视频模型?

常见方式:

动作类型 编码方式 例子
离散动作 action token 游戏方向键、按钮
连续动作 MLP 编码成向量 机器人末端增量、车辆控制
语言指令 文本 token “向左走”“打开门”
轨迹条件 一串 waypoint/action chunk 自动驾驶未来路线

融合方式:

视频 token + 动作 token -> Transformer/Diffusion Model -> 下一帧 token

或:

视频 latent + 动作 embedding -> dynamics model -> 下一 latent

2.2 为什么动作条件是世界模型的分水岭?

没有动作条件的视频模型只能回答:

按照过去趋势,未来可能长什么样?

有动作条件的世界模型才能回答:

如果我现在这样做,未来会怎样?

后者才支持智能体规划。


3. Genie:从视频学可交互环境

Genie 的关键点:

  • 从无标注互联网视频学习。
  • 使用视频 tokenizer 压缩帧。
  • 学 latent action model。
  • 用自回归 dynamics model 生成下一步。
  • 目标是让用户或智能体逐帧控制生成环境。

Genie 说明:即使没有真实动作标签,也可能从视频中学到一种可控的动作空间。

3.1 Genie 的三个部件

可以把 Genie 拆成:

部件 作用
Video tokenizer 把视频帧压缩成离散 token
Latent action model 从相邻帧推断动作 token
Dynamics model 根据过去视频 token 和动作 token 预测下一帧 token

简化流程:

帧 o_t, o_{t+1}
  -> tokenizer 得到视频 token
  -> latent action model 推断 a_t
  -> dynamics model 学 p(o_{t+1 token} | o_{\le t token}, a_t)

推理时,用户选择 latent action,模型生成下一帧,于是形成交互。

3.2 Latent Action 的难点

latent action 不一定对应人类可解释动作:

action 3 可能表示“角色向右上移动一点”
action 7 可能表示“视角轻微旋转并前进”

问题在于:

  • latent action 是否稳定?
  • 是否能组合成长程行为?
  • 是否能和真实机器人/游戏动作对齐?
  • 是否会把相机运动和物体运动混在一起?

Genie 2/3 的意义

Genie 2 把 2D 交互环境扩展到更丰富的 3D 世界;Genie 3 进一步强调实时交互、较长时间一致性和开放式世界模拟。它们代表了“foundation world model”路线:用大规模视频训练一个能生成多样交互世界的通用模型。


4. 自动驾驶世界模型

自动驾驶很适合世界模型,因为真实道路测试昂贵且危险。

GAIA-1

GAIA-1 把视频、文本和动作作为输入,生成可控驾驶场景。它的重点是:

  • 建模道路场景未来。
  • 控制自车行为和场景属性。
  • 生成多种可能情况,用于自动驾驶训练和评估。

自动驾驶世界模型常见输入:

历史相机图像 / LiDAR / 地图 / 文本条件 / 自车动作

常见输出:

未来多相机视频 / BEV 表征 / 其他车辆轨迹 / 风险事件

UniSim

UniSim 类工作关注闭环传感器模拟:从真实行车记录中构建可修改场景,让自动驾驶系统在改变轨迹、加入车辆或行人后,仍能看到合理的相机/LiDAR 输入。

关键价值:

  • 生成真实世界很少出现的危险场景。
  • 支持 closed-loop evaluation。
  • 让规划器和环境互相影响,而不是只回放旧数据。

4.1 自动驾驶为什么强调闭环?

离线回放只能看到真实人类当时走过的轨迹。如果自动驾驶系统选择了另一条轨迹,原始日志里没有对应传感器画面。

世界模型要补这个空白:

如果自车向左变道,其他车辆和传感器画面会怎样?

这就是 closed-loop simulation 的价值。


5. 机器人世界模型

机器人视频世界模型通常输入:

  • 初始图像。
  • 语言指令。
  • 动作轨迹。
  • 机器人状态。

输出:

  • 未来视频。
  • 未来物体状态。
  • 成功概率或价值。

用途:

  • 预测动作是否会成功。
  • 为策略生成合成数据。
  • 在真实执行前筛掉危险动作。
  • 做 sim-to-real 或 real-to-real 场景转换。

5.1 机器人视频预测的难点

难点 为什么难
接触 物体是否被抓住取决于很小的几何误差
遮挡 手爪靠近目标时经常挡住物体
多未来 同一推力可能导致滑动、翻倒或不动
低频视频 vs 高频控制 视频 10-30Hz,控制可能 50-1000Hz
真实物理 摩擦、柔性、碰撞很难只靠像素学准

所以机器人世界模型通常不能只靠视频,还会加入:

  • 机器人关节状态。
  • 末端位姿。
  • 夹爪状态。
  • 深度/点云。
  • 任务语言或目标图像。

6. Cosmos:Physical AI 的世界基础模型

NVIDIA Cosmos 系列把世界模型定位为 Physical AI 的基础设施。Cosmos 平台包含视频 tokenizer、预训练世界基础模型、后训练示例和数据处理流程。Cosmos 3 进一步把语言、图像、视频、音频和动作统一到一个 omnimodal world model 中。

学习 Cosmos 时要关注:

  • 世界模型不只是视频生成,而是服务机器人、自动驾驶和物理智能。
  • 统一多模态输入输出可以同时做理解、生成、仿真和动作。
  • 开源模型和工具链降低了做物理 AI 世界模型的门槛。

6.1 Foundation World Model 的核心能力

可以用四个问题判断:

  • 能否生成未来视频?
  • 能否接受动作或轨迹条件?
  • 能否保持长期空间一致性?
  • 能否用于下游智能体训练、规划或评估?

如果只能根据文本生成漂亮视频,但不能根据动作改变未来,它更像视频生成模型;如果能被智能体交互控制,才更接近世界模型。


7. 视频世界模型的评估

不能只看画面漂不漂亮。更重要的是:

指标 说明
动作可控性 同一初始帧下,不同动作是否产生合理差异
长期一致性 场景结构和物体身份是否保持
物理合理性 重力、碰撞、遮挡、接触是否合理
反事实能力 能否模拟没发生过但可能发生的动作
闭环可用性 智能体在其中训练/评估是否有意义
分布外泛化 新场景、新物体、新动作是否可靠

7.1 最小评估实验

你可以设计一个小 grid game:

输入:过去 4 帧 + 动作 up/down/left/right
输出:下一帧

评估:

  • 同一历史帧下,换不同动作,输出是否不同?
  • 连续 rollout 20 步,角色是否还在合法格子里?
  • 撞墙动作是否真的停住?
  • 目标物体是否保持身份不变?

这个玩具实验能暴露大多数视频世界模型问题。


8. 局限与风险

8.1 画面真实不代表物理真实

视频可能看起来合理,但接触力、摩擦、质量、碰撞细节可能是错的。机器人控制不能只相信画面。

8.2 长期 rollout 会漂移

自回归生成会把误差一帧帧累积,最后可能出现物体身份丢失、几何变形、因果关系错乱。

8.3 动作空间可能不稳定

latent action 如果没有和真实机器人动作对齐,就很难直接用于实机控制。

8.4 评估很难

世界模型生成的是“可能的未来”,但真实世界只有一个发生的未来。如何判断模型是否覆盖了合理多样性,是开放问题。

8.5 视频模型常见失败模式

失败模式 表现
物体身份漂移 红方块变成蓝方块,角色形状变化
动作不响应 不管按什么键,未来差不多
物理穿模 物体穿过墙、桌子、手爪
长期模糊 前几帧清楚,越往后越糊
记忆丢失 之前出现过的目标突然消失
奖励错觉 画面好看,但任务状态不对

9. 学习建议

  1. 先理解普通视频预测。
  2. 再加入 action condition。
  3. 再看 latent action:没有动作标签时如何学习可控性。
  4. 最后看 foundation world model:Genie、Cosmos、自动驾驶和机器人模拟器。