视频与交互式世界模型¶
视频世界模型把“未来会怎样”直接表现为可看的画面。它们和普通视频生成最大的区别是:它们应该对动作有响应,能在交互中保持一致,并支持智能体训练或评估。
1. 普通视频生成 vs 世界模型¶
| 类型 | 输入 | 输出 | 关键能力 |
|---|---|---|---|
| 视频生成 | 文本/图片/视频片段 | 一段视频 | 画面质量、运动合理 |
| 视频预测 | 历史帧 | 未来帧 | 时序预测 |
| 交互式世界模型 | 历史帧 + 动作/指令 | 下一帧或未来状态 | 动作可控、因果响应、长期一致 |
世界模型更接近:
而不是单纯:
1.1 开环视频预测 vs 闭环世界模型¶
| 设置 | 模型看到什么 | 是否会被自己的输出影响 |
|---|---|---|
| Open-loop prediction | 给定历史帧,一次生成未来 | 否 |
| Autoregressive rollout | 每次用自己生成的帧继续预测 | 是 |
| Closed-loop simulation | 智能体看生成结果,再输出动作 | 是,而且动作会改变未来 |
真正难的是 closed-loop。因为模型一旦生成错,智能体会根据错误画面做动作,错误继续放大。
2. 动作条件预测¶
交互式世界模型必须回答:
这要求模型学到动作和未来之间的因果关系。
显式动作¶
数据里有真实动作标签:
- 机器人关节命令。
- 自动驾驶方向盘/油门/刹车。
- 游戏键盘鼠标输入。
隐式动作¶
互联网视频往往没有动作标签。Genie 这类模型会学习 latent action:从相邻视频帧中推断出“导致变化的动作表示”。
2.1 动作如何进入视频模型?¶
常见方式:
| 动作类型 | 编码方式 | 例子 |
|---|---|---|
| 离散动作 | action token | 游戏方向键、按钮 |
| 连续动作 | MLP 编码成向量 | 机器人末端增量、车辆控制 |
| 语言指令 | 文本 token | “向左走”“打开门” |
| 轨迹条件 | 一串 waypoint/action chunk | 自动驾驶未来路线 |
融合方式:
或:
2.2 为什么动作条件是世界模型的分水岭?¶
没有动作条件的视频模型只能回答:
有动作条件的世界模型才能回答:
后者才支持智能体规划。
3. Genie:从视频学可交互环境¶
Genie 的关键点:
- 从无标注互联网视频学习。
- 使用视频 tokenizer 压缩帧。
- 学 latent action model。
- 用自回归 dynamics model 生成下一步。
- 目标是让用户或智能体逐帧控制生成环境。
Genie 说明:即使没有真实动作标签,也可能从视频中学到一种可控的动作空间。
3.1 Genie 的三个部件¶
可以把 Genie 拆成:
| 部件 | 作用 |
|---|---|
| Video tokenizer | 把视频帧压缩成离散 token |
| Latent action model | 从相邻帧推断动作 token |
| Dynamics model | 根据过去视频 token 和动作 token 预测下一帧 token |
简化流程:
帧 o_t, o_{t+1}
-> tokenizer 得到视频 token
-> latent action model 推断 a_t
-> dynamics model 学 p(o_{t+1 token} | o_{\le t token}, a_t)
推理时,用户选择 latent action,模型生成下一帧,于是形成交互。
3.2 Latent Action 的难点¶
latent action 不一定对应人类可解释动作:
问题在于:
- latent action 是否稳定?
- 是否能组合成长程行为?
- 是否能和真实机器人/游戏动作对齐?
- 是否会把相机运动和物体运动混在一起?
Genie 2/3 的意义¶
Genie 2 把 2D 交互环境扩展到更丰富的 3D 世界;Genie 3 进一步强调实时交互、较长时间一致性和开放式世界模拟。它们代表了“foundation world model”路线:用大规模视频训练一个能生成多样交互世界的通用模型。
4. 自动驾驶世界模型¶
自动驾驶很适合世界模型,因为真实道路测试昂贵且危险。
GAIA-1¶
GAIA-1 把视频、文本和动作作为输入,生成可控驾驶场景。它的重点是:
- 建模道路场景未来。
- 控制自车行为和场景属性。
- 生成多种可能情况,用于自动驾驶训练和评估。
自动驾驶世界模型常见输入:
常见输出:
UniSim¶
UniSim 类工作关注闭环传感器模拟:从真实行车记录中构建可修改场景,让自动驾驶系统在改变轨迹、加入车辆或行人后,仍能看到合理的相机/LiDAR 输入。
关键价值:
- 生成真实世界很少出现的危险场景。
- 支持 closed-loop evaluation。
- 让规划器和环境互相影响,而不是只回放旧数据。
4.1 自动驾驶为什么强调闭环?¶
离线回放只能看到真实人类当时走过的轨迹。如果自动驾驶系统选择了另一条轨迹,原始日志里没有对应传感器画面。
世界模型要补这个空白:
这就是 closed-loop simulation 的价值。
5. 机器人世界模型¶
机器人视频世界模型通常输入:
- 初始图像。
- 语言指令。
- 动作轨迹。
- 机器人状态。
输出:
- 未来视频。
- 未来物体状态。
- 成功概率或价值。
用途:
- 预测动作是否会成功。
- 为策略生成合成数据。
- 在真实执行前筛掉危险动作。
- 做 sim-to-real 或 real-to-real 场景转换。
5.1 机器人视频预测的难点¶
| 难点 | 为什么难 |
|---|---|
| 接触 | 物体是否被抓住取决于很小的几何误差 |
| 遮挡 | 手爪靠近目标时经常挡住物体 |
| 多未来 | 同一推力可能导致滑动、翻倒或不动 |
| 低频视频 vs 高频控制 | 视频 10-30Hz,控制可能 50-1000Hz |
| 真实物理 | 摩擦、柔性、碰撞很难只靠像素学准 |
所以机器人世界模型通常不能只靠视频,还会加入:
- 机器人关节状态。
- 末端位姿。
- 夹爪状态。
- 深度/点云。
- 任务语言或目标图像。
6. Cosmos:Physical AI 的世界基础模型¶
NVIDIA Cosmos 系列把世界模型定位为 Physical AI 的基础设施。Cosmos 平台包含视频 tokenizer、预训练世界基础模型、后训练示例和数据处理流程。Cosmos 3 进一步把语言、图像、视频、音频和动作统一到一个 omnimodal world model 中。
学习 Cosmos 时要关注:
- 世界模型不只是视频生成,而是服务机器人、自动驾驶和物理智能。
- 统一多模态输入输出可以同时做理解、生成、仿真和动作。
- 开源模型和工具链降低了做物理 AI 世界模型的门槛。
6.1 Foundation World Model 的核心能力¶
可以用四个问题判断:
- 能否生成未来视频?
- 能否接受动作或轨迹条件?
- 能否保持长期空间一致性?
- 能否用于下游智能体训练、规划或评估?
如果只能根据文本生成漂亮视频,但不能根据动作改变未来,它更像视频生成模型;如果能被智能体交互控制,才更接近世界模型。
7. 视频世界模型的评估¶
不能只看画面漂不漂亮。更重要的是:
| 指标 | 说明 |
|---|---|
| 动作可控性 | 同一初始帧下,不同动作是否产生合理差异 |
| 长期一致性 | 场景结构和物体身份是否保持 |
| 物理合理性 | 重力、碰撞、遮挡、接触是否合理 |
| 反事实能力 | 能否模拟没发生过但可能发生的动作 |
| 闭环可用性 | 智能体在其中训练/评估是否有意义 |
| 分布外泛化 | 新场景、新物体、新动作是否可靠 |
7.1 最小评估实验¶
你可以设计一个小 grid game:
评估:
- 同一历史帧下,换不同动作,输出是否不同?
- 连续 rollout 20 步,角色是否还在合法格子里?
- 撞墙动作是否真的停住?
- 目标物体是否保持身份不变?
这个玩具实验能暴露大多数视频世界模型问题。
8. 局限与风险¶
8.1 画面真实不代表物理真实¶
视频可能看起来合理,但接触力、摩擦、质量、碰撞细节可能是错的。机器人控制不能只相信画面。
8.2 长期 rollout 会漂移¶
自回归生成会把误差一帧帧累积,最后可能出现物体身份丢失、几何变形、因果关系错乱。
8.3 动作空间可能不稳定¶
latent action 如果没有和真实机器人动作对齐,就很难直接用于实机控制。
8.4 评估很难¶
世界模型生成的是“可能的未来”,但真实世界只有一个发生的未来。如何判断模型是否覆盖了合理多样性,是开放问题。
8.5 视频模型常见失败模式¶
| 失败模式 | 表现 |
|---|---|
| 物体身份漂移 | 红方块变成蓝方块,角色形状变化 |
| 动作不响应 | 不管按什么键,未来差不多 |
| 物理穿模 | 物体穿过墙、桌子、手爪 |
| 长期模糊 | 前几帧清楚,越往后越糊 |
| 记忆丢失 | 之前出现过的目标突然消失 |
| 奖励错觉 | 画面好看,但任务状态不对 |
9. 学习建议¶
- 先理解普通视频预测。
- 再加入 action condition。
- 再看 latent action:没有动作标签时如何学习可控性。
- 最后看 foundation world model:Genie、Cosmos、自动驾驶和机器人模拟器。