跳转至

世界模型(World Model / WAM)

世界模型是智能体对环境的内部模拟器:它学习“现在是什么状态”“采取一个动作后会发生什么”“未来可能得到什么结果”,再用这些预测来规划、决策和学习。


一句话理解

如果 VLA 关注:

看见图像 + 听懂指令 -> 输出动作

世界模型关注的是:

当前观测 + 当前动作 -> 预测未来会怎样

更形式化地说,世界模型学习:

\[ p_\theta(s_{t+1}, o_{t+1}, r_t \mid s_t, a_t) \]

其中 \(s_t\) 是内部状态,\(o_t\) 是观测,\(a_t\) 是动作,\(r_t\) 是奖励或任务反馈。智能体可以在真实世界行动前,先在模型里“想象”很多种未来,然后选择更好的动作。

最重要的直觉

世界模型不是普通视频生成器,也不是单纯的物体识别器。它必须关心“动作会如何改变世界”,因为智能体要靠它做决策。


现有规划是否合理?

你原来的笔记把世界模型分成四派:抽象表征、显式 3D 表征、隐空间表征、视频表征。这个分类很有价值,但还需要补三块:

  1. 从 RL 角度补基础:状态、动作、转移模型、奖励模型、规划和 model-based RL。
  2. 从训练目标补细节:像素预测、隐空间预测、JEPA 特征预测、diffusion/flow 视频预测各自优化什么。
  3. 从决策闭环补实践:模型训练好后,如何用 MPC、CEM、MCTS、想象 rollout、actor-critic 来选择动作。

整理后更适合用下面这个学习框架:

路线 代表方法 重点问题
隐空间动力学 World Models、PlaNet、Dreamer、TD-MPC2 如何压缩观测并在 latent state 中预测未来
JEPA 表征 I-JEPA、V-JEPA 如何预测高层语义特征,而不是重建每个像素
显式 3D/空间模型 NeRF、3D Gaussian、Occupancy、World Labs 如何保持几何一致性和空间可编辑性
生成式视频世界 Genie、GAIA-1、UniSim、Cosmos 如何生成可交互、动作可控的未来画面
结构化模型 物体槽、场景图、粒子/图网络 如何利用对象、关系和物理结构提升泛化

世界模型的基本闭环

graph LR
    A[真实环境] -->|观测 o_t| B[编码器]
    B --> C[内部状态 s_t]
    C --> D[动力学模型]
    E[动作 a_t] --> D
    D --> F[预测未来状态/观测/奖励]
    F --> G[规划或策略学习]
    G --> H[选择动作]
    H --> A

一个完整世界模型通常包含:

模块 作用
表征模型 把图像、语言、状态压缩成内部状态
动力学模型 预测动作导致的状态变化
观测模型 可选,把 latent state 解码成图像或其他观测
奖励/价值模型 预测任务收益,帮助选择动作
规划器/策略 在模型里 rollout 多种未来,选择动作

关键部件速查

部件 必须学会什么
MDP/POMDP 状态、观测、动作、奖励、转移概率的区别
转移模型 one-step prediction 和 multi-step rollout 为什么不同
Latent State 为什么要压缩图像,什么信息必须保留
VAE/RSSM prior、posterior、KL、重建和奖励预测如何一起训练
Imagination Dreamer 如何在模型里生成轨迹训练 actor/critic
MPC/CEM 如何在模型里搜索动作序列,并只执行第一步
JEPA 为什么预测 embedding 能避免像素级细节负担
3D/对象表征 为什么几何一致性和物体关系对机器人重要
视频世界模型 动作条件、latent action、闭环生成为什么关键

知识地图

模块 你要搞懂的问题 对应笔记
基础概念 世界模型和 model-based RL 到底是什么? 基础概念
隐空间动力学 VAE/RSSM/Dreamer 如何训练?prior/posterior/KL/imagination 是什么? 隐空间动力学
JEPA 与 3D 为什么有些模型不预测像素,而预测表征、3D 或对象关系? JEPA 与空间表征
视频世界模型 Genie/Cosmos 这类模型如何用 video token、latent action 和动作条件生成未来? 视频与交互式世界模型
规划控制 MPC/CEM/MCTS 如何真正用世界模型选动作?怎么评估和防模型漏洞? 规划、控制与评估
实践路线 新手如何从低维转移模型做到图像 latent 和视频预测? 实践路线

推荐学习路线

阶段 0:补齐前置知识

  • 强化学习基础:MDP、状态、动作、奖励、策略、价值函数。
  • 深度学习基础:自编码器、RNN/Transformer、概率模型、KL 散度。
  • 视觉基础:图像编码、视频帧、光流、深度、3D 表示。
  • 控制基础:MPC、轨迹 rollout、误差累积和安全约束。

阶段 1:理解 model-based RL

  • 学会区分 model-free 和 model-based。
  • 写一个简单环境的转移模型:输入 \((s_t,a_t)\),预测 \(s_{t+1}\)
  • 用预测模型做 5 到 20 步 rollout,看误差如何累积。
  • 理解为什么世界模型既可以用于规划,也可以用于训练策略。

阶段 2:学习隐空间世界模型

  • 读 World Models,理解 VAE + RNN + Controller。
  • 读 PlaNet,理解 latent dynamics 和在线规划。
  • 读 Dreamer,理解在想象轨迹中训练 actor-critic。
  • 对比 TD-MPC2,理解 latent planning 和大规模多任务控制。

阶段 3:学习表征路线

  • 学像素预测为什么昂贵:未来有很多细节不影响决策。
  • 学 JEPA:预测 embedding,而不是重建图像。
  • 学显式 3D 表征:NeRF、3D Gaussian、occupancy、scene graph。
  • 思考:什么时候需要高保真渲染,什么时候只要任务相关状态?

阶段 4:学习生成式世界模拟器

  • 读 Genie:无动作标签的视频如何学出 latent action。
  • 读 GAIA-1/UniSim:自动驾驶和真实传感器模拟。
  • 读 Cosmos:把语言、图像、视频、音频、动作接到同一个 physical AI 框架。
  • 比较视频生成和可交互模拟:后者必须对动作有因果响应。

阶段 5:做自己的最小闭环

建议路线:

  1. 从 GridWorld 或 CartPole 训练一个小转移模型。
  2. 用 CEM/MPC 在模型里搜索动作。
  3. 扩展到图像输入:用 autoencoder 得到 latent state。
  4. 尝试 Dreamer 风格的 imagined rollout。
  5. 再看 Genie/Cosmos 这种大规模世界模型,不急着复现。

新手最容易混淆的概念

概念 容易误解 正确理解
世界模型 等于视频生成 视频生成只是其中一种表现,关键是动作条件预测
模型预测准 策略一定好 控制需要长期 rollout、奖励估计和分布外鲁棒性
隐空间 黑盒压缩 好的 latent state 应保留决策相关信息
JEPA 不生成画面所以不是世界模型 它预测未来表征,适合忽略无关细节
3D 模型 一定比 2D/latent 好 几何一致性强,但数据、重建和计算成本高
仿真器 和世界模型一样 传统仿真器通常手写物理规则,世界模型从数据中学习

参考资料