典型模型与论文路线¶
学 VLA 不建议只追最新模型名,而要看每个模型解决了哪一个关键问题:数据规模、动作表示、连续控制、跨机器人泛化、端侧部署或长程推理。
1. 时间线¶
| 时间 | 模型/工作 | 关键贡献 |
|---|---|---|
| 2022 | RT-1 | 用 Transformer 学真实机器人控制,强调数据规模和任务多样性 |
| 2023 | RT-2 | 把 VLM 接到机器人动作,提出典型 VLA 范式 |
| 2023 | Open X-Embodiment / RT-X | 汇总多机器人数据,推动跨机器人策略学习 |
| 2024 | Octo | 开源通用机器人策略,可用少量数据微调到新机器人 |
| 2024 | OpenVLA | 开源 7B VLA,动作 token 路线的代表 |
| 2024/2026 | pi0 | 基于 VLM + flow matching 的连续动作 VLA |
| 2025 | FAST | 用频域动作 tokenization 改进高频灵巧动作 |
| 2025 | SmolVLA | 面向低成本硬件和社区数据的轻量 VLA |
| 2025 | GR00T N1 | 面向人形机器人的双系统 VLA |
| 2025 | Gemini Robotics / 1.5 | 强调具身推理、长程任务和跨 embodiment |
| 2026 | LeRobot | 端到端机器人学习工具链,降低采集和训练门槛 |
2. RT-1:机器人 Transformer 的起点¶
RT-1 的核心价值是证明:机器人控制也可以从更大、更多样的数据中获益。它还不是今天意义上最完整的 VLA,但它奠定了“用 Transformer 学机器人策略”的路线。
重点读:
- 如何把图像、语言和动作组织成序列。
- 数据规模、模型规模、任务多样性如何影响泛化。
- 为什么机器人数据比互联网文本更难收集。
适合解决的问题:
机器人策略能不能像视觉/语言模型一样从大规模数据中获得可迁移能力?
3. RT-2:VLA 范式成型¶
RT-2 的关键思想是:把机器人动作也表示成 token,让 VLM 既能回答自然语言,也能输出动作。
它的重要性在于:
- 使用互联网视觉语言预训练知识增强机器人泛化。
- 把动作放进和语言相似的生成格式里。
- 展示了语义推理对机器人任务的帮助。
适合重点看:
- 动作如何编码成文本 token。
- 为什么 Web-scale VLM 知识能帮助机器人理解新指令。
- 语义泛化和真实控制之间的连接。
4. Open X-Embodiment:数据标准化与跨机器人¶
Open X-Embodiment 的价值在数据层。它把不同机构的机器人数据统一起来,用来训练跨 embodiment 的策略。
学习它时重点不是记住数据集大小,而是理解这些挑战:
- 不同机器人自由度不同。
- 相机视角不同。
- 动作空间不同。
- 任务和语言标签不同。
- 数据分布不均衡。
这也是为什么 VLA 需要动作归一化、动作 tokenizer、motion transfer 或 robot-specific adapter。
5. Octo:开源通用策略¶
Octo 是一个开源 generalist robot policy,强调:
- 能用语言指令或目标图像作为条件。
- 能微调到新的传感器和动作空间。
- 在标准消费级 GPU 上也能做一定实验。
适合新手学习:
- 通用机器人策略如何组织数据和模型。
- 如何做少量 in-domain 数据微调。
- 和 OpenVLA 的自回归动作 token 路线有什么区别。
6. OpenVLA:开源 VLA 主干¶
OpenVLA 是学习 VLA 结构的重点模型。它的特点:
- 7B 参数。
- 基于 Llama 2。
- 视觉编码器融合 DINOv2 和 SigLIP。
- 使用大规模真实机器人演示数据训练。
- 支持 LoRA 微调和量化部署。
适合精读:
action_tokenizer:动作如何离散化。- 数据 pipeline:如何从机器人轨迹构造训练样本。
- 微调脚本:如何用少量新任务数据适配。
- 推理流程:模型输出如何变成机器人动作。
读 OpenVLA 的顺序
先读论文摘要和方法图,再读数据处理和 action tokenizer,最后看训练脚本。不要一上来陷进大模型工程细节。
7. pi0:Flow Matching 连续动作路线¶
pi0 代表了另一条非常重要的路线:基于预训练 VLM 获取语义能力,再用 flow matching 生成连续动作。
它关注的问题是:
- 灵巧任务需要更平滑、更高频的连续控制。
- 单臂、双臂、移动操作等多平台任务需要更通用的策略。
- 机器人基础模型应能通过微调快速学习新技能。
和 OpenVLA 对比:
| 维度 | OpenVLA | pi0 |
|---|---|---|
| 动作形式 | 离散 token | 连续动作/flow |
| 强项 | 结构清晰、开源易读、微调友好 | 高频、灵巧、连续控制 |
| 学习重点 | action tokenizer、VLM 到动作 token | flow matching、动作专家、连续轨迹 |
8. FAST:动作 tokenization 的升级¶
普通 action tokenization 是逐维、逐时刻分箱。FAST 的思路是把动作序列转到频域再压缩,减少 token 长度,同时保留动作轨迹形状。
适合理解:
- 为什么高频动作不适合简单 binning。
- 为什么动作 token 不只是“把数值离散化”。
- 动作表示本身可以成为一个独立研究方向。
9. SmolVLA:低成本实践路线¶
SmolVLA 面向“普通人也能训练和部署”的 VLA:
- 参数量更小。
- 依赖社区数据和低成本机器人。
- 支持单 GPU 训练,甚至面向 CPU/消费级 GPU 推理。
- 使用异步推理,把感知/动作预测和动作执行解耦。
如果你的目标是先跑起来,SmolVLA/LeRobot 通常比直接啃大模型更友好。
10. GR00T N1 与 Gemini Robotics:双系统与具身推理¶
GR00T N1¶
GR00T N1 面向人形机器人,采用双系统架构:
- System 2:视觉语言模块,负责理解环境和指令。
- System 1:diffusion transformer,负责实时生成动作。
这种结构适合人形机器人,因为全身控制和双臂操作需要高频动作,而高层语义推理不一定需要每一毫秒都运行。
Gemini Robotics¶
Gemini Robotics 强调:
- 基于 Gemini 的多模态理解。
- 直接控制机器人完成复杂操作。
- Gemini Robotics-ER 负责具身推理,例如空间理解、抓取预测、轨迹理解。
- Gemini Robotics 1.5 进一步强调“先思考再行动”和 motion transfer。
学习价值:
- 了解闭源前沿系统关注什么。
- 理解 VLA 不只是短程抓取,还会走向长程任务规划、进度判断和可解释行为。
11. 新手阅读顺序¶
建议按下面顺序读:
- RT-1:理解机器人 Transformer 和数据规模。
- RT-2:理解 VLA 的基本范式。
- Open X-Embodiment:理解数据和跨机器人难点。
- OpenVLA:精读开源 VLA 的动作 token 与微调。
- Octo/SmolVLA:学习更容易实践的开源策略。
- pi0/FAST:理解连续动作与高频动作表示。
- GR00T/Gemini Robotics:了解双系统、具身推理和前沿趋势。