跳转至

VLA技术架构演进

RT-1

解决问题

在 RT-1 之前,机器人学习通常有三个明显问题。 一个任务训练一个模型、训练模型泛化能力弱、Transformer 太慢不容易实时控制。

RT-1 是一套比较明确的固定架构。

技术架构

20260715125341

最近6帧机器人相机图像
          +
自然语言任务指令
USE语言编码器
FiLM条件化的 EfficientNet-B3
每帧产生81个视觉语言Token
TokenLearner:每帧压缩为8个Token
6帧合计48个Token
8层 Decoder-only Transformer
离散动作Token
反量化为机器人控制指令
机器人执行,获得新图像,再次预测
  • USE 只是一个句子编码器,并不是今天意义上的大型语言模型。

  • 其中FiLM-EfficientNet属于一种早期视觉语言融合:语言不是等图像处理完以后才参与决策,而是在视觉特征提取阶段就开始影响模型。 FiLM 可以简单理解为:

h′=γ(l)⊙h+β(l)

其中:

h:当前视觉特征; l:语言指令向量; γ(l)、β(l):由语言指令生成的调节参数。

直观上,如果指令是:“抓取红色罐子”,语言信息就会让视觉网络更关注: 红色区域; 罐状物体; 与抓取有关的边缘和几何特征; 而相对忽略桌面上的其他干扰物。

最终效果

在训练任务上的成功率达到约 97%,模型能够以大约 3 Hz 的频率进行闭环控制。

RT-1 虽然能够泛化,但这种泛化主要还是:对机器人训练数据中已有概念和动作的重新组合。

RT-2

解决问题

RT-1 会控制机器人,但是机器人数据中的知识太少。互联网视觉语言模型懂很多知识,但是不会控制机器人。RT-2把这2者结合起来。

  • 解决方法:使用大型预训练 VLM; 把机器人动作表示成文本 Token; 同时使用互联网视觉语言数据和机器人数据进行 co-fine-tuning。

RT-2 像一种 VLA 改造方法或训练范式: 任何能够接收图像和文本、输出文本 Token 的视觉语言模型,都可以通过动作 Token 化和联合微调,改造成机器人控制模型。

RT-1 使用机器人专用 Transformer 输出动作分类结果,而 RT-2 使用大型 VLM 的文本输出接口生成动作 Token。

技术架构

20260716171434

  • RT-2训练

    图像 + 问题 → 文本答案
               \
                \
                 → 预训练VLM进行联合微调
                /
               /
    机器人轨迹数据
    
    RT-2 没有只拿机器人数据微调 VLM,而是同时保留两类数据。论文中的消融实验显示,只用机器人数据微调,更容易损伤模型原来学到的视觉语言知识;将原始视觉语言数据继续混入训练,可以更好地保留预训练知识并提升机器人泛化能力。

  • RT-2推理

    相机图像 + 指令 → 动作Token序列
                   RT-2模型
                 输出动作Token
                  反Token化
                连续机器人动作
                 真实机器人执行
                  获取下一帧图像
    

最终效果

将互联网知识迁移到了机器人控制,让机器人具备基础语义推理能力。

但是RT-2 从互联网数据中获得的主要是新语义、新物体概念和推理能力,不是新的运动技能。RT-2 论文明确指出,加入互联网数据不会自动产生新的运动方式。机器人动作能力仍然受机器人演示数据覆盖范围限制。