跳转至

论文阅读:VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation

https://arxiv.org/abs/2307.15818

总览

VLA-OPD:通过 On-Policy Distillation,把 VLA 模型的离线 SFT 和在线 RL 连接起来

OPD 是什么,离线 SFT 是什么?

  • VLA: Vision Language Action, 视觉语言动作模型,机器人根据图像和语言指令输出动作
  • OPD: On-Policy Distillation,在学生模型自己实际到达的状态上,让教师模型给监督信号
  • Reverse KL
  • (离线)SFT: Offline Supervised Fine-Tuning,用收集好的静态专家数据,对模型进行监督微调

(离线)SFT

SFT: 监督微调 Supervised Fine Tuning

...

这篇论文的核心:VLA 后训练方法

一个预训练好的 VLA 模型已经有一些通用能力了,但部署到具体机器人任务时还不够可靠,那后续应该怎么训练他,才能又快又稳又不遗忘原来的能力?