具身智能领域术语扫盲
VLM
Vision-Language-Model,即视觉语言模型,同时处理图像和文本两种模态信息。
打破视觉和语言之间的壁垒,让 AI 具备跨模态理解能力,这是具身智能的基础:机器人要首先看懂周围的环境,才能进一步行动。
VLM 的技术架构:
由 视觉编码器、投影层(适配器)、大语言模型 组成
-
视觉编码器负责将图像转换成向量表示,通常使用 ViT(Vision Transformer)等预训练视觉模型
-
投影层的作用是把视觉特征映射到语言模型的嵌入空间,让两种模态的信息可以对齐
-
最后大语言模型负责融合视觉和文本信息,生成回答
优势:可以复用训练好了的语言模型,只要额外训练一个相对轻量的投影层,就能让大模型看懂图片
VLA
Vision-Language-Action,视觉语言动作模型,相比于VLM更进一步于“怎么做”
从视觉输入和语言指令中,生成机器人可以执行的动作序列
VLA的技术架构:
在 VLM 的基础上,增加动作头(Action Head)来输出控制信号。一种常见的做法是将动作也token化,把连续的动作值离散成类似单词的token,这样动作生成就变成了和文本一样的自回归过程,另一种做法是用扩散模型来生成连续的动作轨迹,精度更高
目前主流的 VLA 模型还会结合世界模型、强化学习等技术
VLN
Vision-Language Navigation,视觉语言导航,研究如何让智能体根据自然语言指令,在视觉环境中自主导航到达目标位置。
链接语言理解和空间行动的桥梁
VLN 的技术架构:
几个核心模块:视觉编码器提取环境特征、语言编码器理解指令语义、跨模态融合模块对齐两者,然后通过策略网络或规划器生成下一步的行动策略
早期 VLN 采用模块化设计,把导航拆成定位、建图、规划等独立步骤,今年发展处端到端的 VLN 方法(直接用 VLM 或 VLA 统一处理感知和决策,还有引入世界模型,让机器人行动前先想象路径的后果)
WM
World Model,世界模型,预测环境状态的变化,模拟不同动作可能产生的后果
想象能力让行动前先做规划,避免试错成本,让机器人选择最优方案
世界模型的技术架构:
两个核心部分:
- 表征学习:把高维的视觉输入压缩成紧凑的隐状态(latent?)
- 动态预测:学习状态之间的转移规律,给定当前,预测下一个时刻
根据架构不同,WM 可以分成几类:
- RSSM(循环状态空间模型,Dreamer 系列算法的核心)
- JEPA(联合前途预测架构,专注于抽象语义层面的预测)
- 基于 Transformer 的大模型范式
VLX
Vision-Language-Everything
理想