跳转至

具身智能领域术语扫盲

VLM

Vision-Language-Model,即视觉语言模型,同时处理图像和文本两种模态信息。

打破视觉和语言之间的壁垒,让 AI 具备跨模态理解能力,这是具身智能的基础:机器人要首先看懂周围的环境,才能进一步行动。

VLM 的技术架构:

由 视觉编码器、投影层(适配器)、大语言模型 组成

  • 视觉编码器负责将图像转换成向量表示,通常使用 ViT(Vision Transformer)等预训练视觉模型

  • 投影层的作用是把视觉特征映射到语言模型的嵌入空间,让两种模态的信息可以对齐

  • 最后大语言模型负责融合视觉和文本信息,生成回答

优势:可以复用训练好了的语言模型,只要额外训练一个相对轻量的投影层,就能让大模型看懂图片

VLA

Vision-Language-Action,视觉语言动作模型,相比于VLM更进一步于“怎么做”

从视觉输入和语言指令中,生成机器人可以执行的动作序列

VLA的技术架构:

在 VLM 的基础上,增加动作头(Action Head)来输出控制信号。一种常见的做法是将动作也token化,把连续的动作值离散成类似单词的token,这样动作生成就变成了和文本一样的自回归过程,另一种做法是用扩散模型来生成连续的动作轨迹,精度更高

目前主流的 VLA 模型还会结合世界模型、强化学习等技术

VLN

Vision-Language Navigation,视觉语言导航,研究如何让智能体根据自然语言指令,在视觉环境中自主导航到达目标位置。

链接语言理解和空间行动的桥梁

VLN 的技术架构:

几个核心模块:视觉编码器提取环境特征、语言编码器理解指令语义、跨模态融合模块对齐两者,然后通过策略网络或规划器生成下一步的行动策略

早期 VLN 采用模块化设计,把导航拆成定位、建图、规划等独立步骤,今年发展处端到端的 VLN 方法(直接用 VLM 或 VLA 统一处理感知和决策,还有引入世界模型,让机器人行动前先想象路径的后果)

WM

World Model,世界模型,预测环境状态的变化,模拟不同动作可能产生的后果

想象能力让行动前先做规划,避免试错成本,让机器人选择最优方案

世界模型的技术架构:

两个核心部分:

  • 表征学习:把高维的视觉输入压缩成紧凑的隐状态(latent?)
  • 动态预测:学习状态之间的转移规律,给定当前,预测下一个时刻

根据架构不同,WM 可以分成几类:

  • RSSM(循环状态空间模型,Dreamer 系列算法的核心)
  • JEPA(联合前途预测架构,专注于抽象语义层面的预测)
  • 基于 Transformer 的大模型范式

VLX

Vision-Language-Everything

理想

评论