← 术语图鉴

术语 · 架构

视觉-语言-动作模型

VLA (Vision-Language-Action)

把视觉输入、语言/语义桥接和动作输出统一到一个多模态框架,适合更高层的意图和语义条件化。

会上可能听到:“下一代要上 VLA。——它比现在的端到端多了什么?”

它到底是什么意思

端到端解决「从场景到轨迹」,VLA 想解决的是「从语义意图到轨迹」——比如理解「前面在修路」「那是校车」这类需要世界知识的判断。

代价是量产验证链路在所有方案里最长:语义理解的失败模式比几何感知更难穷举,也更难写进评测集。

机制图解

  1. 01视觉输入看见「前方锥桶 + 施工牌」
  2. 02语义理解理解「这是施工区,要绕」
  3. 03统一表征
  4. 04动作输出轨迹
端到端解决「从场景到轨迹」,VLA 想解决「从语义到轨迹」——代价是语义错误不会报错,只会给出一个自信的错误动作。

容易搞混的地方

常见误解

VLA 就是给车装个大语言模型

正确理解

关键是视觉、语义、动作在同一个框架里,而不是外挂一个会说话的模块

常见误解

语义理解错了会报错

正确理解

它通常不报错,只会给出一个自信而错误的动作——所以兜底机制比模型本身更关键

看懂之后可以追问

  1. VLA 带来的具体是哪一类场景的提升?能不能给两个现在解决不了的 case?VLA 容易变成技术叙事。要求给出具体失败 case,才能判断它是不是当前阶段该投的方向。
  2. 语义理解出错时怎么兜底?谁来判定它理解错了?语义错误往往不会报错,只会给出一个自信而错误的动作,兜底机制比模型本身更关键。

先知道

  • 一段式——感知、预测、规划在统一表征里联合优化,直接输出轨迹——上限更高,但难 debug、难闭环验证。

出处:课程学习总纲 总纲 §3.1、§4.2