会上可能听到:“下一代要上 VLA。——它比现在的端到端多了什么?”
它到底是什么意思
端到端解决「从场景到轨迹」,VLA 想解决的是「从语义意图到轨迹」——比如理解「前面在修路」「那是校车」这类需要世界知识的判断。
代价是量产验证链路在所有方案里最长:语义理解的失败模式比几何感知更难穷举,也更难写进评测集。
机制图解
- 01视觉输入看见「前方锥桶 + 施工牌」
- 02语义理解理解「这是施工区,要绕」
- 03统一表征
- 04动作输出轨迹
容易搞混的地方
常见误解
VLA 就是给车装个大语言模型
正确理解
关键是视觉、语义、动作在同一个框架里,而不是外挂一个会说话的模块
常见误解
语义理解错了会报错
正确理解
它通常不报错,只会给出一个自信而错误的动作——所以兜底机制比模型本身更关键
看懂之后可以追问
- VLA 带来的具体是哪一类场景的提升?能不能给两个现在解决不了的 case?VLA 容易变成技术叙事。要求给出具体失败 case,才能判断它是不是当前阶段该投的方向。
- 语义理解出错时怎么兜底?谁来判定它理解错了?语义错误往往不会报错,只会给出一个自信而错误的动作,兜底机制比模型本身更关键。
沿着主线继续
先知道
- 一段式——感知、预测、规划在统一表征里联合优化,直接输出轨迹——上限更高,但难 debug、难闭环验证。
出处:课程学习总纲 总纲 §3.1、§4.2