会上可能听到:“我们的 token 用的是 acc 和 yaw_rate。——为什么不用轨迹点?这个选择影响什么?”
它到底是什么意思
四种常见设计各有取舍:轨迹点 token 直观但序列长、误差累积重;acc/yaw_rate 学习难度低、积分平滑、dyaw 抖动小,但急加减速时动作分布稀疏;dx/dy/dyaw 贴近几何、极端场景更真实,但噪声会被几何放大、dyaw 抖动大;FAST 那类专门的 action tokenizer 控制接口更紧凑,但需要验证物理可执行性。
核心认知:tokenizer 不是数据预处理的小细节,而是策略模型的控制接口。差的 tokenization 会让模型看起来会 next-token prediction,落到连续控制时却抖动、延迟、误差累积。
机制图解
「下一步」用什么表示
acc / yaw_rate接近控制量 · 学习容易 · 积分平滑;但急加减速时动作分布稀疏
dx / dy / dyaw贴近几何 · 极端场景更真实;但噪声被放大,解码后 yaw 抖
容易搞混的地方
常见误解
token 设计是数据预处理的细节
正确理解
它是策略模型的控制接口,选错了模型指标正常但开起来抖
常见误解
哪种 token 更好有标准答案
正确理解
各有失效场景:acc/yaw_rate 怕急加减速,dx/dy/dyaw 怕噪声放大
看懂之后可以追问
- 急加减速场景下这套 token 的分布是不是很稀疏?那类场景实测表现如何?acc/yaw_rate 方案的已知弱点正在这里。这一问能提前锁定需要专项测试的场景。
- 解码回轨迹之后,yaw 抖动实测多大?乘客能感知到吗?dx/dy/dyaw 方案的噪声放大直接变成体感问题。指标层面可能完全正常。
沿着主线继续
先知道
- 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。
接着看
- 逐步展开与误差累积——策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。
相关论文
- FAST:面向视觉-语言-动作模型的高效动作词元化——tokenizer 即控制接口
出处:课程学习总纲 总纲 §6.2