← 术语图鉴

术语 · 轨迹生成

动作词元设计

Action Token

「下一步」到底表示什么——不同的 token 定义会改变学习难度、噪声传播和极端场景表现。

会上可能听到:“我们的 token 用的是 acc 和 yaw_rate。——为什么不用轨迹点?这个选择影响什么?”

它到底是什么意思

四种常见设计各有取舍:轨迹点 token 直观但序列长、误差累积重;acc/yaw_rate 学习难度低、积分平滑、dyaw 抖动小,但急加减速时动作分布稀疏;dx/dy/dyaw 贴近几何、极端场景更真实,但噪声会被几何放大、dyaw 抖动大;FAST 那类专门的 action tokenizer 控制接口更紧凑,但需要验证物理可执行性。

核心认知:tokenizer 不是数据预处理的小细节,而是策略模型的控制接口。差的 tokenization 会让模型看起来会 next-token prediction,落到连续控制时却抖动、延迟、误差累积。

机制图解

「下一步」用什么表示

acc / yaw_rate接近控制量 · 学习容易 · 积分平滑;但急加减速时动作分布稀疏
dx / dy / dyaw贴近几何 · 极端场景更真实;但噪声被放大,解码后 yaw 抖
tokenizer 不是预处理细节,是策略模型的控制接口——选错了,模型指标正常但开起来抖。

容易搞混的地方

常见误解

token 设计是数据预处理的细节

正确理解

它是策略模型的控制接口,选错了模型指标正常但开起来抖

常见误解

哪种 token 更好有标准答案

正确理解

各有失效场景:acc/yaw_rate 怕急加减速,dx/dy/dyaw 怕噪声放大

看懂之后可以追问

  1. 急加减速场景下这套 token 的分布是不是很稀疏?那类场景实测表现如何?acc/yaw_rate 方案的已知弱点正在这里。这一问能提前锁定需要专项测试的场景。
  2. 解码回轨迹之后,yaw 抖动实测多大?乘客能感知到吗?dx/dy/dyaw 方案的噪声放大直接变成体感问题。指标层面可能完全正常。

先知道

  • 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。

接着看

  • 逐步展开与误差累积——策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。

相关论文

出处:课程学习总纲 总纲 §6.2