← 术语图鉴

术语 · 轨迹生成

逐步展开与误差累积

Rollout / Exposure Bias

策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。

会上可能听到:“闭环里跑着跑着就飘了。——为什么开环测着好好的?”

它到底是什么意思

rollout 就是:当前状态 → 选动作 → 得到新状态 → 再选动作。AR 生成和 RL 训练都依赖这个过程。

风险是共同的:前一步预测错了,后续状态就偏离了训练分布,模型在没见过的状态上继续生成,误差一路累积。这在 AR 里叫 exposure bias,在闭环 RL 里表现为发散。

这也解释了为什么开环评测看不到这个问题——开环每一步都用数据集里的真实状态喂给模型,模型永远不需要面对「自己刚犯的错」。

机制图解

  1. 第 1 步偏差很小还在训练分布内
  2. 第 2 步以错误状态为输入模型没见过这个状态
  3. 第 3 步偏差放大
  4. 更远轨迹跑飞开环评测永远看不到这一段
开环每一步都喂真实状态,模型不需要面对「自己刚犯的错」——这就是开环好看、闭环发散的原因。

容易搞混的地方

常见误解

误差累积是模型不够强导致的

正确理解

它是 rollout 机制的固有性质——前一步输出会变成后一步输入

常见误解

训练数据够多就能避免

正确理解

专家数据里没有「开歪了怎么修回来」的样本,要靠数据增强或闭环训练

看懂之后可以追问

  1. 模型见过「自己犯错之后的状态」吗?训练数据里有恢复类的样本吗?纯专家数据里没有「开歪了怎么修回来」的样本。这一问指向数据增强或闭环训练的必要性。
  2. 规划时域内,误差在第几秒开始明显放大?把抽象的「会累积」变成具体的时间点,就能定出重规划频率,也能判断长时域轨迹哪一段其实不可信。

先知道

  • 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。

接着看

  • 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。

出处:课程学习总纲 总纲 §3.4、§6.2