会上可能听到:“闭环里跑着跑着就飘了。——为什么开环测着好好的?”
它到底是什么意思
rollout 就是:当前状态 → 选动作 → 得到新状态 → 再选动作。AR 生成和 RL 训练都依赖这个过程。
风险是共同的:前一步预测错了,后续状态就偏离了训练分布,模型在没见过的状态上继续生成,误差一路累积。这在 AR 里叫 exposure bias,在闭环 RL 里表现为发散。
这也解释了为什么开环评测看不到这个问题——开环每一步都用数据集里的真实状态喂给模型,模型永远不需要面对「自己刚犯的错」。
机制图解
- 第 1 步偏差很小还在训练分布内
- 第 2 步以错误状态为输入模型没见过这个状态
- 第 3 步偏差放大
- 更远轨迹跑飞开环评测永远看不到这一段
容易搞混的地方
常见误解
误差累积是模型不够强导致的
正确理解
它是 rollout 机制的固有性质——前一步输出会变成后一步输入
常见误解
训练数据够多就能避免
正确理解
专家数据里没有「开歪了怎么修回来」的样本,要靠数据增强或闭环训练
看懂之后可以追问
- 模型见过「自己犯错之后的状态」吗?训练数据里有恢复类的样本吗?纯专家数据里没有「开歪了怎么修回来」的样本。这一问指向数据增强或闭环训练的必要性。
- 规划时域内,误差在第几秒开始明显放大?把抽象的「会累积」变成具体的时间点,就能定出重规划频率,也能判断长时域轨迹哪一段其实不可信。
沿着主线继续
先知道
- 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。
接着看
- 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。
出处:课程学习总纲 总纲 §3.4、§6.2