会上可能听到:“这版指标提升了 15%。——这是开环测出来的还是闭环?”
它到底是什么意思
开环:状态分布固定,来自数据集;看不到误差累积;训练稳定、样本效率高、可 replay、容易复现。量产里大量使用开环不是因为它最好,而是因为它安全、稳定、成本低、可复现。
闭环:状态分布随策略变化;能看到误差累积;能检验模型「自己犯错之后能不能纠回来」;但强依赖仿真质量,训练不稳,难复现。
怎么选:想先让模型像人类,用开环;想让它处理自己犯错后的状态,必须闭环;想优化长期目标但仿真不完全可信,用伪闭环、规则环境代理、IDM 和多样化 logsim 折中。
机制图解
评测方式
开环真实下一状态 · 稳定可复现 · 看不到误差累积 · 学不到纠错
闭环环境动力学 · 能看误差累积 · 依赖仿真质量 · 难复现
容易搞混的地方
常见误解
开环是闭环的低级替代品
正确理解
它是现实工程妥协:安全、稳定、复现、成本低,量产里必然大量使用
看懂之后可以追问
- 这个结论是开环评测出来的还是闭环?最高频也最有用的一问。开环指标好看完全可能对应闭环发散——因为开环永远看不到「模型自己犯错之后」的状态。
- 闭环评测用的是哪种环境?其他车会对我们的动作做出反应吗?非反应式闭环(其他车按录制轨迹走)会高估博弈类场景的表现,加塞、合流这类结论尤其要打折。
沿着主线继续
先知道
- 逐步展开与误差累积——策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。
接着看
- 位移误差指标——ADE 是预测轨迹与真值逐点距离的平均,FDE 只看终点——它们衡量「像不像专家」,不等于安全或舒适。
出处:课程学习总纲 总纲 §7.1