会上可能听到:“我们有数据闭环。——具体是哪几步?多久转一圈?”
它到底是什么意思
完整链路:线上/仿真发现问题 → 归因(感知/预测/规划/导航/reward/规则)→ 难例挖掘与场景标签 → 数据配比与增广 → 调整 reward/规则/token/结构 → 开环评测 → 闭环评测 → 小流量或实车验证 → 回到起点。
数据配比有个实用原则:一条数据只有一个标签就该标签计 1,有 n 个标签则每个标签计 1/n;先定一级标签配比再细化。这避免多标签复合场景在统计里被重复计满,误导长尾覆盖判断。
量产团队的日常不是「调一个更强的模型」,而是持续运转这个循环——每一环都可能是瓶颈。
机制图解
- 01线上发现问题
- 02归因感知 / 预测 / 规划 / 导航 / reward / 规则
- 03难例挖掘打场景标签
- 04数据配比与增广
- 05调整reward / 规则 / token / 结构
- 06开环 + 闭环评测
- 07小流量或实车验证→ 回到第一步
容易搞混的地方
常见误解
有了数据采集和标注工具就是有数据闭环
正确理解
闭环的度量是「发现问题到修复上线的周期」,有工具没流程不算闭环
常见误解
多标签数据每个标签都算一条
正确理解
n 个标签各计 1/n,否则复合场景会在配比统计里被重复计满
看懂之后可以追问
- 从线上发现一个问题,到修复上线,我们的中位周期是多久?卡在哪一环?这是数据闭环唯一有意义的度量。说得出周期和瓶颈环节,说明闭环真的在转;说不出,通常只是有工具没有流程。
- 难例是怎么挖出来的?靠用户投诉、影子模式还是自动挖掘?难例来源决定了长尾覆盖速度。只靠投诉意味着永远慢一步。
沿着主线继续
先知道
- 场景隔离——同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。
接着看
- 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。
出处:课程学习总纲 总纲 §9.1、§9.5