← 术语图鉴

术语 · 量产验收

数据闭环

Data Flywheel / Hard Case Mining

从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。

会上可能听到:“我们有数据闭环。——具体是哪几步?多久转一圈?”

它到底是什么意思

完整链路:线上/仿真发现问题 → 归因(感知/预测/规划/导航/reward/规则)→ 难例挖掘与场景标签 → 数据配比与增广 → 调整 reward/规则/token/结构 → 开环评测 → 闭环评测 → 小流量或实车验证 → 回到起点。

数据配比有个实用原则:一条数据只有一个标签就该标签计 1,有 n 个标签则每个标签计 1/n;先定一级标签配比再细化。这避免多标签复合场景在统计里被重复计满,误导长尾覆盖判断。

量产团队的日常不是「调一个更强的模型」,而是持续运转这个循环——每一环都可能是瓶颈。

机制图解

  1. 01线上发现问题
  2. 02归因感知 / 预测 / 规划 / 导航 / reward / 规则
  3. 03难例挖掘打场景标签
  4. 04数据配比与增广
  5. 05调整reward / 规则 / token / 结构
  6. 06开环 + 闭环评测
  7. 07小流量或实车验证→ 回到第一步
量产团队的日常不是「调一个更强的模型」,而是让这个循环持续转起来。每一环都可能是瓶颈。

容易搞混的地方

常见误解

有了数据采集和标注工具就是有数据闭环

正确理解

闭环的度量是「发现问题到修复上线的周期」,有工具没流程不算闭环

常见误解

多标签数据每个标签都算一条

正确理解

n 个标签各计 1/n,否则复合场景会在配比统计里被重复计满

看懂之后可以追问

  1. 从线上发现一个问题,到修复上线,我们的中位周期是多久?卡在哪一环?这是数据闭环唯一有意义的度量。说得出周期和瓶颈环节,说明闭环真的在转;说不出,通常只是有工具没有流程。
  2. 难例是怎么挖出来的?靠用户投诉、影子模式还是自动挖掘?难例来源决定了长尾覆盖速度。只靠投诉意味着永远慢一步。

先知道

  • 场景隔离——同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。

接着看

  • 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。

出处:课程学习总纲 总纲 §9.1、§9.5