← 术语图鉴

术语 · 量产验收

RL 数据规模直觉

RL Data Scale

验 reward 方向约 10 条;单任务专项百到千条 clip;全量训练约 10w clip;一段式预训练可能千万级。

会上可能听到:“这个 RL 任务需要多少数据?——有没有大致的量级参考?”

它到底是什么意思

这组数字对排期极其有用:它告诉你「验证方向对不对」和「训练到可用」之间差了四个数量级。

最实用的是第一个——约 10 条数据就能发现 reward 方向的明显问题。这意味着任何 reward 改动都应该先跑一个极小规模的方向验证,再决定要不要投全量算力。

容易搞混的地方

常见误解

数据越多效果越好

正确理解

分层、配比、挖难例比总量更重要;方向错了,加数据只是把错误放大

常见误解

要验证 reward 得先攒够数据

正确理解

约 10 条就能发现明显的方向问题,先验证再投算力

看懂之后可以追问

  1. 在投全量训练之前,我们用小样本验证过 reward 方向吗?10 条数据 vs 10w clip 的成本差距巨大。跳过方向验证直接全量,是排期里最容易避免的浪费。
  2. 这个任务现在处在哪个量级?下一个量级需要多久攒够数据?把「效果不够好」翻译成「数据量还差一个量级」,排期讨论才有共同语言,而不是反复问什么时候能好。

先知道

  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。

接着看

  • 数据闭环——从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。

出处:课程学习总纲 总纲 §9.1