会上可能听到:“这个 RL 任务需要多少数据?——有没有大致的量级参考?”
它到底是什么意思
这组数字对排期极其有用:它告诉你「验证方向对不对」和「训练到可用」之间差了四个数量级。
最实用的是第一个——约 10 条数据就能发现 reward 方向的明显问题。这意味着任何 reward 改动都应该先跑一个极小规模的方向验证,再决定要不要投全量算力。
容易搞混的地方
常见误解
数据越多效果越好
正确理解
分层、配比、挖难例比总量更重要;方向错了,加数据只是把错误放大
常见误解
要验证 reward 得先攒够数据
正确理解
约 10 条就能发现明显的方向问题,先验证再投算力
看懂之后可以追问
- 在投全量训练之前,我们用小样本验证过 reward 方向吗?10 条数据 vs 10w clip 的成本差距巨大。跳过方向验证直接全量,是排期里最容易避免的浪费。
- 这个任务现在处在哪个量级?下一个量级需要多久攒够数据?把「效果不够好」翻译成「数据量还差一个量级」,排期讨论才有共同语言,而不是反复问什么时候能好。
沿着主线继续
先知道
- 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
接着看
- 数据闭环——从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。
出处:课程学习总纲 总纲 §9.1