← 术语图鉴

术语 · 轨迹生成

信用分配

Credit Assignment

整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 天然对齐,Diffusion 要摊回多个去噪步。

会上可能听到:“Diffusion 接 RL 比 AR 难。——难在哪?”

它到底是什么意思

AR 是一步步生成动作 token,reward 可以较自然地对应到 rollout 的时间步,粒度天生对齐。

Diffusion 往往是多步去噪后一次得到整条轨迹,而 reward 通常也是轨迹级别的。梯度要分配回各个去噪步骤和轨迹片段,归因更间接、训练更敏感、容易震荡。

解决思路就是那几种:anchor 分组、目标点约束、value guidance、GRPO 组内比较、ODE 转 SDE 加探索。

机制图解

一条轨迹拿到一个总分,功过算谁的

AR + RL一步一个 token,reward 天然对得上每一步——像给司机逐个路口打分
Diffusion + RL整条轨迹一次生成,总分要摊回每个去噪步——像开完全程只给一个总分,还得倒推哪个动作该负责
生成质量和可优化性是两个维度。只比生成效果做选型,接 RL 时会付额外代价。

容易搞混的地方

常见误解

生成效果好的方案就该选

正确理解

生成质量和可优化性是两个维度,接 RL 的难度要算进选型

常见误解

训练震荡是调参没调好

正确理解

信用分配困难会直接表现为震荡,重跑次数是应该算进排期的隐性成本

看懂之后可以追问

  1. 我们选这条生成路线的时候,把接 RL 的难度算进去了吗?生成质量和可优化性是两个维度。只比生成效果选型,后面接 RL 时会付额外的代价。
  2. RL 微调的训练稳定性怎么样?需要跑几次才能得到一个可用版本?信用分配困难会直接表现为训练震荡。重跑次数是隐性成本,排期时经常被漏算。

先知道

  • 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
  • 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。

接着看

  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。

相关论文

出处:课程学习总纲 总纲 §8