会上可能听到:“Diffusion 接 RL 比 AR 难。——难在哪?”
它到底是什么意思
AR 是一步步生成动作 token,reward 可以较自然地对应到 rollout 的时间步,粒度天生对齐。
Diffusion 往往是多步去噪后一次得到整条轨迹,而 reward 通常也是轨迹级别的。梯度要分配回各个去噪步骤和轨迹片段,归因更间接、训练更敏感、容易震荡。
解决思路就是那几种:anchor 分组、目标点约束、value guidance、GRPO 组内比较、ODE 转 SDE 加探索。
机制图解
一条轨迹拿到一个总分,功过算谁的
AR + RL一步一个 token,reward 天然对得上每一步——像给司机逐个路口打分
Diffusion + RL整条轨迹一次生成,总分要摊回每个去噪步——像开完全程只给一个总分,还得倒推哪个动作该负责
容易搞混的地方
常见误解
生成效果好的方案就该选
正确理解
生成质量和可优化性是两个维度,接 RL 的难度要算进选型
常见误解
训练震荡是调参没调好
正确理解
信用分配困难会直接表现为震荡,重跑次数是应该算进排期的隐性成本
看懂之后可以追问
- 我们选这条生成路线的时候,把接 RL 的难度算进去了吗?生成质量和可优化性是两个维度。只比生成效果选型,后面接 RL 时会付额外的代价。
- RL 微调的训练稳定性怎么样?需要跑几次才能得到一个可用版本?信用分配困难会直接表现为训练震荡。重跑次数是隐性成本,排期时经常被漏算。
沿着主线继续
先知道
- 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
- 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。
接着看
- PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
相关论文
- DPPO:扩散策略的策略优化——diffusion 微调方法论
- DiffusionDriveV2:强化学习约束的截断扩散建模——锚内提质,锚间协调
出处:课程学习总纲 总纲 §8