← 论文拆解

Offline / policy gradient RL 背景

DPPO:扩散策略的策略优化

Diffusion Policy Policy Optimization

diffusion 微调方法论

arXiv 2409.00588 ↗

它要解决什么问题

把 diffusion policy 接到 on-policy 策略梯度优化中,需要解决 log 概率难算、方差大的问题。

机制拆解

  1. 把 diffusion policy 当作可优化策略而不只是行为克隆
  2. 讨论优势估计、去噪步数和噪声调度的处理
  3. 在长时域高维动作任务上比较 on-policy PG 与 off-policy Q-learning

量产判断

读完应该能问

  • 微调多少个去噪步?训练稳定性如何?

回到术语

  • 信用分配——整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 天然对齐,Diffusion 要摊回多个去噪步。
  • 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。