它要解决什么问题
把 diffusion policy 接到 on-policy 策略梯度优化中,需要解决 log 概率难算、方差大的问题。
机制拆解
- 把 diffusion policy 当作可优化策略而不只是行为克隆
- 讨论优势估计、去噪步数和噪声调度的处理
- 在长时域高维动作任务上比较 on-policy PG 与 off-policy Q-learning
量产判断
读完应该能问
- 微调多少个去噪步?训练稳定性如何?
Offline / policy gradient RL 背景
Diffusion Policy Policy Optimization
diffusion 微调方法论
arXiv 2409.00588 ↗把 diffusion policy 接到 on-policy 策略梯度优化中,需要解决 log 概率难算、方差大的问题。