← 论文拆解

Offline / policy gradient RL 背景

Diffusion-QL:把扩散策略作为离线 RL 的表达性策略类

Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning

多峰动作 + Q 引导

arXiv 2208.06193 ↗

它要解决什么问题

传统高斯策略无法表达多峰的动作分布,而离线 RL 又不能随便在线探索。

机制拆解

  1. 用 diffusion model 表达行为策略/动作分布
  2. 加入 Q-learning 目标,让策略偏向高价值动作
  3. 适合离线数据场景

量产判断

读完应该能问

  • 离线数据的分布覆盖够吗?超出分布的动作怎么约束?

回到术语

  • 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。