它要解决什么问题
传统高斯策略无法表达多峰的动作分布,而离线 RL 又不能随便在线探索。
机制拆解
- 用 diffusion model 表达行为策略/动作分布
- 加入 Q-learning 目标,让策略偏向高价值动作
- 适合离线数据场景
量产判断
读完应该能问
- 离线数据的分布覆盖够吗?超出分布的动作怎么约束?
回到术语
- 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
- PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。