它要解决什么问题
怎样让生成模型的输出偏向高价值行为,又不必重训生成器。
机制拆解
- 把一段未来状态/动作序列当作 diffusion 的生成对象
- 训练模型学习轨迹分布
- 推理时用 reward 或 value 的梯度引导采样过程
量产判断
读完应该能问
- 我们的择优是在采样期引导还是训练期微调?两者的代价差很多。
回到术语
- 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
Diffusion 轨迹生成
Planning with Diffusion for Flexible Behavior Synthesis
value 引导采样
arXiv 2205.09991 ↗怎样让生成模型的输出偏向高价值行为,又不必重训生成器。