← 论文拆解

Diffusion 轨迹生成

Diffuser:用扩散做灵活的行为合成

Planning with Diffusion for Flexible Behavior Synthesis

value 引导采样

arXiv 2205.09991 ↗

它要解决什么问题

怎样让生成模型的输出偏向高价值行为,又不必重训生成器。

机制拆解

  1. 把一段未来状态/动作序列当作 diffusion 的生成对象
  2. 训练模型学习轨迹分布
  3. 推理时用 reward 或 value 的梯度引导采样过程

量产判断

读完应该能问

  • 我们的择优是在采样期引导还是训练期微调?两者的代价差很多。

回到术语

  • 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。