会上可能听到:“Flow matching 比 diffusion 快。——它们本质区别在哪?”
它到底是什么意思
diffusion 学的是「这一步加了多少噪声」,flow matching 学的是「往真实轨迹方向流动的速度」。推理从噪声出发沿速度场积分即可,通常比多步去噪更省。
在自动驾驶里的落地方式:GoalFlow 用目标点约束轨迹发散方向,再用打分选候选。
要接 RL 时有个额外步骤:确定性的 flow 没有探索空间,需要把 ODE 转成带随机性的采样过程,才能做强化微调。
机制图解
从噪声到轨迹,两种走法
Diffusion学「这一步加了多少噪」· 多步去噪
Flow Matching学「往真实轨迹流动的速度」· 解 ODE,步数更少
容易搞混的地方
常见误解
Flow Matching 是 Diffusion 的升级版
正确理解
是同一目标的另一种机制:学速度场而不是学噪声,各有工程成熟度差异
常见误解
确定性生成更稳定所以更好
正确理解
确定性意味着没有探索空间,要接 RL 必须先把 ODE 转成带随机性的采样
看懂之后可以追问
- 实际采样步数降到了多少?端到端延迟比 diffusion 方案省了多少毫秒?flow matching 的主要卖点是效率。要看端到端实测数字,而不是理论步数。
- 这条路线的工程成熟度和验证链路怎么样?相比 diffusion,flow matching 在自动驾驶量产上的案例更少,工具链和踩坑经验都更薄。
沿着主线继续
先知道
- 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
接着看
- PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
相关论文
- GoalFlow:目标驱动的流匹配多模态轨迹生成——给流一个目标点
- Flow-GRPO:通过在线强化学习训练流匹配模型——ODE 转 SDE 再 RL
出处:课程学习总纲 总纲 §8