← 术语图鉴

术语 · 轨迹生成

流匹配

Flow Matching

不预测噪声,而是学习从噪声轨迹流向真实轨迹的连续速度场,推理时解 ODE——采样步数更少。

会上可能听到:“Flow matching 比 diffusion 快。——它们本质区别在哪?”

它到底是什么意思

diffusion 学的是「这一步加了多少噪声」,flow matching 学的是「往真实轨迹方向流动的速度」。推理从噪声出发沿速度场积分即可,通常比多步去噪更省。

在自动驾驶里的落地方式:GoalFlow 用目标点约束轨迹发散方向,再用打分选候选。

要接 RL 时有个额外步骤:确定性的 flow 没有探索空间,需要把 ODE 转成带随机性的采样过程,才能做强化微调。

机制图解

从噪声到轨迹,两种走法

Diffusion学「这一步加了多少噪」· 多步去噪
Flow Matching学「往真实轨迹流动的速度」· 解 ODE,步数更少
同一个目标(车端实时)的两种机制。代价是 flow 在自动驾驶量产上的案例更少,踩坑经验更薄。

容易搞混的地方

常见误解

Flow Matching 是 Diffusion 的升级版

正确理解

是同一目标的另一种机制:学速度场而不是学噪声,各有工程成熟度差异

常见误解

确定性生成更稳定所以更好

正确理解

确定性意味着没有探索空间,要接 RL 必须先把 ODE 转成带随机性的采样

看懂之后可以追问

  1. 实际采样步数降到了多少?端到端延迟比 diffusion 方案省了多少毫秒?flow matching 的主要卖点是效率。要看端到端实测数字,而不是理论步数。
  2. 这条路线的工程成熟度和验证链路怎么样?相比 diffusion,flow matching 在自动驾驶量产上的案例更少,工具链和踩坑经验都更薄。

先知道

  • 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。

接着看

  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。

相关论文

出处:课程学习总纲 总纲 §8