它要解决什么问题
flow matching 本身是确定性的,没有探索空间,无法直接做强化学习。
机制拆解
- 把确定性 ODE 采样过程转成带随机性的 SDE,提供可优化的轨迹分布
- 用 GRPO 的组内相对优势优化生成结果
量产判断
读完应该能问
- 加了随机性之后,生成的稳定性和一致性怎么保证?
回到术语
- 流匹配——不预测噪声,而是学习从噪声轨迹流向真实轨迹的连续速度场,推理时解 ODE——采样步数更少。
- PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。