← 论文拆解

Diffusion / Flow + RL

Flow-GRPO:通过在线强化学习训练流匹配模型

Flow-GRPO: Training Flow Matching Models via Online RL

ODE 转 SDE 再 RL

arXiv 2505.05470 ↗

它要解决什么问题

flow matching 本身是确定性的,没有探索空间,无法直接做强化学习。

机制拆解

  1. 把确定性 ODE 采样过程转成带随机性的 SDE,提供可优化的轨迹分布
  2. 用 GRPO 的组内相对优势优化生成结果

量产判断

读完应该能问

  • 加了随机性之后,生成的稳定性和一致性怎么保证?

回到术语

  • 流匹配——不预测噪声,而是学习从噪声轨迹流向真实轨迹的连续速度场,推理时解 ODE——采样步数更少。
  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。