会上可能听到:“AR 方案是一个 token 一个 token 出轨迹。——跟 diffusion 比各有什么取舍?”
它到底是什么意思
一句话对比:AR 像一步步开车,Diffusion 像一次提出多条路线。
AR 的优点:把连续控制变成离散分类,交叉熵目标清晰稳定;transformer 天然适配 token 序列;生成过程本身就是 rollout,和 RL 接口顺——先模仿学习再 PPO/GRPO 微调很自然。
缺点集中在三处:exposure bias(训练看真实历史,推理看自己的预测,错误会改变输入分布并放大);早期 token 一旦选边,后续条件分布容易坍缩到单一模式;只最大化局部似然,不直接最大化长期回报。
机制图解
- 01当前状态
- 02出第 1 个动作
- 03更新状态把自己的输出当输入
- 04出第 2 个动作
- 05…直到轨迹结束前一步错了,后面沿着错的继续
容易搞混的地方
常见误解
AR 不能输出多模态
正确理解
能输出概率分布,问题是早期 token 选边后容易坍缩到单一模式
常见误解
开环测得好说明误差累积不严重
正确理解
开环每步都喂真实状态,模型从不面对自己刚犯的错,看不到这个问题
看懂之后可以追问
- 推理时的误差累积有多严重?长时域轨迹的末端偏差实测是多少?exposure bias 是 AR 的固有成本。要看实测数据,因为开环评测通常掩盖这个问题。
- 多模态在 AR 里怎么保?还是最终只取 top1?AR 早期 token 选边后会向单一模式坍缩。如果量产又只取 top1,需要确认分叉场景的表现是否可接受。
沿着主线继续
先知道
- 多模态轨迹——未来不是一个确定的点,而是一个分布:可以跟车、变道、让行、绕行,模型输出多条候选来表达这种不确定性。
对比着看
- 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
接着看
- 动作词元设计——「下一步」到底表示什么——不同的 token 定义会改变学习难度、噪声传播和极端场景表现。
- 逐步展开与误差累积——策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。
相关论文
- FAST:面向视觉-语言-动作模型的高效动作词元化——tokenizer 即控制接口
- Plan-R1:把安全可行的轨迹规划建模为语言建模——规划语言化 + GRPO
出处:课程学习总纲 总纲 §6.2