← 论文拆解

AR 与 action token

FAST:面向视觉-语言-动作模型的高效动作词元化

FAST: Efficient Action Tokenization for Vision-Language-Action Models

tokenizer 即控制接口

arXiv 2501.09747 ↗

它要解决什么问题

高频连续动作序列很长,直接喂给自回归模型学习效率低、抖动大。

机制拆解

  1. 把连续动作压成适合自回归学习的 token
  2. 压缩动作序列长度,同时保留可执行的控制结构
  3. 让动作 token 更接近语言模型擅长处理的离散序列

量产判断

读完应该能问

  • 我们的 token 设计在急加减速和极端场景下实测如何?

回到术语

  • 动作词元设计——「下一步」到底表示什么——不同的 token 定义会改变学习难度、噪声传播和极端场景表现。
  • 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。