它要解决什么问题
高频连续动作序列很长,直接喂给自回归模型学习效率低、抖动大。
机制拆解
- 把连续动作压成适合自回归学习的 token
- 压缩动作序列长度,同时保留可执行的控制结构
- 让动作 token 更接近语言模型擅长处理的离散序列
量产判断
读完应该能问
- 我们的 token 设计在急加减速和极端场景下实测如何?
AR 与 action token
FAST: Efficient Action Tokenization for Vision-Language-Action Models
tokenizer 即控制接口
arXiv 2501.09747 ↗高频连续动作序列很长,直接喂给自回归模型学习效率低、抖动大。