SwiftVLA — 训练时学 4D,推理时丢 4D

Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead · GigaAI / 北大 / 清华 / Moxin · arXiv 2512.00903 (2025)

速览
动机
方法·架构
三大机制
实验
⚔️ 对比 OASIS
💡 创新方向
自测

一句话

大 VLM 撑的 VLA 又慢又占显存;换小 VLM 又丢时空推理。SwiftVLA 让轻量模型"训练时补 4D 的课、推理时轻装上阵":用一个冻结的 4D 视觉几何 Transformer 从纯 RGB 增量提取带时间的几何特征,用 mask-and-reconstruct 把 4D 知识蒸馏进 0.45B 小模型,推理时把整条 4D 分支删掉几乎无损——在 Jetson Orin 上比 π0 快 18×、省显存 12×

本页可靠性🟢 PDF 核对:公式、实验数字均逐条核对自 PDF 原文(arXiv:2512.00903v1)。解读与类比为学习者视角。原文:arXiv · 项目页。姊妹页对比 → OASIS 精读

速览卡片

内容
单位GigaAI / 北京大学 / 清华大学 / Moxin(湖州) / X-Humanoid
核心思想训练期注入 4D 时空 + mask-and-reconstruct 蒸馏,推理期丢弃 4D 分支
骨干SmolVLM-0.5B(SmolVLA 骨干),全模型 ~450M(其中 ~100M action expert)
三大机制① 冻结 4D 几何 Transformer + FIFO 时序缓存 ② Fusion Tokens + 未来轨迹监督 ③ mask-and-reconstruct
关键结果RoboTwin 2.0 SR 0.53(π0 0.47/SmolVLA 0.29,+82.76%) · LIBERO 94.7(π0 94.1) · 真机 0.80(π0 0.61)
边缘效率Jetson Orin:0.167s / 1398MB / SR 0.76 vs π0:2.966s / 16236MB / SR 0.48
动作头条件扩散(噪声预测, Eq.8),非 Flow Matching / 非明确 DiT
为什么值得学:它给出一个高度通用的范式——"有一个昂贵但有用的辅助模态,训练时用来补课、推理时丢掉"。4D 能这样做,是因为几何本就隐含在 RGB 像素里、可被重建。这条思路能否搬到触觉/力(视觉不可见的模态)是最有价值的追问,详见"创新方向"tab。

动机:轻量 VLA 的时空推理困境

VLA 用大 VLM 把语言+视觉直接映射到动作,但基础 VLM 参数巨大 → 高延迟、高显存,边缘设备扛不住实时控制。换小 VLM 又会丢失时空推理能力——论文 Fig. 1 里 SmolVLM-0.5B 连"最左边的碗是什么颜色"都答错(答 white,实际 pale blue),导致定位不准、抓取失败。

现有四类方案的痛点

方案代表痛点
纯 2D 轻量(Fig.2a)SmolVLA压缩 VLM/限 token/跳层,快但时空推理弱、SR 低
直接融合(Fig.2b)3D-VLA / SpatialVLA / Evo-03D 特征直接注入 VLM,需更大 VLM 才能对齐,且缺时序
解耦分支(Fig.2c)PointVLA / GeoVLA独立空间分支处理点云,参数开销大,不适合紧凑模型,忽视时序
时序增强4D-VLA历史相似度关键帧采样,多帧采样增加推理开销
核心假设:轻量 VLM 时空推理差是因为缺几何/动态先验,而非骨干本身学不了。若训练期把 4D 时空知识以辅助监督蒸馏进权重,让模型学会"即使没有显式 4D 输入也能隐式重建/推理 4D 结构",就能在推理时丢掉昂贵的 4D 分支。
与现有方案的本质区别:现有 3D/4D 增强 VLA 都把 3D/4D 当作推理时也必需的输入(所以要么依赖大 VLM,要么加分支参数);SwiftVLA 的 4D 只在训练期作为辅助监督存在,推理期完全丢弃。

整体架构

多视角 RGB
left/right/front
512×512
SigLIP 编码
每帧 64 个 2D token
2D 特征 F2D
(三视角全用)
同样 RGB
冻结 4D 视觉几何 Transformer
Encoder→时空Decoder
+ FIFO Temporal Cache(K)
4D 特征 F4D
限 64 token(仅 front)
F2D + F4D
→随机掩码→
轻量 VLM 𝒱
SmolVLM 前 16 层
+ Fusion Tokens Qf
+ 状态/语言嵌入
分层隐状态 {hV(i)}
{hV(i)}
Action Expert 𝒜
(条件扩散)
动作头 Laction
+ 2D重建头 L2D
+ 4D重建头 L4D
Fusion Tokens 输出 Zf
轨迹头 htraj
预测末端未来轨迹 τ̂
Ltraj 监督

4D 特征提取(§3.2)

冻结的 4D 视觉几何 Transformer 从纯 2D 图像增量导出时序增强的 4D 特征——不需要深度相机/LiDAR。每视角观测先编码 Fe=Encoder(o),再送入时空解码器交替做空间注意力与时序注意力;时序阶段当前特征通过 cross-attention 与 temporal cache 交互:

(F4Dt,v, Ct,k) = Decoder( CrossAttn(Fet,v, Ct,k-1) )

缓存采 FIFO 只保留最近 K 帧。进 VLM 的:F2D=三视角全用,F4D=只用 front 视角;left/right 的 4D 只用于更新缓存(省训练成本)。

总损失(Eq.9)

Ltotal = λ2DL2D + λ4DL4D + λactionLaction + λtrajLtraj

其中 L2D/L4D 是被掩码特征的重建损失(Eq.7),Laction=扩散噪声预测(Eq.8),Ltraj=末端未来轨迹 L2 监督(Eq.6)。各 λ 具体数值论文未公开。

推理阶段:删掉 4D 特征提取器、2D/4D 重建头、轨迹头——它们全是训练期辅助。部署模型只剩 VLM + action expert,纯 2D 输入,又快又省。

机制 ①:带时序缓存的增量 4D 提取

冻结的预训练 4D 视觉几何 Transformer(论文引 [86],正文提到 Evo-0 用 VGGT 类模型) + FIFO temporal cache。关键价值:4D 线索直接从标准 RGB 增量提取,零额外传感器。缓存长度 K 训练时用随机 K∈{3,4,5,6} 效果最好(暴露于可变时序视野增强适应性)。

机制 ②:Fusion Tokens + 未来轨迹监督

小模型难以自行把 2D/4D 融进连贯的 3D 意识潜空间。作者引入一组可学习 token Qf,通过 VLM 内部 cross-attention 与多模态序列(2D/4D 特征、语言、状态)交互,产出统一表征 Zf(Eq.1)。关键:Fusion Tokens 的输出被机械臂末端未来轨迹显式监督:

τ̂t = htraj(Zft)  Ltraj = ‖τ̂t − τt‖²₂ (Eq.6)

用"接下来手要走的轨迹"当老师,使融合表征与时空语义对齐——是一种任务相关、动作感知的对齐信号。

消融证据(Table 5):仅 2D → SR 0.36;2D+4D → 0.40;2D+4D+Fusion Tokens → 0.50。Fusion Tokens + 轨迹监督引导小模型有效使用双模态。

机制 ③:mask-and-reconstruct(核心创新)

训练时以一定概率随机对 2D 或 4D 特征施加掩码,此时 VLA 需基于剩余模态预测动作,同时重建被掩码的特征

L2D = ‖h2D(ZA) − F2D‖  L4D = ‖h4D(ZA) − F4D‖ (Eq.7)

这迫使模型学到全面的、几何感知的 4D 表征,并把 4D 知识蒸馏进权重——即使推理时没有显式 4D 输入,也能隐式重建/推理 4D 结构。

消融证据(Table 6,均训练用 2D+4D、推理仅 2D):不做任何策略直接推理丢 4D → SR 仅 0.02(严重依赖 4D);仅 4D mask → 0.40;4D mask + 重建 → 0.50;4D mask + 2D mask + 重建 → 0.53(对应 with 4D input 0.55)。0.02→0.53 的巨大差距证明蒸馏有效。适度掩码 2D 进一步逼模型利用 4D 几何线索。

主结果

BenchmarkSwiftVLA(0.45B)π0(3.3B)SmolVLA备注
RoboTwin 2.0 平均 SR0.53(with 4D 0.55)0.470.29比 SmolVLA +82.76%;~15% π0 参数
LIBERO 平均94.7(with 4D 95.1)94.1媲美 3B π0/GR00T-N1(93.9),近 7B OpenVLA-OFT(97.1)
真机平均 SR0.80(with 4D 0.82)0.610.34Clean 0.86 / Throw 0.80 / Stack 0.74
Fold the Cloth(附录)0.60(with 4D 0.65)0.450.05可变形物体+长程凸显 4D 优势

边缘部署(Table 4,Jetson Orin)

模型推理时间显存SR
SwiftVLA0.167 s1398.4 MB0.76
π02.966 s16236.2 MB0.48
SmolVLA0.166 s1397.5 MB0.30

比 π0 快约 18×、省显存约 12×;延迟与 SmolVLA 几乎相同(同骨干),但 SR 高得多(0.76 vs 0.30)——证明性能来自训练策略而非算力堆叠。

消融小结

  • 4D 特征:2D 0.36 → 2D+4D 0.40
  • Fusion Tokens:0.40 → 0.50
  • mask-and-reconstruct:丢 4D 无策略 0.02 → 全策略 0.53
  • 缓存 K:K=3→0.47 … K=6→0.52 → Random→0.53(随机最优)
诚实短板:依赖外部冻结 4D Transformer(其质量决定 4D 上限,论文未说明具体架构);4 个损失权重 λ 完全未公开;真机任务少(3+1);mask 概率的消融未报告。

⚔️ SwiftVLA vs OASIS:异同全景

→ 跳转 OASIS 精读页

两篇都是 2025-2026 的轻量 VLA + 从观测注入几何信息的工作,骨干都是 0.5B 级小 VLM,却走了两条哲学不同的路。

相同点

维度共同做法
轻量骨干都用 0.5B 级小 VLM(SwiftVLA=SmolVLM-0.5B;OASIS=Qwen2.5-0.5B)
零额外传感器注入几何都靠冻结的大预训练模型从 RGB 提几何(SwiftVLA=4D 几何 Transformer;OASIS=Depth Anything 3 度量深度),不用深度相机/LiDAR
未来末端轨迹监督两篇都用"机械臂未来 EE 轨迹"作为关键辅助监督去塑造中间表示——这是最惊人的共性
辅助监督→路由进解码都把被监督的中间隐状态送进动作解码器(SwiftVLA 的 {h_V}、OASIS 的 h_traj)
动作分块都预测 action chunk
免大规模机器人预训练都强调不需要大规模机器人预训练/空间标注;都在 LIBERO + 真机评测
非 DiT/FM 动作头SwiftVLA=条件扩散噪声预测;OASIS=ACT 风格 ℓ1 回归——都不是 Flow Matching

不同点

维度SwiftVLAOASIS
核心目标效率:推理时丢掉昂贵模态几何对齐:让中间表示对齐动作空间
辅助模态命运推理时丢弃 4D 分支(mask-and-reconstruct 蒸馏)推理时保留深度 + SE(3) 轨迹分支
中间表示性质融合的 2D/4D token(仍在观测空间,但蒸馏了 4D 知识)SE(3) 位姿监督的隐状态(显式对齐动作空间)
轨迹监督形式未来 EE 轨迹(L2,监督 Fusion Tokens 做跨模态对齐)相机系 SE(3) 轨迹(ℓ1,axis-angle,显式几何,作解码器条件)
核心创新mask-and-reconstruct 训练期蒸馏把中间表示对齐到动作空间的 SE(3) 设计原则
动作头条件扩散(噪声预测)query-based ACT 风格 ℓ1 回归
主打卖点Jetson Orin 18× 快 / 12× 省显存OOD 泛化 90.8% + 数据效率(10 条示教)
一句话对照:SwiftVLA 关心"怎么让几何信息在部署时免费"(训练用、推理丢);OASIS 关心"几何信息该放在中间表示的哪个空间"(观测空间 vs 动作空间)。两者正交、可叠加——见"创新方向"tab。

💡 可复用的 Trick 清单

从两篇论文里能直接"偷"到自己工作的模块化技巧:

Trick来源怎么复用
冻结大模型当特征源两篇用现成 4D/深度/几何大模型,参数高效地注入空间先验,不训练它
未来 EE 轨迹监督中间表示两篇用"接下来手要走的轨迹"塑造隐状态,比重建像素更任务相关
mask-and-reconstruct 蒸馏SwiftVLA训练喂昂贵模态并要求重建,推理丢弃——省部署成本
相机系预测规避外参OASIS把中间量放传感器自身坐标系,省 camera-to-world 标定学习
axis-angle + RodriguesOASIS回归 SO(3)/SE(3) 时天然落流形,免正交化/事后修正
FIFO 缓存 + 随机缓存长度训练SwiftVLA时序建模鲁棒性,尤其适合高频触觉信号
把监督隐状态路由进解码器OASIS(AuxTraj 消融)辅助分支光并行没用,必须把被监督的隐状态喂进解码器才有增益

🚀 后续研究方向(论文创新点子)

① 两篇的直接融合:可丢弃的几何对齐

OASIS 的 SE(3) 轨迹对齐推理时要保留深度+轨迹分支(1.73B 总参)。把 SwiftVLA 的 mask-and-reconstruct 套上去:训练时用 SE(3) 轨迹 + 度量深度对齐中间表示,并要求重建它们;推理时丢掉深度分支和 SE(3) 预测器,只留被蒸馏的动作解码器。目标:拿到 OASIS 的几何精度 + SwiftVLA 的边缘效率。

② 触觉版 mask-and-reconstruct(接触先验蒸馏)

训练期用高分辨率光学触觉(GelSight)作掩码-重建目标蒸馏进策略,推理期仅用低成本本体/视觉。关键风险(必须实测):4D 能推理时丢弃是因为几何隐含在 RGB 里可重建;但接触力/滑动/材质是视觉不可见的,直接照搬"推理丢触觉"很可能大幅掉点。这本身就是一个值得写的实证问题。

③ 触觉版 OASIS(接触轨迹对齐)

把 OASIS 的"SE(3) 轨迹对齐"换成"接触点 SE(3) 轨迹 / 法向力方向轨迹",监督视触觉策略隐状态并路由进解码器。用在 insertion/装配:把接触几何显式注入策略,可能比隐式学习更省数据。这条与 PACE 的 contact-rich 方向高度相关。

④ 辅助模态"可蒸馏性"度量

建立一个指标:辅助模态 X 能否被主模态重建/推断——决定它适合"训练用、推理丢"(如 4D)还是"必须保留"(如接触力)。这为 SwiftVLA 范式划定适用边界,是一篇干净的分析型论文。

⑤ 双轨迹联合监督

两篇都用了未来 EE 轨迹。进一步:同时监督视觉 SE(3) 轨迹(何处) + 触觉接触事件时间轴(何时/如何接触),研究跨模态"接触时刻对齐"——接触瞬间正是纯视觉几何最不可靠、触觉最有信息的时刻。

共同陷阱提醒:两篇的几何增益都与"冻结大基座的质量"深度耦合。"无预训练"是相对的——基座(VLM/4D/深度模型)本身已重度预训练。迁移到触觉时若没有等价的强触觉基座,增益可能不成立。

自测:6 题检验理解