Observation-Action Space Alignment via SE(3) Trajectory Prediction · 西安交通大学 · arXiv 2605.25829 (2026)
VLA 和世界模型的中间表示都停在"观测空间",不共享动作空间的刚体几何,逼动作解码器自己隐式恢复 SE(3) 几何。 OASIS 换个思路:让策略先预测一条相机系 SE(3) 末端执行器轨迹,用位姿监督中间隐状态,把中间表示显式对齐到动作空间,为动作解码提供几何归纳偏置——无需空间标注、无需大规模机器人预训练。
arXiv:2605.25829v1)。解读与类比为学习者视角。原文:arXiv · 项目页。姊妹页对比 → SwiftVLA 精读。| 项 | 内容 |
|---|---|
| 单位 | 西安交通大学(人机混合增强智能全国重点实验室) |
| 核心思想 | 预测相机系 SE(3) 轨迹,把中间表示对齐到动作空间(而非丰富观测特征) |
| 基座 | Prismatic VLM(Qwen2.5-0.5B + DINOv2 + SigLIP, LoRA) + 冻结 Depth Anything 3(度量深度) |
| 三组件 | 3D-aware 编码器 → SE(3) 轨迹预测器(4层 Transformer) → 动作解码器(2层 Transformer) |
| 关键结果 | LIBERO 97.6%(+2.1 vs Unified-VLA) · CALVIN ABC→D 4.57/五连83.3%(+5.2 vs DreamVLA) · 真机 89.2%(+7.6 vs π0.5) · OOD 90.8% |
| 参数/资源 | 总 1.73B / 可训练 0.18B;4×A800 训练;推理 RTX 4090 4.5GB ~20Hz |
| 动作头 | query-based ACT 风格 ℓ1 回归,非扩散/非 Flow Matching |
机器人末端执行器的刚体运动生活在特殊欧氏群 SE(3) 中;但单张图像在同一指令下与许多不同 6-DoF 动作相容——存在天然歧义。消解歧义需要一个能约束目标 SE(3) 位姿的中间表示。现有 VLA/WAM 尽管很强,却都从"不共享动作空间刚体几何"的中间表示中解码相对动作。
| 类别 | 代表 | 中间表示 & 痛点 |
|---|---|---|
| Vanilla VLA | OpenVLA / π0 / RDT / ACT / DP | 多模态特征(观测空间),解码器隐式恢复深度与旋转,无几何对齐 |
| Feature-Enhanced VLA | SpatialVLA / QDepth-VLA / ThinkAct / UniVLA | 注入辅助空间/视觉特征,但中间表示仍不共享动作空间几何,解码器仍需"搭桥" |
| World Action Models | SuSIE / VPP / Seer / DreamVLA / Unified-VLA | 预测未来图像/潜在视觉状态,活在图像平面而非动作空间刚体几何 |
| 张量 | 维度 | 含义 |
|---|---|---|
| 3D 感知表示 h3D | [Nl+Nv+Nd, D] | 语言/视觉/深度特征 concat |
| 轨迹 query / 隐状态 | [H,D]=[8,896] | 位姿监督的条件信号 |
| 相机系轨迹 Tc | 8 个 SE(3),每步 [p(3),θ(3)] | axis-angle 参数化 |
| 上下文 hctx | [(H+1),D]=[9,896] | [htraj, hstate] |
| 动作块 At | [H,7] | 8 步 (6-DoF 相对动作 + 夹爪) |
3D-aware 编码器用冻结的 Depth Anything 3(DA3METRIC-LARGE)提取度量深度特征。作者特意选度量深度(而非 Depth Anything 2 的相对深度或 VGGT 的归一化深度):度量尺度反映真实物理距离,为精确操作提供绝对空间信息。
预测器在相机系(camera-frame)输出 SE(3) 轨迹,使中间表示与 h3D 同坐标系,省去学习 camera-to-world 外参的负担(取 g=Tc→w⁻¹ 即满足对齐)。
每步旋转用 axis-angle 向量 θ∈ℝ³ 参数化,通过 Rodrigues 公式闭式恢复有效旋转矩阵:
桌面操作中 ‖θ‖<π,所有预测落在 SO(3) 正则 axis-angle 图内、远离奇异集,网络输出天然停在 SE(3) 流形上,无需正交化/Gram-Schmidt/事后修正。消融(Table 3):axis-angle 95.2 > Euler 92.2 > quaternion 91.6。
动作解码器交叉注意的是预测器的位姿监督隐状态 htraj(不是轨迹坐标本身) + 当前末端状态,近似 Eq.2 的相对动作恢复,把坐标系转换、噪声、接触动力学、夹爪时序当残差吸收。作者刻意保留学习式解码器而非闭式几何管线。
| Benchmark | OASIS | 次优/对比 | 领先 |
|---|---|---|---|
| LIBERO 平均 | 97.6% | Unified-VLA | +2.1%(vs ThinkAct 平均 +13.2、Long +24.3) |
| CALVIN ABC→D 平均序列长 | 4.57 | 3D Diffuser Actor 3.35 | 五连任务 83.3%(+5.2 vs DreamVLA),领先随任务加长扩大 |
| 真机平均 | 89.2% | π0.5 | +7.6(RDT +19.7 / Seer +30.8 / ACT +48.7) |
| OOD 平均 | 90.8% | π0.5 82.2 | 未见背景94.8/视角偏移91.2/人为干扰86.5 |
共享编码器/深度/架构/训练预算下,每加一层几何对齐都单调涨点。SE(3) 轨迹预测器是所有消融组件中的最大额外增益来源(89.5→95.2)。
数据效率:真机 Long task 仅 10 条示教即达 35.0%(π0.5 用 25 条才 15.0%);50 条时 83.3% vs 71.6%。
两篇都是 2025-2026 的轻量 VLA + 从观测注入几何信息的工作,骨干都是 0.5B 级小 VLM,却走了两条哲学不同的路。
| 维度 | 共同做法 |
|---|---|
| 轻量骨干 | 都用 0.5B 级小 VLM(OASIS=Qwen2.5-0.5B;SwiftVLA=SmolVLM-0.5B) |
| 零额外传感器注入几何 | 都靠冻结的大预训练模型从 RGB 提几何(OASIS=Depth Anything 3 度量深度;SwiftVLA=4D 几何 Transformer),不用深度相机/LiDAR |
| 未来末端轨迹监督 | 两篇都用"机械臂未来 EE 轨迹"作为关键辅助监督去塑造中间表示——这是最惊人的共性 |
| 辅助监督→路由进解码 | 都把被监督的中间隐状态送进动作解码器(OASIS 的 h_traj、SwiftVLA 的 {h_V}) |
| 动作分块 | 都预测 action chunk(OASIS H=8) |
| 免大规模机器人预训练 | 都强调不需要大规模机器人预训练/空间标注;都在 LIBERO + 真机评测 |
| 非 DiT/FM 动作头 | OASIS=ACT 风格 ℓ1 回归;SwiftVLA=条件扩散噪声预测——都不是 Flow Matching |
| 维度 | OASIS | SwiftVLA |
|---|---|---|
| 核心目标 | 几何对齐:让中间表示对齐动作空间 | 效率:推理时丢掉昂贵模态 |
| 辅助模态命运 | 推理时保留深度 + SE(3) 轨迹分支 | 推理时丢弃 4D 分支(mask-and-reconstruct 蒸馏) |
| 中间表示性质 | SE(3) 位姿监督的隐状态(显式对齐动作空间) | 融合的 2D/4D token(仍在观测空间,但蒸馏了 4D 知识) |
| 轨迹监督形式 | 相机系 SE(3) 轨迹(ℓ1,axis-angle,显式几何,作解码器条件) | 未来 EE 轨迹(L2,监督 Fusion Tokens 做跨模态对齐) |
| 核心创新 | 把中间表示对齐到动作空间的 SE(3) 设计原则 | mask-and-reconstruct 训练期蒸馏 |
| 动作头 | query-based ACT 风格 ℓ1 回归 | 条件扩散(噪声预测) |
| 主打卖点 | OOD 泛化 90.8% + 数据效率(10 条示教) | Jetson Orin 18× 快 / 12× 省显存 |
从两篇论文里能直接"偷"到自己工作的模块化技巧:
| Trick | 来源 | 怎么复用 |
|---|---|---|
| 冻结大模型当特征源 | 两篇 | 用现成 4D/深度/几何大模型,参数高效地注入空间先验,不训练它 |
| 未来 EE 轨迹监督中间表示 | 两篇 | 用"接下来手要走的轨迹"塑造隐状态,比重建像素更任务相关 |
| 把监督隐状态路由进解码器 | OASIS(AuxTraj 消融) | 辅助分支光并行没用,必须把被监督的隐状态喂进解码器才有增益 |
| 相机系预测规避外参 | OASIS | 把中间量放传感器自身坐标系,省 camera-to-world 标定学习 |
| axis-angle + Rodrigues | OASIS | 回归 SO(3)/SE(3) 时天然落流形,免正交化/事后修正 |
| 度量深度 > 相对深度 | OASIS | 精确操作要绝对物理尺度,选 metric depth 而非归一化/相对深度 |
| mask-and-reconstruct 蒸馏 | SwiftVLA | 训练喂昂贵模态并要求重建,推理丢弃——省部署成本 |
| FIFO 缓存 + 随机缓存长度训练 | SwiftVLA | 时序建模鲁棒性,尤其适合高频触觉信号 |
OASIS 的 SE(3) 轨迹对齐推理时要保留深度+轨迹分支(1.73B 总参)。把 SwiftVLA 的 mask-and-reconstruct 套上去:训练时用 SE(3) 轨迹 + 度量深度对齐中间表示,并要求重建它们;推理时丢掉深度分支和 SE(3) 预测器,只留被蒸馏的动作解码器。目标:拿到 OASIS 的几何精度 + SwiftVLA 的边缘效率。
把 OASIS 的"SE(3) 轨迹对齐"换成"接触点 SE(3) 轨迹 / 法向力方向轨迹",监督视触觉策略隐状态并路由进解码器。用在 insertion/装配:把接触几何显式注入策略,可能比隐式学习更省数据。与 PACE 的 contact-rich 方向高度相关。
训练期用高分辨率光学触觉(GelSight)作掩码-重建目标蒸馏进策略,推理期仅用低成本本体/视觉。关键风险(必须实测):4D 能推理时丢弃是因为几何隐含在 RGB 里可重建;但接触力/滑动/材质是视觉不可见的,直接照搬"推理丢触觉"很可能大幅掉点。这本身就是一个值得写的实证问题。
OASIS 的位姿监督隐状态与实际执行的偏差,可作为在线异常/失败信号——几何可解释的中间表示天然适合安全监控。可扩展成"预测轨迹 vs 实际轨迹残差触发重规划"的 slow-fast 机制。
建立一个指标:辅助模态 X 能否被主模态重建/推断——决定它适合"训练用、推理丢"(如 4D/深度)还是"必须保留"(如接触力)。这为 SwiftVLA 范式划定适用边界,是一篇干净的分析型论文。