OASIS — 用 SE(3) 轨迹把中间表示对齐动作空间

Observation-Action Space Alignment via SE(3) Trajectory Prediction · 西安交通大学 · arXiv 2605.25829 (2026)

速览
动机·几何论断
方法·架构
核心机制
实验
⚔️ 对比 SwiftVLA
💡 创新方向
自测

一句话

VLA 和世界模型的中间表示都停在"观测空间",不共享动作空间的刚体几何,逼动作解码器自己隐式恢复 SE(3) 几何。 OASIS 换个思路:让策略先预测一条相机系 SE(3) 末端执行器轨迹,用位姿监督中间隐状态,把中间表示显式对齐到动作空间,为动作解码提供几何归纳偏置——无需空间标注、无需大规模机器人预训练。

本页可靠性🟢 PDF 核对:公式、实验数字均逐条核对自 PDF 原文(arXiv:2605.25829v1)。解读与类比为学习者视角。原文:arXiv · 项目页。姊妹页对比 → SwiftVLA 精读

速览卡片

内容
单位西安交通大学(人机混合增强智能全国重点实验室)
核心思想预测相机系 SE(3) 轨迹,把中间表示对齐到动作空间(而非丰富观测特征)
基座Prismatic VLM(Qwen2.5-0.5B + DINOv2 + SigLIP, LoRA) + 冻结 Depth Anything 3(度量深度)
三组件3D-aware 编码器 → SE(3) 轨迹预测器(4层 Transformer) → 动作解码器(2层 Transformer)
关键结果LIBERO 97.6%(+2.1 vs Unified-VLA) · CALVIN ABC→D 4.57/五连83.3%(+5.2 vs DreamVLA) · 真机 89.2%(+7.6 vs π0.5) · OOD 90.8%
参数/资源总 1.73B / 可训练 0.18B;4×A800 训练;推理 RTX 4090 4.5GB ~20Hz
动作头query-based ACT 风格 ℓ1 回归,非扩散/非 Flow Matching
为什么值得学:它把"恢复刚体几何"从解码器的隐式负担,变成一个显式的几何归纳偏置。关键消融证明:加 SE(3) 轨迹预测器带来最大增益(Long 89.5→95.2),而且必须把位姿监督隐状态路由进解码器才有用(光并行分支无效)。这条"对齐动作空间"的设计原则可迁移到任何李群结构的任务。

动机:中间表示的几何论断

机器人末端执行器的刚体运动生活在特殊欧氏群 SE(3) 中;但单张图像在同一指令下与许多不同 6-DoF 动作相容——存在天然歧义。消解歧义需要一个能约束目标 SE(3) 位姿的中间表示。现有 VLA/WAM 尽管很强,却都从"不共享动作空间刚体几何"的中间表示中解码相对动作。

et=[ptt]ᵀ ⟺ Tt=[[R(θt),pt],[0ᵀ,1]]∈SE(3) (Eq.1)  at+h-1=ρ(Tt+h-1⁻¹Tt+h) (Eq.2)

三类现有方法为何不够

类别代表中间表示 & 痛点
Vanilla VLAOpenVLA / π0 / RDT / ACT / DP多模态特征(观测空间),解码器隐式恢复深度与旋转,无几何对齐
Feature-Enhanced VLASpatialVLA / QDepth-VLA / ThinkAct / UniVLA注入辅助空间/视觉特征,但中间表示仍不共享动作空间几何,解码器仍需"搭桥"
World Action ModelsSuSIE / VPP / Seer / DreamVLA / Unified-VLA预测未来图像/潜在视觉状态,活在图像平面而非动作空间刚体几何
核心洞察(§3.2 形式化):一个视界索引化的中间表示 mt 在几何上对齐动作空间,当且仅当它在每步提供显式位姿读出 r(mt+h)=g·Tt+h∈SE(3)(g 是可能未知的固定刚性变换)。有了这样的读出,解码器就能套用 Eq.2 恢复相对动作,把 g、噪声、接触动力学、夹爪时序当残差吸收。OASIS 预测相机系 SE(3) 轨迹,取 g=Tc→w⁻¹ 即满足对齐性质。

整体架构:三组件端到端

RGB(第三人称+腕部)
224×224 · 语言 l · 状态 et(7维)
① 3D-aware 编码器 E3D
Qwen2.5-0.5B VLM(+DINOv2/SigLIP)→hl,hv
冻结 DA3(度量深度)→hd
concat: h3D=[hl,hv,hd]
↓ h3D
② SE(3) 轨迹预测器 P(4层 Transformer)
H=8 可学习 query + RoPE 自注意力
cross-attn 条件于 h3D
→位姿监督隐状态 htraj[8,896]
→相机系 SE(3) 轨迹 {ec=[p(3),θ(axis-angle,3)]}
Ltraj=ℓ1 监督
↓ htraj(不是轨迹坐标,是隐状态!)
③ 动作解码器 D(2层 Transformer)
H=8 动作 query + 状态嵌入 hstate
ctx=[htraj,hstate]
cross-attn → 动作块 At={(Δp,Δθ, 夹爪)}
Lact=ℓ1 监督
Ltotal = λ·Ltraj + Lact, λ=0.1 (Eq.13)

关键张量(Table 5 + 附录 A.2)

张量维度含义
3D 感知表示 h3D[Nl+Nv+Nd, D]语言/视觉/深度特征 concat
轨迹 query / 隐状态[H,D]=[8,896]位姿监督的条件信号
相机系轨迹 Tc8 个 SE(3),每步 [p(3),θ(3)]axis-angle 参数化
上下文 hctx[(H+1),D]=[9,896][htraj, hstate]
动作块 At[H,7]8 步 (6-DoF 相对动作 + 夹爪)
隐藏维 D=896、8 头、H=8;机器人状态 7 维、动作 6 维+夹爪。预测视界与动作块等长(均 H=8)。监督全来自标准专家示教——无空间标注、无大规模机器人预训练

机制 ①:度量深度(metric depth)而非相对深度

3D-aware 编码器用冻结的 Depth Anything 3(DA3METRIC-LARGE)提取度量深度特征。作者特意选度量深度(而非 Depth Anything 2 的相对深度或 VGGT 的归一化深度):度量尺度反映真实物理距离,为精确操作提供绝对空间信息。

消融证据:w/o Metric 91.8;换成 DAv2 相对深度(w/ Rel.)仅回到 92.0——关键是"度量尺度"而非泛泛的深度

机制 ②:相机系预测规避外参学习

预测器在相机系(camera-frame)输出 SE(3) 轨迹,使中间表示与 h3D 同坐标系,省去学习 camera-to-world 外参的负担(取 g=Tc→w⁻¹ 即满足对齐)。

消融证据:相机系 95.2 vs 世界系 93.2(Long +2.0 / Spatial +2.5)。相机系设计还让策略对第三人称视角偏移更鲁棒。
具体是哪个相机?→ Third-person(第三人称固定外置相机),不是 wrist。

论文原话:"Trajectory supervision is derived from the world frame and projected into the third-person camera frame using its extrinsic matrix."

输入:两个视角的 RGB 图像——third-person(固定外置) + wrist(腕部相机),224×224×3
轨迹预测坐标系:在 third-person camera frame 下输出 SE(3) 末端轨迹
为什么选 third-person 而不是 wrist:third-person 相机是固定的(外参已知但不想让模型学);wrist 相机随手臂动,坐标系不稳定
OOD 鲁棒性:论文说"Under the altered camera, only the third-person view is displaced, and because h3D and Tc both live in the camera frame, the decoder tolerates this displacement somewhat"——正因为中间表示和预测都在同一个相机系下,相机位移只是整体平移,decoder 能容忍
输入需要深度传感器吗?→ 不需要,纯 RGB 即可。

OASIS 用 Depth Anything 3(DA3METRIC-LARGE,冻结)从纯 RGB 图像预测 metric depth——这是一个单目深度估计模型,不需要深度相机/LiDAR/RGB-D 传感器。

论文原话:"use Depth Anything 3, specifically the frozen DA3METRIC-LARGE model, which extracts multi-scale metric-depth features from ot"

消融:去掉 metric depth(w/o Metric) LIBERO-Long 从 95.2% 降到 91.8%;换成相对深度(Depth Anything 2) 只恢复到 92.0%——说明 metric scale(绝对深度尺度)是关键,不是深度信息本身。

实际部署只需:2 个 RGB 相机(third-person + wrist) + 机器人状态(7维 EEF pose + gripper)。不需要任何额外深度传感器。

机制 ③:axis-angle + Rodrigues 保证 SE(3) 流形有效

每步旋转用 axis-angle 向量 θ∈ℝ³ 参数化,通过 Rodrigues 公式闭式恢复有效旋转矩阵:

R(θc) = exp([θc]×) ∈ SO(3) (Eq.10)

桌面操作中 ‖θ‖<π,所有预测落在 SO(3) 正则 axis-angle 图内、远离奇异集,网络输出天然停在 SE(3) 流形上,无需正交化/Gram-Schmidt/事后修正。消融(Table 3):axis-angle 95.2 > Euler 92.2 > quaternion 91.6。

机制 ④:把位姿监督隐状态"路由进"解码器(最关键)

动作解码器交叉注意的是预测器的位姿监督隐状态 htraj(不是轨迹坐标本身) + 当前末端状态,近似 Eq.2 的相对动作恢复,把坐标系转换、噪声、接触动力学、夹爪时序当残差吸收。作者刻意保留学习式解码器而非闭式几何管线。

两个决定性消融
AuxTraj 对照:把轨迹损失接成并行分支(htraj 不进解码器)只有 89.7,而 OASIS(路由进解码器)95.2——+5.5(Long)/+7.1(Spatial) 的增益不是轨迹分支的参数容量,而是"把位姿监督隐状态路由进解码器"本身。
闭式解码器:把学习解码器换成硬编码几何管线(甚至给已知外参+特权夹爪信息)→ Spatial 崩到 12.4%、Long 崩到 0.0%,证明学习式残差解码不可省。

主结果

BenchmarkOASIS次优/对比领先
LIBERO 平均97.6%Unified-VLA+2.1%(vs ThinkAct 平均 +13.2、Long +24.3)
CALVIN ABC→D 平均序列长4.573D Diffuser Actor 3.35五连任务 83.3%(+5.2 vs DreamVLA),领先随任务加长扩大
真机平均89.2%π0.5+7.6(RDT +19.7 / Seer +30.8 / ACT +48.7)
OOD 平均90.8%π0.5 82.2未见背景94.8/视角偏移91.2/人为干扰86.5

监督目标的单调阶梯(matched-backbone 控制,LIBERO-Long)

w/o Traj
89.5
AuxTraj
89.7
(并行分支)
2D 轨迹
90.7
(图像平面)
3D Pos.
92.3
(加深度)
World SE(3)
93.2
(加旋转,世界系)
相机系 SE(3)
95.2

共享编码器/深度/架构/训练预算下,每加一层几何对齐都单调涨点。SE(3) 轨迹预测器是所有消融组件中的最大额外增益来源(89.5→95.2)。

数据效率 & 诚实短板

数据效率:真机 Long task 仅 10 条示教即达 35.0%(π0.5 用 25 条才 15.0%);50 条时 83.3% vs 71.6%。

诚实短板:① 依赖冻结的 DA3 度量深度(核心增益源之一),未消融"深度模型失准/超分布"时的鲁棒性;② 仅单臂桌面,双臂/灵巧手扩展停留 future work;③ 真机 Long task 的 Wilson 置信区间与 π0.5 重叠(数值领先但统计不显著);④ "无预训练"需精确理解——VLM(LLaVA-1.5)与 DA3 都已重度预训练,相当于把预训练"外包"给视觉/深度基座。

⚔️ OASIS vs SwiftVLA:异同全景

→ 跳转 SwiftVLA 精读页

两篇都是 2025-2026 的轻量 VLA + 从观测注入几何信息的工作,骨干都是 0.5B 级小 VLM,却走了两条哲学不同的路。

相同点

维度共同做法
轻量骨干都用 0.5B 级小 VLM(OASIS=Qwen2.5-0.5B;SwiftVLA=SmolVLM-0.5B)
零额外传感器注入几何都靠冻结的大预训练模型从 RGB 提几何(OASIS=Depth Anything 3 度量深度;SwiftVLA=4D 几何 Transformer),不用深度相机/LiDAR
未来末端轨迹监督两篇都用"机械臂未来 EE 轨迹"作为关键辅助监督去塑造中间表示——这是最惊人的共性
辅助监督→路由进解码都把被监督的中间隐状态送进动作解码器(OASIS 的 h_traj、SwiftVLA 的 {h_V})
动作分块都预测 action chunk(OASIS H=8)
免大规模机器人预训练都强调不需要大规模机器人预训练/空间标注;都在 LIBERO + 真机评测
非 DiT/FM 动作头OASIS=ACT 风格 ℓ1 回归;SwiftVLA=条件扩散噪声预测——都不是 Flow Matching

不同点

维度OASISSwiftVLA
核心目标几何对齐:让中间表示对齐动作空间效率:推理时丢掉昂贵模态
辅助模态命运推理时保留深度 + SE(3) 轨迹分支推理时丢弃 4D 分支(mask-and-reconstruct 蒸馏)
中间表示性质SE(3) 位姿监督的隐状态(显式对齐动作空间)融合的 2D/4D token(仍在观测空间,但蒸馏了 4D 知识)
轨迹监督形式相机系 SE(3) 轨迹(ℓ1,axis-angle,显式几何,作解码器条件)未来 EE 轨迹(L2,监督 Fusion Tokens 做跨模态对齐)
核心创新把中间表示对齐到动作空间的 SE(3) 设计原则mask-and-reconstruct 训练期蒸馏
动作头query-based ACT 风格 ℓ1 回归条件扩散(噪声预测)
主打卖点OOD 泛化 90.8% + 数据效率(10 条示教)Jetson Orin 18× 快 / 12× 省显存
一句话对照:OASIS 关心"几何信息该放在中间表示的哪个空间"(观测空间 vs 动作空间);SwiftVLA 关心"怎么让几何信息在部署时免费"(训练用、推理丢)。两者正交、可叠加——见"创新方向"tab。

💡 可复用的 Trick 清单

从两篇论文里能直接"偷"到自己工作的模块化技巧:

Trick来源怎么复用
冻结大模型当特征源两篇用现成 4D/深度/几何大模型,参数高效地注入空间先验,不训练它
未来 EE 轨迹监督中间表示两篇用"接下来手要走的轨迹"塑造隐状态,比重建像素更任务相关
把监督隐状态路由进解码器OASIS(AuxTraj 消融)辅助分支光并行没用,必须把被监督的隐状态喂进解码器才有增益
相机系预测规避外参OASIS把中间量放传感器自身坐标系,省 camera-to-world 标定学习
axis-angle + RodriguesOASIS回归 SO(3)/SE(3) 时天然落流形,免正交化/事后修正
度量深度 > 相对深度OASIS精确操作要绝对物理尺度,选 metric depth 而非归一化/相对深度
mask-and-reconstruct 蒸馏SwiftVLA训练喂昂贵模态并要求重建,推理丢弃——省部署成本
FIFO 缓存 + 随机缓存长度训练SwiftVLA时序建模鲁棒性,尤其适合高频触觉信号

🚀 后续研究方向(论文创新点子)

① 两篇的直接融合:可丢弃的几何对齐

OASIS 的 SE(3) 轨迹对齐推理时要保留深度+轨迹分支(1.73B 总参)。把 SwiftVLA 的 mask-and-reconstruct 套上去:训练时用 SE(3) 轨迹 + 度量深度对齐中间表示,并要求重建它们;推理时丢掉深度分支和 SE(3) 预测器,只留被蒸馏的动作解码器。目标:拿到 OASIS 的几何精度 + SwiftVLA 的边缘效率。

② 触觉版 OASIS(接触轨迹对齐)

把 OASIS 的"SE(3) 轨迹对齐"换成"接触点 SE(3) 轨迹 / 法向力方向轨迹",监督视触觉策略隐状态并路由进解码器。用在 insertion/装配:把接触几何显式注入策略,可能比隐式学习更省数据。与 PACE 的 contact-rich 方向高度相关。

③ 触觉版 mask-and-reconstruct(接触先验蒸馏)

训练期用高分辨率光学触觉(GelSight)作掩码-重建目标蒸馏进策略,推理期仅用低成本本体/视觉。关键风险(必须实测):4D 能推理时丢弃是因为几何隐含在 RGB 里可重建;但接触力/滑动/材质是视觉不可见的,直接照搬"推理丢触觉"很可能大幅掉点。这本身就是一个值得写的实证问题。

④ 对齐中间用于失败检测

OASIS 的位姿监督隐状态与实际执行的偏差,可作为在线异常/失败信号——几何可解释的中间表示天然适合安全监控。可扩展成"预测轨迹 vs 实际轨迹残差触发重规划"的 slow-fast 机制。

⑤ 辅助模态"可蒸馏性"度量

建立一个指标:辅助模态 X 能否被主模态重建/推断——决定它适合"训练用、推理丢"(如 4D/深度)还是"必须保留"(如接触力)。这为 SwiftVLA 范式划定适用边界,是一篇干净的分析型论文。

共同陷阱提醒:两篇的几何增益都与"冻结大基座的质量"深度耦合。"无预训练"是相对的——基座(VLM/4D/深度模型)本身已重度预训练。迁移到触觉时若没有等价的强触觉基座,增益可能不成立。

自测:6 题检验理解