VLA Guidance / World-Change / Visual Prompt 六篇横向对比

Bridge-WA · ProgressVLA · TraceVLA · VP-VLA · SwiftVLA · OASIS | 选题碰撞风险与 2D-RPF/CAPE 差异化路线

总览结论
Idea 空间
Benchmark
碰撞风险
对我们方案
单篇入口
本页基于 6 篇 PDF 原文核对与本地 rp 分析文件整理;代码仓库除 SwiftVLA/OASIS 已有页面外,本轮未在本地找到其余四篇源码。目标不是复述论文,而是判断它们对当前课题的边界约束。

最终结论

这 6 篇已经把“VLA 外部引导/视觉提示/世界变化/进度/几何中间表示”的主要自然方向占掉了大半。当前 2D-RPF/CAPE 如果想发顶会,不能再停留在“画提示、估进度、预测哪里变、引入轨迹/几何”这几个泛化表述上。

最稳的差异化表述应是:动作候选的任务关系进展验证。即给定 language plan、当前 RGB、候选低层动作/动作文本,显式判断这个候选动作是否推动目标对象-目标区域-任务阶段关系朝正确方向变化,并在推理时 rerank/reject,而不是重新训练一个“更会看图的 VLA”。

六篇分别占据什么位置

论文占据的 idea 空间一句话边界
Bridge-WAworld-change priorswhere/how changes已经占据“预测世界哪里变、怎么变并注入 policy”。
ProgressVLAprogress guidancediffusion gradient已经占据“任务进度估计 + 推理时引导扩散动作”。
TraceVLA2D visual tracehistory prompting已经占据“CoTracker 2D 历史轨迹画到图像上增强 VLA”。
VP-VLAvisual prompt interfaceinstruction decomposition已经占据“System-2 分解指令 + SAM 画 crosshair/bbox + VLA 执行”。
SwiftVLA4D distillationlightweight VLA已经占据“训练时学 4D 时空动态、推理时丢 4D”的效率路线。
OASISSE(3) trajectoryaction-space alignment已经占据“用 SE(3) 末端轨迹把中间表示对齐动作空间”。

对顶会选题的硬约束

  • 不能只说“我们提升 VLA 指令跟随”,这太泛。
  • 不能只做“结构化 instruction + 目标框/点提示”,VP-VLA 已覆盖。
  • 不能只做“历史 2D 轨迹提示”,TraceVLA 已覆盖。
  • 不能只做“进度估计引导动作”,ProgressVLA 已覆盖。
  • 不能只做“预测未来变化区域/flow”,Bridge-WA 已覆盖。
  • 不能转向“SE(3) 轨迹中间表示”但又不做 3D/外参/深度,OASIS 已是强参照。

机制维度对比

维度Bridge-WAProgressVLATraceVLAVP-VLASwiftVLAOASIS
输入提示future tokens/change/flow priorsprogress scalar原图+trace图原图+visual prompt图训练期2D+4D特征RGB+metric depth features
是否预测未来是,未来变化 teacher间接,world model 预测 future latent否,历史 trace否,当前阶段提示训练期未来轨迹监督预测未来 SE(3) 轨迹
是否推理时引导policy conditioningclassifier guidance 修正扩散采样输入增强输入接口增强推理无 4D,知识内化中间表示进入动作解码
是否依赖 3D主要视觉变化先验视觉 latent2D RGB2D RGB4D 几何 teacher,但推理纯 RGBmetric depth + SE(3)
对我们最相关where/how changeprogress guidance2D tracevisual prompt + instruction structuring时空表征蒸馏轨迹/动作空间对齐

从“提示”到“验证”的差别

VP-VLA
告诉策略看哪里
TraceVLA
告诉策略刚才怎么动
ProgressVLA
告诉采样如何提高进度
建议路线
判断候选动作是否真的让关系进展

这就是 2D-RPF/CAPE 还能站住的位置:不是给 VLA 更多输入,而是给 VLA 的候选输出一个结构化、对象中心、任务阶段相关的“验收器”。

Benchmark 与任务覆盖

论文Benchmark/平台任务/评测重点为什么选这些
Bridge-WAVLABench, RoboTwin2.0, LIBERO-Plus, Dobot 真机复杂操作、Easy/Hard、OOD 变体、真实桌面任务验证 world-change priors 是否提升“哪里/如何变化”的跨场景操作。
ProgressVLACALVIN ABC→D, LIBERO, ARX AC-One 真机CALVIN 连续五任务;LIBERO Spatial/Object/Goal/Long;真实操作progress guidance 天然适合长程、多阶段和目标完成度评测。
TraceVLASimplerEnv, WidowX-250 真机, LIBERO相机/光照/背景/干扰物变体;8 个 WidowX 任务;LIBERO 四套件验证 2D 历史轨迹对空间-时序鲁棒性的贡献。
VP-VLARoboCasa-GR1-Tabletop, SimplerEnv, 真实 OOD24 个厨房 tabletop 多阶段任务;4 个 SimplerEnv 任务;waste sorting / colored egg / egg carton placement直接验证视觉提示接口对 OOD 物体、颜色、位置指令跟随的帮助。
SwiftVLARoboTwin2.0, LIBERO, 真实任务, Jetson Orin短/中/长程任务、LIBERO 四套件、真机和边缘效率证明 4D 蒸馏能让轻量 VLA 保持时空能力且低延迟。
OASISLIBERO, CALVIN ABC→D, 真机 OODLIBERO 四套件;CALVIN 五连任务;背景/视角/人为干扰验证 SE(3) 中间表示对几何精确操作和 OOD 真实部署的价值。

关键数字

论文代表结果解读
Bridge-WAVLABench Avg SR 52.8;LIBERO-Plus Avg 72.1;Dobot Hard 69.1%world-change priors 对复杂和真机 hard split 有明显价值。
ProgressVLACALVIN Full Avg.Len 3.73;LIBERO Full Avg 84.5progress guidance 对长程和扩散采样有稳定增益。
TraceVLALIBERO Avg 74.8 vs OpenVLA 70.6;Long 54.1 vs 45.7;真机约 3.5× OpenVLA2D trace 对历史依赖和长程任务帮助更大。
VP-VLARoboCasa Avg 53.8 vs QwenOFT 48.8;SimplerEnv 58.3;colored egg OOD color 75.0 vs 29.2visual prompt interface 对精确 grounding/OOD 指令跟随非常直接。
SwiftVLALIBERO Avg 94.7;Jetson Orin 0.167s/1398MB/SR 0.76效率路线强,不是我们当前主要竞争点,但说明时空知识可训练期蒸馏。
OASISLIBERO 97.6;CALVIN 4.57/五连 83.3;真机 89.2;OOD 90.8几何中间表示路线很强,但需要 metric depth/SE(3) 设定。

与当前 2D-RPF/CAPE 的碰撞矩阵

我们可能想说会撞谁为什么撞避让方式
预测世界哪里会变、怎么变Bridge-WAchange map / motion-flow map 已是核心贡献改成“候选动作是否导致正确关系进展”,不是预测全局变化先验。
用任务进度引导动作ProgressVLAprogress estimator + world model + classifier guidance 已覆盖不要用单标量 progress;做对象-关系-阶段分解的 action suitability。
用 2D 点轨迹增强时空理解TraceVLACoTracker visual trace prompting 已覆盖轨迹只能作为证据之一,不能作为主贡献。
把 instruction 结构化,再画目标框/点VP-VLASystem-2 planner + SAM3 + crosshair/bbox 已覆盖结构化和视觉提示只做前端,主贡献放在 action verification。
训练时引入时空/4D 表征,推理时高效SwiftVLA4D distillation 已是完整论文除非有强新模态/新蒸馏机制,否则不作为主线。
对齐图像轨迹/语言/末端轨迹OASIS + TraceVLAOASIS 对齐 SE(3) 轨迹,TraceVLA 对齐 2D visual trace若坚持 2D,应明确“不预测/回归轨迹本身,而评估候选动作造成的关系变化”。
最危险的方案表述:“我们把语言指令结构化,利用 2D 图像轨迹和视觉提示增强 VLA 的空间-时序理解,从而提高 OOD 指令跟随。”这句话几乎同时撞 VP-VLA、TraceVLA、ProgressVLA。
更安全的方案表述:“我们提出 relation-progress verification:把 VLA/DP/ACT 生成的候选低层动作转化为可验证的对象-区域-阶段关系进展问题,在推理时显式拒绝 wrong-object、wrong-region、wrong-stage、no-progress 动作。”

建议的最终机制骨架

结构化指令
stage / target / relation
候选动作生成
VLA / DP / ACT / LAP
短视界视觉后果/运动证据
2D flow / mask / trace / latent
Relation Progress Verifier
对象-区域-阶段评分
rerank / reject / repair

三个必须做出的新意

  1. 从“目标提示”升级到“候选动作验收”:VP-VLA 告诉策略看哪里;我们判断策略给出的动作是否会让正确关系进展。
  2. 从“单标量进度”升级到“错误类型可解释进展”:ProgressVLA 的 progress 是 p∈[0,1];我们输出 wrong-object / wrong-region / wrong-stage / no-progress 等分解错误。
  3. 从“历史轨迹输入”升级到“动作-后果一致性”:TraceVLA 用历史 trace;我们要用候选动作导致的短期视觉/关系变化作为证据。

最小可验证闭环

阶段要交付通过标准
Week 1在 LIBERO/SimplerEnv 上生成候选动作集和失败类型标注脚本能稳定复现 baseline failure,并分出 wrong object/region/stage/no-progress。
Week 2实现 2D relation progress verifieroffline 能区分正确动作与 plausible-but-wrong 动作;不仅看分类准确率,还看候选排序。
Week 3接入 reranking/rejection 到现有 policy标准任务成功率不下降,counterfactual/OOD split 明显下降错误率。
Week 4对比 VP-VLA/TraceVLA/ProgressVLA 风格 baseline证明不是画框、不是历史 trace、不是单标量 progress 带来的收益。
Week 5消融 + failure case + 论文图能讲清“关系进展验证”作为新能力维度成立。
如果 Week 2 发现 verifier 只能在离线数据上分类准确、但不能改变 candidate action selection,课题应降级为诊断/数据论文,不宜继续包装成顶会主线。

单篇网页入口