OOD in Robot Manipulation

新物体 OOD 与方位 OOD:已分析论文图谱

基于本地已分析论文,对当前哪些工作真正能缓解机器人操作 OOD 做分层判断:哪些是强解法,哪些只解决一部分,哪些只能做验证器或辅助模块;并补充每篇工作用了哪些数据集、为什么这样设计任务。

整理时间:2026-07-02 · 主题:VLA / 世界模型 / 推理时引导 / 数据规模化

核心结论

现在已经有不少工作能部分解决 OOD,但没有一篇干净地同时解决 新物体 OOD + 方位/空间 OOD + 接触丰富操作 + 真机高成功率

必须拆开看:新物体 OOD 更偏 open-vocabulary object grounding、target selection、unseen affordance;方位 OOD 又要拆成语言方向词、物体位姿变化、精确 3D 空间约束、相机/本体坐标变化。混在一起会高估很多论文。

最强重训式路线

Qwen-RobotManip:靠大规模多源数据、动作/相机/行为对齐、OOD-first 评测来提高泛化。它不是小补丁,而是基础模型训练范式。

新物体强空间强复现成本极高

最强冻结 VLA 竞品

VLS / OmniGuide:都在推理时引导 frozen VLA。VLS 走 VLM 生成 reward + keypoint 几何;OmniGuide 走 3D attractor/repeller 能量场。

空间强新物体中等与 VLMGuide 高相关

最强 object-centric 替代路线

Goal-VLA:用图像生成 VLM 想象目标状态,再用语义匹配和点云配准反解 3D 位姿。强在刚体位姿,不是修复 VLA。

目标位姿强新物体中强绕过 VLA

真正未被干净解决的组合

新物体 grounding 进入动作生成 + 方位修正 + 接触/触觉闭环。现有视觉几何方法对接触力、滑移、插入角度、触觉确认仍弱。

研究空间仍在不能只讲识别

工作能力矩阵

工作 主要数据集 / 任务 新物体 OOD 方位/空间 OOD 机制 判断
ScaleQwen-RobotManip LIBERO / LIBERO-Plus、RoboTwin-C2R/IF/XE、RoboCasa365、EBench、CobotMagic ALOHA OOD、RoboChallenge 大规模多源数据 + H2R 合成 + 统一动作/相机坐标对齐 + OOD-first 评测 当前最强的“重训基础模型式”OOD 解法之一;复现成本极高,无触觉/力闭环。
GoalGoal-VLA RLBench 8 任务;真机 xArm 4 任务 中-强 生成目标图像,再用语义匹配和点云配准反解物体 3D 变换。 适合 rigid object-centric 操作;但绕过 VLA,用几何 pipeline。
GuideVLS LIBERO-PRO、CALVIN、Franka 真机 OOD 中-强 中-强 VLM 生成可微 reward,SAM/DINO/depth grounding 成 keypoint 几何约束,引导冻结 π0.5/OpenVLA。 与 VLMGuide 最直接相关;主要覆盖可 keypoint 化的几何 OOD。
GuideOmniGuide RoboCasa 仿真;DROID/Franka 真机 9 任务 很强 3D attractor/repeller 能量场,在 flow matching 去噪中引导冻结 π0.5/GR00T。 几何/空间 OOD 很强;语义目标要先被 VLM 转成 3D 点。
LALA4VLA DROID → LA-33K;MetaWorld、LIBERO、xArm 真机语言目标任务 中-强 language-action pretraining,削弱视觉捷径,强化语言条件动作先验。 对方向词和低层动作语义有帮助;不解决“选哪个新物体”。
LALAP OXE + MolmoAct 训练;LIBERO;DROID/Custom Franka/YAM/Kinova 真机 弱-中 把低层动作表达成自然语言,提升跨本体与动作语义对齐。 更像 cross-embodiment/action representation 解法,不是新物体 grounding 解法。
WMVERA DROID、PushT、MimicGen、Allegro-Sim/Real、Panda-Real 中-强 视频世界模型生成未来视觉,J-IDM 学图像空间雅可比,把视觉误差反解成动作。 像“视觉误差 → 动作修正”的世界模型路线;但需要目标本体 IDM。
WMDynaGuide CALVIN play data / benchmark;ARX 真机 cup preference DINOv2 latent dynamics + diffusion guidance。 对 goal/preference OOD 有用;不直接解决 open-vocabulary 目标选择。
VLAG0.5 LIBERO、RoboTwin 2.0、SimplerEnv、BEHAVIOR-1K、DROID、PP Bench、R1 真机 中-强 VLM-as-actor,自回归 CoT、BBox、Trace、ActionHint 与动作共享权重。 泛化结果强,但更多是重训路线;不是专门隔离验证新物体/方位 OOD。
VLAπ0.5 / π0.7 真实家庭长程任务、多本体机器人数据、web/VQA/检测数据;π0.7 另含子目标图像与 RL 专家蒸馏数据 π0.5 靠大规模 VLA 预训练;π0.7 加记忆和子目标图像。 可作为强 baseline,但不能说已解决;π0.5 仍可能偏向旧物体。
VerifyDWYS LIBERO-10-R / LIBERO-100-R reasoning 标注扩展;LIBERO OOD 变体 弱-中 runtime reasoning-action alignment verification。 更像验证器/拒绝器;候选动作里没有正确动作时,它不能生成 OOD 解法。

为什么要单独看数据集 / 任务设计

OOD 论文的说服力不只来自方法,还来自评测协议。一个数据集到底在测“新物体”“方位”“语言条件”“跨本体”还是“长程组合”,会直接决定这篇论文的 claim 是否成立。

判断原则:标准 ID benchmark 高分通常不够。真正有价值的数据集会主动打破训练分布中的某个先验:物体位置、物体身份、语言目标、相机/本体坐标、任务阶段或长程组合。

逐篇论文的评测与复现状态总表

论文核心 Benchmark / 任务主要 OOD 轴论文证据强度本地复现状态
VLSLIBERO-PRO、CALVIN、Franka 真机 OOD新物体、物体位置交换、任务规格改变、铰接件/可移动物体强:同一 frozen policy 上做 runtime reward guidance,能清楚归因 OOD 修正收益。未本地复现;当前为论文级分析。
Qwen-RobotManipLIBERO-Plus、RoboTwin-C2R/IF/XE、RoboCasa365、EBench、CobotMagic、RoboChallenge视觉域随机化、语言目标、跨本体、长程组合、真机扰动很强:benchmark 覆盖广,且有真机 OOD;但完整预训练复现成本极高。未本地复现;本地只做论文分析。
LAPLIBERO fine-tuning、DROID seen、Custom Franka/YAM/Kinova unseen跨本体、相机/夹爪/DoF/控制接口变化强:controlled baselines 只换 action representation,适合支撑跨本体 claim。已读本地官方代码;未跑完整训练/真机。
LA4VLAMetaWorld、LIBERO、xArm6 三个语言条件真机任务语言条件、视觉捷径、空间/方向泛化中强:真机任务设计好,但官方代码未实质发布。未复现;本地 LA4VLA 仓库当前无实质代码。
VERAPushT/Panda/Allegro 仿真,Panda-Real/Allegro-RealDoF 扩展、视觉推理 OOD、遮挡/位置/语义条件中强:证明 J-IDM 可把视频 planner 转动作,但基础任务仍弱于 DreamZero。未复现;本地仅论文分析。
DynaGuideCALVIN、ARX 真机 cup preference/hidden/novel behavior目标偏好、遮挡目标、新行为引导中强:清楚证明 runtime latent guidance,但任务相对简单。未复现;可作为低成本 guidance 复现候选。
Goal-VLA / OmniGuideRLBench、RoboCasa、DROID/Franka 真机任务目标状态、空间关系、碰撞/语义/轨迹 guidance中:适合 OOD guidance 思路对照,但不同论文对感知 oracle 依赖不同。未复现。
OOD 类型常用数据集 / 任务为什么用
新物体 / 目标选择LIBERO-PRO Object/Task、CobotMagic ALOHA OOD、VLS 真机 mug 替换、Goal-VLA 真机物体任务打破“训练时总抓旧物体”的动作先验,检查语言目标是否真正进入动作生成。
方位 / 位置 / 空间关系LIBERO-PRO Spatial/Position、Goal-VLA RLBench 物体位姿任务、OmniGuide RoboCasa clutter / 3D semantic target检查策略是否能跟随目标位置、空间关系、障碍和轨迹约束,而不是记忆固定布局。
语言条件 / 指令跟随RoboTwin-IF、LA4VLA 真机按钮/书架/九宫格任务、DWYS reasoning LIBERO 扩展同一视觉场景里只改语言目标,看模型是否真的听语言,而不是视觉捷径。
跨本体 / 坐标对齐RoboTwin-XE、LAP 的 Custom Franka/YAM/Kinova、VERA Panda/Allegro检查动作表示、相机坐标和动力学适配是否能跨机器人泛化。
长程 / 组合泛化LIBERO-10/Long、CALVIN、RoboCasa365、BEHAVIOR-1K检查多阶段任务中是否能切换阶段、避免局部 reward 卡死、处理组合任务。

VLS:为什么用 LIBERO-PRO / CALVIN / 真机 OOD

VLS 的问题定义:冻结的 π0.5 / OpenVLA 在训练分布外会失效,能否不重训、只靠 VLM 生成的可微 reward 在推理时把动作拉回正确方向?因此它需要选择“原始任务高分,一加扰动就崩”的 benchmark。

1. LIBERO-PRO:专门制造语义与空间 OOD

组成任务 / 扰动为什么这样测对 VLS 的意义
4 个 suiteGoal / Spatial / Object / 10-Long,每个 suite 10 个任务,每任务 20 episodes覆盖目标变化、空间关系、物体选择、长程任务四类能力。能区分 VLS 是只会单阶段抓放,还是能处理多阶段和长程。
Position / swap交换或移动物体位置,语言指令不变打破“目标总在固定位置”的视觉记忆。直接测试方位/空间 OOD;VLS 若有效,应把动作拉向新的正确位置。
Task 扰动同时改语言、目标完成状态、关注物体比同义改写更强,要求模型重新 grounding 新目标和新任务。测试 VLM reward 能否重写 frozen policy 的旧任务先验。
Object suite单阶段抓放,只换目标物体结构最干净,失败主要来自“抓错物体/旧物体偏置”。最适合证明 VLS 的 object grounding guidance 有用。
Goal / 10-Long多阶段和长程串联任务检查 stage recognition 和长期规划,而不是单步目标吸引。暴露 VLS 边界:没有可靠 stage 切换时,reward 可能卡在错误阶段。

VLS 使用 LIBERO-PRO 的关键不是“LIBERO 很常见”,而是 LIBERO-PRO 把原本容易被记忆的桌面任务改造成可控 OOD:同一底层策略、同一套任务,只改变位置或任务规格,从而能清楚归因“baseline 崩溃是因为 OOD”。

2. CALVIN:检验可移动物体和铰接件上的空间 reward

任务组测什么为什么用
MovableObjects随机放置的彩色方块等可移动目标目标位置随 episode 变化,固定 goal policy 或简单坐标引导容易失败;适合验证 VLM reward 是否能表达当前场景目标。
ArticulatedPartsdoor / drawer / button / switch 等铰接或交互部件目标不是简单抓点,而是空间方向、接触点和部件 affordance;能检验 reward 是否比 DynaGuide/ITPS 更任务特定。

CALVIN 的作用是补 LIBERO-PRO 的不足:它更强调长程语言条件操作和可交互部件,能展示 VLS 在“几何 reward 可表达”的动态目标上优于固定目标条件化或启发式 latent guidance。

3. 真机 Franka OOD:验证不是仿真技巧

真机 OOD具体设计验证意图
外观偏移未见黄盘等外观变化看 grounding 是否能承受视觉外观变化。
位置偏移交换两个盘子位置,指令不变看策略是否仍按旧位置执行,还是能根据当前图像更新目标。
物体偏移把 banana 换成未见 mug测试新物体 OOD;报告中最难的 mug 替换 baseline 0%,VLS 40%。

其他关键 OOD 论文的数据集选择

工作用了哪些数据集 / 任务为什么用这些任务在验证什么
Qwen-RobotManip 训练:OXE、AgiBotWorld、RoboMIND、Galaxea、RoboCOIN、DROID、RH20T、RDT-1B、InternData-A1、人手视频 EgoDex/VITRA/EgoVerse、H2R 合成、28M VL 样本。评测:LIBERO、LIBERO-Plus、RoboTwin-C2R/IF/XE、RoboCasa365、EBench、CobotMagic ALOHA OOD、RoboChallenge。 它的 claim 是“对齐释放规模化”,所以必须覆盖多机器人、多场景、多任务、跨本体、语言指令和真实扰动。单个 LIBERO 高分不能证明 foundation model 质量。 LIBERO/标准 RoboTwin 测 ID;LIBERO-Plus 测多扰动鲁棒;RoboTwin-C2R 测 clean-to-random 视觉 OOD;RoboTwin-IF 测同场景不同语言目标;RoboTwin-XE 测跨本体;RoboCasa365 测厨房长程组合;CobotMagic OOD 测真机扰动。
Goal-VLA RLBench 8 任务:Pick Up Cup、Open Wine Bottle、Put Shoe On Box、Take Plate Off Dish Rack、Take Frame Off Hanger、Plug Charger In Supply、Place Cup on Cabinet、Close Box;真机 xArm 4 任务:Tomato Placement、Table Sweeping、Weighing Duck、Bottle Stand-Up。 它要证明 training-free object-centric world model 能 zero-shot 操作,因此选择可由“目标状态图像 → 物体位姿变换 → motion planning”串起来的任务。 RLBench 测不同物体重定位、开合、插入供电口等几何目标;真机任务暴露深度、朝向、高度估计误差,尤其 Weighing Duck / Bottle Stand-Up 对几何精度敏感。
OmniGuide RoboCasa 仿真:pick-and-place、TurnSinkSpout、clutter、Multi-Choice;真机 DROID/Franka 9 任务:碰撞 static/dynamic/reactive,语义 Pictures/Objects/Trash Cans,人类模仿 Drawer/Cabinet/Oven。 OmniGuide 要证明“任意 guidance source 都能变成 3D 能量场”,所以任务按 guidance 类型分组,而不是按单一 benchmark 分组。 碰撞任务测 repeller;语义任务测 VLM pointing → 3D target attraction;人类模仿测 trajectory attraction。仿真用 ground-truth depth/object pose 是为了隔离感知误差,专测 guidance 机制。
LA4VLA 数据构造:DROID 9,560 episodes → VLM 分段 56,899 候选 → 人工校验 33,116 段 LA-33K。评测:MetaWorld Easy/Medium/Hard/Very Hard,LIBERO Spatial/Object/Goal/Long,真机 xArm 三任务:按 4 个按钮之一、把书插入 3 个书架位之一、把饮料放到 9 宫格之一。 它要证明“去视觉的 language-action pretraining 能减少视觉捷径,强化语言条件动作先验”。因此训练数据来自真实 DROID 演示,但预训练时故意去掉视觉。 MetaWorld 空间大、连续控制多,能放大动作先验收益;LIBERO Spatial 直接测方向/空间指令;真机三任务保持初始场景近似相同,只靠语言区分目标,专门测语言条件能力。
LAP 训练:OXE + MolmoAct,多数来自 DROID。评测:LIBERO fine-tuning,seen DROID setup,三个 unseen embodiments:Custom Franka、YAM、Kinova;真机任务包括 Pick and Place、Sort、Tissue、Put Towel、Pour,微调任务包括 Hang Tape on Rack、Fold Towel and Place in Basket。 LAP 的 claim 是 language-action 表示带来 zero-shot cross-embodiment transfer,所以必须用未见机器人本体验证,而不能只用同一本体仿真。 LIBERO 测标准 VLA fine-tuning;DROID/Custom/YAM/Kinova 测本体、相机、夹爪和动力学变化下,语言动作表示是否比 FAST/action token 更稳。
VERA DROID 39,816 episodes 做 Panda-Real video post-training;PushT-Sim、MimicGen Panda-Sim、Allegro-Sim、Panda-Real、Allegro-Real 60-217 episodes。 VERA 要证明 action-free video planner + J-IDM 能跨 DoF 和机器人工作,所以从 2-DoF PushT 到 7-DoF Panda 再到 16-DoF Allegro。 PushT/MimicGen/Allegro-Sim 测 J-IDM 随 DoF 扩展和 action reconstruction;Panda-Real 的 basic/occlusion/location/semantic 任务测视频模型的语义/空间想象能否通过 J-IDM 落成动作。
DynaGuide CALVIN play data / benchmark;真机 ARX cup preference pick-place。 DynaGuide 要证明独立 dynamics model 可以在扩散去噪中引导预训练策略,因此选择有现成 play data、桌面物体和铰接件的 CALVIN 训练 latent dynamics。 CALVIN 测 drawer、switch、button、cabinet、彩色方块等目标条件和低质量目标鲁棒;真机杯子偏好任务测 preference guidance 是否能改变已有策略行为。
G0.5 评测:LIBERO、RoboTwin 2.0、SimplerEnv-Bridge、BEHAVIOR-1K、DROID zero-shot、PP Bench、R1-Lite/R1-Pro 真机微调。 G0.5 是 generalist VLA,不是单一 OOD 修复模块,所以需要广覆盖:仿真、真机、移动操作、长程家务、零样本和微调。 BEHAVIOR-1K 测长程家务组合;PP Bench 和 Air Fryer/Cook Bacon 未见任务测 CoT/prompt 是否能 test-time steer 行为;R1 真机任务测同等微调预算下是否优于 π0.5。
DWYS / SEAL LIBERO-10-R、LIBERO-100-Basket-R、LIBERO-100-R;OOD 变体 Lang-Rephrase、Lang-Object-Property、Visual-Scene、Visual-Viewpoint;组合任务 10-Compose / 100-Basket-Compose / 100-Compose。 它要证明 reasoning-action alignment verification 能减少“说一套做一套”,所以需要 reasoning 标注数据和可并行 forward rollout 的仿真 oracle。 ID 测 plan 是否正确、动作是否忠实;语言/视觉 OOD 变体测验证器能否从候选动作里挑出与文字 plan 对齐的一条。注意:这是验证/重采样路线,不是新物体/方位的主生成解法。

新物体 OOD:谁真正相关?

如果“新物体 OOD”指的是训练没见过或分布外目标物体,模型要根据语言选对并操作,那么问题不只是识别,而是 grounding 是否进入 action head。

  1. Qwen-RobotManip:最强基础模型式答案。它在 LIBERO-Plus、RoboTwin-Clean2Rand、RoboTwin-IF、RoboCasa365、CobotMagic ALOHA OOD 上都明显强于 π0.5/StarVLA。它说明新物体/新场景 OOD 可以被“规模化数据 + 对齐正确的训练范式”缓解。
  2. VLS:最直接对 frozen VLA 有威胁。真机中 banana 换成未见 mug,baseline 0%,VLS 到 40%。这证明外部 VLM/视觉基础模型 grounding + 推理时引导可以把一部分新物体 OOD 从失败拉回来。
  3. Goal-VLA:如果任务是刚体物体的目标状态变化,它很强。图像生成式 VLM 直接想象完成后的目标图,再通过语义匹配和点云配准求物体位姿变换。
  4. G0.5 / VERA / DynaGuide:可算第二梯队。G0.5 通过自回归 CoT/BBox/Trace/action 共享权重提升 broad generalization;VERA 依赖视频模型想象正确未来;DynaGuide 依赖目标图或偏好条件。
不要把 LA4VLA/LAP 说成新物体 OOD 解法。LA4VLA 不看视觉做 language-action pretraining,本来就不负责 object localization;LAP 是动作表示与跨本体迁移范式,不是“新物体选择/定位”的主方法。

新物体 OOD 的真正难点

1. 目标选择

在多个干扰物里把语言目标 grounding 到正确物体。VLM 认得物体不等于 policy 会去抓它。

2. Action head 偏置

即使 backbone 识别正确,action head 仍可能沿用训练中旧物体/旧轨迹先验。这与你之前对 π0.5 的 probe 结果一致。

3. 新 affordance

面对新物体形状、功能、接触属性时,选择合理抓取和操作策略。现有视觉几何方法对此覆盖不足。

方位 / 空间 OOD 必须继续拆分

语言方向词

left/right/up/down/clockwise/counterclockwise、move/tilt/rotate 等低层动作语义。

相关工作:LA4VLA、LAP。

物体位姿 / 空间关系

目标位置、目标姿态、放置关系、障碍、轨迹形状等。

相关工作:Goal-VLA、OmniGuide、VLS。

相机 / 本体坐标变化

同一个视觉运动在不同机器人、相机外参、动作空间下如何对齐。

相关工作:Qwen-RobotManip。

图像误差到动作

从目标视觉状态或视觉差异反推出机器人动作修正。

相关工作:VERA、DynaGuide。

方位 / 空间 OOD 强竞品排序

  1. OmniGuide:最强 3D 几何能量场,引导冻结 VLA。适合碰撞、目标点、轨迹形状、空间吸引/排斥。
  2. Goal-VLA:最强 object-centric goal pose 反解,但绕过 VLA。
  3. VLS:最强 VLM-generated reward + frozen VLA 竞品,在 LIBERO-PRO position perturbation 和 CALVIN 可移动/铰接物体上有收益。
  4. Qwen-RobotManip:最强重训基础模型式空间/坐标对齐,camera-frame EEF、CaPE、统一动作模板都直接针对坐标和本体 OOD。
  5. LA4VLA / LAP:更相关于语言方向动作先验,不是精确 3D 几何解法。
  6. VERA / DynaGuide:更相关于世界模型/动态模型式视觉误差引导。

哪些不能过度解释为“解决 OOD”

π0.5 / π0.7

它们是强 baseline,但不能直接说已经解决 OOD。π0.5 的 web data 提升物体识别,但你自己的 probe 已显示它会偏向旧物体;这说明“VLM backbone 认得物体”不等于“action head 会指向新物体”。

DWYS

它是 runtime reasoning-action alignment verification,更像 verifier / rejection / reranking 模块。如果底层 policy 没有生成正确候选动作,验证器不能凭空产生正确 OOD 动作。

LA4VLA / LAP

它们对语言动作、方向词、跨本体动作语义有价值,但不能被说成“解决新物体 grounding”。不要把 action representation 的收益扩大成 object grounding 的收益。

Goal / Preference Guidance

DynaGuide、SuSIE/GHIL-Glue 等依赖 goal/subgoal/偏好条件。它们能帮助高层目标或偏好 OOD,但低层执行是否能泛化仍受 policy 训练分布限制。

对 VLMGuide / 新课题的直接判断

不能再主张“首次用 VLM 引导冻结 VLA”。VLS 和 OmniGuide 已经占住了这条主叙事。如果 VLMGuide 只停留在“VLM 生成约束 + 推理时引导 flow matching”,会被审稿人认为是 incremental。

更可防守的差异化

  1. 从几何 keypoint 引导升级到动作后果预测 / 视觉动态模型引导。VLS/OmniGuide 多数是把目标几何化后直接写 reward;如果我们预测动作导致的视觉后果,再与正负目标比较,叙事更接近世界模型/能量模型。
  2. 显式建模正负目标。尤其是负目标、错误目标、旧物体偏置。VLS 有正 reward,OmniGuide 有 repeller,但不等于系统性做“旧物体偏置拒绝”。
  3. 做闭环失败诊断和不确定性收手。不是恒定加引导,而是判断是否 OOD、是否要引导、引导多强、何时 abstain。
  4. 在组合 OOD 上证明现有视觉几何方法不够。新物体 + 方位 + 接触/触觉闭环,是更难被 VLS/OmniGuide/Goal-VLA 完整覆盖的区域。

论文写法建议

如果研究新物体 OOD必须讨论 Qwen-RobotManip、VLS、Goal-VLA、G0.5。问题表述不要说“VLA 不认识物体”,而要说“VLM 认识,但 action head 不跟随,仍受旧物体/旧轨迹先验支配”。
如果研究方位 OOD必须讨论 OmniGuide、Goal-VLA、VLS、LA4VLA/LAP、VERA。要明确是哪种空间泛化:方向词、目标位姿、3D 几何约束、相机/本体坐标,还是接触方位。
如果研究世界模型引导必须和 VERA / DynaGuide / Goal-VLA 划界:是生成目标状态、预测动作后果、还是从视觉误差反解动作。
一句话:Qwen-RobotManip 是当前最强的重训式 OOD 解法;VLS/OmniGuide 是最强的冻结 VLA 推理时引导竞品;Goal-VLA 是最强 object-centric 几何替代路线;真正还没被干净解决的是“新物体 grounding 进入动作生成 + 方位修正 + 接触/触觉闭环”的组合 OOD。