Qwen-RobotManip — 对齐释放规模化

Alignment Unlocks Scale for Robotic Manipulation Foundation Models · Qwen Team 2026

速览
核心命题
三重对齐
数据引擎
架构
OOD评测
评价与启发
资源配置
自测

一句话

先对齐,再扩规模。 机器人操作数据天然异构(不同本体/坐标系/动作空间/频率/相机),直接堆数据只会互相冲突。Qwen-RobotManip 提出在表征、运动、行为三个维度统一对齐后,异构大规模数据才能相互增强而非干扰——从而像语言/多模态基础模型那样吃下规模、获得真正的 OOD 泛化。

本页可靠性:整理自 Qwen-RobotManip 技术报告(Qwen Team 2026)及本地深度分析。架构参数、数据规模、实验数字来自报告;解读部分为学习者视角。原文:qwen.ai/blog · 代码(开源)

速览卡片

内容
团队Qwen Team(阿里),团队署名
基座Qwen3.5-4B VLM + flow-matching DiT 动作专家(基于 π0.5)
数据规模~38,100 小时操作数据 + 28M VL 样本,全部开源数据,无私有采集
核心创新三重对齐(表征/运动/行为) + Human-to-Robot 合成 + OOD-first 评测
代表结果LIBERO-Plus 91.4 vs π0.5 84.4;RoboTwin-C2R Hard 69.4 vs π0.5 47.9;真机 ALOHA OOD 87.5% vs π0.5 37.5% / StarVLA 0%
新提 benchmarkRoboTwin-IF(指令跟随)、RoboTwin-XE(零样本跨本体)
开源

核心命题:对齐是规模化的前提

读完你能回答:为什么机器人数据不能像文本那样"堆就行"?为什么标准 benchmark 高分不算数?

命题:语言/多模态模型能从 web-scale 异构数据获益,是因为不同数据源能在统一 token/语义空间中对齐。机器人操作数据却同时存在本体、坐标系、动作空间、控制频率、相机布局、任务语义六重差异——不先对齐,直接堆数据只会学到相互冲突的动作约定,规模变大反而干扰(interference)而非增益。

为什么标准 benchmark 骗人

论文 Figure 4 的关键发现:在标准 LIBERO/RoboTwin(训练测试共享相近视觉布局和任务结构)上,从零训练的模型也能追平甚至超过大规模预训练模型——说明标准 benchmark 高分很大程度来自分布内模式匹配(记忆),无法衡量预训练质量和真泛化。
模型/设置ID 表现OOD 表现含义
StarVLARoboTwin Easy 85.7%C2R Hard 10.6%标准高分≠OOD泛化
π0.5ID 强OOD 优于无预训练模型预训练在OOD显价值
Qwen-RobotManipID 强(LIBERO 99.2)OOD 更强(C2R Hard 69.4)对齐+规模化放大OOD能力

结论:OOD-first evaluation 才应该是 foundation model 的主评测协议。

三重对齐(全文核心)

读完你能回答:representation/motion/behavior 三层对齐分别解决什么、怎么做。

对齐层解决的异构问题具体做法
① 表征对齐(representation)不同机器人关节数/动作字段拼接混乱80 维 canonical state-action 模板,语义固定槽位
② 运动对齐(motion)EEF 位姿记在不同 base/camera frame,数值不可比camera-frame delta EEF + CaPE 相机位置编码
③ 行为对齐(behavior)不同机器人执行风格/动力学不同structured embodiment prompt + in-context policy adaptation

① 80 维 canonical 状态/动作模板

80 维 = 2 × 29维 per-arm block + 22 维 reserved

每个 29 维 arm block:
  7 维  joint position(关节位置)
  9 维  EEF pose(末端位姿)
  1 维  gripper state(夹爪)
  12 维 dexterous hand joints(灵巧手)

单臂 → 填一个 arm block; 双臂 → 填两个; 灵巧手 → 填 hand joints
不存在的维度置0,用 binary mask 从 loss 中排除
reserved 22 维 → 移动底盘等扩展自由度
关键:不同机器人不再"任意拼接"动作字段,而是在语义固定的位置提供监督。7-DoF 单臂的关节永远填在同一批槽位,跨数据集才能一致。

② camera-frame delta EEF(运动对齐)

光有 80 维模板还不够——不同数据集的 EEF pose 可能在不同坐标系记录。解法:把 EEF action 表达为相机坐标系下的 delta pose

直觉:如果两个机器人在图像里做相同的视觉运动,它们的 camera-frame delta action 数值也应该相近。 这让"相同物理运动"在数值动作空间中真正一致,是跨本体/跨相机的关键。代价:训练和推理都需要相机内外参,通过 CaPE(Camera Positional Encoding)注入 DiT cross-attention。

效果:RoboTwin-XE 零样本跨本体,camera-frame EEF 平均 23.9% vs joint control 14.5%;joint 空间几乎不能跨本体(<5%)。

③ 行为对齐:prompt + in-context adaptation

  • structured embodiment prompt:含 embodiment/instruction/speed/fps/camera view 等字段,让模型知道"当前是哪种机器人、任务是什么、执行节奏如何"。训练时随机丢弃 embodiment/speed/fps 15% 提高鲁棒性。
  • in-context policy adaptation:把同 episode 的历史 observation-state-action chunk 序列化成 context token 输入 VLM,模型无需参数更新就能从历史识别当前机器人的动力学和执行风格。
  • stochastic context sampling:从 episode 随机位置抽历史 chunk(而非总给最近的),避免模型直接复制最近 action。

数据引擎:38,100 小时怎么来的

读完你能回答:数据从哪来、human-to-robot 怎么合成、为什么要清洗。

数据类型来源规模
开源机器人数据OXE, AgiBotWorld-Beta, RoboMIND(2.0), Galaxea, RoboCOIN, DROID, RH20T, RDT-1B, InternData-A111,000+ 小时
第一视角人手视频EgoDex, VITRA, EgoVerse1,933 小时
H2R 合成机器人演示人手视频渲染到 15 种机器人形态24,808 小时
VL 数据VQA/grounding/OCR/ECoT/ego-video/2D trajectory28M 样本

全部开源数据,无任何私有采集——却达到 ~38,100 小时预训练语料。

Human-to-Robot(H2R)合成管线

动作对齐:
  MANO 手部关键点 → 构造虚拟手指
  拇指与index/middle加权中点 → gripper 位置
  两者距离 → gripper width
  抓取轴+腕到指尖方向 → gripper orientation
  滤波: 位置/宽度 Savitzky-Golay, 旋转 Gaussian-weighted SLERP

视觉对齐:
  SAM3 分割手臂 → ProPainter inpaint 删人手
  → 搜索机器人 base placement → MuJoCo IK 跟踪重定向轨迹
  → Depth Anything v3 场景深度 + 机器人渲染深度 → 遮挡合成

结果: 每段人手视频 → 多个机器人形态下的视觉-动作演示

数据清洗(必须正面处理)

状态/动作五步过滤:突变检测、state-action 趋势对齐、极值过滤、joint-EEF FK 一致性、base frame/EEF orientation 对齐。视频/语言三类检查:指令一致性、video-state 一致性、视频质量。

惊人发现:RoboMIND UR-type 数据中 81% episodes 未通过 state-action 趋势对齐检查。说明大规模机器人数据的质量问题不是边缘小事,而是训练基础模型必须正面处理的核心问题——没有清洗,规模会变成噪声甚至冲突。

模型架构

多视角图像 + 结构化prompt + 历史context
        │
        ▼
Qwen3.5-4B VLM backbone
        │  last-layer hidden states, D_vlm=2560
        ▼
Flow-Matching DiT Action Expert
        │  N=10 blocks, D_act=768, 12 heads
        │  state token + noisy action + query/context tokens
        │  偶数block attend视觉token, 奇数block attend语言token
        ▼
80维 canonical action chunk (binary mask只监督有效维度)
        │
        ▼ 推理: 4步 Euler flow-matching + RTC异步执行

关键实现

组件配置
VLMQwen3.5-4B,last-layer hidden D=2560
DiT 动作专家10 blocks,hidden 768,12 heads,偶数层看视觉/奇数层看语言
Flow Matchingt~Beta(1,1.5),x_t=(1-t)ε+t·a,预测速度 a-ε,推理 4 Euler 步
协同训练9:1 robot/VL 数据,L=L_FM+0.1·L_VLM,每 chunk 重复采样 8 次
架构选择last-layer cross-attention(消融胜过 layer-wise,且成本更低)
对比 StarVLA-PI 的"层级 cross-attn":Qwen-RobotManip 消融发现last-layer cross-attention(只用最后一层)在 LIBERO-Plus 上 87.5 反而高于 layer-wise 86.4,且计算更省,故选它。说明"取所有层"不一定更好,要看任务和成本。

OOD-first 评测体系

读完你能回答:论文用哪些 OOD benchmark、各测什么、结果如何。

评测协议矩阵

评测块Benchmark / 平台任务与数据为什么这样测复现状态
ID sanity checkLIBERO / RoboTwin Easy & Hard标准仿真任务,报告 ID success。证明对齐和大规模预训练不会破坏常规 benchmark,但这不是论文核心。未本地复现。
仿真 OODLIBERO-Plus / RoboTwin-C2R视角、初始状态、光照、背景、噪声、布局、clean-to-random 等扰动。证明 ID 高分不够,只有 OOD 才能检验 foundation model 泛化;也是 Qwen-RobotManip 批评标准 benchmark 的核心证据。未复现;页面基于论文表格。
语言指令跟随RoboTwin-IF同一视觉场景下不同语言要求不同动作。测模型是否真的用语言控制动作,而不是只靠视觉捷径。未复现。
跨本体RoboTwin-XE / CobotMagic ALOHAzero-shot cross-embodiment;比较 joint、统一 EEF、camera-frame EEF。检验 representation / motion alignment 是否解决不同机器人动作空间不一致。未复现。
长程组合RoboCasa365 / EBench / RoboChallenge厨房长程组合、Isaac Sim 双臂移动平台、真实/综合挑战任务。验证从“短桌面任务”扩展到更复杂、多阶段、移动/双臂场景。未复现。
真机CobotMagic ALOHA / ARX / RoboChallengeID/OOD 真机任务,含接触/插入类失败案例。证明仿真 OOD 结论能部分迁移到真实平台,同时暴露纯视觉无力觉的接触短板。未复现;完整预训练和平台成本极高。

关键 OOD Benchmark 结果表

Benchmark测什么 OODQwen-RobotManip vs π0.5
LIBERO-Plus7维扰动(视角/初态/光照/背景等)91.4 vs 84.4(π0 仅 53.6)
RoboTwin-C2R(Clean2Rand)干净训练→随机化测试(视觉域OOD)Hard 69.4 vs 47.9(StarVLA 崩到 10.6)
RoboTwin-IF(新提出)指令跟随:同场景不同语言不同动作72.2 vs 49.6(测语言退化)
RoboTwin-XE(新提出)零样本跨本体迁移camera-frame EEF 23.9% vs joint 14.5%
RoboCasa365厨房长程组合(Composite-Unseen)Total 35.9 vs 16.9;组合未见 14.9 vs RLDX-1 5.4
EBenchIsaac Sim 双臂移动平台Overall 45.6 vs 27.1

真机结果(最有说服力)

平台/设置Qwen-RobotManipπ0.5StarVLA
CobotMagic ALOHA ID88.6%42.9%20.0%
CobotMagic ALOHA OOD87.5%37.5%0.0%
RoboChallenge Table30 Generalist45 / 59.8317.67 / 31.27
真机 OOD 上 Qwen-RobotManip 87.5% 而 π0.5 只有 37.5%、StarVLA 直接 0%——ID 上差距没这么大,OOD 才把预训练+对齐的价值拉开。RoboChallenge 以 20% 相对提升排名第一。

关键消融

  • 动作对齐:只有统一表征+camera-frame EEF 后,跨本体数据规模才呈现稳定 scaling law
  • VL co-training:去掉后 LIBERO 只降 0.9,但 RoboTwin-C2R 降 6.7/8.2、IF 降 7.0——越 OOD 越依赖 VL 数据保语义
  • H2R 数据:robot-only 54.7 → +ego 55.0 → +h2r 58.7(动作+视觉对齐才释放收益)
  • in-context:加 context 后需把去噪步从 4 提到 10 才不抖动,达 70.9

优点

  1. 问题定位精准:不追 LIBERO 高分,而是揭示标准 benchmark 无法衡量预训练质量
  2. 对齐框架系统完整:表征/运动/行为三层贯穿数据、模型、训练
  3. 数据工程规模大且细:38,100h + 24,808h H2R + 28M VL + 五阶段清洗
  4. 实验覆盖极广,与 π0/π0.5 对比充分,开源

局限

  • 完整预训练几乎不可复现(数据清洗/H2R渲染/15平台IK/38100h)
  • 无触觉/力输入:精密接触仍不稳(yellow-disc-insertion 2/5,Insert Screw 0/10)
  • H2R 合成依赖多个外部模型(SAM3/ProPainter/Depth Anything/IK),误差传播分析不足
  • 真机任务 trial 数偏少(5或10),置信区间宽

可借鉴的思想

① OOD-first 评测:只报分布内成功率容易被质疑是记忆,应主动设计 OOD 扰动(物体位姿/光照/背景/初态)。

② camera-frame delta EEF:把动作(乃至触觉)表达在相机/接触局部坐标系下,是跨本体/跨相机的关键。

③ 先对齐再规模化:触觉数据同样异构(传感器/坐标/量纲),可仿照 80 维 canonical template 构建统一触觉 token 模板。

④ in-context adaptation:把历史接触/力曲线作 context,让策略在 episode 内识别材料/摩擦/装配偏差。

一句话总结

Qwen-RobotManip = Qwen3.5-4B + flow-matching DiT + 三重对齐(80维canonical/camera-frame EEF/structured prompt) + 38,100h 全开源数据(含24,808h H2R合成) + OOD-first 评测,用"先对齐再扩规模"释放异构机器人数据的规模化能力。

训练/评测资源配置 🟠论文未明确·调研

诚实说明:Qwen-RobotManip 技术报告没有公开具体的 GPU 型号与数量。报告只定性说明"SFT 阶段相比预训练使用更少的 GPU 和更少的训练步数",未给出预训练集群规格。以下为基于可核对信息的量级推断,非论文原文数字,请勿当作确定值引用。
阶段可核对信息资源量级推断
预训练(Pre-training)~38,100 小时操作数据 + 28M VL 样本,4B VLM + flow-matching DiT,异构大规模语料🟠 这种数据规模的基础模型预训练通常需多机多卡集群(数十至上百张 A100/H100 级)、数天至数周。论文未给具体数字。
SFT(下游适配)论文明确:从预训练 ckpt 初始化,比预训练用更少 GPU、更少步数🟠 单节点 8 卡级即可完成下游 SFT(相对轻)。
评测LIBERO/LIBERO-Plus、RoboTwin(含 C2R Hard)、真机 ALOHA🟢 仿真 rollout + 真机部署,推理侧单卡即可(4B 级模型)。
为什么标 🟠:本站坚持不编造硬件数字。阿里 Qwen 团队有大规模训练基建,但报告未披露训练卡数/型号,因此这里只给"数据规模→资源量级"的合理推断,并明确来源。若后续官方补充配置,应替换为 🟢 核对值。
给复现者的实用判断:Qwen-RobotManip 的预训练几乎不可能在单机复现(数据与算力门槛都高);但它的价值主张是"对齐后可高效 SFT"——若官方放出预训练 ckpt,下游 SFT 用 8× A100 级即可,这才是普通实验室能触及的部分。

自测:6 题检验理解