VERA — 把视频模型变成通用机器人策略

Turning Video Models into Generalist Robot Policies · MIT CSAIL 2026 · arXiv:2605.27817

← 返回 Study Hub
速览
两阶段架构
Jacobian IDM
与 IBVS 类比
实验
评价与启发
资源配置
自测

一句话

让 14B 视频生成模型保持"零动作(action-free)"当作梦想未来的世界模型,再训一个基于图像空间雅可比场的逆动力学模型(J-IDM),通过光流把"梦到的未来画面"反解成机器人动作。 一个视频规划器,多个 IDM——通往零样本、跨本体机器人控制的路线。

本页可靠性:整理自 VERA 论文(arXiv:2605.27817)、本地深度分析笔记与 ~/projects/VERA 仓库代码。公式(雅可比场/伪逆)、实验数字来自论文;"与 IBVS 类比""差异化空间"为学习者解读。原文:arXiv:2605.27817 · 项目页 · 代码

速览卡片

内容
团队MIT CSAIL (Sizhe Lester Li, Evan Kim, Xingjian Bai 等), CMU, Amazon
核心思路解耦"视频规划器(本体无关)" + "J-IDM(本体特异)"
视频模型Wan-14B 开源视频扩散 Transformer,LVP 初始化
J-IDM 骨干VGGT(真机) / DINOv2+DPT(仿真)
机器人Franka Panda(7-DoF) + Allegro Hand(16-DoF)
数据DROID 39,816 episodes(Panda真机);Allegro真机仅 60-217
关键结果Panda-Sim 94% vs UniPi 0%;真机挑战任务(遮挡/位置) 60-80% vs DreamZero/π0.5 都是 0%
开源是(HuggingFace 有模型;Wave1 已放 MimicGen+PushT)

核心贡献

  1. VERA 架构:完全解耦视频规划器(不碰 action)与本体特异 J-IDM
  2. Jacobian IDM:学习图像空间雅可比场 J(p,o)∈R^(2×n),通过正则化伪逆从光流反解动作
  3. 证明 J-IDM 在高自由度下比 Direct-IDM 数据效率高约 2×,且随 DoF 增长优势扩大
  4. 真机 Panda 零样本语言条件操作;16-DoF Allegro 手纯 RGB 灵巧方块重定向

两阶段:规划器 + 翻译器

VERA = Action-free 视频世界模型(规划器) + Jacobian IDM(翻译器)。二者独立训练:

[观测历史 o≤t + 文本指令 g]
        │
        ▼
┌─────────────────────────┐
│ 视频世界模型(规划器)      │  Wan-14B, Diffusion Forcing
│ Action-Free!            │  输入 N=6 context帧, 输出 M=4 future帧
│ 本体无关, 训一次         │  只 commit K=1 前缀
└──────────┬──────────────┘
           │ 梦到的未来帧 ô_{t+1..t+K}
           ▼
┌─────────────────────────┐
│ 光流估计器(现成)         │  RAFT / AllTracker
└──────────┬──────────────┘
           │ dense flow v_t(p) ∈ R^{H×W×2}
           ▼
┌─────────────────────────┐
│ Jacobian IDM(翻译器)     │  VGGT / DINOv2+DPT
│ 本体特异, 每机器人训一个  │  输出 dense per-pixel Jacobian
│ δa = J†·v (正则化伪逆)   │
└──────────┬──────────────┘
           │ 动作块 â_{t:t+K}
           ▼
   执行 → 拿新观测 → 重新查询规划器(闭环 receding-horizon)

为什么要解耦?

视频规划器保持本体无关——它只"想象世界应该变成什么样",不关心是哪个机器人。
不同视频模型可随意替换而无需重训 IDM。
IDM 可用容易获得的自玩(self-play)数据独立训练——不需要昂贵的专家演示。
一个视频规划器,配多个 IDM,就能覆盖多种机器人本体。

视频规划器细节

  • 骨干 Wan-14B,用 LVP(Large Video Planner) checkpoint 初始化
  • 训练目标 Diffusion Forcing,只预测未来帧,不碰 action
  • 机器人后训练:在 DROID 39,816 episodes 上做 video-to-video 微调
  • 多视角:多相机拼成单张宽图输入 tokenizer
  • N=6 context latent 帧,M=4 预测帧,K=1 committed prefix,40 步 UniPC 采样

核心思想:图像空间的雅可比场

把经典机器人学的雅可比概念推广到图像空间——学习一个 dense per-pixel Jacobian field,表达"动作微增量如何驱动每个像素运动"。

给定图像 o,image-conditioned transformer J 对每个像素 p 输出一个矩阵,满足线性化关系:

δp = J(p, o) · δa

其中 δa∈R^n 是动作增量,δp 是该像素的运动,J(p,o)∈R^(2×n)。

训练目标(前向+逆向联合损失)

L = Σ_p ρ( J(p,o)·δa − v(p) ) + w_a · Σ_p ‖ δa − J†·v(p) ‖²
  • 前向项:用雅可比×动作去预测像素流,对齐真实光流 v(p)
  • 逆向项:用伪逆从光流重建动作,对齐真实动作(w_a=0.3)
  • ρ(x)=√(x²+ε²) 是 Charbonnier loss(鲁棒 L1)

推理:从光流反解动作(正则化伪逆)

δâ = argmin_δa Σ_p ‖ J(p,ô)·δa − v(p) ‖² + λ‖δa‖²

即对所有像素的雅可比方程做 ridge 正则最小二乘,闭式解:

δâ = (JᵀJ + λI)⁻¹ Jᵀ v

本质是把"所有像素怎么动"这海量约束,最小二乘地压回到低维动作 δa 上。

为什么 J-IDM 比 Direct-IDM 好

Direct-IDM 直接学"图像→动作"的黑箱映射,高维动作(如 16-DoF 灵巧手)下需要海量数据。J-IDM 把映射结构化为局部线性的雅可比——雅可比是局部性质、对任何运动方向都覆盖,所以:① 高 DoF 下数据效率约 2× Direct-IDM;② 随 DoF 增长优势扩大;③ 是唯一在 DoF 增长时保持 faithful reconstruction 的模型。

VERA ≈ 神经版、dense-flow 版的 IBVS

VERA 的数学形式与经典的 基于图像的视觉伺服 (IBVS) 高度相似:

经典 IBVSVERA
误差手工特征误差 e = s* − sdense optical flow v(p) = Flow(o_t, ô_{t+1})
雅可比解析图像雅可比 / 交互矩阵 L学习的 dense per-pixel 雅可比场 J(p,o)
求解相机速度 v = L† e动作 δa = J† v (ridge 正则)
目标来源人工给定目标特征 s*视频生成模型"想象"出的未来画面

三个关键区别

  1. VERA 的"误差"不是手工设计的特征误差,而是dense 光流
  2. VERA 的雅可比不是解析模型,而是用机器人 self-play 数据学出来的
  3. VERA 的目标不是人工给的,而是视频生成模型想象出来的下一步视觉状态
一句话:VERA 保留了 IBVS "视觉误差 → 雅可比伪逆 → 动作"的核心思想,但把目标生成和雅可比都学习化了

VERA 不是 action-conditioned 世界模型

注意区分两种世界模型思路:
Action-conditioned(ContactWorld/DynaGuide/VTWM):"如果我执行动作 a,会发生什么" → 预测未来 → 评价动作。
VERA:"世界应该变成什么样"(想象目标未来) → 再用 J-IDM 反解"我该怎么动"。
VERA 先想目标、再反解动作,方向相反。

评测协议矩阵:作者到底测了什么

评测块Benchmark / 平台任务与数据为什么这样测复现状态
仿真低/中/高 DoFPushT / Panda-Sim / Allegro-Sim2-DoF、7-DoF、16-DoF 三档动作空间;比较 UniPi 和 J-IDM。验证 J-IDM 的图像雅可比反解是否随 DoF 增大仍可用,避免只在低维 PushT 上成立。未本地复现。
数据效率/DoF 扩展J-IDM scaling analysis固定 DoF 改数据量、固定数据量改 DoF,报告 reconstruction / action recovery。证明 J-IDM 比 Direct-IDM 更适合高维机器人动作,不只是多一个网络名字。未复现。
真机基础任务真实机器人 push/pick与 DreamZero、π0.5 对比,基础任务 DreamZero 更高。暴露 VERA 的短板:video-to-action 翻译仍是瓶颈,基础控制不一定最强。未复现;真机数据不可用。
真机推理/OODHidden Button / Location-based / Semantic-based遮挡按钮、位置条件、语义条件等任务。检验冻结/微调视频 planner 的视觉推理能力是否能通过 J-IDM 转成动作;这部分 VERA 明显强于 DreamZero/π0.5。未复现。
视频模型初始化Random / Wan-14B / LVP-14B比较 validation MSE。证明 VERA 的 planner 依赖视频预训练和机器人视频 warm-start,不是随机初始化即可。未复现。
对 VLMGuide 的意义:VERA 的实验同时说明“图像误差→动作”的路线有效,也说明它需要训练 J-IDM 和视频 planner;如果我们主打冻结 VLA 的轻量 runtime guidance,必须在复现实验中强调成本和部署差异。

仿真结果

ModelAllegro-Sim (16-DoF)Panda-Sim (7-DoF)PushT (2-DoF)
UniPi*0.00.074.4
J-IDM (VERA)70.094.092.5

(成功率 %) UniPi 在高 DoF 完全失败,VERA 稳定完成。

真机对比 (vs π0.5, DreamZero)

任务类型VERADreamZeroπ0.5
Push/Pick 基础60%90%30%
遮挡(隐藏按钮)80%0%0%
基于位置60%0%0%
关键发现:基础任务 DreamZero>VERA>π0.5,但 VERA 的失败源于 video-to-action 翻译不精确,而非视觉规划失败。挑战性推理任务上 VERA >> 其它(都 0%),证明解耦架构保留了视频模型的推理泛化能力。

视频模型初始化消融

初始化Val MSE ↓
Random(14B)0.40
Wan-14B 预训练0.13
LVP-14B warm-start0.10

优点

  1. 解耦优雅:一个视频规划器 + 多个 IDM,视频模型可换、IDM 用自玩数据独立训
  2. J-IDM 数据高效且能扩展到高维动作(16-DoF 灵巧手)
  3. 保留视频模型推理能力:挑战性推理任务上远超端到端 VLA
  4. 零样本语言条件操作 + 纯 RGB 灵巧手控制

局限

  • 仍需机器人特定视频做规划器后训练;J-IDM 需该本体 self-play 数据(换机器人要重训 IDM)
  • 依赖现成光流估计器,其质量直接决定 J-IDM 性能
  • 无法从纯 RGB 推理力控(force-based control)
  • 预测帧像素运动很小时,动作恢复精度下降
  • 14B 模型 40 步去噪 + 光流 + 伪逆,推理延迟高,实时性堪忧
  • 基础任务不如 DreamZero(60% vs 90%),翻译保真度是瓶颈

可借鉴 / 差异化空间

可借鉴:把"视觉变化→雅可比伪逆→动作"这套 IBVS 思想神经化、dense 化,用于任何"目标图/未来帧→动作"的转换。

VERA 已占的地盘:"图像误差→动作映射"本身已被 VERA 占得很实,不建议 claim 为新点。

差异化空间:① 不替代 VLA 而是修正已有 VLA;② 不用 14B 视频模型而用轻量目标/误差信号;③ 加触觉/力解决 VERA 明确不擅长的 contact-rich / force control;④ 把 IBVS 思想从视觉像素层转到 tactile/contact latent 或 VLA 内部表示层。

一句话总结

VERA = action-free 视频世界模型(梦想未来) + Jacobian IDM(用学习的图像雅可比场把光流反解成动作),是神经版、视频驱动的 IBVS,走"解耦规划+忠实翻译"路线实现零样本跨本体控制。

训练/评测资源配置 🟢论文核对

来源:VERA 论文附录 A.1(架构与训练配方)。核心是基于 Wan 家族视频模型的两个规模变体,混合精度训练。

模型变体用途训练硬件初始化
Wan-1.4B(文中亦记作 Wan-1.3B)开发 & 视频模型消融单张 H100Wan-family checkpoint
Wan-14B主实验(main results)1 个节点 8× H200Wan-family / LVP checkpoint

所有运行使用混合精度。VERA 分两部分:video world model(上表,是资源大头) + 轻量的 Jacobian IDM(把预测帧对反解成动作,参数远小于视频模型)。

门槛解读:VERA 的资源画像是典型的"视频世界模型"量级——主实验用 14B 视频模型 + 8× H200 一个节点,这是当前视频驱动 WAM 的主流开销(也正是 ImageWAM 想省掉的部分)。想低成本复现/迭代可用 1.4B 变体单张 H100,论文的开发与消融正是这么做的。IDM 部分很轻,不是瓶颈。
对照记忆点:把 VERA(8×H200 视频生成)和 ImageWAM(8×H20 图像编辑、推理不解码)、DynaGuide(单 3090 引导冻结策略)三者的资源画像并排看,正好体现"视频 WAM → 图像编辑 WAM → 推理时引导"这条逐级降本的技术脉络。

自测:5 题检验理解