世界模型全景 — 机器人操作方向

显式 vs 隐式预测 · 视觉-触觉矩阵 · 开环/闭环 · MPC+CEM 规划 · 基于 30+ 篇论文分析

← 返回 Study Hub
什么是世界模型
三大分类
显式 vs 隐式
视触觉矩阵
开环 vs 闭环
MPC+CEM 规划
选题结论
资源量级
自测
本页可靠性:整理自本地"世界模型相关论文总结.md"(基于 30+ 篇论文的深度分析)。分类判定、开环/闭环、MPC+CEM 归属均按笔记中源码核对+论文原文的结论;个别边界案例(如 VTWM 的 open-loop chunk)已按笔记标注。严肃引用前建议对照各论文原文。

什么是"世界模型"

世界模型(World Model)是一个能预测"未来会怎样"的模型。在机器人里它回答的核心问题通常是两类之一:

  • Action-conditioned(动作条件):"如果我执行动作 a,世界(图像/触觉/状态)会变成什么样?" → 用来评价/搜索动作
  • Action-free(目标想象):"这个任务下,未来应该变成什么样?" → 再用别的模块反解动作(如 VERA)

各类数据/模型在 VLA 生态里的分工

VQA/VL 数据负责"看懂说清",VLA 演示负责"会动手",人类视频负责"扩多样性",仿真负责"便宜扩规模",触觉/力负责"接触动力学",失败数据负责"知错能改"——而世界模型负责"预测未来、想象后果",是连接感知与规划的桥梁。

关键认知:别被"latent"骗了

"在 latent 里预测" ≠ "latent 空间预测"。很多视频扩散世界模型在 VAE latent 里去噪,但它们的目标是生成/预测未来视频(可解码回像素),所以应归为"显式可解码预测",而非"latent 空间预测"。判定标准看最终训练目标和评估对象是否可解码成未来观测

三大分类

类别预测什么典型
① 显式可解码预测直接预测可解码的未来观测(图像/视频/触觉图/力/音频)。即使在 VAE/video-token latent 里去噪,目标仍是可解码的未来观测Cosmos, DreamZero, DreamTac, VTAM, UniPi, LVP
② latent/embedding 预测预测紧凑状态(DINO/V-JEPA/触觉encoder latent/TD-MPC state),控制/规划直接在 latent 空间算代价,不还原像素V-JEPA2, DynaGuide, ContactWorld, FOWM, DDP-WM
③ 混合 / 边界训练时带可解码未来预测、推理时主要出动作;或是 benchmark/surveyFast-WAM, DeFI, LAPA, World-VLA-Loop

被引频次(基于全库 195 篇扫描)

#数据集/平台被引类型
1DROID / Isaac 系列31真机数据 / 仿真器
3LIBERO(含变体)29仿真 benchmark
4Open X-Embodiment21跨本体预训练
5BridgeData V218真机预训练
6RoboCasa(含365)15仿真 benchmark
7CALVIN13仿真(ABC→D 为 OOD)
8SimplerEnv12仿真评测(真机对标)

① 显式可解码预测

纯视觉/视频世界模型

共同点:预测目标常写成 latent video token / VAE latent,但最终语义是"未来画面/视频"。

方法年份预测目标 / 用途
UniPi2023文本条件未来视频 → inverse dynamics 转动作
Genie2024离散视频token+latent action,交互式下一帧(可交互生成环境)
Cosmos2025未来视频/动作条件下一帧,world foundation model
LVP2025规划用未来视频(video-as-plan),再接 action model
DreamVLA2025生成式未来视觉/动作表征,增强 VLA
DreamZero2026未来视频latent+动作(world-action model),零/少样本策略
tau0-WM2026统一 video-action,动作条件视频模拟/规划
Cosmos32026图像/视频/音频/动作多模态未来观测(omni-modal)
CosmosPolicy2026未来视频帧+动作+未来状态/价值 latent frame
RISE-WM / DreamDojo / EgoWM / GigaWorld-02026动作条件未来视频,作想象环境/策略基座

视触觉可解码世界模型(对触觉方向最相关)

方法预测目标VAE 类型
OmniVTA未来视觉序列 + TacVAE 触觉 latent,用于接触概率+门控融合TacVAE
DreamTac统一预测未来视觉/触觉 latent/动作,可 VAE 解码可视化Vision-Tactile VAE
VTAM未来多视角视觉帧 + GelSight 触觉帧/latent,flow matchingVideo VAE
MMVP早期,未来 RGB + haptic/audio/vibration 多模态信号

② latent / embedding 空间预测

核心不是"生成给人看的画面",而是学一个服务控制的状态动力学;预测结果是 feature/latent,规划代价也在这个空间算。

视觉 latent/feature dynamics

方法预测控制
FOWM下一 latent state z(TD-MPC 风格)MPC/TD learning + online fine-tune
V-JEPA2未来 V-JEPA embeddingCEM/MPC 在 feature space 规划到 goal
DynaGuide未来 DINOv2 patch featuregradient guidance / feature-space 规划
DDP-WM下一 DINO feature(稀疏前景+低秩背景)MPC cost in feature space

触觉/接触 latent dynamics

方法预测控制
MvM触觉膜形变 latent、wrench/poseMPPI/MPC
TS-NVAENewtonianVAE 物理对齐 latentlatent-space 比例控制
ContactWorld下一 multimodal latent(JEPA)CEM/MPC 接触规划
VTWM视觉 token + Sparsh-X 触觉 embedding 的未来状态CEM 有限时域规划
DreamTacVLA / TacForeSight未来触觉 latent(策略前瞻)注入策略精炼动作

③ 混合 / 边界

  • Fast-WAM:训练时世界模型化,推理时直接出动作
  • DeFI:GFDM 未来视频 + GIDM latent action,混合
  • LAPA:主体是 latent action pretraining,下一帧重建是副产物
  • WorldArena / WorldGymnast / WM-ManipSurvey:benchmark/综述

视觉-触觉预测四象限

口径:强显式=可解码为图像/视频/触觉图/形变场/haptic;弱显式=模态专属 token/embedding 预测目标但控制在 latent 空间;隐式=只进共享 latent,不单独输出该模态未来观测;N/A=不涉及该模态。

7.1 同时显式预测视觉和触觉

方法视觉触觉
MMVP强显式:未来RGB强显式:haptic/audio/vibration
OmniVTA强显式:未来视觉序列强显式:TacVAE 未来触觉
DreamTac强显式:未来视觉latent(可视化)强显式:未来触觉latent(可视化)
VTAM强显式:未来多视角视觉帧强显式:未来GelSight触觉帧
VTWM弱显式:未来视觉state/token弱显式:Sparsh-X触觉embedding

7.3 只显式预测触觉,视觉隐式(触觉前瞻策略)

方法视觉触觉
DreamTacVLA隐式(进VLA hidden)弱显式:未来触觉embedding
TacForeSight隐式(DINOv2编码)弱显式:未来触觉latent
ViTacFormer隐式:视觉token融合弱显式:自回归未来tactile token
PACE隐式:进ACT策略弱/结构显式:未来触觉/contact delta
MvMN/A弱显式:触觉膜形变latent+wrench/pose

7.4 视觉触觉皆隐式

方法说明
ContactWorldJEPA 式隐空间,只预测下一 multimodal latent,CEM/MPC 在 latent 规划
TS-NVAENewtonianVAE 控制 latent,不生成未来视觉/触觉
纯视觉世界模型(UniPi/Genie/Cosmos/LVP/DreamVLA/DreamZero...)显式预测视觉但不涉及触觉,应标"触觉 N/A",而非"隐式预测触觉"。

开环 vs 闭环

判定不是"有没有真机 rollout",而是:世界模型的预测结果是否进入执行时/训练时的反馈决策环。Open-loop=只做预测/训练辅助/可视化;Closed-loop=预测被用于 MPC/CEM/best-of-N/RL想象/动作精炼/每轮用真实观测替换预测继续决策。

Open-loop(预测不反复影响动作选择)

MMVP, UniPi, Cosmos, LVP, DreamVLA, GigaWorld-0, EgoWM, DreamTac, VTAM(未来触觉主要是辅助输出/可视化), PACE(pred head 只训练时用,推理移除), Fast-WAM, DeFI, LAPA, Cosmos3

Closed-loop(预测参与动作选择)

方法闭环方式
MvM / DDP-WM / FOWMlatent dynamics + MPPI/MPC/TD-MPC
V-JEPA2CEM/MPC 在 feature space 规划
DynaGuide推理时 gradient/action guidance
ContactWorldJEPA latent + CEM/receding-horizon MPC 接触规划
OmniVTA预测接触概率调节融合 + RLTC 60Hz 触觉闭环
DreamTacVLAThink-Dream-Act:草案动作→预测未来触觉→精炼动作
TacForeSight / ViTacFormer预测未来触觉 latent/token 反馈进动作生成
RISE-WM / World-VLA-Loop世界模型作想象环境,策略在rollout中自改进

Mixed / 边界

方法为什么是边界
VTWM用 CEM 有限时域规划,但 best sequence 在真机open-loop trajectory chunks执行,非高频闭环
DreamZero异步闭环(执行chunk后用真实观测替换预测),但不是 MPC 搜索
tau0-WM可直接出动作,ACVS 模式评估候选rollout再修正(test-time computation)
CosmosPolicy直接策略 + model-based planning(N=5候选+价值)
DreamDojo候选动作→预测未来视频→外部value model重排(best-of-N,非CEM/MPC)

MPC + CEM 规划框架

严格口径:① 有显式世界模型/动力学做 rollout;② 短 horizon 采样候选动作序列;③ CEM 作优化器(采样→rollout→评分→top-K elite→更新分布);④ CEM planning ≠ MPC——只有每次只执行最优序列第一步/短前缀并用新观测持续重规划,才算 receding-horizon MPC。

严格 MPC + CEM(闭环)

模型CEM 采样对象用法
ContactWorld未来 H 步动作序列(horizon=6, candidates 64-100, topk=8, iter=4)编码当前观测→CEM采样→latent rollout→目标latent距离打分→只执行第一步→重规划
V-JEPA2动作候选(80 samples × 10 refine)feature space CEM 搜索,使预测 embedding 接近 goal embedding

CEM 有限时域规划(但非严格 MPC)

模型说明
VTWMH=2秒,36 particles,10 iter;但 best sequence open-loop 执行,论文明说 CEM 昂贵导致 open-loop trajectory chunks
MultimodalPretrainingN=120,8-step horizon,LPIPS 目标图像代价;未说明 receding-horizon replanning

易混淆:不是 CEM+MPC 的相近模型

模型实际是什么
MvM / DDP-WMMPPI/MPC,不是 CEM
FOWMTD-MPC 风格,无 CEM elite 更新证据
DynaGuidegradient/action guidance,不是 CEM 规划器
CosmosPolicyN=5候选+价值+majority voting,不是 CEM elite 重拟合
DreamDojobest-of-N / value reranking,不是 CEM

规划范式总表

范式代表CEMMPC
CEM + receding-horizon MPCContactWorld, V-JEPA2
CEM 有限时域/开环chunkVTWM, MultimodalPretraining
MPPI/MPC/TD-MPC latentMvM, DDP-WM, FOWM
Best-of-N / value rerankingDreamDojo, CosmosPolicy, tau0-WM
Gradient/action guidanceDynaGuide
策略内部前瞻/动作精炼DreamTacVLA, TacForeSight, ViTacFormer, PACE
Video-as-plan / inverse dynamicsUniPi, LVP, DeFI, VERA
想象环境/训练闭环RISE-WM, World-VLA-Loop训练侧

选题结论(面向触觉/接触方向)

  1. 可发表的视触觉世界模型 → 对标 OmniVTA, DreamTac, VTAM, VTWM, ContactWorld, DreamTacVLA, TacForeSight
  2. 强调可解释的未来触觉响应 → 显式可解码类更有说服力(DreamTac/VTAM/OmniVTA 能展示未来触觉图/接触区/力变化)
  3. 强调控制效率与严格闭环 MPC → 对标 ContactWorld, V-JEPA2, DDP-WM, FOWM, MvM;VTWM 作"CEM 有限时域/开环chunk"邻近对标
  4. 双臂+灵巧手平台建议不要二选一:底层控制用 latent tactile foresight,论文展示保留可解码触觉/视觉预测分支

相关世界模型论文的评测协议索引

工作Benchmark / 平台任务与评测重点为什么重要本地复现状态
VERAPushT、Panda-Sim、Allegro-Sim、Panda/Allegro Real2/7/16 DoF、隐藏按钮、位置/语义条件;测 video planner + J-IDM。代表“视频计划 + 逆动力学”路线,和 IBVS/图像雅可比式 VLMGuide 最接近。未复现;已有专页分析。
DiT4DiTLIBERO、RoboCasa-GR1、Unitree G1标准仿真、人形桌面、七个 G1 真机任务、物体/数量/替换 OOD。代表“视频去噪中间 hidden feature 条件化动作”的联合训练路线。已做代码/配置核对;未全量复现。
ImageWAMLIBERO、LIBERO-Plus、RoboTwin 2.0、Dobot XTrainer标准 benchmark、七类 OOD、双臂随机化、四个真机任务。代表“图像编辑中间 KV cache 作为世界-动作上下文”,强调高效不解码。已本地复现 LIBERO:97.9% vs 论文 98.4%,基本对齐。
MaskWAMLIBERO、RoboTwin 2.0、Dual-arm Xtrainer语言清晰/语言歧义、干扰物、新实例、光照;测首帧 mask 和未来 mask 预测。代表“空间提示 + 未来 mask 预测”解决文本空间歧义。未复现。
DynaGuideCALVIN、ARX 真机目标偏好、遮挡杯子、新行为引导;测冻结策略的 runtime guidance。代表低成本外部动态模型梯度引导,适合 VLMGuide/ForeTac 借鉴。未复现;复现成本相对低。
π0.7Physical Intelligence 真机平台灵巧任务、指令跟随、跨本体、coaching、数据/上下文消融。代表“子目标图像世界模型 + VLA 上下文条件化”的工业级闭源路线。未复现;不开源主数据/代码。
这个索引的作用是提醒:世界模型论文不能只按“是否预测未来”分类,还要看它在哪些任务上证明了什么能力。对我们选题,最值得复现的是低成本 guidance / LIBERO 级闭环,而不是一上来复现 14B 视频模型。

VERA 在其中的位置

VERA 属于 Video-as-plan / inverse dynamics 范式(和 UniPi 同类),但不是 action-conditioned 世界模型——它先"想象目标未来",再用 J-IDM 反解动作,方向与 ContactWorld/DynaGuide 这类"给动作预测后果"相反。详见 VERA 专页

最容易混淆的几点(避坑)

  • "latent 里去噪" ≠ "latent 空间预测":看最终目标是否可解码成未来观测
  • CEM planning ≠ MPC:要看是否每步只执行第一步 + 重规划
  • 能预测未来 ≠ 闭环控制:预测不进决策环就是 open-loop
  • DreamTac/VTAM/PACE 偏 open-loop/训练辅助,不是在线 MPC 搜索
  • 纯视觉世界模型对触觉是 N/A,不是"隐式预测触觉"

各范式的资源量级 🩷整理·跨论文核对

本页是综述整理,不同世界模型范式的算力门槛差异极大。下表按"骨干类型"给出常见资源量级,具体数字来自本站已核对的对应专页(标 🟢 者),其余为该类方法的普遍量级(🩷)。

范式 / 骨干代表工作训练资源量级推理
视频生成 WAM(大视频 DiT)VERA(Wan-14B) 🟢、Cosmos、GigaWorld最重:14B 级视频模型,单节点 8× H100/H200 起;开发用 1.4B 变体单卡(VERA 用单 H100)稠密时空 token 去噪+解码,延迟高(如 FastWAM 1081ms)
图像编辑 WAMImageWAM 🟢8× H20,LIBERO 单实验约 18h、RoboTwin 约 5 天只取一步编辑 KV cache,单 A6000 约 263ms
VLA + 世界模型子目标π0.7 🟢主模型训练规格未公开(大集群);世界模型 14B主策略单 H100(38ms);子目标 4× H100(1.25s/次,每 4s 一次)
引导冻结策略(training-free / 外部引导)DynaGuide 🟢、DynaGuide 类最轻:dynamics model ≈15M 参数,单张 RTX 3090(24GB),24–48h 收敛,占 ~4GB 显存推理时在去噪回路里加引导;单卡
Diffusion Policy / latent WM(小策略网络)Diffusion Policy 🟢、FOWM:策略网络 ~15M–上百 M 参数,常见单卡即可,部分 benchmark 固定 ~12hDP 在 3080 上 0.1s;latent WM 视规模
一条清晰的降本脉络:视频生成 WAM(8× H200) → 图像编辑 WAM(8× H20,推理不解码) → 推理时引导冻结策略(单 3090)。这条线正是当前"世界模型用于操作"研究的核心张力——想象越"重"(完整视频)算力越贵,越"轻"(KV cache / 只引导)越省但可解释性/想象力打折。选题时按你的算力现实和对"可解释未来"的需求在这条线上定位。
触觉/视触觉世界模型(本页主线,如 DreamTac/VTAM/OmniVTA):这类模型通常骨干比大视频模型小得多(触觉图分辨率低、多为 latent 预测),学术复现门槛普遍在单卡~少数卡量级;各论文具体配置差异大,需查原文,本站暂标 🩷 待逐一核对。

自测:6 题检验理解