DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control · Mondo Robotics / HKUST(GZ) / HKUST · arXiv 2603.10448v2 (2026)
DiT4DiT 的关键不是“生成未来视频再执行”,而是用 Video DiT 去噪过程中的中间 hidden feature 条件化 Action DiT。它通过 dual flow matching 和 tri-timestep,把视频动态建模与动作生成联合训练。对 VLMGuide / 世界模型路线最有价值的判断是:中间生成表征通常比最终重建帧更适合作为动作条件。
/home/chenzhiyuan/projects/paper/2026-DiT4DiT/DiT4DiT.pdf;实现细节核对自本地仓库 /home/chenzhiyuan/projects/DiT4DiT。README 的 release checkpoint 数字和论文表格存在口径差异,本页主结果以论文 PDF 为准,并在复现部分单独标注 README 口径。| 项 | 内容 |
|---|---|
| 论文 | DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control |
| 核心问题 | 现有 VLA 大多继承静态图文表征,低层物理动态主要靠有限机器人动作数据学习,样本效率和 OOD 泛化受限。 |
| 核心方法 | Video DiT 建模未来视觉动态;Action DiT 读取 Video DiT 去噪中间 hidden states,通过 cross-attention 生成连续动作。 |
| 基础模型 | Video backbone 基于 Cosmos-Predict2.5-2B;语言条件来自 Cosmos-Reason1 / Cosmos pipeline text encoder 的多层 embeddings;Action DiT 沿用并改造 GR00T-N1 风格 flow-matching action head。Qwen3-VL/Qwen3DiT 是等参 baseline,不是 DiT4DiT 本体。 |
| 训练机制 | dual flow matching + asymmetric tri-timestep:视频生成时间、hidden extraction 时间、动作去噪时间解耦。 |
| 主结果 | LIBERO 平均 98.6%;RoboCasa-GR1 平均 50.8%;Unitree G1 真机七任务显著优于 GR00T-N1.5 和 Qwen3DiT。 |
| 最重要消融 | 第 18 层 hidden feature 最好;只取 1 step hidden 最好;更多 denoising step 会把表征推向像素重建细节,动作效果下降。 |
论文的出发点很明确:VLA 已经能用视觉和语言条件生成动作,但其 backbone 多数来自静态图文预训练。静态图文数据能提供物体、语义、关系和语言能力,却不直接提供“接触后会怎样”“物体如何随动作演化”“多阶段任务状态如何转换”等物理动态。
DiT4DiT 的核心假设是:通用视频生成模型为了预测未来帧,已经在互联网视频中学到大量时空结构和隐式物理规律。与其把这些能力用作外部可视化,不如把它们变成策略内部的动作条件。
DiT4DiT 的贡献不是简单把未来视频生成出来,再让策略照着视频做。它明确避免依赖 fully reconstructed future frames,而是截取 Video DiT 去噪过程中的 hidden states 作为动作条件。这个差异非常关键:
| 理解方式 | 是否符合 DiT4DiT | 问题 |
|---|---|---|
| 先生成完整未来视频,再做 inverse dynamics | 不准确 | 昂贵、慢、容易被像素细节/生成伪影误导。 |
| 用视频生成模型的中间去噪表征指导动作 | 准确 | 动作模型读取还未塌缩成像素重建的时空动态表征。 |
| 把视频生成作为机器人策略学习的 scaling proxy | 准确 | 论文 Fig.1 认为 video generation 比 grounding 和 VLM latent modeling 更有效。 |
严格说,DiT4DiT 不是从零设计一个全新 transformer,而是把两个已经成熟的方向拼成一个 Video-Action Model:Video 端基于 Cosmos-Predict2.5-2B,Action 端基于 GR00T-N1 风格的 flow-matching Action DiT。它真正的创新不是“换了一个 backbone”,而是把 Video DiT 的中间去噪 hidden states 变成 Action DiT 的条件,并通过 video loss + action loss 联合训练。
| 组件 | 是否 DiT4DiT 本体基座 | 来自哪里 | 在 DiT4DiT 中的作用 |
|---|---|---|---|
| Cosmos-Predict2.5-2B | 是 | Cosmos video generation / prediction foundation model | 提供 causal video VAE、Video Diffusion Transformer、scheduler、video processor;被改造成“动态 hidden feature extractor”。 |
| Cosmos-Reason1 / Cosmos text encoder | 是 | Cosmos 语言条件模块 | 把 instruction 编码成多层 prompt embeddings,作为 Video DiT 的语言条件。 |
| GR00T-N1-style Action DiT | 是 | NVIDIA GR00T-N1 系列 action head 设计 | 提供 flow-matching action transformer;在 DiT4DiT 中改为 cross-attend Video DiT hidden。 |
| diffusers Transformer blocks | 工程依赖 | Diffusers Attention / FeedForward / timestep embedding | Action DiT 的 attention、AdaLN、timestep embedding 等基础实现。 |
| Qwen3-VL 2B / Qwen3DiT | 不是 | 论文构造的参数匹配 baseline | 用 Qwen3-VL 2B + 同一 Action DiT,对比“静态 VLM backbone”与“视频动态 backbone”。 |
| GR00T-N1.5 / GR00T-N1.6 | 不是直接基座 | 强 baseline / 预训练策略 | 用于仿真和真机对比;DiT4DiT 的 action head lineage 来自 GR00T-N1,但不是直接在 N1.5/N1.6 上继续训练。 |
DiT4DiT.py 顶部 docstring 还残留“Qwen2.5 VL / QFormer / DINO”等旧描述,但实际 forward 路径调用的是 get_backbone_model(config) 下的 Cosmos25 backbone。判断模型结构时应以配置与实际调用链为准,而不是残留注释。输入:
o_t: 当前/历史 ego 图像帧
l: 语言指令
s_t: 本体状态,可选
a*: expert action chunk,仅训练时使用
Video branch:
frame_0 ──► Cosmos video processor / VAE ──► condition latent z_t^0
frame_1..T ──► VAE ──► future latent supervision z_{t+1}^0
instruction ──► tokenizer + text_encoder ──► prompt embeddings
noisy future latent z^{τv} + condition latent + prompt
└─► Cosmos Video DiT transformer blocks
└─► hook block 17 (0-based) / paper layer 18
└─► hidden: [B, S=T×H×W, 2048]
Action branch:
action noise / noised action chunk ──► ActionEncoder ─┐
state s_t ──► StateEncoder MLP,可选 ────────────────┤
├─► state/action tokens: [B, H(+state), 768]
Video hidden [B,S,2048] ──────────────────────────────┘
└─► 16-layer Action DiT
- odd blocks: self-attention when interleave_self_attention=true
- even blocks: cross-attention to Video hidden
- timestep injected by AdaLN / timestep encoder
└─► output projection 2560 ─► MLP action decoder ─► velocity / action_dim
训练目标:
L_total = L_action_flow_matching + λ L_video_flow_matching
这张结构图的核心是:Cosmos Video DiT 不负责直接输出机器人动作,Action DiT 也不直接看原始图像。二者通过 Video hidden states 连接。这个连接点就是 DiT4DiT 和普通 VLA / 普通 video world model 的分界线。
| 论文描述 | 本地代码对应 | 核对结论 |
|---|---|---|
| Video DiT initialized from Cosmos-Predict2.5-2B | Cosmos25FeatureExtractor 调用 diffusers.Cosmos2_5_PredictBasePipeline.from_pretrained(...) | 一致。代码显式取出 text_encoder、tokenizer、transformer、vae、scheduler、video_processor。 |
| 语言条件来自 Cosmos-Reason1 multi-layer embeddings | _get_prompt_embeds() 中读取 text encoder 的所有 hidden states,并归一化后 concat | 机制一致;具体 text encoder 由 Cosmos pipeline 权重决定。 |
| extract layer = 18 | 配置 extract_layer: 17;hook transformer_blocks[self.extract_layer] | 一致。代码使用 0-based index,17 对应论文第 18 层。 |
| Action DiT adapted from GR00T-N1 | ActionDiT.py 文件头保留 NVIDIA / GR00T lineage;FlowmatchingActionHead 构建 DiT-B | 一致。具体实现是 flow-matching action head + cross-attention DiT。 |
| input sequence includes proprioception, noisy actions, learnable future tokens | 当前可见主路径中,sa_embs = concat(state_features, action_features);未在已核对路径看到显式 future token parameter | 需谨慎标注:论文写了 future tokens,但本地 release 代码主路径主要是 state/action tokens + video cross-attention。可能是论文描述、早期分支或未展开模块差异。 |
| Action DiT cross-attends Video hidden | self.model(hidden_states=sa_embs, encoder_hidden_states=vl_embs) | 一致。cross_attention_dim: 2048 对齐 Video hidden dim。 |
| 配置项 | 论文 Table 4 / 主设置 | 本地 LIBERO 配置 | 本地 RoboCasa / G1 配置 |
|---|---|---|---|
| Video backbone | Cosmos-Predict2.5-2B | Cosmos25 | Cosmos25 |
| Video hidden dim | 2048 | vl_hidden_dim: 2048 | vl_hidden_dim: 2048 |
| Extract layer | 18 | extract_layer: 17,0-based | extract_layer: 17,0-based |
| Action model type | DiT-B | DiT-B | DiT-B |
| Action DiT inner dim | 768 = 12 heads × 64 dim | 768 | 768 |
| Action decoder hidden size | 2560 | hidden_size: 2560 | hidden_size: 2560 |
| Action output dim | 32 | 8,Franka / LIBERO 口径 | 32,G1 WBC decoupled 版本为 36 |
| State dim | 64 | 16 | 64 |
| Action horizon | 16 | 8 | 16 |
| Action inference steps | 4 | 4 | 4 |
| Video future inference steps | 论文消融显示 1 step 最好 | future_num_inference_steps: 1 | future_num_inference_steps: 1 |
因此,如果要复现或迁移,不能只看论文 Table 4。LIBERO、RoboCasa、真机 G1 的 action/state 维度和 horizon 都会随本体改变;稳定不变的是 Video hidden dim=2048、hook 第 18 层、Action DiT cross-attend video hidden、动作 flow matching 4-step sampling 这些核心机制。
Video DiT 负责建模未来视觉动态;Action DiT 不是读取最终解码视频,而是通过 cross-attention 读取 Video DiT 某一层、某一去噪时刻的 hidden features。论文默认 hidden feature dim 为 2048,extract layer 为第 18 层;Action DiT 为 DiT-B 配置,inner dim 为 768,16 层,输出投影/decoder hidden size 为 2560,主设置动作 horizon 为 16。
基础 flow matching 路径:
Video-Action 联合分布写法:
Video hidden extraction:
总损失:
| 表征 | 优点 | 问题 |
|---|---|---|
| 最终重建未来帧 | 可视化直观 | 昂贵;包含纹理/光照等动作无关细节;可能有生成伪影。 |
| 中间去噪 hidden | 包含未来动态、空间约束和任务语义;尚未过度像素化 | 不可直接人眼解释,需要靠消融/可视化验证。 |
| 早层 hidden | 粗结构和低级视觉 | 语义/任务动态不足。 |
| 末层 hidden | 接近像素重建 | 论文消融显示会塌缩到细节重建,动作成功率下降。 |
DiT4DiT 训练时同时优化视频动态与动作生成。关键不是“两个 loss 简单相加”,而是把三个时间步拆开:
| 时间步 | 作用 | 设计理由 |
|---|---|---|
| τv | Video DiT 的视频 flow matching 时间 | 让视频模型学习从噪声 latent 到未来 latent 的完整速度场。 |
| τf | 抽取 hidden feature 的时间 | 给 Action DiT 一个稳定 operating point,不被完整采样轨迹扰动。 |
| τa | Action DiT 的动作 flow matching 时间 | 独立训练动作噪声到干净动作的速度场;论文/代码使用 Beta 偏置采样。 |
time_distribution 默认是 logit_normal,并带 high-sigma strategy。这属于工程实现对训练稳定性的调整,不改变“视频时间、特征时间、动作时间解耦”的核心。控制时的关键路径很短:
这就是论文能在真机达到 6Hz 的原因:它不是每个控制周期都生成完整未来视频,而是把视频生成模型当作“动态表征提取器”。
| 类别 | 配置 |
|---|---|
| Video DiT | Cosmos-Predict2.5-2B;FlashAttention2;hidden dim 2048;extract layer 18。 |
| Action DiT | DiT-B;hidden size 2560;cross-attention dim 2048;16 layers;AdaLN;interleave self-attention。 |
| 动作 | action dim 32;state dim 64;future action window 15;horizon 16;inference timesteps 4。 |
| 训练 | 32 GPUs;max train steps 100k;warmup 5k;VGM LR 1e-5;Action LR 1e-4;AdamW。 |
| 评测块 | Benchmark / 平台 | 任务与数据 | 为什么这样测 | 复现状态 |
|---|---|---|---|---|
| 仿真标准基准 | LIBERO | Spatial/Object/Goal/Long 四套件;每套件 10 tasks;每任务 500 demos;报告 success rate。 | 验证从 scratch 训练时,视频动态 hidden 是否能在标准 VLA benchmark 上不输强基线,尤其看 Long suite 的长时状态转移。 | 本地做了代码与配置核对,尚未完成全量 LIBERO 复现。 |
| 人形桌面仿真 | RoboCasa-GR1 | Fourier GR1 humanoid;24 个桌面任务;29 维动作;每任务 1,000 teleop demos;每任务 50 rollouts;最大 horizon 720。 | 比 LIBERO 更接近人形双臂桌面操作,检验 DiT4DiT 是否只是在 Franka/LIBERO 上有效。 | 本地核对了仓库任务配置与论文结果口径;未跑全量。 |
| 真机主结果 | Unitree G1 | 7 个任务:pick and place、arrange flower、stack cups、insert plate into rack、box packaging、move spoon、drawer interaction;每任务 200 demos,20 rollouts。 | 验证“中间视频动态表征”是否能迁移到真实人形平台,尤其是长时、多阶段、遮挡和空间对齐任务。 | 未本地复现;真机硬件和数据不可用。 |
| 泛化/OOD | RoboCasa + G1 variation | 仿真新物体 Can/Cup/Milk/Wine;真机 category/quantity/object substitution。 | 排除模型只记住训练物体/数量/外观;检验视频动态 prior 对新物体和干扰变化的鲁棒性。 | 未复现;网页记录论文数值与 README checkpoint 口径差异。 |
| 方法 | Spatial | Object | Goal | Long | Avg |
|---|---|---|---|---|---|
| Diffusion Policy | 78.3 | 92.5 | 68.3 | 50.5 | 72.4 |
| π0 | 96.8 | 98.8 | 95.8 | 85.2 | 94.2 |
| π0.5 | 98.8 | 98.2 | 98.0 | 92.4 | 96.9 |
| CogVLA | 98.6 | 98.8 | 96.6 | 95.4 | 97.4 |
| GR00T-N1.5 | 96.2 | 94.0 | 96.0 | 90.0 | 94.1 |
| Qwen3DiT from scratch | 98.0 | 98.8 | 96.0 | 93.6 | 96.6 |
| DiT4DiT from scratch | 98.4 | 99.6 | 98.6 | 97.6 | 98.6 |
Long suite 是最有解释力的:DiT4DiT 97.6%,明显高于 Qwen3DiT 93.6 和 GR00T-N1.5 90.0。这个结果支持“视频动态 hidden 对长时状态转移有帮助”。
| 方法 | 训练口径 | Avg SR | 说明 |
|---|---|---|---|
| GR00T-N1.5 | pretrained + finetune | 41.8 | 官方预训练权重,目标数据上微调。 |
| GR00T-N1.6 | pretrained + finetune | 40.8 | 同样训练步数。 |
| Qwen3DiT | from scratch | 36.2 | Qwen3-VL 2B + 同一 Action DiT,参数匹配。 |
| DiT4DiT | from scratch | 50.8 | 24 个任务中 16 个任务最高。 |
真机平台为 Unitree G1 humanoid,双 7-DoF 手臂 + ALOHA2 grippers,头部 Intel RealSense D435i ego RGB 640×480,PICO VR + XRoboToolkit 采集。七个任务每个 200 条 demo、20 次 rollout。
| 任务 | 论文强调的 DiT4DiT 表现 | 对比含义 |
|---|---|---|
| Arrange Flower | 75%,GR00T-N1.5 为 25% | 细杆插入花瓶,需要空间对齐和接触前状态判断。 |
| Stack Cup | 60%,GR00T-N1.5 为 25% | 多阶段堆叠,需保持时序一致。 |
| Move Spoon | 40%,GR00T-N1.5 为 15% | 小物体与细粒度运动。 |
| Drawer Interaction | 90% | 长时、多阶段状态转移。 |
| Box Packing | 50% | 打开、放入、退出等子目标序列。 |
Qwen3DiT 在真机几乎崩溃,论文称所有任务不超过 10%,在 Drawer / Arrange / Box 上为 0%。这说明“静态 VLM + 同一动作头”不足以替代视频动态 backbone。
| 场景 | 设置 | 结果 |
|---|---|---|
| 仿真新物体 OOD | 只用 bottle 任务训练;测试 Can / Cup / Milk / Wine | ToDrawerClose 54.5 vs Qwen3DiT 32.0;ToCabinetClose 34.0 vs 24.5;ToMicrowaveClose 30.5 vs 17.0。 |
| 真机 category variation | 改变杯子/花瓶/花的材质、形状、外观 | Arrange Flower(category) DiT4DiT 70%,GR00T-N1.5 10%,Qwen3DiT 0%。 |
| 真机 quantity variation | Stack Cup 数量变化和干扰物变化 | Stack Cup(number) DiT4DiT 50%。 |
| 真机 object substitution | Box Packing 中替换目标物体,如 eggplant → corn | 图示显示 DiT4DiT 相比 Qwen3DiT 更稳,但仍不是完全解决所有 OOD。 |
论文在 RoboCasa-GR1 的五个任务上比较 Video DiT 不同层的 hidden feature。结论是:早层 2–8 表现差,末层 24–28 也明显下降,默认第 18 层最佳。
论文比较用于抽 hidden feature 的 denoising steps。结果是 1 step 最好,更多 step 单调下降。作者解释为:过多迭代会让 hidden states 过度承诺到像素级未来细节,反而损害动作需要的抽象动态先验。
论文用 t-SNE / silhouette score 分析 hidden features。decoupled training 的 silhouette score 为 0.09,joint training 提升到 0.17,并表现出更顺滑的 Early → Middle → Late 任务阶段流动。
这说明 DiT4DiT 不是只把一个冻结视频模型当特征提取器,而是通过 action loss 反向塑形 Video DiT,使其 hidden feature 更适合动作。
| 方法 | Trainable Params | Deploy Frequency | 解读 |
|---|---|---|---|
| GR00T-N1.5 | 2.7B | 13Hz | 最快,但真机/部分仿真任务低于 DiT4DiT。 |
| Qwen3DiT | 2.3B | 9Hz | 参数匹配基线,缺视频动态先验。 |
| DiT4DiT | 2.2B | 6Hz | 更慢,但收益来自动态 hidden,而不是更大模型。 |
| 模块 | 路径 | 作用 |
|---|---|---|
| 框架入口 | /home/chenzhiyuan/projects/DiT4DiT/DiT4DiT/model/framework/DiT4DiT.py | 组装 Cosmos backbone 与 FlowmatchingActionHead;forward 同时返回 action_loss / future_video_loss。 |
| Video backbone | DiT4DiT/model/modules/vlm/Cosmos25.py | 加载 Cosmos2.5 pipeline;注册 transformer block hook;构建 condition frame / future frames;输出 hidden states。 |
| Action DiT | DiT4DiT/model/modules/action_model/ActionDiT.py | 动作 flow matching;Beta 采样动作时间;noisy action → velocity field。 |
| cross-attention DiT | DiT4DiT/model/modules/action_model/flow_matching_head/cross_attention_dit.py | Action token 通过 cross-attention attend 到 Video hidden states。 |
| 配置 | DiT4DiT/config/{libero,robocasa,real_robot}/*.yaml | extract_layer、hidden dim、action horizon、LR、dataset 等。 |
# Cosmos25.py
pipe = Cosmos2_5_PredictBasePipeline.from_pretrained(...)
self.text_encoder = pipe.text_encoder
self.transformer = pipe.transformer
self.vae = pipe.vae
self.scheduler = pipe.scheduler
target_layer = blocks[self.extract_layer]
target_layer.register_forward_hook(hook_fn)
def hook_fn(module, inp, out):
if torch.is_tensor(out):
self._cached_hidden.append(out.detach())
elif isinstance(out, (tuple, list)) and torch.is_tensor(out[0]):
self._cached_hidden.append(out[0].detach())
这说明 Video 端真实基座是 Cosmos-Predict2.5 / Cosmos2.5 pipeline。配置中 extract_layer: 17 是 0-based,对应论文表格里的第 18 层。这一点和论文消融完全对齐。
# Cosmos25.py
self._cached_hidden.clear()
self._capture_hidden_enabled = True
...
for i, t in enumerate(timesteps):
model_out = self.transformer(...)[0]
if i == 0 and hidden_first is None and len(self._cached_hidden) > 0:
hidden_first = self._cached_hidden[-1]
self._capture_hidden_enabled = False
...
hidden = hidden_first if hidden_first is not None else self._cached_hidden[-1]
这就是“推理时不完整生成未来视频”的实现落点:默认 future_num_inference_steps: 1,只要一次 Video DiT forward 的中间 hidden。
# DiT4DiT.py
backbone_outputs = self.backbone_interface(...)
last_hidden = backbone_outputs.hidden_states[-1]
action_loss = self.action_model(last_hidden_repeated, actions_target_repeated, action_mask, state_repeated)
# ActionDiT.py
model_output = self.model(
hidden_states=sa_embs,
encoder_hidden_states=vl_embs,
timestep=t_discretized,
)
encoder_hidden_states=vl_embs 就是 Video DiT 抽出来的 hidden token。Action DiT 内部交替 self-attention / cross-attention,使用 cross_attention_dim: 2048 对齐 video hidden dim。
# ActionDiT.py
state_features = self.state_encoder(state) if state is not None else None
action_features = self.action_encoder(noisy_trajectory, t_discretized)
if self.config.add_pos_embed:
action_features = action_features + pos_embs
sa_embs = torch.cat((state_features, action_features), dim=1) \
if state_features is not None else action_features
model_output = self.model(
hidden_states=sa_embs,
encoder_hidden_states=vl_embs,
timestep=t_discretized,
)
这段代码把 Action DiT 的主输入明确成 state tokens + action tokens,Video hidden 作为 cross-attention memory。论文方法段提到 learnable “future tokens”,但本地 release 代码已核对主路径中没有看到显式 future token parameter。因此网页中把它标为论文描述与代码主路径的差异,而不是强行认定代码已经实现。
# ActionDiT.py
noise = torch.randn(actions.shape, device=actions.device, dtype=actions.dtype)
t = self.sample_time(actions.shape[0], device=actions.device, dtype=actions.dtype)
noisy_trajectory = (1 - t) * actions + t * noise
velocity = noise - actions
...
loss = ((pred_actions - velocity) ** 2) * action_mask
loss = loss.sum() / action_mask.sum()
这与论文中的 action flow matching 对齐。推理时 num_inference_timesteps: 4,从随机动作噪声出发,按 flow ODE 积分得到 action chunk。
这个方案的论文叙事可以是:现有 VLA 会在 OOD、阶段错乱或视觉捷径下生成“看似合理但当前不该做”的动作;VLMGuide 不直接替换 policy,而是在运行时用生成模型中间表征 + action-conditioned dynamics 做动作一致性验证。
DiT4DiT 的局限部分明确提到当前只有单个 ego camera,未来可加入 wrist camera 或 tactile feedback。对你们的触觉方向,这给出一个自然扩展:
| 视觉 DiT4DiT | 视触觉扩展 |
|---|---|
| Video DiT hidden 表示未来视觉动态 | Video/Tactile world model hidden 表示未来视觉 + 接触动态 |
| Action DiT cross-attend video hidden | Action model cross-attend visual hidden + tactile belief hidden |
| 单 ego camera 易遮挡 | 遮挡/闭眼阶段依赖触觉 belief 和力反馈 |
| 适合大规模人形控制 | 适合无腕部相机、头部眼 + 触觉/六维力的 RealMan 研究设定 |
| 路线 | 可发性 | 资源风险 | 建议 |
|---|---|---|---|
| 完整复现/扩展 DiT4DiT | 高,如果有大数据和大算力 | 很高 | 作为长期方向,不适合短平快实习生主线。 |
| ImageWAM-style cache guidance + VLA reranking | 中高 | 中 | 适合 VLMGuide 主线,重点做 policy-level OOD 收益。 |
| DynaGuide-style runtime action steering for VLA/Flow Matching | 中高 | 中 | 重点难点是把 DDIM guidance 正确迁移到 flow matching / VLA action sampler。 |
| 触觉 hidden / belief guidance | 高,但需要真机数据 | 中高 | 适合 RealMan + 触觉长期课题,可从仿真/离线数据先验证。 |
| 事项 | 判断 |
|---|---|
| 仓库可用性 | 本地有完整仓库 /home/chenzhiyuan/projects/DiT4DiT,远端为 https://github.com/Mondo-Robotics/DiT4DiT.git。 |
| 模型下载 | 需要 Cosmos-Predict2.5-2B;README 建议 CUDA 12.4+,训练推荐 >8 GPUs。 |
| benchmark | 仓库提供 LIBERO、RoboCasa-GR1、Real G1 指南。 |
| README vs 论文 | README release checkpoint 的 RoboCasa-GR1 平均约 56–57;论文 Table 2 为 50.8。本页主分析使用论文口径。 |
| 推荐复现切入 | 先读配置和 forward 流程,再只跑 LIBERO smoke test;不要一开始碰 G1 真机链路。 |
DiT4DiT 是一篇很强的世界模型/VLA 交叉论文。它最值得学习的不是“视频模型很强”这个泛泛结论,而是一个更具体的技术判断: