a Steerable Generalist Robotic Foundation Model with Emergent Capabilities · Physical Intelligence 2026
← 返回 Study Hub用丰富的"提示词"(上下文)让机器人基础模型开箱即用地泛化到新任务。 π0.7 的创新不在网络结构,而在一套"多模态上下文条件化"训练方法——给每条数据不仅标注"做什么",还标注"怎么做/做得好不好",让模型能从极其多样(含次优、失败、跨本体、非机器人)的数据里学习,并在推理时通过选择性提示精确控制行为。
| 项 | 内容 |
|---|---|
| 团队 | Physical Intelligence (Bo Ai 等,Sergey Levine/Chelsea Finn 在列) |
| 问题 | 现有 VLA 无法组合技能泛化到新任务,缺开箱即用灵巧操作 |
| 基座 | 基于 π0.6-MEM 改造;VLM=Gemma3 4B;动作专家 860M;世界模型=BAGEL 14B |
| 总参数 | ~5B (4B VLM + 860M 动作专家 + 400M ViT) |
| 核心手段 | 子任务指令 + 子目标图像 + episode 元数据 + 控制模式,四类上下文随机丢弃训练 |
| 关键结果 | 灵巧任务匹配甚至超越 RL 专家吞吐量;零样本跨本体折 T 恤 80% (≈人类首次 80.6%);14 个未见环境指令跟随显著超 π0.5/π0.6 |
| 实验 | 纯真机(移动双臂/BiPi/UR5e/单臂),无仿真,无触觉 |
| 开源 | 否 |
π0 Flow Matching 动作专家 (PaliGemma)
π0-FAST 自回归离散动作 token
π0.5 加语言层级、开放世界泛化
π0.6 VLA + RL 后训练 (π0.6* 是 RL 专家)
π0.6-MEM 加 MEM 多尺度记忆(视频历史编码)
│
▼
π0.7 ★ 多模态上下文条件化 + BAGEL世界模型子目标 + 从RL专家蒸馏
→ 开箱即用泛化 / 跨本体 / 组合泛化
灵感来自语言模型的组合泛化:LLM 不只是记事实,还能把知识以新方式组合来解决新问题。但机器人 VLA 在"以新方式组合技能泛化到新任务"上仍很弱。作者受图像/视频生成领域"提示词扩展(prompt expansion)"启发,认为给训练数据更丰富的上下文条件,就能让机器人像语言模型那样组合泛化。
训练:
4相机×6历史帧 [B,4,6,448,448,3]
│ MEM 视频编码器(时空可分离注意力,任意历史帧→固定token数)
▼
视觉 tokens ──┐
语言指令 ℓ ───┤
子任务指令 l̂ ─┤ 各以 dropout 概率随机丢弃
episode元数据 m┤ (速度/质量/错误)
子目标图像 g ─┤ (25%样本含, 由BAGEL生成)
控制模式 c ───┘ (joint / ee)
│
▼
┌────────────────────────────┐
│ VLM Backbone (Gemma3 4B) │ ← KI知识隔离:梯度不回传VLM
│ 输出 context tokens │ VLM用FAST token离散交叉熵监督
└──────────┬─────────────────┘
│ cross-attention
▼
┌────────────────────────────┐
│ Action Expert (860M) │ Flow Matching + adaRMSNorm
│ 50 action tokens, 5步去噪 │ CFG β∈{1.3,1.7,2.2}
└──────────┬─────────────────┘
▼
Action chunk [B,50,D] (实际执行 15 或 25 步)
世界模型(异步生成子目标):
当前观测+任务 → BAGEL 14B(flow matching) → 子目标图像 (每4秒刷新)
| 组件 | 规格 | 作用 |
|---|---|---|
| VLM 骨干 | Gemma3 4B + 400M ViT | 理解图像+语言+各类上下文,输出 context tokens |
| MEM 视频编码器 | 时空可分离注意力 | 把任意数量历史帧压成固定 token 数(4视角×6帧, 1秒步长, 0.3概率整体丢弃) |
| 动作专家 | 860M Transformer | Flow Matching 预测 50 步连续动作,adaRMSNorm 注入时间步 |
| 世界模型 | BAGEL 14B | 生成子目标图像,为策略提供视觉规划引导 |
传统 VLA 的上下文只有语言指令 ℓ("清理厨房")。π0.7 大幅扩展为四个组件,训练时各以概率随机丢弃,推理时可灵活用任意子集:
| 上下文 | 是什么 | 作用 / 来源 |
|---|---|---|
| 子任务指令 l̂ | 中间层语义子任务,如"打开冰箱门" | 继承 π0.5;推理时由高层策略自动生成,或人类实时"coaching" |
| 子目标图像 g | 多视角的期望近未来场景图 | 本文核心架构创新;由 BAGEL 世界模型生成;把动作预测变成"逆动力学"问题,加速训练 |
| episode 元数据 m | 速度(500步区间离散)+质量(1-5人工评分)+错误标记 | 让模型区分同一任务的不同执行质量,从而能利用次优/失败数据 |
| 控制模式 c | joint(关节) / ee(末端执行器) | 训练时学两种控制空间,推理按需选 |
子目标图像 g 由 BAGEL(14B 图像理解/编辑/生成模型)用标准流匹配损失训练生成。它比纯语言更能表达空间细节。推理时每 Δ=4 秒或语义意图变化时异步刷新;训练用真实未来帧 + 世界模型生成图的混合(25%样本含)。
对从未见过的复杂长任务,人类可以用语言分步"指导"(coaching):一步步告诉机器人子任务("现在打开空气炸锅""放入食物")。然后把这些 coaching 数据蒸馏成自主高层策略,下次就能自己生成子任务指令。这是 π0.7 组合泛化获取新技能的关键链路。
| 评测块 | 平台 / 任务 | 具体设置 | 为什么这样测 | 复现状态 |
|---|---|---|---|---|
| 开箱即用灵巧性 | 双臂移动平台等真机 | 折衣、制作咖啡、组装盒子、做三明治、翻衬衫、切菜、削皮、扔垃圾等。 | 检验单一 generalist policy 是否能接近/超过任务专用 RL 或 SFT 专家,而不是只会简单 pick-place。 | 未复现;数据和机器人闭源。 |
| 语言指令跟随 | 4 个未见厨房 + 2 个未见卧室 | 14 个未见环境场景,3-6 步开放指令;含复杂参考指令和打破数据偏差任务。 | 检验 π0.7 是否比 π0.5/π0.6 更会组合语言、视觉和动作,而不是复读训练分布。 | 未复现。 |
| 跨本体迁移 | BiPi / UR5e / 单臂 6DoF 等 | 如折 T 恤从 BiPi 零样本迁移到 UR5e,报告 task progress 和 success。 | 测试多模态上下文、子目标图像和控制模式标识是否能跨硬件迁移。 | 未复现。 |
| 组合泛化 | 新短任务 + coaching 长任务 | 按法压壶、舀米饭、擦拭、旋转;空气炸锅、烤面包机等长时任务由语言 coaching 引导。 | 验证“可操控”不是普通 instruction following,而是能通过人类提示逐步教会新任务。 | 未复现。 |
| 数据/上下文消融 | metadata / subgoal / eval data / diversity ablation | 去 episode 元数据、去自主评估数据、去子目标图像、去最多样 20% 数据。 | 证明 π0.7 的收益主要来自上下文条件化和数据多样性,不只是模型更大。 | 未复现;页面基于论文。 |
| 能力 | 结果 |
|---|---|
| 开箱即用灵巧性 | 折衣/制咖啡/组装盒子等匹配 RL 专家成功率,折衣和盒子组装吞吐量超过专家 |
| 指令跟随 | 14 个未见环境场景显著超 π0.5/π0.6;复杂参考指令也更好;能打破数据偏差执行反转任务 |
| 跨本体迁移 | 折 T 恤从 BiPi 零样本迁移到 UR5e:85.6% 任务进度 / 80% 成功率,≈人类遥操作首次(90.9%/80.6%) |
| 组合泛化 | 开箱即用做新短任务(按压壶/舀米/擦拭/旋转);通过 coaching 做新长任务(空气炸锅/烤面包机) |
π0.7 = π0.6-MEM 架构 + 多模态上下文条件化(子任务/子目标/元数据/控制模式) + BAGEL 世界模型子目标 + 从 RL 专家蒸馏,用"丰富提示词"实现开箱即用的组合泛化与跨本体迁移。
来源:π0.7 论文附录 C(世界模型训练)、附录 D(推理速度与优化)。π0.7 主体与高层策略均基于 Gemma3 4B。
| 组件 | 硬件 | 说明 |
|---|---|---|
| π0.7 主策略 + 高层策略 | 单张 NVIDIA H100 | 均基于 Gemma3 4B;最小变体 38ms(3 相机输入、5 步去噪、训练时 RTC) |
| 世界模型(子目标图生成) | 4× H100 | 14B 模型(BAGEL 初始化),序列近 1 万 token;用 4-way 张量并行 + 8-bit 量化 + SageAttention,25 步去噪 1.25s;测试时每 Δ=4s 重生成一次子目标 |