Skip to content

EGO 跨本体桥 · 广度 roadmap + 精度 Insight

研究母题之一:把海量人体第一视角(EGO)数据,有效变成机器人可训练的监督。 核心矛盾 = "Embodiment Gap"(Embodiment Gap, 2608.18433):可复用数据/模型 与 在某台具体机器人上跑通 之间的那部分"看不见的工作"。 本文先给广度地图(技术栈全貌),再给研究员级判断(哪些是真方向、哪些是坑)。


PART A · 广度:EGO→机器人 跨本体桥的五层技术栈

把"人体视频 → 机器人动作监督"拆成五层,每层是一类技术方案:

 EGO 人体视频(海量、无动作标签)
   ┌────┴───────────────────────────────────────────┐
   │  层① 动作表示层:用什么"通用语言"承载人类动作       │
   │  层② 重定向/映射层:把通用表示翻译成某台机器人动作    │
   │  层③ 解耦层:把"懂任务"和"控制本体"分开             │ ← 架构主钥匙
   │  层④ 配对/对齐层:造多少 human↔robot 配对监督        │
   │  层⑤ 物理验证层:保证翻译出来的是"能执行的",不是"像的"│
   └────┬───────────────────────────────────────────┘
   机器人训练监督(动作标注、可执行、物理可信)

层① 动作表示层 —— "用什么语言承载人类动作"

  • 相机中心动作几何(OnePolicy-ManyEmbodiments):动作定义在相机可见坐标系 → 异构本体共用一套动作 → 一权重吃全部。
  • 统一手动作空间 UHAS(Unified Hand Action Space):手动作=标准球面的几何形变 + Cascade IK 映射到本体关节;Allegro/LEAP/Shadow/MANO 零样本互通、真机验证。
  • 隐式动作/潜变量(Motion-Focused Latent Action):Hybrid 解耦 VQ-VAE,把"运动动力学"与"环境背景"用物理 mask 分离 → 构造跨本体动作码本,纯人体视频预训练 VLM 学"动作意图"。
  • 手 tokenizer(UniDexTok):统一灵巧手 token,跨机器人。
  • 3D 交互轨迹世界模型(μ0):把动作表示成可扩展的 3D 交互足迹。
  • 遮蔽端末效应器(Cloak):从 wrist 相机视野里把自己"藏起来"→ 视觉推理与本体解耦(最便宜的一招)。

层② 重定向 / 映射层 —— 把通用表示翻译成机器人动作

  • Motion retargeter(EgoInfinity):把 3D 手动作编译成任意形态机器人的关节轨迹,人体仅部分可见也能做。
  • 级联逆运动学 CIK(UHAS):共享表示 → 本体关节配置。
  • 逆动力学模型 IDM(VERA):视频观测 → 动作,用本体 Jacobian 设计,数据高效、可扩到 16-DoF。
  • 快速适配(Motion-Focused:下游仅 50 轨迹适配;KITE:只训新解码器)。

层③ 解耦层 —— 把"懂任务"与"控制本体"分开(★架构主钥匙)

多个 SOTA 独立收敛到同一句architecture语:embodiment-agnostic 的推理 + embodiment-specific 的动作头。 - KITE:共享策略预测"接触模式"的潜意图(与本体无关),intent 条件的动作解码器按各本体运动学单独训——换本体只训解码器、不重采数据。 - VERA:视频规划器保持本体无关,配 embodiment-specific IDM。 - Motion-Focused:VLM 预测意图 + 冻结视觉编码器给状态特征 → 抑制动作幻觉。 - Cloak:让视觉推理本体无关。

这一层是全文的"可迁移上限"决定者:把"懂世界/懂任务"做得越本体无关,EGO 数据的复用率越高。

层④ 配对 / 对齐数据层 —— "造多少配对监督"

  • Data Analogies(数据类比)关键实证——形态学迁移,无结构多样性收益甚微,最大增益来自"场景/任务/轨迹对齐的配对示范"(data analogies);仅改数据构成就把真实跨本体迁移提 +22.5%
  • 配对数据集:HRDexDB(同目标人/机对齐+接触力)、ImitatorGame IG-10K(意图级配对)。
  • Co-training:人体视频 + 机器人数联合训(移动导航实证)。

层⑤ 物理验证层 —— 保证"能执行"而非"像的"

  • Pegasus:人体视频 → Task Graph → Affordance/Constraint Graph → Robot Planning Graph;闭环物理验证器用运动学可行性/碰撞/关节限位过滤非法生成。
  • EgoInfinity:跨模块度量校准 + 交互感知细化,抑制漂移与接触不一致。
  • Need More than VLA/WM(Position Paper):点破缺的四类接口 = 数据接口(自动标注无结构行为)+ 本体接口(retarget)+ 世界模型接口(物理3D)+ 奖励接口(从视频/语言推断进度与成功)

PART B · 精度:研究员级 Insight(哪些是真方向,哪些是坑)

I1 · 真正的瓶颈不是"语义理解",是"物理/接触可靠性"。 Embodiment Gap 明说"模型能泛化,但离在某台机器人跑通还有一段"。几条线都指向同一处难啃的骨头:度量漂移 + 接触/力(EgoInfinity 专门做度量+接触一致性;Pegasus 用物理验证器过滤非法;KITE 用接触模式做意图)。结论:EGO 桥的成败在"物理真实性",不在"长得像"。纯视觉重建拼不出可执行行为。

I2 · "解耦"是当前架构的主钥匙(且是收敛信号)。 KITE / VERA / Motion-Focused / Cloak 各自独立都做出了"本体无关推理 + 本体相关解码/控制"的架构。多个独立工作收敛到同一结论 = 这几乎肯定是正确方向。做 EGO 桥,架构上就该往这个方向搭,而不是追求"一步到位跨本体端到端"。

I3 · 数据策略的实锤:无结构堆量帮"视角/感知",配对(analogy)帮"形态学"。 Data Analogies 的受控实验是目前最可操作的指导:想提升跨形态迁移,别只无脑加数据,而是把数据组织成"跨本体对齐的类比"(同场景/同任务/同轨迹配对)。YUBI/UMI 的设备价值正在于此——它天然产出已对齐、可跨本体的示范。

I4 · 隐式动作让"无标注的 EGO"变得可用——这是规模红利的开关。 Motion-Focused Latent Action 用纯无标注人体视频预训练,即与"海量标注数据集训的 SOTA"竞争、下游仅 50 轨迹适配。"语义/意图先在无标注 EGO 上长大,动作在少样本本体上收敛"——这条管线把数据成本打下来了。

I5 · 零样本跨本体是可以"不重采数据"达成的,但要付架构税。 Cloak / KITE / UHAS / VERA 都证明:零样本跨本体可以做到(Cloak 甚至直接复用单一夹爪数据集)。但都需要特定的架构设计作为代价(mask、latent intent、sphere 表示、IDM)。"数据能比硬件活得更久"(Cloak) 这句话是 UMI 型数据哲学的终极表达。

I6 · 评测是隐形地雷:只看 success rate 会骗你。 Embodiment Gap 提出报"适配工作量"而非只报成功率的报告框架;ImitatorGame 用 L0–L3 暴露"轨迹记忆 vs 理解"的假泛化。判断"跨本体到底行不行",必须看清"在目标机器人上还剩下多少工作"。

给研究计划的落地建议(直接可用)

  1. 架构:优先搭"本体无关主干(意图/世界建模)+ 本体相关动作解码器"的骨架(学 KITE/VERA)。
  2. 数据:主线采 配对/analogy 数据(UMI 类设备天然产出)+ 用无标注 EGO 预训练语义/意图主干(隐式动作)。
  3. 可信度:加入物理验证器/接触一致性作为数据生成的守门员(Pegasus/EgoInfinity 思路),这是"能执行"的来源。
  4. 评测:用 Embodiment Gap 的"适配工作量" + ImitatorGame 分层,量化"还差多少工作"。