Skip to content

EGO 数据线 · A · 分析蓝本(可执行)

把「人体第一视角 → 机器人训练」整条数据供给链做成一张可执行的分析蓝图。 输入:Danfei Xu ego 主线(13篇,精度核验)+ EGO 跨本体桥广度(表示/迁移/翻译)+ 数据引擎(EgoInfinity/Open-AoE/ROBOEDIT/H2R-Bench 等)。 目标:给「EGO 数据线分析」一个可落地、可证伪、可量化收益的决策框架。


0 · 命题界定:什么是「EGO 数据线」

定义:从"人类第一视角操作数据"到"机器人可训练监督"的完整供给链 = 采集 → 表示/对齐 → 翻译/补全 → 缩放 → 世界/物理 → 评测。 价值主张:机器人真实遥操数据稀缺又贵,ego 人数据海量又廉价——但存在 Embodiment Gap(可复用数据/模型 ↔ 在某台机器人跑通之间的"看不见的工作")。 核心命题(本蓝本要证伪/证实的)ego 数据能否成为与真实遥操"可比的"训练供给,取决于对齐/翻译引擎是否先把"物理可信 + 可行动作"补出来,而非单纯堆量。


1 · 全链路地图(Danfei 主线 × 广度合流)

  人类 EGO 视频(海量、无标签)
 L0 采集/Capture ──────────────┬── Danfei系: Aria眼镜(EgoMimic)·全身(EMMA)·平台(EgoVerse)
     │                          └── 广度: Ego-OSCAR(200$开源双止)·Open-AoE(手机众包)·EgoInfinity(web rgb)
 L1 机器人协同设计 ───────────── Danfei:低gap双臂(EgoMimic) ; 广度: UMI手持夹爪·KoalaGripper co-design·YUBI双指
     │                          → 共同哲学: 硬件迁就数据(适配税在硬件层一次付清)
 L2 表示/对齐 ───────────────── Danfei: play latent(MimicPlay)·OT对齐(EgoBridge)·跨域对齐(EgoMimic)
     │                          ; 广度: 相机中心动作(UCAG-P)·UHAS手空间·隐式动作(Motion-Focused)·UniDexTok·JAAS(AdvDex)
 L3 翻译/补全 ───────────────── Danfei: EgoEngine(视觉+动作双补全)·EgoAVFlow(主动视觉3D flow)
     │                          ; 广度: RoboEdit(视频翻译)·H2R-Bench(质检)
 L4 缩放律 ──────────────────── Danfei: EgoScale(20,854h log-linear) · 广度: AXIS/COBALT(采集规模)
 L5 世界/物理 ───────────────── Danfei: EgoWAM(世界表示)·CHORD(力-力矩)  ; 广度: MimicTouch(触觉)·Pegasus(物理验证)
 L6 评测 ───────────────────── Embodiment Gap(适配工作量)·H2R-Bench(5维)·ImitatorGame(L0-L3)
  机器人可训练监督(可执行·物理可信·跨本体)

关键观察:Danfei 系的供给主线(L0→L4)与工会式广度在表示/翻译(L2/L3)处必须合流——Danfei 提供"自家ego+本体"的纵向闭环,广度提供"通用表示+翻译引擎"的横向复利。EGO 数据线是否成立,取决于这两股在 L2/L3 处的结合点。


2 · 六层逐层分析(现状·判断·缺口)

L0 采集 - 现状:Danfei 证明"可规模化且带动作标注"(Aria/平台);Ego-OSCAR 证明成本可打到 200$/400 台;Open-AoE 证明手机众包可达 ~2000h。 - 判断:采集不再是瓶颈的"技术"面,而是"组织"面(谁能把社区/平台养起来,谁就有供给侧优势)。 - 缺口:多模态(IMU/深度)与低成本标注的权衡未定;大规模 ego 的动作标注成本藏在 L2/L3。

L1 机器人协同设计 - 现状:UMI→Koala→YUBI→EgoMimic 低gap双臂,一路进化"采集界面即数据质量"。 - 判断:这是国产系与 Danfei 系的共同签名,且是"免重定向"最实的一招(硬件顺人=天然对齐)。 - 缺口:极端灵巧(手指独立)仍受夹爪架构限制;co-design 的通用性(对手臂/机身)未系统化。

L2 表示/对齐(生死线) - 现状:play latent→OT对齐→跨域对齐(Danfei);通用动作表示(UCAG-P/UHAS/JAAS/隐式动作/UniDexTok)(广度)。 - 判断:两条路线之争 = "行为/潜在空间对齐"(EgoBridge) vs "统一动作表示"(JAAS/UCAG-P)。EgoBridge 对齐潜在空间让"共训"可行;统一动作表示让"免重定向"可行。前者借 ego 的量,后者重构坐标系。 - 缺口:二者能否互解(统一动作空间作为对齐的可微不变量)未验证——这是本蓝图最重要的一条待做实验。

L3 翻译/补全 - 现状:EgoEngine(高保真换人保机+任务对齐动作);RoboEdit(通用视频翻译);EgoAVFlow(主动视觉)。 - 判断:翻译引擎的价值在不同在"长得像",而在"物理可信+动作可执行"。H2R-Bench 已证黑盒世界模型跨本体失败率高——只有显式几何/状态监督那条(ROBOEDIT/EgoEngine)被姑且看好。 - 缺口:翻译产物的训练收益未用下游策略闭环测量(只测了生成质量)。

L4 缩放律 - 现状:EgoScale 给出 20k h log-linear。AXIS/COBALT 证明采集规模可放大。 - 判断:缩放律成立的隐含前提是"动作标注的 ego 视频"。若 L2/L3 不先把动作/对齐补出来,纯被动 ego 的缩放曲线会塌。 - 缺口:需要"对齐成本 vs 训练收益"的边际曲线,把缩放律的斜率打开分项。

L5 世界/物理(未闭环硬骨头) - 现状:EgoWAM 提出世界表示为迁移上限;CHORD 用力-力矩做 RL 通货;MimicTouch 触觉。 - 判断:物理/接触真值是 ego 无从携带的(视觉拿不到摩擦/法向力)——这是 EGO 线最诚实的天花板。世界表示+显式接触必须合流。 - 缺口:量化亲和(缩放)前端 与 显式接触/物理监督 的合流实验

L6 评测 - 现状:Embodiment Gap(适配工作量)、H2R-Bench(5维)、ImitatorGame(分层)。 - 判断:只看 success rate 会骗人;跨本体必须报"还差多少适配工作"。 - 缺口:缺少统一评测把"纯被动 ego/标注 ego/翻译引擎产物"三种监督放同一把尺上。


3 · 决策轴 / 实验矩阵(可证伪)

轴心对照实验(EGO 数据线分析的主角):同一任务、同一策略骨架、同量数据,比较三类监督的迁移收益: | 监督源 | 代表 | 迁移收益假设 | 风险点 | |---|---|---|---| | 纯被动 ego | Open-AoE/EgoVerse 未标注 | 视角/语义先验,动作需算法补 | 动作欠采样、物理不可信 | | 动作标注 ego | EgoScale 20k h | 直接训 VLA,缩放律可外推 | 标注/对齐成本高 | | 翻译引擎产物 | EgoEngine/RoboEdit | 高保真+任务对齐,可闭环 | 伪影、编辑痕迹 |

次级实验矩阵(按杠杆排序): 1. 对齐互解:统一动作空间(JAAS/UCAG-P)作为 EgoBridge OT 对齐的可微不变量 → 是否能同时拿"共训红利"+"免重定向红利"。 2. 缩放分项:把 EgoScale 缩放律的斜率分解到"采集体/对齐引擎/世界模型"各输入端 → 找缩放的主力贡献在哪。 3. 接触合流:EgoWAM 世界表示 + CHORD 力-力矩监督在接触密集任务上的联合增益 vs 各自 alone。 4. 采集组织:EgoVerse/Open-AoE 社区化 vs 自采(夹爪Ue+低gap双臂) 的单位成本与质量,选供给侧打法。 5. 硬件顺人:低gap双臂(EgoMimic) vs 手持夹爪(UMI形态) vs 遥控遥操,在"免适配工作量"上的量化差异。


4 · 落地路线(三步走)

第一步 · 建基线:复现/承接 EgoScale 缩放律 + EgoBridge OT 对齐,作为 ego 数据线分析的可比基线(同一策略、统一评测尺)。 第二步 · 打轴心实验:跑"纯被动 ego vs 标注 ego vs 翻译引擎产物"三类监督的迁移收益对照——这是判定 EGO 数据线"供给有效性"的裁决实验。 第三步 · 打通表示接口:把统一动作空间(JAAS/UCAG-P)接入 ego 数据线作为动作表示;把 EgoWAM 世界表示作为迁移上限的参照系;合并为"ego 供给 × 统一动作表示 × 世界/物理监督"三位一体原型。


5 · 一句话主线(给纲领)

EGO 数据线的胜负手不在"采多少",而在"L2/L3 是否先把'可对齐的动作 + 物理可信'补出来";一旦动作表示/翻译引擎到位,EgoScale 的缩放律就是可外推的供给曲线——届时 ego 数据将真正与真实遥操在训练供给上可比。