Skip to content

EGO 数据线 · EGO 数据集标注层次对照(扩展版)

由三大集扩展到六大集,在 L0–L4 统一量尺上定位,直观看每套的可训练天花板与"大规模×全标注层次"缺口。 数据经 arXiv 摘要核验;EGO-1 / Ego-4D 主论文 id 未能即时核验,如实留待增补,不臆测。


一、标注层次谱系(量尺重申)

  • L0 采集元数据(相机/IMU 同步校准)
  • L1 文本/语义级(动作语言描述)
  • L2 空间结构级(3D 手姿态 MANO/相机轨迹/物体位姿)
  • L3 时域事件级(时间定位原子动作/动作分割)
  • L4 可行动作级(重定向后机器人可执行动作)

二、L0–L4 覆盖矩阵(核心视图)

数据集 id L0 L1 L2 L3 L4 可训练天花板
EgoVerse 2604.07607 ✔标准 见原文 见原文 见原文(未展开) 转移研究可支持 依赖下游
Open-AoE 2607.14183 ✔文本 ✔MANO+轨迹 ✔原子动作 ✔retarget工具 最高(全层次)
Ego-OSCAR 2608.08285 ✔校准 ✔自由文本 ✔3D手 ✘(原料) 到 L2+文本
EPIC-KITCHENS 1804.02748 ✔narration 部分(bbox非手3D) ✔39.6K分割 到 L3(泛任务)
EgoInfinity 2606.17385 自动(非手标) ✔4D手物GT ~ ✔retarget 引擎→L4
HRDexDB 2604.14944 ✔多相机 ✔高精度3D 配对真值 监督基准(小)

读表结论:没有任何一套 ego 数据集同时给出"大规模 × 全层次(L0–L4)"。L4(可行动作)只由引擎(EgoInfinity/Open-AoE retarget)配对基准(HRDexDB 小规模) 提供;L1–L3 的大规模覆盖是碎片化的。


三、六数据集五维对照(分组)

A 组 · 机器人导向 EGO 集(供 EGO 数据线直接训练/对齐)

维度 EgoVerse Open-AoE Ego-OSCAR EgoInfinity HRDexDB
规模 1,362h/80k回合/1965任务/2087人 ~2,000h/500+人/400+手机 550h·双目/分布式 Web 视频(引擎,按需生成) 100物体/2.1K试次
采集 平台协作 手机众包 200$开源头戴 网络 RGB 自动 专用多相机
标注方式 标准化 全管道(分割/手重建/轨迹) 自由文本+3D手 自动无人工 高精度3D真值+触觉力
是否机器人导向 是(有跨本体转移研究) 是(作原料) 是(反复一体) 是(配对基准)
成本特征 组织成本高 采集中低 单机<200$ 无采集(计算制) 专业采集高

B 组 · 泛型大规模 EGO 基准(作 L3 先验/预训练)

维度 EPIC-KITCHENS
规模 55h / 11.5M 帧 / 32人 / 39.6K 动作段 / 454.3K 物体框
采集 32 参与者在自家厨房(4城市/10国籍), 低成本自然采集
标注 参与者自述narration(L1) + 密集动作段verb-noun标注(L3) + 物体框
机器人导向 否(通用 ego 动作/物体理解) → 可做 VLA/WM 的 L3 先验/预训练

四、科学家判断

S1 · "泛型大规模 L3"和"机器人导向 L4"是同一块缺口的左右两边。 EPIC-KITCHENS 给了大规模 L3(39.6K动作段)但非机器人导向、无 L4;机器人导向集(EgoVerse/Open-AoE)要么规模不够、要么 L4 靠引擎。缺一个"大规模(≥1000h) × 机器人导向 × 到 L4(可行动作)"的 ego 集。

S2 · EgoInfinity 指出了补缺口的引擎式路线,但它产的是"重建产物"而非"原始采集"。 它把任何互联网 ego 视频自动升到 4D 手物 GT + retarget 动作(L2+L4),无需人工。这绕过了"采集+标注"双昂贵,但把精度赌在重建/重定向组件上——"引擎制"是通往 L4 规模化的可行路,代价是物理可信度(接触/力)仍弱(呼应蓝本 L5)。

S3 · HRDexDB 证明"配对+高精度+触觉"是监督质量的黄金标准,但注定小规模。 100 物体/2.1K 试次的多相机高精度真值+接触力,是"用人体数据教机器人"的质量上限参照;但它贵、不可放量。它和 EgoInfinity(引擎大规模但重建噪声)构成质量-规模的最优权衡两端。

S4 · 给"EGO 数据线"的供给端破局定式: 要同时拿到"大规模 + 到L4",现实组合是 低门槛采集(手机/200$设备/平台) + 自动标注引擎(EgoInfinity式: 从显式几何/接触/重定位) + 配对基准(HRDexDB式: 作监督质量校准)——三件套合流,才能把一个 ego 集推到"可直接训动作"。


五、一句话口径(更新版)

六大 ego 集在 L0–L4 量尺上是碎片化覆盖——L4(可行动作)只由引擎(Open-AoE/EgoInfinity)或配对小基准(HRDexDB)提供,"大规模×到L4"尚无一套满足;破局需"低门槛采集+自动标注引擎+配对校准"三件套合流。