EGO 数据线 · 三大 EGO 数据集标注层次对照表
供给端对照:EgoVerse(Danfei系平台) / Open-AoE(手机众包+工具链) / Ego-OSCAR(200$开源硬件)。 数据均经 arXiv 摘要核验;对"摘要未展开"的项如实标注,不臆测。
一、标注层次谱系(先定标尺)
定义从浅到深的标注层次,作为三套数据集的共同坐标: | 层 | 标注内容 | 能支撑的训练 | |---|---|---| | L0 | 采集元数据:相机/IMU 同步校准(时间、外参、内参) | 特征提取、重建前提 | | L1 | 文本/语义级:动作语言描述 | 任务/语言对齐、VLA 语言条件 | | L2 | 空间结构级:3D 手姿态(MANO)/相机轨迹/物体位姿 | 3D 表示、跨本体 retarget 输入 | | L3 | 时域事件级:时间定位原子动作(动作分割/定位) | 长时程规划、段落监督 | | L4 | 可行动作级:重定向后的机器人可执行动作 | 直接训策略(免对齐) |
二、三数据集五维对照表
| 维度 | EgoVerse | Open-AoE | Ego-OSCAR |
|---|---|---|---|
| arXiv | 2604.07607 | 2607.14183 | 2608.08285 |
| 组 | Danfei Xu 系 | 开放社区 | 开源硬件团队 |
| 规模 | 1,362h / 80k 回合 / 1,965 任务 / 240 场景 / 2,087 人 | ~2,000h / 500+ 贡献者 / 400+ 手机 | 550h·每相机(双目) / 分布式贡献者 |
| 采集方式 | 平台协作(个人/实验室/企业统一采集) | 手机众包(400+ 手机) | 200$ 开源头戴双目-惯导(Aria 低配替代) |
| L0 采集元数据 | 标准化格式(同步/格式统一) | 相机轨迹重建 | 硬件同步双目+IMU、逐会话双目校准 ✔ |
| L1 文本/语义 | manipulation-relevant 标注(层次见原文) | 文本标注 ✔ | 自由文本动作标注(开放词汇、覆盖近全时间线) ✔ |
| L2 3D 结构 | manipulation-relevant 标注(见原文) | MANO 手位姿 + 相机轨迹 ✔ | 逐帧 3D 手重建 ✔ |
| L3 时域事件 | 见原文(未在摘要逐一展开) | 时间定位原子动作 ✔ | ✘(无结构化原子动作,靠自由文本覆盖) |
| L4 可行动作 | 跨本体转移研究(shared protocols)可支持 | 工具链含 cross-embodiment retargeting(可通向动作级) | ✘(不自带重定向,是翻译/世界模型原料) |
| 工具链/管道 | 平台统一处理+tooling | 全管道(分割/标注/手重建/相机轨迹) + 下游训练配方(VLA/WAM/WM) | 采集软件栈(编码/IMU daemon/同步/看门狗),无训练管道 |
| 成本特征 | 协作平台(组织成本为主) | 手机众包(低采集成本) | 单机 <200$(最低) |
| 定位 | 大规模跨本体转移研究的平台基建 | 从采集到训练的完整开放管道 | 最便宜可站住的众包 ego 底座 |
三、科学家视角判断
S1 · 标注层次与"可训练性"之间隔着 L4 这一大段。 三套里只有 Open-AoE 显式给到 L3(时间定位原子动作)且带 retarget 工具链通向 L4;EgoVerse 规模最大但摘要未展开标注层次;Ego-OSCAR 给到 L2(3D手)+自由文本、缺 L3。结论:要想"直接训动作",标注层次至少要够到 L3 + retarget 工具(Open-AoE 的路径);否则就落到 L4 由 EgoEngine/RoboEdit 类翻译引擎补齐。
S2 · 标注层次 vs 成本是倒挂的:越浅越便宜。 Ego-OSCAR 最便宜(200$),标注层次正好最浅(L0+L1+L2、无L3);Open-AoE 手机众包成本中低、标注层次最全;EgoVerse 靠平台标准化。这给供给端一个明确的权衡曲线:"要 L3/L4 就得投入标注/重定向,单纯拉低成本会停在 L2"。
S3 · "标注成本藏在 L2/L3",正好呼应 A 蓝本的判断。 A 蓝本说 EGO 线的瓶颈在 L2/L3 是否补出"可对齐动作"。三数据集的现实印证:最便宜的(Ego-OSCAR)把动作问题整个留给了下游(翻译/世界模型),最全的(Open-AoE)把 retarget 做进工具链但规模只有 2k h。 没有一套同时给到"大规模 + 全标注层次"。
S4 · 用"标注层次谱系 L0–L4"作统一量尺,是梳理供给端的关键工具。 三套数据集放在 L0–L4 尺上看,各自的"可训练天花板"一目了然。后续任何新 ego 数据集(EgoInfinity/Open-AoE 后续版等)都应先在这把尺上定位。
四、一句话口径
三大 EGO 数据集是"成本-标注层次"权衡曲线上的三个采样点:Ego-OSCAR(最便宜·浅标注·作翻译原料) → Open-AoE(中成本·标注最全·带retarget管道) → EgoVerse(平台化·规模最大·组织成本);EGO 数据线供给端要破局,需要"大规模 × 全标注层次(到 L3/L4)"还没被任何一套同时满足。