Skip to content

深度精读 · EGO/UMI 数据引擎批次(8篇)

这批复读"读纲领"里最贴 ①统一动作空间 ②边际贡献 ③配对 ⑤提纯 的论文。 主线:数据源如何落地成可训练的信号


1 · AXIS — 可生长的社区数据引擎(浏览器遥操)

一句话:把数据采集从"专职实验室"变成"全球浏览器众包",并自动把原始示范转成训练级数据。 核心:浏览器式遥操(免装硬件)+ 自动任务生成/校验 + 自动化质检(成功判定/质量过滤/轨迹平滑/视觉与物理扩增)。当前 207 任务 / 50K+ 轨迹。 为什么重要(真洞察)"能规模化采集 + 能自动化提纯" 是数据引擎的一体两面。AXIS 把"采"(浏览器众包)与"练前处理"(质检/扩增)串成闭环;连续预训练在 π₀.5 上 +5.8%、比 RoboCasa365 预训练高 37.3%,且随数据量持续缩放——这是②边际贡献/缩放曲线的直接证据,且增益集中在布局/传感噪声/相机扰动(泛化,不是记背)。 局限:质量依赖自动判定的可靠性;任务仍偏仿真/受控场景。 链接:https://arxiv.org/abs/2607.21588

2 · COBALT — 众包遥操作平台(智能手机)

一句话:用云端 + 手机/VR/3D鼠标,把"采示范"成本打下来,还带自动质量过滤。 核心:向量化环境 + 负载均衡,1 GPU 支持 8 并发、20Hz、<100ms 端到端延迟;手机可达 256 客户端/8GPU;手机遥操效果不输专用硬件且更符合人体工程;用实时指标自动滤掉次优示范。众包收获 9 国 5 天 7500+ 示范(50+ 小时)。 为什么重要数据采集的成本结构决定数据能否规模化——COBALT 证明"用手里都有的手机 + 云端编排"就能跨地域众包,且质量不是玄学:实时指标 + 用户训练课程可系统提升。这正面回答"遥操不可规模化"的旧共识。 局限:是否真能覆盖灵巧/接触密集,待看(手机遥操天花板)。 链接:https://arxiv.org/abs/2605.19138

3 · EgoInfinity — Web 级 4D 手-物交互数据引擎(EGO 变现)

一句话:把互联网任意 RGB 视频自动化升成"4D 手-物表示 + 任意机器人可执行动作"。 核心:模块化引擎(感知/分割/重建/交互感知细化/retarget)。不再堆静态数据集,而是可随组件进步持续受益的引擎;把野外人体视频转成agent-agnostic 度量 4D 手-物表示(手轨迹/6DoF物体位姿/接触状态);关键创新是跨模块度量校准 + 交互感知细化,抑制纯视觉重建的漂移与接触不一致;新 motion retargeter 把 3D 手动作编成任意形态机器人的关节轨迹(人体部分可见也能做)。 为什么重要:EGO 变现最大的坑不是"采"而是"跨本体桥的物理可靠性"——EgoInfinity 直击"视频→动作"两条绳:度量一致性(漂移) + 接触一致性。可执行技能(抓/切/擦/倒)实证,是"互联网→真实机器人行为"的可扩展桥。 局限:接触类任务(摩擦/力学)仍是重建信号的薄弱区。 链接:https://arxiv.org/abs/2606.17385

4 · Open-AoE — 开放第一视角数据集 + 工具链

一句话:智能手机就能贡献的第一视角操作数据,从采集一路打通到训练。 核心:~2000h 操作视频,500+ 贡献者、400+ 手机;标注含文本/MANO手位姿/相机轨迹/时间定位原子动作。配套处理管线(时序动作分割/语义标注/手重建/相机轨迹重建)+ 下游工具链(可视化/跨本体 retarget/数据转换/VLA-WAM-世界模型训练配方)。 为什么重要开放+社区化+工具链才是"人人可贡献、人人可复用"的 EGO 基建——它同时降低"产数据"和"用数据"两类门槛。是①③(跨本体/配对)的落地样板。 局限:标注/手重建质量与一致性需随数据量检验。 链接:https://arxiv.org/abs/2607.14183

5 · KoalaGripper — 夹爪+数据采集设备协同设计(UMI 哲学)

一句话:把"采集设备"和"真机执行夹爪"当成一套系统一起设计,而不是让采集设备去迁就真机形态。 核心:co-design 框架同时约束数据采集与执行两侧。Koala 夹爪:力优化手指/扳机联动 + 定向反射质量 + 单体双拇指 + 人体工程;可反向驱动(backdrivable)、有效质量几十克;能稳抓广谱物体/用力工具/精确分拣;配端到端"采集→策略执行"管线。 为什么重要二手教训——采集设备若照抄真机形态,会牺牲人体工程与操作表现。Koala 反其道用 co-design:采集手感与执行可控兼得。这正是"采集界面决定数据质量"在 UMI 设备层的落地。 局限:双拇指/单体设计的泛化面与量产成本待考察。 链接:https://arxiv.org/abs/2608.20546

6 · YUBI — 通用双指接口(UMI 更上一层)

一句话:手指直接驱动夹爪的双指接口,解决 UMI 手枪握把在精细双臂任务上的人体工程问题,并验证"一份数据直接跨多机器人执行"。 核心:yielding(顺从/顺势)手指驱动——人类手指运动直接映射夹爪颌。配 VR 6DoF 追踪采数据,造了 8434h / 1.20M 回合 / 119 任务 UMI 型数据集;单策略在 UR/Franka/ELEY 多个双臂机器人上直接跨本体执行(挂哪台就能用)。 为什么重要UMI 数据哲学的最高验证——同份数据跨本体直用,且把"人体工程"当成可规模化采集的命门。8434h 的量级证明"夹爪设备驱动大规模语料"可行。 局限:仍以抓取类为主,极端灵巧(手指独立运动)受限。 链接:https://arxiv.org/abs/2606.10244

7 · HRDexDB — 配对 human-robot 跨本体灵巧抓取数据集

一句话:同一目标物体上,人和多类机器手的高精度对齐抓取轨迹 + 接触力,做跨本体基准。 核心:多相机系统 + SOTA 视觉法,提供 agent 与物体高精度时空 3D 真值;100 物体、2.1K 抓取回合,同步视觉+运动学,触觉手带接触力。 为什么重要配对(人↔机)是③的精确定义:不是"类似动作",而是"同目标同构型对齐动作+真值"。它直接服务"用人体数据教机器人"的监督信号质量。 局限:局限在抓取这一任务族。 链接:https://arxiv.org/abs/2604.14944

8 · SIEVE — 结构感知数据选择(⑤提纯)

一句话:示范不是一堆点,而是"可复用原语 + 转移接口"的组合;按结构分配预算选数据,50% 数据/步数即超越全量。 核心:把轨迹看成可复用的"视觉运动原语"组合;先切原语,再按"复用暴露度/收益递减"分配选择预算到组合模式,最后在各模式桶内选中位轨迹(medoid)(中心、稳定、易模仿)。 为什么重要"数据不是越多越好" 的结构化解法——冗余/噪声/覆盖不均才是问题;用可复用结构做信号,是⑤的教科书。50% 数据+50% 步数超越 full-data 训练,直接回答"该留哪些丢哪些"。 局限:依赖"原语可切分"假设;对长程/连续流动任务可能失效。 链接:https://arxiv.org/abs/2607.06442


这批的合并 Insight(回答纲领)

  • 可规模化采集 + 自动化提纯 = 数据引擎的左右手(AXIS/COBALT/SIEVE):能采还要能挑。
  • "视频→动作"的硬骨头在物理可靠性,不是视觉重建(EgoInfinity:度量+接触一致性)——这是 EGO 变现的最大杠杆。
  • UMI 哲学的正宗后继是"采集界面 co-design"(Koala/YUBI):手怎么握,决定数据怎么好、怎么多。
  • 配对数据是把类人数据变成训练监督的关键(HRDexDB/ImitatorGame)。