数据×训练 · 研究纲领(方向把握)
研究母题:EGO / UMI / 仿真 / 真机遥操作这四类数据,如何造、如何配、如何混,最终有效帮到训练。 这句话是 arxivReader 所有数据方向工作的北极星。下面是方向定性——先想清楚机制,再去抓论文。
一、核心判断:没有哪一类数据"够用",它们是互补的四个角色
把四类数据源放到"一条数据→训练价值链路"上,它们各自承担不可替代的角色:
| 数据源 | 给训练什么(机制) | 拿什么换 | 最大短板 |
|---|---|---|---|
| EGO 人体第一视角 | 规模 + 多样性 + 人类灵巧(不用机器人就能海量采) | 极低成本 | 无机器人动作标签,需跨本体桥(retarget/隐式动作) |
| UMI 通用操作接口 | 灵巧 + 跨本体 + 对齐(人手拿手持设备采,跨本体可用) | 中低成本 | 数据格式/动作空间设计是命门 |
| 仿真/合成 | 覆盖边界 + 失败样本 + 自动标注 + 无限 | 便宜可扩展 | sim2real 鸿沟、行为真实性 |
| 真机遥操作 | 本体匹配 + 动作真值 + 金标准(目标机器人直接训) | 昂贵/慢/耗硬件 | 不可规模化、人类手感瓶颈 |
一场训练的正确姿势,几乎总是"四层栈",而不是"四选一":
① 用 EGO(+互联网)做海量预训练 → 世界模型 / 通用表征 / VLA 主干
② 用 UMI 型设备低成本采"灵巧+跨本体"示范 → 人工覆盖
③ 用仿真/世界模型合成边界、失败、密集物理 → 补覆盖 + 放大(real2sim 校准)
④ 用真机遥操采目标本体的金标准示范 → 精调 + 验证
⑤ 用统一动作空间(相机中心/夹爪不变/隐式动作)把这四层混进一个训练语料
二、四类数据各自的"帮训练"机制(重点精读视角)
EGO(第一视角人体视频)
机制A 当预训练语料(scale):人类每天产出大量真实操作视频,喂 VLA/世界模型做主干的"海量免费汤底"。价值在多样性跟泛化:机器人永远采不到那么多种场景。 机制B 跨本体动作抽象:人体≠机器人,必须把"人干什么"翻译成"机器人怎么动"。三条路:显式 retarget(关节对齐)、隐式/潜变量动作(motion-focused latent action)、跨本体动作空间(相机中心)。 机制C 意图级模仿(配对):ImitatorGame 的利刃——仅 10 条 human↔robot 配对示范 + 大规模预训练即大幅提升。证明"配对"是把 EGO 变现的高杠杆。 证据在库:Open-AoE(第一视角数据集+工具链)、EgoInfinity(Web 级 4D 手-物交互数据引擎)、ImitatorGame IG-10K、ZeroWAM(人体视频训世界动作模型)、WAM-TTT、UniDexTok(手 tokenizer)、EaDex、Mrs/Steering World Action。
UMI(通用操作接口)
核心思想:用手持、低成本、可随身携带的设备,让人就能采出"跟演示对齐、跨本体可用的"灵巧操作数据;配合夹爪不变动作表示 + 数据格式设计,让同一批数据能训很多机器人。它在"人类灵巧"与"跨本体可用"之间搭了桥。 帮训练的价值:①不必等真机就可以大规模采技能数据 ②一份示范多本体复用(数据投资回报高)③人类手能做到的精细技能,遥操未必做得到。 证据在库:KoalaGripper(夹爪+数据采集设备协同设计,正对 UMI 哲学)、OnePolicy-ManyEmbodiments(相机中心统一动作几何,一个权重吃全部)、YUBI(通用双指接口、双臂规模化)、HRDexDB(配对 human-robot)、EaDex。
仿真 / 合成
帮训练机制:补覆盖、补失败、补标签密度——仿真能做真机不敢做/难做的(危险、稀有、失败恢复),且动作/状态标签免费且一致;世界模型/生成器本质是"数据乘数"(一段视频→无限变体)。 关键约束:①sim2real 鸿沟(要 real2sim 校准)②行为真实性——BehaviorWorldGen 揭示合成数据最大坑不是"像不像"而是"周围智能体会不会合理回应你" ③产出可执行、可训的数据才算数(Scene2Demo 的闭环纠错)。 证据在库:Video2DoorTraversal(一段视频→自动造数据流)、Real2Sim2Real(Panda 扭矩 sim2real 校准)、CRAFT(视频扩散造双臂数据)、Worlds in One Demo(合成数据引擎)、CRESSim-Neo、GaussianDream++/μ0(世界模型)。
真机遥操作
帮训练机制:目标本体的金标准——本体匹配、动作标注齐全、直接在要部署的机器人上;任何大规模/预训练最后都绕不开"目标机器人的精调数据"。 关键约束:成本与手感。Missing Touch 证明"空间分布式触觉反馈"决定示范质量(轨迹偏差降 29–79%、压缩动作状态空间→低熵示范);COBALT 用云端手机遥操作众包摊薄成本;SIEVE 用数据选择提纯。 证据在库:Missing Touch(手感→数据质量)、COBALT(众包遥操)、SoftVTBench(物理真值+DSR)、ViTacPhys(物理属性条件化)、KoalaGripper。
三、研究纲领要盯的关键问题(待精读的"北极星问题")
- 统一动作空间:用什么表示让 EGO/UMI/仿真/遥操能共存于一套训练语料?(相机中心几何 / 夹爪不变 / 隐式动作)——这是"四层栈"能不能成立的技术总纲。
- 每类数据的边际贡献:做消融/曲线,量化"每类数据带来的泛化增益",回答"到底该多采哪类"。
- 配对比比:human↔robot 配对要多少、怎么造最省(ImitatorGame 给的是 10 条 + 规模)。
- 世界模型当数据乘数:仿真/世界模型生成的边界与失败数据,能否替代部分遥操?省多少?
- 数据质量提纯:SIEVE 选择、SoftVTBench 物理真值、手感反馈——"留哪些丢哪些"。
四、落地到 arxivReader
- 抓取已按"数据集/基准/仿真 + 数据引擎/众包/跨本体"双轨道跑;从这里持续补充四类的代表性 + 前沿论文。
- 精读标准:优先回答上述 5 个北极星问题的论文;每篇落在"它属于四层栈哪一层、帮训练哪个机制"。
- 成果沉淀:本纲领 + 各数据源的证据清单 → 持续更新进飞书
EGO && UMI。