Skip to content

数据×训练 · 证据清单(按四层栈归位)

配套:《数据×训练·研究纲领》。本文把已入库论文映射到四层数据栈 + 五个北极星问题,可据此按主题检索/精读。 北极星问题编号:①统一动作空间 ②各数据边际贡献 ③配对量 ④世界模型数据乘数 ⑤数据提纯

🟩 EGO 层(第一视角人体视频 → 海量预训练/跨本体)

论文 帮训练机制 对应问题
Open-AoE(第一视角数据集+工具链) 2000h 智能手机采集,MANO手位姿/原子动作,跨本体 retarget + 训练配方 ①③
EgoInfinity(Web 级 4D 手-物交互数据引擎) 任意 RGB 视频→4D手-物表示→任意机器人可执行动作(无人工标注) ①②
ImitatorGame IG-10K(配对 human-robot) 意图级模仿;10 条配对+规模=起飞
ZeroWAM / WAM-TTT / Steiner(人体视频训世界动作模型) EGO 当世界模型/隐式动作的汤底 ①④
UniDexTok(手 tokenizer) 手→统一动作 token,跨本体
EaDex(低成本示范跨本体灵巧) 从低成本人体示范学灵巧 ①③
HRDexDB(配对 human-robot 灵巧抓) 2.1K 高精度配对轨迹+接触力,跨本体基准
Latex 3D(LaST-HD) 从规模化人体视频学物理推理 ①④

🟨 UMI 层(通用操作接口 → 灵巧+跨本体+对齐)

论文 帮训练机制 对应问题
KoalaGripper(夹爪+采集设备协同设计) 手持采集与真机执行设备一起设计 ①⑤
YUBI(通用双指接口) 手指驱动夹爪,8434h/119任务跨多机器人直用 ①②
OnePolicy-ManyEmbodiments 相机中心统一动作几何,一权重吃全部本体
HRDexDB(跨本体配对) 同一目标物体对齐人/机抓取
Cloak / EaDex / UniDexTok 跨本体动作表示 trick

🟦 仿真/合成 层(补覆盖/失败/自动标注 + 放大)

论文 帮训练机制 对应问题
Video2DoorTraversal(一段视频→造数据) 单视频→仿真孪生→可执行示范
CRAFT(视频扩散造双臂数据) 生成式数据扩增
Worlds in One Demo(合成数据引擎) 一份演示→开放世界合成数据
CRESSim-Neo / GaussianDream++ / μ0 仿真引擎/世界模型当数据器
Real2Sim2Real(Panda 扭矩 sim2real) 物理参数标定,数据进 RL 的地基
BehaviorWorldGen(行为可信交通流) 合成数据"行为真实性" ④⑤
Scene2Demo(自进化数据生成) 失败→自动纠错的闭环造数据 ④⑤

🟪 真机遥操 层(目标本体金标准)

论文 帮训练机制 对应问题
COBALT(云端手机遥操众包) 众包摊薄成本,多国 7500+ 示范 ②⑤
AXIS(浏览器遥操社区数据引擎) 网页遥操 + 自动任务生成 + 质检过滤扩增 ②⑤
Missing Touch(分布式触觉反馈) 手感→示范质量(降 29–79% 轨迹偏差)
SoftVTBench(物理真值+DSR) 数据"过程物理对不对"的度量
ViTacPhys(物理属性条件化) 显式物理条件提升分布外 ①⑤
SIEVE(结构感知数据选择) 50% 数据/步数超越全量
KoalaGripper / YUBI(采集设备) 采集界面决定数据质量/规模 ①⑤

跨层(属于统纲,不单归一层)

  • π₀.7(可引导通用基础模型)、μ₀(规模交互轨迹世界模型)、Dexora/EaDex(跨本体 VLA)→ 回答 ①②④
  • VLA 综述(Datasets/Benchmarks/Data Engines)→ 已有全景图鉴

待补的证据缺口(精读优先)

  • ② 需要每类数据边际贡献消融的直接论文(多数只有单类报告,缺"同语料混训消融")。
  • ① 需要“统一动作空间同时吃 EGO/UMI/仿真/遥操”的端到端实证(多数只做跨本体或单源)。【部分填补:UCAG-P(2608.26058) 已用一权重吃下多本体+仿真+人手示范、免重定向合训,零样本 LIBERO-Plus 82%——但未含 EGO 被动视频,#这一格仍缺。)