数据×训练 · 证据清单(按四层栈归位)
配套:《数据×训练·研究纲领》。本文把已入库论文映射到四层数据栈 + 五个北极星问题,可据此按主题检索/精读。
北极星问题编号:①统一动作空间 ②各数据边际贡献 ③配对量 ④世界模型数据乘数 ⑤数据提纯
🟩 EGO 层(第一视角人体视频 → 海量预训练/跨本体)
| 论文 |
帮训练机制 |
对应问题 |
| Open-AoE(第一视角数据集+工具链) |
2000h 智能手机采集,MANO手位姿/原子动作,跨本体 retarget + 训练配方 |
①③ |
| EgoInfinity(Web 级 4D 手-物交互数据引擎) |
任意 RGB 视频→4D手-物表示→任意机器人可执行动作(无人工标注) |
①② |
| ImitatorGame IG-10K(配对 human-robot) |
意图级模仿;10 条配对+规模=起飞 |
③ |
| ZeroWAM / WAM-TTT / Steiner(人体视频训世界动作模型) |
EGO 当世界模型/隐式动作的汤底 |
①④ |
| UniDexTok(手 tokenizer) |
手→统一动作 token,跨本体 |
① |
| EaDex(低成本示范跨本体灵巧) |
从低成本人体示范学灵巧 |
①③ |
| HRDexDB(配对 human-robot 灵巧抓) |
2.1K 高精度配对轨迹+接触力,跨本体基准 |
③ |
| Latex 3D(LaST-HD) |
从规模化人体视频学物理推理 |
①④ |
🟨 UMI 层(通用操作接口 → 灵巧+跨本体+对齐)
| 论文 |
帮训练机制 |
对应问题 |
| KoalaGripper(夹爪+采集设备协同设计) |
手持采集与真机执行设备一起设计 |
①⑤ |
| YUBI(通用双指接口) |
手指驱动夹爪,8434h/119任务跨多机器人直用 |
①② |
| OnePolicy-ManyEmbodiments |
相机中心统一动作几何,一权重吃全部本体 |
① |
| HRDexDB(跨本体配对) |
同一目标物体对齐人/机抓取 |
③ |
| Cloak / EaDex / UniDexTok |
跨本体动作表示 trick |
① |
🟦 仿真/合成 层(补覆盖/失败/自动标注 + 放大)
| 论文 |
帮训练机制 |
对应问题 |
| Video2DoorTraversal(一段视频→造数据) |
单视频→仿真孪生→可执行示范 |
④ |
| CRAFT(视频扩散造双臂数据) |
生成式数据扩增 |
④ |
| Worlds in One Demo(合成数据引擎) |
一份演示→开放世界合成数据 |
④ |
| CRESSim-Neo / GaussianDream++ / μ0 |
仿真引擎/世界模型当数据器 |
④ |
| Real2Sim2Real(Panda 扭矩 sim2real) |
物理参数标定,数据进 RL 的地基 |
④ |
| BehaviorWorldGen(行为可信交通流) |
合成数据"行为真实性" |
④⑤ |
| Scene2Demo(自进化数据生成) |
失败→自动纠错的闭环造数据 |
④⑤ |
🟪 真机遥操 层(目标本体金标准)
| 论文 |
帮训练机制 |
对应问题 |
| COBALT(云端手机遥操众包) |
众包摊薄成本,多国 7500+ 示范 |
②⑤ |
| AXIS(浏览器遥操社区数据引擎) |
网页遥操 + 自动任务生成 + 质检过滤扩增 |
②⑤ |
| Missing Touch(分布式触觉反馈) |
手感→示范质量(降 29–79% 轨迹偏差) |
⑤ |
| SoftVTBench(物理真值+DSR) |
数据"过程物理对不对"的度量 |
⑤ |
| ViTacPhys(物理属性条件化) |
显式物理条件提升分布外 |
①⑤ |
| SIEVE(结构感知数据选择) |
50% 数据/步数超越全量 |
⑤ |
| KoalaGripper / YUBI(采集设备) |
采集界面决定数据质量/规模 |
①⑤ |
跨层(属于统纲,不单归一层)
- π₀.7(可引导通用基础模型)、μ₀(规模交互轨迹世界模型)、Dexora/EaDex(跨本体 VLA)→ 回答 ①②④
- VLA 综述(Datasets/Benchmarks/Data Engines)→ 已有全景图鉴
待补的证据缺口(精读优先)
- ② 需要每类数据边际贡献消融的直接论文(多数只有单类报告,缺"同语料混训消融")。
- ① 需要“统一动作空间同时吃 EGO/UMI/仿真/遥操”的端到端实证(多数只做跨本体或单源)。【部分填补:UCAG-P(2608.26058) 已用一权重吃下多本体+仿真+人手示范、免重定向合训,零样本 LIBERO-Plus 82%——但未含 EGO 被动视频,#这一格仍缺。)