深度精读 · 数据方向剩余批次(17篇)
母题:数据×训练 价值链条。本批清理
_待精读.md剩余队列中属于【数据方向】的 17 篇, 越界的模型/感知/规划/驾驶类已在队列中归位跳过(不精读,见文末清单)。 标注北极星问题:①四源同语料混训实证 ②边际贡献消融 ③数据性质量化与改造训练 ④跨本体(EGO/灵巧)桥 ⑤评测度量数据真实价值。
A. 数据引擎 / 合成数据生成
1. Worlds in One Demo — 用"一份示范"生成整个开放世界(合成数据引擎)
🔗 arXiv: https://arxiv.org/abs/2607.13154
2607.13154 · 北极星③
核心思想:遥操和 UMI 单份示范成本极高,本文反其道——把"每一份人工示范"当作种子,用可控合成生成把它的价值放大到覆盖开放世界(空间/长程/场景泛化)。
方法拆解:不是刷随机仿真,而是围绕"这一份示范"的语义与几何做实例化、可控分布的合成扩增:同一任务换表/换物/换位/换光照,产出对齐示范的动作标签,最大化单次人力输入的可复用杠杆。
为什么重要(真洞察):它把数据供给的瓶颈从"采集成本"迁移到"生成控制"。关键不是生成器强,而是生成分布与任务语义对齐——乱生成会污染(见 Batch2 的 BehaviorWorldGen 教训)。这直接支撑纲领里"仿真补覆盖"层:仿真不是替代人,而是给人类示范"配覆盖"。
局限·下一步:合成→真实仍有 gap(视觉/物理域差);"生成什么才补未覆盖区域"仍需与覆盖洞信号(见多样性专题 I4)联动,否则合成只是堆量。
一句话:单示范是种子,可控合成是让每一份人工程度成指数级覆盖的肥料。
2. CRAFT — 视频扩散生成双手示范(Canny 引导)
🔗 arXiv: https://arxiv.org/abs/2604.03552
2604.03552 · 北极星③
核心思想:双手数据贵且视角/配置/本体视觉多样性窄。用视频扩散 Transformer 合成时间一致、可对齐机器人动作的双手示范,Canny 引导保证对象几何一致性。
方法拆解:以 Canny 边缘为条件约束空间结构,扩散出时序连贯的双手交互视频,再转成可训练动作。
为什么重要(真洞察):证明"生成视频→提动作"这条路能补双手场景的视觉多样性——这正是多样性专题里"谱系B 嵌入/语义级多样性"的供给端。双手是对称+协同结构,几何约束(Canny)比纯文生视频更稳。
局限·下一步:合成视频的动作质量/物理一致性是上限;离 full sim 数据管线(CRESSim-Neo)仍有差距。
一句话:用扩散视频把双手示范的视觉多样性从"天价"降到"可控生成"。
3. CRESSim-Neo — 批量 GPU 手术仿真 + GPU 驻留数据管线
🔗 arXiv: https://arxiv.org/abs/2608.25192
2608.25192 · 北极星③⑤
核心思想:手术机器人缺数据,本质缺"能大规模产坐的仿真"。把刚体/软体/流体/缝线/超声全塞进批量 GPU 仿真 + GPU 驻留数据管线(数据不落盘回 CPU,直接在显存里采样增广)。
方法拆解:位置(position-based)动力学 + batched rendering + 手术专用感知 + 数据驻留 GPU,支持组织操作/抽吸/缝合/线缆驱动/超声成像合成。
为什么重要(真洞察):数据管线的瓶颈常不在生成器而在I/O 通路——先采到 CPU 再增广是浪费。"GPU 驻留"把生成-增广-训练拉进同一带宽,是数据引擎的工程化真话。
局限·下一步:手术域的逼真度/力学可信是长期硬约束;通用它需要领域仿真资产积累。
一句话:把"生成数据"做成 GPU 上不落盘的生产线,手术数据规模的斜率才起得来。
4. Video2DoorTraversal — 单视频 real-to-sim-to-real 门孪生
🔗 arXiv: https://arxiv.org/abs/2608.20251
2608.20251 · 北极星③
核心思想:给一段真实门 RGB 视频,DoorTwin 重建实例对齐、可仿真的门孪生(几何+外观),再在仿真里合成多样门状态训练穿越策略,回传真实。
方法拆解:real→sim(重建门孪生)→sim 内扩多样 handle 位置/门型/开度→训练轮足移动操纵→sim2real。
为什么重要(真洞察):它是"仿真补覆盖"按场景实例而非"通用仿真"来配——针对眼前这一扇门造孪生,比在庞大的通用仿真里乱跑更可能在 sim2real 里站住。是"仿真数据要贴着任务语义生成"的又一例证。
局限·下一步:单门孪生的泛化要扩到多门/多建筑;渲染→真实仍需域迁移。
一句话:先造"这一扇门"的仿真孪生,再让数据补齐它没见过的开法。
5. Learning While Deploying — 车队离线→在线强化学习数据回路
🔗 arXiv: https://arxiv.org/abs/2605.00416
2605.00416 · 北极星③
核心思想:离线示范数据固化了分布,部署中的分布偏移/长尾失败/人工纠正是离线集永远装不下的。LWD 在真实部署车队上把 offline→online RL 做成闭环,把"部署即数据采集"。
方法拆解:离线预训→线上用部署中收集的(含人工纠正)交互做 online 更新→车队规模聚合。
为什么重要(真洞察):这是对"数据性质"最反直觉的一击——好数据不只是"采集来"的,是"部署回合生成"的;离线示范的次优/覆盖天花板要靠部署中的纠正流来补。它把数据供给从"一次性采集"改成"终身回路"。
局限·下一步:online 稳定的代价(安全/回滚)、车队一致性;不是所有任务都能部署中安全收集。
一句话:让正在用的机器人为自己补数据的锤子,比离线攒数据集更接近泛化。
6. ROS2 Connect — 跨 WAN 的机器人数据通信底座
🔗 arXiv: https://arxiv.org/abs/2608.25102
2608.25102 · 数据基础设施(邻域)
核心思想:ROS2/DDS 的 multicast 发现跨广域网不可用,远程遥操/分布式数据采集被卡住。用 WebSocket 打通 WAN 上的 ROS2。
为什么重要(真洞察):数据引擎里"分布式采集"(众包/跨机构协作)的上限往往在传输层——让机器人数据能跨机房流动,才谈得上跨本体/跨地域语料(呼应 COBALT 智能手机众包、AXIS 社区数据引擎。参见数据引擎批次)。
局限·下一步:延迟/吞吐/实时性取舍;安全审计。
一句话:先让数据能跨城流动,众包/社区数据平台才有地基。(邻域工具,非数据性质本身)
B. 数据集 / 基准
7. HABIT — 人存在环境(human-present)的示范数据集
🔗 arXiv: https://arxiv.org/abs/2606.31682
2606.31682 · 北极星③
核心思想:现有大规模示范都在"无人环境"采的,策略会"会做事但不善解人意"。HABIT 补"有人在场"的示范数据,让人-机器人交互行为可学习。
方法拆解:在有人存在的场景里组织任务采集,覆盖需要"人-机器人距离/让路/交接"等社交感知行为的任务谱。
为什么重要(真洞察):这戳中一个常被忽视的数据性质维度——场景社会语义。覆盖洞不止在"状态-动作空间",还在"有人/无人"这个分布轴上;无人数据训出的策略在真人家居场景天然暴露。
局限·下一步:社交行为的标注/度量大;跨文化差异(呼应 ACME)怎么进示范数据。
一句话:示范数据不止要覆盖"任务空间",还要覆盖"人存在与否"这个社会分布轴。
8. SurgSync — 手术多模态时间同步采集框架+数据集
🔗 arXiv: https://arxiv.org/abs/2603.06919
2603.06919 · 北极星③
核心思想:手术机器人智能化被"缺训练数据"卡住。SurgSync 做时间同步的多模态(视觉/力/器械状态等)采集框架+数据集,为 supervised autonomy 提供数据。
为什么重要(真洞察):领域数据(手术)缺的不是"更多视频",而是同步的多模态配套——单模态无法支撑高层控制/监督自治。数据工程的"模态配对质量"是领域可训性的钥匙(呼应 HRDexDB 配对思想)。
局限·下一步:手术数据合规/隐私;标注成本。
一句话:手术智能化缺的是"同步好的多模态",不是"更多的视频"。
9. ACME — 跨文化、多本体的社交导航数据集
🔗 arXiv: https://arxiv.org/abs/2607.21964
2607.21964 · 北极星③④
核心思想:现有社交导航数据集缺文化/地理/人机交互方式的多样性。ACME 采集跨文化×多本体的共享空间运动数据。
为什么重要(真洞察):这是"多样性"从状态-动作空间延伸到文化/社会规范空间的实证——同一个"靠近人"在不同文化里是不同合法动作。多本体(不同机器人形态)+多文化=真正覆盖"人怎么对待机器人"的分布。
局限·下一步:文化维度的标签化与量化;跨地区检索的地域代表性。
一句话:社交行为数据的"多样性"要覆盖文化维度,本地化才能自动化。
10. DexVerse — 多任务多本体灵巧操作模块化基准
🔗 arXiv: https://arxiv.org/abs/2607.08751
2607.08751 · 北极星⑤④
核心思想:灵巧基准都"孤立单任务",无法系统衡量跨任务/跨本体泛化。DexVerse 做成模块化:多交互模式×多感知条件×多机身,可控视觉变化。
为什么重要(真洞察):它在做"评测数据覆盖度"的系统化——要回答"策略到底跨本体/跨任务泛没泛",基准本身必须把这些轴隔离出来可控地变。呼应纲领⑤"评测要度量数据真实价值"和证据清单②消融需求。
局限·下一步:基准✓≠解决数据稀缺;任务/本体的代表性仍需扩展。
一句话:把"跨任务×跨本体×跨感知"做进同一套可控基准,泛化才测得出。
11. VLA Survey: 数据集/基准/数据引擎 —— 数据即瓶颈 ★
🔗 arXiv: https://arxiv.org/abs/2604.23001
2604.23001 · 北极星①②③④⑤(全景)
核心思想(对本研究的战略支撑):VLA 下一个瓶颈不是架构,而是数据基础设施——高保真数据引擎 + 结构化评测协议要一起设计。
方法拆解:对 VLA 的数据集/基准/数据引擎做系统性数据视角分析,论证"数据×训练"共同设计。
为什么重要(真洞察):这是纲领的直接学术背书——把我们从"读论文"抬到"读研究结构"。它验证了四个核心判断:①模型红利见顶、数据红利开始 ②数据引擎/评测要 co-design ③未来进步靠数据侧 ④单纯堆架构(μ₀/π0.7)不解决数据瓶颈。应作为研究纲领的 top-citation。
局限·下一步:survey 罗列有余、定量证据(四源混训消融)仍需我们自己补(对应证据清单缺口②)。
一句话:VLA 的胜负手正从"模型架构"转向"数据引擎×评测协议"——和我们的北极星同构。
12. SCAPE — 场景条件化的仿真增强策略评估
🔗 arXiv: https://arxiv.org/abs/2608.19425
2608.19425 · 北极星⑤
核心思想:真机评估可信但贵难扩,仿真易扩但有 sim2real 偏差。SCAPE 用场景条件化的仿真增强:针对具体"场景分布"补仿真投放,而非笼统求均值。
方法拆解:识别评估里"哪些场景稀缺/高风险",用仿真为该场景条件补数据,目标不是平均分而是分布可靠。
为什么重要(真洞察):评估数据本身也是"数据"——它的覆盖洞导致我们"高估低估"不一。SCAPE 把评估从"一堆 rollout 平均"精细到"按未覆盖场景补仿真"——是⑤"评测度量数据真实价值"的量化侧。
局限·下一步:场景分布怎么定义/采样(又回到覆盖量化);sim2real 偏差仍在。
一句话:评估要"按没覆盖到的场景补仿真",平均分掩盖了洞。
13. Push-T(Agentic 重访)— 无示范的算法化解决
🔗 arXiv: https://arxiv.org/abs/2608.18227
2608.18227 · 邻域/最新趋势
核心思想:用 LLM coding agent(Claude Code+Fable5)给 Push-T 写一个不需要任何示范的算法解。这对"示范驱动"范式是个挑衅式反例。
为什么重要(真洞察):它逼我们思考——一定量的任务(状态可观测、物理可建模)根本不需要"示范数据",agentic 手写/搜索即可解决。这划出数据价值的一个边界:数据不是万能的,难点在"状态/动力学不透明+需要灵巧接触"的任务。
局限·下一步:仅单一基准;agentic 解的可扩展性/稳定未证。
一句话:有的任务无需示范数据——逼我们想清楚"数据到底在哪种任务上不可替代"。(趋势信息,非数据方法本身)
C. 跨本体 / 灵巧数据表示
14. UniDexTok — 跨本体灵巧手的统一 tokenizer(真实数据)
🔗 arXiv: https://arxiv.org/abs/2606.10683
2606.10683 · 北极星④
核心思想:灵巧手硬件差异(运动学/关节定义/DoF)让"共享状态表示"无从谈起,数据碎片化。UniDexTok 用真实数据学一个统一灵巧手 tokenizer,把不同本体烫进同一状态空间。
方法拆解:从真实多本体手部数据训练统一 token(latent action/state),让异构手数据能联合训练。
为什么重要(真洞察):这是"解耦=本体无关推理+本体相关动作头"路线的数据侧实证(呼应 EGO 跨本体桥 I2)。比手写关节对齐(UNI 那类)更可扩展——用数据学对齐,而不是造统一关节箱。
局限·下一步:tokenizer 学出来的"统一空间"是否真保持语义/物理可学;跨到爪/软手。
一句话:让"数据自己"把不同灵巧手对齐成一个 token 空间,比人手工定义统一关节更可能是解。
15. EaDex — 低成本示范条件下的跨本体灵巧框架
🔗 arXiv: https://arxiv.org/abs/2606.03268
2606.03268 · 北极星④
核心思想:真实灵巧数据贵(RL 探索大 + 示范贵)。EaDex 在低成本示范条件下做多本体灵巧学习。
方法拆解:用低成本示范(少而稳)跨多本体训练灵巧策略,弥补 RL/委托的成本墙。
为什么重要(真洞察):它回应的是数据路线的经济学——不是"数据越多越好",而是"在示范预算极低时,怎么让一个数据点跨多本体复用"。跨本体复用=把单示范的边际价值抬高(数据×训练的效率杠杆)。
局限·下一步:低成本示范的复杂度上限;灵巧策略的可扩展性。
一句话:示范越贵,就越要用"跨本体一鱼多吃"来摊薄单个示范的成本。
16. Longitudinal LfD — 无专家在场的长期示范可用性(人因)
🔗 arXiv: https://arxiv.org/abs/2608.25196
2608.25196 · 数据采集人因(邻域)
核心思想:非专家示范可用性多在"有机器人专家陪跑"的实验室评估。本文看没有实时专家反馈时,非专家在家长期教机器人遇到的真实障碍。
为什么重要(真洞察):数据采集的瓶颈不只是技术,是"谁会一直愿意给示范"。要是用户中途卡住没人救,数据集就断。它是"众包/遥操数据引擎"(COBALT/AXIS)的供给侧人因校验——采集流程的可用性直接决定语料能不能规模化。
局限·下一步:样本/场景窄;非专家数据质量噪声需与自动清洗(MMPF)配合。
一句话:示范数据能源源不断的前提是"非专家真能长期教得动",否则引擎空转。
17. GelSight 力场估计跨传感器零样本迁移
🔗 arXiv: https://arxiv.org/abs/2608.18240
2608.18240 · 感知数据结构(邻域)
核心思想:GelSight 大多手工制造、性能难标准化,导致每只传感器都要重新采数据训模型。提出跨不同 GelSight Mini 单元的 3D 力场估计零样本泛化。
为什么重要(真洞察):这是"数据不可比"的底层痛点——触觉传感器个体差异让同类数据不可互训。标准化/域对齐感知(让每只贴片采的触觉数据进入同一分布)是触觉数据可规模化复用的前提(呼应 Missing Touch/SoftVTBench 的触觉数据路线)。
局限·下一步:跨不同材质/尺寸传感的迁移;真 3D 力精度。
一句话:先解决"每只触觉贴片数据不可互训",触觉数据集才能规模化。
归位跳过(越界,不精读)
以下为宽泛抓取混入、不属于【数据×训练】方向,已在 _待精读.md 勾除归位:
- 模型/基础模型:DECOWAM、μ₀、π0.7、Regularized Latent Dynamics
- 感知/重建/里程计:Point2Pose、ScaRF-SLAM、UNRIO、LiDAR-IMU 标定、ISS 3D 高斯重建、Saliency 分割
- 驾驶/交通:SkyDrive、ChooseYourGame、分布式驾驶仿真测试
- 规划/多机/控制:TAMP Macro-operator、Trust-Aware 多机、CoToGrasp、Wave 双边遥操控制、航空安全遥操、建筑零样本接触
- 服务/农作:Orienteering 服务、Vineyard 遥操分析
若需其中任一(尤其 Orienteering 服务基准、Wave 遥操控制),可单独指出,再补精读。
一句话主线(本批对纲领的增量)
- 数据供给从"采集"转向"生成/部署回路":Worlds in One Demo / CRAFT / CRESSim-Neo / LWD 四条路都在把"单份数据的价值"放大或"让部署自我补数据",指向③数据性质改造训练的下一个工程形态。
- 数据多样性轴从"状态-动作"扩展到"社会/文化/人存在":HABIT / ACME——覆盖洞是多维的。
- 跨本体靠"数据学对齐"(tokenizer)而非"手写统一关节":UniDexTok / EaDex,直接支撑④。
- 评测本身也是数据、也要制造成覆盖:SCAPE / DexVerse,呼应⑤。
- VLA survey 是纲领的战略背书,应作 top-citation。