具身智能 · 数据方向速览(2026-08-27)
本期起,抓取调整为数据优先:聚焦具身/机器人数据的架构、平台、管线。 收录信号:数据管线/平台/基础设施、数据采集、遥操作、示范数据、合成数据、数据生成、数据策展、数据扩展、数据集。
为什么从数据角度看具身
具身智能(尤其 VLA / 世界模型)的瓶颈早已不是"模型结构",而是数据: - 一条可用的机器人示范成本高(遥操作人工、硬件损耗、跨机器不通用); - 数据异构(不同机械臂/相机/动作空间/夹爪),难以统一训练; - 真实接触/失败数据稀缺,模型看不见"恢复"和"边界"; - 模型学家的产出越来越依赖"数据飞轮":合成数据 → 训练 → 过滤 → 再生成。
所以数据架构/平台/管线,正从"辅助"变成"第一公民"。
本批数据方向精选(3 篇)
1. Scene2Demo — 自进化式离线具身数据生成
核心思想:给一张真实 RGB 图 + 一条用户查询,自动产出:可交互仿真场景、可执行任务配置、多视角执行视频、以及离线机器人学习数据集。核心是一个"物体-动作图"的模块化工作流,把任务生成落到"物体为中心的状态 + 动作迁移";执行失败/不完整时,由反馈代理查看 rollout 回放、修订动作流。 为什么值得关注:这是"数据飞轮自动化"的代表——不靠人手录示范,靠"图→场景→任务→执行→自反馈"自动造数据。102 个场景-任务对执行成功率 71.6%,且生成的数据训出的 BC 策略在新任务上达到 96%/92% 成功率;与 RoboGen、GenSim2 对比在自动化数据生成下规划/执行更强。 一句话:给机器人一个"自己造题、自己刷题、自己改错"的数据引擎。 链接:https://arxiv.org/abs/2608.26114(以实际为准,见 Obsidian 笔记)
2. CRESSim-Neo — 批量 GPU 手术仿真引擎 + 合成数据 + GPU 驻留数据管线
核心思想:面向手术机器人/机器人学习的一体化仿真引擎:位置法同时解算刚体/可变形组织/流体/线绳,配批量渲染、手术专用传感(如超声图像合成),并内置 GPU-resident 数据管线——可直接访问物理/渲染缓冲、DLPACK 零拷贝接 PyTorch,让"在 GPU 里训练"成为可能。 为什么值得关注:仿真是合成数据的第一生产力,而手术/医疗是标注最贵、最不可及的领域。CRESSim-Neo 在 4090 上吞吐 2.03M env steps/s(8192 并行 CartPole)、可扩展批量手术场景,等于把"造数据"变成"可量化吞吐的流水线"。 一句话:把手术/医疗的合成数据造得像工业流水线一样快、可扩展。 链接:https://arxiv.org/abs/2608.25192
3. ROS2 Connect — 跨广域网(WAN)的机器人数据通信平台
核心思想:ROS2 靠 DDS/RTPS 组播发现,在 WAN(跨网段/跨地域)下不可用,远程操作/分布式困难。ROS2 Connect 用 WebSocket 客户端-服务器架构,无需改网络基础设施/DDS,即可双向传输 topic/service/action/系统数据,并带认证与访问控制。 为什么值得关注:这是机器人数据的传输层——把"分布在各处的机器人/集群/云端"连成一张统一数据网,是数据平台/管线的地基(远程遥操作、云边协同、多机器人数据汇集都依赖它)。实测比 DDS Router、rosbridge、Zenoh 更低延迟、更稳、更可扩展。 一句话:给机器人的数据铺一条穿到任何网络的“高速公路”。 链接:https://arxiv.org/abs/2608.25102
一句话启示
- 造数据比存数据值钱:自动生成 + 自我反馈(Scene2Demo)是解数据困局的钥匙。
- 仿真吞吐 = 数据产能:把"合成数据"变成可量化的 GPU 流水线(CRESSim-Neo)。
- 数据要先"连得起来":跨网数据平台(ROS2 Connect)决定了数据能否被统一消费。
说明
- export.arxiv.org 目前对本机限流(429),本条从官方 RSS(cs.RO)抓取;管线已内置 API→RSS 自动兜底。
- 管线查询已改为数据方向(配置见
~/.arxiv_reader/config.json),后续每日自动累积数据向论文。 - 若需"数据平台/管线"更全的盘点,等限流恢复后我用 export API 做多日/跨分类深度检索,可另行生成一份「数据基础设施专题」。