企业数据集研究 · 首期产业勘查
目标:扫描市面上头部具身智能公司,识别谁在公开数据集(有论文更好),放进「数据×训练」主线做佐证分析。 精度声明:每条标注核验级别(✔arxiv已核 / ✔web公告 / ⚠待核 / 未公开)。未核验的 id 一律不臆测。
〇、三条数据哲学(佐证分析的坐标轴)
企业公开数据可归为三条路线,正是「数据×训练」要验证的核心: - 哲学A 真实遥操/机器人数据:真机构数据、物理可信,但采集贵、规模受限流。(智元/特斯拉/Figure) - 哲学B 人/EGO数据(人中心):海量廉价、形态多样,但要对齐/翻译才可训。(光轮/它石/Open-AoE) - 哲学C 仿真合成数据:无限生成、全标注、可控,但 sim2real 真实性待验。(NVIDIA ISAAC/Cosmos、智元 Digital World)
谁在这三条上同时拿到"规模化+质量",谁就握有具身智能的数量级燃料。
一、已确认公开数据集(逐家,含核验级别)
| 公司 | 国别 | 数据哲学 | 公开数据集 | 论文 | 核验 |
|---|---|---|---|---|---|
| NVIDIA | 美 | C 仿真合成 | GR00T 数据集(GROOT-1M,Isaac/Omniverse 合成演示)+GR00T-N1/N1.5开源模型+Cosmos 世界模型(Cosmos-Predict/Reason) | 有(GR00T-N1/N1.5 技术报告、Cosmos 论文) | ⚠GR00T-N1 id 待核 |
| Google DeepMind | 美 | A+跨本体 | Open X-Embodiment/RT-X(多机构、多本体、跨域机器人数据) | 2310.08864 ✔ | ✔ |
| 智元 AgiBot | 中 | A+C | AgiBot World Colosseo(>1000 任务、多本体真实遥操)+AgiBot Digital World(仿真) | 2503.06669 ✔ | ✔ |
| 光轮智能 | 中 | B 人/EGO | EgoSuite-Open100K(10万小时全模态人类行为,HF/AtomGit 开源) | 暂无(公司公告,2026 WRC) | ✔web |
| 它石智航(TARS) | 中 | B 人/EGO+触觉 | WIYH(World In Your Hands)(全球首个大规模真实 VLTA 视觉-语言-触觉-动作) | 暂无(公司公告) | ✔web |
| Physical Intelligence | 美 | A | π0/π0.5 开源权重+代理(openpi)及部分数据 | π0=2410.24164 ✔; π0.5 开源 | ✔ |
| 银河通用 Galbot | 中 | A | GraspVLA 数据集(真机灵巧+人示范) | 有(GraspVLA) | ⚠id 待核 |
二、已开源模型/能力但数据未完全开放
| 公司 | 现状 | 数据开放度 |
|---|---|---|
| 1X | NEO 人形 + 世界模型/television 数据线 | 模型开、数据未全开 |
| Skild AI | SKILD 大规模 VLA + 人视频数据线 | 部分 |
| Figure | Helix(双系统 VLA) | 未公开(自有数据护城河) |
三、数据未公开的头部("数据即护城河")
Tesla(Optimus 车队真实数据,无论文) · Boston Dynamics(Atlas) · Agility(Digit) · Sanctuary(Phoenix) · Unitree(偏硬件) · Apptronik · Fourier 傅利叶 · 星动纪元。这些靠自有真实数据但关起门——是"数据是护城河"的对照组,恰好反衬开源者的生态位。
二、佐证分析(对「数据×训练」主线的证据意义)
佐证1 · 数据哲学正在从"真实遥操"向"人/EGO + 仿真"双路分化。 头部出货量级的数据都不再是纯真机遥操:NVIDIA 押仿真合成(Cosmos/GR00T 无限生成)、光轮/它石押人/EGO 全模态(10万h 人行为、人中心 VLTA)。这与我们「EGO 数据线」判断一致——真机遥操是质量上限,但规模化供给的两条放量路(人数据+仿真)正在成为企业主战场。
佐证2 · 光轮 EgoSuite-Open100K 就是"EGO 数据线"的产业级供给端。 10万小时全模态人类行为数据,是商业公司把"EGO 数据线 L0+L1+L2"直接量产成标品。这正面验证"EGO 数据规模化"不是实验室臆想,而是有产业买单的供给结构——且它直连我们数据集对照里的"大规模×全标注层次"缺口。
佐证3 · 它石 WIYH(VLTA) 把"触觉"正式写进企业级数据标准。 视觉-语言-触觉-动作四模态,人中心、真要真数据。这印证我们反复强调的"物理/接触可信是 EGO/跨本体线未闭环的硬骨头"——头部企业已开始把触觉当作数据标准的一等公民,与 CHORD/MimicTouch/触觉数据集路线合流。
佐证4 · "开源数据集"正成为头部玩家的生态武器,而非负担。 智元(World)、光轮(Open100K)、它石(WIYH)、NVIDIA(GR00T)、PI(π0.5)都选择开源数据/模型。它们在用数据开源换取生态标准定义权(谁的数据格式被广用,谁定义数据接口)。这佐证"数据接口是最大壁垒"(呼应 Embodiment Gap 里的数据接口项)。
佐证5 · 真实数据王者(Tesla/Figure/波士顿)选择封闭,与开源者形成"数据封闭 vs 数据生态"分岔。 谁是终局赢家未定,但开源生态者正在把"数据"变成公共基础设施层的争夺战,而封闭者押"自有车队数据质量碾压"。这条分岔本身,就是"数据×训练"宏观层面的最佳实证命题。
三、下一步(企业数据集研究推进方向)
- 逐家深读:光轮 EgoSuite-Open100K、它石 WIYH、智元 AgiBot World、NVIDIA GR00T/Cosmos 各做一篇精确数据集盘点(规模/采集/标注 L0-L4/用途)。
- 补 Verge 清单:核验 GR00T-N1、GraspVLA、1X、Skild 的论文/数据细节(id 待核项逐个落定)。
- 与 EGO 数据线合并:把光轮/它石并入"EGO 数据集标注层次对照"(它们正好补"大规模×到 L3/L4"那一格)。
- 三哲学实证对照:拿"真机遥操(智元) vs 人/EGO(光轮/它石) vs 仿真(GR00T/Cosmos)"三家做成一个可测的"迁移收益对比"课题。