专题延伸 · 统一动作空间 / 免重定向(以 UCAG-P 为锚)
母题:数据×训练。本期把散落的「统一动作空间」类工作串成一条主题线,回答一个战略问题: "让异构数据能一起训"这件事,到底该改数据,还是改动作空间(标签)? 触发点:UCAG-P(2608.26058)证明了一条更省事的路径——不动数据,靠重标动作空间免重定向合训。
一、为什么现在值得聚焦这条线
- 证据清单缺口①(四源同语料混训实证)悬而未决,而统一动作空间是实现它的前置条件:四类数据(EGO视频/UMI/仿真/遥操)形态各异,不先定一个公有动作"坐标系",任何合训试悲都做不干净。
- 过去一年该方向密集收敛(UHAS/KITE/Cloak/Motion-Focused/UniDexTok/YUBI/UCAG-P),说明它是"共识正在形成"的转折点,值得一次系统梳理。
- 它把研究问题的表述从"怎么造更多数据"翻转为"怎么让已有数据在共享坐标系下变得可训练"——正是"数据×训练"链条上被低估的杠杆。
二、路线全家福:统一动作空间的四种打法
| 代表 | 统一的是 | 关键技术 | 是否免重定向 | 数据生态 |
|---|---|---|---|---|
| UHAS(统一手动作空间) | 手动作坐标 | 手-物统一坐标 | ~免 | 灵巧手多本体 |
| KITE(解耦运动学/交互) | 运动特征 | 解耦运动学+交互头 | 免 | 跨本体零样本 |
| Cloak(遮挡端执行器) | 输入表征 | 掩蔽末端效应器 | 免 | VLA 跨本体 |
| Motion-Focused Latent Action | 隐式动作 | 人手视频→latent action | 免 | EGO 被动视频 |
| UniDexTok | 手 token 空间 | 真实数据学统一 tokenizer | 免 | 跨本体灵巧手 |
| YUBI(通用双指接口) | 抓取接口 | 手指驱动夹爪直用 | 免 | 8434h/119 任务 |
| UCAG-P(本期锚) | 相机中心几何动作空间 | 锚点运动 + 几何翻译器 | 免 | 多本体+仿真+人手 |
观察:多数走"改成共享坐标/表征",UCAG-P 把统一提到相机可观测锚点运动这一更"语义中立"的层,且把翻译器做成可插拔动作头——解耦最彻底的一例。
三、机制拆解:为什么"重标动作空间"优于"改写数据"
- 改写数据(retargeting/视频合成)引入噪声:重定向误差会污染示范,让"跨本体贡献"测不准(见 UCAG-P);动作空间统一则数据原样保留。
- 统一动作空间=让"各源数据边际贡献"可公平比较的前提:否则比较的是"重定向后的残次数据",不是数据本身——这直接为证据缺口②的消融实验打地基。
- 可扩展性收益在标签侧:新增一个本体只需加一个"运动学→动作空间"翻译器,不必重采/重写整个语料——数据引擎的边际成本降下来。
四、三条研究员判断(Insight)
- I1 · "统一动作空间"和"数据改造"不是二选一,是先后序:先建公有动作坐标系,之后 SIEVE/FAKTUAL/PhysicsFiltering 等数据选择/过滤才谈得上"跨源公平地筛"。动作空间是数据治理的"校准坐标系"。
- I2 · 相机中心比"手中心"更接近答案的一半:手中心(UHAS/UniDexTok)仍绑定"手"这一概念;相机中心锚点运动(UCAG-P)把抽象层级抬到"观测到的空间运动",更贴近 EGO 视频能天然提供的东西——这对把 EGO 被动视频纳进来(缺口①最后一段)是关键转向。
- I3 · 免重定向路线当前缺一块:物理/接触可信度:动作空间统一管"动得了",不管"接触得真"(软体形变/可变形/接触力)。这恰好是触觉与物理数据(SoftVTBench/ViTacPhys/Missing Touch 线)的互补位置——统一动作空间 × 物理可信数据是下一个合流点。
五、展望与建议
- 与四层对位:统一动作空间 = EGO/UMI/仿真/遥操 四源共用的"坐标系层",是四层之上的横切件(呼应纲领"统一动作空间"层)。
- 建议实验(补缺口①/②):以 UCAG-P 相机中心动作为基座,分别喂入 ①EGO 被动视频(缺的最后一格)②纯机器人/纯仿真/纯人手 做单源 vs 多源边际贡献消融——这同时回答①②两个缺口。
- 纳入跟踪:把 UCAG-P 列为"统一动作空间"小主题的 anchor 论文,后续新论文归入此族。
一句话主线:四源合训的天花板,不在数据量,而在"有没有一个能让异构数据公平共训的公有动作坐标系"——统一动作空间正是那把钥匙,而走"重标坐标系"而非"改写数据"才不污染各自的贡献。