EGO 数据线 · B · L2 表示/对齐深挖
承《EGO 数据线 A 蓝本》:L2 表示/对齐是 EGO 数据线的生死线。本篇把两条对齐哲学——行为/潜在空间对齐(EgoBridge/MimicPlay/EgoMimic) 与 统一动作表示(UCAG-P/JAAS/UHAS/UniDexTok/Motion-Focused/Cloak/KITE)——放在同一桌,回答绿本里"最重要待做实验":统一动作空间能否作为 OT 对齐的可微不变量,一石二鸟拿"共训红利"+"免重定向红利"。
一、两系对话:各握一半答案
| 维度 | 对齐系(Danfei·EgoBridge/MimicPlay) | 统一动作空间系(UCAG-P/JAAS/UHAS) |
|---|---|---|
| 统一的是 | 策略潜在空间(人/机) | 动作/观测坐标系(相机中心/SE3+15指/手token) |
| 手段 | OT 度量拉近 latent + 保留动作相关信息的共训 | 重标动作坐标免重定向 + 可插拔翻译头 |
| 数据红利 | 借 ego 的量(共训时人视频当减重) | 异构数据在共享坐标公平共训 |
| 弱项 | 潜在空间对齐不与"动作可执行"绑(可能对齐了语义没对齐本体) | 需定义/习得那套坐标系,初始成本高 |
| 迁移上限 | 受"对齐度量是否捕获本体/动作"限制 | 受"坐标系是否带你给的物理"限制(见I3) |
冲突不在"要不要对齐",而在"对齐的度量放在哪一层": EgoBridge 在 help/特征空间做 OT,UCAG-P 在动作/坐标空间做统一。若把统一动作空间当作 OT 的分层坐标锚,两者不冲突而是正交叠加。
二、为什么能互解:机制的 3 个支点
支点1 · 坐标系当"可微不变量": OT 对齐的本质是找"人机在共同空间里怎么对应"。若共同空间就是统一动作空间(如相机中心锚点运动),则 OT 的传输矩阵定义在"两端的动作都在同一坐标系"上 → 语义/动作用同一把尺量,对齐更干净,且"对齐以后的动作头就是免重定向"。
支点2 · 动作空间当"数据选择度量": 在统一动作空间里算 ego 示范与机器人示范的 OT 距离,可做 ego→co-train 的数据筛选(只挑离机器人最近的 ego),把"海量被动 ego"变成"主动挑选的训练池"——这直接给 AXIS/SIEVE 式的提纯一个跨本体度量。
支点3 · 对齐的产物=新本体动作头: 若 OT 对齐学到人→机映射,而该映射被参数化为"机器人侧的统一动作空间解码/翻译头",则新增本体=只加一个头,不重采全语料——把动作空间的可扩展收益(I3)与 OT 的迁移收益合流。
三、裁决实验协议(把"最重要待做实验"落成可跑)
共同设定: 同一灵巧任务,同一 VLA 骨架,同一数据总预算(如 5k 机器人示范 + 20k ego 示范),统一评测尺(真机成功率 + Embodiment Gap 的"适配工作量")。
A·对齐互解(主实验)——固定 ego+机器人数据不变,只换对齐方式: - A1 基线: 只训机器人数据(无 ego 共训)。 - A2 EgoBridge 式: 原始动作空间上 OT 潜在对齐 + 共训。 - A3 统一动作空间: UCAG-P 重标(免对齐+共训),无 OT。 - A4 互解: 统一动作空间上做 OT(A3 的动作坐标 + A2 的 OT 度量)。
判据: 若 A4 ≥ max(A3, A2) 且显著高于 A2 → 证明"坐标系锚 × OT"可叠加,一石二鸟成立。
B·动作空间作数据选择度量(副实验): - B1 随机抽 20k ego。 - B2 用统一动作空间 OT 距离筛选"离机器人最近的 ego" 20k。 - B3 用 A4 对齐后的距离筛选。
判据: B2/B3 在更少 ego(如 5k 精选)上接近 B1 的 20k 全量 → 验证"统一动作空间度量 = 跨本体提纯器",呼应 SIEVE 但跨本体。
C·物理/接触合流(把 I3 收口): A4 模型 + CHORD 式力-力矩监督(或 MimicTouch 触觉) 在接触密集任务上: - C1 A4 alone vs C2 A4+接触监督。
判据: 接触密集 subtest 上 C2 显著 >C1 → 证明"量化亲和前端"+"显式接触后端"合流是该线完整性的必要件(呼应蓝本 L5)。
四、工程接口(怎么接到 EGO 数据线)
- 动作表示层: 以相机中心锚点运动(UCAG-P)为默认坐标,新增"本体↔坐标系"翻译头(可插拔)。
- 对齐层: 把 EgoBridge 的 OT 度量重定义在统一动作空间上,作为共训/筛选的损失与度量。
- 数据层: EgoVerse/Open-AoE 的动作标注 + EgoEngine 翻译产物,统一落到该坐标系再合训。
- 评测层: 统一输出"成功率 + 适配工作量"双指标(Embodiment Gap 报告框架)。
五、科学家判断(Insight)
B-I1 · 统一动作空间的真正价值是"对齐度量的锚",不是"免重定向本身"。免重定向只是表象,它真正的解放是让 OT/共训/数据选择 这类跨本体运算有了可比坐标系。没有这个锚,OT 对齐的是"语义"而非"本体+动作",跨本体贡献永远测不准。
B-I2 · "坐标系锚 × OT" 是 A 蓝本最大的赌注,且最值得先跑。它同时含 ①共训红利(借 ego 量)②免重定向红利(坐标统一)③提纯红利(度量选数据)三条收益线;若 A4 成立,EGO 数据线 L2 的整条都在同一坐标上打通。
B-I3 · 相机中心系天然适配 EGO。EGO 视频最自然供给的就是"观测到的空间运动/锚点运动",相机中心动作空间(UCAG-P)正好吃这个——EGO 被动视频纳入(证据清单缺口①最后一段)与相机中心动作空间是同一件事的因果两面。
B-I4 · 对齐不做物理,增长会停在"动得了"。统一动作空间管"动得了",接触可信仍靠 CHORD/MimicTouch/SoftVTBench 线补。所以 A 蓝本 C 实验不是可选项,是"EGO 数据线自称完整"的必要件。
B-I5 · 别在初始就求"零重定向"。对已有海量本体专有数据,直接重标成本高;更省的是"统一动作空间 + OT 对齐学到的映射"渐进换坐标系,把历史数据通过对齐折进新坐标——换坐标系要走"迁移路径",不是"重写"。
六、一句话主线(B 篇)
EGO 数据线 L2 的钥匙 = 把统一动作空间当成对齐/共训/数据选择的公有坐标系锚,再用 EgoBridge 式 OT 在这个锚上做迁移——若 A4 裁决实验成立, ego 的量、统一动作空间的免重定向、OT 的迁移三者在一套坐标里收敛,EGO 数据线 L2 全线打通。