Skip to content

数据性质 × 有效训练 · 广度 roadmap + 精度 Insight

研究母题之一:聚焦数据本身(性质)与"怎么让训练更有效",不涉及纯硬件设计。 核心命题:机器人数据无法像 LLM 那样无限扩展(物理采集成本),所以要靠"看清数据性质 + 用对数据"来逼近扩展带来的好处。


PART A · 广度:数据的八个性质维度(决定训练有效性的"体检项")

# 性质维度 问了什么 证据在库
规模 scale 数据量曲线的形状?能不能用别的方式替代扩展? AXIS 缩放、PhyFilter(物理过滤替代扩展)
多样性/几何形态 diversity 多样性是不是越多越好? Geometric Entropy(H_G)、FAKTUAL(签名熵)
物理质量 physical truth 数据"过程物理上对不对"? SoftVTBench(DSR/FEM)、PhyFilter
冗余 redundancy 有没有大量可删的重复信息? 冗余审计、SIEVE、均匀性
噪声/次优性 suboptimality 次优/分布外示范能不能用? Ambient Diffusion、SDP(纠正块)
标签一致性 label consistency 标注(语言/动作)会不会"对但错位"? MMPF(ITM审计)、Keypose自动标注
覆盖/分布 balance 各类场景/本体/难度是否均衡? 混合/co-training、LingBot 数据配方
可学习结构 structure 数据里有没有可复用的结构? SIEVE(原语+转移接口)、Keypose、action-chunk

PART A·2 · 广度:让训练更有效的六个机制

  1. 选择/策展 selection:SIEVE(按原语结构选,50% 数据+50% 步数超越全量)、FAKTUAL(熵最大化选子集)、medoid、COBALT 实时指标过滤。
  2. 过滤 filtering:PhyFilter(物理过滤学习残差,替代数据扩展)、MMPF(过滤 vs 重标二选一)。
  3. 重标注/纠错 relabel & correct:SDP(用人类纠正构建正负动作块)、MMPF relabel、Keypose 自动轨迹标注(VLM 事件 + 轨迹分析,一条示范串全任务)。
  4. 混合/课程 mixing & curriculum:co-training(人体视频+机器人数)、Ambient Diffusion(噪声依赖使用)分阶段、LingBot 的"50k robot + 10k ego"配方。
  5. 利用次优/无标签数据 exploiting suboptimal:Ambient Diffusion(噪声依赖数据使用)、利用 OXE 异构数据。
  6. 数据表示/条件化 conditioning:动作粒度、关键点、动作块——让监督"更可学"。

PART B · 精度:研究员级 Insight

I1 · "多样性不是越多越好"——几何熵的倒U曲线,是把"数据性质"变成可操作信号的最硬结论。 H_G 用 target-frame 对齐归一掉目标位姿/工作区外源变量后,测量过境轨迹的几何多样性,得到倒U:低多样性区加多样性→更稳;一旦多样性引入"策略二义性"→反而掉点;任务越熟练(更多数据/更易任务/更强先验),最优熵往下移;对预训练 VLA 近乎单调递减。含义:真想提升训练,不能盲目"更多/更多样",要按任务熟练度把数据多样性校准到"可学习区"。这条直接可写成"数据集体检报告"的一项。

I2 · 机器人界不能靠无限扩展——"用数据性质改造训练"是扩展的替代品。 PhyFilter 明说"按 LLM 方式堆 demo 不现实",用物理过滤的反馈残差在数据很少时也能泛化(四足/无人机/空中机械臂都验证)。核心命题:做事效率的杠杆不是"多采",而是"把物理先验/数据性质织进训练"。这是 Data-Centric 在机器人界的立足点。

I3 · 次优/无标签数据不是垃圾,是用法问题。 Ambient Diffusion 发现机器人动作数据有谱幂律,据此只在"高频(局部)与低频(全局)"时段用次优数据抽有用特征,在 OXE 异构数据上 +33%;SDP 把人类纠正当"正负动作块"结构化使用。含义:数据价值的瓶颈常在建模/用法(怎么把次优数据喂进去),而非数据本身——先别急着扔,先想怎么用。

I4 · 标签噪声是最阴险的破坏源,且"审计"必须成为管线标配。 ITM(轨迹行为正确、但配了错误语言指令)外表无害,却污染语言-行为映射;MMPF 以"多模态概率融合"(乘积专家)检测+重标或过滤,多数下游训练提升。含义:数据质量问题里,标注错位比执行失败更难发现也更不该忽略——要在进训练前加"审计门"。

I5 · "可学习结构"信号 > 原始量——高杠杆点。 SIEVE(原语+转移接口,50% 数据超越全量)、Keypose(关键点 conditioning + 可达性过滤跨本体)、action-chunk(SDP)都在证明:从数据里提炼"适合学"的结构,比堆更多数据更值钱。这是"数据有效训练"的性价比之王。

I6 · "整理成可训练语料"本身是一门工程研究(数据配方)。 LingBot-VLA 2.0 用重新整的 60,000h(50k 机器人 + 10k 第一视角)驱动跨本体长程;AXIS/COBALT 证明"采集+质检+扩增"流水线。含义:比分头采数据更稀缺的,是"怎么把异构、带噪、错位的原始数据,整理成同口径、可缩放、可审计的训练语料"——这正是你"数据研究员"该卡位的产出。

落地建议(给研究计划)

  1. 给每个候选数据集出一张"性质体检表":几何熵、物理真值(DSR)、ITM 审计率、冗余度、次优占比、覆盖均衡。
  2. 训练管线加三道数据门禁:选择(SIEVE/FAKTUAL) → 过滤/审计(PhyFilter/MMPF) → 吸收次优(Ambient/SDP)。
  3. 别盲目增多样/增量,按"任务熟练度"校准到可学习区。
  4. 把"数据配方(异构→统一训练语料)"作为可复用的自建产出。