Skip to content

专题 · 多样性 / 覆盖 的量化与校准

母题:数据性质 × 有效训练。本章专攻多样性 & 覆盖两个最容易被误用(也最有杠杆)的性质。 一句话主线:"多样性"是几何形状的差异化,"覆盖"是状态-动作空间被填满的程度——两者测的东西不同,优化目标不同,别混着用。


一、量化:三大测度谱系

谱系A · 几何/轨迹级(形状多样性)

测"这些轨迹"长得有多不一样。 - Geometric Entropy H_G(luo/2606.20871):先把每条过境轨迹做 target-frame 对齐(归一掉目标位姿/工作区尺度等外源变量),再测几何形状的内在多样性。关键设计:分离"内在"与"外在"变源,只度量"该多样性"。 - 签名核熵(FAKTUAL/2603.11634):在轨迹的签名核 Gram 矩阵上定义熵,尊重轨迹的几何与时间结构,是 Shannon/von Neumann 熵到轨迹集的推广;无需策略/rollout,纯模型无关。

适合:回答"同一任务/同一场景里,示范轨迹够不够『形状上』多样"。

谱系B · 表示/嵌入级(语义/特征多样性)

测"这些样本在表征空间里散得开不开"。 - 嵌入空间覆盖/本征维数:把示范编码到特征空间(VLA/视觉主干),看占据体积(本征维数、Vendi score、determinantal point processes DPP 的多样性项)。 - Vendi score / DPP(领域已知):用核矩阵特征谱度量"群体多样性",DPP 还能直接当采样/选择的多样性先验。

适合:回答"跨任务/跨场景,这些样本的『语义/视觉』多样性"。

谱系C · 状态-动作空间覆盖级(可执行度/占领度)

测"数据真正『占领』了多少可到达的状态-动作空间"。 - 状态-动作覆盖:状态、动作、观测空间被填满的比例(网格化/密度估计/核密度)。 - 可达性/几何覆盖(机器人体):哪些动作目标可达——KeyposeExploration 用可达性图(reachability map)过滤到目标机器人运动学可行区。 - coreset / facility location / 极小覆盖:选最少点覆盖整个集合(经典近似算法)。

适合:回答"数据有没有『空白区』(coverage holes),能不能支撑该场景的动作"。

谱系 度量什么 工具/指标 常见误用
A 几何 轨迹形状差异化 H_G、签名核熵 把外源变化(位姿/尺度)当多样性
B 嵌入 语义特征张度 Vendi/DPP/本征维数 把"视觉不相似"当"任务多样"
C 覆盖 空间占领度 密度/可达性/coreset 只看"有没有"不看"可不可达/可不可学"

二、校准:从"测到"到"调好"

多样性不是"越大越好"(Geometric Entropy 的倒U):低多样性 → 不够鲁棒;高多样性 → 策略二义性;且最优多样性随任务熟练度往下漂移(数据更多、任务更易、先验更强时)。所以"校准"是动态的、有目标的——把数据集调到"可学习区(learnable regime)"。

校准闭环(measure → adjust → re-measure)

① 测度:H_G(形状)+ 嵌入覆盖 + 状态-动作覆盖 → 出"多样性与覆盖体检图"
② 诊断:
   - 多样性过低 → 鲁棒差 → 增多样
   - 多样性过高 → 二义性/难学 → 减多样(删掉制造二义性的)
   - 出现覆盖洞 → 缺那一类样本 → 针对性补
   - 某区域过密/过稀 → 重加权/重采样
③ 动作(五选一或组合):
   - 选择/删减:FAKTUAL 熵最大化子集选、SIEVE medoid(保中心稳定)、删"二义性制造者"
   - 增补/生成:探测到覆盖洞后,定向生成/增强那一类(CRAFT/世界模型/仿真)
   - 重加权:按覆盖密度的倒数重采样,平衡分布
   - 课程/分期:先密而窄(高熟练度),随掌握程度逐渐加面/加多样(对准倒U的最优点移动)
   - 条件化:用 keypose/action-chunk 等"可学结构"把过多自由度的多样性收进可学形式
④ 效验:用 learnability(如 SIEVE/DP 成功率)验证"调完的这版数据是否更好学/更强"

三、研究员级 Insight

I1 · 多样性≠覆盖,先分清再谈校准。 多样性是"彼此有多不同"(形状/语义),覆盖是"空间被填了多少"(状态-动作/可达)。高覆盖可能低多样性(都填满了但全是同一形状的轨迹)、高多样性可能低覆盖(花样多但某关键区全空)。优化目标不一样:多样性校准要"避免二义性",覆盖校准要"消灭空白区"。混用会用错工具。

I2 · 度量的关键不是"用什么核",而是"归一掉什么"。 H_G 的精华在 target-frame 对齐(归掉目标位姿/工作区)——它保证你"只量该量的多样性"。同理 FAKTUAL 用签名核尊重轨迹几何。错把目标位姿差异当"多样"是最常见的度量污染。→ 设计度量先问"哪些变源该算、哪些该归一"。

I3 · 倒U是"鲁棒性/二义性"的权衡,且最优点会漂移 → 校准必须动态。 低区加多样=加鲁棒;高区多样=加二义性(策略不知道跟哪条)。最优熵随熟练度↓→ 同一条数据,前期(新手)该多面、后期(精通)该收敛。所以"多样性校准"不该设固定值,而应跟训练阶段/任务难度挂钩(课程化)

I4 · 覆盖洞是"可操作"信号——它直接告诉你该采什么/生成什么。 "哪儿没覆盖"远比"总体多样不多样"可执行:对覆盖洞做定向补数据(生成/增强/定向采集)。把"覆盖地图"当数据采购清单,是把测度变成动作最快的一条路。

I5 · 多样性校准要跟"可学习性"一起看,否则调到"更多样但更难学"。 SIEVE/Keypose/action-chunk 共识:"让监督更可学"比"让数据更变化多端"更值钱。凭空加多样可能只是加了噪声/二义性;把多样性收进可学习结构(关键点/原语/动作块)才能真正提升。校准的终点是"可学习区",不是"最多样区"。

I6 · 双指标校准框架(本书建议): 用 "多样性弹道曲线(H_G)" + "覆盖地图(状态-动作/可达)" 两套图给数据集画像: - 横轴任务熟练度、纵轴最优 H_G → 决定"这阶段该多面还是收敛"; - 覆盖地图热区 → 决定"哪里要补、哪里要删/收敛"; - 两者交叉 → 选"进可学习区的数据子集"(SIEVE 结构筛选 + FAKTUAL 熵平衡)。

落地模板:数据集"多样性与覆盖体检表"

字段 用哪个 判读
形状多样性 H_G 谱系A 与当前熟练度最优值比,判断该加面还是收敛
语义张度 Vendi/嵌入覆盖 谱系B 跨任务是否够散,别把视觉差异当任务多样
状态-动作覆盖 谱系C 找覆盖洞→补采/生成清单
机械可达性 谱系C 过滤不可达动作(Keypose思想)
可学性 proxy SIEVE/DP val 校准后验证"更好学吗"