专题 · 多样性 / 覆盖 的量化与校准
母题:数据性质 × 有效训练。本章专攻多样性 & 覆盖两个最容易被误用(也最有杠杆)的性质。 一句话主线:"多样性"是几何形状的差异化,"覆盖"是状态-动作空间被填满的程度——两者测的东西不同,优化目标不同,别混着用。
一、量化:三大测度谱系
谱系A · 几何/轨迹级(形状多样性)
测"这些轨迹"长得有多不一样。 - Geometric Entropy H_G(luo/2606.20871):先把每条过境轨迹做 target-frame 对齐(归一掉目标位姿/工作区尺度等外源变量),再测几何形状的内在多样性。关键设计:分离"内在"与"外在"变源,只度量"该多样性"。 - 签名核熵(FAKTUAL/2603.11634):在轨迹的签名核 Gram 矩阵上定义熵,尊重轨迹的几何与时间结构,是 Shannon/von Neumann 熵到轨迹集的推广;无需策略/rollout,纯模型无关。
适合:回答"同一任务/同一场景里,示范轨迹够不够『形状上』多样"。
谱系B · 表示/嵌入级(语义/特征多样性)
测"这些样本在表征空间里散得开不开"。 - 嵌入空间覆盖/本征维数:把示范编码到特征空间(VLA/视觉主干),看占据体积(本征维数、Vendi score、determinantal point processes DPP 的多样性项)。 - Vendi score / DPP(领域已知):用核矩阵特征谱度量"群体多样性",DPP 还能直接当采样/选择的多样性先验。
适合:回答"跨任务/跨场景,这些样本的『语义/视觉』多样性"。
谱系C · 状态-动作空间覆盖级(可执行度/占领度)
测"数据真正『占领』了多少可到达的状态-动作空间"。 - 状态-动作覆盖:状态、动作、观测空间被填满的比例(网格化/密度估计/核密度)。 - 可达性/几何覆盖(机器人体):哪些动作目标可达——KeyposeExploration 用可达性图(reachability map)过滤到目标机器人运动学可行区。 - coreset / facility location / 极小覆盖:选最少点覆盖整个集合(经典近似算法)。
适合:回答"数据有没有『空白区』(coverage holes),能不能支撑该场景的动作"。
| 谱系 | 度量什么 | 工具/指标 | 常见误用 |
|---|---|---|---|
| A 几何 | 轨迹形状差异化 | H_G、签名核熵 | 把外源变化(位姿/尺度)当多样性 |
| B 嵌入 | 语义特征张度 | Vendi/DPP/本征维数 | 把"视觉不相似"当"任务多样" |
| C 覆盖 | 空间占领度 | 密度/可达性/coreset | 只看"有没有"不看"可不可达/可不可学" |
二、校准:从"测到"到"调好"
多样性不是"越大越好"(Geometric Entropy 的倒U):低多样性 → 不够鲁棒;高多样性 → 策略二义性;且最优多样性随任务熟练度往下漂移(数据更多、任务更易、先验更强时)。所以"校准"是动态的、有目标的——把数据集调到"可学习区(learnable regime)"。
校准闭环(measure → adjust → re-measure)
① 测度:H_G(形状)+ 嵌入覆盖 + 状态-动作覆盖 → 出"多样性与覆盖体检图"
② 诊断:
- 多样性过低 → 鲁棒差 → 增多样
- 多样性过高 → 二义性/难学 → 减多样(删掉制造二义性的)
- 出现覆盖洞 → 缺那一类样本 → 针对性补
- 某区域过密/过稀 → 重加权/重采样
③ 动作(五选一或组合):
- 选择/删减:FAKTUAL 熵最大化子集选、SIEVE medoid(保中心稳定)、删"二义性制造者"
- 增补/生成:探测到覆盖洞后,定向生成/增强那一类(CRAFT/世界模型/仿真)
- 重加权:按覆盖密度的倒数重采样,平衡分布
- 课程/分期:先密而窄(高熟练度),随掌握程度逐渐加面/加多样(对准倒U的最优点移动)
- 条件化:用 keypose/action-chunk 等"可学结构"把过多自由度的多样性收进可学形式
④ 效验:用 learnability(如 SIEVE/DP 成功率)验证"调完的这版数据是否更好学/更强"
三、研究员级 Insight
I1 · 多样性≠覆盖,先分清再谈校准。 多样性是"彼此有多不同"(形状/语义),覆盖是"空间被填了多少"(状态-动作/可达)。高覆盖可能低多样性(都填满了但全是同一形状的轨迹)、高多样性可能低覆盖(花样多但某关键区全空)。优化目标不一样:多样性校准要"避免二义性",覆盖校准要"消灭空白区"。混用会用错工具。
I2 · 度量的关键不是"用什么核",而是"归一掉什么"。 H_G 的精华在 target-frame 对齐(归掉目标位姿/工作区)——它保证你"只量该量的多样性"。同理 FAKTUAL 用签名核尊重轨迹几何。错把目标位姿差异当"多样"是最常见的度量污染。→ 设计度量先问"哪些变源该算、哪些该归一"。
I3 · 倒U是"鲁棒性/二义性"的权衡,且最优点会漂移 → 校准必须动态。 低区加多样=加鲁棒;高区多样=加二义性(策略不知道跟哪条)。最优熵随熟练度↓→ 同一条数据,前期(新手)该多面、后期(精通)该收敛。所以"多样性校准"不该设固定值,而应跟训练阶段/任务难度挂钩(课程化)。
I4 · 覆盖洞是"可操作"信号——它直接告诉你该采什么/生成什么。 "哪儿没覆盖"远比"总体多样不多样"可执行:对覆盖洞做定向补数据(生成/增强/定向采集)。把"覆盖地图"当数据采购清单,是把测度变成动作最快的一条路。
I5 · 多样性校准要跟"可学习性"一起看,否则调到"更多样但更难学"。 SIEVE/Keypose/action-chunk 共识:"让监督更可学"比"让数据更变化多端"更值钱。凭空加多样可能只是加了噪声/二义性;把多样性收进可学习结构(关键点/原语/动作块)才能真正提升。校准的终点是"可学习区",不是"最多样区"。
I6 · 双指标校准框架(本书建议): 用 "多样性弹道曲线(H_G)" + "覆盖地图(状态-动作/可达)" 两套图给数据集画像: - 横轴任务熟练度、纵轴最优 H_G → 决定"这阶段该多面还是收敛"; - 覆盖地图热区 → 决定"哪里要补、哪里要删/收敛"; - 两者交叉 → 选"进可学习区的数据子集"(SIEVE 结构筛选 + FAKTUAL 熵平衡)。
落地模板:数据集"多样性与覆盖体检表"
| 字段 | 用哪个 | 判读 |
|---|---|---|
| 形状多样性 H_G | 谱系A | 与当前熟练度最优值比,判断该加面还是收敛 |
| 语义张度 Vendi/嵌入覆盖 | 谱系B | 跨任务是否够散,别把视觉差异当任务多样 |
| 状态-动作覆盖 | 谱系C | 找覆盖洞→补采/生成清单 |
| 机械可达性 | 谱系C | 过滤不可达动作(Keypose思想) |
| 可学性 proxy | SIEVE/DP val | 校准后验证"更好学吗" |