周报 · 数据×训练 方向(2026-08-27)
本周把「具身智能数据方向」从"每日抓 arXiv"升级为一条完整的研究流水线: 自动抓取 → Obsidian 归库 → 待精读队列 → Agent 深读(Insight) → 飞书 roadmap/贴图 → Telegram 推送。 主题始终钉在北极星:数据性质 × 有效训练 / EGO·UMI·仿真·遥操 四源价值链。
一、成果总览
结构文档(纲领级,均已上飞书 EGO && UMI 文档)
| 文档 | 内容 | 状态 |
|---|---|---|
| 数据×训练·研究纲领 | 四层数据栈 + 统一动作空间 + 5 北极星问题 | ✅ |
| 数据×训练·证据清单 | 已入库论文映射到四层 + 缺口标注 | ✅ |
| EGO 跨本体桥·roadmap+insight | 五层技术栈 + 6 条研究员判断 | ✅ 5 图 |
| 数据性质×有效训练·roadmap+insight | 8 性质维度 + 6 机制 + 6 Insight | ✅ 6 图 |
| 专题·多样性/覆盖 量化与校准 | 三谱系 + 校准闭环 + 双指标框架 | ✅ |
深读批次(Insight 标准,全部上飞书+Telegram)
| 批次 | 篇数 | 代表 & 关键结论 |
|---|---|---|
| 数据集方向两篇 | 2 | SoftVTBench(有触觉≠融合有效)、Statistical Audit(基准冗余 4 保 78.5%) |
| 数据方向批次2 | 6 | Scene2Demo(自进化数据)、Missing Touch(触觉→示范质量)、ImitatorGame、LabDex、BehaviorWorldGen、ViTacPhys |
| EGO/UMI 数据引擎 | 8 | AXIS、COBALT、EgoInfinity、Open-AoE、KoalaGripper、YUBI、HRDexDB、SIEVE |
| 数据方向剩余批次 | 17 | Worlds in One Demo、CRAFT、CRESSim-Neo、VLA Survey★、UniDexTok、EaDex 等 |
合计深读 33+ 篇,待精读队列 78 项全部清零(17 精读 + 24 归位跳过 + 37 原已读)。
Pipeline(arxivReader/)
- 每日 09:00 launchd 自动任务:抓取→去重→Obsidian→Telegram→自动贴图到飞书
- 双轨查询(track1 数据集/仿真/遥操 · track2 数据引擎/众包/跨本体语料)+ RSS 兜底
- 飞书贴图 40+ 张(
sips缩<1MB 防 error 1663) - 追加守卫 append_guard.py:修复 lark-cli 偶发"陈旧 rev 号导致整章重复",飞书文档去重完成、44 图完好
二、本周核心认知(Insight 沉淀)
- 数据瓶颈正从"采集"转向"生成/部署回路":Worlds in One Demo(单示范→开放世界)、CRESSim-Neo(GPU 驻留数据管线)、Learning While Deploying(部署自我补数据)。
- 多样性轴从"状态-动作"扩展:HABIT(有人环境)、ACME(跨文化)——覆盖洞是多维的。
- 跨本体靠"数据学对齐"而非手写统一关节:UniDexTok / EaDex / UCAG-P(统一动作空间免重定向,LIBERO-Plus 零样本 82%)。
- VLA Survey 是纲领的战略背书:"数据引擎×评测协议"co-design 决定未来 → 应作 top-citation。
三、证据缺口现状(见证据清单)
- ① 四源同语料混训端到端实证:UCAG-P 部分填补(多本体+仿真+人手,未含 EGO 被动视频,仍缺一格)
- ② 各源数据边际贡献消融:仍缺直接论文(多数单类报告)→ 建议自建消融或定向抓取
四、下一步建议
- 基于 UCAG-P 线做统一动作空间/免重定向专题(本期已单独成文,见《专题延伸·统一动作空间》)
- 定向抓取/设计②边际贡献消融证据
- 继续每日自动任务跑 weekly 周报沉淀