Skip to content

周报 · 数据×训练 方向(2026-08-27)

本周把「具身智能数据方向」从"每日抓 arXiv"升级为一条完整的研究流水线: 自动抓取 → Obsidian 归库 → 待精读队列 → Agent 深读(Insight) → 飞书 roadmap/贴图 → Telegram 推送。 主题始终钉在北极星:数据性质 × 有效训练 / EGO·UMI·仿真·遥操 四源价值链

一、成果总览

结构文档(纲领级,均已上飞书 EGO && UMI 文档)

文档 内容 状态
数据×训练·研究纲领 四层数据栈 + 统一动作空间 + 5 北极星问题
数据×训练·证据清单 已入库论文映射到四层 + 缺口标注
EGO 跨本体桥·roadmap+insight 五层技术栈 + 6 条研究员判断 ✅ 5 图
数据性质×有效训练·roadmap+insight 8 性质维度 + 6 机制 + 6 Insight ✅ 6 图
专题·多样性/覆盖 量化与校准 三谱系 + 校准闭环 + 双指标框架

深读批次(Insight 标准,全部上飞书+Telegram)

批次 篇数 代表 & 关键结论
数据集方向两篇 2 SoftVTBench(有触觉≠融合有效)、Statistical Audit(基准冗余 4 保 78.5%)
数据方向批次2 6 Scene2Demo(自进化数据)、Missing Touch(触觉→示范质量)、ImitatorGame、LabDex、BehaviorWorldGen、ViTacPhys
EGO/UMI 数据引擎 8 AXIS、COBALT、EgoInfinity、Open-AoE、KoalaGripper、YUBI、HRDexDB、SIEVE
数据方向剩余批次 17 Worlds in One Demo、CRAFT、CRESSim-Neo、VLA Survey★、UniDexTok、EaDex 等

合计深读 33+ 篇,待精读队列 78 项全部清零(17 精读 + 24 归位跳过 + 37 原已读)。

Pipeline(arxivReader/)

  • 每日 09:00 launchd 自动任务:抓取→去重→Obsidian→Telegram→自动贴图到飞书
  • 双轨查询(track1 数据集/仿真/遥操 · track2 数据引擎/众包/跨本体语料)+ RSS 兜底
  • 飞书贴图 40+ 张(sips 缩<1MB 防 error 1663)
  • 追加守卫 append_guard.py:修复 lark-cli 偶发"陈旧 rev 号导致整章重复",飞书文档去重完成、44 图完好

二、本周核心认知(Insight 沉淀)

  1. 数据瓶颈正从"采集"转向"生成/部署回路":Worlds in One Demo(单示范→开放世界)、CRESSim-Neo(GPU 驻留数据管线)、Learning While Deploying(部署自我补数据)。
  2. 多样性轴从"状态-动作"扩展:HABIT(有人环境)、ACME(跨文化)——覆盖洞是多维的。
  3. 跨本体靠"数据学对齐"而非手写统一关节:UniDexTok / EaDex / UCAG-P(统一动作空间免重定向,LIBERO-Plus 零样本 82%)。
  4. VLA Survey 是纲领的战略背书:"数据引擎×评测协议"co-design 决定未来 → 应作 top-citation。

三、证据缺口现状(见证据清单)

  • ① 四源同语料混训端到端实证:UCAG-P 部分填补(多本体+仿真+人手,未含 EGO 被动视频,仍缺一格)
  • ② 各源数据边际贡献消融:仍缺直接论文(多数单类报告)→ 建议自建消融或定向抓取

四、下一步建议

  1. 基于 UCAG-P 线做统一动作空间/免重定向专题(本期已单独成文,见《专题延伸·统一动作空间》)
  2. 定向抓取/设计②边际贡献消融证据
  3. 继续每日自动任务跑 weekly 周报沉淀