具身智能论文速览 2026-08-26
目标:不读原文也能吃透今天这批论文。每篇给「核心思想 / 为什么值得关注 / 一句话」。
今日大趋势(先看这节)
今天 25 篇具身论文,可以读出四条正在收敛的主线:
- 「世界模型」是当前最大热点 —— 多篇在做 World-Action Models(WAM):把「预测未来帧」和「生成动作」统一。争议点在于:到底要不要用视频生成做中间目标?GaussianWAM 想给它加几何/语义约束(+19pt),DELE 直接主张砍掉视频生成只预测终态(+47pt)。结论倾向:预测「物理结果」比预测「像素」更本质。
- VLA 从「会做」走向「可靠、精炼、懂意图」 —— 不再只刷成功率,而是解决三个工程痛点:数据效率(HSR 检索复用)、鲁棒性(M3 模态遮罩)、以及「让动作知道自己在为什么而做」(Act with Intent)。同时出现面向记忆(UniMem)和稀疏快思考(Think Only When Needed)的架构。
- 感知/本体往「数据采集端」发力 —— 灵巧手、光纤手套、仿生皮肤、视触觉传感器。原因是具身学习最大的瓶颈是数据:高质量手部/触觉数据采集,比算法更稀缺。
- 从「单机智能」走向「可信系统」 —— 安全基准(GuardianBench)、指令不可替代基准(InstructMove)、LLM 编排机器人团队的符号校验层(Physical Agentic AI)。具身安全开始当作一等公民。
主题一:世界模型(World Models / WAM)
1. DELE-w0.5 — 不做视频生成,只预测未来状态
核心思想:世界模型的目标不是"复现每一帧长什么样",而是预测"动作执行后世界到达什么状态"。DELE 从紧凑的未来隐状态直接推断动作,去掉视频生成的高维冗余,训练更便宜、推理低延迟、单次前向出动作。 为什么值得关注:它用 480 次真实机器人试错、4 个长程任务,把最强的基线甩开 47.5 个百分点(全程成功率)——证明「视频生成是没必要的中间目标」这条路走得通。 一句话:与其预测像素,不如预测物理结局。
2. GaussianWAM — 用 3D 高斯场给世界模型「补课」
核心思想:WAM 的视频隐变量缺乏跨视角几何结构和物体级语义。用 3D 高斯场把深度、相机参数、语义特征"绑定"到共享原语上,渲染出空间对齐的监督信号,训练期蒸馏进 WAM 表征;推理时全部移除教师组件,零额外开销。 为什么值得关注:LIBERO-Plus 上 FastWAM 从 52%→71%、Cosmos Policy 71%→77%,且真实操纵正向迁移。 一句话:给 WAM 的"眼睛"装上空间和语义的地基,不动部署架构。
3. Do Robotic World Models Really Follow Actions? —— 给世界模型"体检"
核心思想:行动条件化世界模型被当成熟练仿真器用,但一个没被检验的假设是:生成的未来真的忠实反映任意有效动作吗?本文做诊断与对齐。 为什么值得关注:这篇是方向性风险提示——先证明问题,再谈放心用。 一句话:在用世界模型做策略评估前,先确认它真的"听动作的话"。
4. DreamLedger — 把"可靠"做成持久对象
核心思想:世界模型预测的可信度不该是模型内部瞬时信号,而应是部署期的"信用档案"——记录预测被实际执行消耗后是否兑现(execution-settled credit files)。 一句话:让世界模型靠"兑现记录"自我证明可靠,而不是自报置信度。
(同类:GeoWAM 把世界模型用于自动驾驶像素空间;TrAct 用视觉轨迹桥接控制与预测。)
主题二:VLA 与策略学习(可靠化、数据效率、懂意图)
5. HSR — 层级化技能检索,让 VLA 少样本也能适应新任务
核心思想:长程任务完整匹配难找,但可复用技能很多。HSR 先按语义+可靠度把目标任务拆成技能序列,再做"子任务语言检索 + 行为特征重排"的混合检索,两阶段预训练+微调。 数据:LIBERO +10.3%、真实操纵 +21.3%。 一句话:VLA 适配新任务时,从检索"可复用技能"入手,而不是硬找整条示范。
6. M3(Modality Masking)— 最朴素的鲁棒性开关
核心思想:双臂 VLA 失败常因多视角+语言融合不稳、注意力涣散到干扰区。M3 训练时随机遮罩部分模态通道,逼模型少依赖不可靠线索。 数据:RoboTwin 2.0 双臂 Clean +21.7%、随机场景 +11.4%、真实长程 +30%。 一句话:不改架构、不做预训练,一行遮罩就让 VLA 更抗噪。
7. Act with Intent — 让 VLA 不只是"照抄动作"
核心思想:VLA 的动作解码器基本都是行为克隆,只监督"示范做了什么",没表达"为什么这么做"。蒸馏出行为背后的局部意图作为额外监督。 一句话:从"模仿动作"升级到"理解意图"。
8. UniMem — 把记忆和控制在 VLA 里统一
核心思想:长程/非马尔可夫任务需要记忆,现有方法把记忆当外挂。UniMem 统一多模态记忆与控制的建模。 一句话:记忆不该是补丁,应是 VLA 的一等公民。
9. Think Only When Needed — 稀疏"慢思考"介入
核心思想:检索能增强冻结的 VLA,但检索文本一旦进入执行 prompt 就成了干预(不加保护会从 92% 掉到 3%)。按需选择何时启用慢路径。 一句话:聪明地只在必要时"多想一步",否则保持快。
10. Pointing-VLA — 更可靠的空间接地
核心思想:VLA 常用自回归文本坐标或黑盒动作 token 表达空间接地,很脆。用类型化的隐状态空间读出做接地接口。 一句话:给 VLA 一个"会指"的接口,而不是只会报坐标。
(同类:Gripper-aware VLA 处理夹爪感知假设;CAT 用轨迹级连续动作表征摆脱控制频率耦合;CoDrift 做离线 RL 的组成式漂移。)
主题三:感知、本体与数据采集(瓶颈在数据)
11. Fiber Optic Sensing Glove — 高保真灵巧手数据
核心思想:视觉手势捕捉怕遮挡,传统手套会漂移。用多芯形变光纤抓每根纤维的 3D 形变,60Hz 重建立手姿态,指尖误差 7.2mm(标定后 4.9mm)。 一句话:给灵巧操纵的数据饥饿解渴的高保真采集工具。
12. 仿生关节覆盖皮肤 — 肌骨人形机器人的第二套本体感受
核心思想:肌骨人形主要靠肌肉传感估关节,皮肤形变被忽略。做带组织样分层结构的关节覆盖皮肤,单独即可估关节角度(误差≈3°),与肌肉传感融合更准。 一句话:给机器人"皮肤"也装上本体感受,冗余即鲁棒。
13. CARO — 四足机器人零样本鲁棒移动
核心思想:把固定基座动力学模型嵌进 RL 控制环,构造无需力传感器/接触估计/视觉的"力矩级残差观测",用扰动观测器给策略在线自适应信号。 数据:负载、质心偏移、地形、突变动力学等分布外场景零样本鲁棒性显著提升。 一句话:不靠昂贵传感器,用动力学残差就能自适应。
(同类:视触觉滑检 TimeSformer;MotionDLO 事件+帧混合跟踪可变形线体。)
主题四:可信系统、安全与多智能体
14. Physical Agentic AI — 给 LLM 机器人编排加一道"物理红绿灯"
核心思想:LLM 把任务拆给机器人团队时,会产生不可行/不合时/不安全动作。加一个确定性"机器人编排器",每次只校验并授权一个技能。 数据:不拦截时 8 个注入故障全跨过边界且 6 个引发真实运动;拦截后全部在执行前被拒,0 误拦截。 一句话:先验证、再执行——用确定层拦住 LLM 的"嘴上说说"。
15. GuardianBench — 只在特定组合下才危险的安全风险
核心思想:无害指令+安全场景组合后可能变危险(潜在上下文风险)。固定场景、只变指令做安全/不安全对比对(3024 例)。主力 VLM 平均 pair 准确率仅 24.1%——模型常"两个都放行"。 一句话:安全问题藏在"指令×场景"的组合里,现有模型几乎看不见。
16. InstructMove — 让"指令跟随"不可作弊
核心思想:多数基准里目标过于显眼,策略不真理解指令也能成功。InstructMove 用语义干扰物让多个动作都可行、只有一个匹配语言,逼策略真正接地指令。 一句话:把"读指令"和"抄捷径"分开考。
(同类:Triplet2Track 用物体中心化表征做闭环长程操纵;CSymPlan 用符号规划+校验保证高自由度机械臂安全。)
给研发的一句话启示
- 做世界模型:先想清楚目标是"像素"还是"物理状态"(DELE 的结论值得抄)。
- 做 VLA:别只刷成功率,先解决数据效率、鲁棒性和"懂意图"三件事。
- 缺数据:往手部/触觉数据采集端投入,比堆算法更划算。
- 做产品:把安全/可控当一等公民,加确定性校验层。
跟进
- 每篇对应的完整笔记见同一目录(citekey 命名),可点击 index.md 跳转。
- 需要我对某篇展开深度精读(Method 细节 / 局限 / 与你的场景关联),单独说篇名即可。