具身智能论文速览 2026-08-26 · 完整版(25 篇)
目标:不读原文也能吃透。重点精讲 = 值得深读;一句带过 = 了解即可。
今日大趋势
- 「世界模型」最大热点:多篇 WAM,争论焦点是"要不要视频生成"。倾向结论:预测物理状态比预测像素更本质(DELE 最强、+47pt)。
- VLA 走向「可靠、精炼、懂意图」:数据效率(HSR)、鲁棒性(M3)、意图理解(Act with Intent)、记忆(UniMem)、稀疏快思考(Think Only When Needed)。
- 瓶颈在数据采集端:手部/触觉/本体传感扎堆(光纤手套、仿生皮肤、视触觉)。
- 具身安全当一等公民:GuardianBench、Physical Agentic AI。
🟢 重点精讲(14 篇,建议深读)
世界模型
DELE-w0.5 — 砍掉视频生成,只预测"动作执行后达到的物理终态",从终态隐变量直接推断动作。480 次真实试错、4 长程任务全程成功率 62.5,甩开最强基线 47.5pt。→ 与其预测像素,不如预测物理结局。
GaussianWAM — 用 3D 高斯场把深度/语义/相机关联到共享原语,训练期蒸馏进 WAM 表征,推理零额外开销。LIBERO-Plus 从 52%→71%。→ 给世界模型"补空间和语义地基"。
TrAct — 用视觉轨迹(不受具身约束的点轨迹)做控制与预测的中介接口,替代弱对齐的原始动作。仿真 27%→55%、真实 49%→76%。→ 训练世界模型时,"要让哪些点动"比"动作本身"更有信号。
PonderPounce — 复用 MLLM 原生上下文作机器人"记忆":System2(Ponder)累积内容、System1(Pounce)快速出动作,端到端联合训练,无需专门记忆模块,p50 延迟 78ms/25ms 支持 20Hz。→ 用 LLM 的上下文当记忆,System2/System1 双系统架构。
VLA 与策略学习
HSR — 层级化技能检索:把目标任务拆成技能序列,按语义+可靠度选优,再混合检索复用示范。LIBERO +10.3%、真实 +21.3%。→ VLA 少样本适配新任务时,检索可复用技能比找整条示范划算。
M3(Modality Masking) — 训练时随机遮罩模态通道,逼模型少依赖干扰线索。不改架构、不预训练,双臂 Clean +21.7%、随机 +11.4%、真实长程 +30%。→ 最朴素的鲁棒性开关。
Act with Intent — 除监督"示范做了什么"外,蒸馏行为背后的局部意图。→ 从模仿动作升级到理解意图。
UniMem — 把多模态记忆与控制统一建模进 VLA(而非外挂记忆)。→ 记忆是长程任务的一等公民。
Think Only When Needed — 检索的文本一旦进执行 prompt 就成了干预(可致成功率 92%→3%)。按需选时开启"慢思考"快慢路径。→ 聪明地在必要时多想一步。
Pointing-VLA — 用类型化隐状态空间读出做空间接地,替代脆的文本坐标/黑盒 token。→ 给 VLA 一个会"指"的接口。
感知 / 本体 / 数据
Fiber Optic Sensing Glove — 多芯形变光纤抓每根纤维 3D 形变,60Hz 重建手姿态,指尖误差 7.2mm(标定后 4.9mm)。→ 给灵巧操纵的数据饥饿解渴的高保真采集工具。
仿生关节覆盖皮肤 — 带组织样分层的关节覆盖皮肤,单独即可估关节角(误差≈3°),与肌肉传感融合更准。→ 给机器人"皮肤"也装本体感受,冗余即鲁棒。
可信 / 安全 / 多智能体
Physical Agentic AI — 给 LLM 机器人编排加确定性"编排器",每步只校验授权一个技能。不拦截时 8 个注入故障全跨边界且 6 个引发真实运动;拦截后全被拒、0 误拦截。→ 先验证、再执行。
GuardianBench — 固定场景只变指令,做安全/不安全对比对(3024 例)。主力 VLM 平均 pair 准确率仅 24.1%,模型常"两个都放行"。→ 危险藏在"指令×场景"组合里,现有模型几乎看不见。
⚪ 一句带过(11 篇,了解即可)
- Do Robotic World Models Really Follow Actions? — 给行动条件化世界模型"体检",质疑其生成未来是否真反映动作。
- One-Shot LfD of Contact-Rich Manipulation — 显式建模"何时何地发生接触",单条示范即可复现复杂接触性任务。
- Gripper-aware VLA(MiGA/GVLA) — 造了 5 种夹爪 10.3 万示范的数据集,让 VLA 感知夹爪类型(平行爪 vs 吸盘)。
- CAT — 轨迹级连续动作表征,摆脱控制频率耦合,跨骨干/频率一致提升。
- CoDrift — 离线 RL 的组成式"漂移",把多个目标场合成统一策略场,73 任务平均排名最优。
- GeoWAM — 把世界模型用于自动驾驶,处理像素空间场景演化的几何。
- Reward-Free Continual Adaptation(Space) — 无奖励信号的持续 RL,用于太空机器人硬件退化自适应。
- ROS2SmolVLA — 让轻量 VLA 集成进工业级小机器人,适配小批量多变生产。
- InstructMove — 用语义干扰物让"指令跟随"不可作弊,逼策略真读指令。
- CSymPlan — 符号规划+校验,保证高自由度机械臂安全(零违规)。
- Reproducible 6-DoF Arm — 开源的本科生低成本机械臂,含踩坑文档。
- NVIDIA Cosmos-H-Dreams — 首个可实时交互的外科手术世界模型(160 FPS、控制器无关、浏览器/VR/真实手术机器人可驱动)。
给研发的一句话启示
- 做世界模型:先想清楚目标是"像素"还是"物理状态"。
- 做 VLA:别只刷成功率,先解决数据效率、鲁棒性、懂意图。
- 缺数据:往手部/触觉数据采集端投入,比堆算法划算。
- 做产品:把安全/可控当一等公民,加确定性校验层。
跟进
每篇对应完整笔记在同目录(citekey 命名),index.md 可跳转。要深读某篇,把篇名发我即可。