具身智能论文速览 2026-08-26 · 新增 13 篇
这批最新论文(按投稿时间倒序)的深度精炼。延续「核心思想 / 为什么值得关注 / 一句话」。
本批主线
- 多臂 / 异质本体统一化:MA-VLA(多臂原子动作分配)、UCAG-P(小米:相机中心统一动作几何,一个权重吃下多形态)。VLA 正在解决"换个机器人、换个手就不行"的问题。
- 3D 高斯世界模型再进化:GaussianDream++(把世界状态/预测 token 直接嵌进 VLA)、GaussVLA(Mamba + 3D 高斯空间推理)。
- 反馈与推理的双向增强:TacForcing(执行期触觉反馈流式生成)、LM-X(显式多尺度可解释预测状态)、R³(让 VLM 用自然语言"推理"来引导动作)。
- 控制层回暖:PRISM(采样 MPC + 投影)、LAC(人形全身线性/角向柔顺)。
🟢 重点精讲
多臂 / 异质本体
MA-VLA — 多臂协作的可组合泛化 核心思想:现有 VLA 用一条全局指令,无法为"哪条臂做什么"建模。MA-VLA 把协作行为拆成原子动作提示(mid-level atomic prompts)分配给各臂,并引入 Arm Shuffle——训练时轮换各臂的观测/状态/提示,逼模型"不认臂位、只看指派",从而能在未见过的协作模式里重组泛化。 为什么值得关注:他们造了一个"训练集里没有该协作模式"的基准,SOTA VLA 基本全挂,而 MA-VLA 稳定成功——双/多臂将成为具身必备能力。 一句话:把"每条臂该干嘛"显式拆开并打乱训练,多臂就能举一反三。
UCAG-P(小米具身团队)— 一个权重吃下所有机器人 核心思想:异质具身数据的最大瓶颈是"动作空间不统一"。UCAG-P 不再用机器人专属指令当共享目标,而是用相机可观测的锚点运动(图像/相机坐标系)作统一动作表征,把机械臂、人形、人手都当同一种动作 schema 的不同化身;再用几何条件化的动作翻译器,把预测运动转成目标本体的可执行控制。 为什么值得关注:4.03K 小时机器人+仿真 + 2.34K 小时人类示范,单个 checkpoint 达到 LIBERO 98.3%、RoboTwin Hard 89.2%、LIBERO-Plus 零样本 82.0%——不用按任务微调的通用操控范本。 一句话:把动作统一到"相机看得到的运动"上,异构机器人共用一套策略。
世界模型 / 空间推理
GaussianDream++ — 把 3D 高斯世界"token 化"塞进 VLA 核心思想:在 VLA 骨干里直接插入 World State/World Prediction Token,训练期用一个只存在于训练时的 World Representation Head 把它们解码成当前世界 + 未来预测(共享 3D 高斯原语、静态-动态分解);推理时删掉 head/渲染器/VGGT,只剩 20 个世界 token,零额外在线开销。 为什么值得关注:既拿了 3D 世界模型的几何/动力学监督,又不牺牲部署速度——LIBERO 98.6%、LIBERO-Plus 87.8%,且对相机/布局偏移更稳;真实机器人把 π0.5 的 29.2%→52.5%。 一句话:训练时偷师 3D 世界模型,部署时只留 20 个 token。
GaussVLA — Mamba + 3D 高斯空间推理 核心思想:VLA 把图像压成没有几何信息的 2D patch token,单目深度也只是逐像素标量。GaussVLA 用 Gaussian Spatial Tokenizer 把语义+深度抬升成紧凑 3D 高斯 token,加 Depth-Aware Chain-of-Thought 做非自回归几何推理。 数据:LIBERO 平均 93.5%、Spatial 套件 100%,只要 200M 参数,比 SpatialVLA 平均 +19.7%。 一句话:让 VLA 真正"看得懂空间",而不是拍平。
反馈 / 推理 / 可解释
TacForcing — 执行期触觉反馈的流式动作生成 核心思想:接触丰富的操作里,接触状态在动作区间内会快速变化,但 chunk 式 VLA 用的是执行前的观测,触觉早就过期了。TacForcing 把动作专家换成流式动作专家,生成时喂入执行中不断更新的触觉;并加 Execution-Aware Tactile Attention 让触觉只约束"即将执行"的动作,减小时间错配。 数据:6 个仿真 UniVTAC + 3 个真实接触任务,成功率 65%/69%,超强基线。 一句话:让触觉"实时跟上",而不是用过期数据猜。
LM-X — 让 VLA 输出可解释的多尺度预测状态 核心思想:单一动作目标要同时扛下"任务进度、中间意图、局部可靠度",用户却看不到这些。LM-X 显式输出三个监督信号并直接用于动作生成:RTG(可见任务进度)、ETG(下一个语义转折)、异方差动作流(局部可靠度/方差)。 数据:在 50 个 RoboTwin2.0 随机困难任务上 74.1%(GR00T N1.7 是 55.4%),7 个真实任务 68.6% vs 50.7%。方差会在犹豫/振荡时升高——可解释即诊断。 一句话:把"进度/转折/信心"显式预测出来,控制可解释、可调试。
R³ — 教 VLM 用自然语言"推理"引导机器人 核心思想:能否让 VLM 用自然语言做思考(像 test-time compute)来引导底层操作?R³ 先拿专家推理轨迹做 mid-training 初始化推理风格,再用基于 rubric 的单步 RL 从离线动作数据强化——最终用自由文本推理产出测试时指导。 为什么值得关注:这是少见的"机器人也能像 LLM 一样把推理当算力砸"的方向,提升了未见任务的探索与泛化,明显优于纯指令模仿基线。 一句话:让机器人先"想明白"再动手,推理本身成为策略。
控制 / MPC / 导航
PRISM — 投影集成采样式 MPC 做双臂操作 核心思想:用 GPU 物理引擎当在线世界模型做双臂采样 MPC。核心技巧是 QP-guided 控制采样:采样出的关节速度轨迹先投影到满足位置/速度/加速度/加加速度边界 + 初速度条件的可行集合,再拿来 rollout——解耦"探索"与"运动学可行"。配套一个利用关节可分性的 ADMM/Bregman QP 求解器,外加贝叶斯优化调权。 数据:PerAct² 的障碍物球运输、托盘、交接、举箱上更鲁棒,且能在双 UR5e 上 sim-to-real。 一句话:用物理仿真当世界模型 + 数学投影保证可行,双臂也能实时规划。
LAC — 人形全身线性+角向柔顺控制 核心思想:真实人形要与人/物交互,但现有控制器要么把外力当扰动拒绝、要么只对局部刚性调节。LAC 把外力和虚拟扭矩经虚拟导纳转换成全身柔顺响应,用教师-学生 RL 训练单一策略跟踪柔顺运动。 数据:上身各处的全身柔顺、对刚度命令全量程单调调节,可用于遥操作移动-操纵。 一句话:让机器人"顺势而为",而不是硬扛外力。
⚪ 一句带过
- RA-VLA — 检索增强 + 行为对齐的上下文检索 + 落地执行管线的 VLA,训练-free 提升测试时任务适配,且保推理效率(LIBERO + 真实 UR5e)。
- ConfAL-WM — 给世界模型加"置信度探头",在潜在空间预测稠密置信图,做主动学习数据筛选 + 帧/块加权微调,提升迁移后效(RoboTwin2.0)。
- EgoNav — 学习式航点 + 几何感知局部规划的分层导航(语义分割可通行区域生成候选 + 自适应局部规划),Habitat 和实体人形上跑赢基线。
- TARCAT(施工任务分类) — 从 91 个 O*NET 任务 + 30 条施工视频归纳出 41 个动作原语/12 组/3 类,为通用施工机器人提供统一"语言"(DOBOT CR3 已演示部分原语)。
给研发的一句话启示
- 做 VLA 通用化:往"动作统一(相机中心 / 原子分配)"方向走,别再每台机器一个分支。
- 做世界模型:3D 高斯 + "训练期监督、部署期只剩 token" 是当下性价比最高的落地方案。
- 做接触操作:执行期触觉反馈(TacForcing)被验证有效,别再只吃执行前观测。
- 做多臂 / 人形:MA-VLA(原子分配)、LAC(全身柔顺)都是绕不开的能力项。
跟进
- 独立论文笔记已入库(citekey 命名),index.md 可跳转。
- 需对某篇展开深度精读(method 细节 / 局限 / 与你的场景关联),说篇名即可。