EMBODIED OUTPOST

具身前哨 · 第 12 期

2026年06月10日 · 共 20 篇

今日速览 · 20 条
  1. 1AffordanceVLA:基于感知理解的视觉-语言-动作模型
  2. 2MPCoT:多路径潜在推理,提升视觉-语言-动作模型的测试性能
  3. 3TempoVLA:学习可控速度的视觉-语言-动作策略
  4. 4世界模型在生物医学研究中的应用
  5. 5WorldFly:基于世界模型的无人机导航视觉-语言-动作模型
  6. 6HANDOFF:人形机器人任务空间控制,通过蒸馏实现协同
  7. 7简化操作:视觉-语言-动作模型的一步行动生成
  8. 8PLAN-S:规划与潜在风格动态结合,提升自动驾驶世界模型
  9. 9合成数据生成:助力双机械臂布料操作中的瑕疵与关键点检测
  10. 10PHUMA:可靠的人形机器人运动数据集
  11. 11超越模仿:强化学习与仿真-现实协同训练,提升VLA模型
  12. 12测试时训练:提升视觉预测视觉-语言-动作模型
  13. 13行星探测车:主动悬挂助力实现全地形运动控制
  14. 14STRIPS-WM:从图像学习基于世界模型的机器人行为预测
  15. 15T-GMP:地形感知生成运动先验,提升人形机器人的自然运动能力
  16. 16通用三维视觉-动作策略学习中的任务编辑技术
  17. 17预测风格匹配:实现稳定且自然的机器人双足运动
  18. 18Coarse-to-Control:基于动作令牌规划的视觉-语言-动作模型
  19. 19QuadVerse:集成框架,实现视觉与物理现实对齐的四足机器人仿真
  20. 20Shield-Loco:预测安全过滤技术提升机器人运动策略的鲁棒性
1头条

AffordanceVLA:基于感知理解的视觉-语言-动作模型

embodied
来源:arXiv cs.RO · 原文链接

研究团队提出AffordanceVLA模型(视觉-语言-动作模型),通过具身智能提升机器人操作精度。该模型引入结构化预设预测模块,结合视觉-语言-动作模型,实现更精准的感知-动作映射。实验显示,其在仿真与现实场景中均表现出色,尤其在复杂操作任务中成功率提升27%。技术突破在于通过Which2Act、Where2Act、How2Act三组件分离物体识别、交互定位与三维操作规划,为机器人自主决策提供新范式。

2头条

MPCoT:多路径潜在推理,提升视觉-语言-动作模型的测试性能

embodied
来源:arXiv cs.RO · 原文链接

MPCoT框架通过奖励引导的多路径潜层推理,解决了视觉-语言-动作(VLA)策略在复杂任务中的脆弱性问题。在LIBERO和CALVIN数据集上,其长时域任务成功率提升15%。该方法无需生成推理token,保留原始8步动作接口,同时支持可配置的推理参数(K,M)。技术亮点在于利用世界模型和专家动作一致性评估路径质量,实现端到端的高效决策。

3头条

TempoVLA:学习可控速度的视觉-语言-动作策略

embodied
来源:arXiv cs.RO · 原文链接

研究团队提出TempoVLA,通过结合数据增强和模型条件机制,实现了视觉-语言-动作模型的速度可控执行。VSTA模块在调整轨迹时几乎无运动误差,实验显示其在模拟和现实任务中均能双向灵活控速,且默认性能提升20%。该技术首次实现动态速度调节,加速低风险操作、减速高风险阶段,为灵巧操作和具身智能提供新方案。

4

世界模型在生物医学研究中的应用

embodied
来源:arXiv cs.AI · 原文链接

研究团队提出生物医学世界模型,旨在通过模拟生物系统动态机制推动AI驱动的医学发现。该模型能学习分子到临床多尺度状态的潜在表示,并预测干预后的未来轨迹。技术首次实现跨虚拟细胞、手术模拟等场景的前瞻性仿真,或为疾病预测与治疗方案设计提供新范式。

5

WorldFly:基于世界模型的无人机导航视觉-语言-动作模型

embodied
来源:arXiv cs.AI · 原文链接

研究团队提出WorldFly(世界飞),一种基于世界模型的视觉-语言-动作框架,专为无人机导航设计。该模型通过双分支耦合流匹配机制,能同时生成未来视频预测和导航动作,在密集城市环境测试中表现优于其他方法,尤其在未见过的场景中提升显著。这一突破验证了世界模型对具身空中代理决策能力的增强作用,为复杂环境下的自主飞行提供新思路。

6

HANDOFF:人形机器人任务空间控制,通过蒸馏实现协同

humanoid
来源:arXiv cs.RO · 原文链接

Unitree G1团队提出HANDOFF控制器,通过多教师知识蒸馏技术实现人形机器人全身控制突破。该方法在Unitree G1上达到行业领先的运动速度跟踪精度,操作空间扩大30%,且无需特定任务数据训练。其创新性地整合全身运动跟踪、运动控制与跌倒恢复三大模块,结合视觉-语言-动作模型实现自然语言指令驱动的复杂任务执行,为具身智能在真实场景中的落地提供关键技术支撑。

7

简化操作:视觉-语言-动作模型的一步行动生成

embodied
来源:arXiv cs.RO · 原文链接

研究者提出了一种新的视觉-语言-动作模型(VLA)动作生成方法,通过调整训练中的噪声分布,无需复杂步骤即可实现高效动作生成。在1.4B参数的模型上,该方法在LIBERO-Long任务中达到95.6%的准确率,显著优于传统多步解码方案,为机器人自主决策提供了新思路。

8

PLAN-S:规划与潜在风格动态结合,提升自动驾驶世界模型

embodied
来源:arXiv cs.RO · 原文链接

PLAN-S模型通过结合潜在风格动态,提升自动驾驶世界模型的规划能力。在nuScenes数据集上,平均L2误差降低至0.55米,3秒内碰撞率减少42%;在NAVSIM上,规则成本变体达到89.4的PDMS评分。该方法通过显式建模风险与风格偏好,优化了自动驾驶决策流程,实现更安全、多样的轨迹生成。

9

合成数据生成:助力双机械臂布料操作中的瑕疵与关键点检测

humanoid
来源:arXiv cs.RO · 原文链接

研究人员开发了基于Blender的合成数据生成技术,结合视觉检测解决双臂布料操作难题。系统通过自动标注关键点和皱纹检测,实现1.7615像素的均值位置误差。该方法无需微调即可迁移至物理织物,在高遮挡场景下优于传统基线模型,为柔性材料操作提供新方案。

10

PHUMA:可靠的人形机器人运动数据集

humanoid
来源:arXiv cs.RO · 原文链接

研究团队发布PHUMA(物理可靠人形机器人运动数据集),通过两阶段流程整合动作捕捉与互联网视频,生成73小时高质量数据。该数据集解决现有数据集存在的肢体穿透、足部滑动等物理缺陷,在运动跟踪基准测试中,基于PHUMA训练的策略成功率超越AMASS和Humanoid-X,且可零样本迁移至真实机器人Unitree G1(优必选)。这一突破为人形机器人运动控制提供了更可靠的数据基础,推动具身智能技术落地。

11

超越模仿:强化学习与仿真-现实协同训练,提升VLA模型

embodied
来源:arXiv cs.RO · 原文链接

研究团队提出基于强化学习的仿真-现实协同训练框架RL-Co,通过交互式仿真提升视觉-语言-动作模型(VLA)的现实表现。在两个代表性VLA架构OpenVLA和π₀.₅上,该方法使现实任务成功率分别提升24%和20%。相比传统方法,RL-Co显著增强模型泛化能力与现实数据效率,为仿真到现实(sim-to-real)部署提供可扩展解决方案。

12

测试时训练:提升视觉预测视觉-语言-动作模型

embodied
来源:arXiv cs.RO · 原文链接

研究者提出一种新型测试时训练方法T³VF,通过预测未来图像与实际观测的监督对,提升视觉-语言-动作模型在分布外场景的鲁棒性。实验证明该方法仅需适度增加推理成本,无需修改模型架构。这项技术突破为复杂环境下的具身智能应用提供了更可靠的技术方案,尤其适用于需要高精度视觉预测的机器人操作场景。

13

行星探测车:主动悬挂助力实现全地形运动控制

humanoid
来源:arXiv cs.RO · 原文链接

研究团队提出四轮行星探测车ERNEST,搭载主动铰接悬挂系统,通过强化学习实现复杂地形自主导航。在20°沙坡测试中,其运输成本较传统方案降低37%。该系统融合 proprioceptive 与 exteroceptive 传感器数据,采用领域随机化技术实现仿真到现实的零样本迁移,成功穿越岩石场、沙丘等障碍。

14

STRIPS-WM:从图像学习基于世界模型的机器人行为预测

embodied
来源:arXiv cs.RO · 原文链接

某团队提出STRIPS-WM框架,通过视觉转换学习图像关联的STRIPS风格世界模型。该方法从图像序列中提取二值命题和符号操作符,首次实现从图像直接生成符号操作模型。实验显示其在视觉重排任务中成功率超越现有视觉推演、潜在图搜索等基准方法,为具身智能和自主移动机器人(AMR)的长期规划提供新范式。

15

T-GMP:地形感知生成运动先验,提升人形机器人的自然运动能力

humanoid
来源:arXiv cs.RO · 原文链接

某团队提出T-GMP模块,解决人形机器人运动控制难题。该方法基于条件变分自编码器,利用少量专家演示学习地形适应的运动模式,实现自然流畅的运动。实验显示,其穿越成功率和运动平滑度优于现有方法,同时保持生物模仿的协调性。这项技术突破为复杂地形中的人形机器人应用提供了新思路。

16

通用三维视觉-动作策略学习中的任务编辑技术

embodied
来源:arXiv cs.RO · 原文链接

一项新研究提出Task-Edit框架,通过任务分解与重组,显著提升机器人3D视觉运动策略的泛化能力。该方法将任务拆解为场景、技能和对象组件,灵活生成多样化轨迹,减少对真实世界演示数据的依赖。实验表明,其在复杂操作任务中成功率提升35%,并能有效应对干扰、避障及杂乱环境等现实挑战,为具身智能的高效训练提供新思路。

17

预测风格匹配:实现稳定且自然的机器人双足运动

humanoid
来源:arXiv cs.RO · 原文链接

Unitree G1团队提出Predictive Style Matching(PSM)方法,解决人形机器人运动质量不足的问题。在Unitree G1上,PSM将上半身风格误差降低约10倍,同时保持跌倒恢复率。相比模仿学习基线,PSM恢复失败率低5倍,提升运动稳定性与自然性。

18

Coarse-to-Control:基于动作令牌规划的视觉-语言-动作模型

embodied
来源:arXiv cs.RO · 原文链接

研究团队提出Coarse-to-Control方法,通过动作标记空间的计划-执行框架提升视觉-语言-动作模型(VLA)的长期任务表现。该方法先生成粗略动作序列作为规划,再转化为具体指令,使模型在LIBERO等复杂任务中性能提升显著,尤其在多阶段任务中效果优于传统直接生成方式。

19

QuadVerse:集成框架,实现视觉与物理现实对齐的四足机器人仿真

humanoid
来源:arXiv cs.RO · 原文链接

研究者提出QuadVerse框架,通过重建几何约束的3D场景,解决四足机器人仿真与现实的差距。该方法结合视觉和物理交互校准,减少执行器误差达30%。这一突破使零样本视觉导航策略部署更高效,推动具身智能发展。

20

Shield-Loco:预测安全过滤技术提升机器人运动策略的鲁棒性

humanoid
来源:arXiv cs.RO · 原文链接

研究团队提出Shield-Loco方法,通过预测安全过滤提升四足机器人运动安全性。该方法结合全物理模型与三个算法组件(几何投影、动量增强更新、复制交换),在密集杂乱环境中验证,安全违规减少超70%。技术突破在于无需保守控制器即可实现动态避障,为复杂场景下的具身智能提供新思路。