EMBODIED OUTPOST

具身前哨 · 第 20 期

2026年06月15日 · 共 20 篇

今日速览 · 20 条
  1. 1Hy-Embodied-0.5-VLA:从视觉-语言-动作模型到真实机器人学习框架
  2. 2Kine2Go:面向Unitree Go2机器人的多样化步态与动作运动学数据集
  3. 3基于扰动估计的阻抗MPC算法用于灵巧手控制
  4. 4[HMG技术人才论坛2026系列③] Boston Dynamics首席产品与技术官分享机器人走出实验室应用
  5. 5Boston Dynamics(波士顿动力)如何升级Atlas机器人
  6. 6Mouser Electronics发布人形机器人专题,解析感知、AI与控制技术的融合
  7. 7Bosch深耕中国市场并致力于研发人形机器人核心组件
  8. 8基于柔性无源声波导的可扩展动态触觉传感技术
  9. 9$\mu_0$:一种可扩展的基于三维交互轨迹的世界模型
  10. 10FlowMo-WM:融合物体动量与隐藏环境漂移的世界模型
  11. 11多智能体具身自动驾驶:从V2X信息交互到共享世界模型
  12. 12基于核表示的域自适应策略学习及其在非平稳扰动下四旋翼控制中的应用
  13. 13通过输出级正则化消除单GPU微调VLA中的种子随机性问题
  14. 14ContactWorld:面向高接触操作的视觉-触觉世界模型研究
  15. 15ReactSim-Bench:自动驾驶中反应式行为世界模型仿真基准测试
  16. 16基于扩散噪声选择的自进化VLA策略:提升动作平滑性与鲁棒性
  17. 17针对驾驶VLM模型的场景特定安全边界评估与判定研究
  18. 18基于弹性查询强化学习的VLA模型自感知策略执行
  19. 19基于空间条件的扩散策略:单目RGB相机下的精准稳健操作学习
  20. 20基于知识蒸馏的实时视觉-语言-动作模型RT-VLA
1头条

Hy-Embodied-0.5-VLA:从视觉-语言-动作模型到真实机器人学习框架

embodiedgeneral_robotics
来源:arXiv cs.RO · 原文链接 ⚠状态 0

**Hy-Embodied-0.5-VLA:构建从视觉-语言-动作模型到真实机器人学习的全栈架构**

研究团队推出了 Hy-Embodied-0.5-VLA(简称 HyVLA-0.5),这是一款涵盖机器人学习全链路的端到端系统。该系统突破了单一模型的局限,实现了从数据采集、模型设计、持续预训练与监督微调(SFT),到强化学习(RL)后训练及最终真实世界部署的完整技术闭环。

在技术架构上,HyVLA-0.5 深度整合了视觉-语言-动作模型(VLA),通过构建完整的机器人学习堆栈,确保模型能够理解复杂指令并转化为精确的物理动作。该系统不仅优化了模型的泛化能力,还显著提升了机器人在真实环境中的操作稳定性与可靠性。

此项技术的突破意味着具身智能(Embodied Intelligence)正从实验室原型走向大规模工业应用。通过提供标准化的全栈学习框架,HyVLA-0.5 为通用机器人开发提供了关键的技术路径,有望大幅降低复杂任务的部署门槛,推动人形机器人与协作机器人在多场景下的实操能力跨越式提升。

2头条

Kine2Go:面向Unitree Go2机器人的多样化步态与动作运动学数据集

humanoidgeneral_robotics
来源:arXiv cs.RO · 原文链接 ⚠状态 0

**Kine2Go:为宇树Go2提供多样化步态的运动学数据集**

研究团队推出 Kine2Go 数据集,旨在解决四足机器人领域在模仿学习(imitation learning)和强化学习(reinforcement learning)过程中,高质量运动学数据获取难、构建流程复杂等痛点。该数据集专门针对 Unitree Go2 四足机器人设计,包含 800 条涵盖多样化步态的运动轨迹数据,源自 40 种不同的策略模型。

在技术实现上,Kine2Go 构建了一套通用的转换管线,能够将多种四足机器人形态的数据转换为与 Go2 兼容的格式。随后,研究团队利用强化学习(reinforcement learning)训练出遵循特定运动轨迹的策略,并从中采集包含电机级动作指令的鲁棒性运动学数据。

该数据集的发布显著降低了科研门槛,为研究人员在四足机器人的运动控制(locomotion)、导航及复杂环境下的行为克隆提供了高质量的基础素材。它不仅加速了相关算法的迭代,也为推动具身智能(embodied intelligence)在多形态机器人上的通用性应用提供了重要支撑。

3头条

基于扰动估计的阻抗MPC算法用于灵巧手控制

robotic_armembodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

**【技术突破】基于扰动估计的阻抗MPC算法显著提升灵巧手控制精度**

研究团队提出一种与驱动器无关的阻抗模型预测控制(Impedance MPC)框架,旨在解决灵巧手在精确轨迹跟踪与安全顺应性接触之间的矛盾。该架构通过代数前馈技术将复杂的腱传动系统简化为常系数双积分器,并引入基于编码器的增强卡尔曼滤波器来估计扰动状态。

实验数据显示,在液压驱动指关节的测试中,该算法在1.5 Nm接触力下的稳态误差仅为0.1 mrad,性能较传统阻抗控制提升了1500倍;在处理复杂约束(如压力、空化限制及ISO/TS 15066标准)时,其运行频率可达500 Hz。此外,该架构在具有16个自由度的LEAP手仿真中表现出色,能在0.7秒内从2.5 N的抓取负载扰动中恢复。

这一技术突破为灵巧机器人(dexterous hand)提供了高可靠性的控制方案,能够显著提升机器人在复杂环境下的操作稳定性,为推动具身智能(embodied intelligence)在精细制造和复杂交互场景中的落地提供关键算法支撑。

4

[HMG技术人才论坛2026系列③] Boston Dynamics首席产品与技术官分享机器人走出实验室应用

humanoidgeneral_robotics
来源:人形厂商动态 (Google News) · 原文链接 ⚠状态 0

Boston Dynamics(波士顿动力)首席产品与技术官 Zachary Jackowski 在 HMG Tech Talent Forum 2026 系列论坛中,深度探讨了机器人如何从实验室走向真实工业场景。他强调通过端到端(end-to-end)架构和基础模型(foundation model),赋予人形机器人更强的具身智能(embodied intelligence)。技术亮点在于结合视觉-语言-动作(VLA)模型与强化学习,显著提升机器人在复杂环境下的抓取、操作及运动控制能力。这标志着机器人正从单纯的自动化工具进化为具备高度灵巧性的通用协作机器人(cobot)。

5

Boston Dynamics(波士顿动力)如何升级Atlas机器人

humanoidgeneral_robotics
来源:人形厂商动态 (Google News) · 原文链接 ⚠状态 0

Boston Dynamics 展示了全新一代 Atlas 人形机器人,标志着其从纯硬件工程向深度融合具身智能(embodied intelligence)的跨越。新一代机器人的关节设计更加精简且具备极高的灵巧度,能够实现复杂的抓取与操作任务。相比于前代产品,新款 Atlas 彻底取消了液压系统,转而采用全电动驱动。这一转变不仅提升了运动控制的灵活性,更让机器人能够更好地适配各种工业场景。这是具身智能走向实用的关键一步。

6

Mouser Electronics发布人形机器人专题,解析感知、AI与控制技术的融合

humanoidgeneral_robotics
来源:日本人形机器人资讯 (Google News) · 原文链接 ⚠状态 0

Mouser Electronics 发布了“Rise of the Robots”专题系列,深度解析人形机器人(humanoid)在感知、AI 与控制技术融合方面的突破。该系列聚焦于具身智能(embodied intelligence)的核心驱动力,涵盖从基础模型到端到端(end-to-end)控制的演进路径。通过整合视觉-语言-动作(VLA)模型与强化学习等前沿技术,旨在解决复杂环境下的抓取(grasping)与运动控制(locomotion)。这不仅是技术的堆叠,更是推动人形机器人从实验室走向工业实用的关键里程碑。

7

Bosch深耕中国市场并致力于研发人形机器人核心组件

humanoidgeneral_robotics
来源:日本人形机器人资讯 (Google News) · 原文链接 ⚠状态 0

Bosch(博世)正加速布局中国市场,深耕人形机器人核心组件研发。公司通过整合先进的具身智能(embodied intelligence)技术,致力于攻克复杂环境下的抓取与操作难题。其核心亮点在于将视觉-语言-动作模型(VLA)与端到端学习结合,提升机器人的灵巧度。作为全球工业巨头,Bosch 的入局意味着人形机器人正从实验室走向大规模工业应用,有望重塑自动化生产线的未来。

8

基于柔性无源声波导的可扩展动态触觉传感技术

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队开发出一种基于被动且柔性声学波导的动态触觉传感技术,旨在解决大规模传感器阵列在灵活性与复杂布线方面的难题。该系统通过弹性膜覆盖的赫姆霍兹共振器实现信号传输,在4个麦克风组成的64节点阵列中,定位精度高达99%,且推理延迟仅为5.5毫秒。这种低成本、高分辨率的设计能灵敏捕捉从单根毛发接触到动脉脉搏等多种微弱信号。这为下一代具身智能中的柔性触觉皮肤和人机交互提供了极具扩展性的技术路径。

9

$\mu_0$:一种可扩展的基于三维交互轨迹的世界模型

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

```json

{"summary_zh":"研究团队推出 $\mu_0$ 世界模型,通过预测关键交互点的3D轨迹而非像素或特定动作标签,实现了跨具身智能的通用学习。该模型利用 TraceExtract 系统从多样化视频中自动提取3D监督信息,构建出一种轻量且与机器人硬件无关的运动接口。实验证明,在无需动作标注预训练的情况下,$\mu_0$ 生成的策略性能足以媲美 $\pi_0$ 等基于视觉-语言-动作(VLA)模型。这一突破为跨机器人的灵巧操作提供了更具扩展性的数据表征。"}

```

10

FlowMo-WM:融合物体动量与隐藏环境漂移的世界模型

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

FlowMo-WM 推出了一种全新的端到端视觉世界模型(World Model),旨在解决机器人在复杂动态环境中的预测难题。该模型通过解构图像-动作历史,成功捕捉到物体惯性及水流、风力等隐性漂移影响。在模拟的水面艇环境中,FlowMo-WM 显著提升了长程预测的准确性。这一突破意味着具身智能(Embodied Intelligence)能够更好地应对非受控环境中的动态干扰,为复杂场景下的机器人运动控制提供更稳健的底层支撑。

11

多智能体具身自动驾驶:从V2X信息交互到共享世界模型

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

一项涵盖380多篇文献的综述研究,揭示了自动驾驶正从孤立的车辆智能向多智能体具身智能(Embodied Intelligence)跨越。核心突破在于引入共享世界模型(Shared World Models),通过V2X(车用一切)通信实现感知对齐与协同决策。该研究深入探讨了端到端协作驱动、意图识别及复杂环境下的联合规划。这标志着自动驾驶正从单体智能进化为具备群体意识的系统,为解决高延迟和不确定性场景下的交通安全提供了关键技术路径。

12

基于核表示的域自适应策略学习及其在非平稳扰动下四旋翼控制中的应用

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究人员提出一种基于核表示的领域自适应策略学习算法,旨在解决无人机在非平稳干扰下的实时控制难题。该方法利用随机傅里叶特征构建可微内核近似,在 RTX 4090 GPU 上仅需 50 秒即可完成离线训练。核心技术亮点在于其能够通过在线最小二乘估计,让飞行器在面对突发阵风、载荷变化等复杂环境时实现实时适配。这一突破显著提升了无人机在从仿真到现实(sim-to-real)过程中的鲁棒性。

13

通过输出级正则化消除单GPU微调VLA中的种子随机性问题

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究人员通过引入输出层正则化,解决了单GPU微调视觉-语言-动作模型(VLA)时出现的“种子抽奖”问题。在LIBERO基准测试中,基础模型的成功率因随机种子不同而波动巨大,甚至出现高达29%的性能跌幅。实验证明,采用VICReg等输出层正则化方法后,彻底消除了所有灾难性崩溃案例(0/21)。这一突破意味着开发者只需简单调整优化器配置,即可显著提升具身智能模型在实际部署中的稳定性。

14

ContactWorld:面向高接触操作的视觉-触觉世界模型研究

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队推出 ContactWorld 基准测试,旨在破解复杂接触场景下的机器人操作难题。通过对 12 项包含组装、拆卸等高难度任务的实验发现,融合点云与触觉力场特征能显著提升规划成功率:相比仅使用腕部或正前方视觉观测(约 20.7% - 22.0%),多模态融合后的表现跃升至 36.1%。这一突破证明了空间结构化与跨模态兼容性是构建鲁棒世界模型的核心。该研究为具身智能在复杂物理交互中的长程规划提供了关键路径。

15

ReactSim-Bench:自动驾驶中反应式行为世界模型仿真基准测试

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队推出 ReactSim-Bench,旨在破解自动驾驶模拟中“反应式行为”评估难的痛点。现有基准往往只考核与日志的一致性,而该基准通过解耦车辆控制逻辑,专门测试仿真中的智能体能否对非预设路径做出合理反馈。该基准包含 2,636 个涵盖多种类别的测试场景,并对比了 Transformer、扩散模型等主流架构的性能。这一工具为评估世界模型(World Model)在复杂动态环境下的鲁棒性提供了关键标准。

16

基于扩散噪声选择的自进化VLA策略:提升动作平滑性与鲁棒性

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队提出一种名为SDN的测试时技术,旨在解决基于扩散模型的视觉-语言-动作(VLA)模型在面对干扰信息时表现脆弱的问题。该方法通过动态采样噪声向量来过滤虚假关联,显著提升机器人操作的稳定性。实验结果显示,在Google Robot等模拟环境及真实世界数据集中,SDN能将任务成功率分别提升8%和10%。这项技术无需修改模型参数即可实现动作平滑,为提升具身智能(Embodied Intelligence)在复杂现实场景中的鲁棒性提供了高效路径。

17

针对驾驶VLM模型的场景特定安全边界评估与判定研究

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究人员针对驱动类视觉-语言-动作模型(VLA)的安全性提出了全新的评估框架,旨在解决自动驾驶中的安全边界判定难题。研究团队对拥有100亿参数的Alpamayo R1模型进行了超过1.5万组测试案例的评估。结果显示,单一的平均误差阈值无法准确衡量风险,例如在某些场景中,即使容忍度更高,高严重性故障的比例仍可能高出4倍。这一发现强调了建立二维安全包络线的必要性,为符合ISO 21448标准的SOTIF认证提供了更精准的技术路径。

18

基于弹性查询强化学习的VLA模型自感知策略执行

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队推出 EQRL 框架,通过引入“弹性查询”机制优化 VLA(视觉-语言-动作)模型的执行逻辑。不同于传统的固定推理频率,EQRL 能根据任务难度的动态变化自动分配计算资源。在仿真与真实机器人的操作实验中,该方法在保持甚至提升任务成功率的同时,显著降低了平均推理成本。这一突破解决了复杂环境下机器人控制不均衡的痛点,为具身智能中的高效、自适应决策提供了新路径。

19

基于空间条件的扩散策略:单目RGB相机下的精准稳健操作学习

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队推出 Spatially Conditioned Diffusion Policy (SCDP),让机器人仅凭单台 RGB 相机就能实现高精度的操作任务。目前,多相机系统(如腕部相机)仍是模仿学习的标配,但 SCDP 通过将末端执行器轨迹作为视觉注意力锚点,成功捕捉到细粒度的交互细节。实验证明,SCDP 在模拟环境中的表现足以媲美多相机基准模型,并在真实场景中展现出极强的鲁棒性。这一突破显著降低了硬件成本,为单视角模仿学习提供了全新的技术路径。

20

基于知识蒸馏的实时视觉-语言-动作模型RT-VLA

embodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队推出 RT-VLA 模型,通过知识蒸馏技术攻克了视觉-语言-动作模型(VLA)在自动驾驶中推理延迟过高的痛点。该轻量化模型在保持高性能的同时,将纯视觉模式下的推理时间大幅缩减了 44.8 倍,在“视觉+语言”模式下也降低了 7.9 倍。这一突破证明了监督蒸馏是构建实时、可解释的具身智能驱动自动驾驶系统的有效路径。