EMBODIED OUTPOST

具身前哨 · 第 98 期

2026年09月20日 · 共 20 篇

今日速览 · 20 条
  1. 1Agility获3亿美元订单,显著增强人形机器人赛道信心
  2. 2视频展示:5台人形机器人在赛道上翩翩起舞
  3. 3GMO熊谷谈论具身AI如何重塑日本制造与人形机器人前景
  4. 4Tesla Optimus面临Figure AI带来的新挑战
  5. 5机器人视频世界模型:应用、挑战与未来方向综述
  6. 6Teach and Grow:面向通用机器人学习的智能体中心架构
  7. 7中国机器人初创公司RobotPlusPlus完成C轮融资
  8. 8稳定策略学习研究综述
  9. 9DeliveryGym:具备自适应课程的长程具身智能规划环境
  10. 10SCOUT:基于嵌入空间预测的跨越Sim-to-Real的人员检索
  11. 11动态系统中持续的企业级世界模型发现研究
  12. 12报告涵盖手术机器人进展及仓储自动化在现实场景的部署
  13. 13基于最小描述长度的多元时间序列分类对齐诊断
  14. 14中国初创公司研发出可响应语音指令的人形机器人
  15. 15利用“世界人形机器人运动会”数据优化Zoomlion(纵马)人形机器人性能
  16. 16Figure AI推出新一代AI大脑助力人形机器人迈向自动化生产
  17. 17Agile-WAM:面向高接触环境机器人控制的敏捷触觉世界动作模型
  18. 18SkipVLA:结合经典规划跳过VLA步骤以加速机器人操作
  19. 19学习机器人屋面施工中的坡度自适应全身运动控制
  20. 20面向几何变化的机器人插入视觉Sim-to-Real学习:应用于钢筋安装
1头条

Agility获3亿美元订单,显著增强人形机器人赛道信心

general_roboticshumanoid
来源:人形厂商动态 (Google News) · 原文链接 ⚠状态 0

**Agility Robotics 斩获超3亿美元订单,加速人形机器人商业化进程**

随着Agility Robotics获得超过3亿美元的订单,人形机器人(humanoid)在工业领域的落地进程显著提速。这些订单主要源于其核心产品:能够执行复杂任务并具备高度灵活性的人形机器人系统。

技术层面,Agility通过先进的运动控制(locomotion)与精密的感知算法,赋予机器人在非结构化环境中作业的能力。其硬件设计支持复杂的抓取(grasping)与操作(manipulation),配合强大的具身智能(embodied intelligence)算法,使机器人能够替代人类完成物流搬运、分拣等高重复性工作。

这一突破标志着人形机器人正从实验室走向大规模工业应用。大额订单的落地不仅验证了Agility技术的可靠性,更预示着人形机器人将成为未来自动化仓储与制造领域的关键基础设施,推动智能制造进入新阶段。

2头条

视频展示:5台人形机器人在赛道上翩翩起舞

humanoid
来源:日本人形机器人资讯 (Google News) · 原文链接 ⚠状态 0

**【头条】人形机器人集群协同:多机联动突破复杂动态场景**

在近期展示的演示中,5台人形机器人(humanoid)在赛道上同步完成复杂的舞蹈动作。这一表现不仅是运动控制(locomotion)能力的体现,更展示了机器人在高动态环境下的稳定性与群体协作能力。

该技术核心依托于先进的端到端(end-to-end)模型与强化学习(reinforcement learning),使机器人能够精准处理复杂的平衡控制与多肢体协同。通过在模拟环境中进行大规模训练并结合仿真到现实(sim-to-real)技术,这些机器人在动态轨迹中的稳定性显著提升,能够快速响应环境变化。

此项突破标志着人形机器人正从单一的运动实验走向复杂的场景应用。高度稳定的群控能力与灵巧操作能力的融合,将加速人形机器人在物流、制造及复杂服务领域的商业化落地进程。

3头条

GMO熊谷谈论具身AI如何重塑日本制造与人形机器人前景

humanoid
来源:日本人形机器人资讯 (Google News) · 原文链接 ⚠状态 0

**具身智能驱动制造变革:GMO集团探讨人形机器人重塑日本工业的潜力**

随着制造业面临劳动力短缺挑战,具身智能(Embodied Intelligence)正成为推动工业自动化转型的核心引擎。GMO集团相关负责人指出,通过将物理世界与人工智能融合,人形机器人有望解决传统自动化难以覆盖的复杂制造场景。

在技术路径上,该领域正从简单的轨迹规划转向基于基础模型(Foundation Model)的端到端(End-to-End)控制。通过整合视觉-语言-动作模型(VLA)和强化学习(Reinforcement Learning),机器人能够实现更复杂的抓取(Grabbing)与灵巧(Dexterous)操作,并具备在非结构化环境中自主决策的能力。此外,利用仿真到现实(Sim-to-Real)技术加速训练,可大幅缩短人形机器人在工厂实测的周期。

这一技术的突破意味着工业生产将从“预设程序”转向“智能感知”。人形机器人不仅能替代高强度、重复性的体力劳动,更能通过具备通用能力的具身AI,在复杂的装配线和物流环节中提供高度灵活的自动化支持,为重塑制造业竞争力提供核心技术支撑。

4

Tesla Optimus面临Figure AI带来的新挑战

humanoid
来源:人形厂商动态 (Google News) · 原文链接 ⚠状态 0

Tesla 正面临来自 Figure AI 的强力竞争,双方在人形机器人领域的技术路径正形成鲜明对比。Figure AI 采用基于视觉-语言-动作(VLA)模型的端到端架构,通过模仿学习实现复杂的抓取与操作;而 Tesla Optimus 则侧重于大规模数据驱动的具身智能进化。这种技术路线的分野意味着行业正从单一的运动控制转向融合大模型能力的通用机器人。若 Figure AI 的 VLA 模型能显著提升机器人在非结构化环境中的决策能力,将倒逼特斯拉加速其基础模型的迭代与泛化能力的突破。

5

机器人视频世界模型:应用、挑战与未来方向综述

embodiedgeneral_robotics
来源:arXiv cs.RO · 原文链接 ⚠状态 0

视频世界模型(Video World Models)正成为具身智能领域构建高保真环境模拟的关键技术。该综述指出,相比于传统基于物理的模拟器,视频模型能生成包含精细交互和可变形物体动态的写实画面,有效克服仅靠语言抽象难以描述复杂物理交互的局限。目前,该技术正被应用于强化学习中的动力学建模、奖励建模、视觉规划以及高效数据生成等核心环节。尽管面临幻觉(Hallucinations)导致的违反物理规律及指令遵循差等挑战,但视频模型作为基础模型在模拟真实世界动态方面的潜力巨大。这预示着具身智能将从依赖简化假设的仿真环境转向更具表现力的视觉驱动模拟,加速机器人从虚拟到现实(sim-to-real)的跨越。

6

Teach and Grow:面向通用机器人学习的智能体中心架构

embodiedgeneral_robotics
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队推出 Teach-and-Grow Learning (TGL) 架构,旨在通过无需梯度更新或微调的“零训练”方式让机器人快速习得新技能。该系统集成 OpenAI GPT-6 Astra 进行多模态推理,并利用 Codex 连接机器人工具,在 LIBERO 测试集中达到 99.9% 的平均成功率,并在包含扰动的 LIBERO-Plus 类别中达到 92.4%。TGL 通过构建闭环“技能块”和经验记忆库,将演示数据转化为可复用的知识。这为具身智能领域提供了一种摆脱大规模数据重训的路径,显著降低了机器人学习新任务的成本,加速了复杂操作场景下的泛化能力落地。

7

中国机器人初创公司RobotPlusPlus完成C轮融资

general_roboticsinvestment
来源:机器人融资 (Google News) · 原文链接 ⚠状态 0

机器人初创公司 RobotPlusPlus 完成 C 轮融资,旨在加速具身智能(Embodied Intelligence)技术的商业化落地。该公司专注于研发具备灵巧操作能力的机器人系统,并利用端到端(End-to-end)架构优化抓取与运动控制。通过整合视觉-语言-动作模型(VLA)和强化学习技术,RobotPlusPlus 致力于提升人形机器人(Humanoid)在复杂工业环境中的作业能力。这标志着具身智能正从基础模型研究转向高精度的实操应用,推动通用机器人进入大规模量产与多场景部署的关键阶段。

8

稳定策略学习研究综述

embodied
来源:arXiv cs.LG (Machine Learning) · 原文链接 ⚠状态 0

研究者提出一种名为 policy-vote bagging 的策略学习方法,旨在解决基于证据的决策中采样风险导致的低福利产出问题。该算法通过在多个子样本上学习处理决策并平均投票概率,显著降低了单一实验样本带来的波动性。技术核心在于建立估计准确度、子样本规模与福利变动之间的严格界限,并在 CARA 效用函数下提供精确保证。这为具身智能中的强化学习(reinforcement learning)提供了更稳健的决策框架,能有效提升机器人在不确定环境下的动作稳定性与安全性。

9

DeliveryGym:具备自适应课程的长程具身智能规划环境

embodied
来源:arXiv cs.LG (Machine Learning) · 原文链接 ⚠状态 0

DeliveryGym推出了一个包含持久性世界动态和多模态工具交互的3D环境,旨在训练具身智能体进行长程规划。该系统在13个城市地图中测试了6种模型,通过强化学习使Qwen3-VL-4B模型的净收入提升54.3%,且通过自适应课程学习进一步提升16.5%。这套框架将配送任务中的时间、能量等资源消耗转化为RL反馈。它为具身智能提供了从单一动作执行到复杂决策链条的跨越,解决了机器人在多约束条件下进行长程规划和资源分配的实战难题。

10

SCOUT:基于嵌入空间预测的跨越Sim-to-Real的人员检索

embodied
来源:arXiv cs.CV (Computer Vision) · 原文链接 ⚠状态 0

SCOUT通过在嵌入空间预测冻结特征,解决了跨模态检索中的sim-to-real(仿真到现实)鸿沟问题。该系统采用V-JEPA作为视频编码器、EmbeddingGemma作为文本编码器,并利用Qwen3.5-0.8B解码器作为预测器。在AI City Challenge 2026竞赛中,该方案最终达到84.25 mAP@10的成绩,显著优于仅使用单一冻结模型的60.63分。这证明了通过参数高效的适配与重排序机制,可以在不微调基础模型的情况下大幅提升跨模态检索精度,为具身智能中的复杂环境感知提供更高效的低成本技术路径。

11

动态系统中持续的企业级世界模型发现研究

embodied
来源:arXiv cs.AI · 原文链接 ⚠状态 0

研究团队提出一种持续演进的“企业世界模型”发现机制,旨在让智能体在动态业务规则中自主学习并预测操作后果。该技术基于真实的 ServiceNow 环境构建了 EnterpriseWorldShift 测试集,包含 9 个数据表、25 条隐藏规则及 600 个评估动作。实验证明,Continual Discovery Agent (CDA) 在模型预测准确度上比传统查询式方法高出 8.98 个 IoU 点。这为具身智能在复杂工业环境中的决策提供了新路径:机器人无需实时请求外部系统即可理解动态规则,显著提升了在高度动态、非结构化工作流中的自主作业能力。

12

报告涵盖手术机器人进展及仓储自动化在现实场景的部署

industrialgeneral_robotics
来源:The Robot Report (Google News) · 原文链接 ⚠状态 0

The Robot Report 发布最新报告,聚焦手术机器人技术突破及仓储自动化在真实场景中的落地应用。报告指出,工业领域正从传统的自动导引车(AGV)向具备SLAM技术的自主移动机器人(AMR)转型;同时,具身智能(embodied intelligence)正通过端到端模型融合视觉-语言-动作(VLA)技术,提升人形机器人的抓取与操作能力。这标志着机器人从单一任务执行转向通用技能学习,将推动工业自动化从预设路径走向自主决策,加速复杂环境下的协作机器人(cobot)大规模商用。

13

基于最小描述长度的多元时间序列分类对齐诊断

investment
来源:arXiv cs.AI · 原文链接 ⚠状态 0

研究者提出一种基于最小描述长度(MDL)的诊断方法,用于检测多通道时间序列分类中的时间错位问题。该方法无需重新训练或参考对齐数据,即可识别由延迟、时钟漂移引起的传感器流偏移。在FordChallenge、PAMAP2等9个真实世界数据集测试中,该指标成功识别出传统评估无法发现的系统性偏差。这为具身智能中的多传感器融合提供了一种通用的诊断工具,能有效定位并纠正部署环境中的数据对齐缺陷,提升复杂任务下的模型鲁棒性。

14

中国初创公司研发出可响应语音指令的人形机器人

humanoidgeneral_robotics
来源:日本人形机器人资讯 (Google News) · 原文链接 ⚠状态 0

中国初创企业正研发具备语音交互能力的 humanoid(人形机器人),预计将于明年实现商用。该技术融合了 VLA(视觉-语言-动作模型)与端到端学习,旨在让机器人能理解复杂口头指令并执行相关 manipulation(操作)任务。相比传统仅依赖预设程序的 AGV 或 AMR,这种基于基础模型的具身智能方案赋予机器人更强的泛化能力。这标志着人形机器人正从简单的自动化执行向具备高层语义理解的通用智能进化,将加速具身智能在非结构化环境中的落地应用。

15

利用“世界人形机器人运动会”数据优化Zoomlion(纵马)人形机器人性能

humanoidgeneral_robotics
来源:日本人形机器人资讯 (Google News) · 原文链接 ⚠状态 0

Zoomlion(中联重科)正利用其在“世界人型机器人运动会”中积累的实测数据,加速推进人形机器人(humanoid)的研发。通过整合多维度运动数据,该公司旨在提升机器人在复杂环境下的稳定性与交互能力。此举标志着具身智能(embodied intelligence)从实验室走向实战场景,真实数据的注入将显著缩短模拟到现实(sim-to-real)的跨度。这不仅能加速人形机器人在工业制造等领域的落地应用,更预示着基于大规模真实数据驱动的端到端(end-to-end)控制模型正成为提升机器人的灵巧操作与运动控制的关键路径。

16

Figure AI推出新一代AI大脑助力人形机器人迈向自动化生产

humanoidgeneral_robotics
来源:人形厂商动态 (Google News) · 原文链接 ⚠状态 0

Figure AI 发布了基于视觉-语言-动作(VLA)模型的全新“AI大脑”,显著提升人形机器人的复杂任务处理能力。该模型通过端到端架构融合基础模型,使机器人能够理解复杂指令并执行精准的抓取与操作。相比传统仅依赖预设程序的AGV或简单的移动控制,这一突破实现了从简单搬运到复杂逻辑决策的跨越。这标志着具身智能正从单一的运动控制转向具备高泛化能力的通用操作,为人形机器人在工厂、物流等真实工业场景中的大规模部署扫清技术障碍。

17

Agile-WAM:面向高接触环境机器人控制的敏捷触觉世界动作模型

embodiedgeneral_robotics
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队推出Agile-WAM,通过融合视觉与触觉信息构建轻量化世界模型(World Action Model),旨在解决复杂接触场景下的机器人控制难题。该模型采用流匹配(flow-matching)过程,在5项真实世界实验中实现11.9ms的低推理延迟,并将操作成功率提升29.4%。通过处理视觉与触觉不同时间尺度的动态差异,Agile-WAM证明了轻量化架构也能支撑高频、精准的机器人控制。这为具身智能在复杂物理交互中的实时性挑战提供了高效的技术路径。

18

SkipVLA:结合经典规划跳过VLA步骤以加速机器人操作

general_roboticsembodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

SkipVLA通过将预训练的视觉-语言-动作模型(VLA)与传统运动规划器结合,解决了大模型在长程任务中推理速度慢的痛点。该系统仅在抓取、放置等高难度接触技能时调用VLA,而在自由空间移动中切换至经典规划算法。实验显示,SkipVLA在LIBERO仿真任务及实物6自由度YAM机械臂测试中,任务完成速度提升高达2.5倍,且显著降低了能耗。这一混合架构为具身智能提供了高效路径:通过将语义理解与确定性运动规划解耦,大幅提升复杂工业场景下的机器人操作效率。

19

学习机器人屋面施工中的坡度自适应全身运动控制

humanoidgeneral_robotics
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队提出一种基于任务语义场景锚定的框架,使 Unitree G1 人形机器人能够完成屋顶施工中的复杂运动。该系统结合轨迹级优化与强化学习(Reinforcement Learning),解决了单纯模仿学习在倾斜表面导致的支撑点偏移问题。实验显示,机器人在使用钉枪、锤击和侧向推挤等任务中,工作空间误差控制在 0.256 至 0.531 厘米之间,且基座坐标系运动误差低于 80 毫米。这一成果为具身智能(Embodied Intelligence)在复杂建筑工况下的动作原语提供了一种可靠的技术路径,推动人形机器人从实验室演示走向高难度的工业实景应用。

20

面向几何变化的机器人插入视觉Sim-to-Real学习:应用于钢筋安装

embodiedgeneral_robotics
来源:arXiv cs.RO · 原文链接 ⚠状态 0

研究团队推出RebarSim系统,通过全仿真环境训练机器人完成高难度的钢筋插入任务。该系统采用强化学习训练具备特权信息的教师模型,并将其知识蒸馏至多视角学生模型中。在仅有1.4毫米间隙的复杂工况下,该模型在真实工厂生产出的随机几何尺寸样本中实现了91.3%的零样本(zero-shot)成功率。相比从零训练,预训练策略能减少4-6倍的蒸馏样本量。这证明了大规模多样性模拟与端到端学习结合,是解决工业场景下高精度、强接触任务泛化难题的关键路径。