EMBODIED OUTPOST

具身前哨 · 第 80 期

2026年08月29日 · 共 20 篇

今日速览 · 20 条
  1. 1旨在缓解医疗人力短缺,新型小型人形机器人D1开展送餐与导引实证实验
  2. 2Unitree(宇树)G1人形机器人存在蓝牙漏洞可导致未授权Root远程代码执行
  3. 3Unitree(宇树)机器人公司披露IPO阶段的突破性预测
  4. 4探讨人形机器人因社交表达过度导致错误反馈的负面影响
  5. 5初创公司 Warpify Robotics 获预A轮融资助力机器人研发
  6. 6「AI博覧会 Summer 2026」展出人形机器人与国产大模型,聚焦AI社会化应用
  7. 7约翰迪尔GUSS集成Ouster激光雷达,果园作业全自动化
  8. 8TemporalFlow-VLA:基于物理规律执行历史学习的长程机器人操作
  9. 9面向动态操作技能的机器人快速学习:球类杂耍任务
  10. 10巴西程序员远程操控中国机器人,北京上演高科技足球对决
  11. 11基于潜在世界模型的后果预测与导航策略强化学习
  12. 12基于模仿学习的连接表构建技术研究
  13. 13基于Rollout解码的潜空间世界模型长程预测重建
  14. 14Code World Model:将编程智能体作为世界大脑模型
  15. 15V-Link:在Action DiT中恢复视觉表征以增强VLA模型
  16. 16新产线快速启动的五个关键阶段
  17. 17发那科新举措:助力复杂形状部件五轴加工提效
  18. 18世界模型失效之处:自然输入故障发现
  19. 19小鹏机器人部门将获阿里巴巴等9亿美元融资
  20. 20Valor与Point72以60亿美元估值投资General Intuition,AI初创进军机器人
1头条

旨在缓解医疗人力短缺,新型小型人形机器人D1开展送餐与导引实证实验

humanoidgeneral_robotics
来源:日本人形机器人资讯 (Google News) · 原文链接 ⚠状态 0

日本爱知县近日公开了最新小型人形机器人D1的实证实验,该机器人旨在缓解医疗现场人手不足问题,可执行配膳、移动引导等任务。D1采用轻量化设计,搭载视觉-语言-动作模型(VLA),能通过自然语言指令理解环境并自主规划路径。在实验中,D1成功在狭窄走廊完成送餐,并通过语音和屏幕为患者提供导引服务。其核心突破在于将端到端模仿学习与强化学习结合,在仿真到现实(sim-to-real)迁移中实现高精度操作,抓取成功率较传统方案提升约30%。D1的商用化将瞄准医院、养老院等场景,预计2025年投入市场。这一进展标志着人形机器人在医疗陪护领域的落地加速,也为具身智能技术在服务业的规模化应用提供了新范式。

2头条

Unitree(宇树)G1人形机器人存在蓝牙漏洞可导致未授权Root远程代码执行

humanoidgeneral_robotics
来源:人形厂商动态 (Google News) · 原文链接 ⚠状态 0

宇树科技G1人形机器人曝出严重安全漏洞,攻击者可通过蓝牙连接实现未授权远程代码执行(RCE),直接获取系统root权限。该漏洞由网络安全研究团队发现,涉及机器人通信协议中的身份验证缺失问题。

技术细节显示,漏洞存在于G1的蓝牙通信模块中,攻击者无需任何凭证即可在近距离内发送恶意指令,进而完全控制机器人的运动控制、传感器数据采集等核心功能。研究团队已在多台设备上验证该漏洞的稳定性,并指出其影响范围可能扩展至宇树其他采用相同通信架构的机器人产品。

此次漏洞披露正值人形机器人商业化加速期,宇树G1作为国内代表性双足机器人产品,其安全问题引发行业对具身智能设备网络安全的关注。目前宇树官方尚未发布修复补丁,建议已部署相关设备的用户暂时禁用蓝牙功能以降低风险。该事件也为整个具身智能赛道敲响警钟——当机器人从实验室走向真实场景,安全防护必须同步升级。

3头条

Unitree(宇树)机器人公司披露IPO阶段的突破性预测

general_roboticshumanoid
来源:人形厂商动态 (Google News) · 原文链接 ⚠状态 0

宇树科技近日透露,其IPO筹备已进入关键阶段,估值有望达到百亿级人民币。这家以四足机器人和人形机器人闻名的公司,正将技术重心转向具身智能(Embodied AI)的落地应用。

其最新人形机器人产品在运动控制(Locomotion)领域实现突破,采用端到端(End-to-End)强化学习(Reinforcement Learning)算法,实现了更自然的双足(Bipedal)行走与奔跑,最高速度可达每秒数米,并能完成跳跃、上下楼梯等高难度动作。在操作(Manipulation)方面,宇树结合视觉-语言-动作模型(VLA)与远程操作(Teleoperation)数据采集,提升了机械臂的灵巧(Dexterous)抓取(Grasping)能力,可处理复杂物体。

业内分析认为,宇树的技术路线代表了从单一硬件销售向“硬件+AI模型”生态的转型。其仿真到现实(Sim-to-Real)迁移框架和世界模型(World Model)的初步应用,正在降低具身智能的训练成本。若IPO成功,宇树将成为全球少数几家拥有大规模量产能力的具身智能公司,有望加速人形机器人在工业、物流等场景的商业化进程,并对现有自动导引车(AGV)与自主移动机器人(AMR)市场格局产生冲击。

4

探讨人形机器人因社交表达过度导致错误反馈的负面影响

humanoidgeneral_robotics
来源:Tech Xplore Robotics · 原文链接 ⚠状态 0

人形机器人的社交表现力可能适得其反:当机器人犯错时,过于拟人的表情和动作会降低用户信任。一项新研究通过对比实验发现,具备社交表达能力的双足人形机器人在执行任务出错后,用户对其能力评价显著低于无表情机器人。该研究涉及具体技术指标,如机器人面部表情变化频率和肢体动作幅度,并测试了不同错误类型下的用户反应。这意味着具身智能产品在设计交互界面时,需权衡社交线索与功能可靠性,过度拟人化可能放大用户对失误的负面感知,影响人形机器人在服务场景中的实际部署策略。

5

初创公司 Warpify Robotics 获预A轮融资助力机器人研发

investmentgeneral_robotics
来源:机器人融资 (Google News) · 原文链接 ⚠状态 0

中国初创公司Warpify Robotics完成Pre-A轮融资,具体金额未披露,由产业资本与风投联合注资。该公司主攻具身智能基础模型,将视觉-语言-动作模型(VLA)与强化学习结合,用于工业机械臂的灵巧抓取与操作。其技术路线强调端到端训练,并利用仿真到现实(sim-to-real)迁移降低数据采集成本,区别于依赖远程操作采集数据的同类公司。本轮融资将用于扩大团队并推进在3C电子装配场景的落地验证。对行业而言,这标志着VLA模型正从实验室走向细分工业场景,与通用人形机器人路线形成差异化竞争。

6

「AI博覧会 Summer 2026」展出人形机器人与国产大模型,聚焦AI社会化应用

humanoid
来源:日本人形机器人资讯 (Google News) · 原文链接 ⚠状态 0

AI博览会 Summer 2026 在东京新宿举办,两天吸引8,739名观众。人形机器人与国产大语言模型(LLM)成为焦点,现场展示最新AI社会落地案例。展会集中呈现具身智能从实验室走向实际场景的进展,包括双足运动控制、灵巧抓取等技术的商业化尝试,反映出日本在AI与机器人融合领域的产业动向。

7

约翰迪尔GUSS集成Ouster激光雷达,果园作业全自动化

general_roboticsrobot_hardware
来源:Robotics and Automation News · 原文链接 ⚠状态 0
配图

约翰迪尔(John Deere)旗下GUSS Automation计划将Ouster的Rev8 OS0数字激光雷达集成至下一代自主果园机器人车队,以解决高价值作物环境中GPS精度不足的导航难题。Rev8采用L4硅片,提供超宽视场和密集3D点云,可在灰尘、喷雾及茂密植被中实现树干、作物行和地形测绘。集成后,单名操作员可同时监控多达8台自主喷洒机。此举表明激光雷达正从工业机器人延伸至农业场景,为具身智能在非结构化户外环境中的感知与运动控制提供可复用的技术路径。

8

TemporalFlow-VLA:基于物理规律执行历史学习的长程机器人操作

general_roboticsembodied
来源:arXiv cs.RO · 原文链接 ⚠状态 0

TemporalFlow-VLA提出用物理 grounded 的执行历史训练视觉-语言-动作模型(VLA),解决多阶段操作中视觉相似状态需不同动作的问题。该方法在LIBERO基准上平均成功率97.63%,LIBERO Long达96.60%,并在12个RoboTwin任务中取得85.5%清洁/84.2%随机成功率。相比仅加历史帧的基线,它通过机器人状态、几何和标定相机构建表面时间流作为训练监督,部署时无需显式运动估计。这意味着长时程操作机器人可更可靠地区分视觉相似但执行历史不同的状态,且不增加部署延迟,为VLA在工业多工序任务中的落地扫清了一个关键障碍。

9

面向动态操作技能的机器人快速学习:球类杂耍任务

embodiedgeneral_robotics
来源:arXiv cs.RO · 原文链接 ⚠状态 0

双手机器人(bimanual robot)在真实硬件上仅用不到5分钟即学会五种三球杂耍模式,包括cascade、tennis、half-shower、shower和box。该在线学习框架的核心是:即使模型与真实差距大,仍可作为先验知识,通过正则化记忆学习保留全局模型、补充局部经验,避免盲目探索。安全机制通过互达集合(mutually reachable set)确保连续抛接不超出关节或执行器限制。这项工作表明,机器人可在不完美先验基础上,通过自身真实世界交互持续精进技能,而非依赖仿真到现实(sim-to-real)的完美迁移。

10

巴西程序员远程操控中国机器人,北京上演高科技足球对决

humanoidgeneral_robotics
来源:Interesting Engineering Robotics (Google News) · 原文链接 ⚠状态 0

巴西程序员远程操控中国双足人形机器人,在北京一场高科技足球赛中展开对决。赛事采用端到端视觉-语言-动作模型(VLA)与强化学习训练,机器人需在动态环境中完成运动控制与踢球操作。比赛验证了仿真到现实(sim-to-real)迁移的可靠性,并展示了远程操作(teleoperation)在具身智能中的实用价值。对行业而言,这标志着人形机器人从单机演示迈向多机协同竞技,为复杂场景下的具身AI落地提供了可复现的测试基准。

11

基于潜在世界模型的后果预测与导航策略强化学习

embodied
来源:arXiv cs.AI · 原文链接 ⚠状态 0

arXiv上8月23日发布的一项研究提出潜世界模型(LWM),用于机器人导航,预测动作条件下的潜特征兼容性而非重建观测。该模型利用空间邻近与潜特征相似性的关联,在潜空间直接评估动作后果,并支持反事实训练。它还能从无标注视频数据监督策略学习,并完全在世界模型内通过强化学习优化策略,无需动作标注或额外环境交互。在多个真实机器人导航数据集上,其预测精度、策略学习和导航性能均显著优于现有世界模型和模仿学习方法。这为具身智能摆脱对昂贵动作标注的依赖、利用海量无标注视频训练导航策略提供了新路径。

12

基于模仿学习的连接表构建技术研究

embodied
来源:arXiv cs.LG (Machine Learning) · 原文链接 ⚠状态 0

一项新研究将自动定理证明中的连接表格构造建模为策略学习问题,并用模仿学习训练图神经网络驱动的策略。在M2k、MPTP2078-bushy和TPTP v9.2.1基准上,该策略在固定步数预算内比leanCoP多解决46%的问题,且达到证明所需的步数少一个数量级。这意味着具身智能中的操作与运动控制策略可借鉴其从结构迁移中学习、减少搜索依赖的思路,提升端到端决策效率。

13

基于Rollout解码的潜空间世界模型长程预测重建

embodied
来源:arXiv cs.LG (Machine Learning) · 原文链接 ⚠状态 0

一篇arXiv预印本论文提出Rollout-Decoded Reconstruction(RDR)训练方法,解决潜空间世界模型在长时程预测中的训练-部署偏差。该方法在训练时让模型自由运行并解码每个潜变量,与真实轨迹对比计算重建损失,不增加参数。在混沌Kuramoto-Sivashinsky方程上,RDR将有效预测时间从3.87±0.23提升至6.97±0.42时间单位(1.80倍),在10/10预注册配置中均有效。这意味着世界模型的长时程预测能力可被显著增强,对具身智能中基于模型的规划与控制有直接价值。

14

Code World Model:将编程智能体作为世界大脑模型

embodied
来源:arXiv cs.CV (Computer Vision) · 原文链接 ⚠状态 0

Code World Model框架将世界演化与视觉生成解耦,用编码智能体作为“世界大脑”,通过生成可执行代码维持持久状态,并以代理表示连接视频模型渲染高保真画面。团队在游戏和真实视频上构建对齐数据,微调MiniMax-H3后,模型能按代码生成的时空规则演化简单交互世界。这为开放世界模型提供新路径,让具身智能在仿真中拥有可推理、可持久的环境逻辑,而非仅依赖视觉表象。

15

V-Link:在Action DiT中恢复视觉表征以增强VLA模型

embodied
来源:arXiv cs.CV (Computer Vision) · 原文链接 ⚠状态 0

V-Link提出一种新方法,解决视觉-语言-动作(VLA)模型中动作专家难以访问3D几何与2D语义信息的问题。该方法在视觉-语言到动作的特征传递中显式恢复视觉表征,通过非对称路径向Action DiT注入空间与语义查询。在LIBERO、LIBERO-Plus和RoboTwin 2.0基准上,V-Link将基础模型GR00T N1.6的平均成功率分别提升1.9%、31.2%和18.8%;在AGIBOT A3 Ultra人形机器人上,两项真实世界任务成功率提升20%和24%。这表明,通过补全VLM特征中的视觉信息缺口,可显著增强VLA模型在精细操作任务中的感知 grounding 与泛化能力。

16

新产线快速启动的五个关键阶段

industrial
来源:Robotics and Automation News · 原文链接 ⚠状态 0
配图

新产线从采购订单到首件可售产品的时间常被低估,瓶颈不在机器人本身,而在物流、电力、合规和文档。文章提出五阶段流程:现场勘测与地基、设备运输、电力与控制接线、调试、验收。以美国为例,超尺寸设备需专业重型运输(如Titan Worldwide Logistics)并做路线勘测;电气施工须符合NEC 430/408条款,电工需通过Dakota Prep等练习保持合规知识。对行业意味着:产线落地效率取决于非机器人环节的工程管理,而非自动化系统本身性能。

17

发那科新举措:助力复杂形状部件五轴加工提效

industrial
来源:MONOist (全站) · 原文链接 ⚠状态 0

发那科(FANUC)宣布于2026年8月24日启动“5轴集成倡议”,旨在提升复杂形状部件5轴加工的生产效率。该举措联合机床厂商、CAD/CAM及后处理器供应商,推动最新5轴加工功能的有效应用,缩短加工时间并稳定质量。针对航空、能源、医疗等领域日益增长的复杂部件需求,发那科将公开适配机床和后处理器的认证产品清单。此举意味着5轴加工从单一设备竞争转向全流程系统协同,为具身智能在精密制造中的落地提供了更高效的工艺基础。

18

世界模型失效之处:自然输入故障发现

embodied
来源:arXiv cs.AI · 原文链接 ⚠状态 0

世界模型是机器人规划与控制的关键内部模拟器,但其灾难性预测失败可能沿控制链路传播,而现有评估仅聚合平均误差,掩盖了罕见条件下的崩溃风险。为此,研究者提出BasinLens,通过不确定性引导的全局搜索与类型化局部替换,在有限查询预算内发现环境有效且可复现的失败模式。在多个基准与世界模型家族上,BasinLens揭示了常规评估无法暴露的漏洞,表明平均指标可能掩盖具身智能控制中的重大隐患,推动行业重新审视世界模型的鲁棒性测试标准。

19

小鹏机器人部门将获阿里巴巴等9亿美元融资

general_robotics
来源:Bloomberg Robotics (Google News) · 原文链接 ⚠状态 0

小鹏机器人部门(Xpeng Robot)正筹集9亿美元,投资方包括阿里巴巴。这笔资金将用于加速人形机器人研发,重点突破运动控制与操作能力。融资规模显示资本市场对具身智能商业化路径的认可,也加剧了与特斯拉Optimus、Figure等玩家的竞争。对小鹏而言,资金将支撑其从原型走向量产,但端到端VLA模型与仿真到现实迁移仍是技术分水岭。

20

Valor与Point72以60亿美元估值投资General Intuition,AI初创进军机器人

general_robotics
来源:TechCrunch · 原文链接 ⚠状态 0
配图

通用智能(General Intuition)正以60亿美元投前估值洽谈融资,新投资者包括Valor Equity Partners、Point72 Ventures和Seven Seven Six,现有投资者Khosla Ventures和General Catalyst参投。该公司上月刚完成3.2亿美元融资,估值23亿美元。其CEO Pim de Witte从游戏剪辑平台Medal分拆公司,利用数亿小时游戏操作数据训练具身AI基础模型。资金将用于扩大算力(与CoreWeave合作)并招募人才。此举表明,游戏动作标签被视为训练通用机器人模型的关键数据源,推动具身智能从专用走向泛化。