1 头条
仿生手制造商:人形机器人助力销售额激增
humanoidgeneral_robotics
**中国仿生手制造商受益于人形机器人市场爆发**
一家中国仿生手制造商正迎来销售额的显著增长,这主要得益于人形机器人市场的蓬勃发展。该公司专注于为人形机器人提供高精度、高灵巧度的仿生手,这些仿生手能够实现复杂的抓取和操作任务。
该公司的仿生手采用先进的视觉-语言-动作 (VLA) 模型,结合了即时定位与地图构建 (SLAM) 技术,使其能够适应复杂多变的环境。通过端到端 (end-to-end) 的学习方式,仿生手能够实现高度的自主性,并能够通过模仿学习 (imitation learning) 和强化学习 (reinforcement learning) 不断提升性能。公司表示,其仿生手在抓取精度和操作灵巧度方面均达到行业领先水平,能够有效提升人形机器人的工作效率和应用范围。
人形机器人的发展为仿生手市场带来了巨大的机遇,尤其是在工业自动化、医疗康复和家庭服务等领域。该公司的产品有望在推动人形机器人技术的普及和应用方面发挥重要作用,并为相关产业带来新的增长点。
2
从人类视频到机器人操作:基于以人为本数据的视觉-语言-动作学习
embodiedgeneral_robotics
**人形机器人操控能力迎来突破:利用人类视频数据提升VLA模型性能**
一项新的研究表明,通过利用大量人类视频数据,可以显著提升视觉-语言-动作(VLA)模型的操控能力,从而推动人形机器人(humanoid)和自主移动机器人(AMR)的发展。目前,VLA模型通常依赖于昂贵的机器人示范数据,而该研究则探索了如何将丰富的人类行为信息转化为机器人的有效知识。
研究人员将现有方法分为四类:编码帧间变化的潜在动作表示、预测未来帧的世界模型、提取图像平面信息的显式2D监督以及恢复几何或运动的显式3D重建。研究还强调了三个关键挑战:如何将非结构化视频转化为可训练的片段,如何将视频信息转化为适用于不同机器人形态和视角的动作指令,以及如何设计更有效的评估方法,以预测实际部署性能和迁移效率。
这项研究有望降低机器人学习成本,加速具身智能(embodied intelligence)的发展,并为协作机器人(cobot)和自动导引车(AGV)等应用带来更灵活、更智能的操控能力。
3
机器人操作的世界模型:技术综述
embodiedgeneral_robotics
**人形机器人操控迎来突破:世界模型助力更智能的运动与操作**
一项新的研究综述探讨了“世界模型”在机器人操控中的应用,旨在解决机器人预测未来状态的能力。研究表明,世界模型正从任务特定的动态预测器演变为机器人学习的预测基础设施。
世界模型是一种基于动作的预测系统,它能够预测机器人在特定动作下,物体、接触和场景几何的变化。该研究将现有工作划分为五大类,并区分了集成预测-动作模型和显式预测规划器,同时还探讨了其在合成经验生成、候选过滤、搜索评估、学习环境和结果验证等基础设施中的作用。研究还分析了34个机器人操控数据集,并提出了评估预测准确性、任务性能和模拟器可靠性的方法。
这项研究强调了世界模型在提升机器人灵巧性、运动控制和操作能力方面的潜力,尤其是在具身AI和人形机器人领域。未来,该技术有望在自动化生产、远程操作(teleoperation)和复杂环境下的机器人应用中发挥重要作用,并可能催生新的商业模式和应用场景。
4
优化视觉-语言-动作模型:聚焦组内误差,提升11自由度移动操作
embodiedamr
研究团队发现,微调视觉-语言-动作模型(VLA)时,总均方误差(MSE)最低的模型未必在真实机器人上表现最佳。通过分析11自由度丰田HSR机械臂的实验数据,在60次实际测试中,π₀.₅(3.3B参数)模型的80k版本以4.0/4分显著优于其他微调方案(SmolVLA仅得3.5/4分)。研究指出,单独关注臂部关节组误差而非总MSE,能更准确评估模型性能,这对异构动作空间的机器人控制具有指导意义。
5
基于Transformer的世界模型:离线元强化学习中的任务表示学习
embodied
一项新研究提出了一种框架,通过结合Transformer-based世界模型和信息论任务表示学习,解决了离线元强化学习中的分布偏移问题。实验表明,该方法在分布外和稀疏奖励场景中表现优于现有技术,稳定性提升30%。这项突破为机器人自主适应复杂环境提供了新思路,尤其在工业自动化和智能物流领域具有应用潜力。
6
语言智能体:策略与世界模型协同训练
embodied
一项新研究提出结合策略与世界模型的协同训练框架PaW,通过强化学习与环境模拟的联合优化,使语言代理在复杂任务中表现提升23%。该方法无需额外训练阶段,在三个基准测试中持续超越现有强化学习基线。其核心创新在于利用动作熵筛选数据、噪声容忍损失函数和奖励自适应平衡机制,为具身AI和自主机器人提供更高效的训练范式。
7
VLM4VLA:重新审视视觉-语言模型在视觉-语言-动作中的应用
embodied
研究团队提出VLM4VLA方法,通过少量参数将通用视觉-语言模型(VLM)转化为视觉-语言-动作(VLA)策略,挑战了VLM通用能力与下游任务表现关联的常见假设。实验显示,在三个基准的多个任务中,VLM初始化虽有益,但视觉模块而非语言部分是性能瓶颈。通过向视觉编码器注入控制相关监督,即使冻结参数仍能提升效果,为具身AI的端到端训练提供了新思路。
8
交互式视频世界建模:前沿、挑战、基准与未来趋势
embodied
一篇最新论文系统梳理了交互式视频世界建模的前沿进展,于2026年5月31日提交。研究聚焦动作条件控制、长时互动记忆等三大技术挑战,对比了游戏引擎、自动驾驶等四个领域的基准。该成果为具身AI、机器人操作等应用提供了关键参考,推动世界模型向更高效、可控的方向发展。
9
RescueBench:具身智能能否在真实场景中拯救生命?
embodied
研究团队推出RescueBench,这是首个针对复杂救援场景的具身智能体评估基准。该基准包含五个渐进难度等级,最高难度下所有基线均无法完成全流程任务。通过多阶段任务评估,揭示自主探索和空间记忆是当前具身AI的主要瓶颈,为提升灾难救援机器人性能提供关键方向。
10
Focused Energy:2.4亿美元A轮融资,加速激光聚变技术
investment
**Focused Energy 获 2.4亿美元 A 轮融资,加速激光聚变技术发展**
Focused Energy 近日完成了超额认购的 2.4亿美元 A 轮融资,成为一家在聚变能源领域获得最大早期融资的初创公司之一。此次融资使公司已筹集总计 3 亿美元的私人资本,并获得了 2 亿美元的政府资助。
该公司总部位于德国,正在开发一种利用激光压缩聚变燃料的反应堆,即惯性约束聚变技术。其设计灵感来源于美国劳伦斯利物莫国家实验室的“国家点火设施”(NIF),该设施是目前唯一实现可控核聚变反应,并释放出比启动能量更多的能量的实验。为了提高效率,Focused Energy 采用“直接驱动”激光系统,直接压缩燃料颗粒,而无需像 NIF 那样使用复杂的金制腔体(hohlraum)将激光能量转化为 X 射线。
该公司计划在德国一家退役的核裂变电站,建立名为 Lighthouse 的首个示范系统。此次 A 轮融资由 RWE 牵头,其他参与方包括德国联邦突破创新机构 (SPRIND)、Prime Movers Lab 和欧洲创新委员会基金。随着聚变能源领域的投资热潮,Focused Energy 将与 Thea Energy、Inertia Enterprises 和 Type One Energy 等公司展开竞争,共同推动聚变能源技术的商业化进程。
11
英伟达:与美国、欧洲人形机器人厂商合作,拓展至中国Unitree
humanoidgeneral_robotics
Nvidia将与美国、欧洲及中国Unitree等公司合作开发人形机器人(humanoid robot)。此举或加速具身智能(embodied intelligence)技术落地,推动机器人自主运动(locomotion)与操作(manipulation)能力提升。合作方涵盖多地区企业,凸显行业对人形机器人规模化应用的期待。
12
人形机器人:物理AI发展的关键指标
general_roboticshumanoid
波士顿动力推出新一代人形机器人手,通过灵巧操作算法实现92%抓取成功率,成为具身AI落地的关键突破。该技术融合模仿学习与仿真到现实迁移,使机械手能完成精密零件组装等复杂任务,推动人形机器人从实验室走向工业场景。
16
LLM助力机器人理解模糊指令,聚焦关键细节
general_robotics
最新研究利用大语言模型(LLM)提升机器人对模糊指令的理解能力,通过聚焦关键细节使任务成功率提升35%。该技术结合自然语言处理与机器人控制,推动具身智能发展,为复杂场景下的自主操作提供新思路。
17
RoboChem Flex:推动自主合成机器人的普及
general_robotics
**阿姆斯特丹大学推出低成本“RoboChem Flex”自动合成机器人,助力科研普惠**
阿姆斯特丹大学范特霍夫分子科学研究所的Timothy Noël教授团队,在《Nature Synthesis》杂志发表论文,展示了一种面向合成优化领域的自动实验室系统——RoboChem Flex。该系统采用模块化设计,并支持“人工干预”分析,旨在服务于各种规模的合成实验室。研究团队公开了系统构建所需的所有信息,力求降低使用门槛。
RoboChem Flex的出现,旨在打破高昂成本带来的壁垒,让更多科研机构能够使用先进的、基于人工智能的合成系统。与此前耗资超过5万美元的RoboChem系统相比,RoboChem Flex的预计成本仅为5000美元,同时具备光催化、生物催化、热交叉偶联等多种应用能力。
该系统采用易于获取的组件或3D打印部件,并通过开源的OmniPlatypus软件进行硬件控制,实现模块化和快速定制。软件层面,集成了高度模块化的贝叶斯优化算法,支持与多种在线分析仪器集成,实现全天候的自动化反应优化。研究团队还开发了低成本的3D打印液体取样模块,方便用户使用现有分析设备进行样本分析,进一步降低了使用门槛。
RoboChem Flex的开源代码和设计文件,将为全球科研机构提供一个经济实惠且灵活的自动实验室解决方案,有望促进化学领域的创新和发展,尤其是在资源有限的研究群体中。
18
软银:洽谈8亿美元投资,助力Agile Robots发展
general_robotics
SoftBank正在洽谈投资8亿美元的敏捷机器人融资轮,该金额可能成为全球机器人领域最大单笔融资。这笔资金将重点支持人形机器人(humanoid)和自主移动机器人(AMR)技术突破,推动具身智能(embodied intelligence)在工业场景的落地应用。
19
机器人巡逻犬:或将部署至台湾南海岛屿
general_robotics
台湾的南中国海岛屿或将部署机器人巡逻犬(robot patrol dogs),据路透社报道。这类设备可能搭载自主移动技术(AMR),实现全天候无人值守巡逻。此举或提升岛屿监控效率,减少人力依赖。尽管具体技术细节未披露,但机器人巡逻犬的潜在应用标志着具身智能(embodied intelligence)在安防领域的扩展,可能推动相关技术在复杂地形中的落地。
26
约束全身跟踪:提升人形机器人运动控制的稳定性和精度
humanoidgeneral_robotics
**人形机器人全方位运动控制迎来突破,安全性能大幅提升**
研究人员推出了一种名为ConstrainedMimic的控制框架,旨在提升人形机器人在运动控制方面的安全性和约束性。该框架利用全方位运动学和动力学原理,实现实时约束的执行,尤其是在强化学习(Reinforcement Learning, RL)跟踪策略中。通过结合“操作空间控制”和“控制屏障函数”(Control Barrier Functions, CBFs)的原理,该方法能够满足运动参考轨迹和底层动力学方面的各种实时约束,例如避免与自身或外部障碍物发生碰撞,以及遵守关节限制和重心稳定性要求。
在Unitree G1人形机器人(仿真环境)上的实验中,该方法在保持当前接触模式和跟踪目标的同时,仅对策略能力进行最小程度的限制,并能以高达300-500Hz的频率运行,支持CPU、GPU和TPU平台。该技术的商业意义在于,它有望提高人形机器人在复杂环境中的应用安全性,加速其在物流、服务等领域的普及。所有软件将在发布时免费提供。
27
$ au_0$-WM:统一视频-动作世界模型,助力机器人操作
embodiedgeneral_robotics
**$\tau_0$-WM:统一的视频-动作世界模型,助力机器人精准操作**
研究人员发布了一种名为$\tau_0$-World Model (简称$\tau_0$-WM)的统一视频-动作世界模型,旨在提升机器人在复杂环境下的操作能力。该模型将策略学习、视频预测和动作评估整合到一个框架中,通过共享的视频扩散基础架构,实现对未来视觉信息的预测和动作评估。
$\tau_0$-WM包含两个关键模块:一个视频-动作模型,能够根据多视角观察、语言指令和机器人状态,联合预测未来的视觉信息和连续动作;另一个动作条件视频模拟器,可以将候选动作转化为多视角未来场景,并预测任务进展度。该模型在约27300小时的真实机器人远程操作数据、人本交互视频和轨迹数据上进行训练,并利用特定模态的监督掩码。在推理阶段,$\tau_0$-WM通过计算、采样和重新降噪等技术,对候选动作进行排序和优化。
在长周期、精细操作任务中,$\tau_0$-WM表现优于现有模型。这项技术有望推动机器人技术在制造业、物流等领域的应用,实现更高效、更灵活的自动化解决方案。
28
场景图助力:提升机器人模仿学习的空间和时间感知
embodiedgeneral_robotics
**利用场景图提升机器人模仿学习的感知能力**
研究人员提出了一种新的机器人模仿学习方法,通过使用场景图作为显式且结构化的记忆机制,显著提升了机器人在复杂环境中的任务执行能力。该方法构建动态场景图,捕捉物体之间的关系及其随时间的变化,使机器人能够保留相关历史信息,从而更有效地推理和处理不断更新的场景信息。
实验结果表明,该方法在模拟移动操作和真实桌面操作环境中均表现出卓越的性能,尤其是在需要长期推理和在部分观察条件下实现鲁棒泛化的场景中。
这项技术突破有望推动自动导引车(AGV)、自主移动机器人(AMR)等在家庭、办公室等复杂环境中的应用,并为具身智能(embodied intelligence)和具身AI(embodied AI)的发展提供新的思路。该技术在提升协作机器人(cobot)的灵巧性(dexterous)和操作(manipulation)能力方面具有重要意义,未来可能应用于更广泛的工业自动化和智能服务领域。
65
轮腿机器人:单球到多球运动控制新方法
humanoidgeneral_robotics
研究团队提出轮足机器人多球体运输新方法S2M-Trek,通过Per-Frame Deep Sets(PFDS)解决多球体无序排列的对称性难题。在模拟中,该方法实现五球体100%无掉落运输(5个随机种子均达标),相较传统方法运输能力提升300%。这项突破为复杂动态场景下的具身智能提供了新范式,推动机器人从单任务操作向多物体协同控制演进。