Figure AI发布Index数据集,以众包模式采集人类操作数据训练机器人,直指劳动力市场重构。该数据集涵盖家庭、仓储、零售等场景的远程操作数据,规模达百万级,配合其Helix视觉-语言-动作模型,使机器人能通过模仿学习掌握复杂操作技能。Figure AI已部署数百台人形机器人于宝马、亚马逊等工厂,Index将加速其从单一任务向通用操作能力跃迁。此举被视为具身智能领域的数据基建竞赛信号——当数据规模成为瓶颈,众包或成解锁通用机器人的关键路径。
Figure AI发布Index数据集,以众包模式采集人类操作数据训练机器人,直指劳动力市场重构。该数据集涵盖家庭、仓储、零售等场景的远程操作数据,规模达百万级,配合其Helix视觉-语言-动作模型,使机器人能通过模仿学习掌握复杂操作技能。Figure AI已部署数百台人形机器人于宝马、亚马逊等工厂,Index将加速其从单一任务向通用操作能力跃迁。此举被视为具身智能领域的数据基建竞赛信号——当数据规模成为瓶颈,众包或成解锁通用机器人的关键路径。
宇树科技上市后股价暴跌45%,引发市场对中国机器人行业泡沫化的担忧。这家以四足机器人和人形机器人闻名的公司,此前估值一度飙升至百亿美元级别,但IPO后的市场表现却急转直下。
技术层面,宇树在运动控制算法和关节电机等核心部件上确有突破,其H1人形机器人已实现复杂地形行走和稳定抓取,但商业化落地速度远不及估值膨胀节奏。招股书显示,公司营收仍高度依赖科研机构和演示项目,工业场景批量应用尚需时日。
此次股价回调被视为行业理性回归的信号。过去两年,中国具身智能赛道涌入超百亿元资本,催生多家独角兽,但多数企业仍停留在原型机阶段。宇树的估值波动警示:基础模型、仿真到现实迁移等关键技术尚未成熟前,资本狂热可能透支产业未来。长期看,具备真实场景数据积累和端到端技术闭环的公司,才能在泡沫退去后胜出。
更快、更强、(偶尔)直立:人形机器人在北京赛场上竞技。近日,一场人形机器人运动会引发关注,参赛机器人展示了双足行走、奔跑乃至跌倒后自行爬起的能力。尽管部分机器人在比赛中摔倒,但整体运动控制与平衡算法取得显著进展。
本次赛事聚焦具身智能核心技术,包括强化学习、模仿学习及仿真到现实迁移。多家参赛团队采用端到端视觉-语言-动作模型,使机器人能根据环境指令实时调整步态。关键性能数据显示,顶尖机器人最高奔跑速度达每小时7公里,可连续运行超过2小时,抓取成功率提升至95%。
业内分析认为,这类竞赛正加速人形机器人从实验室走向商业落地。目前,全球人形机器人市场预计到2030年将突破150亿美元,物流、制造及服务业成为主要应用场景。此次北京赛事不仅展示了技术成熟度,也标志着中国在具身智能赛道上的竞争进入新阶段。
东京大学孵化的物理AI企业commissure推出面向企业的“物理AI研修”课程,教授人形机器人与协作机器人的导入决策方法。课程覆盖VLA、世界模型、sim-to-real等关键技术,帮助企业在不盲目采购的前提下评估机器人落地场景。此举直击当前具身智能商业化中“技术热、落地难”的痛点,为行业提供了从技术认知到采购判断的中间层服务。
物流机器人公司Geek+(极智嘉)在“国际物流综合展2026”上首次于日本展出通用人形机器人“Gino”,并披露四款物流机器人产品。Gino采用端到端视觉-语言-动作模型(VLA),结合模仿学习与强化学习,支持双足运动与灵巧抓取。此举将人形机器人引入仓储场景,与现有AMR(自主移动机器人)形成互补,推动具身智能在物流领域的落地。
工业机器人部署端到端视觉-语言-动作策略时,观测、推理与执行延迟造成的“观测-执行间隙”常被忽视。2月15日提交的arXiv论文提出一套延迟感知框架,通过延迟校准多模态感知、统一通信管道及远程操作界面,为策略预测的动作序列打时间戳,仅调度时间上可行的动作,实现异步推理与执行,无需改动策略架构。在接触密集装配任务中,推理延迟100-500毫秒下,任务时长与运动平滑度分别保持在演示参考的13%和9%以内,优于阻塞式执行的延迟降速和朴素异步执行的大接触力超调。这意味着具身智能策略在真实工业场景落地时,系统级时序设计比单纯改进模型更能决定部署成败。
具身智能正从实验室走向工业现场,核心趋势是让机器人同时具备“大脑”与“身体”。与单纯押注人形机器人不同,行业更关注将基础模型、世界模型与强化学习、模仿学习结合,提升双足运动控制、灵巧抓取等能力。端到端视觉-语言-动作模型(VLA)与仿真到现实(sim-to-real)技术缩短了训练周期,而自动导引车(AGV)与自主移动机器人(AMR)的普及,使即时定位与地图构建(SLAM)成为标配。这意味着,机器人竞争焦点已从单一算法转向软硬件协同的具身AI系统,协作机器人与远程操作技术正加速落地,推动制造业、物流业从自动化迈向智能化。
PEAfowl是一种面向双臂操作任务的多视角视觉-语言-动作(VLA)模型,通过逐像素深度分布预测与可微3D提升构建跨视角空间表征,并以Perceiver式文本感知读取替代全局语言条件,提升指令接地精度。在RoboTwin 2.0域随机化测试中,PEAfowl相较最强基线成功率提升23.0个百分点,真实机器人实验亦验证其性能。该方案支持训练时深度蒸馏,在不增加推理开销的前提下利用预训练深度先验,缓解了RGB-D传感器噪声问题。对具身智能行业而言,PEAfowl展示了多视角几何信息与语言条件精细化注入对提升VLA策略在杂乱场景下鲁棒性的直接价值,为双臂操作基础模型提供了可复现的技术路径。
南京理工大学团队提出VFMM3D框架,利用视觉基础模型生成前景感知的伪激光雷达点云,用于单目3D物体检测。该方法结合Depth Anything Model的深度先验与Segment Anything Model的前景先验,通过伪激光雷达着色操作强化物体结构、抑制背景噪声,并引入稀疏化策略降低计算开销。在KITTI和Waymo数据集上,VFMM3D均刷新SOTA成绩,且能无缝集成到多种基于激光雷达的3D检测器中。这表明视觉基础模型可显著提升单目3D检测的精度与泛化性,为低成本自动驾驶感知方案提供了新路径。
Generalist(通用机器人初创公司)再获2亿美元融资,由现有投资方领投,累计融资额超3亿美元。该公司主攻具身智能基础模型,将视觉-语言-动作模型(VLA)与强化学习结合,用于双足人形机器人的运动控制和灵巧抓取。新资金将用于扩大数据采集规模,包括远程操作和仿真到现实(sim-to-real)数据。此举表明资本正加速押注端到端具身智能路线,而非传统模块化方案,行业竞争将从硬件转向数据与模型能力。
波士顿动力(Boston Dynamics)为电动Atlas人形机器人加装头部,以提升人机交互的自然度。新头部集成传感器与屏幕,可显示表情和状态信息,配合全身运动控制增强沟通意图。此举将Atlas从纯运动能力展示转向协作场景,反映人形机器人设计正从功能优先转向社交适配,为工厂、家庭等人类共存环境中的部署铺路。
RoboStrategy CEO公开断言,人形机器人赛道的领跑者并非特斯拉,而是Figure AI。该判断基于Figure AI在端到端视觉-语言-动作模型(VLA)与商业化进度上的优势,其已进入宝马工厂试点。相比之下,特斯拉Optimus仍停留在内部测试阶段。这一表态直接冲击市场对特斯拉的估值预期,并提示投资者:具身智能的竞争焦点正从硬件参数转向基础模型的数据闭环与真实场景部署能力。
波士顿动力(Boston Dynamics)发布人形机器人Atlas全电动版本,取代此前液压驱动设计,并展示其自主抓取与运动控制能力。新Atlas采用端到端强化学习训练,能在仿真到现实(sim-to-real)环境中完成搬运任务,关节扭矩与灵活性显著提升。该公司同时将Spot机械狗扩展至工业巡检场景,搭载SLAM导航与远程操作接口。此举表明具身智能正从实验室走向工厂,但商业化仍受限于电池续航与复杂环境泛化,行业需在基础模型与硬件成本间找到平衡。
人形机器人竞争进入“现实战争”阶段:美国押注大脑与平台,中国主攻量产与出口。Figure、特斯拉(Tesla)等美企聚焦VLA模型与基础平台,而宇树、优必选等中国厂商已实现双足机器人规模化出货,价格下探至数万美元级。双方技术路线分化——美方强调端到端模仿学习与仿真到现实迁移,中方侧重运动控制与灵巧操作的工程化落地。这场竞赛将决定具身智能的产业主导权,但短期看,量产能力比算法突破更能撬动供应链与市场格局。
日本“Initial AI Expo 2026”展会聚焦AI从“导入”转向“实装”,展出搭载物理AI的人形机器人、3D AI化身等前沿技术。现场演示了双足运动控制、灵巧抓取及端到端视觉-语言-动作模型(VLA)在真实场景中的应用,强调仿真到现实(sim-to-real)迁移与强化学习在工业操作中的落地。这标志着具身智能正从实验室走向工厂与服务业,基础模型与远程操作结合将加速协作机器人(cobot)的实用化进程。
中联重科(Zoomlion)在2026年世界机器人会议上发布人形机器人Z01与具身智能系统ZBrain。Z01具备双足运动与灵巧抓取能力,ZBrain整合视觉-语言-动作(VLA)模型与即时定位与地图构建(SLAM)技术,支持端到端操作。该系统将仿真到现实(sim-to-real)训练与强化学习结合,应用于复杂工业场景。此举标志工程机械巨头切入具身智能赛道,推动人形机器人从实验室走向工地等垂直领域落地。
韩国政府启动“国家代表级人形机器人”选拔计划,面向国内开发的机器人进行公开招募,被视为“独破帽”AI基础模型项目的机器人版本。该计划旨在筛选出具备顶尖技术实力的本土人形机器人,推动具身智能产业发展。此举意味着韩国正将人形机器人提升至国家战略高度,通过政府背书加速技术商业化,并强化本土供应链在运动控制、操作等核心环节的竞争力。
NEC旗下基金投资美国Dexmate,后者提供人形机器人VEGA及物理AI平台。VEGA采用双足设计,结合视觉-语言-动作模型(VLA)与端到端模仿学习,实现灵巧抓取与运动控制。资金将用于加速仿真到现实(sim-to-real)技术落地。此举标志NEC切入具身智能赛道,推动基础模型在工业场景的实用化。
德国团队提出GuideFetch框架,用于协调导盲机器狗与取物机器人的并发任务。该框架用大语言模型生成四动作调度方案,并通过确定性校验确保规则合规。在360次仿真中,并行协议将任务完成时间缩短41.3%,且32个违规变体全部被拒。这表明具身智能系统可通过高层调度与状态校验,实现异构机器人的可靠协同,而非依赖端到端模型。
GigaBrain-WBC-0.5首次将行为世界模型(BWM)用于人形机器人全身控制,让执行网络同时预测动作、状态和潜在行为命令分布,而非仅做反应式跟踪。其自动地形标注管线能从重定向动作中恢复完整3D接触几何,使地形数据规模与现有动作数据集相当。在四类测试中,该模型地形交互成功率81.3%(为最强基线4.3倍)、跌倒恢复99.3%(16.8倍),且Unitree G1检查点经简单微调可迁移至Maker L01。这意味着人形机器人不再依赖扩大参考动作库来应对复杂地形,而是让策略自身理解环境如何塑造可行行为,为端到端具身智能在非结构化场景落地提供了新路径。