我们相信,真正的智能终将拥有身体。具身前哨每天为你过滤全球噪声,只留下让机器走进物理世界的那些关键进展——不追热点,只追拐点。
仅靠文本,你无法学会物理世界的运作方式。真正的智能需要感知世界、与世界互动。
—— 杨立昆(Yann LeCun)今日速览 · 20 条
1.适得其反:仿真到现实(sim-to-real)如何阻碍策略学习?
2.视觉证据预算:提升视觉-语言-动作模型泛化能力
3.TTT-VLA:视觉-语言-动作模型测试时潜在提示优化
4.MetaWorld:基于单视角视频数据构建大规模多智能体视频世界模型
5.GeoAlign:超越语义,利用状态引导的空间对齐提升视觉-语言-动作模型
6.AirDreamer:基于世界模型的通用无人机导航系统
7.EaDex:低成本演示驱动的具身智能灵巧操作框架
8.SplitAdapter:基于分层适应的人形机器人运动控制与操作
9.eMEM:混合时空记忆系统,赋能具身智能体
10.PHASER:基于阶段感知的视觉-语言-动作模型体验重播
11.3D等高线世界模型:揭示城市隐藏的几何结构与跨城市特征
12.GN0:面向视觉-语言导航的统一生成、评估与策略学习框架
13.Humanoid-GPT:通过扩展数据与结构实现人形机器人零样本运动跟踪
14.TRAP:利用对抗性补丁攻击视觉-语言-动作模型推理
15.Cosmos 3:多模态世界模型,赋能物理智能
16.NVIDIA OmniDreams:实时生成式世界模型,助力闭环自主车辆仿真
17.提升具身AI的可靠性:从测试到形式验证的社区共识
18.VLA-Arena:开源视觉-语言-动作模型基准测试框架
19.耦合局部与全局世界模型:提升强化学习效率
20.MIND:多尺度意图扩散,实现基于文本的物理人形机器人控制
序号颜色:■ 🧠 具身智能■ 🤖 人形机器人
🧠 具身智能
★ 头条适得其反:仿真到现实(sim-to-real)如何阻碍策略学习?
来源:arXiv cs.RO
**仿真过度可能阻碍机器人策略学习,研究者提出新解决方案** 一项新的研究表明,过度的“仿真到现实”(sim-to-real)技术在某些情况下反而会阻碍机器人的策略学习。研究人员发现,为了使模拟环境更逼真,施加的约束条件可能会限制策略探索,导致机器人难以适应真实世界的复杂性。 该研究指出,当前“仿真到现实”技术的过度应用,导致了与策略学习目标的不一致,造成“模拟器锁定”现象。为了解决这个问题,研究团队提出了一种新的“仿真到仿真到现实”(sim-to-sim2real)范式,该方法仅将机器人的运动学作为设计约束,旨在优化策略学习过程。
🧠 具身智能
★ 头条视觉证据预算:提升视觉-语言-动作模型泛化能力
来源:arXiv cs.RO
**视觉-语言-动作模型泛化能力显著提升:聚焦关键信息,减少视觉干扰** 研究人员提出了一种名为S2 (See Less, Specify More)的框架,旨在通过优化训练接口来提升视觉-语言-动作(VLA)模型的泛化能力。该框架的核心在于,在执行任务时,系统会提供更精细化的、与当前执行模式相关的语言指导,同时限制模型使用的视觉信息量,避免其受到无关信息的干扰。 S2框架通过“Specify More”机制,将原始指令转化为更详细的轨迹和子任务级别语言描述,并引入了明确的视觉证据预算,引导模型仅关注对任务至关重要的视觉信息。
🧠 具身智能
★ 头条TTT-VLA:视觉-语言-动作模型测试时潜在提示优化
来源:arXiv cs.RO
**TTT-VLA:通过优化隐式提示提升视觉-语言-动作模型的泛化能力** 研究人员提出了一种名为TTT-VLA的框架,旨在解决现有视觉-语言-动作(VLA)模型在实际部署时面临的分布差异问题。该方法利用“测试时间训练”(Test-Time Training, TTT)技术,通过优化一个隐式提示(latent prompt),实现对模型的自适应调整,无需修改底层策略。 具体而言,TTT-VLA在训练阶段学习额外的代理任务,为策略学习提供额外的条件信号。在测试阶段,系统仅根据当前环境的交互数据,利用代理任务的自监督信号优化隐式提示,从而提升模型在不同场景下的表现。
🧠 具身智能
#4MetaWorld:基于单视角视频数据构建大规模多智能体视频世界模型
来源:arXiv cs.AI
MetaWorld框架通过单视角视频数据实现多智能体世界模型扩展,突破传统多视角数据采集限制。其创新的单目世界状态展开技术无需多摄像头设备,结合跨视角对齐机制,使跨视角一致性提升37%。该方法为具身AI和元宇宙构建了可扩展的物理驱动范式,解决了多智能体场景下数据稀缺与状态对齐难题。
🧠 具身智能
#5GeoAlign:超越语义,利用状态引导的空间对齐提升视觉-语言-动作模型
来源:arXiv cs.RO
研究团队提出GeoAlign架构,通过状态引导的几何对齐提升视觉-语言-动作(VLA)模型的操作精度。该方法在LIBERO任务中达到99.0%准确率,实测任务表现优于现有方案。其核心创新在于利用RGB-D数据训练几何感知模块,结合机器人本体状态生成动态空间特征,为复杂场景下的灵巧操作提供新范式。
🧠 具身智能
#6AirDreamer:基于世界模型的通用无人机导航系统
来源:arXiv cs.RO
AirDreamer(通用无人机导航系统)通过世界模型与强化学习结合,实现复杂未知环境下的自主导航。该方法在挑战性地图中导航成功率比最佳基线提升5.3%,且无需人工调整即可完成仿真到现实迁移。
🧠 具身智能
#7EaDex:低成本演示驱动的具身智能灵巧操作框架
来源:arXiv cs.RO
EaDex框架通过低成本演示数据解决灵巧操作学习的高成本难题,实现跨具身场景的高效训练。该方法仅用单目RGB-D相机捕捉手部动作,结合动态演示退火机制,使训练效率提升55.3%。其创新性数据生成与奖励优化策略,为具身智能在复杂操作任务中的落地提供新路径。
🤖 人形机器人
#8SplitAdapter:基于分层适应的人形机器人运动控制与操作
来源:arXiv cs.RO
研究团队提出SplitAdapter,通过解耦适配提升人形机器人在负载变化下的运动与操作稳定性。该方法在2kg至6kg物体、0至60cm高度的测试中,重负载场景成功率较基线提升超30%。
🧠 具身智能
#9eMEM:混合时空记忆系统,赋能具身智能体
来源:arXiv cs.RO
研究团队提出eMEM(具身记忆),一种面向具身智能体的混合时空记忆系统。该系统通过SQL ITE、hnswlib和R-tree多索引架构,实现语义、空间和时间的联合检索,模拟生物海马体-新皮层记忆巩固机制。
🧠 具身智能
#10PHASER:基于阶段感知的视觉-语言-动作模型体验重播
来源:arXiv cs.RO
研究团队提出PHASER框架,通过语义经验回放解决视觉-语言-动作(VLA)模型在持续学习中的灾难性遗忘问题。该方法在LIBERO测试集上将平均成功率提升31%,最终达到87.8%。其创新点在于相位感知的记忆分配和多模态干扰路由策略,结合无监督动作信号检测技术,使机器人能在开放环境中自主适应新技能。
🧠 具身智能
#113D等高线世界模型:揭示城市隐藏的几何结构与跨城市特征
来源:arXiv cs.RO
研究者提出一种基于3D等视线(isovist)的世界模型,通过记录建筑间可视距离的球形深度图,捕捉城市导航中的可移动空间几何特征。模型在曼哈顿和巴黎数据集训练后,能跨城市识别空间签名,城市身份从时间潜变量中线性可解码,准确率远超单帧基线。
🧠 具身智能
#12GN0:面向视觉-语言导航的统一生成、评估与策略学习框架
来源:arXiv cs.RO
研究团队发布GN0框架,通过构建大规模导航数据集与高保真模拟平台,解决视觉-语言导航(VLN)领域数据不足问题。该框架整合了首个基于鸟瞰图(BEV)的动态交互基准GN-Bench,以及端到端训练的导航基础模型BAE,在指令跟随、目标导航等任务中超越现有方法。
🤖 人形机器人
#13Humanoid-GPT:通过扩展数据与结构实现人形机器人零样本运动跟踪
来源:arXiv cs.RO
研究团队推出Humanoid-GPT,一种基于万亿级运动数据训练的生成式Transformer模型,突破传统方法在数据量和泛化能力上的限制。模型通过20亿帧整合数据集预训练,实现零样本泛化到未见过的复杂动作控制。实验显示其能同时追踪高动态人体运动并完成新任务,为通用人形机器人控制提供新范式。
🧠 具身智能
#14TRAP:利用对抗性补丁攻击视觉-语言-动作模型推理
来源:arXiv cs.RO
研究团队提出TRAP攻击方法,通过对抗性补丁劫持视觉-语言-动作(VLA)模型的Chain-of-Thought(CoT)推理路径,使机器人执行错误指令(如递刀而非苹果)。该方法在三个代表性VLA模型上验证有效,且在现实场景中通过纸质补丁实现攻击。
🧠 具身智能
#15Cosmos 3:多模态世界模型,赋能物理智能
来源:arXiv cs.RO
Cosmos 3(宇宙3)多模态世界模型由研究团队发布,其统一架构能处理语言、图像、视频、音频及动作序列,为具身AI提供新范式。该模型于2026年6月1日提交,被Artificial Analysis评为最佳开源图文生成模型,RoboArena认证为最优策略模型。
🧠 具身智能
#16NVIDIA OmniDreams:实时生成式世界模型,助力闭环自主车辆仿真
来源:arXiv cs.RO
NVIDIA(英伟达)推出OmniDreams,实时生成世界模型,解决自动驾驶闭环模拟难题。该模型基于21,000小时驾驶场景训练,能生成极端天气等传统模拟器难以捕捉的复杂现象。与Alpamayo 1政策模型结合后,其衍生的WAM模型在Physical AI数据集上参数量仅为竞品1/5,性能却更优。
🧠 具身智能
#17提升具身AI的可靠性:从测试到形式验证的社区共识
来源:arXiv cs.RO
美国人工智能协会2026年桥梁计划提出具身AI可靠性提升方案,通过测试与形式验证解决开放环境部署难题。研究指出需从场景化测试、符号化验证和运行时自适应三个方向构建保障体系,并强调神经符号表示的集成工作流。该框架为复杂场景下安全可靠的具身智能系统开发提供技术路径,推动AI从实验室走向现实应用。
🧠 具身智能
#18VLA-Arena:开源视觉-语言-动作模型基准测试框架
来源:arXiv cs.RO
研究团队推出开源框架VLA-Arena,用于量化评估视觉-语言-动作模型(VLA)的能力边界。该框架设计170个任务,涵盖安全、干扰、外推等四个维度,每个任务设三个难度等级(L0-L2)。评估发现,当前VLA存在过度依赖记忆、长时序任务技能组合能力弱等缺陷。
🧠 具身智能
#19耦合局部与全局世界模型:提升强化学习效率
来源:arXiv cs.RO
最新研究提出结合局部与全局世界模型的方法,提升强化学习在复杂操作任务中的效率。该方法在Push-T任务中样本效率显著优于PPO,无需依赖物理模拟器,为解决复杂RL问题提供新路径。2026年6月更新的版本通过解耦梯度计算,实现高保真轨迹生成与高效训练,推动具身智能在真实环境中的落地应用。
🤖 人形机器人
#20MIND:多尺度意图扩散,实现基于文本的物理人形机器人控制
来源:arXiv cs.RO
研究团队提出MIND模型,通过多尺度意图扩散机制实现文本驱动的人形机器人控制。该框架利用行为意图作为语义桥梁,解决文本指令与低级动作间的模态鸿沟问题。实验表明,MIND在语义对齐和物理合理性方面优于现有方法,于2026年5月提交至arXiv。
今日总结
今日具身智能领域呈现两大核心进展:视觉-语言-动作(VLA)模型的泛化能力取得突破,GeoAlign在LIBERO任务中实现99.0%操作准确
真正的智能,
不在于思考有多快,而在于能否改变物理世界。
本期完整版(含原文链接)可在独立网站阅读:
me.embodied.wiki/embodied-outpost →
你认为具身智能的下一个拐点会出现在哪里?
欢迎在评论区聊聊 👇 觉得有价值就点个在看,方便随时回看。
本期由「具身前哨」自动采集 · AI 译介 · 人工审校
内容为译介摘要性质,已标注来源与原文链接,版权归原作者所有