1头条
基于仿生信号的共享自主假肢抓取:仿真学习助力实现
embodied
来源:arXiv cs.RO ·
原文链接 ⚠状态 0**基于仿真的模仿学习助力无生物信号共享自主假肢抓取**
研究人员开发了一种可扩展的仿真框架,用于生成多样化的“触及-抓取”演示数据,旨在实现无需肌电图(EMG)等生理信号的共享自主控制的上肢假肢手部操作。该框架通过虚拟摄像头记录腕部视角、本体感觉信息和动作,构建大规模演示数据集,并结合物理可行的抓取合成、自然触及轨迹重定向以及在程序化生成的室内环境中执行“触及-抓取-抬升”动作。
实验结果表明,仿真生成的数据集足够丰富且一致,能够有效训练策略模型。在三种真实场景下,该方法实现的“仿真到现实”(sim-to-real)策略的抓取成功率超过90%,优于现有基线方法,并表现出更强的泛化能力。
这项技术有望推动无生物信号共享自主假肢的发展,为截肢患者提供更加自然、低负担的操作体验,降低开发成本,加速相关产品的商业化进程。 演示数据已公开。
2头条
基于层次结构的强化学习:提升四足机器人的操作能力
humanoid
来源:arXiv cs.RO ·
原文链接 ⚠状态 0**四足机器人抓取能力迎来突破:基于“可利用性”的强化学习框架**
研究人员提出了一种新的三层级强化学习(RL)框架,旨在提升四足机器人在物体操作方面的能力。该框架利用“可利用性”(affordance)的概念,指导导航策略和运动控制策略,并根据目标物体的交互点“可利用性”来规划抓取动作,从而实现无需预设轨迹的自主操作。
研究团队在IsaacSim仿真环境中训练了该框架,并在模拟环境和真实场景中进行了评估。实验结果表明,该框架能够自主识别合适的姿态,并在实际环境中成功执行物体操作任务,无需人工干预。
这项技术有望推动四足机器人应用到更广泛的领域,例如物流、农业等,并为开发更具灵巧性和适应性的具身智能(embodied intelligence)系统奠定基础。
3头条
LARA:视觉-语言-动作模型中的潜在动作表示对齐
embodied
来源:arXiv cs.RO ·
原文链接 ⚠状态 0**LARA:视觉-语言-动作模型的新突破,助力机器人理解与执行指令**
研究人员提出了一种名为LARA(Latent Action Representation Alignment)的全新框架,旨在提升视觉-语言-动作(VLA)模型的性能。传统VLA模型依赖大量高质量数据进行训练,但现实中此类数据的获取成本高昂。LARA通过联合优化潜在动作表示模型(LAM)和VLA模型,实现两者之间的协同进化。
具体而言,LARA利用LAM从视频动态中学习潜在的动作表示,并将其作为额外监督信号用于VLA模型的训练。该框架实现了“双向”优势:LAM能够根据实际的运动轨迹进行学习,避免因视觉变化带来的干扰;而VLA模型则可以通过LAM中的前向动力学知识进行约束,减少生成无效轨迹的风险。实验结果表明,LARA在三个仿真环境和一套精心设计的真实机器人操作基准测试中,分别实现了约10%、5%和15%的性能提升。
这项技术有望加速具身AI(embodied AI)的发展,并为自动导引车(AGV)、自主移动机器人(AMR)以及人形机器人(humanoid)等应用带来更可靠、高效的指令执行能力,从而推动智能制造和服务的智能化升级。
4
基础模型在机器人领域的应用:从统一的MDP视角看仿真与现实差距
embodied
来源:arXiv cs.AI ·
原文链接 ⚠状态 0一篇论文提出从马尔可夫决策过程视角统一解决基础模型代理的仿真到现实差距问题,引发具身AI领域关注。论文于2026年6月5日提交,将观察、动作、转移和奖励四要素纳入经典框架,通过多语言工具调用案例揭示感知空间差距导致操作失效的隐患。该研究推动建立统一评估体系,为高可靠性现实应用提供标准化基准,有望加速基础模型从仿真到真实场景的落地进程。
5
ActQuant:基于动作引导量化的视觉-语言-动作模型优化技术
embodied
来源:arXiv cs.AI ·
原文链接 ⚠状态 0ActQuant提出一种亚4位动作引导量化方法,解决视觉-语言-动作(VLA)模型在边缘设备部署难题。该框架通过跨张量位分配和张内尺度优化,在真实6自由度UR3机械臂测试中,将模型内存从14.3GB压缩至2.7GB(5.3倍压缩),同时保持OpenVLA-OFT基准95.0%准确率。其工具链支持模型原生转换,推动具身AI在低算力场景落地。
6
OPTIMUS-Prime:深度视觉模型的简洁概念解释框架
humanoid
来源:arXiv cs.CV (Computer Vision) ·
原文链接 ⚠状态 0研究者提出OPTIMUS框架,解决视觉模型解释的理论与实践差距。该方法基于prime implicants理论生成热图,兼具用户可解释性与形式保证,满足充分性与最小性双重特性。在视觉分类基准测试中验证有效,显著提升模型决策透明度,为可解释AI(XAI)提供新方向。
7
流式视频生成与流式力控制技术研究
embodied
来源:arXiv cs.CV (Computer Vision) ·
原文链接 ⚠状态 0StreamForce框架通过连续力输入实现物理基础控制,突破传统视频生成模型的局限。该模型在单GPU上运行速度达16.6 FPS,力控制精度和运动真实感均达到行业领先水平。其统一的力表示方法与蒸馏流水线设计,解决了先前模型对固定力假设和非因果处理的依赖问题,为动态场景生成提供了新范式。
8
多模态世界模型:为具身智能体构建听觉-视觉想象能力
embodied
来源:arXiv cs.CV (Computer Vision) ·
原文链接 ⚠状态 0研究团队提出音频-视觉世界模型(AVWM),首次整合多模态感知提升具身智能。该模型基于包含30小时双耳音视频数据的AVW-4k基准,实验证明其在复杂环境导航中优于传统视觉模型。通过三阶段训练策略,AV-CDiT模型实现视听模态的高保真预测,为仿真到现实的具身AI提供新范式。
9
表征涌现理论:解释不足如何驱动表征学习和世界模型构建
embodied
来源:arXiv cs.LG (Machine Learning) ·
原文链接 ⚠状态 0一项新研究提出表征涌现的‘引导理论’,揭示当现有模型无法解释现象时,会驱动新表征的产生。该理论通过五阶段模型(稳定观察→异常检测→解释不足→表征涌现→临时稳定)解释AI系统如何突破自身认知边界。研究指出,未来AI需具备检测自身表征局限性的机制,这对世界模型、基础模型等技术发展具有指导意义。
10
DOPPLER:双策略学习,优化异步数据流图中的设备分配
embodied
来源:arXiv cs.LG (Machine Learning) ·
原文链接 ⚠状态 0研究团队提出DOPPLER框架,通过双策略网络优化异步数据流图中的设备分配,显著降低系统执行时间。实验表明,该方法在复杂机器学习任务中比基线方法减少执行时间达30%,同时提升采样效率,缩短单次训练时间。其创新性在于结合选择策略(SEL)与放置策略(PLC),突破传统强化学习对同步系统的依赖,为异步计算优化提供新思路。
11
面向6G的智能世界模型:实现近实时生成状态空间推理
embodied
来源:arXiv cs.LG (Machine Learning) ·
原文链接 ⚠状态 0研究者提出基于具身智能的6G网络控制模型,通过模拟未来场景优化资源分配,提升网络效率。该模型在真实O-RAN数据上,将预测误差降低1.69%,参数减少32%,推理速度提升2.3-4.1倍,为6G实现高精度、低延迟的动态资源管理提供新方法。
12
几何感知长程灵巧操作框架:面向机器人操作的层次式RL-MPC
embodied
来源:arXiv cs.RO ·
原文链接 ⚠状态 0研究团队提出分层RL-MPC框架,解决灵巧操作中几何感知与接触动力学联合推理难题。该方法通过高阶策略规划接触位置,低阶控制器实时优化动作,使数据需求降低10倍,实现零样本仿真到现实迁移。实验显示其在非抓取任务中成功率显著提升,为复杂操作场景提供新方案。
13
SERNF:动作分块策略优化,提升真实环境下机器人灵巧操作效率
embodied
来源:arXiv cs.RO ·
原文链接 ⚠状态 0研究团队提出SERNF框架,通过动作分块和归一化流技术,提升灵巧操作策略在真实世界的微调效率。该方法首次在真实机器人硬件上结合基于似然的多模态生成策略与分块级价值学习,解决传统方法在样本效率和多模态动作分布上的瓶颈。实验显示,SERNF在切割胶带和掌心旋转立方体等任务中实现稳定适应,较标准方法提升显著。
14
超越搜索的潜在几何信息:世界模型中的路径规划优化
embodied
来源:arXiv cs.RO ·
原文链接 ⚠状态 0研究团队提出通过结构化潜在空间优化规划的新方法,在预训练世界模型中实现规划过程的分摊。实验显示,其提出的GC-IDM模型在四个基准环境中,相较传统方法将每决策成本降低100-130倍,且在七种场景中表现优于或等于基线。该成果表明,足够结构化的潜在空间能将规划负担从在线优化转移至学习推理,为高效机器人控制提供新思路。
15
X-OP:跨形态全身远程操作与MPC重定向
embodied
来源:arXiv cs.RO ·
原文链接 ⚠状态 0研究人员提出X-OP框架,通过单个扩展现实(XR)设备实现跨形态全身遥操作。该框架采用基于模型预测控制(MPC)的运动重定向器,联合优化操作者意图与机器人动态可行性,无需针对不同机器人重新训练策略。仿真显示,在人形机器人全身控制任务中,完成时间降低超30%,成功率提升20%。系统还集成SLAM全局位姿反馈以抑制长期漂移。
16
PRISM:先验引导的世界模型想象力采样
embodied
来源:arXiv cs.RO ·
原文链接 ⚠状态 0研究人员推出PRISM框架,从世界模型自身学习动作先验以指导规划采样。该方法在标准JEPA潜空间世界模型的冻结编码器上附加轻量MLP,预测状态条件高斯先验,并通过精度加权的产品高斯更新融合到规划器采样分布中。PRISM无需独立视觉编码器或大语言模型,保持架构简洁,同时提升连续控制任务中的规划效率。
17
Q-VGM:Q值引导的价值梯度匹配实现流匹配VLA策略
embodied
来源:arXiv cs.RO ·
原文链接 ⚠状态 0研究人员提出Q-VGM离线强化学习方法,用于微调流匹配视觉-语言-动作(VLA)策略。该方法利用VGG-Flow将价值梯度转化为去噪时间步上的梯度场,避免反向传播整个去噪链或计算动作似然。Q-VGM在固定回放缓冲区上运行,通过动作敏感的Cal-QL集成批评家,高效利用一阶价值梯度信息改进流策略。
18
EgoAERO:单段第一人称视频学习灵巧操作,无需真实数据
embodied
来源:arXiv cs.RO ·
原文链接 ⚠状态 0研究人员发布EgoAERO框架,首次实现从单段第一人称RGB-D视频学习灵巧操作,无需预扫描物体资产。系统通过无资产物体追踪与重建、自我运动补偿和自适应接触优化重建接触一致的手-物轨迹,再经两阶段残差学习转化为机器人策略。团队构建了包含430万帧的EgoDex-R数据集,实验表明单次演示即可达到接近CAD重建方法的性能。
19
vla.cpp:视觉-语言-动作模型的统一推理运行时
embodied
来源:arXiv cs.RO ·
原文链接 ⚠状态 0研究人员发布vla.cpp,首个基于llama.cpp的便携C++推理运行时,原生支持流匹配和扩散VLA模型推理。该引擎统一服务7种架构(5种骨干网络+4种动作头),在LIBERO-Object上以200轮测试仅差1轮匹配顶尖模型,运行BitVLA仅需1.3 GiB内存且成功率100%。通过IMMA阶梯GEMM优化,BitVLA每步延迟降低4.5倍,支持从消费级GPU到8GB嵌入式模块的三级硬件。
20
Open-H-Embodiment:用于医疗机器人基础模型的大规模数据集
industrialgeneral_robotics
来源:arXiv cs.RO ·
原文链接 ⚠状态 0某团队发布名为Open-H-Embodiment的医疗机器人数据集,覆盖50余家机构及多款手术机器人,解决基础模型训练数据不足问题。其构建的GR00T-H模型在缝合任务中实现25%成功率(其他模型为0%),Cosmos-H-Surgical-Simulator可跨九种机器人平台进行手术模拟。该数据集为医疗机器人具身智能发展提供关键基础设施,推动手术操作精度与自主学习能力提升。