1、具身智能科技前瞻探索(第2期)报告要点人形机器人已成为中国硬科技的新名片,在国际舞台大放异彩,但受限于大脑能力及量产成本等因素,距大规模应用仍有显著差距。把握产业脉络,需紧跟一线技术动态,国泰海通产业团队推出具身智能科技前瞻探索系列研究,跟踪学术前沿解读最新论文成果,为产业发展和投资决策提供最前瞻视角。本期科技前瞻探索摘录来自清华大学、MIT、英伟达等研究机构的6篇最新学术前沿成果,包括真实世界在线学习系统RLinf-USER、学习人类视频数据的基础模型中0、真实世界的基准测试设施ManipulationNet、解决灾难性遗忘的终身具身导航学习、实现零样本跨本体灵巧抓取的DexGrasp-Ze
2、ro、显著提升推理速度的世界动作模型Fast-WAM。技术研发进度不及预期风险、技术成果转化不及预期风险、商业化应用不及预期风险。RLinf-USER:面向具身智能真实世界在线策略学习的统一可扩展系统真实世界在线学习清华大学等机构推出RLinf-USER系统,一套面向具身智能真实世界在线策略学习的统一可扩展基础设施,通过将物理机器人与GPU纳入统一硬件抽象层的核心设计,解决了真机在线学习面临的异构部署、跨域通信、训练效率低、长周期运行稳定性不足等系统级难题。主要贡献:1:提出统一硬件抽象层设计:将物理机器人与GPU等加速器作为同等的一等硬件资源,实现异构机器人的自动发现、统一管理与调度,支撑多
3、机器人并行训练与跨机型统一学习。2:构建自适应通信平面:通过隧道组网、分布式数据通道与SM感知权重同步机制,实现云边跨域稳定通信,降低跨网传输开销,避免权重同步占用GPU核心计算资源。3:设计全异步学习框架:解耦数据生成、模型训练、传输与权重同步流程,保障机器人连续执行不中断,显著提升真机学习的训练效率与收敛速度。4:提供高可扩展抽象接口:统一支持多种奖励机制、学习算法与模型架构,覆盖主流强化/模仿学习范式,无需重构底层系统即可适配多样化学习需求。影响展望:1:对具身智能学术研究前沿的影响:为具身智能真实世界在线策略学习提供了统一的系统级框架,补充了现有仿真中心化框架在真机分布式部署场景的适配
4、不足。其异构硬件统一抽象、全异步训练等设计,为学界后续真机大规模分布式学习研究提供了可复用的基础设施,也为不同算法、模型的横向性能对比建立了标准化的实验底座。2:对具身智能产业界发展的参考意义:本系统降低了机器人真机在线学习的部署与研发门槛,其云边协同架构可适配工业、服务机器人等商用场景的分布式真机训练需求,统一的硬件抽象也可支撑多品牌、多机型机器人的统一策略学习与迭代,能够帮助厂商缩短真机策略调优周期,缓解仿真与真机的性能差距,加速技术从实验室向商用场景的落地。RLinf-USER:面向具身智能真实世界在线策略学习的统一可扩展系统原文摘要:在物理世界中直接开展在线策略学习,是具身智能领域一个
5、极具前景却充满挑战的方向。与仿真环境不同,真实世界系统无法被任意加速、低成本重置,也难以大规模复制,这使得规模化数据采集、异构部署、长周期有效训练均面临较大困难。这些挑战表明,真实世界在线策略学习不仅是算法问题,更是一个底层的系统工程问题。我们提出了USER,一套面向真实世界在线策略学习的统一可扩展系统。USER通过统一硬件抽象层,将物理机器人与GPU一同视为一等硬件资源,实现了异构机器人的自动发现、管理与调度。针对云边通信难题,USER设计了自适应通信平面,通过基于隧道的组网技术、实现流量本地化的分布式数据通道,以及流多处理器感知的权重同步机制,对GPU端开销进行管控。在该基础设施之上,US
6、ER将学习过程组织为全异步框架,并搭载持久化缓存感知缓冲区,可支撑高效的长周期实验,具备完善的崩溃恢复能力与历史数据复用能力。此外,USER为奖励函数、算法与策略提供了可扩展的抽象接口,在统一管线内支持CNN/MLP、生成式策略、大型视觉-语言-动作(VLA)模型的在线模仿学习或强化学习。仿真与真实世界实验结果表明,USER可支撑多机器人协同、异构机械臂部署、大模型云边协同训练,以及长周期异步训练,为真实世界在线策略学习提供了统一、可扩展的系统底座。(divcenter)图1:RLinf-USER方法整体框架(/divcenter)【学习人类视频数据】Y0:面向通用人形移动操作的开源基础模型0