具身智能是机器人与人工智能的交汇点,决定了机器人能否从“专用工具”进化为“通用智能体”。中泰证券研究报告指出,具身智能在机器人上的应用划分为感知、推理、执行三阶段,技术路线分为端到端大模型(VLA)和分层具身大模型两大流派。端到端VLA(如谷歌RT-2、Figure Helix)实现从人类指令到机械臂执行的直接映射;分层模型(如Figure 02、银河通用)通过“大脑-小脑”分工协作,上层大模型负责感知决策,下层小模型负责快速执行。当前因机器人训练数据稀缺(仅240万个数据片段,远逊于文本15T tokens),分层模型仍是主流选择,但VLA模型正快速突破。泛化性——机器人在新场景、新任务、新物体上的适应能力——是衡量具身智能水平的核心指标。
具身智能三阶段——感知、推理、执行
具身智能在机器人上的应用体现为三阶段闭环。具身感知是机器人理解环境的基础,包括物体感知(识别物体类别和属性)、场景感知(理解空间布局和上下文)、行为感知(识别人类动作意图)、表达感知(理解语言和指令)。具身推理将抽象的人类指令转化为具体的可执行技能,包括任务规划(将“倒杯水”分解为“走到厨房→找杯子→拿杯子→倒水→返回”)、导航(在3D环境中移动完成目标)和具身问答(主动探索环境后回答问题)。具身执行完成具体动作输出,核心是技能学习——通过模仿学习(从专家演示中学习)或强化学习(从环境交互试错中学习)掌握动作技能。三阶段形成“感知→理解→决策→行动”的完整智能闭环。
技术路线之一——端到端VLA模型
端到端VLA(视觉-语言-动作)模型直接从人类指令到机械臂执行,输入图像+文本指令,输出夹爪末端动作。谷歌RT-1(2022年)基于130k episodes、700+任务训练,证明了端到端学习在机器人操作中的可行性。RT-2(2023年)在VLM预训练基础上用机器人数据微调,使模型获得“涌现能力”——可理解训练数据中从未出现的命令,并基于思路链推理决策。Figure AI的Helix(2025年)首创“系统1、系统2”双系统VLA架构:系统2(7B参数)慢思考场景理解,系统1(8000万参数)快思考200Hz实时控制,仅用500小时监督数据训练(此前VLA数据集的<5%)。端到端VLA的优势是简化流程、泛化能力强、通用性高;劣势是数据稀缺(机器人数据仅240万片段)、推理响应速度慢(RT-2仅1-3Hz)。
H3:技术路线之二——分层具身大模型
分层模型将感知、规划决策、控制和执行分解为多个层级,分别突破“大脑”和“小脑”。Figure 02采用三层级方案:顶层OpenAI大模型负责视觉推理和语言理解;中间层神经网络策略(NNP)快速将视觉信息转换为动作指令;底层全身控制器输出各关节扭矩指令。银河通用三层级方案:底层硬件层,中间层通过仿真合成数据训练的泛化技能,上层大模型调度中间技能API。分层模型的优势是各层可独立优化、可解释性强、数据需求相对较低;劣势是层间信息传递有损耗、系统复杂度高。目前因端到端受数据制约,分层模型仍是主流选择,但随着机器人数据逐步积累,端到端有望成为未来主流。
H4:泛化性——衡量具身智能的核心标尺
机器人的通用性取决于泛化性的发展程度。泛化性描述了机器人因学习场景与应用场景任务设置不一致导致的性能变化,衡量机器人在新场景、新物体、新指令上的适应能力。从泛化性角度,机器人技术分为五个阶段:程序化控制(无泛化)→预设任务执行(任务内泛化)→多任务学习(任务间泛化)→元学习与自适应(场景泛化)→通用具身智能(跨场景泛化)。当前行业正从第三阶段向第四阶段迈进。银河通用提出VLA达到基础模型需满足七大泛化金标准——物体泛化、场景泛化、光照泛化、视角泛化、指令泛化、动作泛化和多任务泛化。泛化能力的突破是机器人从“专用工具”走向“通用智能体”的关键。
H3:技术路线之二——分层具身大模型
分层模型将感知、规划决策、控制和执行分解为多个层级,分别突破“大脑”和“小脑”。Figure 02采用三层级方案:顶层OpenAI大模型负责视觉推理和语言理解;中间层神经网络策略(NNP)快速将视觉信息转换为动作指令;底层全身控制器输出各关节扭矩指令。银河通用三层级方案:底层硬件层,中间层通过仿真合成数据训练的泛化技能,上层大模型调度中间技能API。分层模型的优势是各层可独立优化、可解释性强、数据需求相对较低;劣势是层间信息传递有损耗、系统复杂度高。目前因端到端受数据制约,分层模型仍是主流选择,但随着机器人数据逐步积累,端到端有望成为未来主流。
H4:泛化性——衡量具身智能的核心标尺
机器人的通用性取决于泛化性的发展程度。泛化性描述了机器人因学习场景与应用场景任务设置不一致导致的性能变化,衡量机器人在新场景、新物体、新指令上的适应能力。从泛化性角度,机器人技术分为五个阶段:程序化控制(无泛化)→预设任务执行(任务内泛化)→多任务学习(任务间泛化)→元学习与自适应(场景泛化)→通用具身智能(跨场景泛化)。当前行业正从第三阶段向第四阶段迈进。银河通用提出VLA达到基础模型需满足七大泛化金标准——物体泛化、场景泛化、光照泛化、视角泛化、指令泛化、动作泛化和多任务泛化。泛化能力的突破是机器人从“专用工具”走向“通用智能体”的关键。
| 对比维度 | 端到端VLA模型 | 分层具身模型 |
|---|---|---|
| 代表产品 | 谷歌RT-2、Figure Helix | Figure 02、银河通用 |
| 架构特点 | 单一模型从指令到动作 | 多层级分工协作 |
| 推理速度 | 1-3Hz(RT-2) | 200Hz+(底层控制) |
| 数据需求 | 高(数百万级演示) | 中等(可仿真合成) |
| 泛化能力 | 强(涌现能力) | 较强(模块化泛化) |
| 当前主流 | 新兴方向 | 主流选择 |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-29
机器人
57页
63张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录