国盛证券2025年5月发布的智能驾驶报告指出,语言模型和多模态模型正被引入智能驾驶领域,让自动驾驶车辆从“聋哑司机”变成“司机助理”——不仅能开车,还能解释为什么这样开。谷歌旗下Waymo推出端到端自动驾驶多模态模型EMMA,英国Wayve推出闭环驾驶VAM模型LINGO-2(首个在公共道路测试的视觉语言动作模型),清华大学与理想汽车联合推出DriveVLM(通过思维链推理实现场景描述/场景分析/分层规划)。理想汽车正训练32B参数VL基座模型并扩展至VLA,小鹏汽车推进72B参数VLA模型并通过蒸馏“推云入端”,吉利VLA大模型用于L3智能驾驶架构。从“能开车”到“能解释”,智能驾驶正在从“聋哑司机”进化成“司机助理”。
VLM/VLA从机器人领域跨界自动驾驶
VLA(Vision-Language-Action)模型最早见于机器人行业。2023年7月,谷歌DeepMind推出全球首个控制机器人的视觉语言动作模型RT-2。2024年10月,谷歌旗下Waymo推出基于端到端的自动驾驶多模态模型EMMA,将VLA架构从机器人拓展至自动驾驶。
VLA模型的本质是让AI同时具备“看懂”和“动手”的能力。以RT-2为例,模型输入图像及文本指令,输出机械臂末端动作。在自动驾驶场景中,VLA模型输入摄像头图像,输出驾驶轨迹决策,同时还能用自然语言解释决策理由。
Wayve的LINGO-2是首个在公共道路上进行测试的视觉语言动作模型(VAM)。在案例中,用户问“交通灯是什么颜色的?”LINGO-2正确回答“交通灯是绿色的”,并能解释驾驶决策。VLA/VLM的引入让自动驾驶从“黑盒”变“白盒”,增强了用户信任和系统可解释性。
VLA模型的本质是让AI同时具备“看懂”和“动手”的能力。以RT-2为例,模型输入图像及文本指令,输出机械臂末端动作。在自动驾驶场景中,VLA模型输入摄像头图像,输出驾驶轨迹决策,同时还能用自然语言解释决策理由。
Wayve的LINGO-2是首个在公共道路上进行测试的视觉语言动作模型(VAM)。在案例中,用户问“交通灯是什么颜色的?”LINGO-2正确回答“交通灯是绿色的”,并能解释驾驶决策。VLA/VLM的引入让自动驾驶从“黑盒”变“白盒”,增强了用户信任和系统可解释性。
DriveVLM:理想汽车让车学会“解释”决策
清华大学与理想汽车联合推出的DriveVLM在传统自动驾驶系统上增加了大视觉语言模型能力。VLM在视觉理解和推理方面能力突出,结合大模型能力后,DriveVLM不仅能开车,还能理解输入的图像信息并作出对应决策。
DriveVLM通过思维链(Chain-of-Thought)推理,包含三个模块:场景描述(描述当前场景)、场景分析(分析潜在风险和规则)、分层规划(做出驾驶决策)。在案例中,面对交警指挥交通的场景,DriveVLM识别出交警在指挥左边道路、前方三轮车缓慢行驶,作出“缓慢直线行驶”决策,并解释“需要和前方及两侧车辆保持安全距离”。面对阴雨天骑电动车迎面而来的场景,系统作出“先减速,右转,并缓慢直行”决策,解释“减速是为了等骑车的人通过”。
DriveVLM是目前开环测试端到端智能驾驶全球第一名,基于nuScenes数据集测得3秒平均L2轨迹误差0.22米、3秒平均碰撞率0.04%,均优于VAD和UniAD等方案。
DriveVLM通过思维链(Chain-of-Thought)推理,包含三个模块:场景描述(描述当前场景)、场景分析(分析潜在风险和规则)、分层规划(做出驾驶决策)。在案例中,面对交警指挥交通的场景,DriveVLM识别出交警在指挥左边道路、前方三轮车缓慢行驶,作出“缓慢直线行驶”决策,并解释“需要和前方及两侧车辆保持安全距离”。面对阴雨天骑电动车迎面而来的场景,系统作出“先减速,右转,并缓慢直行”决策,解释“减速是为了等骑车的人通过”。
DriveVLM是目前开环测试端到端智能驾驶全球第一名,基于nuScenes数据集测得3秒平均L2轨迹误差0.22米、3秒平均碰撞率0.04%,均优于VAD和UniAD等方案。
小鹏/理想/吉利全面布局VLA
小鹏汽车正在云上训练72B参数的超大规模VLA模型,通过蒸馏方法生产小尺寸车端模型,“把72B超级大脑的智能推云入端”。小鹏还自主研发了数据基础设施,使数据上传规模提升22倍、训练中数据带宽提升15倍、模型训练速度提升5倍。规模法则效应在10亿到720亿参数模型上均有体现——参数规模越大、训练数据量越大,模型能力越强。
理想汽车VLA分四阶段:预训练(32B参数VL基座模型)→后训练(VLA模型从3.2B扩至近4B)→强化训练(RLHF+纯RL)→搭建司机Agent。简单短指令由端侧VLA处理,复杂指令由云端VL基座模型解析后交VLA处理。
吉利汽车在2025年3月推出千里浩瀚安全高阶智能驾驶系统,H7级别加入VLM大模型(2025年完成推送),最高级H9加入VLA大模型和数字先觉网络,为L3智能驾驶准备。元戎启行于2025年1月宣布基于英伟达Thor芯片推出VLA量产车型,计划年内交付。
理想汽车VLA分四阶段:预训练(32B参数VL基座模型)→后训练(VLA模型从3.2B扩至近4B)→强化训练(RLHF+纯RL)→搭建司机Agent。简单短指令由端侧VLA处理,复杂指令由云端VL基座模型解析后交VLA处理。
吉利汽车在2025年3月推出千里浩瀚安全高阶智能驾驶系统,H7级别加入VLM大模型(2025年完成推送),最高级H9加入VLA大模型和数字先觉网络,为L3智能驾驶准备。元戎启行于2025年1月宣布基于英伟达Thor芯片推出VLA量产车型,计划年内交付。
VLA上车挑战:算力与蒸馏
VLA模型上车面临核心挑战——车端算力。传统rule-base方案只推理1秒路况,端到端1.0能推理7秒,而VLA能对几十秒路况进行推理。车端模型参数变大,既要有高效实时推理能力,又要有大模型认识复杂世界的能力。
解决方案是“云端训练+车端蒸馏”。小鹏做法是在云端训练72B大模型,通过蒸馏方法产出小尺寸车端模型。理想做法是32B VL基座模型在云端,通过蒸馏把能力传递至车端VLA。地平线判断:L2需100+TOPS,2028年L3需500-1000+TOPS,2030年L4需2000+TOPS。英伟达Thor最高2000TOPS、小鹏图灵芯片等效760TOPS、理想Thor U 700TOPS(2025年搭载),车端算力正快速满足VLA需求。
解决方案是“云端训练+车端蒸馏”。小鹏做法是在云端训练72B大模型,通过蒸馏方法产出小尺寸车端模型。理想做法是32B VL基座模型在云端,通过蒸馏把能力传递至车端VLA。地平线判断:L2需100+TOPS,2028年L3需500-1000+TOPS,2030年L4需2000+TOPS。英伟达Thor最高2000TOPS、小鹏图灵芯片等效760TOPS、理想Thor U 700TOPS(2025年搭载),车端算力正快速满足VLA需求。
| 模型 | 发布方 | 特点 |
|---|---|---|
| EMMA | Waymo | 端到端自动驾驶多模态模型 |
| LINGO-2 | Wayve | 首个公共道路测试的VAM模型 |
| DriveVLM | 清华大学/理想 | 场景描述/分析/分层规划三模块 |
| 小鹏VLA | 小鹏汽车 | 72B参数,蒸馏上车 |
| 理想VLA | 理想汽车 | 32B VL基座→VLA→Agent |
| 吉利VLA | 吉利汽车 | H9层级为L3准备 |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-28
信息技术
55页
1张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录