自动驾驶是感知、预测、规划、控制的复杂系统工程。信达证券世界模型专题报告指出,传统级联架构容易导致信息丢失和建模复杂,而基于扩散的视频生成模型作为世界模型可部分解决上述问题。随着多模态大模型和视觉生成模型的进展,世界模型在自动驾驶和机器人领域正受到广泛关注。本文基于信达证券报告,深度解析世界模型如何赋能自动驾驶与机器人智能化。
自动驾驶的级联困境——信息丢失与建模复杂
现代自动驾驶通常分为感知、预测、规划和控制四个模块。在汽车行驶场景中,汽车通过相机、雷达、高精度地图等方式获取数据来感知世界。在多模态大模型和视觉生成模型出现之前,交通场景的模拟通常以感知模块收集或手动构建,并进行进一步建模和渲染以产生适合车辆的输出。
信达证券指出,多个模块的级联容易导致信息丢失和建模复杂。感知模块输出的抽象表示可能丢失了原始数据中的部分细节,预测模块的误差会逐级传导到规划和控制模块,导致整体性能下降。此外,逼真的场景渲染需要耗费巨量的计算资源,限制了自动驾驶系统的效率和可扩展性。
信达证券指出,多个模块的级联容易导致信息丢失和建模复杂。感知模块输出的抽象表示可能丢失了原始数据中的部分细节,预测模块的误差会逐级传导到规划和控制模块,导致整体性能下降。此外,逼真的场景渲染需要耗费巨量的计算资源,限制了自动驾驶系统的效率和可扩展性。
视频生成模型作为世界模型——突破传统瓶颈
使用基于扩散的视频生成模型作为世界模型可以部分解决上述问题。视频生成模型直接从视觉数据中学习交通场景的动态演变,无需经过多级抽象和建模。模型可以端到端地接受传感器输入并生成未来帧的预测,减少了中间环节的信息损失。
近年来已有相关研究在不断进行。视频生成模型从早期的GAN-based模型(VGAN、MoCoGAN、VideoGPT)演进到扩散模型(VDM、LDM、Video LDM),再发展到DiT架构(Sora、Genie、Genie2)。信达证券认为,视频生成模型时间线的持续演进表明,基于扩散的方法在自动驾驶场景模拟方面具有显著潜力,可以更高效地生成逼真的训练数据并支持感知模型的优化。
近年来已有相关研究在不断进行。视频生成模型从早期的GAN-based模型(VGAN、MoCoGAN、VideoGPT)演进到扩散模型(VDM、LDM、Video LDM),再发展到DiT架构(Sora、Genie、Genie2)。信达证券认为,视频生成模型时间线的持续演进表明,基于扩散的方法在自动驾驶场景模拟方面具有显著潜力,可以更高效地生成逼真的训练数据并支持感知模型的优化。
机器人世界模型——从模拟学习到现实行走的突破
机器人的应用是世界模型另一主要方向。传统机器人关键组件会被建模,机器人在执行任务时无需理解世界。但当机器人被部署在新的场景中时,可能会手足无措。世界模型对物理世界的理解和预测能力是机器人智能化的关键利器。
近年来机器人世界模型研究取得多项突破:BC-Z利用语言表示作为任务表示,增强了机器人的多任务性能;DayDreamer从离线数据中推广了一个世界模型,使机器人能够在数小时内直接在现实世界中学会行走;SWIM可以从人类视频中学习,并在没有任何任务监督的情况下对机器人设置进行微调;VIPER在专家视频上利用预训练自回归transformer,指导机器人正确执行;GR-2对机器人任务进行了微调,实现了对机器人未来图像的准确预测和动作轨迹的生成。
近年来机器人世界模型研究取得多项突破:BC-Z利用语言表示作为任务表示,增强了机器人的多任务性能;DayDreamer从离线数据中推广了一个世界模型,使机器人能够在数小时内直接在现实世界中学会行走;SWIM可以从人类视频中学习,并在没有任何任务监督的情况下对机器人设置进行微调;VIPER在专家视频上利用预训练自回归transformer,指导机器人正确执行;GR-2对机器人任务进行了微调,实现了对机器人未来图像的准确预测和动作轨迹的生成。
AGI的实现路径——LLMs与世界模型的融合
信达证券指出,LLMs和世界模型被认为是实现通用人工智能(AGI)的可能途径之一,它们可以成为机器理解世界基本规律的起点。LLMs提供了语言理解和推理能力,而世界模型提供了对物理世界的感知和预测能力,两者互补可形成更完整的智能系统。
o3-mini可模拟生成小球在四维超立方体内弹射的Python代码,Grok3可模拟航天器任务并准确描述飞船、地球、太阳、火星的位置关系——这些成果表明大模型正在学习如何理解物理世界和空间关系。世界模型有望迎来快速迭代时期,推动AI从2D像素层面走向3D空间智能,为自动驾驶、机器人、复杂系统模拟等场景提供新的技术基础。
o3-mini可模拟生成小球在四维超立方体内弹射的Python代码,Grok3可模拟航天器任务并准确描述飞船、地球、太阳、火星的位置关系——这些成果表明大模型正在学习如何理解物理世界和空间关系。世界模型有望迎来快速迭代时期,推动AI从2D像素层面走向3D空间智能,为自动驾驶、机器人、复杂系统模拟等场景提供新的技术基础。
| 传统级联架构问题 | 视频生成模型解决方案 |
|---|---|
| 模块间信息丢失 | 端到端视频生成,直接从视觉输入预测未来帧 |
| 多级建模复杂 | 单一模型替代多级建模流程 |
| 场景渲染计算资源巨量 | 基于扩散的高效生成 |
| 误差逐级传导 | 统一架构减少累积误差 |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
电子行业
16页
1张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录