您的当前位置:首页 > 标签 > 世界模型自动驾驶应用
电子行业:世界模型探索空间智能AI复杂场景落地可期-250305(16页).pdf
世界模型自动驾驶应用:扩散模型解决信息丢失,机器人智能化突破瓶颈趋势|信达证券
信达证券报告指出世界模型在自动驾驶领域解决信息丢失和建模效率问题,机器人领域DayDreamer数小时学会行走,世界模型正突破自动驾驶与机器人智能化瓶颈。
 2026-07-30
 电子行业
 16页
2张图表
数据来源:
电子行业:世界模型探索空间智能AI复杂场景落地可期-250305(16页) 查看报告
信达证券报告指出,随着视觉生成模型和多模态大模型的进展,世界模型在自动驾驶领域受到广泛关注。使用基于扩散的视频生成模型作为世界模型可以部分解决传统自动驾驶模拟中信息丢失和建模效率低下的问题。在机器人领域,世界模型让机器人在现实中处理通用任务展示出巨大前景——DayDreamer从离线数据推广世界模型使机器人数小时内学会行走。世界模型对物理世界的理解和预测能力是机器人智能化的关键利器。

自动驾驶的世界模型应用,从感知到预测的范式转变

现代自动驾驶通常可以分为感知、预测、规划和控制四个模块。在汽车行驶场景中,汽车通过相机、雷达、高精度地图等方式获取数据来感知世界。

在多模态大模型和视觉生成模型出现之前,交通场景的模拟通常以汽车的感知模块收集或手动构建,并进行进一步的建模和渲染以产生适合车辆的输出。多个模块的级联容易导致信息丢失、建模复杂等问题。此外,逼真的场景渲染需要耗费巨量的计算资源,限制了自动驾驶的效率。

使用基于扩散的视频生成模型作为世界模型可以部分解决上述问题。近年来已有相关的研究在不断进行。世界模型能够从输入数据中学习和预测交通场景的动态变化,为自动驾驶系统提供更丰富、更准确的环境理解。

机器人世界模型研究进展,从专用到通用的跨越

机器人领域的应用也是世界模型的主要方向之一。传统的机器人关键组件会被建模,机器人在执行任务时无需理解世界。但当机器人被部署在新的场景中时,可能会手足无措。

近年来相关研究有很多进展。BC-Z利用语言表示作为任务表示,增强了机器人的多任务性能。DayDreamer从离线数据中推广了一个世界模型,使机器人能够在数小时内直接在现实世界中学会行走。SWIM可以从人类视频中学习,并在没有任何任务监督的情况下对机器人设置进行微调。VIPER在专家视频上利用预训练自回归transformer,指导机器人正确执行。GR-2对机器人任务进行了微调,实现了对机器人未来图像的准确预测和动作轨迹的生成。

世界模型对物理世界的理解,AGI的关键路径

世界模型对物理世界的理解和预测能力是机器人智能化的关键利器。LLMs和世界模型被认为是实现通用人工智能(AGI)的可能途径之一,它们可以成为机器理解世界基本规律的起点。

目前AI发展迅速,大模型正快速学习如何理解物理世界。在近期发布的大模型中,o3-mini可以模拟生成一个小球在四维超立方体内弹射的Python代码。而Grok3则可以模拟航天器任务,生成的3D动画准确描述了飞船、地球、太阳、火星的位置关系。这些成果有可能从底层催动世界模型的进展,让AI的智能化进入更高的水平。

推理成本下降为世界模型落地创造条件

无论是北美还是国内,推理成本的降低及推理性能的迅速提升趋势非常显著。微软董事长Satya Nadella曾在法说会表示,每代硬件的性价比提高2倍以上,而由于软件优化,每代模型的性能提升10倍以上。

DeepSeek卓越的性价比让人印象深刻。据Semianalysis观察,在GPT-4上同样有类似的趋势,即每过一年算法改进和优化使得推理成本降低10倍,同时性能提升10倍。

伴随推理性能的提升和推理成本的降低,许多算力密集型的场景有了落地的可能,世界模型便是其中一个例子。世界模型可以帮助端侧理解并预测世界,从而产生正确的决策。从云来看,由于多模态数据的训练与推理,算力需求总体仍然呈现迅速增长的趋势;而从端来看,人形机器人、自动驾驶等重要赛道有望迅速前进,以突破目前的智能化瓶颈。
世界模型在自动驾驶与机器人领域的应用对比
应用领域传统方法痛点世界模型解决方案代表研究/产品
自动驾驶信息丢失、建模复杂、渲染计算量大扩散模型生成场景、端到端预测英伟达Cosmos
机器人新场景适应性差、缺乏通用性从人类视频学习、离线数据推广DayDreamer、SWIM、VIPER、GR-2
客服
商务合作
小程序
服务号
折叠