您的当前位置:首页 > 标签 > 世界模型技术进展
【信达证券】电子:世界模型探索空间智能,AI复杂场景落地可期-250305(16页).pdf
2026世界模型技术进展:Sora开启物理模拟新纪元,机器人世界模型研究加速|信达证券
信达证券世界模型深度报告:Sora验证视频生成模型构建物理世界模拟器路径,机器人世界模型实现数小时学会行走,AI从2D像素向3D空间智能演进。
 2026-07-30
 电子行业
 16页
1张图表
数据来源:
【信达证券】电子:世界模型探索空间智能,AI复杂场景落地可期-250305(16页) 查看报告
世界模型正成为AI从理解文本向理解物理世界演进的关键路径。信达证券世界模型专题报告指出,从2018年Ha et al.首次系统引入世界模型概念,到2024年OpenAI推出Sora,世界模型的研究进展显著加速。机器人在数小时内学会行走、大模型模拟四维超立方体物理——这些成果正在让AI获得真正的空间智能。本文基于信达证券报告,系统梳理世界模型的技术演进、核心争议与应用前景。

从2018到2024,世界模型研究进入快车道

世界模型的研究经历了从概念引入到技术突破的跨越式发展。2018年,Ha et al.首次系统地将世界模型概念引入人工智能社区,奠定了理论基础。2022年,Yann LeCun在关于自主机器智能发展的前瞻性文章中,介绍了联合嵌入预测架构(JEPA),该框架包括处理感官数据的感知模块和评估信息的认知模块,有效体现了世界模型的核心理念,允许大脑评估动作并确定最适合实际应用的反应。

2023年,大语言模型的浪潮中,一些工作证明了潜在世界知识的存在。这些模型捕获了直观的知识,使得他们能对现实世界场景做出预测,LLMs能够对外部世界进行建模。2024年,OpenAI引入Sora模型,被广泛认为是世界模拟器的视频生成模型,展示了卓越的建模功能,输入真实世界的视觉数据后模型可以输出视频帧,预测未来世界的演变。信达证券认为,从时间线看世界模型研究正进入快速迭代期。

Sora的技术架构与功能——扩散模型+Transformer的组合

Sora被认为是基于扩散的视频生成模型,由三部分组成:压缩模型在时间和空间上将原始视频压缩为潜在表示,并包含将潜在表示映射回原始视频的对称模型;基于Transformer的扩散模型(类似DiT)在潜在空间中进行训练;语言模型将人工指令编码到嵌入中并注入生成模型。

在功能层面,Sora可根据用户文本提示生成视频,并可进行替换视频元素、合并视频、拓展场景、提高视频质量等多种编辑操作。信达证券指出,在许多用例中Sora确实具备一定的理解和预测世界的能力,生成的视频在大部分时候能保持良好一致性。但同时也存在掉不碎的水杯、吃不完的苹果等物理不一致现象,表明Sora是否真正理解物理世界仍存争议。

从像素生成到物理理解——世界模型的核心争议

世界模型尚无统一定义,观点通常分为理解世界和预测未来。Ha和Schmidhuber的早期工作侧重于抽象外部世界以深入了解其潜在机制。相比之下,LeCun认为世界模型不仅应该感知和建模现实世界,还应具备设想可能未来状态的能力,从而为决策提供信息。

英伟达官网的定义为:“世界模型是理解现实世界动态(包括其物理和空间属性)的生成式AI模型。它们使用文本、图像、视频和运动等输入数据来生成视频。通过学习,它们能够理解现实世界环境的物理特性,从而对运动、应力以及感官数据中的空间关系等动态进行表示和预测。”

Sora发布后,关于像素生成与物理理解的争论更加激烈。有人认为Sora仅是像素层面的生成,导致无法解释的现象;也有人认为Sora确实具备一定的理解和预测世界的能力。信达证券认为,无论结论如何,Sora的结果表明扩展视频生成模型是构建物理世界通用模拟器的有前景途径。

机器人世界模型——从模拟到现实的关键桥梁

机器人领域的应用是世界模型的主要方向之一,世界模型让机器人在现实中处理通用任务展示出巨大前景。传统机器人关键组件会被建模,执行任务时无需理解世界。但当机器人部署在新场景时可能手足无措,因此世界模型对物理世界的理解和预测能力是机器人智能化的关键利器。

近年研究进展显著:BC-Z利用语言表示作为任务表示增强机器人多任务性能;DayDreamer从离线数据推广世界模型,使机器人能够在数小时内直接在现实世界中学会行走;SWIM从人类视频学习并在无任务监督下对机器人设置微调;VIPER在专家视频上利用预训练自回归transformer指导机器人正确执行;GR-2对机器人任务微调,实现了对机器人未来图像的准确预测和动作轨迹的生成。信达证券认为,LLMs和世界模型正成为机器理解世界基本规律的起点。
世界模型研究关键里程碑
年份研究/模型核心贡献
2018年Ha et al.首次系统将世界模型概念引入AI社区
2022年Yann LeCun JEPA联合嵌入预测架构,体现世界模型框架
2023年LLMs世界知识大模型捕获外部世界知识,能对现实场景做预测
2024年OpenAI Sora视频生成模型作为物理世界通用模拟器
客服
商务合作
小程序
服务号
折叠