世界模型正成为AI从理解文本向理解物理世界演进的关键路径。信达证券世界模型专题报告指出,从2018年Ha et al.首次系统引入世界模型概念,到2024年OpenAI推出Sora,世界模型的研究进展显著加速。机器人在数小时内学会行走、大模型模拟四维超立方体物理——这些成果正在让AI获得真正的空间智能。本文基于信达证券报告,系统梳理世界模型的技术演进、核心争议与应用前景。
从2018到2024,世界模型研究进入快车道
世界模型的研究经历了从概念引入到技术突破的跨越式发展。2018年,Ha et al.首次系统地将世界模型概念引入人工智能社区,奠定了理论基础。2022年,Yann LeCun在关于自主机器智能发展的前瞻性文章中,介绍了联合嵌入预测架构(JEPA),该框架包括处理感官数据的感知模块和评估信息的认知模块,有效体现了世界模型的核心理念,允许大脑评估动作并确定最适合实际应用的反应。
2023年,大语言模型的浪潮中,一些工作证明了潜在世界知识的存在。这些模型捕获了直观的知识,使得他们能对现实世界场景做出预测,LLMs能够对外部世界进行建模。2024年,OpenAI引入Sora模型,被广泛认为是世界模拟器的视频生成模型,展示了卓越的建模功能,输入真实世界的视觉数据后模型可以输出视频帧,预测未来世界的演变。信达证券认为,从时间线看世界模型研究正进入快速迭代期。
2023年,大语言模型的浪潮中,一些工作证明了潜在世界知识的存在。这些模型捕获了直观的知识,使得他们能对现实世界场景做出预测,LLMs能够对外部世界进行建模。2024年,OpenAI引入Sora模型,被广泛认为是世界模拟器的视频生成模型,展示了卓越的建模功能,输入真实世界的视觉数据后模型可以输出视频帧,预测未来世界的演变。信达证券认为,从时间线看世界模型研究正进入快速迭代期。
Sora的技术架构与功能——扩散模型+Transformer的组合
Sora被认为是基于扩散的视频生成模型,由三部分组成:压缩模型在时间和空间上将原始视频压缩为潜在表示,并包含将潜在表示映射回原始视频的对称模型;基于Transformer的扩散模型(类似DiT)在潜在空间中进行训练;语言模型将人工指令编码到嵌入中并注入生成模型。
在功能层面,Sora可根据用户文本提示生成视频,并可进行替换视频元素、合并视频、拓展场景、提高视频质量等多种编辑操作。信达证券指出,在许多用例中Sora确实具备一定的理解和预测世界的能力,生成的视频在大部分时候能保持良好一致性。但同时也存在掉不碎的水杯、吃不完的苹果等物理不一致现象,表明Sora是否真正理解物理世界仍存争议。
在功能层面,Sora可根据用户文本提示生成视频,并可进行替换视频元素、合并视频、拓展场景、提高视频质量等多种编辑操作。信达证券指出,在许多用例中Sora确实具备一定的理解和预测世界的能力,生成的视频在大部分时候能保持良好一致性。但同时也存在掉不碎的水杯、吃不完的苹果等物理不一致现象,表明Sora是否真正理解物理世界仍存争议。
从像素生成到物理理解——世界模型的核心争议
世界模型尚无统一定义,观点通常分为理解世界和预测未来。Ha和Schmidhuber的早期工作侧重于抽象外部世界以深入了解其潜在机制。相比之下,LeCun认为世界模型不仅应该感知和建模现实世界,还应具备设想可能未来状态的能力,从而为决策提供信息。
英伟达官网的定义为:“世界模型是理解现实世界动态(包括其物理和空间属性)的生成式AI模型。它们使用文本、图像、视频和运动等输入数据来生成视频。通过学习,它们能够理解现实世界环境的物理特性,从而对运动、应力以及感官数据中的空间关系等动态进行表示和预测。”
Sora发布后,关于像素生成与物理理解的争论更加激烈。有人认为Sora仅是像素层面的生成,导致无法解释的现象;也有人认为Sora确实具备一定的理解和预测世界的能力。信达证券认为,无论结论如何,Sora的结果表明扩展视频生成模型是构建物理世界通用模拟器的有前景途径。
英伟达官网的定义为:“世界模型是理解现实世界动态(包括其物理和空间属性)的生成式AI模型。它们使用文本、图像、视频和运动等输入数据来生成视频。通过学习,它们能够理解现实世界环境的物理特性,从而对运动、应力以及感官数据中的空间关系等动态进行表示和预测。”
Sora发布后,关于像素生成与物理理解的争论更加激烈。有人认为Sora仅是像素层面的生成,导致无法解释的现象;也有人认为Sora确实具备一定的理解和预测世界的能力。信达证券认为,无论结论如何,Sora的结果表明扩展视频生成模型是构建物理世界通用模拟器的有前景途径。
机器人世界模型——从模拟到现实的关键桥梁
机器人领域的应用是世界模型的主要方向之一,世界模型让机器人在现实中处理通用任务展示出巨大前景。传统机器人关键组件会被建模,执行任务时无需理解世界。但当机器人部署在新场景时可能手足无措,因此世界模型对物理世界的理解和预测能力是机器人智能化的关键利器。
近年研究进展显著:BC-Z利用语言表示作为任务表示增强机器人多任务性能;DayDreamer从离线数据推广世界模型,使机器人能够在数小时内直接在现实世界中学会行走;SWIM从人类视频学习并在无任务监督下对机器人设置微调;VIPER在专家视频上利用预训练自回归transformer指导机器人正确执行;GR-2对机器人任务微调,实现了对机器人未来图像的准确预测和动作轨迹的生成。信达证券认为,LLMs和世界模型正成为机器理解世界基本规律的起点。
近年研究进展显著:BC-Z利用语言表示作为任务表示增强机器人多任务性能;DayDreamer从离线数据推广世界模型,使机器人能够在数小时内直接在现实世界中学会行走;SWIM从人类视频学习并在无任务监督下对机器人设置微调;VIPER在专家视频上利用预训练自回归transformer指导机器人正确执行;GR-2对机器人任务微调,实现了对机器人未来图像的准确预测和动作轨迹的生成。信达证券认为,LLMs和世界模型正成为机器理解世界基本规律的起点。
| 年份 | 研究/模型 | 核心贡献 |
|---|---|---|
| 2018年 | Ha et al. | 首次系统将世界模型概念引入AI社区 |
| 2022年 | Yann LeCun JEPA | 联合嵌入预测架构,体现世界模型框架 |
| 2023年 | LLMs世界知识 | 大模型捕获外部世界知识,能对现实场景做预测 |
| 2024年 | OpenAI Sora | 视频生成模型作为物理世界通用模拟器 |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
电子行业
16页
1张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录