信达证券最新电子行业专题报告指出,世界模型研究正迅速进展,应用端机遇与挑战并存。OpenAI发布Sora后,世界模型获得广泛关注——Sora能生成一分钟高保真视频,但也出现"掉不碎的水杯"等无法解释现象,引发其是否真正理解物理世界的争议。与此同时,英伟达推出Cosmos世界基础模型、李飞飞创立World Labs估值超10亿美元、谷歌DeepMind发布Genie2,各大厂商已展开激烈角逐。报告认为,伴随推理性能提升和推理成本降低,世界模型等算力密集型场景有了落地可能。
世界模型从学术概念到产业落地,六年演进路径清晰
2018年,Ha et al.首次系统地将世界模型概念引入人工智能社区。2022年,在关于自主机器智能发展的前瞻性文章中,Yann LeCun介绍了联合嵌入预测架构(JEPA),该框架包括处理感官数据的感知模块和评估信息的认知模块,有效地体现了世界模型。2023年,大语言模型的浪潮中,一些工作证明了潜在世界知识的存在,LLMs能够对外部世界进行建模。2024年,OpenAI引入Sora模型,被广泛认为是世界模拟器的视频生成模型,输入真实世界视觉数据后可输出视频帧、预测未来世界演变。
从功能方面看,在许多用例中Sora确实具备一定的理解和预测世界的能力,且生成的视频在大部分时候有良好的一致性。但也有人认为Sora仅是像素层面的生成,会导致"掉不碎的水杯"、"吃不完的苹果"等无法解释的现象,表明Sora并未真正理解物理世界。尽管争议存在,Sora的结果表明扩展视频生成模型是构建物理世界通用模拟器的一条有前景的途径。
从功能方面看,在许多用例中Sora确实具备一定的理解和预测世界的能力,且生成的视频在大部分时候有良好的一致性。但也有人认为Sora仅是像素层面的生成,会导致"掉不碎的水杯"、"吃不完的苹果"等无法解释的现象,表明Sora并未真正理解物理世界。尽管争议存在,Sora的结果表明扩展视频生成模型是构建物理世界通用模拟器的一条有前景的途径。
英伟达Cosmos基于2000万小时数据,构建物理感知视频生成平台
英伟达推出的Cosmos世界基础模型是一套用于物理感知视频生成的开放式扩散和自回归Transformer模型。这些模型已基于2000万小时的真实世界人类互动、环境、工业、机器人和驾驶数据,训练了9000万亿个token。
Cosmos模型分为三类:Nano用于针对实时、低延迟推理和边缘部署进行优化的模型;Super用于高性能基线模型;Ultra具有高质量和保真度,适合用于蒸馏自定义模型。配合NVIDIA Omniverse 3D输出时,扩散模型可生成可控的高质量合成视频数据,用于启动机器人和自动驾驶汽车感知模型的训练。自回归模型基于输入帧和文本预测视频帧序列中的下一步动态,实现实时下一个token预测,让物理AI模型预测其下一个最佳行动。
英伟达允许无论公司规模如何,研究人员和开发者都可以根据开放模型许可协议自由使用Cosmos模型,且许可协议允许商业用途。目前已公布的第一批试用者包括机器人公司1X、Agility Robotics,以及自动驾驶领域的Uber、小鹏、比亚迪等。
Cosmos模型分为三类:Nano用于针对实时、低延迟推理和边缘部署进行优化的模型;Super用于高性能基线模型;Ultra具有高质量和保真度,适合用于蒸馏自定义模型。配合NVIDIA Omniverse 3D输出时,扩散模型可生成可控的高质量合成视频数据,用于启动机器人和自动驾驶汽车感知模型的训练。自回归模型基于输入帧和文本预测视频帧序列中的下一步动态,实现实时下一个token预测,让物理AI模型预测其下一个最佳行动。
英伟达允许无论公司规模如何,研究人员和开发者都可以根据开放模型许可协议自由使用Cosmos模型,且许可协议允许商业用途。目前已公布的第一批试用者包括机器人公司1X、Agility Robotics,以及自动驾驶领域的Uber、小鹏、比亚迪等。
李飞飞创立World Labs,三个月估值突破10亿美元
World Labs是一家空间智能AI公司,由在AI学术领域享有盛誉的李飞飞博士创立。公司致力于构建空间智能大型世界模型(LWM)来感知、生成3D世界并与之交互,目标是将AI模型从像素的2D平面提升到完整的3D世界——包括虚拟和现实——赋予它们丰富的空间智能。
World Labs仅创立了三个月,便吸引了英伟达、AMD等公司的融资,估值超过10亿美元。在World Labs官网上展示了大量LWM用例,只需要输入单图就可以生成一张3D图片并保持良好一致性,在影视、游戏、世界模拟等方面拥有良好前景。World Labs在2024年9月走出隐身模式时已获得2.3亿美元融资,成为空间智能领域的领跑者。
World Labs仅创立了三个月,便吸引了英伟达、AMD等公司的融资,估值超过10亿美元。在World Labs官网上展示了大量LWM用例,只需要输入单图就可以生成一张3D图片并保持良好一致性,在影视、游戏、世界模拟等方面拥有良好前景。World Labs在2024年9月走出隐身模式时已获得2.3亿美元融资,成为空间智能领域的领跑者。
谷歌DeepMind Genie2与昆仑万维Matrix-Zero跟进布局
谷歌旗下DeepMind推出Genie2,性能强大且用例广泛。Genie2是一个自回归潜在扩散模型,在大型视频数据集上进行了训练。通过自动编码器后,视频中的潜在帧被传递到大型Transformer动力学模型,该模型使用类似于大型语言模型使用的因果掩码进行训练。在推理时,Genie2可以自回归方式进行采样,逐帧执行单动作和过去的潜帧。Genie2可在长达一分钟内保持一致性,生成不同视角,学会创建复杂的3D视觉场景以及水、烟等不同物理效果。
昆仑万维发布的Matrix-Zero世界模型包含两款子模型。其中3D场景生成大模型支持将用户输入的图片转化为可自由探索的真实合理的3D场景,具备全局一致性、可自由探索、支持不同风格图片输入、支持风格迁移、支持动态场景生成等特点。可交互视频生成大模型提供以用户输入为核心驱动的可交互空间智能视频生成方案,支持根据用户实时输入生成互动视频效果。
昆仑万维发布的Matrix-Zero世界模型包含两款子模型。其中3D场景生成大模型支持将用户输入的图片转化为可自由探索的真实合理的3D场景,具备全局一致性、可自由探索、支持不同风格图片输入、支持风格迁移、支持动态场景生成等特点。可交互视频生成大模型提供以用户输入为核心驱动的可交互空间智能视频生成方案,支持根据用户实时输入生成互动视频效果。
| 厂商 | 产品 | 核心数据/特点 | 主要应用方向 |
|---|---|---|---|
| 英伟达 | Cosmos | 2000万小时数据,9000万亿token | 自动驾驶、机器人 |
| World Labs | LWM | 估值超10亿美元,单图生成3D | 影视、游戏、世界模拟 |
| 谷歌DeepMind | Genie2 | 自回归潜在扩散,保持1分钟一致性 | 3D环境生成、AI代理训练 |
| 昆仑万维 | Matrix-Zero | 3D场景生成+可交互视频生成 | 空间智能、互动视频 |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
电子行业
16页
2张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录