您的当前位置:首页 > 标签 > 2026年世界模型行业报告
电子行业:世界模型探索空间智能AI复杂场景落地可期-250305(16页).pdf
2026年世界模型行业报告:Sora争议与英伟达Cosmos入局,AI空间智能落地前景|信达证券
信达证券世界模型报告显示,英伟达Cosmos基于2000万小时数据训练9000万亿token,李飞飞World Labs估值超10亿美元,Sora引发物理理解争议,世界模型行业前景分析。
 2026-07-30
 电子行业
 16页
2张图表
数据来源:
电子行业:世界模型探索空间智能AI复杂场景落地可期-250305(16页) 查看报告
信达证券最新电子行业专题报告指出,世界模型研究正迅速进展,应用端机遇与挑战并存。OpenAI发布Sora后,世界模型获得广泛关注——Sora能生成一分钟高保真视频,但也出现"掉不碎的水杯"等无法解释现象,引发其是否真正理解物理世界的争议。与此同时,英伟达推出Cosmos世界基础模型、李飞飞创立World Labs估值超10亿美元、谷歌DeepMind发布Genie2,各大厂商已展开激烈角逐。报告认为,伴随推理性能提升和推理成本降低,世界模型等算力密集型场景有了落地可能。

世界模型从学术概念到产业落地,六年演进路径清晰

2018年,Ha et al.首次系统地将世界模型概念引入人工智能社区。2022年,在关于自主机器智能发展的前瞻性文章中,Yann LeCun介绍了联合嵌入预测架构(JEPA),该框架包括处理感官数据的感知模块和评估信息的认知模块,有效地体现了世界模型。2023年,大语言模型的浪潮中,一些工作证明了潜在世界知识的存在,LLMs能够对外部世界进行建模。2024年,OpenAI引入Sora模型,被广泛认为是世界模拟器的视频生成模型,输入真实世界视觉数据后可输出视频帧、预测未来世界演变。

从功能方面看,在许多用例中Sora确实具备一定的理解和预测世界的能力,且生成的视频在大部分时候有良好的一致性。但也有人认为Sora仅是像素层面的生成,会导致"掉不碎的水杯"、"吃不完的苹果"等无法解释的现象,表明Sora并未真正理解物理世界。尽管争议存在,Sora的结果表明扩展视频生成模型是构建物理世界通用模拟器的一条有前景的途径。

英伟达Cosmos基于2000万小时数据,构建物理感知视频生成平台

英伟达推出的Cosmos世界基础模型是一套用于物理感知视频生成的开放式扩散和自回归Transformer模型。这些模型已基于2000万小时的真实世界人类互动、环境、工业、机器人和驾驶数据,训练了9000万亿个token。

Cosmos模型分为三类:Nano用于针对实时、低延迟推理和边缘部署进行优化的模型;Super用于高性能基线模型;Ultra具有高质量和保真度,适合用于蒸馏自定义模型。配合NVIDIA Omniverse 3D输出时,扩散模型可生成可控的高质量合成视频数据,用于启动机器人和自动驾驶汽车感知模型的训练。自回归模型基于输入帧和文本预测视频帧序列中的下一步动态,实现实时下一个token预测,让物理AI模型预测其下一个最佳行动。

英伟达允许无论公司规模如何,研究人员和开发者都可以根据开放模型许可协议自由使用Cosmos模型,且许可协议允许商业用途。目前已公布的第一批试用者包括机器人公司1X、Agility Robotics,以及自动驾驶领域的Uber、小鹏、比亚迪等。

李飞飞创立World Labs,三个月估值突破10亿美元

World Labs是一家空间智能AI公司,由在AI学术领域享有盛誉的李飞飞博士创立。公司致力于构建空间智能大型世界模型(LWM)来感知、生成3D世界并与之交互,目标是将AI模型从像素的2D平面提升到完整的3D世界——包括虚拟和现实——赋予它们丰富的空间智能。

World Labs仅创立了三个月,便吸引了英伟达、AMD等公司的融资,估值超过10亿美元。在World Labs官网上展示了大量LWM用例,只需要输入单图就可以生成一张3D图片并保持良好一致性,在影视、游戏、世界模拟等方面拥有良好前景。World Labs在2024年9月走出隐身模式时已获得2.3亿美元融资,成为空间智能领域的领跑者。

谷歌DeepMind Genie2与昆仑万维Matrix-Zero跟进布局

谷歌旗下DeepMind推出Genie2,性能强大且用例广泛。Genie2是一个自回归潜在扩散模型,在大型视频数据集上进行了训练。通过自动编码器后,视频中的潜在帧被传递到大型Transformer动力学模型,该模型使用类似于大型语言模型使用的因果掩码进行训练。在推理时,Genie2可以自回归方式进行采样,逐帧执行单动作和过去的潜帧。Genie2可在长达一分钟内保持一致性,生成不同视角,学会创建复杂的3D视觉场景以及水、烟等不同物理效果。

昆仑万维发布的Matrix-Zero世界模型包含两款子模型。其中3D场景生成大模型支持将用户输入的图片转化为可自由探索的真实合理的3D场景,具备全局一致性、可自由探索、支持不同风格图片输入、支持风格迁移、支持动态场景生成等特点。可交互视频生成大模型提供以用户输入为核心驱动的可交互空间智能视频生成方案,支持根据用户实时输入生成互动视频效果。
全球主要厂商世界模型布局对比
厂商产品核心数据/特点主要应用方向
英伟达Cosmos2000万小时数据,9000万亿token自动驾驶、机器人
World LabsLWM估值超10亿美元,单图生成3D影视、游戏、世界模拟
谷歌DeepMindGenie2自回归潜在扩散,保持1分钟一致性3D环境生成、AI代理训练
昆仑万维Matrix-Zero3D场景生成+可交互视频生成空间智能、互动视频
客服
商务合作
小程序
服务号
折叠