1、江海证券有限公司及其关联机构在法律许可的情况下可能与本报告所分析的企业存在业务关系,并且继续寻求发展这些关系。因此,投资者应当考虑到本公司可能存在影响本报告客观性的利益冲突,不应视本报告为投资决策的唯一因素。敬请参阅最后一页之免责条款证券研究报告证券研究报告行业点评报告行业点评报告2025 年年 2 月月 11 日日江海证券研究发展部江海证券研究发展部分析师:张婧分析师:张婧执业证书编号:执业证书编号:S1410525010001联系人:吴雁宇联系人:吴雁宇执业证书编号:执业证书编号:S1410124010015行业评级行业评级:增持增持(维持维持)近十二个月行业表现近十二个月行业表现%1 个
2、月3 个月12 个月相对收益5.658.3636.48绝对收益8.863.4152.41数据来源:聚源注:相对收益与沪深 300 相比注:2025 年 2 月 10 日数据相关研究报告相关研究报告1.江海证券-行业点评报告-通信行业:Cosmos 世界基础模型开放,机器人和自动驾驶汽车应用加速 2025.01.132.江海证券-行业点评报告-通信行业:AI产业高速成长,算力重要性持续凸显 2025.01.063.江海证券-行业点评报告-通信行业:卫星互联网高速发展,持续看好 2024.12.094.江海证券-行业点评报告-通信行业:5G产业深化,投资机会不断 2024.12.025.江海证券-
3、行业点评报告-传媒行业:市值管理指引发布,看好通信央国企投资机会 2024.11.19通信行业VideoWorld 提出提出,无需依赖语言模型无需依赖语言模型事件:事件:2025 年 2 月 10 日,豆包大模型团队与北京交通大学、中国科学技术大学联合提出视频生成实验模型 VideoWorld。不同于 Sora、DALL-E、Midjourney 等主流多模态模型,VideoWorld 在业界首次实现无需依赖语言模型,即可认知世界。投资要点:投资要点:VideoWorld 去掉语言模型,实现了统一执行理解和推理任务。去掉语言模型,实现了统一执行理解和推理任务。现有模型大多依赖语言或标签数据学习
4、知识,很少涉及纯视觉信号的学习。然而,语言并不能捕捉真实世界中的所有知识。例如,折纸、打领结等复杂任务,难以通过语言清晰表达。作为一种通用视频生成实验模型,VideoWorld 去掉语言模型,实现了统一执行理解和推理任务。同时,它基于一种潜在动态模型,可高效压缩视频帧间的变化信息,显著提升知识学习效率和效果。在不依赖任何强化学习搜索或奖励函数机制前提下,VideoWorld 达到了专业 5 段 9x9 围棋水平,并能够在多种环境中,执行机器人任务。尽管面向真实世界的视频生成和泛化仍存在很大挑战,视频生成依然可以成为一种通用的知识学习方法,并在现实世界充当思考和行动的“人工大脑”。目前,该项目代
5、码与模型已开源。VideoWorld 模型架构上使用朴素的自回归模型实例化视频生成器,包含一个模型架构上使用朴素的自回归模型实例化视频生成器,包含一个VQ-VAE 编码器编码器-解码器和一个自回归解码器和一个自回归 Transformer。在模型训练环节,团队构建了一个包含大量视频演示数据的离线数据集,让模型“观看”学习,以此得到一个可以根据过往观测,预测未来画面的视频生成器。模型架构上,团队使用朴素的自回归模型实例化视频生成器,它包含一个VQ-VAE 编码器-解码器和一个自回归 Transformer。编码器负责将视频帧(画面)转换为离散标记,Transformer 在训练期间使用这些标记预
6、测下一标记。在推理过程中,Transformer 生成下一帧(画面)的离散标记,这些标记随后由解码器转换回像素空间。通过任务相关的映射函数,模型可将生成画面转换为任务执行动作。这让视频生成实验模型可在不依赖任何动作标签情况下,学习和执行具体任务。VideoWorld 模型模型压缩视觉变化,实现了更有效的视频学习。压缩视觉变化,实现了更有效的视频学习。通常,视频编码需要数百或数千个离散标记来捕捉每帧内的视觉信息,这导致知识被稀疏地嵌入标记中。VideoWorld 引入了一个潜在动态模型(LatentDynamics Model,LDM),可将帧间视觉变化压缩为紧凑的潜在编码,提高模型的知识挖掘效