1、2 0 2 3 年深度行业分析研究报告多模态AI综述01Partone3AI模型:必将从单模态走向多模态,实现复杂场景下的智能决策014单模态多模态跨模态多模态神经搜索Jina AI光谱AI实现模态融合多模态AI数据:将多模态数据融合处理模型:更多融合人类脑神经机制,提升性能功能:实现智能决策、跨模态任务、运动控制、智能预测反馈来源:AWS,IBM Research,浙商证券研究所2024年,有望出现多模态领域类ChatGPT的爆款应用015来源:Multimodal Foundation Models:FromSpecialists to General-Purpose Assistants
2、,浙商证券研究所1Task-Specific模型2预训练模型3Unified Models withEmerging Capabilities4General Purpose Assistants语言文本领域视觉&多模态领域机器翻译文字填充情绪识别BERTGPTGPT-2GPT-3LLaMA分类检索风格转换MoCoCLIPDALLEFlamingoPaLM-EChatGPTGPT-4子类细分方向代表模型视觉理解(visualUnderstanding)监督学习、基于语言-文本对的训练、仅有图像的自监督学习、多种方法的融合、多模态融合、区块和像素级别的预训练BiT、ViTCLIP、ALIGNMo
3、Co、DINO、MAESLIP、UniCLUNITER、CoCaGLIP、SAM视觉生成(Visual Generation)文本-图像生成基础模型、Spatial Controllable生成、基于文本的编辑模型、文本Prompt、Concept CustomizationStable DiffusionControlNetInstructPix2PixDDPODreamBooth子类细分方向代表模型联合视觉模型(Unified Vision Models)From Closed-set to Open-set Models、From Task-Specific to Generic Mod
4、els、From Static to Promptable ModelsGLIP、Openseg、OpenSeeD、Unified-IO、X-Decoder、SAM、SEEM、SegGPT基于LLM训练的多模态大模型(Visual Generation)图像到文字的生成模型、Instruction Tuning in LLM、Instruction Tuning in LMMFlamingo、ChatGPT、VicunaMultimodal GPT-4、LLaVA、MiniGPT-4多模态助手:基于LLM的工具链(Multimodal Agents:Chaining Tools with LL
5、M)多模态助理(Multimodal Agent)VISPROG、Visual ChatGPT、MM-REACT特定目的的预训练模型通用多模态助手演变大模型行业规模持续增长,市场前景广阔016来源:2023年中美AI大模型应用比较研究报告,第一财经,浙商证券研究所预计2028年全球大模型市场规模将超过1000亿美元。根据大模型之家、钛媒体数据,预计2023年全球大模型市场规模达到210亿美元,同比增长94.4%。预计到2028年全球大模型市场规模将达到1095亿美元,20222028年复合增长率约为47.12%,根据IDC预测,全球生成式AI计算市场规模将从2022年的8.2亿美元增长至202
6、6年的109.9亿美元,CAGR约为91.34%。预计至2028年我国大模型市场规模接近1200亿人民币。根据大模型之家、钛媒体数据,预计2023年中国大模型市场规模达到147亿人民币,同比增长110.0%。预计到2028年中国大模型市场规模将达到1179亿人民币,20222028年复合增长率约为60.11%,市场规模快速成长。多模态大模型带来AI全新应用场景,多模态内容市场规模有望快速成长。第一财经数据显示,预计至2025年,中国多模态内容市场规模将达到832.7亿美元,2018-2025年复合增长率达65.02%。多模态大模型内容将主要应用于商业定制、医疗、游戏、教育和影视领域。2020-