当前位置:首页 > 报告详情

北京交通大学:2026数据工厂白皮书(138页).pdf

上传人: 表表 编号:1280812 2026-07-22 138页 8.20MB

下载:
核心结论速览: 人工智能已进入“奇点时刻” :2025年全国词元日调用量从2024年初的1000亿跃升至2025年底的100万亿,两年增长超千倍。2026年5月词元日调用量突破400万亿。 推理数据量首次超过训练数据量:2025年人工智能数据应用总量达199.48EB,其中推理数据量101.34EB,首次超过训练数据量的98.14EB,标志着AI从学习训练阶段正式转向应用推理阶段。 智能体已成为互联网的主要操作者:2026年6月全球HTML网页请求中,机器人(Bot)流量占57.5%,人类流量仅占42.5%,互联网正从“人类网络”进入“机器可阅读网络”。 数智产业链存在三个薄弱环节:数据资源“供不出”(96%数据无法在互联网直接流通)、行业数据“存不好”(每年约四成数据未使用)、高质量数据集“作坊式”生产效率低下。 全国已建成高质量数据集超11.6万个:截至2026年3月,总规模超过960PB,相当于中国国家图书馆数字资源总量的336倍。国家数据局已确定72家行业高质量数据集建设链主单位。 数据工厂是数智社会的新型产业生态:由储备车间、生产车间和中试车间三部分构成,包括集中式、半集中式和分布式三种形态,呈现多样化、规模化、标准化、体系化、AI化五大特征。H2:研究背景与产业全景图谱。人工智能正以惊人的速度重塑世界,支撑AI不断进化的“燃料”——高质量数据集的供给问题日益凸显。2025年是人工智能从“训练”走向“应用”的起点。据《2025年全国数据资源调查报告》,2025年AI推理数据量达101.34EB,首次超越98.14EB的训练数据量,标志着人工智能已正式跨过学习阶段、步入规模化应用阶段。从更宏观的视角看,算力、算法和数据是人工智能的三个关键要素。2024年底,以DeepSeek为代表的人工智能企业实现了MOE等关键技术重大突破并采取模型开源策略,实现了“算力平权”和“算法平权”。2025年底,OpenClaw智能体横空出世,促进AI向各行各业加速渗透。2026年初,Anthropic推出Claud系列模型,彻底颠覆了软件业和网络安全业。DeepSeek实现“算力平权”和“算法平权”后,“数据平权”已成为人工智能在千行百业普及应用的最后一个堡垒。当前,面向人工智能应用的数智产业链已基本形成,包括上游(公域数据→通用高质量数据集→通用大模型)、中上游(行业私域数据→行业通识高质量数据集→行业大模型)、中下游(行业专识高质量数据集→智能体)、下游(千行百业应用)和底座(全国一体化算力网)五个环节。然而,数据资源供给、高质量数据集建设和数据基础设施建设,是数智产业链上的三个薄弱环节。H2:数据工厂新业态发展现状。人工智能进入“奇点时刻” 。据《2025年全国数据资源调查报告》,2025年全国词元日调用量从2024年初的1000亿跃升至2025年底的100万亿,两年增长超千倍,全年词元调用量达21100万亿次。2026年3月词元日调用量突破140万亿,5月突破400万亿。系统软件、人工智能产生的数据量为26.92ZB,首次超过摄像头、传感器等物联感知数据量的25.34ZB。高质量数据集成为人工智能瓶颈。传统数据治理的目标是将数据资源加工成人能看懂的数据产品;数智时代数据治理的目标是将数据资源加工成机器或智能体能识别、学习、处理的数据产品。高质量数据集主要包括通识数据集、行业通识数据集和行业专识数据集等类型。通识数据集面向社会公众的通用知识,无需专业背景即可理解和应用;行业通识数据集需要一定专业背景方可理解;行业专识数据集需要较深的行业背景和具体业务经验方可理解和应用。全国各领域加快布局高质量数据集。2025年国家数据局联合国家发展改革委开展行业高质量数据集链主单位遴选,2026年2月正式确定72家链主单位。截止2026年3月,全国已建成高质量数据集超过11.6万个,总规模超过960PB。工业和信息化部选择20个行业打造100个行业高质量通识数据集和100个行业大模型。国家能源局公布8个领域51个“人工智能+”能源高价值场景。各省市纷纷出台支持政策,最高补贴金额可达500万元。H2:国内外数据工厂探索实践。美国和欧盟的数据企业一直将人工智能可以识别和应用作为数据生产的目标,不断创新高质量数据集规模化生产模式。美国ScaleAI:成立于2016年,2021年获得美国军方2.5亿美元合同,将美军数据源接入其Donovan平台,规模化生产战场高质量数据集。2025年6月Meta以143亿美元收购其49%股份。ScaleAI构建了覆盖通用、生成式AI、公共部门、汽车等领域的专业化数据引擎矩阵。美国星际之门项目:2025年1月正式提出,整体投资5000亿美元,计划2029年完成。将“高质量数据”明确定位为“国家战略资产”,建设容量可达20EB的独立数据中心。欧洲数据中心:2024年10月由德国施瓦茨数字公司和德国铁路公司合作成立,旨在增强欧洲AI领域自主性,让欧洲摆脱对海外数据提供商的依赖。国内典型数据工厂:崖州湾国家实验室“繁|未来农业智能枢纽”超级数据工厂聚焦农业育种领域,已上线8类数据库、3000+基因组。贵州主枢纽存力中心依托国家“东数西算”工程,可调度算力达4.5EFLOPS、存力980PB。上海库帕思“语料超级工厂”日生成语料接近1TB,覆盖具身智能、金融、医疗等多个行业。京津冀数据要素产业园人工智能数据工厂总投资2.6亿元,拥有100PB存力。帕西尼具身智能超级数据工厂占地近12000平方米,部署150个标准化采集单元,预计年产近2亿条高质量训练数据。H2:数据工厂的涵义与类型。数据工厂是人类社会进入数智化发展新阶段,面向人工智能大模型应用,开展高质量数据集设施化、规模化、标准化生产的数据基础设施。数据工厂是国家数据基础设施的基本构成单元,是突破人工智能发展瓶颈的有效手段,是高质量数据集的规模化生产设施,是数据全生命周期的综合产业形态。数据工厂的构成有广义和狭义两个范畴。广义数据工厂包括国家数据基座、国家数据工厂和国家人工智能训练场三个组成部分。狭义数据工厂由储备车间、生产车间和中试车间组成。根据物理分布、组织方式和技术水平等特征,数据工厂分为三种类型:集中式数据工厂:将数据供应、生产、交付全过程集中在一个固定物理区域内,是未来五年主流方式之一。代表包括帕西尼具身智能超级数据工厂、库帕思语料超级工厂。半集中式数据工厂:采用相对统一的技术平台在不同区域开展数据生产。美国ScaleAI通过Remotasks和Outlier子平台将数据标注业务部署到东南亚、非洲等多个区域。分布式数据工厂:数据供应、生产、交付分布在一个广泛的网络空间内,通过数据编织技术实现“逻辑统一、物理解耦”。代表为美国Palantir公司,其Foundry平台支持连接200多种数据源。数据工厂呈现五大特征: 多样化:集中式、半集中式、分布式三种形态长期共存。 设施化:数据工厂本身就是一个设施集合,核心构成要素都是设施。 规模化:建立在专业分工基础上的社会化大生产方式。 标准化:数据资源、加工处理、数据产品和服务均实现标准化。 AI化:人工智能是数据工厂的最常用工具。H2:狭义数据工厂的构成体系。狭义数据工厂由储备车间、生产车间和中试车间三部分组成。储备车间:定位于数据原料的“供应基地”,提供规模化收储、标准化预处理、体系化管理的数据原料。由数据采集中心、数据存储中心和数据管理中心三大基础平台构成。生产车间:定位于高质量数据集“流水线”,承担面向人工智能应用的高质量数据集规模化、专业化、标准化构建。由数据加工中心和数据标注中心两大生产中心构成。数据加工中心负责数据的清洗、转换、增强等预处理;数据标注中心负责数据的标注、审核和质量控制。中试车间:定位于数据集投产前的“靶场”,衔接高质量数据集生产与AI模型训推,评估数据集质量及模型适配性。由模型评估中心和数据集维护与更新中心组成。H2:数据工厂的建设、运营与部署。四种建设模式:1. 数据标注企业升级:海天瑞声、数据堂等传统标注企业转型升级为数据工厂。2. 数据存储基地转型:存储基地和数据中心转型升级为集中式数据工厂。3. 人工智能企业延伸:百度、抖音、腾讯等头部企业发展独立数据业务。4. 技术企业创新设立:通过数据编织等技术创新设立分布式数据工厂。四种运营模式:1. 保障模式:针对国家重大战略需求,数据资源无条件提供,数据集有条件无偿开放。2. 定制模式:针对社会公益、技术创新需求,按需求有条件提供,定向开放。3. 电商模式:针对市场化基础较好的行业,按市场规则向全社会开放。4. 结对子模式:针对需要长期开发的领域,引导龙头企业和大模型企业形成良性循环。四种部署策略:1. 底座部署:生产通识数据集,服务基础大模型。2. 区域重要功能设施:生产区域通识数据集,服务区域通用性应用。3. 行业重要功能设施:生产行业通识数据集,服务行业垂域大模型。4. 业务节点:生产行业专识数据集,服务智能体和垂直大模型。H2:未来3—5年机会洞察。机会赛道分析:| 赛道 | 成熟度 | 市场空间 | 爆发窗口 | 推荐优先级 |||||||| 通识数据集数据工厂 | 中高 | 大 | 已爆发 | ★★★★★ || 行业通识数据集数据工厂 | 中 | 大 | 2026-2028 | ★★★★★ || 行业专识数据集数据工厂 | 中低 | 极大 | 2027-2029 | ★★★★ || 半集中式数据工厂(区域部署) | 中 | 中 | 2026-2028 | ★★★★ || 分布式数据工厂 | 低 | 大 | 2028-2030 | ★★★ || 数据标注企业转型升级 | 高 | 中 | 已爆发 | ★★★★ |多角色行动建议: 政府部门:加快出台《关于促进数据工厂新业态创新发展的指导意见》,启动数据工厂相关标准研制,将数据工厂关键技术纳入国家科技计划。 数据标注企业:积极加大数据资源储备、数据生产加工、数据中试验证等方面科技投入,从劳动密集型转型升级为规模化、智能化、通用化的数据工厂。 存储与算力企业:与数据源机构合作共建集中式数据工厂,将长期存放的静态原始数据加工成高质量数据集。 人工智能企业:大力发展独立数据业务,建设独立运营的半集中式数据工厂,形成企业第二业务增长曲线。 技术创业团队:聚焦数据编织、数据虚拟化等前沿数据安全流通技术,布局分布式数据工厂新业态。延伸阅读:以上为报告核心趋势分析,如需获取完整报告详细数据及全部案例,请访问下载页下载完整PDF报告。FAQ区块。Q1:什么是数据工厂?A:数据工厂是人类社会进入数智化发展新阶段,面向人工智能大模型应用,开展高质量数据集设施化、规模化、标准化生产的数据基础设施。由储备车间、生产车间和中试车间三部分组成。Q2:数据工厂有哪几种类型?A:根据物理分布、组织方式和技术水平,分为集中式数据工厂、半集中式数据工厂和分布式数据工厂三种。集中式将全流程集中在一个物理区域;半集中式用统一技术平台在不同区域部署;分布式通过数据编织技术实现“逻辑统一、物理解耦”。Q3:为什么需要数据工厂?A:当前高质量数据集建设大多由人工智能厂商自行构建,呈现零散式、作坊式、非标化等特点,远远不能满足AI大模型应用需求。数据工厂通过设施化、规模化、标准化生产,可从根本上突破高质量数据集供给瓶颈。Q4:国内外有哪些典型的数据工厂?A:国外有美国ScaleAI(获Meta143亿美元收购)、星际之门项目(投资5000亿美元)、欧洲数据中心等。国内有崖州湾国家实验室“繁|未来农业智能枢纽”、贵州主枢纽存力中心、库帕思语料超级工厂、帕西尼具身智能超级数据工厂等。Q5:数据工厂如何部署?A:在国家数据基础设施底座部署生产通识数据集的数据工厂;在区域重要功能设施部署生产区域通识数据集的数据工厂;在行业重要功能设施部署生产行业通识数据集的数据工厂;在各业务节点部署生产行业专识数据集的数据工厂。Q6:发展数据工厂需要哪些政策支持?A:建议加快出台《关于促进数据工厂新业态创新发展的指导意见》,启动数据工厂相关标准研制,突破非结构化数据采集、海量数据存储、智能化数据加工、数据集质量评估等关键技术瓶颈,加强数据资源汇聚、数据集生产、数据流通、人工智能训练等支撑平台建设。数据来源说明。本报告数据来源于《数据工厂白皮书》,由北京交通大学、北京化工大学牵头,联合华为技术有限公司、浙江蚂蚁密算科技有限公司、上海零数科技有限公司、北京数据集团有限公司、贵州大数据产业集团有限公司、清华大学公共管理学院、北京大学大数据分析与应用技术国家工程实验室等30余家机构共同编制。
word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
1. **数据工厂是高质量数据集规模化生产的关键设施**,解决人工智能发展中的数据瓶颈问题,推动数智产业链发展。 2. **人工智能进入应用阶段**:2025年国内AI推理数据量(101.34EB)首次超过训练数据量(98.14EB),词元日调用量从2024年初1000亿跃升至2025年底100万亿。 3. **数据工厂构成**:包括储备车间(数据收储)、生产车间(数据加工)、中试车间(质量评估),形成设施化、规模化、标准化生产模式。 4. **国内外实践**:美国Scale AI、欧洲数据中心等探索数据工厂,国内如贵州主枢纽存力中心、崖州湾超级数据工厂加速布局。 5. **政策支持**:国家层面推动行业高质量数据集建设,各省市加大资金补贴(如贵州最高500万元),促进数据要素市场化。
数据工厂是什么? AI数据瓶颈在哪? 如何建设数据工厂?
客服
商务合作
小程序
服务号
折叠