2026数据工厂白皮书_第1页
2026数据工厂白皮书_第2页
2026数据工厂白皮书_第3页
2026数据工厂白皮书_第4页
2026数据工厂白皮书_第5页
已阅读5页,还剩250页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

i版权声明本白皮书版权由北京交通大学、北京化工大学、华为技术有限公司、北京数据集团、贵州大数据产业集团、北京物资学院、清华大学、北京大学等编制单位(详细名单见下页)共同拥有,并受法律保护,转载、摘编或利用其他方式使用本报告文字、图表或观点的,应注明“来源:《数据工厂白皮书》”,违反上述声者,将追究其相关法编制单位北京交通大学、北京化工大学华为技术有限公司、浙江蚂蚁密算科技有限公司、上海零数科技有限公司、杭州安恒信息技术股份有限公司、北京京数智科技开发有限公司、北京数据集团有限公司、贵州大数据产业集团有限公司、内蒙古大数据产业发展集团有限公司、苏州算力科技集团有限公司、横琴金融投资集团有限公司、海南数据产业服务有限公司、四川数据集团有限公司、成都数据集团股份有限公司、湖州市数据科技集团有限公司、东莞市人工智能与数字经济集团有限公司、北京国际大数据交易所、江苏省数据交易所、中国煤炭地质总局、南京钢铁集团有限公司、清华大学公共管理学院未来政府治理中心、清华大学计算社会科学与国家治理实验室、清华中国电子数据治理研究院、北京大学大数据分析与应用技术国家工程实验室、北京交通大学经济管理学院、北京交通大学信息管理与理论国际研究中心、北京化工大学经济管理学院、北京化工大学信息化绩效评估中心、北京物资学院、北京邮电大学经济管理学院、北京软件和信息服务业协会、呼和浩特市互联网协会、中国国际经济咨询有限公司、四川省大数据发展研究会编写人员张向宏、袁远、李振军、涂群、张茜茜杨文道、王旭东、王振、张震、翟爽、秦立都、朱建红(华为)张真继、刘世峰、宫大庆(北京交通大学)张闯(北京物资学院)韦韬、刘前伟、潘无穷、李婷婷(蚂蚁密算)王磊、童君、杨珍(零数科技)刘博、陶立峰、周俊、张强、段平霞(安恒信息)王仕品、刘军、王似巍(贵州省大数据产业集团)晋梁昊(北京数据集团)温天宁、叶航辉(北京大数据国际交易所)王刚、吉日木图、王阳(内蒙古大数据公司)云霄、许军毅(中国煤炭地质总局)王芳、孙茂杰、徐发喜(南京钢铁集团有限公司)陈军、纪昌秀、蔡文俊(苏州算力公司)方树财、余祥臣、罗丽琪(东莞人工智能与数字集谢辉、杨舒、周苏宁(横琴金融投资公司)续新颖、于嘉南、郭静雯(江苏省数据交易所)邓建平、李泉、王斌(成都数据集团)漆骏锋(四川省数据集团)黄健强、施幸汝、梁钰(海南数据公司)王震、陆斌霄、刘思佳(湖州数据集团)张少彤(清华大学公共管理学院未来政府治理中心)王理达(清华中国电子数据治理研究院)张影强(清华大学计算社会科学与国家治理实验室)徐克付、易典馨、孙震(北京大学大数据国家实验王友奎、易兰丽、魏娜(北京邮电大学经济管理学龙飞、郝峥嵘、刘莉(北京软件和信息服务业协会)张晓宇、陈浩(呼和浩特市互联网协会)秦强子、张锐(四川省大数据发展研究会)傅毅明、王隆泰、李虹霞(中国国际经济咨询有限公v 1 1 9 16 25 30 42 62 65 69 73 77 79 83 105 111 114 118 120 122 124 1 2 3 4 6 11 13 14 17 18 19 20 22 24 25 26 27 28 29 31 34 36 38 40 41 42 43 46 48 50 53 55 58 59 60 61 63 64 65 66 69 73 77 78 79 86 94 106 111 115 120 122 124 126 16表2:三种数据工厂类型对比分析 72前言习近平总书记在刚刚召开的国家科学技术奖励大会、两院院士大会、中国科协第十一次全国代表大会上指出,“当以神经科学、认知科学、计算科学、数学等理论突破和学科交叉为基础,以智能前沿技术群体性突破和广泛渗透赋能为标志,呈现数据驱动、万物互联、人机协同、跨界融合等显著特征。形势催人,也逼人。我们必须抓住历史机遇,迎接时代挑战,加快推进高水平科技自立自强”。数据成为人工智能三大要素的第一关键要素,数据驱动成为人工智能四大特征的第一显著特征。当前,人工智能正以惊人的速度重塑世界,一个根本性的问题日益凸显:支撑AI不断进化的“燃料”从何而来?2025年是人工智能从“训练”走向“应用”的起点。数据显示,2025年国内AI推理数据量达101.34EB,首次超越98.14EB的训练数据量,标志着人工智能已正式跨过学习阶段、步入规模化应用阶段。然而,支撑人工智能技术升级的高质量数据集依然匮乏。存量公域数据持续供给乏力,海量私域数据、非结构化数据、行业高端数据无法有效供给,导致市面上各类大模型能力趋同,难以突破专业场景应用。AI越强大,数据要素化就越紧迫、越根本。高质量数据集的规模和质量不仅直接影响人工智能大模型的“智商”水平,更是人工智能在千行百业广泛应用的关键“瓶颈”,已成为企业的核心竞争力和真正的“护城河”。高质量数据集匮乏的深层原因在于生产方式滞后。当前,大部分高质量数据集的生产仍处于“作坊式”阶段。如何实现高质量数据集的规模化、标准化、设施化生产,已成为制约人工智能技术水平进一步提升和深度落地产业场景的关键瓶颈,已成为决定人工智能应用普及程度的核心。正如工业社会的水有水厂、电有电厂一样,数智社会也必须有数据工厂。数据工厂作为高质量数据集规模化、设施化、标准化生产的新型业态,是数智化发展新阶段的一种基本生产业态。数据工厂由储备车间、生产车间和中试车间等三部分构成,包括集中式数据工厂、半集中式数据工厂和分布式数据工厂三种形态,呈现出多样化、规模化、标准化、体系化、AI化等五大特征。数据工厂有数据标注企业迭代、数据存储基地升级、人工智能企业延伸和技术企业创新创立等四种主要建设模式,应探索采用保障模式、定制模式、结对子模式、电商模式等四种运营模式,应与国家数据基础设施协同部署,在国家基础设施底座应部署通识数据集的数据工厂,在重要功能设施应部署行业通识数据集数据工厂,在各业务节点应部署行业专识数据集数据工厂。数据工厂新兴业态的建设、发展和完善,需要政策、标准、技术、平台四方面的系统保障,应加快出台促进数据工厂创新发展的政策文件,启动数据资源汇聚整合、数据集生产、质量评估、流通应用等全链条标准研制,突破非结构化数据采集、海量数据存储、智能化数据加工、数据集质量评估等关键技术瓶建设数据资源汇聚、数据集生产、数据流通、人工智能训练等支撑平台。《数据工厂白皮书》是我国第一本关于数据工厂政策、理论、实践的研究成果,由北京交通大学、北京化工大学牵头,联合华为、蚂蚁、零数等技术企业,北京、贵州、内蒙古等数据集团,中煤地质、南钢集团等央企,清华、北大、北物、北邮等高等院校,北数所、江苏数交所等交易机构,历经一年多时间研究编制完成。编制过程中,得到国家数据局、全国数据标准化技术委员会、国家数据发展研究院和多个地方数据管理机构的支持,在此表示衷心感谢!数据工厂是《交大评论》团队首次研究提出的一种新兴业态,在政策、理论、实践等各方面还处于初级探索阶段,书中难免有疏忽和遗漏之处,敬请批评指正!1一、数据工厂新业态发展方兴未艾(一)人工智能已发展到奇点时刻日调用量从2024年初的1000亿,跃升至2025年底的100万亿,两年增长超千倍,2025年全年词元调用量达21100万亿词元调用量的爆发式增长,表明大模型正被越来越多的主体、在越来越多的场景中应用。图1:词元调用量爆发式增长2数据应用总量达199.48EB,同比增长42.86%。其中,推理数据量达101.34EB,首次超过训练数据量的98.14ZB。表明人工智能已正式从学习训练阶段转向应用推理阶段,人工智能正在开启从技术突破到应用拓展的发展新阶段。图2:人工智能推理数据应用量首次超过训练数据应用量智能产生的数据量为26.92ZB,首次超过摄像头、传感器等物3联感知数据量的25.34ZB。企业数据技术投入同比增长17.37%。其中,头部平台企业和中央企业数据投入分别增长25.79%和24.49%。企业数据技术投入同比增长17.37%。其中,24.49%。图3:计算驱动成为数据生产的主要方式据CloudflareRadar全球网络监测显示,球HTML网页请求中,机器人(Bot)流量占57.5%,人类(Human)流量占42.5%。机器发起的已经超过了真人用户发起的请求。Bot即自动化程序,它所发起的HTTP请求,包括搜索引擎爬虫、AI数据抓取器、监控脚本、价格爬虫、SEO工具、恶意爬虫、自动化测试工具等。这些bot相当于按脚本干活的“弱智能体”。表明互联网正在进入一个新时4代,从人类网络进入机器可阅读/智能体可阅读的网络。网页不仅要给人看,也越来越要被机器读取、理解和调用。图4:智能体流量超过了人类对HTML网页的访问流量人工智能的快速发展对数据治理提出了新的要求。传统数据治理的目标是将数据资源加工成人能看懂的数据产品,典型形态就是领导驾驶舱和应急指挥调度大屏;数智时代数据治理的目标是将数据资源加工成机器或智能体能识别、学习、处理的数据产品,典型的形态就是应用于大模型预训练的高质量数据和大模型微调、对齐、评测、推理的高质量数5数据资源是各种有价值的信息、数据、元数据、属性的总称。按照来源主体不同,数据可以分为个人数据、企业数据和公共数据;按照数据格式不同,数据可以分为结构化数据、半结构化数据和非结构化数据等。数据资源具有数量多、潜在价值大、处理工艺简单等特点。高质量数据是将原始数据资源经去重、去噪、目录化、体系化等初步加工处理,形成的数据产品。在数字化发展阶段,高质量数据主要用于加工生产报表、决策系统、产品预测等企业BI产品;在数智化发展新阶段,大规模的高质量数据主要用于大模型的预训练。高质量数据具有规模较大、价值较高、加工处理工艺较简单等特点。高质量数据集是将经过标注、增强、质检等加工处理方法,形成的数据产品。高质量数据集主要用于大模型的微调、对齐、测评、推理等过程,具有规模小、价值高、加工处理工艺复杂等特点。高质量数据集主要指经过采集、加工等数据处理,可直接用于开发和训练人工智能模型,能有效提升模型性能的数据集合。包括通识数据集、行业通识数据集和行业专识数据集等类型。通识数据集是由蕴含通用知识的数据组成的数据集。面向社会公众的通用知识,主要包括基础概念、通用原理和典型事例等方面内容,无需专业背景即可理解和应用,具有广泛性、基础性和常识性等特点。行业通识数据集是由蕴含行业领域通用知识的数据组成的数据集。行业领域通用6知识包括行业领域基础理论、通用技术和共性业务等行业知识,需要一定的专业背景方可理解和应用,在行业领域内部具有普适性和共识性等特点。行业专识数据集是由蕴含行业领域专业知识的数据组成的数据集。行业领域专业知识是指面向行业领域机构内部业务人员的专业知识,具有场景针对性、组织机构专属性和实践经验积累性等特点。主要包括从研发、生产、管理、营销和服务等业务环节中产生和积累的知识,需要较深的行业背景和具体业务经验方可理解和应用。图5:从数据资源到高质量数据再到高质量数据集通识高质量数据集、行业通识高质量数据集和行业专识高质量数据集,都具有知识内容、来源类型、时效性、标注人员类型、敏感程度、模型类型、主题范围等方面的特征。知识内容指数据集中数据所蕴含知识的专业性、知识深度和目标受众;来源类型指数据集中数据的获取来源,如网络资7源、文献类型、系统平台、组织机构等来源;时效性指数据集中数据的更新速度或有效期限;标注人员类型指对数据集中数据进行标注或审核的人员类型;敏感程度指数据集中数据公开后所产生的风险程度;模型类型指数据集中数据支持开发和训练人工智能模型的类型;主题范围指数据集所涉及通用知识领域、行业领域、业务场景等的范围。通识数据集具有以下特征:在知识内容方面,数据集中数据所承载信息蕴含的知识面向社会公众,以基础概念、通用原理、典型事例等常识性知识为主,无需专业背景即可理解;在来源类型方面,数据集中数据无明确来源,或主要来自百科、问答、互联网平台(短视频类、新闻门户类、用户内容生成类、视听资讯类、新闻机构类等)等网络资源,综合性书籍等类型文献,以及由合成数据技术生成;在时效性方面,数据集中数据一般在较长时间内保持稳定,时效性较低。如年度国民经济统计公报、重大事件新闻报道等,一经发布即可在较长时间内作为信息参考,较少出现频繁调整变更的情况;在标注人员类型方面,数据集中数据通常由普通数据标注员标注,对行业领域专业背景和专业资质等级无特殊要求;在敏感程度方面,数据集中数据的敏感程度较低,不涉及国家秘密、工作秘密、商业秘密、个人隐私等;在模型类型方面,数据集中数据用于支持开展通用模型、行业模型的开发和训练;在主题范围方面,数据集不属于特定行业8领域,主题范围较广。行业通识数据集具有以下特征:在知识内容方面,数据集中数据所承载信息蕴含的知识聚焦于各行业领域的共性知识,以行业领域的基础理论、通用技术、共性业务为主,面向行业领域的从业人员,需要一定的专业背景才能理解和运用;在来源类型方面,数据集中数据来源清晰,主要来自论文、报告、标准、专利、技术文档、非综合性书籍、官方文件等类型文献,行业领域的主管部门、协会、科研机构、企业、出版传媒机构等组织机构,以及由合成数据技术生成;在时效性方面,数据集中数据一般根据行业发展和管理需求变化,相对比较稳定,时效性高于通用知识,低于行业专业知识;在标注人员类型方面,数据集中数据通常由行业领域内具备一定学科背景或相关从业经历的人员标注;在敏感程度方面,数据集中数据的敏感程度较低,不涉及国家秘密、工作秘密、商业秘密、个人隐私等;在模型类型方面,数据集中数据用于支持开展通用模型、行业模型的开发和训练;在主题范围方面,数据集主要聚焦于行业领域内部,但也应考虑上下游及周边相关行业领域知识对于该行业知识的影响与补充,主题范围中等。行业专识数据集具有以下特征:在知识内容方面,数据集中数据所承载信息蕴含的知识聚焦于各行业领域组织机构内部的专业知识,以组织机构自身业务中从研发、生产、9管理、营销和服务等环节产生和积累的知识为主,面向内部业务人员,需要较深的专业背景和业务经验才能理解和运用。在数据来源方面,数据集中数据来源清晰,由组织机构日常生产经营生成和采集,主要来自组织机构内部的业务系统、管理平台等系统平台,或文档图纸等文献。在时效性方面,数据集中数据一般根据业务场景需求变化,满足数据处理及时性要求,时效性较高。在标注人员类型方面,数据集中数据通常由行业领域内具备深厚专业知识、丰富实践经验和高度权威性的专家标注。在敏感程度方面,数据集中数据的敏感程度较高,仅供内部特定岗位人员使用,应用前需要明确权限和授权。在模型类型方面,数据集中数据用于支撑开展行业模型的开发和训练;在主题范围方面,数据集主要聚焦于业务场景,主题范围较窄。(二)面向人工智能的数智产业链已经形成算力、算法和数据是人工智能的三个关键要素,长期以来,高耗算力、模型闭源和数据短缺一直制约着人工智能大模型的应用普及。2022年底,以OpenAI发布ChatGPT3为标志,人工智能正式进入大模型发展阶段;2024年底,以DeepSeek为代表的人工智能企业,实现了MOE等关键技术重大突破,并采取了模型开源策略,实现了“算力平权”和“算法平权”,突破了人工智能三要素中的两大要素制约;2025年底,OpenClaw智能体横空出世,“养龙虾”热潮席卷全球,促进人工智能大模型向通信、互联网、汽车、能源、推出Claud系列模型,彻底颠覆了以编程为主要手段的软件业和网络安全业,显著降低了成本,提高了效率,并优化了用户体验,人工智能大模型广泛应用的时代已经到来。任何一项技术在千行百业的落地应用都需要一个通俗易用的实施载体。正如计算机进入千行百业主要得益于应用软件的出现,如word、Excel、PPT、WPS等应用软件推动了计算机进入个人日常工作学习,ERP、MES、SCM等应用软件促进了计算机进入企业的日常生产经营活动,OA、HR、协同软件等应用软件推进了计算机进入政府的社会管理和公共服务事务。当前,智能体正成为人工智能在千行百业普及应用的应用载体。通过将行业通识高质量数据集“喂养”给通用大模型,形成行业大模型,再将行业高质量数据集“喂养”给行业大模型,形成应用于每一个企业、每一项业务、每一个流程、每一个环节的智能体,并实现智能体间的互联互通和群体协作,为成为人工智能在千行百业应个行业、交通运输领域的10个领域,以及全国政务领域,都正在加快开展行业大模型开发和智能体的应用。一方面是人工智能应用普及对数据资源需求日益迫切,另一方面是国家层面对数据资源开发利用制度供给不断加大,两端相向而行,已形成一条面向人工智能的数智产业链条,包括上游、中上游、中下游、下游、底座等五个环节。图6:面向人工智能体的数智产业链构成上游包括由公域数据加工形成的通用高质量数据集,以及依托通用高质量数据集训练生成的通用大模型。中上游包括由政务、金融、医疗、交通等各行业的私域数据,加工形成的行业通识高质量数据集,以及依托行业通识高质量数据集构建的行业大模型。中下游是机构、业务、流程运行过程中的行业专识高质量数据集,以及依托行业专识高质量数据集构建形成的两类智能体的应用工具:一类是作业流程长、动态变化快、实时性强的工业制造、具身智能等领域采用的具身智能体工具;另一类是业务精度高、静态变化慢、非实时业务的医疗诊断、药品研发、金融风控、公共服务等领域采用百具身智能体工具。下游则是数据作为关键生产要素,通过智能体在各行各业的应用。底座是运行这条“通识高质量数据集—通用大模型—行业通识高质量数据集—行业大模型—行业专识高质量数据集—智能体—千行百业应用”数智产业链的算力支撑——全国一体化算力网,包括算力标识、池化、并网、计量、监测、调度、运营、安全等。国家数据局联合国家发展改革委开展行业高质量数据集链主单位遴选活动,于2026年2月正式确定了72家行业高质量数据集建设链主单位,并与各链主单位正式签署链主工作任务书。2026年7月,国家数据局正式发布《关于推进行业高质量数据集建设行动的实施方案》,确定了强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放等六个专项行动,首次体系化部署行业数据集全链条建设。截止2026年3月,全国已建成高质量数据集超过11.6万个,模超过960PB,相当于中国国家图书馆数字资源总量的336倍左右。国家发展改革委于2025年启动实施国家人工智能应用中试基地建设,已选择电力、医疗、制造、交通、消费、教育、有色金属、具身智能、文化旅游等10个行业开展建设。国家网信办联合国家发展改革委、工信部发布《智能体规范应用与创新发展实施意见》,从夯实发展基础、守牢安全底线、强化应用牵引、建设创新生态等四方面对智能创新应用做了全面部署。图7:国家层面全面部署高质量数据集建设各行各业正加速实践高质量数据集和智能体应用。工业和信息化部在过去半年时间内,先后发布《“人工智能+制造”专项行动实施意见》《关于启动工业数据筑基行动开展面向人工智能赋能的高质量行业数据集建设先行先试的通知》选择了20个行业,打造100个行业高质量通识数据集和100个行业大模型;每个行业选择30个应用场景,共建设形成600个应用场景,每个场景打造3个行业专识数据集,共形2026年5月,国家能源局综合司正式印发《关于发布“人工智能+”能源高价值场景清单和组织开展试点申报工作的通值场景。2026年7月,交通运输部会同国家铁路局、中国民用航空局、国家邮政局、中国国家铁路集团有限公司发布了《“人工智能+交通运输”典型应用场景创新行动方案》(交科技发〔2026〕60号),提出在公路、铁路、航运、邮政等10个领域,开展人工智能场景应用;2025年10月,中央网信办会同国家发展改革委发布《政务领域人工智能大模型部署应用指引》,指导人工智能大模型在政务领域的规范应用。图8:各行各业加快高质量数据集建设各地区加大对高质量数据集建设的支持力度。近一年来,全国各地从省级到市级,补贴、奖励、数据券、语料券层出不穷,各地围绕高质量数据集建设,数据要素赋能人工智能发展,在政策、资金、平台等方面纷纷加码多重支持。北京市自2025年5月至2026年4月一年间,从经开区、北京城市副中心、西城区、石景山区等到经信局市级层面,围绕开放人工智能大模型训练数据集、建设高质量人工智能语料库和行业数据集、高质量数据集建设使用、高质量数据集建设并接入数据流通交易平台等,给予资金补助,最高补助金额可达200万元。贵州省于2025年11月发布《贵州省大数据发展专项资金支持数据产业重点发展方向(2025年版)》,提出支持建设高质量数据集。鼓励企业参与公共数据治理、标注等服务,打造一批高质量公共数据集。支持打造面向行业的高质量数据集,按不超过投资额的30%对建设主体给予不超过500万元一次性奖励。对在高质量数据集建设领域获得国家先行先试工作试点、国家优秀(典型)案例的项目,贵州省正式上线启动了全国首个省级数据工厂—贵州省数据集(语料)服务平台。上海市于2025年下半年,分别提出“对本市纳入国家数据基础设施建设第二批先行先试(高质量数据集方向)试点名单的牵头单位,给予50万元奖励。”最高500万元资助。”并围绕行业领域高质量数据集建设和高质量数据集工具链平台建设,启动高质量数据集先行先试湖南、广东、广西、海南、重庆、新疆等省(市、自治区)也推出了相应政策。(三)数智产业链还存在三个薄弱环节DeepSeek实现“算力平权”和“算法平权”后,“数据平权”已成为人工智能在千行百业普及应用的最后一个堡垒。而数据资源供给、高质量数据集建设和数据基础设施建设,是数智产业链上的三个薄弱环节,已成为决定人工智能落地应用水平的最关键因素。图9:数智产业链存在三个薄弱环节在互联网上能直接流通的数据只占全球数据总量不到4%,还有96%的数据都不能在互联网上直接流通,其中,16%是非结构化的多模态数据,另外80%是涉隐涉密的私域数据,这两类“供不出”的数据是高质量数据集构建和人工智能应全社会普遍缺乏付费使用数据的意识。一方面是社会公众和企业普遍习惯于免费获取别人数据,而不愿他人免费获取自已的数据;另一方面政府主体在现有政府信息化、数字化建设项目中,没有数据采购的预算,而公共数据开放没有财政支持,没有经费预算开展公共数据治理。非结构化数据采集难度大成本高。主要表现在三方面:一是非结构化场景是无限的,而非结构化数据极却度匮乏,甚至完全空白。二是标准难以统一,造成非结构化数据无法直接使用。三是非结构化数据标注自动化程度低,加工成本图10:数据“供不出”问题依旧突出目前,高价值的行业数据大都分散保存在各部门、各企业:一方面,难以实现数据资源集中化和规模化,导致数据使用率低,据统计每年未使用的数据占比约4成,各部门各企业对扩大数据资源保存规模的积极性低,无法形成高质量数据原料;另一方面,数据分散保存造成总体成本增加,缺乏规模效应,技术、管理和维护都需要重复投入。行业数据“存不好”的主要原因是,缺少完善的数据资源保存规范和指引,导致各行业数据保存规模和质量参差不齐。从公开渠道研究来看,欧美国家十分重视潜在价值数据保存的规范和指引,美国国家安全局明确电子通信数据的存储周期达100年;美国国家科学院院刊要求永久保存研究人员所有原始数据;荷兰要求医疗机构将医疗影像数据长期存储达100年。我国部分行业虽然在信息化阶段对部分数据制定了存储范围和存储周期,但主要是考虑数据安全而非数据价值挖掘,已经无法满足如今数智化阶段的需求。尤其是对于短期价值不明显,但具备长期潜在价值的数据不保存或者少保存,这也是导致当前人工智能中文语料严重不足的重要因素之一。图11:数据“存不好”现象普遍存在据京数智估算,过去4年全球企业人工智能采用率增长了270%,我国更是增长了320%。随着“人工智能+”和“数据要素×”不断发展和相向而行,人工智能重点正从优化模型转向提高数据集的质量。正如具有“人工智能之父”之称的吴恩达认为,“人工智能世界在这十年中需要经历的最重要转变将是转向以数据为中心的人工智能”。我国也正式开量数据集正处于起步阶段。图12:高质量数据集“作坊式”生产效率低下面向行业应用的高质量数据集供给严重不足。根据《全系统软件、人工智能产生的数据量为26.92ZB,首次超过摄像头、传感器等物联感知数据量的25.34ZB。然而,我国高质量数据集供给规模和质量差距巨大,海量数据与多样化场景优势的潜能远未充分释放。从数据到高质量数据集的进化是数据资源价值化的过程,须经清洗、标注、加工、分析等不同数据处理活动,但是,以下三方面问题严重阻碍了高质量数据集的构建。一是高质量数据集构建的投入产出不成比例。专业化数据的高质量标注需要庞大的资金投入且同时关联安全责任风险,这与数据应用的收益回报比例之间存在错位。二是行业领域公共数据场景化加工的程度与紧迫性不足,难以发挥公共数据对于数据开发利用的引领作用与催化作用。从现有国家政策来看,我国工业、医疗、交通、气象等具体场景的数据供给能力尚未作为专门对象加以细化规定,领域差异化数据统归于公共数据范畴的做法难以匹配垂直领域的细化要求。三是数据加工技术存在优化空间,专业人才供给难以充分满足需求,致使场景化加工效果欠佳。在数据标注自动化工程尚未成熟的阶段,将杂乱无序的低价值数据在工业互联网等特定场景加工为标准化、目录化、高价值数据资源需要高级别的专业技术技能,人工智能训练与推理阶段涉及多模态数据、高维度数据、跨领域数据,对计算机科学专业技术需求更加严苛,这为我国数据加工的现代化场景转向带来一定挑战。图13:行业高质量数据集供给严重不足数据“采存算管用”全过程生产供给方式落后。得益于多民族文化的包容特性与社会秩序的长期稳定,线上支付、电子商务、共享经济、电子政务、智慧医疗、工业互联网、低空经济、智能驾驶、具身机器人等多样化数据服务和应用场景,在我国具有良好的社会接受度与广阔的应用前景,我国大多数民众对跨场景数据应用持开放态度,数字化需求趋于多样,为数据赋能的技术突破与多领域数字创新的涌现提供了社会土壤。但是相比算力和算法日新月异的技术突破,高质量数据集的生产方式和供给水平略显滞后,特别是非结构化高质量数据集和行业高质量数据集的供给,已成为制约人工智能应用的直接瓶颈。主要表现在三方面:一是上游数据供给不足。非结构数据采集难度大,数量规模有限;公共数据等私域数据供给意愿不足。二是下游应用还未普及。全社会总体上处于信息化向数字化和智能化升级的换档期,人工智能的落地应用才刚刚开始,大多数企业对垂域大模型和智能体等人工智能落地工具还比较陌生,应用市场还远未打开。三是生产手段略显原始。当前高质量数据集构建工具缺乏,标准不统一,智能化程度低,表现出分散化、个体化、零碎化特点,远远不能满足智能体和垂域大模型的训练、调整、推理的需求。图14:数据生产方式落后海量数据在垂直场景的价值实现面临挑战。不同应用场景下,数据的格式、版本等特征性技术具有不同的数据标准实时监测的产业需求,在生产节拍精准同步等方面存在特定数据规范;在智能交通领域,位置、路况信息之外的视觉、雷达、激光测距等多样化数据融合及相应技术标准对高精度地图的更新则至关重要。然而,当前数据供给主要着眼于数量增加,尚未针对场景深入开展数据集标准化技术工程。数据技术标准与架构不统一增加了场景数据集成的复杂性,并可能引发数据误差、降低场景数据供给的整体质量。人工智能模型结构高速迭代的产业背景下,多模态模型所需图像、语音、文本、视频等数据形式的融合需求日趋关键。未来,细分场景下数据技术标准与架构的滞后效应可能进一步影响场景数据集的流通与复用,阻碍数据供给、流通、交易与价值实现。图15:垂直场景数据价值实现面临挑战(四)数据工厂是高质量数据集规模化生产的关键设施当前,高质量数据集建设大多由人工智能厂商自行构建,呈现零散式、作坊式、非标化等特点,远远不能满足人工智能大模型应用对高质量数据集的需求。借鉴水、电、燃料等资源型基础设施发展规律,亟需加快建设高质量数据集的规模化生产设施——“数据工厂”。图16:高质量数据集生产正从作坊式向数据工厂升级纵观人类社会发展史,水、电、燃料等在社会经济活动中发挥重要作用的基础资源,通常需要经过加工处理后才能被社会广泛使用,其规模化使用离不开资源型基础设施建设,例如水利基础设施、电力基础设施和油气基础设施。而资源型基础设施的发展需要供给、流通、利用三个环节的紧密协同:在供给环节,需要建设规模化的加工生产设施,如水厂将原水处理为自来水、电厂将一次能源转化为电力、石化企业将原油加工为成品油;在流通环节,需要建设覆盖广泛的传输网络,如供水管网、电网、油气管道;在利用环节,需要丰富多样的应用场景承载,如工业生产、居民生活等用电用水场景,公交车、私家车、工程车等用油场景。三者相互支撑、协同布局,水厂连着管网到用户、电厂连着电网到用户、炼油厂通过油气管道和加油站服务用户,共同构成资源型基础设施高效运转的完整体系。图17:资源型基础设施“供给-流通-利用”协同规律数据基础设施作为数智化阶段新的资源型基础设施,同2024年12月,国家发展改革委、国家数据局、工业和信息化部等联合印发《国家数据基础设施建设指引》,明确了国家数据基础设施的概念内涵、发展愿景和建设目标,为数据要素的高效流通提供了设施支撑。同时,各类数据基础设施试点示范、工程建设项目也在如火如荼进行。在利用环节,2025年10月,国家数据局综合司印发《关于在国家数据基础设施建设先行先试中加强场景应用的实施方案》,以建设、技术创新牵引驱动国家数据基础设施高水平建设,推供给环节,面向人工智能大模型训练推理的高质量数据集规模化生产设施建设仍是薄弱环节,亟需加快布局。图18:数据基础设施供给环节亟待加强3.数据工厂能为智能化应用持续提供“数据燃料”数字社会需要专门的数据加工生产设施——数据工厂,将海量原始数据加工处理为可供人工智能训练推理的高质量数据集,为千行百业的智能化转型提供源源不断的“数据工厂是社会化大生产的一种基本业态,并随着技术不断创新而持续迭代。在工业时代,水利、电力、交通等是经济社会运行的基础设施,水厂、电厂、车厂是工业社会的基本生产业态;在信息社会,网络、算力、系统等是经济社会运行的基础设施,网络厂商、算力厂商、软件厂商等成为信息社会的基本生产业态;到了数智时代,既能促进数据大规模流通又能确保数据安全的数据基础设施应运而生,以数据为生产对象的数据工厂正在成为数智社会的基本生产业态。图19:数据工厂是数智社会的新型生产业态数据工厂是人类社会进入数智化发展新阶段,面向人工智能大模型应用,开展高质量数据集设施化、规模化、标准化生产的数据基础设施。数据工厂是国家数据基础设施的基本构成单元,是突破人工智能发展瓶颈的有效手段,是高质量数据集的规模化生产设施,是数据全生命周期的综合产业二、国内外数据工厂探索实践概况高质量数据集是人工智能大模型训练的核心“燃料”,其多样性和质量直接决定了模型的能力水平和应用效果。当前,高质量数据集正从人工智能企业自建向设施化、规模化生产转型,数据工厂作为高质量数据集设施化生产的新型业态,正成为国家数据基础设施的重要组成部分,国内外已涌现出一批典型实践。(一)国外典型数据工厂概述美国和欧盟的许多数据企业都是与人工智能技术和应用伴生发展的,一直将人工智能可以识别和应用作为数据生产的目标,并不断创新出许多高质量数据集规模化、设施生ScaleAI成立于2016年,总部位于美国旧金山,起初是一家数据标注外包公司,2021年后发展成为专业的数据工厂。2021年获得美国军方2.5亿美元合同项目,将美国军方数据源接入其多诺万(Donovan)数据加工平台,对战场图像进行清洗、标注、特征提取、增强等数据处理,规模化生产战场高质量数据集,并通过该平台完成大模型训练和战场情报分析,开启了“数据工厂”建设的先河。此后业务迅速扩展到商业领域,主要客户包括OpenAI、英伟达、Meta、微软、美国国防部等。2024年12月,ScaleAI推出全新的AILab平年6月,Meta以143亿美元收购其49%股份。ScaleAI的高质量数据集生产设施主要由数据引擎、测试评估平台和AI应用平台三大类组成。数据引擎方面,ScaleAI针对不同应用领域构建了多个专业化数据引擎:通用数据引擎(ScaleDataEngine)提供数据收集、整理、标注、训练和评估的全流程服务,通过将AI技术与人机协同相结合提供高质量标注数据,并提供数据集管理、测试、模型评估和模型比较等工具套件;生成式AI数据引擎(GenerativeAIDataEngine)支持快速创建由领域专家策划的定制高质量数据集,提供Ops质量控制中心实时监控数据收集和管理,可访问由语言学家和程序员组成的全球专家网络,支持大语言模型的负责任开发;公共部门数据引擎(PublicSectorDataEngine)为国防、情报和民用机构提供AI支持,可标注文本、视频、地理空间、图像等各种数据类型,提供数据可见性和自然语言搜索等数据管理功能;汽车数据引擎(AutomotiveDataEngine)提供2D和3D数据标注,可处理来自多个传感器的数据,支持模型开发的基础阶段、改进阶段和目标阶段全过程,通过场景测试评估模型性测试评估平台方面,ScaleAI构建了完整的模型评估能力体系:公共部门测试与评估平台(PublicSectorTest&Evaluation)专门测试和评估AI的安全性、性能和可靠性,覆盖计算机视觉和大型语言模型两大领域,提供整体评估、人工专家评估、自动化基准评估等多种评估方法;企业生成式AI评估平台(GenerativeAIEvaluationforEnterprise)企业在生产环境中自信部署GenAI系统,通过系统性评估、改进和监控构建“信任反馈循环”,确保安全性和可靠性,避免偏见、幻觉、准确性差等问题。AI应用平台方面,ScaleAI提供从数据到应用的全栈服务能力:人工智能平台ScaleDonovan支持自定义、评估和部署AI代理,帮助客户在短时间内完成从概念到实战部署任务定制,主要面向国防领域,在作战人员最需要的时间和地通过无代码界面构建和自定义AI代理,支持访问数据源、创建知识库、利用最先进模型、分配代理指令以及连接现有系统和工具;测试与评估模块,比较不同模型的响应和性能指标,以严格的测试框架确保可靠性、安全性以及与美国国防部AI目标的一致性;代理Arsenal,提供符合美国国防部AI道德原则、专为问责制、速度和规模而设计的AI代理和应用程序库;生成式AI平台(ScaleGenAIPlatform)面向帮助客户在云上使用自有数据和任何模型构建优化解决方案,包括定制Copilots提升员工工作效率、客户支持增强客户体验、数据分析提取业务见解等功能,通过查询检索增强(RAG)技术准确总结和引用客户知识库。ScaleAI的典型特色包括以下几个方面:一是建立人机协同的数据标注模式,将AI辅助技术与领域专家相结合,实现高质量、可扩展、成本可控的数据标注服务;二是率先服务军方和国防领域,在战场图像判读、毁伤评估、态势感知等场景验证了数据工厂模式的可行性;三是构建了覆盖“数据标注—数据管理—模型评估—AI应用”全链条的服务能力,形成数据生产与模型优化、应用部署的完整闭环体系;四是建立了面向不同行业的专业化数据引擎矩阵,实现通用能力与垂直领域的有机结合。Project整体投资5000亿美元,计划于2029年完成。该项目旨在建设大规模AI基础设施,包括高性能计算中心和独立数据中心,为美国AI产业发展提供算力和数据支撑。星际之门项目的核心功能包括以下几个方面:一是建设独立的数据存储和处理中心,在硬件设施方面投资建设一批高性能计算中心,配备最先进的处理器、加速器和存储设备,为AI模型的训练和推理提供强大算力支持;同时打造容量可达20EB的独立“数据中心”,作为数据存储和处理的核心,主要用于存储文本、图像、视频等海量数据资源及算法模型检查点,确保数据的安全、高效和可扩展性;二是建立关键行业数据资源池,美国AI行动计划和国家级生命科学AI战略明确将“高质量数据”定位为“国家战略资产”,要建立关键行业的数据资源池,例如在生物领域计划建立一个全球领先的、AI-ready的生物科学数据资源池,该资源池覆盖联邦土地上包括微生物、植物、动物等所有生物域的全基因组测序项目,为训练下一代生物基础模型提供数据支撑,解决当前生物AI模型训练数据分散、规模有限、质量参差的星际之门项目的典型特色包括以下几个方面:一是投资规模巨大,体现国家层面对AI基础设施的战略重视;二是将高质量数据明确定位为“国家战略资产”,从国家安全高度推进数据资源建设;三是注重算力与数据的协同布局,同步推进计算中心和数据中心建设。2024年10月21日,德国施瓦茨数字公司和德国铁路公IT、人工智能初创企业阿勒夫-阿尔法公司、德国人工智能研究中心和达姆施塔特工业大学等众多合作伙伴参与。该中心是一个旨在为人工智能模型训练提供数据汇集与处理、安全训练环境、数据合规保障等数据支持的数字化平台,核心目标是增强欧洲在AI领域的自主性,让欧洲摆脱对海外数据提供商的依赖。欧洲数据中心的核心功能包括以下几个方面:一是数据聚合与处理,将自动驾驶、医疗、遥感、制造业等多个关键领域的海量数据汇集到平台上,利用先进的数据处理技术进行整理,确保数据的准确性与高质量,以满足AI模型训练的需求;二是提供安全与合规的训练环境,特别强调数据安全和隐私保护,利用区块链等新兴技术保障数据的透明性和安全性,符合欧盟的严格法规(如GDPR);三是支持多模态数据处理,平台设计支持图像、文本和音频等多种数推动多模态AI模型的发展;四是数据生态建设,致力于汇集来自德国乃至欧洲的工业、科技和媒体等领域的数据,为本地企业提供在安全平台上训练AI模型所需的数据。欧洲数据中心的典型特色包括以下几个方面:一是采用政企合作、产学研联合的建设模式,整合了企业、研究机构和高校等多方力量;二是强调数据主权和安全合规,为欧洲企业提供符合本地法规的数据训练环境;三是定位于服务欧洲本土AI产业发展,减少对海外数据提供商的依赖。为充分发挥人工智能的潜力,欧盟委员会在2025年下半年推出新的数据联盟战略(DataUnionStrategy),重点加强欧盟数据生态系统的互操作性和数据可用性,解决人工智能模型训练和验证所需高质量数据稀缺的问题。作为该战略的核心举措,欧盟提出建设数据实验室(DataLabs),将其定位为欧洲人工智能基础设施的关键环节和人工智能工厂的有机组成部分,专注于汇聚来自不同来源的高质量数据。欧洲数据实验室的核心功能包括以下几个方面:一是数据整合与共享,将分散的行业数据源,如医疗、能源领域数据,整合为可信、易访问的资源,并与欧洲共同数据空间相连,在适当条件下向人工智能开发者提供;二是技术支持服务,提供数据清洗、标准化格式、合成数据生成等工具,以及安全的数据交换和访问管理解决方案,降低技术复杂性和成本;三是促进跨领域合作,通过连接公共部门、企业、研究机构,支持跨行业数据协作,并利用《数据治理法案》框架中的可信数据中介,帮助公司在遵守反垄断规则的前提下共享数据;四是与人工智能工厂协同,数据实验室与AI网络,如欧洲超级计算中心联动,为训练百万亿参数级别的复杂AI模型提供数据支撑。欧洲数据实验室的典型特色包括以下几个方面:一是与欧洲共同数据空间深度融合,实现数据资源的互联互通;二三是注重多语言数据资源建设,2025年3月启动的语言技术联盟(ALT-EDIC)汇集17个成员国建立高质量语言资源综合存储库,弥合多语言数据差距并保持欧洲的语言和文化多ParseBiosciences专注于单细胞RNA测序,生成高质量生物医学数据集。近期与西奈山医学院合作,建立全球最大的阿尔茨海默病和帕金森病单细胞数据集(1000万+细胞采用Evercode化学技术提高测序效率和准确性。Bioptimus专注于病理学AI数据集建设,开源发布H-optimus-0模型(11亿参数基于50万+病理切片训练,应用于癌症检测、生物标志物分析等领域,未来计划整合基因组学、蛋白质组学等多模态数据。NOAA及空客高分辨率影像(0.5米精度应用于农业、环境监测、灾害响应等领域,客户包括嘉吉(Cargill)等企业。(二)国内典型数据工厂概述近两年来,我国数据要素化进程不断加快,人工智能应用快速拓展,高质量数据集供给充沛,涌现出一批以数据工厂为代表的高质量数据集专业生产机构,并正在成为国家数据基础设施的重要组成。崖州湾国家实验室自成立以来,始终聚焦国家种业重大战略需求,致力于突破种源关键核心技术。“繁|未来农业智能枢纽”是由崖州湾国家实验室主导开发的面向农业育种领域的AI全链条技术体系与智能基座,含育种智能体、种业数据集、工具集及软硬件基础设施,通过构建多地多中心的统一数据平台,汇聚1三亚总部+N个全国基地的多源头农业数据,建立覆盖基因组学、表型组学、环境组学的标准化数据集,实现多模态种业数据的标准化归集,并结合数据加工、应用编排、模型工程等工具集,旨在解决农业科研中数据量大、复杂及工程化难题,打造出行业专属育种智能体,州湾国家实验室发布面向农业育种领域的AI智能基座——“繁|未来农业智能枢纽”。“繁|未来农业智能枢纽”的核心功能包括以下几个方面:一是建设包含育种智能体、种业数据集、工具集及软硬件基础设施在内的完整技术体系,确立“数据—知识—工程”阶梯递进能力,通过数据编织、数据护照、智能体及可信安全技术,实现五级数据集的自动化生产、动态治理与可信共享。二是为农业数据建立“星链级”全局文件系统,汇聚全国多源头农业数据,构建战略作物数据库,覆盖基因组学、表型组学、环境组学,提供高质量育种语料,已上线8类数据库、3000+基因组,35000+样本数。三是是构建农业开源多智能体平台,已上线FAN文献智能体和FAN分析智能体,具备基于语义理解的智能文献检索,支持自然语言查询,分析研究热点和发展趋势,为科研方向提供决策支持,数据关联筛选、自动化编排分析、建模验证及智能决策能力,实现跨地域、跨设备的数据调度与高效检索。“繁|未来农业智能枢纽”超级数据工厂的典型特色包括以下几个方面:一是重塑育种流程,提升30%效率;二是汇聚全国数百PB的育种数据,实现数据互联共享,制定生物育种领域统一术语体系,建立行业级数据交换协议,制定数据格式、接口规范、安全协议等行业标准,确保不同育种机构、科研团队之间能够安全、高效地共享数据和算法资源,生成高质量育种数据集。三是构建全球最完整的育种知识网络,打通全球大田与实验室数据,整合全球育种研究成果,构建基因-表型-环境的多维知识图谱,揭示育种要素间的复杂关联,为智能育种决策提供知识支撑。四是构建农业开源多智能体平台,构建行业共识的知识框架,定义智能体在育种中的协作模式,设计智能体之间的协作协议与任务编排机制,实现文献检索、数据分析、预测建模等AI能力的无缝协同,构建端到端的智能育种工作流。贵州主枢纽存力中心暨数据要素保障基地(以下简称“保障基地”)依托全国一体化算力网络国家(贵州)枢纽节点建设,定位为国家级数据要素保障基地,旨在汇聚跨区域、跨层级、跨行业、多模态数据资源,面向千行百业提供数据全生命周期服务,实现“算力-数据-算法”存算并举、数算用一体的发展模式,走出一条以数据驱动、场景牵引、安全保障,存算并举、数算用一体化发展的新路径,按照“算、数、模、用”融合思路,提供高质量数据集面向政府、企业等多场景。保障基地的核心功能包括以下几个方面:一是构建以存力中心为节点的高速网络架构,通过重塑数据流通路径,将存力中心打造为数据汇聚、处理、流通的超级节点,实现数据流通安全与效率的双重提升。构建多维度、多模态的数据融合平台,为数据分析、挖掘和应用提供便利。二是提供数据要素服务融合数据安全保障方案,打造城市可信数据空间,在数据处理、数据开发、数据资产入表等核心数据要素服务的基础上,深度融合数据空间构建、防勒索安全、跨域数据流动等数据安全保障服务能力。三是推进多领域业务融合应用创新,以九大应用场景为切入点,引入专家学者科研数据、交通领域汽研数据、医疗领域影像数据、教育领域教学数据、智慧物流仓储数据等垂直行业数据,构建行业AI大模型训练高质量数据集。保障基地的典型特色包括以下几个方面:一是依托国家枢纽节点建设,具有明确的国家战略定位,存算一体,智算优先,加速高质量数据供给和使用;二是提出“以数为核、场景为引、以数促产、以产育企、以企兴业”的运营理念,东数西训”战略任务,探索“西数东送”创新模式,推进与中国汽研、温州大数据集团等东西部节点城市企业的合作,存算用户90%以上来自省外,已形成“东数西算”“东数西训”“东数西渲”等多元服务模式和产业发展模式,促进东西部资源优化配置与区域协调发展。3.库帕思“语料超级工厂”上海库帕思科技有限公司是一家由上海信投牵头、联合11家单位组建的人工智能语料数据平台型企业,形成“1125”业务架构和“一业一方法、一业一指引”的数据生产流程,支撑“语料超级工厂”的运作。库帕思构建了“1125”业务架构。一是1个语料基座,构建“1+X”模式的综合语料库并链接多个行业语料库,既能服务基础大模型,也能有效降低垂类模型的应用成本;二是1个语料运营平台,对标国际先进实践,构建“采、洗、标、测、用”五位一体的工具体系,2025年世界人工智能大会上发布的语料工具链平台2.0包含403个功能模块,支持从数据采集到最终交付的全流程;三是2大战略基础体系,包括基于世界知识体系语料构建方法的“语料魔方”体系,以及对标模型“有德、有趣、有序、有品、有用”五有标准的基石语料库和测试集;四是5项可持续发展能力,包括智能清洗与质量保障能力、智能合成与价值对齐能力、场景适配与知识修正能力、可信流通与跨域治理能力、生态服务能力。围绕语料运营平台,形成多模态数据采集—智能清洗与去噪—智能预标注—多维质量评测—标准化交付的语料生产全流程闭环系统。库帕思的典型特色包括以下几个方面:一是形成“一业一方法、一业一指引”的标准体系,与金融、教育、医疗、法律等不同行业深度适配,制定语料库建设导则和技术白皮书;二是注重数据安全与价值对齐,构建多维度价值对齐的语料体系;三是采用平台型企业模式,由国资牵头、多单位联合组建,积极与产业伙伴合作推进语料数据的商业化。京津冀数据要素产业园人工智能数据工厂(简称:数据要素产业园)位于霸州经济开发区,总投资2.6亿元,拥有100PB存力,定位为"数据要素跨区域流通试验田"和"京津冀数据要素价值转化枢纽"。数据要素产业园自启动试运营以来捷报频传,3个月上线可用存力25PB、签约合同额突破2000万元。凭借区位、运营、技术、产业四大核心竞争力,产业园以强劲势能,发展成为京津冀数据要素产业高质量发展的亮眼名片。产业园立足霸州电子信息产业基础,打造“数据+研发+制造”融合生态,可有效承接京津雄研发数据外溢,提供数据标注、模型训练、仿真测试等专业服务,助力科技成果转化周期缩短30%以上。数据要素产业园紧扣“1-4-3-N”架构体系(1个存力中心为承载,4个能力中心为基础,3类可信空间为保障,打造N个行业数据应用场景)建设,构建数据采、存、算、管、用全生命周期服务能力,形成存力租赁、数据服务、产业生态三大业务板块,价值变现能力持续释放。数据要素产业园核心功能包括以下几个方面:一是1个全场景可信存力核心底座,已接入政务、医疗、新能源汽车等数据超1PB。二是据治理引擎,实现了数据归集、清洗、脱敏、标签、质控全流程自动化处理,覆盖数据全生命周期服务。三是3类可信空间,构建城市公共数据、行业产业链、企业隐私计算三维协同体系,试点数据分级分类、确权登记、交易溯源等标准规范,实现数据“可用不可见、可控可计量”,为数据跨域流通与交易提供合规保障。四是N个应用场景,以高质量数据支撑新能源汽车、食品安全、智慧物流等行业大模型开发京津冀数据要素产业园人工智能数据工厂(霸州)的典型特色包括以下几个方面:一是清晰的顶层设计与系统的整体规划,立足自身京津雄核心腹地的区位优势,明确将存力中心作为华北数字化、智能化转型的支点,将自己打造为所有数据流转的关键枢纽。这种统筹规划的思路,让霸州的数字转型不盲目、不零散,从根源上确保了各项工步推进。二是全场景可信存力,项目构建从芯片、硬件到系统软件的全国产化信创技术体系,打造加密传输、访问管控、数据脱敏、容灾备份、审计溯源等八大安全保障,为数据全生命周期筑牢了安全屏障。三是数据要素产业园立足霸州电子信息产业基础,打造“数据+研发+制造”融合生态,可有效承接京津雄研发数据外溢,提供数据标注、模型训练、仿真测试等专业服务,助力科技成果转化周期缩短30%以上。三是食安领航加速可信数据价值释放,数字经济与实体经济深度融合,如“霸州云厨”依托存力中心的数据汇聚、治理与流通能力,建立起覆盖从田间生产基地到学校餐桌的全链条数据汇聚机制,让每一份食材都有了数字身份证;存力中心支撑的各类数字化工具,可以让消费者清晰查看食材的产地、加工、流转全过程,彻底打消顾虑,建立起霸州食品的品牌与口碑。广东省先进存力中心,依托韶关数据中心集群进行建设,项目首期建设20PB存力,秉持“存得下、存得好、存得安全”理念,立足数据储备与流通基地、AI语料中心、数据开发基地、产业聚集高地、人才创新平台“五大定位”,围绕“存—聚—算—产—育”闭环,打造覆盖数据全生命周期的产业链,实现数据高效治理与市场化应用,通过安全可信的存储体系与跨域复用机制,建设异构数据治理工厂和AI资源目录,支撑人工智能发展。广东省先进存力中心核心功能包括如下几个方面:一是省级数据资源整合与价值释放中心,同时汇聚跨区域、跨层级、跨行业、多模态数据资源,面向全市、全省的政府单位和各类企业提供数据采集、存储、清洗、标准化、标注等数据全生命周期服务。二是广东省先进存力中心依托国家“东数西算”工程十大集群之一、粤港澳大湾区唯一的韶关数据中心集群,通过“算力不动、数据高效流动”模式,与韶关公共算力服务平台及智算中心联动,提供存算力调度及运营服务。三是依托可信存力资源构建“1+N”数据标注产业体系,提供智能标注服务并接入全国公共服务网,打造多源汇聚、安全可信的数据智能标注生态。广东省先进存力中心的典型特色包括以下几个方面:一是构建数据交易闭环生态,中心采用“前店后厂”模式,联动广州数据交易所(韶关)服务基地,推动数据合规登记与交易流通,构建良性闭环生态,探索供应数据交易模式,畅通数据要素流通渠道,建成广州数据交易所(韶关)服务基地,现已吸纳37家会员单位,上架涵盖农业、气象、文旅等领域的48个数据标的,并有7款数据产品完成合规登记。二是打造粤港澳大湾区数据应用产业园,推动数据与实体经济深度融合,联合数据应用企业创新应用场景,拓展数字经济发展空间,赋能智能矿山无人值守、智慧文旅流量监测及医疗、汽车、教育等行业数据开发利用,助力韶关工业老城向“绿”向“新”突围,持续释放文旅数据价值,为韶关打造粤港澳大湾区乃至世界级旅游目的地品牌提供坚实支撑。帕西尼具身智能超级数据工厂(SuperEIDFactory)位于天津市河西区空天数字产业园,由帕西尼感知科技(深圳)有限公司投资建设,于2025年6月23日正式启用,是全球规模最大的具身智能数据采集与模型训练基地。工厂建筑面积近12000平方米,部署了150个标准化采集单元,每个单元都配备了帕西尼自研的高精度数据采集设备。帕西尼具身智能超级数据工厂的核心功能包括以下几感器-灵巧手-人形机器人”技术矩阵及VTLA全栈式技术体系,自主研发6D霍尔阵列式多维触觉传感技术,构建了覆盖汽车制造、3C装配、家庭、办公、餐饮、商超、康养、医百万道工序;二是大规模高质量数据生产,工厂预计每年可生产近2亿条包含丰富维度的高质量训练数据,汇聚成全模态数据集,为行业提供标准化的数据基座;三是攻克行业核心瓶颈,工厂产出的数据特别注重填补触觉模态数据的空白,并通过与视觉等信息的对齐,重点解决智能体在未知场景中表现不佳的泛化性差问题;四是驱动模型与产业生态进化,工厂产出的高质量数据用于喂养和升级帕西尼自研的VTLA(视觉-触觉-语言-动作)具身智能模型,形成“数据喂养模型、模型指导采集”的共生飞轮,同时数据能力面向全球产业生态开放,助力整个行业的发展。帕西尼具身智能超级数据工厂的典型特色包括以下几个方面:一是首创“无本体依赖”数据采集技术,通过捕捉真人在真实场景中完成复杂任务时的手部动作姿态、空间轨迹和力学交互信息来采集数据,摆脱了对特定机器人硬件的依赖,显著降低数据生产成本并提升数据通用性;二是自主研发多模态神经织网技术(NeuralMesh),将高精度触觉数据与视觉、关节角度、语音等信息进行同步融合,形成丰富的多模态数据;三是开发体感重定向系统(SomaRedirect能将采集自人类的数据有效适配并“重定向”到不同结构、不同型号的机器人本体上,攻克模型跨本体泛化的行业难题。1)上海徐汇区“模速空间”2023年9月28日,上海“模速工智能大模型产业生态集聚区在徐汇西岸揭牌。截至2025年5月,核心承载区6万平方米空间内已集聚近50家具身智能、科学智能、应用智能等多个技术领域企业,整个20万平模速空间汇聚了上海人工智能实验室、中国信息通信研究院等功能平台,周边集聚徐汇滨江七大百万平方米量级科创磁场,阿里、腾讯、网易等科技巨头,商汤、阶跃星辰、稀宇科技等AI独角兽,形成强劲创新矩阵。通过打造算力服务、开放数据、评测服务、金融服务、综合服务等全要素功能平台,拥有上海全部五大基础模型、千亿产业基金、万卡算力和丰富语料供给,为入驻企业提供创新要素高效组织和全方2)北京经开区“模数世界”北京经开区“模数世界”是北京经济技术开发区打造的人工智能创新产业社区,以大模型和数据要素为核心驱动,依托国家信创园7号楼为核心、周边50万平方米办公楼宇为创新空间,构建人工智能创新生态服务体系和开放场景应用平台。提供首月免费的共享算力池支持算法训练和模型开发,搭建场景验证实验室加速技术从研发到商用的转化,组建千亿级融资生态支持企业全生命周期发展,推出“AI二十条”专项政策每年提供数亿元资金支持产业发展,提供“拎包入住”政策礼包包含舒享办公空间和算力资源等服务。3)珠海市“模数空间”珠海市“模数空间”于2024年9月启动运营,是一个集技术研发、模型应用、数据交易、算力服务、展示交流为一体的人工智能大模型应用高地。聚焦人工智能全产业链,涵盖边缘计算AI芯片、数据标注、算力中台等关键技术,提供数据确权、授权、交易等全流程服务,并整合算力资源支持计划打造超100个垂类行业应用,其中无界方舟发布方舟大模型2.0及多语言机器人产品,深译科技推出全国首个高价值AI算料数据资产包。4)北京石景山区“大模型超级工厂”百度智能云千帆大模型产业(北京)创新基地服务平台是北京首座生产大模型的“超级工厂”,由百度与石景山区于2024年11月5日在石景山人工智能大模型产业集聚区联合创建。创新基地可为大模型和AI原生应用的开发者提供从数据管理、模型精调、模型评估到推理服务部署的全链条工具平台,配套“管家式”技术服务,助力企业孵化、技术服务和产业人工智能赋能。创新基地已集聚十余家具备行业大模型训练和垂直领域应用开发能力的企业,累计完成120余次模型训练,模型训练和推理消耗tokens数超过6亿,在营销、客服、应急等领域打磨场景应用。(三)国内外数据工厂发展现状总结从国内外数据工厂的发展实践来看,高质量数据集的设施化、规模化生产已成为全球共识,各地各行业建设的存力中心、模速空间、语料超级工厂等新业态正加速向数据工厂演进,并在供给、生产、应用等环节形成了可资借鉴的成熟国内外数据工厂普遍重视原始数据的稳定获取,形成了多元化的数据供给体系。一方面,通过政企合作、产学研联合等方式拓展数据来源,如欧洲数据中心整合了德国铁路、云服务商、人工智能企业、研究中心和高校等多方资源,欧洲数据实验室与欧洲共同数据空间深度融合实现数据互联互通;另一方面,依托行业龙头企业和专业机构汇聚垂直领域数据,如帕西尼构建了覆盖汽车制造、3C装配、家庭、餐贵州保障基地引入科研、交通、医疗、教育、物流等多个垂直行业数据。这些实践表明,建立稳定、多元、可持续的数据供给渠道是“数据工厂”运转的基础前提。国内外数据工厂在数据加工处理环节已形成较为成熟的设施化生产模式。在生产设施方面,ScaleAI构建了覆盖通用、生成式AI、公共部门、汽车等不同领域的专业化数据引擎矩阵,帕西尼部署了150个标准化采集单元、预计年产近2亿条高质量训练数据,库帕思形成了包含403个功能模块的语料工具链平台。在生产流程方面,各“数据工厂”普遍建立了从数据采集、清洗、标注到质检的全流程生产体系,如库帕思形成了“多模态数据采集—智能清洗与去噪—智能预标注—多维质量评测—标准化交付”的闭环系统。在技术手段方面,人机协同、AI辅助标注、智能质检等技术得到广泛应用,显著提升了数据生产效率和质量。图38:数据工厂生产环节-设施化、规模化、智能化“三位一体”国内外数据工厂普遍以服务人工智能模型训练为核心目标,形成了“数据生产—模型训练—应用反馈”的良性循Meta、微软等头部AI企业,帕西尼产出的数据用于喂养自研的VTLA具身智能模型,库帕思构建的语料库既能服务基础大模型也能降低垂类模型应用成本。在应用场景方面,各数据工厂面向具身智能、自动驾驶、医疗诊断、国防安全等人工智能重点应用领域提供定制化数据集,如ParseBiosciences建立了全球最大的阿尔茨海默病和帕金森病单细胞数据集,笛卡尔实验室为农业、环境监测、灾害响应等领域提供遥感数据服务。在迭代优化方面,部分数据工厂已建立模型评估模型指导采集”的共生飞轮。三、数据工厂的涵义、类型和特点(一)数据工厂涵义数据工厂不仅是高质量数据集规模化生产设施和新型业态,也是国家数据基础设施的重要组成部分。数据工厂提供面向大规模数据资源的存储、治理、加工、流通等服务能力,能够显著降低数据归集、存储、加工和治理成本,为人工智能训练场提供规模化高质量数据集。数据工厂是高质量数据集规模化供给的关键设施,是推动行业数据资源和区域数据资源有序汇聚沉淀、高效开发利用的重要载体。图40:数据工厂能为智能化应用持续提供“数据燃料”国家数据基础设施是一个“供得出、流得动、用得好、保安全”的数据安全流通环境,其根本目标就是在这个安全流通环境中,能将高价值的数据流通出来,以赋能人工智能应用。而数据工厂就是通过搭建一个安全环境,将原始数据加工成高质量数据集,并应用于人工智能训练和推理等各种场景。因此,数据工厂本质上就是数据基础设施的最小组成单元,每一个数据工厂就是一个“微型”的数据安全高效流通环境,当众多生产高质量数据集的数据工厂建设起来,并通过“三统一”标准规范实现互联互通后,横向联通、纵向贯通、协调有力的国家数据基础设施就形成。当前,高质量数据集的供给规模远远跟不上算力和模型的技术迭代速度,成为制约人工智能技术水平提升和应用领域拓展的关键瓶颈。一个重要原因是,一方面这些数据是业务发展的“副产品”,数据“采存算管用”等数据治理活动是企业的“副业”,而大多数企业数据加工处理能力弱,高质量数据集生产能力不足而无力提供;另一方面高价值数据往往与企业核心业务紧密耦合,有加工能力的机构很难获得这些高价值数据进行处理并对外提供。建设独立业态的数据工厂,通过数据脱敏、匿名化处理等手段,实现数据与业务解耦,并通过专业化、规模化的社会大生产方式,能实现高质量数据集的规模化生产和供给,从根本上突破人工智能技术水平提升和应用范围拓展的“最初一公里”瓶颈。数据工厂建设和运营的最终目标就是能规模化生产高质量数据集。与当前高质量数据集生产方式相比,数据工厂具有三个显著特点:一是设施化。数据工厂作为国家数据基础设施的基本组成单元,将当前各行业、各企业使用的各种技术、工具进一步规范化、平台化、设施化,形成智能化、自动化的采集汇聚、清洗标注、加工处理、检验测试等工具化生产高质量数据集是数据工厂的第一个特点;二是规模化。作为一种独立的数据生产业态,数据工厂不再是传统企业的副业,也不再是人工智能企业不得不兼顾的非核心环节,数据是数据工厂的核心业务,其生产原料是海量的多元异构的原始数据,最终产品是大规模的、业态多样的、各种类繁多的高质量数据集。因此,规模化生产高质量数据集是数据工厂的第二个特点;三是标准化。数据工厂是数智社会的一种通用生产业态和商业模式,在生产工具、生产流程、生产过程等方面的标准化程度较高,其生产的高质量数据集不仅仅要满足个别人工智能企业的需求,更多的是面向各行业各领域各企业的需要,提供全社会各类主体都能使用的高质量数据集。因此,标准化生产高质量数据集是数据工厂的第三个当前,数据产业包括数据资源企业、数据技术企业、数据应用企业、数据服务企业、数据安全企业和数据基础设施企业等六种业态,还未形成一个独立的产业形态,对数据要素化价值化的支撑作用还未充分发挥出来。数据工厂通过数据编织、密态计算、隐私保护计算等数据安全流通技术,构建起数据安全流通环境,并从数据采集汇聚的源头做起,通过研发突破数据清洗、标注、增强、检测等核心数据技术,创新形成各种以高质量数据集为主的数据产品和服务。数据工厂的生产流程覆盖了数据产业全部六种形态,是数据产业的综合产业形态。发展数据工厂对加快打造独立数据产业形态,为数据要素化价值化形成全面产业支撑,具有极其重要(二)数据工厂类型根据物理分布、组织方式和技术水平等特征,数据工厂可以分为集中式数据工厂、半集中式数据工厂和分布式数据工厂等三种不同类型,数据工厂的三种形式特点各异、各有优势,并将在今后很长一段时间内长期共存。集中式数据工厂是指将“供应-生产-交付”等数据加工生产全过程,都集中在一个固定物理区域内的数据生产业态。集中式数据工厂最大的特点就是“物理集中”,即数据资源集中供给、数据生产集中加工、数据产品集中交付。集中式数据工厂是未来五年之内数据工厂的主流方式之一。欧洲数据中心以德国、英国、荷兰、爱尔兰等国为核心,集中部署了数百个超大规模数据中心,并在GDPR数据主权法规驱动下持续扩张,2025年欧盟进一步提出300亿美元兆瓦级AI数据中心建设计划。帕西尼具身智能超级数据工厂于2025年6月在天津投用,占地近12000平方米,是全球最大的具身智能数据采集与模型训练基地,通过150个标准化采集单元年产近2亿条多模态训练数据,将数据采集、加工与交付集中于同一物理空间[14]。库帕思语料超级工厂是上海市组建的国内首家AI语料战略性平台企业,以集中化方式将原始数据加工为高质量大模型训练语料,日生成语料接近1TB,覆盖具身智能、金融、医疗等多个行业领域[15]。贵州主枢纽存力中心数据要素保障基地依托国家“东数西算”工程,以贵安新区为核心采用“前店后厂”模式,集中汇聚47个重点数据中心,可调度算力达4.5EFLOPS、存力980PB,是面向全国的算力保障枢纽。这些项目和工厂都是集中式数据工厂的典型代表。半集中式数据工厂是指采用相对一致的技术、工具、平台和方法,在不同区域开展不同行业领域、不同应用场景的数据规模化生产方式。半集中式数据工厂最大的特点就是“技术平台统一、加工场所分散”,即,将相对

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论