数据工厂白皮书_第1页
数据工厂白皮书_第2页
数据工厂白皮书_第3页
数据工厂白皮书_第4页
数据工厂白皮书_第5页
已阅读5页,还剩140页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

数据工厂白皮书2026年7月版权声明本白皮书版权由北京交通大学、北京化工大学、华为技术有限公司、北京数据集团、贵州大数据产业集团、北京物资学院、清华大学、北京大学等编制单位(详细名单见下页)共同拥有,并受法律保护,转载、摘编或利用其他方式使用本报告文字、图表或观点的,应注明“来源:《数据工厂白皮书》”,违反上述声者,将追究其相关法律责任。编制单位牵头单位:参编单位:华为技术有限公司、浙江蚂蚁密算科技有限公司、上海零数科技有限公司、杭州安恒信息技术股份有限公司、北京京数智科技开发有限公司、北京数据集团有限公司、贵州大数据产业集团有限公司、内蒙古大数据产业发展集团有限公司、苏州算力科技集团有限公司、横琴金融投资集团有限公司、海南数据产业服务有限公司、四川数据集团有限公司、成都数据集团股份有限公司、湖州市数据科技集团有限公司、东莞市人工智能与数字经济集团有限公司、北京国际大数据交易所、江苏省数据交易所、中国煤炭地质总局、南京钢铁集团有限公司、清华大学公共管理学院未来政府治理中心、清华大学计算社会科学与国家治理实验室、清华中国电子数据治理研究院、北京大学大数据分析与应用技术国家工程实验室、北京交通大学经济管理学院、北京交通大学信息管理与理论国际研究中心、北京化工大学经济管理学院、北京化工大学信息化绩效评估中心、北京物资学院、北京邮电大学经济管理学院、北京软件和信息服务业协会、呼和浩特市互联网协会、中国国际经济咨询有限公司、四川省大数据发展研究会编写人员主编人:参编人:杨文道、王旭东、王振、张震、翟爽、秦立都、朱建红(华为)张真继、刘世峰、宫大庆(北京交通大学)张闯(北京物资学院)韦韬、刘前伟、潘无穷、李婷婷(蚂蚁密算)王磊、童君、杨珍(零数科技)刘博、陶立峰、周俊、张强、段平霞(安恒信息)王仕品、刘军、王似巍(贵州省大数据产业集团)晋梁昊(北京数据集团)温天宁、叶航辉(北京大数据国际交易所)王刚、吉日木图、王阳(内蒙古大数据公司云霄、许军毅(中国煤炭地质总局)王芳、孙茂杰、徐发喜(南京钢铁集团有限公司)陈军、纪昌秀、蔡文俊(苏州算力公司)方树财、余祥臣、罗丽琪(东莞人工智能与数字集团)谢辉、杨舒、周苏宁(横琴金融投资公司)续新颖、于嘉南、郭静雯(江苏省数据交易所)邓建平、李泉、王斌(成都数据集团)漆骏锋(四川省数据集团)黄健强、施幸汝、梁钰(海南数据公司王震、陆斌霄、刘思佳(湖州数据集团张少彤(清华大学公共管理学院未来政府治理中心王理达(清华中国电子数据治理研究院)张影强(清华大学计算社会科学与国家治理实验室)徐克付、易典馨、孙震(北京大学大数据国家实验室)王友奎、易兰丽、魏娜(北京邮电大学经济管理学院)龙飞、郝峥嵘、刘莉(北京软件和信息服务业协会)张晓宇、陈浩(呼和浩特市互联网协会)秦强子、张锐(四川省大数据发展研究会)傅毅明、王隆泰、李虹霞(中国国际经济咨询有限公司)目录前言 xii一、数据工厂新业发方兴未艾 1(一人智已展奇点刻 1(二面人智的智产链经成 9(三数产链存三个弱节 16(四数工是质数据规化产关设施 25二、国内外数据工探实践概况 30(一国典数工概述 30(二国典数工概述 42(三国外据厂展现总结 62三、数据工厂的涵、型和特点 65(一数工涵义 65(二数工类型 69(三数工特点 73四、数据工厂的构、位和功能 77(一数工及构成 77(二广数工及构成 79(三狭数工及构成 83五、数据工厂的建、营和部署 105(一数工的设式 105(二数工的营制 111(三数工的署略 114六、发展数据工厂业政策建议 118(一加制促数工厂展策 118(二启数工相标准制 120(三突数工关技术颈 122(四加数工支平台设 124图目录图1:词调量发增长 1图2:人智推数应用首超训数应用量 2图3:计驱成数生产主方式 3图4:智体量过人类对HTML网的流量 4图5:从据源高数据到质数集 6图6:面人智体数智业构成 11图7:国层全部高质数集设 13图8:各各加高量数集设 14图9:数产链在个薄环节 17图10:据“供出”依旧出 18图11:据“存好”普遍在 19图12:质数集“坊式”生效低下 20图13:业质数供给重足 22图14:据产式后 24图15:直景据实现临战 25图16:质数集正从坊向据厂级 26图17:源基设“供给流通利”同律 27图18:据础施环节待强 28图19:据厂数会的型产态 29图20:ScaleAI数工架构 31图21:国际门工厂构 34图22:洲据心工厂构 36图23:洲验数厂架构 38图24:ParseBiosciences数据厂构 40图25:Bioptimu数工架构 41图26:卡实室工厂构 42图27:州国实“|来业能纽”级数工架构 43图28:州枢存心暨据素障地据工架构 46图29:岶语超厂架构 48图30:津数要业园工能据厂构 50图31:东先存心数工架构 53图32:西具智级数工架构 55图33:海汇模间架构 58图34:京开模界架构 59图35:海模空构 60图36:京景区型超工架构 61图37:据厂给-多稳的据源道 63图38:据厂产-设化规化智“三一” 64图39:据厂用-以AI应为标 65图40:据厂为化应持提“据” 66图41:据厂三型 69图42:据厂五征 73图43:义据厂 77图44:义据厂 78图45:义据厂图 79图46:备间构体系 86图47:产间构体系 94图48:试间构体系 102图49:据厂四建设式 106图50:据厂四运营式 111图51:据厂四部署略 115图52:议快台关于进据厂业创新展指意》 120图53:议动台据工相标研制 122图54:议快破据工关技瓶颈 124图55:议强据厂支平建设 126表目录表1:全各市大高质数集持度 16表2:三种数据工厂类型对比分析 72前言特征的第一显著特征。AI示,2025年国内AI推理数据量达101.34EB,首次超越98.14EBAIxii智能应用普及程度的核心。布式数据工厂三种形态,呈现出多样化、规模化、标准化、体系化、AI《数据工厂白皮书》是我国第一本关于数据工厂政策、古等数据集团,中煤地质、南钢集团等央企,清华、北大、北物、北邮等高等院校,北数所、江苏数交所等交易机构,30数据工厂是《交大评论》团队首次研究提出的一种新兴业态,在政策、理论、实践等各方面还处于初级探索阶段,书中难免有疏忽和遗漏之处,敬请批评指正!一、数据工厂新业态发展方兴未艾(一)人工智能已发展到奇点时刻词元调用量爆炸式增长《20252025年,2024年初的10002025100202521100万亿3140402026年5400万亿。在越来越多的场景中应用。图1:词元调用量爆发式增长数据来源:《全国数据资源调查报告(2025年)推理数据量首次超过训练数据量202542.86据量达101.34EB,首次超过训练数据量的98.14ZB。表明人图2:人工智能推理数据应用量首次超过训练数据应用量数据来源:《全国数据资源调查报告(2025年)3计算驱动成为数据生产主要方式2025联感知数据量的25.34ZB。企业数据技术投入同比增长17.37%。其中,头部平台企业和中央企业数据投入分别增长25.79%和24.49%企业数据技术投入同比增长17.37%其中,头部平台企业和中央企业数据投入分别增长 25.79%和24.49%。图3:计算驱动成为数据生产的主要方式数据来源:《全国数据资源调查报告(2025年)智能体成为互联网的主要操作者据CloudflareRadar全球网络监测显示,6球HTML网页请求中,机器人流量占(Human)流量占42.5%。机器发起的已经超过了真人用户发起的请求。Bot即自动化程序,它所发起的HTTP请求,AIbot相当于/不仅要给人看,也越来越要被机器读取、理解和调用。图4:智能体流量超过了人类对HTML网页的访问流量数据来源:CloudflareRadar2026年5月28日—6月4日的流量监测高质量数据集成为人工智能瓶颈高质量数据集的类型人工智能的快速发展对数据治理提出了新的要求。传统数据治理的目标是将数据资源加工成人能看懂的数据产品,典型形态就是领导驾驶舱和应急指挥调度大屏;数智时代数据治理的目标是将数据资源加工成机器或智能体能识别、学习、处理的数据产品,典型的形态就是应用于大模型预训练的高质量数据和大模型微调、对齐、评测、推理的高质量数据集。BI高质量数据集主要指经过采集、加工等数据处理,可直接用于开发和训练人工智能模型,能有效提升模型性能的数据集合。包括通识数据集、行业通识数据集和行业专识数据集等类型。通识数据集是由蕴含通用知识的数据组成的数据集。面向社会公众的通用知识,主要包括基础概念、通用原理和典型事例等方面内容,无需专业背景即可理解和应用,具有广泛性、基础性和常识性等特点。行业通识数据集是由蕴含行业领域通用知识的数据组成的数据集。行业领域通用图5:从数据资源到高质量数据再到高质量数据集高质量数据集的特征通识高质量数据集、行业通识高质量数据集和行业专识高质量数据集,都具有知识内容、来源类型、时效性、标注人员类型、敏感程度、模型类型、主题范围等方面的特征。知识内容指数据集中数据所蕴含知识的专业性、知识深度和目标受众;来源类型指数据集中数据的获取来源,如网络资中数据的更新速度或有效期限;标注人员类型指对数据集中数据进行标注或审核的人员类型;敏感程度指数据集中数据公开后所产生的风险程度;模型类型指数据集中数据支持开发和训练人工智能模型的类型;主题范围指数据集所涉及通用知识领域、行业领域、业务场景等的范围。通识数据集具有以下特征在知识内容方面数据集中数据所承载信息蕴含的知识面向社会公众以基础概念通用原理典型事例等常识性知识为主无需专业背景即可理解; 在来源类型方面,数据集中数据无明确来源,或主要来自百科、问答、互联网平(短视频类、新闻门户类用户内容生成类视听资讯类、新闻机构类等)等网络资源综合性书籍等类型文献以及由合成数据技术生成;在时效性方面数据集中数据一般在较长时间内保持稳定时效性较低如年度国民经济统计公报重大事件新闻报道等一经发布即可在较长时间内作为信息参考较少出现频繁调整变更的情况在标注人员类型方面数据集中数据通常由普通数据标注员标注对行业领域专业背景和专业资质等级无特殊要求;在敏感程度方面,数据集中数据的敏感程度较低不涉及国家秘密工作秘密商业秘密个人隐私等在模型类型方面数据集中数据用于支持开展通用模型行业模型的开发和训练在主题范围方面数据集不属于特定行业领域,主题范围较广。集中数据所承载信息蕴含的知识聚焦于各行业领域的共性知识,以行业领域的基础理论、通用技术、共性业务为主,面向行业领域的从业人员,需要一定的专业背景才能理解和文件等类型文献,行业领域的主管部门、协会、科研机构、度方面,数据集中数据的敏感程度较低,不涉及国家秘密、集中数据用于支持开展通用模型、行业模型的开发和训练;考虑上下游及周边相关行业领域知识对于该行业知识的影响与补充,主题范围中等。行业专识数据集具有以下特征:在知识内容方面,数据集中数据所承载信息蕴含的知识聚焦于各行业领域组织机构内部的专业知识,以组织机构自身业务中从研发、生产、生产经营生成和采集,主要来自组织机构内部的业务系统、管理平台等系统平台,或文档图纸等文献。在时效性方面,数据集中数据一般根据业务场景需求变化,满足数据处理及(二)面向人工智能的数智产业链已经形成大模型快速演进推动人工智能应用普及年底,以OpenAI发布ChatGPT3为标志,人工智能正式进入大模型发展阶段;2024年底,以DeepSeekMOE等关键技术“算法平权”,突破了人工智能三要素中的两大要素制约;2025全球,促进人工智能大模型向通信、互联网、汽车、能源、推出Claud系列模型,彻底颠覆了以编程为主要手段的软件智能体已成为人工智能落地的应用载体任何一项技术在千行百业的落地应用都需要一个通俗易用的实施载体。正如计算机进入千行百业主要得益于应用软件的出现,如word、Excel、PPT、WPS等应用软件推动了计算机进入个人日常工作学习,ERP、MES、SCM、CRM等应用软件促进了计算机进入企业的日常生产经营活动,OA、HR、协同软件等应用软件推进了计算机进入政府的社会管理和公共服务事务。当前,智能体正成为人工智能在千用的主流方向。当前,工业领域的20个行业、能源领域的810正在加快开展行业大模型开发和智能体的应用。面向人工智能应用的数智产业链已形成一方面是人工智能应用普及对数据资源需求日益迫切,另一方面是国家层面对数据资源开发利用制度供给不断加大,两端相向而行,已形成一条面向人工智能的数智产业链条,包括上游、中上游、中下游、下游、底座等五个环节。图6:面向人工智能体的数智产业链构成上游中上游中下游集构建形成的两类智能体的应用工具:一类是作业流程长、动态变化快、实时性强的工业制造、具身智能等领域采用的具身智能体工具;另一类是业务精度高、静态变化慢、非实时业务的医疗诊断、药品研发、金融风控、公共服务等领域采用百具身智能体工具。下游则是数据作为关键生产要素,通过智能体在各行各业的应用。底座是运行这条“通识高质量数据集—通用大模型—行业通识高质量数据集—行业大池化、并网、计量、监测、调度、运营、安全等。全国各领域高质量数据集正在加快布局国家层面加速布局高质量数据集和智能体建设2025国家数据局联合国家发展改革委开展行业高质量数据集链202627220267行动,首次体系化部署行业数据集全链条建设。截止2026311.6过960PB,相当于中国国家图书馆数字资源总量的336左右。国家发展改革委于2025年启动实施国家人工智能应用中试基地建设,已选择电力、医疗、制造、交通、消费、教育、有色金属、具身智能、文化旅游等10个行业开展建设。国家网信办联合国家发展改革委、工信部发布《智能体规范应用与创新发展实施意见》,从夯实发展基础、守牢安全底线、强化应用牵引、建设创新生态等四方面对智能创新应用做了全面部署。图7:国家层面全面部署高质量数据集建设各行各业正加速实践高质量数据集和智能体应用人工智能赋能的高质量行业数据集建设先行先试的通知》20262010030600个应用场景,每个场景打造3个行业专识数据集,共形1800180020265智能+”能源高价值场景清单和组织开展试点申报工作的通85120267(交202660202510图8:各行各业加快高质量数据集建设各地区加大对高质量数据集建设的支持力度。近一年来,全国各地从省级到市级,补贴、奖励、数据券、语料券层出北京市2025520264200贵州省202511)》,提出支持建设高质量数据集。鼓励企业参与公共数据治理、30%对建设主体给予不500国家先行先试工作试点、国家优秀(典型)案例的项目,每个给予企业不超过502026710州省正式上线启动了全国首个省级数据工厂—贵州省数据集(语料2025(高质量数据集方向5030%500湖南、广东、广西、海南、重庆、新疆等省(市、自治区也推出了相应政策。表1:全国各省市加大对高质量数据集支持力度(三)数智产业链还存在三个薄弱环节DeepSeek数据资源供给、高质量数据集建设和数据基础设施建设,是图9:数智产业链存在三个薄弱环节数据资源“供不出”问题依然普遍存在在互联网上能直接流通的数据只占全球数据总量不到96%80%财政支持,没有经费预算开展公共数据治理。非结构化数据采集难度大成本高。主要表现在三方面:一是非结构化场景是无限的,而非结构化数据极却度匮乏,高。图10:数据“供不出”问题依旧突出行业数据“存不好”导致规模效应不够4乏规模效应,技术、管理和维护都需要重复投入。100100因素之一。图11:数据“存不好”现象普遍存在高质量数据集“作坊式”生产效率低下4270%320%图12:高质量数据集“作坊式”生产效率低下面向行业应用的高质量数据集供给严重不足。根据《全(2025量为52.26(ZB27.227.44%。系26.92ZB,首次超过摄像头25.34ZB。然而,我国高质量数发挥公共数据对于数据开发利用的引领作用与催化作用。从景的数据供给能力尚未作为专门对象加以细化规定,领域差异化数据统归于公共数据范畴的做法难以匹配垂直领域的科学专业技术需求更加严苛,这为我国数据加工的现代化场景转向带来一定挑战。图13:行业高质量数据集供给严重不足数据“采存算管用”全过程生产供给方式落后。得益于多民族文化的包容特性与社会秩序的长期稳定,线上支付、电子商务、共享经济、电子政务、智慧医疗、工业互联网、低空经济、智能驾驶、具身机器人等多样化数据服务和应用场景,在我国具有良好的社会接受度与广阔的应用前景,我国大多数民众对跨场景数据应用持开放态度,数字化需求趋于多样,为数据赋能的技术突破与多领域数字创新的涌现提供了社会土壤。但是相比算力和算法日新月异的技术突破,乏,标准不统一,智能化程度低,表现出分散化、个体化、图14:数据生产方式落后不同应用场数据规范;在智能交通领域,位置、路况信息之外的视觉、能模型结构高速迭代的产业背景下,多模态模型所需图像、语音、文本、视频等数据形式的融合需求日趋关键。未来,细分场景下数据技术标准与架构的滞后效应可能进一步影响场景数据集的流通与复用,阻碍数据供给、流通、交易与价值实现。图15:垂直场景数据价值实现面临挑战(四)数据工厂是高质量数据集规模化生产的关键设施图16:高质量数据集生产正从作坊式向数据工厂升级资源型基础设施规模化需要供给、流通、利用三环节协同需要建设覆盖广泛的在利用环节,需型基础设施高效运转的完整体系。图17:资源型基础设施“供给-流通-利用”协同规律数据基础设施亟需加快供给环节的设施化建设在流通环节,202412试点示范、工程建设项目也在如火如荼进行。在利用环节,202510模化生产设施建设仍是薄弱环节,亟需加快布局。图18:数据基础设施供给环节亟待加强数据工厂能为智能化应用持续提供“数据燃料”数字社会需要专门的数据加工生产设施——数据工厂,将海量原始数据加工处理为可供人工智能训练推理的高质工厂是社会化大生产的一种基本业态,并随着技术不断创新而持续迭代。在工业时代,水利、电力、交通等是经济社会运行的基础设施,水厂、电厂、车厂是工业社会的基本生产业态;在信息社会,网络、算力、系统等是经济社会运行的基础设施,网络厂商、算力厂商、软件厂商等成为信息社会的基本生产业态;到了数智时代,既能促进数据大规模流通又能确保数据安全的数据基础设施应运而生,以数据为生产对象的数据工厂正在成为数智社会的基本生产业态。图19:数据工厂是数智社会的新型生产业态形态。二、国内外数据工厂探索实践概况高质量数据集是人工智能大模型训练的核心“燃料”,其多样性和质量直接决定了模型的能力水平和应用效果。当前,高质量数据集正从人工智能企业自建向设施化、规模化生产转型,数据工厂作为高质量数据集设施化生产的新型业态,正成为国家数据基础设施的重要组成部分,国内外已涌现出一批典型实践。(一)国外典型数据工厂概述美国和欧盟的许多数据企业都是与人工智能技术和应产模式。ScaleAI1)基本情况ScaleAI成立于2016年,总部位于美国旧金山,起初是2021年获得美国军方2.5亿美元合同项目,将美国军方数据OpenAIMeta年12月,ScaleAI推出全新的AILab平年6,Meta以14349%股份。图20:ScaleAI数据工厂架构ScaleAI的高质量数据集生产设施主要由数据引擎、测试评估平台和AI应用平台三大类组成。数据引擎方面,ScaleAI针对不同应用领域构建了多个(ScaleDataEngine)提供数AIAI据引擎(GenerativeAIDataEngine)支持快速创建由领域专Ops(PublicSectorDataEngine)数据引擎(AutomotiveDataEngine)提供2D和3D数据标测试评估平台方面,ScaleAI构建了完整的模型评估能力体系:公共部门测试与评估平台(PublicSectorTest&Evaluation)专门测试和评估AI的安全性、性能和可靠性,覆盖计算机视觉和大型语言模型两大领域,提供整体评估、企业生成AI(GenerativeAIEvaluationforEnterprise)帮助企业在生产环境中自信部署GenAI改进和监控构建“信任反馈循环”,确保安全性和可靠性,避免偏见、幻觉、准确性差等问题。AI应用平台方面,ScaleAIScaleDonovan署AI点提供高级AI(AgentAIAIArsenalAIAIAI(ScaleGenAIPlatform)AI帮助客户在云上使用自有数据和任何模型构建优化解决方案,包括定制Copilots(RAG)技术准确总结和引用客户知识库。3)典型特色ScaleAIAI据标注—数据管理—模型评估—AI美国星际之门项目图21:美国星际之门数据工厂架构基本情况美国于2025年1月正式提出“星际之门项目”(Stargate50002029目旨在建设大规模AIAI核心功能一是建设在硬件设施方面投资建设一批为AI模型的训练和推理提供强大算力支持;同时打造容量可达20EB的独立“数据中心”,作为数据存储和处理的核二是建立关键行业数据资源池,美国AI行动计划和国家级生命科学AI的生物科学数据资源池,该资源池覆因组测序项目,为训练下一代生物基础模型提供数据支撑,解决当前生物AI典型特色AI推进数据资源建设;三是注重算力与数据的协同布局,同步推进计算中心和数据中心建设。欧洲数据中心图22:欧洲数据中心数据工厂架构基本情况20241021StackIT标是增强欧洲在AI领域的自主性,让欧洲摆脱对海外数据提供商的依赖。核心功能一是数据聚合与处理,AI特别强调数据安全(GDPR);三是支持多模态推动多模态AI致力于汇集AI模型所需的数据。典型特色洲本土AI产业发展,减少对海外数据提供商的依赖。欧洲数据实验室(DataLabs)图23:欧洲实验室数据工厂架构基本情况2025年推出新的数据联盟战略(DataUnionStrategy),重点加强Labs),位为欧洲人工智能基础设施的关键环节和人工智能工厂的有机组成部分,专注于汇聚来自不同来源的高质量数据。核心功能欧洲数据实验室的核心功能包括以下几个方面:一是数二是技术支持服三是促进跨领域合作,AI复杂AI典型特色3(ALT-EDIC)17样性。国外其他典型数据工厂Biosciences图24:ParseBiosciences数据工厂架构ParseBiosciences专注于单细胞RNA测序,生成高质量(1000万+细胞采用Evercode化学技术提高测序效率和准确性。Bioptimus图25:Bioptimu数据工厂架构Bioptimus专注于病理学AI数据集建设,开源发布optimus-0(1150组学、蛋白质组学等多模态数据。笛卡尔实验室图26:笛卡尔实验室数据工厂架构NASAESANOAA(0.5(二)国内典型数据工厂概述据基础设施的重要组成。崖州湾国家实验室“繁|未来农业智能枢纽”超级数据工厂图27:崖州湾国家实验室“繁|未来农业智能枢纽”超级数据工厂架构基本情况战略需求,致力于突破种源关键核心技术。“繁|未来农业AI1三亚总部+N个全国基地的多源头农据量大、复杂及工程化难题,打造出行业专属育种智能体,加速AI在农业领域的行业化落地。2025年11月11日,崖州湾国家实验室发布面向农业育种领域的AI智能基座——“繁|未来农业智能枢纽”。核心功能“繁|未来农业智能枢纽”的核心功能包括以下几个方国多源头农业数据,构建战略作物数据库,覆盖基因组学、表型组学、环境组学,提供高质量育种语料,已上线83000FAN文献智能体和FAN分析智能体,典型特色“繁|未来农业智能枢纽”超级数据工厂的典型特色包30%汇聚全国数百PB的育种数据,实现数据互联共享,制定生络,打通全球大田与实验室数据,整合全球育种研究成果,构建基因-表型-环境的多维知识图谱,揭示育种要素间的复AI贵州主枢纽存力中心暨数据要素保障基地图28:贵州主枢纽存力中心暨数据要素保障基地数据工厂架构基本情况贵州主枢纽存力中心暨数据要素保障基地(以下简称“保障基地(贵州枢纽存算并举、数算用一体的发展模式,走出一条以数据驱动、核心功能智慧物流仓储数据等垂直行业数据,构建行业AI大模型训练高质量数据集。典型特色优先,加速高质量数据供给和使用;二是提出“以数为核、场景为引、以数促产、以产育企、以企兴业”的运营理念,中国汽研、温州大数据集团等东西部节点城市企业的合作,90库帕思“语料超级工厂”图29:库岶思语料超级工厂架构基本情况1125”业务架构和“一业一方法、一业一指引”的数据生产流程,支撑“语料超级工厂”的运作。核心功能库帕思构建了“1125”业务架构。一是1个语料基座,构建“1+X”模式的综合语料库并链接多个行业语料库,既能服务基础大模型,也能有效降低垂类模型的应用成本;二是1个语料运营平台,对标国际先进实践,构建“采、洗、标、测、用”五位一体的工具体系,2025年世界人工智能大会上发布的语料工具链平台2.0包含403个功能模块,支持从数据采集到最终交付的全流程;三是2大战略基础体系,包括基于世界知识体系语料构建方法的“语料魔方”体系,以及对标模型“有德、有趣、有序、有品、有用”五有标准的基石语料库和测试集;四是5项可持续发展能力,包括智能清洗与质量保障能力、智能合成与价值对齐能力、场景适配与知识修正能力、可信流通与跨域治理能力、生态服务能力。围绕语料运营平台,形成多模态数据采集—智能清洗与去噪—智能预标注—多维质量评测—标准化交付的语料生产全流程闭环系统。典型特色库帕思的典型特色包括以下几个方面:一是形成“一业一方法、一业一指引”的标准体系,与金融、教育、医疗、法律等不同行业深度适配,制定语料库建设导则和技术白皮书;二是注重数据安全与价值对齐,构建多维度价值对齐的语料体系;三是采用平台型企业模式,由国资牵头、多单位联合组建,积极与产业伙伴合作推进语料数据的商业化。京津冀数据要素产业园人工智能数据工厂图30:京津冀数据要素产业园人工智能数据工厂架构基本情况(位于霸州经济开发区,总投资2.6亿元,拥有100PB25PB2000成果转化周期缩短30%以上。核心功能数据要素产业园紧扣“1-4-3-N”架构体系(1个存力中个行业数据应用场景)建设,构建数据采、存、算、管、11PB。二是43N典型特色京津冀数据要素产业园人工智能数据工厂(霸州)的典30%以上。广东省先进存力中心图31:广东省先进存力中心数据工厂架构基本情况项目首期建设20PB存力,秉持“存得下、存得好、存得安AIAI资源目录,支撑人工智能发展。核心功能服务。三是依托可信存力资源构建“1+N聚、安全可信的数据智能标注生态。典型特色(韶关(韶关37487粤港澳大湾区乃至世界级旅游目的地品牌提供坚实支撑。帕西尼具身智能超级数据工厂图32:帕西尼具身智能超级数据工厂架构基本情况帕西尼具身智能超级数据工厂(SuperEIDFactory)位于天津市河西区空天数字产业园,由帕西尼感知科技(深圳)有限公司投资建设,于2025年6月23日正式启用,是全球积近12000平方米,部署了150元都配备了帕西尼自研的高精度数据采集设备。核心功能帕西尼具身智能超级数据工厂的核心功能包括以下几VTLA全栈式技术体系,自主研发6D霍尔阵列式多维触觉传感技术,构建了覆3C15+N2三是攻克行业核表现不佳的泛化性差问题;四是驱动模型与产业生态进化,工厂产出的高质量数据用于喂养和升级帕西尼自研的VTLA(视觉-触觉-语言-动作)典型特色帕西尼具身智能超级数据工厂的典型特色包括以下几Mesh),将高精度触觉数(Soma能将采集自人类的数据有效适配并“重定向”到不同结构、不同型号的机器人本体上,攻克模型跨本体泛化的行业难题。其他数据工厂上海徐汇区“模速空间”图33:上海徐汇区模速空间架构202392820255月,核心承载区6万平方米空间内已集聚近50家具身智20200AI位保障。北京经开区“模数世界”图34:北京经开区模数世界架构人工智能创新产业社区,以大模型和数据要素为核心驱动,依托国家信创园7号楼为核心、周边50万平方米办公楼宇“AI包入住”政策礼包包含舒享办公空间和算力资源等服务。珠海市“模数空间”图35:珠海市模数空间架构20249盖边缘计算AI3620计划打造超100个垂类行业应用,其中无界方舟发布方舟大模型2.0及多语言机器人产品,深译科技推出全国首个高价值AI算料数据资产包。北京石景山区“大模型超级工厂”图36:北京石景山区大模型超级工厂架构(北京创新基地服务平台于2024年11月5日在石景山人工智能大模型产业集聚区联合创建。创新基地可为大模型和AI原生应用的开发者提供大模型训练和垂直领域应用开发能力的企业,累计完成tokens6营销、客服、应急等领域打磨场景应用。(三)国内外数据工厂发展现状总结经验。供给环节建立了多元稳定的数据来源渠道合等方式拓展数据来源,如欧洲数据中心整合了德国铁路、洲数据实验室与欧洲共同数据空间深度融合实现数据互联互通;3C“15+N图37:数据工厂供给环节-多元稳定的数据来源渠道生产环节形成了设施化规模化的生产能力国内外数据工厂在数据加工处理环节已形成较为成熟的设施化生产模式。AIAI擎矩阵,帕西尼部署了1502亿条高质量训练数据,库帕思形成了包含403个功能模块的语料工具链平台。在生产流程方面,各“数据工厂”普遍建立了从数据采集、清洗、标注到质检的全流程生产体系,如库帕思形成了“多模态数据采集—智能清洗与去噪—智能预标注—多维质量评测—标准化交付”的闭环系统。在技术手段方面,人机协同、AI辅助标注、智能质检等技术得到广泛应用,显著提升了数据生产效率和质量。图38:数据工厂生产环节-设施化、规模化、智能化“三位一体”应用环节聚焦人工智能训练的场景需求国内外数据工厂普遍以服务人工智能模型训练为核心AIOpenAIAIVTLA各数ParseBiosciences建立了全球最大的阿尔茨海默病和帕金森病单细胞数据集,部分数据工厂已建立模型评估模型指导采集”的共生飞轮。图39:数据工厂应用环节-以AI应用为目标三、数据工厂的涵义、类型和特点(一)数据工厂涵义数据工厂不仅是高质量数据集规模化生产设施和新型数据资源有序汇聚沉淀、高效开发利用的重要载体。图40:数据工厂能为智能化应用持续提供“数据燃料”数据工厂是国家数据基础设施基本构成单元国家数据基础设施是一个“供得出、流得动、用得好、数据工厂是突破人工智能发展瓶颈有效手段术水平提升和应用范围拓展的“最初一公里”瓶颈。数据工厂是高质量数据集的规模化生产设施数据工厂建设和运营的最终目标就是能规模化生产高质量数据集。与当前高质量数据集生产方式相比,数据工厂具有三个显著特点:一是设施化。数据工厂作为国家数据基础设施的基本组成单元,将当前各行业、各企业使用的各种技术、工具进一步规范化、平台化、设施化,形成智能化、自动化的采集汇聚、清洗标注、加工处理、检验测试等工具数据工厂是数据全生命周期的综合产业形态过研发突破数据清洗、标注、增强、检测等核心数据技术,创新形成各种以高质量数据集为主的数据产品和服务。数据工厂的生产流程覆盖了数据产业全部六种形态,是数据产业的综合产业形态。发展数据工厂对加快打造独立数据产业形态,为数据要素化价值化形成全面产业支撑,具有极其重要的意义。(二)数据工厂类型势,并将在今后很长一段时间内长期共存。图41:数据工厂的三种类型集中式数据工厂GDPR300AI数20256120001502AI1TB,[15纽存力中心数据要素保障基地依托国家“东数西算”工程,474.5EFLOPS980PB,是面厂的典型代表。半集中式数据工厂半集中式数据工厂是指采用相对一致的技术工具平台和方法在不同区域开展不同行业领域不同应用场景的数据规模化生产方式。半集中式数据工厂最大的特点就是“技术平台统一加工场所分散即将相对统一的技术平台部署在不同区域生产不同场景应用需求的高质量数据集半集中式数据工厂是我国数据工厂发展的重点方向将在未来五年实现爆发式增长大量专业的数据标注公司和人工智能企业都将开发数据工厂的统一技术平台并在全国多区域布局建设当前的国家数据标注基地也将向半集中式数据工厂转型升级。美国Scale AI就是典型的半集中式数据工厂它通过旗下的Remotasks和Outlier等平台将数据标注业务分布部署到东南亚非洲等多个区域依托统一的数据标注引擎模型评测工具和AI应用接口面向Google、MetaOpenAI客户以及美国国防部卡塔尔政府等机构的具体应用场景提供数据标注模型评估与AI应用开发等全流程数据加工服务。分布式数据工厂分布式数据工厂是指数据的“供应-生产-交付”等加工生产全过程分布在一个广泛分散的网络空间内原始数据不需要汇聚在一个集中场所数据加工也不需要集中在一个物理空间而是通过数据虚拟化和连接器框架等数据编织技术将分散在不同区域的数据库数据仓数据湖中的数据连接在一起并将查询转换为源系统能够理解的语言在数据原地进行处理,只将结果返回给平台,形成“逻辑统一,物理解耦的分布式数据加工生产业态分布式数据工厂不需要将原始数据移出其原先的数据库仓可以完全实“原始数据不出域数据可用不可见的数据资源开发利用特别适用于国防金融医疗交通等安全要求极高行业的高质量数据集生产加工分布式数据工厂是数据工厂发展的必然发展方向将在未来五年的技术突破中实现快速增长许多技术创新创业型企业将持续突破数据编织、数据虚拟化、数据连接框架等数据前沿技术越来越多的政府机关国有企事业单位大型龙头行业企业等将采用分布式数据工厂模式既能实现数据的高价值加工流通又能确保对原始数据的控制权Palantir就是典型的分布式数据工厂,其Foundry平台通过Data Connection框架支持连接200多种数据源,在客户原有系统上就地完成批处理流式处理及虚拟表查询并借助数据虚拟化实现双向近实时数据流转无需集中搬迁数据即可完成跨系统整合与分析。表2:三种数据工厂类型对比分析对比维度集中式数据工厂半集中式数据工厂分布式数据工厂核心特征物理集中技术平台统一、加工场所分散逻辑统一、物理解耦数据流动数据汇聚到中心平台部署到数据所在地数据不出域、结果返回适应场景大规模通用数据集生产多区域、多行业场景国防、金融、医疗等高安全行业典型代表美国星际之门、帕西尼超级数据工厂ScaleAIPalantir(三)数据工厂特点数据工厂作为数智社会的一种新兴生产业态,目前还处于刚刚起步的萌芽发展阶段,不同企业根据自身基础和条件,开展了形式多样的数据工厂探索实践。总体来看,数据工厂具有多标准化、设施化、规模化、标准化等四方面显著特点。图42:数据工厂的五大特征多样化AIScaleAIPalantir设施化设施化是数据工厂的一个显著特征主要表现在三方面其一数据工厂本身就是一个设施数据工厂是国家数据基础设施的最基本组成单元,本质上是一个设施集合;其二,数据工厂的主要构成要素都是设施构成数据工厂的数据储备加工中试等各种车间其核心组成部分也都是各种工具平台等设施其三数据工厂服务常常以平台设施方式提供如ScaleAI的通用数据引擎Palantir的 FoundryPalantirCEOAlexKarp规模化区别于当前自给自足的高质量数据集作坊化生产方式,数据工厂是一种建立在专业分工基础上的社会化大生产方模化自动加工。数据工厂的数据清洗、标注、增强、合成、数据集,无论是应用于人工智能大模型训练或智能体迭代,标准化目前高质量数据集大多都是人工智能或其他用户自已加工生产的,不同用户加工生产出来的数据集有不同特点,异构的,都需要按照统一的分类分级、统一的目录化体系、数据加工处理标准化。数据工厂的数据清洗、标注、增强、是一种标准化的数据产品和服务,能为不同用户提供服务。AI化AIAIAI,PalantirAIPOpenAIAI四、数据工厂的构成、定位和功能(一)数据工厂及其构成形态。数据工厂的构成有广义和狭义两个范畴:图43:广义数据工厂据集设施化供给闭环。图44:狭义数据工厂/评估和数据集迭代等15个环节。其中,数据采集、数据汇54是数据集的测试验证阶段,是中试车间的主要业务。(二)广义数据工厂及其构成图45:广义数据工厂架构图的供应链产业链各功能环节,广义数据工厂由国家数据基座、国家数据工厂、国家人工智能训练场等三部分组成。国家数据基座理分散、逻辑统一,横向联通、纵向贯通的国家数据基座。据短期价值小的一个重要原因是当前数据加工处理技术还法模型的持续迭代提供数据供给。国家数据工厂1016N10(布、内蒙古和林格尔、甘肃庆阳、宁夏中卫、贵州贵阳)地区,共同建设以通识数据集为主要产品的国家级数据工厂。“1616据资源充沛供给基础上,在学研究、工业制造、智慧能源、16数据工厂。国家人工智能训练场直大模型训练场和企业智能体训练场等三部门组成。通用基础大模型训练场量数据集来源和大规模高可靠算力的技术创新创业型中小企业,以及一些资源垄断型行业或区域龙头企业。行业垂直大模型训练场企业智能体训练场。面向智能体开发和模型微调推理,(三)狭义数据工厂及其构成储备车间储备车间定位功能储备车间定位于数据原料的“供应基地”,提供规模化收储、标准化预处理、体系化管理的数据原料;通过系统性地收集原始数据并转化为可量化、可管理、可追溯的数据资源,为后续加工环节奠定质量基石。数据工厂作为规模化、设施化生产高质量数据集的生产业态,首先要完成数据资源的准备工作,因此,储备车间的功能主要包括数据需求与规划、数据采集与汇聚、数据存储与管理等。即预估获得和准备数据以支持特定人工智能应用所需的工整合。追踪、版本可回溯、容量可弹性扩展。储备车间建设要点储备车间作为数据工厂的前端环节,在建设时应重点关注以下方面:数据汇聚管道化。将多源异构数据统一接入,转化为标准数据流,构建自动化、智能化、可监控的端到端数据流动体系,确保原始数据能够高效、可靠地汇聚成数据资源池。数据标准化处理。多源异构的原始数据是杂乱无序的直接决定了后续“数据产品”的质量。个数据工厂的数据容量上限、处理效率下限和业务敏捷度。多维度的数据管理体系。为了避免海量数据沼泽化、质储备车间建设内容中心、五模块、多方法”的完整体系架构。图46:储备车间的构成体系——“储备车间”包含三大基础平台。据接入平台,实现不同格式、不同来源数据的标准化接入;配置网络爬虫工具、API类数据(包括原始数据、中间数据和结果数据)进行安全、多源异构数据。需要根据数据的访问频率和价值,实施冷、数据管理中心。贯穿于数据采集、汇聚、处理、存储的全生命周期,通过建立统一的数据标准、元数据体系和数据——储备车间拥有五大功能模块:一是数据采集模块,负责从各类数据源获取原始数据,数据汇聚模块数据预处理模块数据存储模块数据管理模块质量管控与访问控制,实现数据高效共享与安全使用。——储备车间具备系统化技术体系“储备车间”形成了完整的数据采集、存储和管理方法体系,每个功能模块都配备了相应的技术能力:通过连接器和协议解析技术数据库同步技术术消息队列技术技术通过分布式流批处理技术数据托管技术(实时增量备份+定时快照+异地容灾汇聚到储备车间进一步挖掘数据价值。数据预处理技术数据清洗与校验技术格式转换与标准化技术数据脱敏与加密技术(个人信息、商业秘密元数据采集技术的透明与可信。数据存储技术。NVMe,实现数据访(温冷化存储成本。通过多模态湖表格式技术,同时处理结构化、NASHDFSS3SQL、实现数据分布式存储引擎通过数据目录技术数据血缘技术多模融合检索技术(如文)的数据进行组合检索。通过访问控制技术,实现细粒度的数据权限精准管控,确保数据在授权范围内被安全访问与操作。生产车间生产车间定位功能生产车间数据加工与合成、数据标注与质检等两大功能。一是数据加工与合成,通过数据清洗识别和处理重复、耗品转变为可发现、可理解、可信任、可复用的数据集。生产车间建设要点生产车间作为数据工厂的核心加工环节,在建设时应重点关注以下方面:集中化生产以降低成本。通过规模化、精细化和技术赋能,实现数据生产单位成本的显著下降和整体效率的跃升。集中化资源管理,整合数据资源集中调度,避免重复加工;应根据不同类型数据集的特点,设计差异化的生产流水线,覆盖文本、图像、音频、视频、多模态等数据集生产。引入大规模数据并发处理技术,支持按需动态调整计算与存储资源,根据业务需求合理规划产能,包括日处理数据量、并发处理能力、标注团队规模等,满足从小批量实验到大批量生产的不同规模需求。将人的智慧与机器的效率深度AI术,从劳动密集型升级为技术密集型,从“有多少标注员”AIAI踪,问题可定位到具体环节与人员。持续进化以加强能力生产车间建设内容构。47——生产车间拥有两大生产中心:SQL后数据符合预定标准。立人机协同标注体系。开展数据标注工作,运用模型标注、化标注;构建质量控制体系,通过规则校验、一致性分析、AIAI生成工具、AIAIAI——生产车间具有六大功能模块:数据清洗模块数据增强模块数据标注模块数据集管理模块——生产车间配备了相应的技术能力:过重复数据处理技术噪声数据识别技术术智能清洗技术以处理的模糊、上下文相关、语义层面的脏数据问题。AI规则驱动合成技术仿真与程序化合成技术通过AI,利用大语言模型引导合成文数据增强从简单的随机替换发展到基于技术强技术/((通过音频数据增强技术(如时间扭跨模态增强技术频-视频的跨模态增强。数据标注技术。负责对数据进行高质量标注,为模型训练提供有效的训练样本。对于文本数据,通过文本分类、词性分析、情感分析、语义分析、关系抽取等技术进行标注;OCR别等技术进行标注;对于音频数据,通过降噪、重叠分离、情感/语调/数据,通过语义分割、目标检测与跟踪、实例分割与跟踪、注。通过多模态融合标注技术,如数据蒸馏、多模态关联、检、自动化质检和人工质检确保语料集在准确性、一致性、AI质量智能评估技术AI(字段/记录缺失率(与权威源比对)(跨数据源逻辑冲突(时间戳分布分析并设定阈值自统计分析与异常检测技术合规性扫描技术NLP对抗测试技术通过数据目录技术数据编织技术分层存储;通过数据血缘与溯源技术构建数据集血缘图谱,多模融合检索技术()的数据进行组合检索。中试车间中试车间定位功能中试车间定位于数据集投产前的“靶场”,衔接高质量数据集生产与AI模型训推,评估数据集质量及模型适配性、排查问题、优化数据,确保数据集符合模型训练要求。高质量数据集生产完成后,投入人工智能模型训练前,需对数据集进行效果适配性评估,以确定数据集是否满足模型训练、微调、推理要求,因此,“中试车间”主要包括模型评估、数据集维护和更新两个阶段。一是模型评估,通过模型训练评估,使用数据集训练基准模型,评估训练性能、收敛质量及资源效率,验证数据有效性;通过模型微调评估,对预训练模型进行场景化微调,评估微调效果、泛化性能及稳定性,验证数据集的领域适应能力;通过模型推理评估,测试模型在真实业务场景中的准确性、鲁棒性及业务适配性,反向识别数据缺陷。数据集的可追溯、可比较与可回滚。中试车间建设要点中试车间对高质量数据集进行训练前效果适配性评估和优化,确保形成合规、质量可靠、可用性达标的数据集。(验证与专家抽样确保数据真实反映现实(记录是否缺失)(辑是否一致(新鲜度与时效要求匹配AI包含模态类型、数据分布情况、标签类别统计、样本示例、一致性方面,多模态数据间应在语义和表达上保持匹配。提升目标应用场景人工智能模型的性能。中试车间建设内容“中试车间”通过中小规模的模型生产验证与评估,基于模块化设计和可扩展技术架构,支持不同类型数据集的评测,构建了“两中心、四模块、多技术”的完整体系架构。图48:中试车间的构成体系——“中试车间”由模型评估中心、数据集维护和更新中心组成。AI集维护和更新中心提供精准改进建议。数据集维护和更新中心Schema——中试车间拥有四大功能模块:一是模型训练评估模块模型微调评估模块模型推理评估模块集产品。——中试车间具备关键技术能力体系:通过(CV/NLP/时序等领域的标准模型架构基准数据集对比分析技术监控模型在多次训练或不同数据子集下,关键性能指标(如损失、准确率的波动情况,确保模型具备可复现性与鲁棒性。通过参数高效微调框架多维度评估矩阵等指标的变化,量化数据集领域价值;通过梯度分析技术,小样本适应性测试5%-20%通过业务场景压力测试(置信度与不确定性分析对抗鲁棒性测试数据集迭代技术。通过问题溯源技术,基于数据血缘图谱与多维度质量指标关联分析,精准定位问题根源;通过数据集管理技术,实施严格的版本化管控,记录每次迭代的内容变更、质量提升与对应的模型性能变化,实现数据集的可追溯、可比较与可回滚;通过可疑样本自动流转技术,针对标记为低质量的数据集,推送至对应责任人进行迭代优化;通过问题模式库,积累行业典型数据问题模式,结合知识图谱实现问题自动匹配与解决方案推荐,减少重复问题处理时间。五、数据工厂的建设、运营和部署(一)数据工厂的建设模式技术企业创新设立等四种模式建设。图49:数据工厂的四种建设模式数据标注企业升级成高质量数

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论