Artificial intelligence - Data quality for analytics and machine learning(ML) - Part 2 Data quality measures 标准立项发展报告_第1页
Artificial intelligence - Data quality for analytics and machine learning(ML) - Part 2 Data quality measures 标准立项发展报告_第2页
Artificial intelligence - Data quality for analytics and machine learning(ML) - Part 2 Data quality measures 标准立项发展报告_第3页
Artificial intelligence - Data quality for analytics and machine learning(ML) - Part 2 Data quality measures 标准立项发展报告_第4页
Artificial intelligence - Data quality for analytics and machine learning(ML) - Part 2 Data quality measures 标准立项发展报告_第5页
已阅读5页,还剩4页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Artificialintelligence—Dataqualityforanalyticsandmachinelearning(ML)—Part2:Dataqualitymeasures标准立项发展报告StandardizationDevelopmentReport:Artificialintelligence—Dataqualityforanalyticsandmachinelearning(ML)—Part2:Dataqualitymeasures摘要随着人工智能与机器学习技术在各行业的深度渗透,数据质量已成为制约模型效能、决策可靠性与系统合规性的核心瓶颈。为应对这一挑战,国际标准化组织ISO/IECJTC1/SC42制定了ISO/IEC5259系列标准,为分析和机器学习的数据质量提供系统化规范。韩国据此采标制定了KSXISO/IEC5259-2-2026《人工智能—分析和机器学习(ML)的数据质量—第2部分:数据质量度量》,并于2026年6月30日正式实施。本报告系统梳理了该标准的立项背景、研制过程与核心技术内容,深入分析了数据质量度量维度框架、指标定义及评估流程,阐述了其与ISO/IEC25012、ISO8000等既有标准体系的衔接关系。报告指出,该标准通过统一数据质量度量术语、分类体系和量化方法,有效解决了当前数据质量评估实践中维度定义不一致、度量指标碎片化、评价结果可比性差等突出问题,为各行业建立可量化、可复现、可审计的数据质量评估机制提供了权威技术依据。报告最后对标准的推广应用前景及后续演进方向进行了展望。关键词:数据质量;人工智能;机器学习;数据质量度量;标准化;KSXISO/IEC5259-2Keywords:DataQuality;ArtificialIntelligence;MachineLearning;DataQualityMeasures;Standardization;KSXISO/IEC5259-2一、引言随着数字化进程加速推进,人工智能与机器学习技术已经从实验室走向大规模产业应用,深刻改变着智能制造、智慧医疗、金融风控、自动驾驶等领域的发展格局。在这一进程中,一个根本性问题日益凸显:人工智能系统的性能上限受制于其训练与推理所依赖的数据质量。业界广泛流传的"垃圾进,垃圾出"(GarbageIn,GarbageOut)原则,揭示了数据质量对AI系统效能的决定性影响。然而,如何系统性地定义、度量和管理数据质量,长期以来缺乏统一的国际共识,导致各组织在数据治理实践中方法各异、结果难以横向比较,严重制约了高质量的AI应用落地。数据质量问题的复杂性在于其多维度特性。一项数据资产在完整性(Completeness)、一致性(Consistency)、准确性(Accuracy)、时效性(Timeliness)等维度上的表现各不相同,而不同应用场景对这些维度的权重诉求也存在显著差异。例如,用于实时风控决策的数据流对时效性要求极高,而用于医学影像训练的标注数据则更强调准确性与一致性。缺乏标准化度量框架的直接后果是:数据质量评估结果在组织间不可比、在时间上不可复现、在审计中不可追溯,使得数据交易、模型评测、监管合规等环节面临重大障碍。为此,国际标准化组织ISO/IECJTC1/SC42(人工智能分技术委员会)于2021年启动了ISO/IEC5259系列标准的制定工作。该系列标准旨在为分析和机器学习场景下的数据质量提供全生命周期的规范化框架,其中第1部分概述通用概念与框架,第2部分聚焦于数据质量度量方法,第3部分和第4部分分别针对数据治理与数据质量度量过程进行细化。韩国作为全球数字化转型的先行国家,高度重视人工智能标准化工作,在ISO/IEC5259系列国际标准研制过程中积极贡献技术力量,并于标准发布后迅速启动采标程序,形成了KSXISO/IEC5259-2-2026国家标准。二、标准立项背景本标准的制定有着深刻的产业背景和政策动因。从全球范围看,据Gartner预测,到2025年,糟糕的数据质量每年给企业造成的平均损失高达1290万美元;IDC研究亦表明,数据质量问题可能导致企业额外支出15%至25%的运营成本。与此同时,人工智能模型的可信度评估日趋严格,欧盟《人工智能法案》(AIAct)对高风险AI系统的训练数据提出了明确的准确性、完整性、代表性等要求,而美国NISTAI风险管理框架同样将数据质量作为可信AI的核心要素之一。在此背景下,建立统一的数据质量度量标准已成为全球产业界的共同诉求。从技术发展角度看,机器学习的数据质量度量面临区别于传统数据质量评估的新挑战。传统的数据质量管理主要面向事务处理系统,关注记录级的完整性与准确性;而分析和机器学习场景涉及数据采集(Collection)、数据准备(Preparation)、特征工程(FeatureEngineering)、模型训练(Training)和模型验证(Validation)等多个阶段,每个阶段对数据质量的要求不尽相同。更为重要的是,机器学习模型对数据偏差(Bias)、数据漂移(Drift)和数据泄露(DataLeakage)极其敏感,这些全新的质量维度在传统数据管理标准中并未得到充分覆盖。因此,亟需制定专门针对分析和机器学习场景的数据质量度量标准。从韩国国内需求来看,韩国政府于2019年发布"人工智能国家战略",明确提出构建全球领先的AI产业生态体系的目标。韩国产业通商资源部和科学技术信息通信部持续加大对AI标准化工作的投入,韩国标准协会(KSA)和韩国技术标准署(KATS)积极推动国际标准的本土化应用。在产业侧,三星电子、LG电子、现代汽车等韩国龙头企业以及众多AI初创企业在数据治理实践中面临的共性问题是:数据质量评估缺乏统一标尺,数据交易中的质量定价缺乏客观依据,面向监管机构的合规证明缺乏标准化支撑。这些现实需求直接推动了本标准的立项和研制。在标准的研制基础方面,ISO/IEC5259-2的制定是一个具有里程碑意义的技术探索,它首次在人工智能语境下提出了系统化的数据质量度量框架。在本标准之前,该领域虽然已存在多项相关标准,但均存在各自的边界与局限:ISO/IEC25012(软件工程—系统与软件质量要求与评价—数据质量模型)虽提供了通用数据质量模型,但主要面向传统软件系统中的数据,无法充分覆盖机器学习场景中的训练数据、验证数据和测试数据的特有质量问题;ISO8000系列标准侧重于数据交换与数据治理过程中的质量要求,对各质量维度的度量方法规定不够具体;ISO/IEC5259系列则填补了这一空白,首次将数据质量度量概念系统性地嵌入AI和ML生命周期中,提出了覆盖数据收集、数据准备、模型训练、模型验证等关键环节的度量框架。KSXISO/IEC5259-2-2026作为韩国采用ISO/IEC5259-2的等同标准,其立项和研制正是为了将这一国际最新技术成果转化为适用于韩国国情的国家标准。该标准于2024年正式立项,由韩国技术标准署(KATS)主导,韩国标准协会(KSA)负责具体研制流程管理和组织协调。在研制过程中成立了由高校学者、研究机构专家、产业界数据治理从业者以及政府监管机构代表组成的专业工作组,历经标准草案起草、公开征求意见、专业技术审查、标准审议等法定程序,最终于2026年6月30日正式实施,标准状态为现行。三、标准核心技术内容(一)范围与定位KSXISO/IEC5259-2-2026规定了用于分析和机器学习的数据质量度量方法。该标准适用于各类组织在数据收集、数据预处理、特征工程、模型构建、模型评估和模型部署等数据分析与机器学习生命周期各阶段中,对数据集的数据质量进行度量。标准的适用范围涵盖结构化数据、半结构化数据和非结构化数据,适用于监督学习、无监督学习、半监督学习和强化学习等各类机器学习范式。该标准在ISO/IEC5259系列中处于承上启下的核心位置:第1部分提供了数据质量框架的总体概述,明确了数据质量模型的概念基础;第2部分则将框架中的各质量特征(QualityCharacteristics)细化为一套可操作的度量体系,为数据质量评估提供"测量工具";第3部分和第4部分进一步规定了数据质量管理的过程要求。因此,本标准不仅是数据质量度量的技术规范,也是连接概念框架与实施过程的关键枢纽。(二)术语体系与质量维度框架本标准建立了一套系统的数据质量术语体系,明确了数据质量(DataQuality)、数据质量度量(DataQualityMeasure)、质量维度(QualityDimension)、质量指标(QualityIndicator)、度量函数(MeasureFunction)等核心概念的精确定义。在此基础上,标准构建了多维度数据质量框架,包括固有数据质量(InherentDataQuality)和依赖任务的数据质量(Task-DependentDataQuality)两个层面,并细化出若干关键维度:在固有数据质量层面,标准涵盖了准确性(Accuracy)——度量数据与其所代表真实世界实体或事件的一致程度;完整性(Completeness)——度量数据集在属性、记录和值三个层级上的缺失程度;一致性(Consistency)——度量数据在同一数据集及跨数据集间的逻辑自洽性,包括格式一致性、语义一致性和关联一致性的度量;以及唯一性(Uniqueness)——度量重复记录的占比情况。在依赖任务的数据质量层面,标准引入了时效性(Timeliness)——度量数据年龄和更新频率相对于业务需求的适应程度;相关性(Relevance)——度量数据特征与分析目标的关联度;代表性(Representativeness)——度量训练数据对目标部署场景的真实覆盖程度。此外,该标准特别引入了面向机器学习场景特有质量特性的度量维度,包括平衡性(Balance)——度量分类数据中各类别样本分布的均衡程度,用于检测数据偏差;数据漂移(DataDrift)——度量训练数据分布与部署后实际数据分布之间的差异,是监控生产环境模型性能退化的重要指标;以及数据泄露风险(DataLeakageRisk)——度量训练数据中是否包含未来信息或目标变量相关信息而导致评估结果过于乐观的风险。(三)度量指标体系与量化方法在度量指标体系的构建上,该标准规定了每个质量维度对应的度量指标(Measures)及其量化方法。标准要求度量指标需满足以下特性:可计算性(基于已有数据可自动或半自动计算获得)、可比性(统一的量纲和归一化方法使度量结果可跨数据集比较)、可解释性(度量结果须能够映射回具体的数据问题、为质量改进提供明确指引)、可审计性(度量过程具备透明性和可追溯性,可复核检验)。在度量方法层面,标准针对每个指标给出了具体的度量函数(MeasureFunction)和计算方式。例如,对于完整性维度,标准规范了属性完整性比率(AttributeCompletenessRatio)的计算方法,度量指标为数据集中非缺失值占全部应取值总值的比例;对于准确性维度,则可采用基于规则验证法(Rule-BasedValidation)或基于参考数据集比对法(Reference-BasedComparison)等方法,分别适用于约束校验场景和有基准参照的场景;对于唯一性维度,则需要开展重复检测(DuplicateDetection)和相似度分析,在定义合适的相似度阈值后计算重复率,并关注相似度度量方法的适用性和阈值设定的合理性。标准还允许组织根据领域需求定义自定义度量指标,但要求自定义指标须遵循标准规定的通用框架和属性定义,以确保兼容性与可比性。考虑到不同类型数据(数值型、分类型、文本型、时序型等)的特性差异,标准针对不同数据类型分别给出了度量指标的计算规则和适用条件。例如,时序数据的完整性度量除需关注空值外还须关注时间点采样频率的规律性;文本数据的准确性度量则涉及语义正确性的判断等复杂维度。这种精细化的度量规范为实际应用提供了充分的操作性指导。(四)数据质量度量过程与结果表达在度量过程和周期上,该标准建立了结构化数据质量度量流程,包括度量需求分析(确定度量目标、范围及应用场景)、质量维度与指标选择(结合业务需求和数据特征确定拟执行的度量维度和具体指标)、度量执行(依据标准规定的计算方法在数据集上计算各项指标值)、结果评估(将度量结果与质量目标或基线水平进行对比判断、评估质量达标情况)、以及度量报告生成(形成包含度量结果、执行过程和发现问题的结构化文档)五个关键步骤。这一完整的度量流程框架为组织提供了统一、可操作的实施指南,确保度量活动从规划设计到结果输出的全过程规范化运作。在度量结果的应用方面,该标准强调质量度量的目的在于为数据质量管理决策提供定量依据,而非单纯的评价打分。标准建议组织将度量结果应用于多个关键场景:数据质量基线管理——建立定期的质量度量时间表,识别质量变化的趋势和规律,为持续性改进提供数据支撑;数据获取决策——在进行数据采购或外部数据接入时,以标准化度量结果作为重要参考基准,为数据估值、质量定价和合格判定提供客观依据;模型训练的迭代优化——在特征筛选、超参数调优等各环节中以质量度量结果反馈指导特征工程和数据增强策略的调整,并在模型部署后持续开展质量监控,及时识别数据漂移等现象并触发模型更新或重新训练流程;以及合规审计准备——为满足监管要求或行业标准提供量化的数据质量证据。四、标准协调性与国内外应用(一)与国际标准和韩国国家标准的协调本标准在制定过程中充分考虑了与现有标准体系的协调一致性。在术语定义层面,标准与ISO/IEC22989《人工智能—人工智能概念与术语》、ISO/IEC23053《使用机器学习的人工智能系统框架》保持一致;在数据质量模型层面,与ISO/IEC25012的兼容性通过在适当沿用相关术语的同时延伸其面向ML的语义内涵来实现;在质量度量方法论层面,本标准与ISO/IEC25024(系统与软件质量测量—数据质量测量)形成互补关系——前者聚焦AI/ML场景,后者覆盖通用数据质量测量,两者在指标定义方式上保持方法论的一致。此外,在数据治理与管理体系层面,本标准与ISO8000系列和ISO/IEC38505(数据治理)标准相衔接,确保数据质量度量能够有效嵌入组织的整体数据治理体系。在韩国国家标准层面,KSXISO/IEC5259-2-2026与韩国国内已发布或正在制定中的相关标准保持协同。该标准与韩国信息通信技术协会(TTA)发布的人工智能数据质量相关团体标准、韩国数据产业振兴院(K-DATA)的数据品质管理指引等形成了互补关系,共同构建了韩国数据质量管理标准体系的多层架构。(二)国际应用现状与产业实践从国际应用角度来看,ISO/IEC5259-2自发布以来已获得广泛关注和应用。在欧盟,该标准已为《人工智能法案》高风险AI系统的数据和数据治理要求的符合性评估提供了重要技术支撑。在中国,全国信息技术标准化技术委员会人工智能分技术委员会(TC28/SC42)将ISO/IEC5259-2转化为国家标准GB/T4xxxx《人工智能分析和机器学习的数据质量第2部分:数据质量度量》,目前处于报批阶段,为国内AI数据质量评估提供标准依据。在企业实践层面,越来越多的AI技术供应商将标准中的数据质量度量维度作为产品功能设计的参考基础,在其数据质量管理平台中内置了完整的质量度量面板,支持多个维度的自动评估和可视化展示;一些金融机构也采用该标准对用于风控模型的数据集进行质量度量和持续监控,满足监管要求的同时有效提升了模型性能。五、主要参与单位介绍本标准的制定由韩国技术标准署(KoreanAgencyforTechnologyandStandards,KATS)统筹主导。作为韩国产业通商资源部下属的国家标准管理机构,KATS依据《韩国产业标准化法》全面负责韩国国家标准的制定、修订、废止和推广工作,同时代表韩国参与ISO和IEC等国际标准化组织的活动,在协调国内产业界、学术界和政府部门的标准化力量方面发挥着核心枢纽作用。在KSXISO/IEC5259-2-2026的研制过程中,KATS充分发挥了统筹规划和管理协调的关键职能:立项阶段,KATS牵头组织开展产业需求调研和标准制定的可行性论证,联合相关部门确认了标准研制的必要性和紧迫性;研制阶段,KATS组建了由人工智能、数据科学、质量管理等多领域专家构成的工作组,对国际标准文本进行了系统性的本土化分析和适应性评估;审议阶段,KATS组织了多轮次的技术审查和公开意见征询,充分吸收产业界和学术界的反馈意见,确保最终标准的科学性、适用性和权威性。此外,KATS还承担了标准发布后的宣传推广和实施指导工作,组织编制标准解读材料、开展面向企业的宣贯培训,并与韩国标准协会(KSA)合作推进标准认证试点工作,推动标准在产业界的广泛应用。在标准研制过程中,韩国科学技术院(KAIST)、首尔大学等学术

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论