人工智能-分析和机器学习(ML)的数据质量-第1部分概述、术语和示例标准立项发展报告_第1页
人工智能-分析和机器学习(ML)的数据质量-第1部分概述、术语和示例标准立项发展报告_第2页
人工智能-分析和机器学习(ML)的数据质量-第1部分概述、术语和示例标准立项发展报告_第3页
人工智能-分析和机器学习(ML)的数据质量-第1部分概述、术语和示例标准立项发展报告_第4页
人工智能-分析和机器学习(ML)的数据质量-第1部分概述、术语和示例标准立项发展报告_第5页
已阅读5页,还剩2页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

人工智能——分析和机器学习(ML)的数据质量——第1部分:概述、术语和示例标准立项发展报告StandardizationDevelopmentReport:Artificialintelligence—Dataqualityforanalyticsandmachinelearning(ML)—Part1:Overview,terminology,andexamples摘要关键词:人工智能;机器学习;数据质量;ISO/IEC5259-1;标准化;数据治理;术语Keywords:ArtificialIntelligence;MachineLearning;DataQuality;ISO/IEC5259-1;Standardization;DataGovernance;Terminology正文1.引言:标准立项背景与行业需求在数字化转型浪潮中,数据被誉为“新时代的石油”,而人工智能与机器学习则是精炼这些石油、提取高价值产品的核心引擎。当前,AI/ML系统的成功与否,在很大程度上不再仅仅取决于算法的先进性,而是越来越依赖于输入数据的内在质量。低质量的数据——无论是缺失、错误、不一致还是过时——都会导致模型“GarbageIn,GarbageOut”(GIGO),引发模型偏差、性能下降、甚至产生有害的决策结果,严重阻碍了AI技术的可信应用与大规模部署。尽管数据质量在传统信息系统和数据治理领域已有一定研究基础,但AI/ML场景下的数据质量面临前所未有的新挑战:-动态性与时效性:模型训练数据、验证数据和实时推理数据往往具有不同的时间属性和分布特征,对数据时效性和稳定性提出了更高要求。-标注与主观性:监督学习依赖人工或半自动标注,标注的一致性和准确性直接影响模型收敛和泛化能力。-高维与复杂性:AI/ML数据常包括非结构化文本、图像、视频、多模态数据及大规模稀疏特征,传统的数据完整性检查方法难以适用。-公平性与伦理:数据中包含的偏见可能被模型放大,产生歧视性结果,对公平性数据质量提出了新维度的要求。在ISO/IEC5259系列标准发布之前,业界虽存在若干有关数据质量的标准(如ISO8000系列),但这些标准主要面向传统结构化数据的一般管理,未能系统覆盖AI/ML模型的全生命周期(包括训练、验证、测试、部署、监控与迭代)。此外,不同厂商、研究机构和企业对“数据质量”的理解与定义存在巨大差异,术语混乱、评估维度不一,导致了高昂的集成与协作成本。鉴于此,ISO/IECJTC1/SC42(人工智能分技术委员会)于2018年提出了ISO/IEC5259系列标准的立项动议,旨在为分析和机器学习领域的数据质量建立一套通用、权威、可操作的标准化框架。ISO/IEC5259-1:2024作为该系列标准的纲领性文件,于2024年7月2日正式发布,标志着全球AI数据质量管理迈入标准化时代。2.标准核心内容解析ISO/IEC5259-1:2024《人工智能——分析和机器学习(ML)的数据质量——第1部分:概述、术语和示例》是整个5259系列的基础。其主要内容可概括为以下几个方面:2.1术语体系的构建标准核心贡献之一是建立了一套统一的、适用于AI/ML上下文的数据质量术语表。包括但不限于:-数据质量:指数据满足特定使用需求的程度。本标准明确了数据质量并非绝对概念,而是与应用场景(如特定ML任务)高度绑定的相对概念。-数据质量维度:用于描述和评价数据质量的某一特定方面或特性。标准列举并定义了关键的维度,如:-完备性:数据在多大程度上包含了所有必要的信息。-准确性:数据描述的真实世界对象或事件的正确程度。-一致性:数据在不同记录、不同时间点或不同系统间保持逻辑关联和相互吻合的程度。-唯一性:数据实体被唯一标识且无重复记录的程度。-及时性/时效性:数据反映当前或所需时间点的状态的程度。-可信性/来源性:数据来源可靠、权威并附有可追溯来源的程度。-可访问性/可用性:数据在需要时能够被授权用户有效获取和使用的程度。-公平性:数据不包含或引入对特定群体或个体的系统偏差,从而影响模型公平性的程度。-数据质量度量:用于量化评估某一数据质量维度级别的指标或方法。2.2数据质量概念模型标准提供了一个概念性参考模型,解释了数据质量在AI/ML系统生命周期的不同阶段(如数据获取、数据处理、数据标注、模型训练、模型评估、模型部署和监控)是如何被影响、评估和保障的。该模型强调了“质量源于设计”的理念,即数据质量管理应贯穿于数据全生命周期,而非仅在事后进行修修补补。2.3数据质量维度在ML场景的扩展在传统数据质量维度(如准确性、完备性)基础上,本标准突出了AI/ML特有的质量关切:-标注质量:针对监督学习,明确提出了标注质量的概念,包括标注的正确性、一致性、覆盖率和中立性。-代表性:数据集能否反映目标应用场景中的真实数据分布,避免分布偏移过采样或欠采样。-可解释性与可追溯性:数据来源、转换历史和标注过程的清晰记录,对于模型审计和可信赖性至关重要。2.4丰富的应用示例报告的核心价值在于实用性。ISO/IEC5259-1提供了多个跨行业的详细应用示例,通过案例具体展示了如何应用上述术语和框架来识别和评估数据质量问题。示例场景包括:-自然语言处理:情感分析数据集中的标注不一致问题。-计算机视觉:自动驾驶场景下的图像数据标注准确性及环境多样性问题。-金融风控:贷款审批模型训练数据中的历史偏见问题。-医疗健康:医学影像数据集的完备性与标注者间一致性评估。这些示例使得抽象的标准条文变得直观易懂,为不同行业的技术人员提供了可直接借鉴的“最佳实践”指南。3.标准的技术定位与价值分析3.1支撑可信赖AI的基础设施当前全球AI治理的核心议题之一是如何确保AI系统的可信赖性(TrustworthyAI)。可信AI通常包含稳健性、透明度、公平性、可解释性和问责制等原则。ISO/IEC5259-1的标准内容直接服务于这些原则。例如,通过明确定义公平性数据维度,为识别和缓解模型偏见提供了量化基础;通过强调数据溯源和可解释性,为模型审计奠定了基础。3.2促进AI产业链的协同与互操作AI产业链涉及数据生产方、数据经纪人、模型开发商、系统集成商、应用部署方及最终用户等众多角色。缺乏统一的数据质量语言,会导致合作各方对数据需求的理解错位,增加沟通成本。ISO/IEC5259-1提供了一套通用的语言和评估框架,使得市场各方能够基于同一套定义和技术规范来交流、验证和交易数据资产,极大地增强了产业链的协同效率。3.3降低AI项目开发风险与成本AI项目失败率高,据统计,超过半数的失败源于数据质量问题而非算法问题。本标准通过强调事前定义质量需求、事中监控质量维度、事后改进问题,为AI项目提供了可复用的质量管理方法论。企业可以基于本标准制定内部的数据质量管理制度,避免了从零开始探索的风险,并降低因数据缺陷造成的高昂返工成本。3.4推动算法评估标准化评估AI模型性能时,模型输出的好坏高度依赖于测试数据的质量。如果测试数据本身存在偏差或标签错误,模型的评估结果将产生误导。ISO/IEC5259-1为评估数据本身的质量提供了依据,从而间接提升了模型评估和基准测试(Benchmark)的客观性与可比较性。4.主要参与单位与技术贡献:ISO/IECJTC1/SC42ISO/IEC5259-1:2024由一个高水平、跨领域的国际专家团队协作完成,其核心推动单位是ISO/IECJTC1(信息技术标准化联合技术委员会)下属的SC42(人工智能分技术委员会)。SC42成立于2017年,是人工智能国际标准化的核心力量,统筹规划AI领域的全面标准化工作,涵盖基础架构、计算技术、可信赖性、治理、数据质量及应用等。SC42的秘书处由美国国家标准学会(ANSI)担任,主席来自中国。技术贡献与工作性质:SC42拥有来自全球几十个国家的数百名代表,以及众多国际组织(如IEEE)、行业协会和企业的专家。5259-1作为数据质量管理体系的基础标准,其制定过程充分体现了SC42的运作模式:-全球协作,凝聚共识:该标准并非由单一国家或企业主导,而是历经多轮讨论、投票和修改,综合了美国、中国、德国、日本、英国、法国等AI强国在数据管理、AI伦理和软件工程方面的最佳实践与学术洞察。-体系化设计:SC42认识到数据质量不能孤立讨论,因此将5259系列纳入其复杂的标准规划中。该系列与SC42其他标准工作组(WG)产出的标准强关联,例如:-ISO/IEC22989《人工智能-概念与术语》:为5259提供了顶层概念基础。-ISO/IEC23053《人工智能与机器学习框架》:描述了AI系统生命周期。-ISO/IEC38507《信息技术-IT治理-组织使用AI的治理指南》:治理层面与数据质量进行衔接。-前瞻性布局:5259-1的制定过程中,专家团队充分考虑了生成式AI(如大语言模型)带来的新挑战,如数据污染、幻觉、以及来源于互联网未标记数据质量和伦理问题,虽然这些趋势在标准发布时尚未完全成熟,但标准术语和框架具备足够的开放性和扩展性。5.结论与展望ISO/IEC5259-1:2024的发布,是AI标准化进程中的一个重要里程碑。它不仅填补了AI领域数据质量管理术语和基础框架的空白,也为后续更具体的标准和操作指南(如ISO/IEC5259-2《数据质量度量》,ISO/IEC5259-3《数据质量要求》,ISO/IEC5259-4《数据质量过程》)的制定奠定了坚实的理论基础。未来发展展望:1.从术语到实践的深化:5259系列标准的后续部分(2、3、4部分)正在或即将制定中,它们将提供具体的度量方法、过程指南和测试方法。这些标准将进一步转化为实际可操作的工具和软件。2.与AI治理和法规的融合:随着《欧盟人工智能法案》等全球主要AI监管法规的落地,企业将有法律责任确保用于AI系统的数据质量符合特定要求。ISO/IEC5259系列标准被预期将成为企业证明其遵守法规的重要技术文件和合规框架。3.与国家标准的互认:中国作为人工智能应用大国,亟需相关标准。我国已由全国信息安全标准化技术委员会(TC260)和全国信息技术标准化技术委员会(TC28)等机构,积极跟踪并计划转化ISO/IEC5259系列为国家标准(GB/T系列)。这将极大促进国内AI数据治理实践的规范化和与国际接轨。4.应对

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论