ISOIEC TS 42119-22025 人工智能 人工智能测试 第2部分测试人工智能系统概述标准立项发展报告_第1页
ISOIEC TS 42119-22025 人工智能 人工智能测试 第2部分测试人工智能系统概述标准立项发展报告_第2页
ISOIEC TS 42119-22025 人工智能 人工智能测试 第2部分测试人工智能系统概述标准立项发展报告_第3页
ISOIEC TS 42119-22025 人工智能 人工智能测试 第2部分测试人工智能系统概述标准立项发展报告_第4页
ISOIEC TS 42119-22025 人工智能 人工智能测试 第2部分测试人工智能系统概述标准立项发展报告_第5页
已阅读5页,还剩6页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

人工智能人工智能测试第2部分:测试人工智能系统概述标准立项发展报告StandardizationDevelopmentReport:ArtificialIntelligence-TestingofAI-Part2:OverviewofTestingAISystems摘要随着人工智能技术在医疗、交通、金融、制造等关键行业的规模化部署与深度应用,AI系统的可信赖性、安全性及鲁棒性已成为全球标准化治理的核心议题。在此背景下,国际电工委员会(IEC)于2025年11月3日正式发布了ISO/IECTS42119-2:2025《人工智能人工智能测试第2部分:测试人工智能系统概述》。该标准作为ISO/IEC42119系列的重要组成部分,首次从系统层面构建了人工智能测试的统一框架,系统界定了AI测试的基本概念、测试类别、测试过程及测试与评估的关系,填补了AI测试领域基础性、概述性国际标准的空白。关键词:人工智能测试;系统测试框架;可信赖AI;国际标准;ISO/IEC42119;质量保障;标准化Keywords:ArtificialIntelligenceTesting;SystemTestingFramework;TrustworthyAI;InternationalStandards;ISO/IEC42119;QualityAssurance;Standardization一、引言1.1研究背景人工智能技术的飞速发展正在深刻改变经济社会运行方式。据国际数据公司(IDC)预测,全球AI市场规模将在2027年突破5000亿美元,年复合增长率超过25%。与此同时,AI系统在实际部署中暴露出的安全性、公平性、透明性和鲁棒性问题日益凸显——自动驾驶事故、算法歧视事件、生成式AI“幻觉”等问题引发了全球范围内的广泛关注。国际标准化组织(ISO)和国际电工委员会(IEC)作为全球最权威的标准化机构,近年来持续加大AI领域的标准研制力度。ISO/IECJTC1(信息技术联合技术委员会)下设的SC42(人工智能分技术委员会)专门负责AI标准化工作,已发布和正在研制中的标准超过40项,覆盖基础术语、风险管理、可信赖性、算法评估、数据质量等多个维度。在此背景下,ISO/IECTS42119-2:2025的发布具有标志性意义。该标准首次在ISO/IEC标准体系中系统性地回答了“什么是AI测试”“AI测试包含哪些内容”“如何组织开展AI测试”等基础性问题。作为AI测试领域的技术规范(TechnicalSpecification),它为后续更细分的AI测试标准(如数据集测试、算法测试的具体方法标准)奠定了概念基础、分类框架和流程指引。1.2标准立项的必要性AI系统与传统软件系统存在本质差异。传统软件测试基于明确的确定性逻辑和规格说明,而AI系统具有数据驱动、行为涌现、非确定性输出等特点,其测试面临“测试预言”(TestOracle)缺失、输入空间高维、行为边界模糊等根本性挑战。现有ISO/IEC/IEEE29119系列软件测试标准主要针对传统软件系统,难以直接适用于AI系统的测试需求。此外,AI系统的高风险应用场景对测试提出了更高要求。例如,医疗AI系统的误诊率评估、自动驾驶系统的边缘场景覆盖、金融风控模型的抗扰动能力等,都需要专门的测试方法论和指标体系。行业迫切需要一份系统性的、可操作的AI测试框架性标准,以统一认识、规范流程、指导实践。1.3标准定位与意义ISO/IECTS42119-2:2025定位于“概述性”和“框架性”标准,是ISO/IEC42119《人工智能人工智能测试》系列标准的第二部分。该系列标准的整体架构如下:-第1部分(拟制定):AI测试的总体概念和术语-第2部分(本标准):测试AI系统概述-后续部分(拟制定):AI测试的具体方法和算法评估细节本标准的发布有效填补了国际AI标准体系中“测试框架”层面的空白,具有承上启下的重要作用——向上对接ISO/IEC22989(AI概念与术语)、ISO/IEC23053(AI系统框架)等基础性标准,向下牵引各行业AI测试实施指南的制定。二、标准基本信息|项目|内容||------|------||标准编号|ISO/IECTS42119-2:2025||标准名称(中文)|人工智能人工智能测试第2部分:测试人工智能系统概述||标准名称(英文)|Artificialintelligence-TestingofAI-Part2:OverviewoftestingAIsystems||标准状态|现行||发布机构|国际电工委员会(IEC)||ICS分类号|35.020(信息技术综合)||发布日期|2025年11月3日||发布年份|2025年||国别|国际组织||语言|英语||版本说明|电子版加密PDF格式,约1分钟可下载,有水印,需安装FileOpen插件,电脑需联网,限制累计3台电脑共打印5次||售价|1286.0元人民币|三、标准核心内容解析3.1标准适用范围本标准适用于各类AI系统的测试活动,包括但不限于:-基于机器学习的预测和决策系统-自然语言处理系统(包括大语言模型应用)-计算机视觉系统-智能推荐系统-自主决策与控制系统-混合人机协同系统标准面向AI系统开发方、测试方、第三方评估机构、监管机构以及最终用户等多类利益相关方。3.2关键术语与概念界定标准对AI测试领域的核心术语进行了系统界定,主要包括:(1)AI测试(AITesting)标准将AI测试定义为“为评估AI系统一个或多个质量特性而执行的技术操作”。该定义延续了ISO/IEC/IEEE29119-1(软件测试概念与定义)的基本框架,但同时突出了AI系统的特殊性——测试目标不仅包括功能正确性,更包括鲁棒性、公平性、可解释性、安全性等AI特有属性。(2)测试预言(TestOracle)针对AI系统“测试预言”难题,标准提出了分层测试预言的概念,包括完整预言、部分预言和统计预言。其中统计预言是AI测试的重要创新——基于统计方法判断输出是否符合预期分布。(3)对抗性样本(AdversarialExamples)标准专门界定了对抗性样本的概念,将其定义为“经过有意扰动但保持人类感知不变的数据输入”,这一定义为后续对抗性测试方法的标准化奠定了基础。(4)AI质量特性(AIQualityCharacteristics)标准提出了AI系统测试所关注的质量特性框架,包括:功能正确性、性能效率、兼容性、易用性、可靠性、安全性、可维护性、可移植性、鲁棒性、公平性、可解释性、隐私保护等。3.3AI测试的类别划分标准从多个维度系统划分了AI测试的类型,构建了多维度分类框架:(1)按测试对象层级划分|层级|描述|测试重点||------|------|----------||单元级测试|针对AI模型的单个组件|单一算法模块、数据预处理环节||模型级测试|针对AI模型整体|模型精度、鲁棒性、泛化能力||系统级测试|针对嵌入AI的完整系统|端到端功能、性能、交互安全性||生态级测试|针对AI系统的运行环境|与外部系统协同、数据流、部署环境|(2)按测试目的划分标准将AI测试分为:正确性测试(验证功能是否满足需求)、鲁棒性测试(评估对抗扰动和输入变异下的表现)、公平性测试(检测不同群体间的性能差异)、安全性测试(评估系统在恶意攻击下的表现)、性能测试(评估资源效率和响应能力)以及可解释性测试(评估预测过程的可理解程度)等六大类。(3)按测试阶段划分标准提出全生命周期测试理念,贯穿数据准备、模型开发、模型验证、部署上线、运行监控、更新迭代等阶段的全生命周期测试理念。3.4测试过程与流程标准参考ISO/IEC/IEEE29119-2(软件测试过程)的框架,提出了AI测试的统一过程模型,包括:测试策划(定义测试范围、策略、资源与排期)、测试设计(设计测试用例、生成测试数据)、测试执行(运行测试并记录结果)、测试评估(比对预期与实际结果并形成评估结论)与测试报告(记录测试全过程及结论)五个基本阶段。同时,针对AI测试的特殊需求,增加了数据验证与模型评估两个关键环节。标准特别强调,AI测试过程应体现两个核心原则:一是风险驱动,根据AI系统的应用场景风险等级确定测试深度和范围;二是持续测试,AI系统在部署后仍需持续监控和测试,以适应数据漂移和概念漂移。四、标准的关键技术特征与创新4.1分级测试框架标准提出分级测试框架(TieredTestingFramework),将AI测试划分为三个层级:-Tier1:组件级测试——针对数据管线、特征工程、模型训练等独立组件-Tier2:模型级测试——针对AI模型的行为特性、鲁棒性、敏感性-Tier3:系统级测试——针对包含AI模型的完整产品系统分级框架的核心价值在于:允许测试人员根据测试目标和资源约束灵活选择合适的测试层级,实现测试效率与测试覆盖度的平衡。4.2结合生命周期的AI测试框架本标准的另一大亮点在于:其将AI测试置于系统全生命周期视角之下进行统筹考量,明确提出了在各生命周期阶段(需求分析、数据工程、模型开发、系统集成、运行维护等)的测试关注点和对应方法,从而实现了测试活动在不同阶段的有效衔接和资源优化配置。4.3数据测试与模型测试的区分标准明确区分了数据测试和模型测试两个子域:-数据测试侧重于数据质量评估,包括完整性、一致性、准确性、时效性、平衡性等方面,同时涉及数据漂移检测、数据偏见评估和数据溯源验证。-模型测试侧重于模型行为验证,包括功能正确性、鲁棒性、泛化性和公平性等维度。两个子域相互依赖但又各有方法论体系,这种区分为后续制定专门的数据测试标准和模型测试标准提供了概念基础。4.4测试充分性度量面对AI测试“测到什么程度才够”的难题,标准初步提出了AI测试充分性度量的若干指标:数据覆盖率(测试数据对输入空间的覆盖程度)、行为覆盖率(AI系统关键行为被触发和验证的比例)、元路径覆盖(对关键决策路径的覆盖情况)和对抗样本多样性(对抗样本的类别和强度分布)。这些度量指标为AI测试的量化管理和风险评估提供了参考依据。4.5测试工具与自动化标准还关注AI测试工具链的建设问题,提出了AI测试工具应具备的典型功能,包括测试数据生成、测试预言构造、测试执行引擎、覆盖率分析和报告生成等。同时鼓励开发基于机器学习的智能测试工具——即“用AI测试AI”的技术路线。五、标准制定的背景与研制历程5.1研制背景AI技术的产业化进程正在加速推进,全球多个主要经济体已将AI发展上升为国家战略。与此同时,AI系统事故频发——据统计,2012年至2025年间,全球公开报道的重大AI安全事件超过1000起。在此背景下,各国监管机构纷纷加强AI治理。欧盟《人工智能法案》(AIAct)已于2024年正式生效,中国《生成式人工智能服务管理暂行办法》等法规相继出台,美国也发布了多项AI监管框架文件。这些法规均对AI系统的测试和评估提出了明确要求。然而,在此之前,国际上缺乏系统性指导AI测试的统一标准。ISO/IEC29119系列软件测试标准虽然成熟,但主要针对确定性软件系统;学术界虽积累了大量的AI测试研究成果,但尚未转化为可广泛执行的国际标准。ISO/IECTS42119-2:2025的发布填补了在这一关键环节上的标准化空白。5.2研制历程ISO/IECTS42119-2的研制遵循ISO/IECJTC1的标准制定流程,经历了以下关键阶段:-提案阶段(ProposalStage):由SC42专家提出AI测试概述性标准的新工作项目建议(NP),经过成员国投票表决通过。-准备阶段(PreparatoryStage):成立工作组(WG)或维持现有工作组架构,召集国际专家编制工作草案(WD)。-委员会阶段(CommitteeStage):草案在SC42内部进行多轮审议,形成委员会草案(CD),征求各成员国意见并处理反馈。-询问阶段(EnquiryStage):草案作为国际标准草案(DIS)或技术规范草案(DTS)分发至各成员国进行投票和评论。-批准阶段(ApprovalStage):最终草案(FDIS或FDTS)通过最终表决。-发布阶段(PublicationStage):由ISO和IEC正式发布。该标准从立项到发布全过程历时约24至30个月,凝聚了来自中国、美国、英国、德国、日本、韩国、加拿大等数十个国家的百余位AI与测试领域专家的智慧与经验。5.3与其他标准的协调关系ISO/IECTS42119-2:2025在制定过程中注重与多个现有标准的协调衔接:-ISO/IEC22989:2022(AI概念与术语)——本标准的术语定义与该标准保持一致;-ISO/IEC23053:2022(AI系统框架)——标准的系统层级测试框架参考了其中定义的AI系统架构;-ISO/IEC23894(AI风险管理)——测试过程的风险驱动原则与该标准的风险管理框架对接;-ISO/IEC25059(AI质量评估)——测试质量特性与软件工程质量模型相衔接;-ISO/IEC/IEEE29119系列(软件测试标准)——基本测试过程模型与29119兼容,同时增加了AI特有内容。六、主要参与单位介绍6.1标准研制的主要推动力量ISO/IECTS42119-2:2025的研制由ISO/IECJTC1/SC42(人工智能分技术委员会)组织推进。SC42成立于2017年,是ISO和IEC在AI领域最核心的标准化技术组织,其工作范围涵盖AI基础标准、可信赖性、数据质量、算法评估、应用指南等多个方面。SC42现任主席为美国专家,秘书处设在美国标准协会(ANSI)下属的InterNationalCommitteeforInformationTechnologyStandards(INCITS)。SC42下设多个工作组(WG),其中与AI测试直接相关的有:-WG1:基础标准工作组——负责AI术语、概念、框架等基础性标准的研制;-WG3:可信赖性工作组——负责AI可信赖性相关标准(包括鲁棒性、可解释性、公平性等);-WG4:应用与用例工作组——负责各行业AI应用指南的研制。本标准的研制由WG3和WG1联合推进,汇集了来自全球的AI测试专家、软件测试专家、算法评估专家和质量工程专家。6.2中国参与情况及主要贡献单位中国是SC42的重要参与国。中国电子技术标准化研究院(CESI)作为我国IT领域国家标准研制的核心机构,在AI标准化方面发挥了核心作用:-承担全国信息技术标准化技术委员会人工智能分技术委员会(TC28/SC42)秘书处工作;-深度参与SC42多项国际标准的研制,包括本标准的制定;-牵头制定多项AI领域国家标准,推动国际标准与

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论