GBT 44217.11-2024 语言资源管理 语义标注框架 第11部分:可度量数量信息(MQI)标准立项发展报告_第1页
GBT 44217.11-2024 语言资源管理 语义标注框架 第11部分:可度量数量信息(MQI)标准立项发展报告_第2页
GBT 44217.11-2024 语言资源管理 语义标注框架 第11部分:可度量数量信息(MQI)标准立项发展报告_第3页
GBT 44217.11-2024 语言资源管理 语义标注框架 第11部分:可度量数量信息(MQI)标准立项发展报告_第4页
GBT 44217.11-2024 语言资源管理 语义标注框架 第11部分:可度量数量信息(MQI)标准立项发展报告_第5页
已阅读5页,还剩5页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

语言资源管理语义标注框架第11部分:可度量数量信息(MQI)标准立项发展报告StandardizationDevelopmentReport:LanguageResourceManagement—SemanticAnnotationFramework—Part11:MeasurableQuantitativeInformation(MQI)摘要随着人工智能、自然语言处理及大数据技术的迅猛发展,语言资源作为支撑智能信息处理的基础性战略资源,其规范化管理和精细化标注需求日益迫切。语义标注是实现语言资源互操作和深度利用的关键环节,而其中可度量数量信息(MeasurableQuantitativeInformation,MQI)的标准化标注更是涉及科学、经济、医疗、教育等多领域知识表达的核心问题。本报告围绕国家标准GB/T44217.11-2024《语言资源管理语义标注框架第11部分:可度量数量信息(MQI)》的立项背景、研制过程、技术内容及推广应用展开系统阐述。该标准作为GB/T44217系列标准的第11部分,首次从国际视野出发,构建了面向多语言环境中可度量数量信息的统一语义标注框架,明确了MQI的概念模型、标注类别体系、标注表示方法及其与既有语义标注框架的兼容机制,填补了我国在数量信息语义标注领域的标准空白。本报告还详细介绍了标准主要起草单位——中国科学技术信息研究所的标准化工作基础及贡献,并对该标准在跨语言信息检索、智能问答系统、科学数据管理及国际标准对接等领域的应用前景进行了展望,旨在为相关领域的研究人员、技术人员及标准化工作者提供系统性参考。关键词:语言资源管理;语义标注框架;可度量数量信息;MQI;国家标准;自然语言处理;知识表示Keywords:LanguageResourceManagement;SemanticAnnotationFramework;MeasurableQuantitativeInformation;MQI;NationalStandard;NaturalLanguageProcessing;KnowledgeRepresentation1引言在信息技术飞速演进的当代,语言资源已成为人工智能、大数据分析、跨语言信息检索等领域的核心基础设施。根据中国互联网络信息中心(CNNIC)发布的第53次《中国互联网络发展状况统计报告》,截至2024年6月,我国网民规模已近11亿人,互联网普及率达78.0%,数字内容的生成规模与日俱增。在此背景下,如何对海量语言资源进行系统化管理和精细化标注,使之成为机器可读、可理解、可推理的知识资源,已成为语言信息技术领域的重大课题。语义标注(SemanticAnnotation)作为连接自然语言表达与形式化知识表示的关键桥梁,旨在为文本、语音等语言数据赋予计算机可处理的语义信息。国际标准化组织ISO/TC37(术语与语言资源标准化技术委员会)自2006年起启动了语义标注框架系列标准的研制工作,形成了ISO24617系列标准。其中,可度量数量信息(MQI)作为语义标注的重要维度,涉及长度、重量、时间、温度、货币、浓度等各类带量纲的数量表达,在科学研究、医疗卫生、国际贸易、工程技术等领域具有广泛的应用需求。然而,由于不同语言中数量表达方式的差异性和复杂性,长期以来缺乏统一的、可跨语言操作的MQI标注框架,导致各系统间的语义标注结果难以互操作和共享。在此国际国内背景下,全国语言与术语标准化技术委员会(SAC/TC62)积极推动ISO24617-11:2021《语言资源管理语义标注框架第11部分:可度量数量信息(MQI)》向我国国家标准转化,由中国科学技术信息研究所等权威机构牵头起草了GB/T44217.11-2024。本标准的发布实施,标志着我国在语言资源语义标注标准化领域迈出了具有里程碑意义的一步,对于提升我国语言资源建设和应用水平、促进国际学术交流与合作具有重要意义。2标准编制背景2.1国际标准化动态在国际层面,ISO/TC37/SC4(语言资源管理分技术委员会)负责语言资源管理的标准化工作。该分技术委员会自成立以来,围绕语言资源管理发布了多项重要国际标准,其中ISO24617系列标准是语义标注领域的核心标准簇。该系列标准采用“分部分”的框架结构,每个部分针对特定类型的语义现象制定标注规范。截至目前,ISO24617系列已涵盖对话行为(Part1)、对话行为与隐喻(Part2)、参照域(Part3)、语义角色(Part4)、话语连接结构(Part5)、时间和事件(Part6)、空间信息(Part7)、关系指示(Part8)等多个子标准。可度量数量信息(MQI)标准(ISO24617-11:2021)是该系列的第11部分。MQI标准旨在为自然语言中涉及度量信息的表达提供一套统一的语义标注规范,其覆盖范围包括但不限于:物理量(如质量、长度、温度)、时间量(如时长、时刻)、货币量、比例与百分比、统计量等多类数量信息。该标准的研制工作始于2018年,经过多轮国际专家讨论和跨语言验证,于2021年正式发布。2.2国内标准化需求从国内视角来看,我国在语言资源管理和语义标注领域虽然已有一定的研究和应用基础,但在可度量数量信息的标准化标注方面长期处于缺乏统一规范的状况。随着人工智能技术的深入发展,特别是大规模语言模型、智能问答系统、知识图谱构建等应用的快速推进,数量信息的准确理解和精细化标注已成为制约系统性能提升的瓶颈之一。具体而言,MQI标准的需求主要体现在以下几个方面:其一,在跨语言信息检索中,同一数量信息在不同语言中的表达方式差异显著,需要统一的标注框架来实现跨语言映射;其二,在科学数据管理与学术文献挖掘中,各类实验数据、统计指标的准确提取和语义标注是实现数据互操作的基础;其三,在智能医疗、智能制造等领域,数量信息的精确理解和推理直接影响系统的决策质量;其四,在标准化工作本身层面,我国积极参与国际标准转化,有助于提升中国在国际标准化事务中的话语权和影响力。2.3标准立项依据本标准的立项依据主要包括以下几个方面:(1)《中华人民共和国标准化法》及《国家标准化发展纲要》提出的“推动标准国际化”“加快关键技术标准研制”等战略要求;(2)国家标准化管理委员会关于采用国际标准的政策导向,鼓励将国际标准转化为国家标准,提升我国标准的国际兼容性;(3)全国语言与术语标准化技术委员会(SAC/TC62)的工作规划中将ISO24617系列标准转化作为重点任务;(4)国内语言资源建设、自然语言处理研究及人工智能产业发展的现实需求。3标准主要技术内容3.1标准定位与适用范围GB/T44217.11-2024《语言资源管理语义标注框架第11部分:可度量数量信息(MQI)》定位于为自然语言文本中可度量数量信息的语义标注提供统一规范。本标准适用于各类自然语言处理和语言资源建设场景,包括但不限于:语料库建设与标注、信息抽取系统开发、机器翻译质量评估、智能问答与对话系统设计、科学文献知识挖掘等领域。标准明确了其适用范围涵盖书面文本和口语转写文本中的可度量数量信息标注,支持多语言环境下的标注工作,并可与ISO24617系列其他部分配合使用。3.2核心术语与概念模型标准对“可度量数量信息”(MeasurableQuantitativeInformation,MQI)进行了严格定义,将其界定为“自然语言表达中可通过度量工具或度量标准进行量化描述的语义信息”。MQI的核心要素包括:-量值(Magnitude):数量信息中的数值成分,可以是精确值或近似值;-计量单位(Unit):用于度量量值的标准单位,涵盖国际单位制(SI)单位、法定计量单位及常用非标准单位;-度量维度(Dimension):指所度量对象的物理或逻辑属性范畴,如长度、质量、时间、温度、面积、体积、速度、货币量、浓度、比例等;-精度与误差(PrecisionandUncertainty):对数量信息的精确程度和不确定性描述;-量值范围(Range):上下界数量表达;-比较关系(Comparison):数量之间的相对大小关系。标准构建了一个层次化的MQI概念模型,将上述要素组织为一个结构化的信息框架。该模型的设计遵循了ISO24617系列标准的总体原则,采用了“语义类别+属性结构”的描述方式,确保与系列中其他部分的兼容性和一致性。3.3MQI标注类别体系MQI标准定义了一个多维度的标注类别体系,主要包括以下层级:第一层:基础标注类别-数量表达(QuantityExpression):标注文本中作为数量表达的基本语言单元;-度量维度类型(MeasurementDimensionType):标注数量所属的度量维度;-量值标注(MagnitudeAnnotation):标注数值成分的具体取值;-单位标注(UnitAnnotation):标注计量单位及其换算信息。第二层:语义关系标注类别-精度类型(PrecisionType):区分精确数量、近似数量、估计数量等;-范围表达(RangeExpression):标注区间型数量信息;-比较表达(ComparisonExpression):标注大于、小于、约等于等比较关系。第三层:上下文相关标注类别-时间限定(TemporalQualification):标注数量信息的时间有效性;-条件限定(ConditionalQualification):标注数量信息的适用条件;-来源标注(SourceAttribution):标注数量信息的来源或依据。3.4标注表示方法在具体标注表示层面,标准借鉴了ISO24617系列通用的形式化标注语言(ISO24617-1定义的抽象语义表示方法),为MQI标注设计了XML表示体系和JSON-LD表示方案。标注表示方法的核心特征包括:1.统一性:标注结构遵循统一的元模型,确保不同标注者之间的一致性;2.可扩展性:支持在基础框架上进行领域化扩展,满足特定领域的标注需求;3.互操作性:标注结果可直接映射为RDF等知识图谱表示,支持语义网应用;4.可追溯性:每个标注单元均保留指向原始文本的引用信息,便于验证和修订。标准还提供了丰富的标注示例和规范化标注流程指导,涵盖中英文在内的多语言示例,为标注实践提供了具体参照。3.5与ISO24617系列的协调兼容作为GB/T44217系列标准(等同采用ISO24617系列)的组成部分,本标准的编制严格遵循了ISO24617框架标准的顶层设计原则。标准在概念定义、标注数据类型、抽象语法表示等方面均与系列中已有部分保持协调一致,确保各子标准可组合使用、互不冲突。具体而言,MQI标准与ISO24617-1(语义标注框架总体框架)、ISO24617-6(时间和事件标注)以及ISO24617-7(空间信息标注)之间建立了明确的接口机制。例如,在标注涉及时间语义的数量信息时,MQI标准推荐使用时间标注框架中定义的TimeML风格标注属性;在标注空间度量信息时,则与空间信息标准中定义的空间参照体系相衔接。4主要起草单位介绍本标准的主要起草单位是中国科学技术信息研究所(InstituteofScientificandTechnicalInformationofChina,简称ISTIC)。该研究所成立于1956年,是直属于科学技术部的国家级公益性科技信息研究机构,长期致力于科技信息资源建设、科技情报分析与研究工作。在语言资源管理和自然语言处理标准化领域,中国科学技术信息研究所拥有深厚的研究积累和丰富的实践经验。研究所配备了专业的自然语言处理实验室和标准化研究团队,现有研究人员中多人担任全国语言与术语标准化技术委员会(SAC/TC62)委员,并深度参与ISO/TC37国际标准化工作。近年来的主要进展包括:在标准研制方面,该所作为核心起草单位完成了多项国家和行业标准的制修订工作,在术语标准化、语言资源管理、知识组织系统等领域贡献突出。研究所团队成员多次代表中国参加ISO/TC37国际会议,在语义标注、术语学等方向上提出了多项国际标准提案和技术建议。在技术研发方面,研究所自主研发了大规模中文科技文献语料库和语义标注平台,构建了覆盖物理、化学、生物、医学等多个学科领域的科技实体识别和语义关系抽取系统。在可度量数量信息处理方面,研究所积累了丰富的技术储备和实践验证基础,为标准的制定提供了有力的技术支撑。在应用推广方面,研究所与国家科技图书文献中心(NSTL)等国家级科技信息平台深度协作,将标准化成果直接应用于科技文献的知识组织与语义检索。同时,面向医疗卫生、气象、计量等多行业开展技术咨询和标准宣贯培训,推动标准的落地实施。5标准的应用前景分析5.1跨语言信息检索领域MQI标准为跨语言环境下数量信息的统一标注提供了技术规范。在学术文献、专利文本等跨语言信息检索场景中,数量信息往往是用户查询的核心约束条件,例如“查找沸点超过100℃的材料”。通过采用本标准定义的标注框架,各检索系统可在统一的语义层面上进行数量约束的匹配和推理,有效提升跨语言信息检索的准确率和召回率。5.2智能问答与对话系统在智能问答系统(如医疗咨询、法律咨询、金融问答等垂直领域)中,数量信息的准确理解和逻辑推理是决定回答质量的关键因素。MQI标准的应用使得问答系统能够对用户问题中的数量约束进行结构化解析,并在知识库中精确匹配具有相应数量特征的知识条目,从而显著提升系统的语义理解能力和答复精度。5.3科学数据管理与语义出版在科研数据开放共享的大趋势下,论文中实验数据的机器可读性和可计算性变得越来越重要。MQI标准为学术论文中实验测量数据、统计结果等数量信息的结构化标注提供了标准化方案。科技期刊和学术数据库可基于本标准对论文中的数量信息进行标注,实现数据从非结构化文本到结构化知识库的自动转换,服务于科学数据的深度挖掘与知识发现。5.4国际标准对接与互认由于本国家标准等同采用了ISO24617-11:2021,在标准技术内容和标注体系层面实现了与国际标准的完全对接。这意味着采用本国家标准构建的语言资源和标注数据天然具备国际兼容性,可直接参与国际合作与数据交换,为我国语言技术产品和服务“走出去”提供了标准支撑。6结论与展望GB/T44217.11-2024《语言资源管理语义标注框架第11部分:可度量数量信息(MQI)》的制定与发布,填补了我国在数量信息语义标注标准化领域的空白,是推动我国语言资源管理工作迈向精细化、国际化的重要里程碑。该标准以ISO24617-11:2021为基础,结合我国语言资源建设和人工智能技术发展的实际需求,构建了一套科学、系统、可扩展的可度量数量信息语义标注框架。展望未来,随着人工智能技术的持续演进和语言资源应用场景的不断拓展,MQI标准在以下方面仍有广阔的发展空间:一是面向特定垂直领域的MQI标注扩展规范(如医学检验数据标注、工程测量数据标注等)的研制;二是与机器学习标注规范、大语言模型评测基准等新兴标准化需求的融合与衔接;三是在标准技术内容的基础上开发智能标注工具和自动标注服务,降低标准实施门槛、提升标注效率;四是进一步深化国际合作,在ISO/TC37框架下持续贡献中国经验和智慧,推动数量信息语义标注标准的持续演进和完善。本标准的有效实施,不仅将为我国语言资源管理提供坚实的技术规范,也将为全球语言资源语义互联互通贡献中国方案。期待更多的科研机构、高等院校和企业在本标准的基础上积极探索实践,共同推动语言资源管理的标准化和智能化发展。参考文献[1]国家标准化管理委员会.GB/T44217.11-2024语言资源管理语义标注框架第11部分:可度量数量信息(MQI)[S].北京:中国标准出版社,2024.[2]InternationalOrganizationforStandardization.ISO24617-11:2021Languagereso

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论