ISOIEC 246612023 信息技术.用户接口.全双工语音交互标准立项发展报告_第1页
ISOIEC 246612023 信息技术.用户接口.全双工语音交互标准立项发展报告_第2页
ISOIEC 246612023 信息技术.用户接口.全双工语音交互标准立项发展报告_第3页
ISOIEC 246612023 信息技术.用户接口.全双工语音交互标准立项发展报告_第4页
ISOIEC 246612023 信息技术.用户接口.全双工语音交互标准立项发展报告_第5页
已阅读5页,还剩4页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

信息技术用户接口全双工语音交互标准立项发展报告StandardizationDevelopmentReport:InformationTechnology-UserInterfaces-FullDuplexSpeechInteraction摘要随着人工智能与物联网技术的深度融合,语音交互已从传统的“按压讲话”(Push-to-Talk)单工模式向全双工自然对话模式演进,成为智能汽车、智能家居、可穿戴设备及远程会议系统等众多领域的关键人机交互范式。在此背景下,国际电工委员会(IEC)与国际标准化组织(ISO)联合发布了ISO/IEC24661:2023《信息技术用户接口全双工语音交互》国际标准。本报告系统梳理了该标准的立项背景、编制历程、核心技术框架及适用场景,重点分析了标准中所定义的全双工语音交互参考模型、音频处理与回声消除要求、打断管理机制、多设备协同策略以及安全与隐私保护条款。报告指出,ISO/IEC24661:2023的发布填补了国际标准化领域在全双工语音交互系统架构与评价方面长期存在的空白,为全球范围内相关产品的研发、测试与合规评估提供了统一的技术依据。报告同时对该标准的主要起草单位之一——中国电子技术标准化研究院的参与情况进行了介绍,并对标准在智能座舱、智能家居及无障碍辅助等领域的应用前景进行了展望,旨在为相关行业技术人员、标准化工作者及产业决策者提供系统性的参考与指导。关键词:全双工语音交互;用户接口;国际标准;人机交互;语音识别;回声消除;打断管理AbstractWiththedeepintegrationofartificialintelligenceandtheInternetofThings,voiceinteractionhasevolvedfromthetraditionalpush-to-talkhalf-duplexmodetoafullduplexnaturalconversationparadigm,becomingakeyhuman-computerinteractionmodalityinintelligentvehicles,smarthomes,wearabledevices,remoteconferencingsystems,andnumerousotherdomains.Againstthisbackdrop,theInternationalElectrotechnicalCommission(IEC)andtheInternationalOrganizationforStandardization(ISO)jointlypublishedISO/IEC24661:2023,"InformationTechnology-UserInterfaces-FullDuplexSpeechInteraction."Thisreportsystematicallyreviewsthestandard'sbackground,developmentprocess,coretechnicalframework,andapplicationscenarios,withafocusonanalyzingthefullduplexspeechinteractionreferencemodel,audioprocessingandechocancellationrequirements,interruptionmanagementmechanisms,multi-devicecollaborationstrategies,andsecurityandprivacyprotectionprovisionsdefinedtherein.ThereporthighlightsthatthepublicationofISO/IEC24661:2023fillsalong-standinggapininternationalstandardizationregardingfullduplexspeechinteractionsystemarchitectureandevaluation,providingaunifiedtechnicalbasisfortheresearch,development,testing,andcomplianceassessmentofrelatedproductsworldwide.ThereportalsointroducestheparticipationoftheChinaElectronicsStandardizationInstituteasoneoftheprimarydraftingorganizationsanddiscussesthestandard'sfutureapplicationprospectsinintelligentcockpits,smarthomes,andaccessibilityassistance,aimingtoprovidesystematicreferenceandguidancefortechnicalprofessionals,standardizationpractitioners,andindustrydecision-makers.Keywords:Fullduplexspeechinteraction;Userinterfaces;Internationalstandard;Human-computerinteraction;Speechrecognition;Echocancellation;Interruptionmanagement一、引言1.1立项背景语音作为人类最自然、最高效的沟通方式,长期以来一直是人机交互领域的研究与产业化重点。早期的语音交互系统普遍采用“按压讲话”(Push-to-Talk)模式,用户必须按住物理按键或等待系统提示音结束后才能说话,系统与用户之间呈现严格的“轮流发言”单向通道特征,这种模式在交互效率、自然度和用户体验方面均存在明显局限。随着深度学习驱动的语音识别(ASR)、自然语言理解(NLU)以及语音合成(TTS)技术的迅猛发展,语音交互系统已具备实时处理和连续对话的能力,全双工(FullDuplex)语音交互——即用户与系统能够同时说话并相互感知、响应的交互模式——逐渐从理论研究走向工程实现。在智能汽车领域,全双工语音交互使驾驶员能够在系统播报导航信息的同时直接下达新指令,无需等待播报结束,大幅提升了驾驶安全性和操作效率。在智能家居场景中,用户可以与语音助手进行自然的多轮对话,随时打断和修正,体验更接近人际交流。在远程会议、在线教育和医疗问诊等场景中,全双工语音技术同样成为提升沟通效率的关键支撑。然而,由于缺乏统一的国际标准,不同厂商的全双工语音交互系统在架构设计、接口协议、性能评价指标等方面互不兼容,导致产品互通性差、测试评价缺乏依据、市场准入标准不一等问题日益突出,严重制约了产业的健康发展。1.2标准编制历程针对上述产业需求,ISO/IECJTC1(信息技术联合技术委员会)下属的SC35(用户接口分技术委员会)于2019年正式启动全双工语音交互国际标准的预研工作。经过多轮国际研讨会和专家论证,该项目于2021年完成立项投票并正式注册为工作组草案(WD),编号ISO/IEC24661。标准编制过程中,来自中国、美国、德国、日本、韩国等国家的标准化专家和技术企业代表积极参与,围绕系统架构、音频处理、打断管理、互联互通等关键技术议题展开了深入讨论。经过工作组草案(WD)、委员会草案(CD)、国际标准草案(DIS)和最终国际标准草案(FDIS)等多个阶段的严格评审与修改,该标准于2023年5月22日正式发布。1.3标准定位与意义ISO/IEC24661:2023的发布具有多重重要意义。首先,它填补了国际标准化体系中全双工语音交互领域无统一标准的空白,为技术创新和产品研发提供了基准框架。其次,标准定义了系统间互通互操作的技术要求,为构建开放、兼容的语音交互生态奠定了基础。再次,标准对安全、隐私和可访问性提出了明确要求,有利于保护用户权益并促进包容性设计。最后,该标准作为ISO/IECJTC1框架下的正式国际标准,为各国采标和行业应用提供了权威依据。二、标准主要内容2.1范围与适用场景ISO/IEC24661:2023规定了全双工语音交互系统的总体架构、功能模块、接口要求、性能指标和评价方法。标准适用于以下类型的系统与场景:-智能车载语音交互系统(包括车载信息娱乐系统、导航系统、语音助手等);-智能家居语音控制设备(包括智能音箱、智能家电、智能安防设备等);-可穿戴智能设备(包括智能手表、智能耳机、AR/VR设备等);-远程会议与协同办公系统(包括视频会议终端、智能麦克风阵列等);-面向老年人及残障人士的语音辅助交互系统;-其他采用全双工语音交互模式的信息技术产品与服务。标准不限定具体的实现技术和平台,而是从功能架构和交互行为层面提出规范性要求,以保持技术中立性和未来适应性。2.2术语与定义标准对全双工语音交互领域的核心术语进行了系统定义,包括但不限于:全双工语音交互(fullduplexspeechinteraction)、半双工语音交互(halfduplexspeechinteraction)、打断(barge-in)、回声消除(echocancellation)、双讲检测(double-talkdetection)、语音活动检测(voiceactivitydetection,VAD)、交互轮次(interactionturn)、唤醒词(wake-upword)、语音助手(voiceassistant)等。这些统一定义为全球范围内的技术交流、产品开发和标准实施提供了共同的语言基础。2.3全双工语音交互参考模型标准的核心内容之一是定义了全双工语音交互系统的通用参考模型(ReferenceModel),该模型将系统划分为以下关键功能层次:(1)音频采集层(AudioAcquisitionLayer):负责多通道语音信号的采集,包括麦克风阵列的配置要求、采样率与位深的最低规范、增益控制策略等。标准对远场拾音能力提出了明确的性能参考指标,以支持3-5米范围内的有效语音采集。(3)语音识别层(SpeechRecognitionLayer):包括语音活动检测(VAD)、唤醒词检测、连续语音识别(ASR)和端点检测(Endpointing)等功能模块。标准要求系统在用户打断系统播报时应能在毫秒级时间内完成状态切换,确保交互的及时性。(4)对话管理层(DialogueManagementLayer):负责任务解析、上下文追踪、多轮对话策略管理和交互状态控制。标准定义了对话管理中应支持的基本状态模型,包括空闲(Idle)、聆听(Listening)、理解(Understanding)、响应(Speaking)和等待(Waiting)等状态的转换规则。(5)语音合成层(SpeechSynthesisLayer):涵盖文本转语音(TTS)的实时生成、播报打断响应、播报暂停与恢复等能力要求。(6)应用接口层(ApplicationInterfaceLayer):定义了系统与上层应用之间的标准化接口,以便各类应用服务(如导航、娱乐、通信等)能够以统一方式调用全双工语音交互能力。上述参考模型采用分层解耦设计,各层之间通过标准化接口交互,既保持了系统整体的一致性,又为不同厂商的模块化实现和差异化创新保留了充分空间。2.4音频处理与回声消除要求全双工语音交互区别于传统单工模式的核心技术难点在于:系统在播放语音的同时仍需持续采集和分析用户的语音输入,这必然导致扬声器播放信号通过声学路径泄漏至麦克风形成回声。若回声消除不彻底,系统将无法准确区分用户指令与自身播报,严重时会导致“自激”和识别紊乱。针对这一问题,标准在以下方面作出了明确的技术规定:-回声消除性能指标:规定了在典型声学环境(如车内、客厅)中,系统在不同信噪比和混响条件下的回声返回损耗增强(ERLE)最低要求,以及稳态和瞬态条件下的收敛速度指标。-双讲检测与处理:要求系统能够准确检测用户与系统同时发声的“双讲”状态,并在该状态下保持有效的回声消除和语音捕捉能力,避免语音裁剪或丢失。-非线性失真处理:考虑扬声器非线性失真带来的残余回声问题,对算法补偿能力提出要求。-多麦克风协同:针对多麦克风阵列配置,规定了波束成形指向性、旁瓣抑制等参数的最低要求。2.5打断管理机制全双工语音交互的显著特征之一是用户可以在系统播报过程中随时打断并插入新指令。标准将打断(Barge-in)分为“完全打断”(用户中止当前播报并开始新指令)和“部分打断”(用户在系统播报的同时追加或修正信息)。标准对打断管理机制提出了以下核心要求:-打断响应时延:系统从检测到用户打断意图到停止当前播报并切换至聆听状态的总时延应控制在一定范围内(如不超过300毫秒),以保证交互自然度。-打断后的状态恢复:系统应能根据对话上下文合理判断被打断任务的处置方式(暂停、继续或放弃),并确保状态恢复的语义一致性。-回退确认机制:在关键操作场景(如涉及安全或不可逆操作时),系统应在被打断后通过适当的确认机制消除歧义,防止误操作。2.6多设备协同与互联互通在智能家居和车载多屏互联等复杂场景中,用户可能同时面对多个具备语音交互能力的设备。标准定义了多设备场景下的协同交互要求,包括:设备发现与能力协商机制、基于用户位置和朝向的拾音设备选择策略、跨设备对话状态迁移的连续性保证、以及多设备同时响应时的冲突消解方案。2.7安全、隐私与可访问性随着语音交互系统大量涉及个人敏感信息(如通讯录、日程安排、支付指令等),标准对安全与隐私保护提出了明确要求,包括:语音数据的本地处理与云端传输的加密要求;用户隐私政策的明确告知与选择退出机制;个人语音数据的存储期限和访问控制策略;语音交互过程的可审计性和日志记录的合规要求等。此外,标准还特别设立了可访问性条款,要求全双工语音交互系统应支持老年人、听障人士和运动障碍人士的特殊使用需求,包括但不限于:可调节的语速和音量、视觉反馈辅助通道、替代性输入方式等,以促进信息技术的普惠应用。三、主要起草单位介绍3.1中国电子技术标准化研究院中国电子技术标准化研究院(CESI,原电子工业部标准化研究所)是中国工业和信息化部直属的标准化专业科研机构,也是中国在ISO/IECJTC1/SC35用户接口分技术委员会的国内技术归口单位。CESI自20世纪80年代起便深度参与国际信息技术标准化工作,在用户接口、语音交互、无障碍设计等领域积累了深厚的研究基础和丰富的国际标准化经验。在ISO/IEC24661:2023的编制过程中,CESI作为核心起草单位之一,充分发挥了在用户接口标准化领域的引领作用。CESI的专家团队负责了标准中参考模型与交互状态框架的核心提案起草工作,并主导了多设备协同交互章节的技术方案设计。在标准讨论过程中,CESI团队组织了多轮国内产业调研和意见征集,广泛汇集了来自科大讯飞、百度、华为、小米等中国企业在全双工语音交互领域的一线研发经验与产业化实践,将中国在智能语音技术领域的先进成果和工程经验有效融入国际标准之中。同时,CESI积极协调国内相关单位开展标准验证试验,为标准的可行性和普适性提供了有力的实证支撑。四、标准实施与应用展望4.1对产业的影响与价值ISO/IEC24661:2

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论