CN119418700A 语音数据的处理方法、电子设备和存储介质 (杭州阿里云飞天信息技术有限公司)_第1页
CN119418700A 语音数据的处理方法、电子设备和存储介质 (杭州阿里云飞天信息技术有限公司)_第2页
CN119418700A 语音数据的处理方法、电子设备和存储介质 (杭州阿里云飞天信息技术有限公司)_第3页
CN119418700A 语音数据的处理方法、电子设备和存储介质 (杭州阿里云飞天信息技术有限公司)_第4页
CN119418700A 语音数据的处理方法、电子设备和存储介质 (杭州阿里云飞天信息技术有限公司)_第5页
已阅读5页,还剩71页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

语音处理模型基于原始语音数据的原始离散化化特征是对原始语音数据进行离散化处理得到人建模的常规模型对语音数据进行处理导致的2基于所述训练语音数据和所述生成语音数据,对所述初始编码器、3利用所述语音处理模型基于所述原始离散化特云端服务器接收客户端发送的原始语音数据,其中,所述云端服务器对所述原始语音数据进行离散化处理,得到所述原所述云端服务器利用语音处理模型基于所述原始离散化特征对所述原始语音数据进所述云端服务器发送所述目标处理结果至所述客户端,其中,所述目45决由于现有技术仍然依赖针对单人建模的常规模型对语音数据进行处理导致的语音数据音数据进行离散化处理得到的,原始语音数据是驱动音频采集设备所采集到的语音数据,6[0015]图1示出了一种用于实现语音数据的处理方法的计算机终端(或移动设备)的硬件[0016]图2是根据本申请实施例的一种语音数据的处理方法的虚拟现实设备的硬件环境7员在没有做出创造性劳动前提下所获得的所有其他实施例,都应当属于本申请保护的范[0038]语音离散化(SpeechTokenizer):是指将连续的语音信号划分为离散的语音片段[0039]语音编解码器(Encodec):是指用于将语音信号进行编码压缩和解码解压缩的算[0040]语音处理模型:本方案中可以指语音大语言模型(Speech_LargeLanguage8[0041]语音生成式无监督预训练(SpeechGPT):是指一种基于生成式模型的无监督预训练方法,旨在对语音信号进行建模和生成。它是GPT(GenerativePre_trained附图的流程图示出的步骤可以在诸如一组计算机可执行指令的计算机系统中执行,并且,算装置中执行。图1示出了一种用于实现语音数据的处理方法的计算机终端(或移动设备)用102a,102b,……,102n来示出)处理器102(处理器102可以包括但不限于微处理器(MicrocontrollerUnit,MCU)或可编程逻辑器件(FieldProgrammableGateArray,以外,计算机终端10还可以包括:显示器、输入/输出接口(I/O接口)、通用串行总线[0047]应当注意到的是上述一个或多个处理器102和/或其他数据处理电路在本文中通算机终端10(或移动设备)中的其他元件中的任意一个内。如本申请实施例中所涉及到的,[0048]存储器104可用于存储应用软件的软件程序以及模块,如本申请实施例中的语音数据的处理方法对应的程序指令/数据存储装置,处理器102通过运行存储在存储器104内9[0049]传输装置106用于经由一个网络接口与网络连接以接收或者发送数据。上述的网与其他网络设备相连从而可与互联网进行通讯。在一个实例中,传输装置106可以为射频备)可以包括硬件元件(包括电路)、软件元件(包括存储在计算机可读介质上的计算机代机设备(或移动设备)具有图像用户界面(GU字视频、播放数字音乐和/或网络浏览等、用于执行上述人机交互功能的可执行指令被配置/存储在一个或多个处理器可执行的计算机程序产品或可读存储介AR设备关联的音频输出设备播放执行语音数据的处理方法得到的处理以框图示出了使用上述图2所示的VR设备(或移动设备)作为计算环境301中计算节点的一[0059]仍然如图3所示,终端用户302可以通过客户端上的web浏览器或其他软件应用程关330。入口网关330可以包括一个相应的代理来处理针对服务320(计算环境301中提供的[0060]仍然如图3所示,服务320是根据计算环境301支持的各种虚拟化技术来提供或部机虚拟化机器的同时,根据基于容器的虚拟化,可以启动容器来虚拟化整个操作系统[0061]在基于容器虚拟化的一个实施例中,服务320的若干容器可以被组装成一个POD1,340_2,…,340_N(统称为POD340)。每个POD340可以包括代理345和一一个或多个服务320,执行一个服务320的一个或多个功能可能需要调用另一个服务320的可以请求服务320_3(代表服务E)执行[0072]根据本申请实施例提供的上述方法,能够将语音处理处理涉及的多种功能需求的上述语音处理模型还可以与语义大模型结合,将上述方法扩展至更大范围的应用场景,训练的语音助手大模型(即语音处理模型)基于原始语音数据的原始离散化特征对原始语用英文怎么说”,智能语音助手首先调用语音数据处理流程对该问题进行离散化处理并利用语音助手大模型基于该问题的离散化特征对该问题进行处理,所得到的处理结果包括文能穿戴设备相关联,由该移动终端设备或智能穿戴设备提供该智能音响对应的操作界面,[0092]如图5所示,在语音处理模型的训练过程的第二阶段:基于训练离散化特征进行[0099]仍然如图6所示,本申请提供的方法中,基于神经网络和矢量量化(VectorQuantization)的音频编解码模型来进行语音数据的离散化。音频编解码模型包括四个组的目标量化器(如图7所示的斜线阴影所示的端和接收端之间的交互内容为目标量化器得到的量100个离散的表征(即,100token/s)。与常规方法中基于Encodec的离散化处理方式(400token/s)相比,本申请的上述具体的实施方式具备更少的离散表征,有利于降低解码器可以采用与上述语音解码器类似的训练方式进行预训练得到。利用文本解码器对音频语义特征进行解码,得到用音处理模型)基于离散化特征进行提取,得到带噪语音数据对应的音频语义特征。进一步征或语音离散化特征所得到的语义特征相比,能够更加准确地表征原始输入数据的语义。游任务对应的任务特定数据集中获取,该任务特定数据集中的样本数据为有标签样本数SpeechRecognition,ASR)、文本翻译(MachineTranslation,MT)、语音到文本翻译过程具体包括:利用经过训练并固定参数的语音编码器(Encodec)对语音信号进行编码得数据集确定。具体地,上述指令集微调对应的指定可能包括:单指令多数据(Single[0142]综上,本申请实施例提出Speech_LLM框架利用SpeechTokenizer将连续的音频信语音数据和文本数据进行预训练得到的Speech_LLM会通过音频模态相关的任务进行指令[0150]步骤S82,对第一语音数据进行离散化处理,得到第一语音数据的第一离散化特[0151]步骤S83,利用第一离散化特征和训练文本数据,对初始处理模型进行无监督训[0155]本申请实施例提供的上述语音处理模型的训练方法可以运行于客户端或服务离散化后的特征的影响会减弱,采用离散化特征能够降低模型对异常值和噪声的敏感度;解决由于现有技术仍然依赖针对单人建模的常规模型对语音数据进行处理导致的语音数述方法所训练得到的语音处理模型不仅面向音频生成,还将语音模态相关的任务统一到[0173]步骤S92,对原始语音数据进行离散化处理,得到原始语音数据的原始离散化特[0176]本申请实施例提供的上述语音数据的处理方法可以但不限于应用于电商、教育、[0182]在如实施例1中的运行环境下,本申请提供了如图10所示的另一种语音数据的处语音数据的处理方法的终端设备通过上述第一接口和第二接口与另一设备或客户端进行理方法运行于云服务器,上述第一接口和第二接口为云服务器与客户端之间软件即服务[0194]在如实施例1中的运行环境下,本申请提供了如图11所示的另一种语音数据的处[0197]步骤S1103,云端服务器利用语音处理模型基于原始离散化特征对原始语音数据[0200]可选地,图12是根据本申请实施例5的一种在云端服务器进行语音数据的处理的用户。SaaS服务端和客户端进行交互的方式,采用由SaaS服务端对原始语音数据进行离散化处结果通过客户端提供给用户。[0206]根据本申请实施例,还提供了一种用于实施上述实施例1中的语音数据的处理方[0209]可选地,图14是根据本申请实施例6的一种可选的语音数据的处理装置的结构示[0210]可选地,图15是根据本申请实施例6的另一种可选的语音数据的处理装置的结构应作用于操作界面上的语音输入指令,在操作界面上显示包含有原始语音数据的语音文[0220]此处需要说明的是,上述第一响应模块1301和第二响应模块1302对应于实施例1或软件组件,上述模块也可以作为装置的一部分可以运行在实施例1提供的计算机终端10[0221]根据本申请实施例,还提供了另一种用于实施上述实施例2中的语音处理模型的训练方法的装置实施例。图16是根据本申请实施例6的一种语音处理模型的训练装置的结到第一语音数据对应的第一语音特征;利用目标量化器对第一语音特征进行离散化处1604对应于实施例2中的步骤S81至步骤S84,四个模块与对应的步骤所实现的实例和应用[0225]根据本申请实施例,还提供了另一种用于实施上述实施例3中的语音数据的处理方法的装置实施例。图17是根据本申请实施例6的另一种语音数据的处理装置的结构示意应于实施例3中的步骤S91至步骤S93,三个模块与对应的步骤所实现的实例和应用场景相理的硬件组件或软件组件,上述模块也可以作为装置的一部分可以运行在实施例1提供的[0230]根据本申请实施例,还提供了另一种用于实施上述实施例4中的语音数据的处理方法的装置实施例。图18是根据本申请实施例6的又一种语音数据的处理装置的结构示意输出模块1804对应于实施例4中的步骤S1001至步骤S1004,四个模块与对应的步骤所实现[0232]根据本申请实施例,还提供了另一种用于实施上述实施例5中的语音数据的处理方法的装置实施例。图19是根据本申请实施例6的又一种语音数据的处理装置的结构示意发送模块1904对应于实施例5中的步骤S1101至步骤S1104,四个模块与对应的步骤所实现利用语音处理模型基于原始语音数据的原始离散化特征对原始语音数据进行处理得到的,原始离散化特征是对原始语音数据进行离散化的处理方法和装置对应的程序指令/模块,处理器通过运行存储在存储器内的软件程序以始离散化特征是对原始语音数据进行离散化处如,计算机终端200还可包括比图20中所示更多或者更少的组件(如网络接口、显示装置[0260]本领域普通技术人员可以理解上述实施例的各种方法中的全部或部分步骤是可上述存储介质可以用于保存上述任意一种方法所果是利用语音处理模型基于原始语音数据的原始离散化特征对原始语音数据进行处理得

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论