CN115148185B 语音合成方法及装置、电子设备及存储介质 (北京小米移动软件有限公司)_第1页
CN115148185B 语音合成方法及装置、电子设备及存储介质 (北京小米移动软件有限公司)_第2页
CN115148185B 语音合成方法及装置、电子设备及存储介质 (北京小米移动软件有限公司)_第3页
CN115148185B 语音合成方法及装置、电子设备及存储介质 (北京小米移动软件有限公司)_第4页
CN115148185B 语音合成方法及装置、电子设备及存储介质 (北京小米移动软件有限公司)_第5页
已阅读5页,还剩40页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本公开实施例提供一种语音合成方法、装学习的方法使用样本集对基础模型进行训练得其中所述目标语音特征为预先选择的目标用户2其中,所述语音合成模型为通过机器学习的方法使用样本集对基础模型进行训练得所述目标语音数据通过以下方式确定:将所述语障用户的语音数每个所述语音文本对包括一个音素和与所述音素对应的梅尔所述将所述语障用户的语音数据和所述多个候选语音数据输入声纹识从所述多个候选语音数据中选择所述第二语音特征与所述第一语音特征输入所述声根据所述音色相似度,从所述多个候选语音数据选择相似度位于第根据第一语音数据所对应的用户属性与所述语障用户的用户属性相似语音数据中选择相似度位于第二相似度区间的第3文本编码模块,用于从第一音素序列提取语言学信息,注意力机制模块,用于接收第一序列,将所述第一序列和基于声学解码模块,用于根据所述第一序列和第二序列,得到在使用所述目标语音数据训练所述基础模型时,使用音素分其中,所述语音合成模型为通过机器学习的方法使用样本集对基础模型进行训练得选择模块,用于将所述语障用户的语音数据和多个候选语音数据输入声纹识别模型,4[0011]每个所述语音文本对包括一个音素和与所述音素对应的述多个候选语音数据与所述语障用户的语音数据的音色5[0022]从所述多个候选语音数据中选择所述第二语音特征与所述第一语音特征输入所述声纹识别模型,从所述语障用户的语音数据和所述多个候选语音数据输入声纹识别模第一语音数据中选择相似度位于第二相似度区6[0046]每个所述语音文本对包括一个音素和与所述音素对应的述多个候选语音数据与所述语障用户的语音数据的音色[0057]从所述多个候选语音数据中选择所述第二语音特征与所述第一语音特征输入所述声纹识别模型,从所述语障用户的语音数据和所述多个候选语音数据输入声纹识别模第一语音数据中选择相似度位于第二相似度区7[0076]确定模块,用于根据所述音素分类结果以及所述文本数8语言内容相对应的文本数据,其中所述目标语音特征为预先选择的目标用户的语音特征。多个步骤中的一个或多个),即使附图中未明确描述或说明这种一个或多个单元。另一方9[0105]本公开实施例提供的语音合成模块就是语音合成(TextToSpeech,TTS)技术的[0112]所述基础模型可为使用大量的用户的语音数据完成了训练的一个通用语音模[0114]每个所述语音文本对包括一个音素和与所述音素对应的[0125]将所述语障用户的语音特征和所述多个候选语音数据的语音特征输入声纹识别方便从多个备选语音数据中选择出用于训练基础模型的第一语音数据中选择相似度位于第二相似度区度选择出语音相似度从高到低排序最高的多个候选用户的候选语音数据作为所述第一语够选择更符合语障用户需求的目标语音数据,从而使得语音合成模型的语音合成效果更[0181]本公开实施例提供的语音合成模型包括上述模块,上述[0182]文本数据在输入到文本编码模块之前,会通过文本分析文本输入区之后点击发送。该文本数据可以是AI电话助理预先根据用户B的语音文本智能模型将文字数据转成合成语音数据。从而使得语障用户A能将所表达的内容用自己定制的[0214]根据预设的相似度阈值筛选出符合阈值范围内的相似度值对应的捐献者的音色[0216]该分类模型可包含多层帧级别的时间延迟网络(time-delayneuralnetwork,[0218]音色相似度得分计算,是将受捐者和捐献对象的语音数据提取的fbank参数输入偏沉稳,则电子设备通过音频处理工具sox对目标用户语音数据6kHz-16kHz的频率进行调[0230]文本编码模块利用神经网络对经上述文本分析模块处理后的语障用户的输入数模块全面获取到的信息解码成后续转换成音频所需的声学参数例如梅[0239]上述模型将输入数据转换成合成语音数据的过程,即利用了注意力机制的灵活[0240]在图5中虚线框或者虚线箭头代表的是在模型训练过程中才会涉及,而实线框和[0248]每个所述语音文本对包括一个音素和与所述音素对应的述多个候选语音数据与所述语障用户的语音数据的音色[0259]从所述多个候选语音数据中选择所述第二语音特征与所述第一语音特征输入所述声纹识别模型,从所述语障用户的语音数据和所述多个候选语音数据输入声纹识别模第一语音数据中选择相似度位于第二相似度区[0278]确定模块,用于根据所述音素分类结果以及所述文本数方便多媒体组件808和处理组件802之间的例包括用于在电子设备800上操作的任何应用程序或方法的指令,联系人数据,电话簿数[0285]电源组件806为电子设备800的各种组件提供电力。电力组件806可以包括电源管像头可以是一个固定的光学透镜系统或具有焦距和光学[0288]I/O接口812为处理组件802和外围接口模块之间提供接口,上述外围接口模块可[0290]通信组件816被配置为便于电子设备800和其他设备之间有线或无线方式的通示例性实施例中,通信组件816经由广播信道接收来自外部广播管理系统的广播信号或广[0298]每个所述语音文本对包括一个音素和与所述音素对应的述多个候选语音数据与所述语障用户的语音数据的音色[0309]从所述多个候选语音数据中选择所述第二语音特征与所述第一语音特征输入所述声纹识别模型,从所述语障用户的语音数据和所述多个候选语音数据输入声纹识别模第一语

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论