CN119400155A 语音合成方法及装置 (上海稀宇极智科技有限公司)_第1页
CN119400155A 语音合成方法及装置 (上海稀宇极智科技有限公司)_第2页
CN119400155A 语音合成方法及装置 (上海稀宇极智科技有限公司)_第3页
CN119400155A 语音合成方法及装置 (上海稀宇极智科技有限公司)_第4页
CN119400155A 语音合成方法及装置 (上海稀宇极智科技有限公司)_第5页
已阅读5页,还剩49页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

202311870114.72023.12.29替序列;将文本音频交替序列输入到语音合成2将所述多个目标文本段中的最后目标文本段输入到训练好的语音合循环执行如下步骤直至获取首个目标文本段对应的首个目从所述连贯文本中选取多个第一文本段、多个位于第一文本段前与所述第一根据所述组合训练数据集,对初始语音合成模型进行训练,得到训练对所述第一音频段、第二音频段和第三音频段进行离散化处理并提取3获取所述第一文本段、第二文本段和第三文本段的组合文本获取第一音频段、第二音频段和第三音频段相互之间的声纹将所述组合训练数据集中的组合训练数据迭代输入到所述初始语音合将所述组合训练数据集中的组合训练数据输入到所述初始语音第二文本段对应的第二输出音频段,根据所述第二输出音频段和第二音频段的音频特征,将所述组合训练数据集中的组合训练数据迭代输入到所述初始语音合将所述组合训练数据集中的组合训练数据迭代输入到所述初始语音合4述第三文本段对应的第三输出音频段;根据所述第一输出音频段和第一音频段的音频特所述目标文本获取模块被配置为获取目标文本,将所述目标文本按照所述初始生成模块被配置为将所述多个目标文本段中的最后目标文本段输入到训练所述文本音频拼接模块被配置为根据所述最后目标文本段和所述最后目标音频段拼所述循环生成模块被配置为循环获取前一目标文本段,将所述前一目标文本所述文本音频交替序列以对所述文本音频交替序列进行更新;将文本音频交替序列输5[0005]因此,本申请实施例意图提供一种语音合成方法以及相关的电子设备及存储介成包括多个所述组合训练数据的组合训练数6[0020]对所述第一音频段、第二音频段和第三音频段进行离散7[0032]将所述多个目标文本段中的首个目标文本段输入到训练好的目标语音合成模型下一目标文本段且提取了其他目标文本段的韵律、音律和/或情感声学特征的下一目标音[0038]将所述多个目标文本段中的最后目标文本段输入到训练好的目标语音合成模型所述前一目标文本段且提取了其他目标文本段的韵律、音律和/或情感声学特征的前一目8合成模型由本申请任一实施例中的训练方法训练[0047]所述向量拼接模块被配置为将满足可拼接条件的多个第一文本段、第二文本段、[0052]所述文本音频拼接模块被配置为根据所述首个目标文本段和所述首个目标音频段拼接生成文本音频交替序列;加到所述文本音频交替序列尾部以对所述文本音频交替序列进行更新;将文本音频交9[0063]图4示出本申请实施例的语音合成模型训练方法中的文本段、音频段向量化的流[0065]图6示出本申请实施例的语音合成模型训练方法中的模型训练的另一流程示意[0066]图7示出本申请实施例的语音合成模型训练方法中的模型训练的另一流程示意[0067]图8示出本申请实施例的语音合成模型训练方法中的模型训练的另一流程示意[0068]图9示出本申请实施例的语音合成模型训练方法训练得到语音合成模型的工作流例性实施例中所描述的实施方式并不代表与本说明书一个或多个实施例相一致的所有实和上下文的音频内容,生成目标文字段对应的语音音频,可以通过语音合成(Textto[0085]如图1所示,本申请实施例中的模型训练过程为从训练集选取一段连贯的文本和数据离散化后通过embedding转换为训练数据;检测三部分数据能否满足能够进行拼接的一文本段相邻的第二文本段、多个位于第一文本段后与所述第一文本段相邻的第三文本[0091]在本申请实施例中,选取上下文的文本数据和语音数据法进行处理,例如采用基于字符串匹配的方法或[0114]词汇筛选:基于频率和相关性筛选出词汇表中的单词。去除高频的停用词(如[0131]在本申请的实施例中,可以在所述训练中提取所述第二文本段和/或所述第三文或所述第三文本段中的有关韵律、音律和/或情感特征被提取出来并用于语音合成模型的[0134]本申请的实施例中,所述语音合成模型包括多种语音合成模型(例如Tacotron、[0136]S151a:将所述组合训练数据集中的组合训练数据迭代输入到所述初始语音合成[0146]S151c:将所述组合训练数据集中的组合训练数据迭代输入到所述初始语音合成[0149]本申请实施例中迭代或者循环从目标训练向量集中取出目标训练向量输入到初[0150]如图9所示,本申请实施例中语音合成模型500可以抽象成编码器510和解码器[0151]本申请实施例中的初始语音合成模型在训练过程输出的音频段包括第一输出音[0153]本申请中的语音合成模型在运行过程中,文本、音频序列先通过embedding模块[0155]S151d:将所述组合训练数据集中的组合训练数据迭代输入到所述初始语音合成[0158]本申请实施例在计算第四损失值过程中,可以根据关注度调整各个损失值的权[0160]本申请实施例中的目标语音合成模型可以是TTS模型,训练过程中使用大量标注的语音文本对进行监督学习,调整学习率、批次大小等超参数,应用如Dropout、Batch[0165]在本申请的一些实施例中,将所述目标文本按照文本顺[0182]将所述多个目标文本段中的最后目标文本段输入到训练好的目标语音合成模型[0188]本申请的实施例中,当所述目标语音合成模型为TTS(Text_to_Speech)或大语音[0193]时间对齐和音高校正:使用数字信号处理技术,如WSOLA(WaveformSimilarity[0208]客观评估:使用客观评估工具(如PESQ,PerceptualEvaluationofSpeech型对首段文本进行语音合成,然后将生成的首个音频段与首段文本进行组合形成文本_音[0225]对所述第一音频段、第二音频段和第三音频段进行离散[0237]所述目标文本获取模块410被配置为获取目标文本,将所述目标文本按照文本顺[0239]所述文本音频拼接模块1330被配置为根据所述首个目标文本段和所述首个目标[0241]所述音频拼接模块1350被配置为将各个目标音频段进行拼接处理,生成目标音[0247]图14示出了可以用来实施本申请实施例的方法或实现本申请实施例的电子设备或功能。处理器1410可以包括各种类型的处理器,例如中央处理器(CPU)、图形处理器[0254]以上描述被提供用于使得本领域任何技术人员可以实施本文所描述的各个方

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论