CN119479609A 语音生成方法、装置、设备、存储介质及产品 (腾讯科技(深圳)有限公司)_第1页
CN119479609A 语音生成方法、装置、设备、存储介质及产品 (腾讯科技(深圳)有限公司)_第2页
CN119479609A 语音生成方法、装置、设备、存储介质及产品 (腾讯科技(深圳)有限公司)_第3页
CN119479609A 语音生成方法、装置、设备、存储介质及产品 (腾讯科技(深圳)有限公司)_第4页
CN119479609A 语音生成方法、装置、设备、存储介质及产品 (腾讯科技(深圳)有限公司)_第5页
已阅读5页,还剩77页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

施例的技术方案在生成文本对应的语音的过程2基于图像特征和声学特征之间的映射关系,对所述场景图像特征进行映基于所述文本特征和所述场景图像特征对应的声学特征,生成与基于设定的激活函数对所述变换场景图像特征进行非线对经过非线性映射处理得到的图像特征进行第二线性变换处理基于发音元素与持续时长之间的映射关系,对所述文本特征所指对所述文本特征进行第三线性变换处理,得到变换文本特征,并基于所述持续时长预测特征、所述先验分布参数和所述场景图像特征对应的声学特基于所述持续时长预测特征,在所述先验均值参数和所述先验方差参基于所述持续时长预测特征中各时长特征元素,对所述变换基于采样特征和语音信号特征之间的映射关系,对所述第一采样特征进行映射处理,3对所述第一采样特征对应的语音信号特征和所述场景图像特征对应的声学特征进行在所述后验均值参数和所述后验方差参数定义的后验分布中进行对基于所述训练文本提取到的训练文本特征进行第四线性变换处理基于发音元素与持续时长之间的映射关系,对所述训练文本特基于所述训练持续时长预测特征在所述训练先验分布参数定义的训练先验分布中进基于图像特征和声学特征之间的映射关系,对基于所述训练场4基于所述生成语音对应的频域表示信息和所述训练语音对应的频域表示信息之间的基于所述训练持续时长预测特征与所述对齐估计特征之间的差异基于所述训练场景图像特征对应的声学特征和所述训练场景图像对应的场景类别标基于所述重建损失数据、所述分布损失数据、所述持续时长损对所述生成语音对应的频域表示信息进场景分类处理,得到所所述基于所述重建损失数据、所述分布损失数据、所述持续时长损失对所述训练语音和所述生成语音进行判别处理,得到所述训练语音和所述生成语音处理单元,用于基于图像特征和声学特征之间的映射关系,对所述生成单元,用于基于所述文本特征和所述场景图像特征对5处理单元,用于对所述训练语音对应的频域表示信息进行特征提取处理,存储器,用于存储一个或多个计算机程序,当所述一个或多个6[0002]随着人工智能技术的飞速发展,将书面文字转换为用户可听语音的文本到语音[0007]基于图像特征和声学特征之间的映射关系,对所述场景7[0026]在一种可能的实现方式中,所述先验分布参数包括先验均值参数和先验方差参[0028]基于所述第一采样特征和所述场景图像特征对应的声学特征,生成所述目标语8[0034]对所述第一采样特征对应的语音信号特征和所述场景图像特征对应的声学特征述训练场景图像所指示场景的环境音效相匹配的[0037]所述处理单元,还用于对所述训练语音对应的频域表示[0042]基于所述训练文本对应的语音和所述环境音效进行卷积处理,得到所述训练语[0043]在一种可能的实现方式中,所述后验分布参数包括后验均值参数和后验方差参[0049]基于所述训练持续时长预测特征在所述训练先验分布参数定义的训练先验分布9[0056]基于所述生成语音对应的频域表示信息和所述训练语音对应的频域表示信息之[0059]基于所述训练场景图像特征对应的声学特征和所述训练场景图像对应的场景类一[0072]在本申请中的一些实施例所提供的技术方案中,在生成文本对应的语音的过程[0081]图8是本申请实施例提供的一种场景分类模型在训练过程中的空间识别误差变化VR)等多种需要更具沉浸感的听觉体验的场备103和下游应用设备104。本申请提供的语音生成方案可以由语音生成设备101或者模型训练设备103执行。其中,语音生成设备101可以分别与数据获取设备102、模型训练设备实施例以语音生成设备101、数据获取设备102以及模型训练设备103为同一电子设备为例体部署基于TTS技术的语音生成模型用于基于文本和场景图该视觉图像中可以包括指示场景的图像。数据获取设备102可以是配置有文本输入设备和[0096]在一些实施例中,模型训练设备103可以是用于对机器学习模型进行训练的电子型训练设备103可以基于获取到的训练样本数据对机器于语音生成设备101生成的语音进行后续的应用,如在包括沉浸式场景的游戏中添加语音[0100]其中,待处理文本和待处理场景图像可以是数据获取设备102从互联网上获取到设备102基于文本生成工具和图像生成工具分别生成的,文本生成工具可以是自然语言处做限定。目标语音可以是调用模型训练设备103训练的语音生成模型基于待处理文本和待据块中包含了一批次网络交易的信息,用于验证其信息的有效性(防伪)和生成下一个区所描述的语音生成方法可由电子设备来执行,该电子设备可以是图1所示的语音生成系统本特征也可以称为文本嵌入(Embedding),可以是指将待处理文本转换为一系列向量所得沉浸式文本转语音(Image_indicatedImmersiveText_to_speechSynthesis,I2TTS)任图3所示,多模态文本转语音系统(Multi_modalTTSsystem)可以用于执行该I2TTS任务。以学习输入的文本数据的潜在表示,并将其转换为更易于后续模型处理的特征表现形式,件例如可以是图像编码器(ImageEncoder)。图像编码器例如可以是卷积神经网络(ConvolutionalNeuralNetworks,CNN)、也可以是基于对比语言__图像预训练像特征和声学特征之间的映射关系可以是用于将图像特征转换为声学特征的机器学习模[0125]可以理解的是,第一个FC和第二个FC的模型参数(如权重矩阵和偏置项)可以相长之间的映射关系可以是用于预测音素持续时长的机器学习模型或者机器学习模型中的组件进行训练得到的,也可以是基于文本特征和持续时长预测特征建立的数学模型得到网络结构的模型参数可以是在训练的过程中对说话者的说话特执行的,映射网络可以是紧接在文本编码器之后的线性投影层(LinearProjection验分布可以是由先验均值参数和先验方差参数所定义的正态分布,也可以称为高斯分布。它根据输入的特征表示生成最终的语音波形,例如可以是高保真生成对抗网络(High[0145]其中,采样特征与语音信号特征之间的映射关系可以理线性变换处理和非线性变换处理,可以用于捕捉采样特征与语音信号特征之间的复杂关抗学习的端到端语音合成(VariationalInferencewithAdversarialLearningfor图像特征对应的声学特征Ie可以被输入到TTS主干网络中,可以用于将基于待处理场景图[0154]在本申请中的一些实施例所提供的技术方案中,在生成文本对应的语音的过程音生成模型的处理方法可由电子设备来执行,该电子设备可以是图1所示的语音生成模型提供的一种语音生成方法的另一流程示意图,该语音生成方法包括以下步骤S501一步骤于合成带有该场景混响(Reverberant)的声音数据,可以是指该训练场景图像所对应的空表某个特定环境的RIR进行卷积操作,可以模拟出该纯净语音在该特定环境中应有的混响[0162]由于训练语音是由卷积处理得到的,因此训练语音也可以称为卷积语音样本进行傅里叶变换等相关处理得到的,如梅尔频谱可以是对语音进行短时傅里叶变换[0167]在一种可能的实现方式中,对训练语音对应的频域表示可以是待训练的语音生成模型中的频谱编码器(SpectrogramEncoder)进行的,由于频谱待训练语音生成模型进行训练的过程中,可以直接基于该后验分布参数进行语音生成处中抽取一定数量的样本。具体可以是待训练的语音生成模型通过重参数化技巧长预测特征在训练先验分布参数定义的训练先验分布中进行采样处理,得到第三采样特以理解为对齐处理是用于确定训练文本特征所指示的各个音素在该训练语音中的持续时特征与采样特征之间的映射关系可以是基于transformer的归一化流(Flow)模型学习得到优的对齐方式可以是得分最高的对齐方式,可以表示两个采样特征之间最佳的对应关系,[0185]第二部分是基于先验编码器和后验编码器分别输出的先验分布和后验分布之间异来生成损失数据。例如,可以基于训练先验分布与后验分布之间的相对熵信息散度[0187]第四部分是基于适配器将场景图像特征适配到的声学特征与场景类别标签之间具体可以基于训练场景图像特征对应的声学特征和训练场景图像对应的场景类别标签之模型中集成一个场景分类模型,该场景分类模型,也可以称为语音混响分类模型(Speech于经过场景分类处理得到的场景类别和场景类别标签之间的差异,生成场景类别损失数成语音类别)作为判别标签,与判别得到各语音所属的类别之间的差异,确定判别损失数基于Clip模型的图像编码器,适配器例如可以由GELU和两个FC组成。TTS主干网络可以是[0204]该TTS主干网络中的频谱编码器可以对训练语音对应的频域表示信息进行特征提Zi进行切取,并选取部分的切片(slice)输入到解码器中,得到该解码器生成的语音波形[0205]该TTS主干网络可以对训练文本特征分别进行两种不同的处理,一个分支可以是p[0206]其中,第二采样特征Zi可以经过TTS主干网络中归一化流(Flow)模型进行映射处p频域表示信息(梅尔频谱)和训练语音对应的频域表示信息(梅尔频谱)之间的差异生成重于判别器输出的判别结果与各语音所属的类别生成的判别输入场景图像所指示场景的环境音效相匹配的语音的语音[0210]在一种可能的实现方式中,该SRC可以包括用于捕捉局部时频特征和跨时间帧的p次,提取出生成语音的局部时频特征。在另一个分支中,通过二维最大池化层和p[0214]在一些实施例中,可以基于训练语音和场景类别标签对SRC空间特性与场景类别标签所指示的场景的空间特性非常匹配,表明场景_环境音效对齐有[0216]为了了解场景图像中哪些视觉特征对图像编码器(如基于Clip的图像编码器)的影响最大,可以采用梯度加权类激活映射(Gradient_weightedClassActivation示训练场景图像对应的热力图。这些热力图显示了SPE模型认为对提取与声学特性相关的[0217]下面对本申请实施例提供的语音生成方法中的语音生成模型进行客观评估和主[0218]为了评估该语音生成模型的有效性,可以采用梅尔倒谱失真(MelCepstral数(Mel_FrequencyCepstralCoefficients,MFCC)与真实语音的MFCC来计算的,较低的[0219]其中,可以将本申请实施例提出的语音生成模型与其他convolutionalspeech);2)基于该卷积语音样本训练得到的VITS模型,无任何附加模块_4.014.294.22的语音的发音的质量和听众识别单词的难易程度。通过自然度_平均意见得分(Naturalness_MeanOpinionScore,NMOS)来衡量生成的语音的自然度,评估其整体流畅NMOS↑4.574.544.633.753.923.283.723.773.873.984.06[0227]在本申请中的一些实施例所提供的技术方案中,在生成文本对应的语音的过程音生成装置100可以用于执行图2所示的语音生成方法中的相应步骤。该语音生成装置100[0241]在一种可能的实现方式中,所述先验分布参数包括先验均值参数和先验方差参[0243]基于所述第一采样特征和所述场景图像特征对应的声学特征,生成所述目标语[0249]对所述第一采样特征对应的语音信号特征和所述场景图像特征对应的声学特征[0250]根据本申请的一个实施例,图2所示的方法所涉及的步骤均可以是由图10所示的来执行,步骤S202由图10所示的处理单元1002来执行,步骤S203由图10所示的生成单元[0251]根据本申请的一个实施例,图10所示的语音生成装置100中的各个单元可以分别上运行能够执行如图2中所示的相应方法所涉及的各步骤的计算机程序(包括程序代码),机程序可以记载于例如计算机可读存储介质上,并通过计算机可读存储介质装载于图1所语音生成装置100可以用于执行图5所示的语音生成方法中的相应步骤。该语音生成装置[0256]处理单元1102,还用于对所述训练语音对应的频域表示[0261]基于所述训练文本对应的语音和所述环境音效进行卷积处理,得到所述训练语[0262]在一种可能的实现方式中,所述后验分布参数包括后验均值参数和后验方差参[0268]基于所述训练持续时长预测特征在所述训练先验分布参数定义的训练先验分布[0275]基于所述生成语音对应的频域表示信息和所述训练语音对应的频域表示信息之[0278]基于所述训练场景图像特征对应的声学特征和所述训练场景图像对应的场景类[0288]根据本申请的一个实施例,图5所示的方法所涉及的步骤均可以是由图11所示的[0289]根据本申请的一个实施例,图11所示的语音生成装置110中的各个单元可以分别上运行能够执行如图5中所示的相应方法所涉及的各步骤的计算机程序(包括程序代码),机程序可以记载于例如计算机可读存储介质上,并通过计算机可读存储介质装载于图1所[0292]基于上述语音生成方法实施例的描述,本申请实施例还述处理器的计算机存储介质、上述处理器可以称为中央处理单元(CentralProcessing[0294]在一种实施方式中,可由处理器1201加载并执行存储器1204中存放的计算机程[0296]基于图像特征和声学特征之间的映射关系,对所述场景[0306]在一种可能的实现方式中,所述先验分布参数包括先验均值参数和先验方差参[0308]基于所述第一采样特征和所述场景图像特征对应的声学特征,生成所述目标语[0314]对所述第一采样特征对应的语音信号特征和所述场景图像特征对应的声学特征

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论