CN119404248A 声质转换装置、声质转换方法、声质转换神经网络、程序以及记录介质 (多玩国株式会社)_第1页
CN119404248A 声质转换装置、声质转换方法、声质转换神经网络、程序以及记录介质 (多玩国株式会社)_第2页
CN119404248A 声质转换装置、声质转换方法、声质转换神经网络、程序以及记录介质 (多玩国株式会社)_第3页
CN119404248A 声质转换装置、声质转换方法、声质转换神经网络、程序以及记录介质 (多玩国株式会社)_第4页
CN119404248A 声质转换装置、声质转换方法、声质转换神经网络、程序以及记录介质 (多玩国株式会社)_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2024.12.12PCT/JP2023/0274852023.07.27WO2024/024872JA2024.02.01用学习完成的神经网络(100),将转换源的声音声质转换为与转换目标的说话者信息对应的声现(S1)转换为保留发声的方式的特征并且去除了转换源的说话者特性的不依赖于说话者的潜以使声码器(130)能够将编码器(110)输出的潜在表现复原为原来的学习用声音,且通过流程(120)的转换而得的不依赖于说话者的潜在表现与文本编码器(140)2转换部,其利用学习完成的神经网络,将所述转换源的声音数据声学习用声音数据的音韵信息和表示所述学习用声音数据中包含的规定的特征的环境输入与所述文本编码器输出的表现接近的方式来对所述神经转换部,其利用学习完成的神经网络,将所述转换源的声音数据声用声音数据的音韵信息和表示所述学习用声音数据中包含的规定的特征的环境输入至文对所述编码器输出的第一潜在表现进行转换而得的潜在表现与所述第二编码器输出的第二潜在表现接近的方式来对所述神经网络进所述声质转换装置具有:学习部,其以使通过所述流程对所述第一潜在后再进行逆转换而得的潜在表现与通过所述流程对所述第二潜在表现进行逆转换而得的3至少1台以上的计算机将学习用声音数据输入至所述编码器,并且将所述学习用声音数据的音韵信息和表示所述学习用声音数据中包含的规定的特征的环境输入至文本编码编码器输出的表现接近的方式来对所述神经至少一台以上的计算机输入转换源的声音数据和在声质至少1台以上的计算机将学习用声音数据输入至编码器,并且将所述学习用声音数据使所述解码器能够将所述编码器输出的第一潜在表现复原为原来的学习用声音数据的方器输出的第一潜在表现进行转换而得的潜在表现与所述第二编码器输出的第二潜在表现至少一台以上的计算机以使通过所述流程对所述第一潜在表现进行转换后再进行逆转换而得的潜在表现与通过所述流程对所述第二潜在表现进行逆转换而得的第三潜在表12.一种神经网络,其输入声音数据和在声质转换时想要操作的元信息并声质转换为413.一种神经网络,其输入声音数据和在声质转换时想要操作的元信息并声质转换为使计算机作为权利要求1~5中任一项所述的声质转换记录了使计算机作为权利要求1~5中任一项所述的声质转换装置的各部进行动作的5进行根据文本的声音生成和声质转换的技术。非专利文献2是以非专利文献1的技术为基[0005]非专利文献1:JaehyeonKim,VariationalAutoencoderwithAdversarialLearningforEnd_to_EndText_to_式的特征性的声音输入,也转换为用于学习用的转换目标的声音的平静音(通常时的声存在无法转换为平静音与低语声之间的中间的所述声音数据中包含的规定的特征并且去除了与所述元信息对应的特征的第二潜在表现,6式的声质转换装置1学习想要能够相互转换的说话者的声音,能够以多对多的方式对进行7现附加转换目标的说话者的说话者特性并逆转换为转换目标的声音的潜在表现;解码器器的中间表现所遵循的分布限制为根据文本和环境制作的分布来学习神经网络。换言之,[0030]流程120在输入潜在表现和说话者信息时,输出从潜在表现中尽可能去除了说话器140输入学习用声音的文本和环境。以使输入到编码器110的声音与从声码器130输出的横轴是时间,文本编码器140输出的根据不依赖于说话者的信息制作出的表现的横轴是音8便流程120输出去除了说话者特性而包含发声方式的特征[0036]输入到神经网络100的说话者信息也可以说是在声质转换时想要操作的元信息。作为声质转换时的不变的信息来进行处理的情况下,从文本得到的音素分别具有时间长[0042]在步骤S12中,转换部12将转换源的声音和转换源的说话者信息输入到编码器9[0045]在步骤S15中,转换部12将潜在表现S2和转换目标的说话者信息输入到声码器S1转换为保留声音中包含的发声方式的特征并且去除了转换源的说话者特性的不依赖于1能够转换为反映了输入的声音的低语声、假声以及生气声等发声方式的转换目标的说话并且将学习用声音的文本和学习用声音数据中包含的表示发声方式的环境输入至文本编原为原来的学习用声音,且使通过基于流程120的转换而得的不依赖于说话者的潜在表现与文本编码器140输出的根据不依赖于说话者的信息制作出的表现接近。由此,通过流程[0049]第二实施方式的声质转换装置对第一实施方式的神经网络100进行追加学习,对说话者信息的情况下使输入了学习用声音的any用编码器150的输出接近不依赖于说话者将学习用声音输入到编码器110和any用编码器150,对神经网络进行学习,以便使在流程120中对编码器110的输出进行转换后的潜在表现与any用编码器150的输出接近。在流程120中转换后的潜在表现是从学习用声音去除了说话者特性而包含发声的方式的特征的潜潜在表现的方式进行学习。如果通过数十人至100人左右的多个说话者的学习用声音进行[0054]通过流程120对any用编码器150输出的潜在表现进行逆转换,赋予转换目标的说150得到不依赖于说话者的潜在表现。不依赖于说话者的潜在表现包含转换源的声音的发[0060]在步骤S24中,转换部12将潜在表现S2和转换目标的说话者信息输入到声码器[0063]在图6的学习例中,以使通过流程120对编码器110的输出进行转换及逆转换而得的潜在表现与通过流程120对any用编码器150的输出进行逆转换而得的潜在表现接近的方此,声质转换装置1无论从谁的声音都能够转换为反映了输入的声音的发声方式的转换目而得的不依赖于说话者的潜在表现(监督)与any用编码器150输出的潜在表现接近的方式[0069]声质转换装置1也可以以使通过流程120转换后再进行逆转换而得的潜在表现S2(监督)与通过流程120对any用编码器150输出的不依赖于说话者的潜在表现进行逆转换而

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论