CN115862592B 音频处理方法及相关装置 (腾讯音乐娱乐科技(深圳)有限公司)_第1页
CN115862592B 音频处理方法及相关装置 (腾讯音乐娱乐科技(深圳)有限公司)_第2页
CN115862592B 音频处理方法及相关装置 (腾讯音乐娱乐科技(深圳)有限公司)_第3页
CN115862592B 音频处理方法及相关装置 (腾讯音乐娱乐科技(深圳)有限公司)_第4页
CN115862592B 音频处理方法及相关装置 (腾讯音乐娱乐科技(深圳)有限公司)_第5页
已阅读5页,还剩42页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

司一种音频处理方法及相关装置,该方法包根据曲谱文件确定歌曲训练样本的音节序列和音节序列和音符序列输入初始基频预测模型得频序列对初始基频预测模型进行训练得到目标和发音序列输入初始声学模型得到第一声学特模型和目标基频预测模型用于生成待合成歌曲2根据所述曲谱文件确定所述歌曲训练样本的音节序列和音符序列,以音频确定所述歌曲训练样本的第一基频序列和发音序将所述歌曲训练样本的音节序列和音符序列输入初始基频预测模型得到第二基频序所述待合成歌曲的预测基频序列;将所述歌曲训练样本的第一基频序列和发音序列输入初始声学模型得到第一声学特获取所述曲谱文件中的各个音节的时间信息,并根据预设单获取所述曲谱文件中的各个音符的时间信息,并根据所述预设符的时间信息确定所述歌曲训练样本的音符序获取所述干声音频中的各个发音元素的时间信息,并根据所根据所述预设单位帧长对所述干声音频进行基频提取处理,得针对各个所述发音元素,根据所述预设单位帧长和所述发音元根据各个所述发音元素的个数和序列开始位置,对所述各个发音元素进行排序处理,得到所述歌曲训练样本的发音序列。对所述多帧子音频的多个基频值进行排序处理,得到所述歌曲训练样3对所述歌曲训练样本的发音序列中的各个发音元素分别进行编码处理对所述歌曲训练样本的第一基频序列和所述发音编码序列分别进行将所述融合特征输入初始声学模型包括的编解码模块中,得到转换特对所述歌曲训练样本的音节序列中的各个音节分别进行编码处理,得到音节编码序对所述音节编码序列和所述音符编码序列分别进行特征提取处理将所述音节序列特征输入初始基频预测模型包括的语义编码模根据所述音符残差特征和所述音符编码序列确定第二基频序列。获取待合成歌曲的曲谱文件,并根据所述曲谱文件确定所述待合将所述待合成歌曲的音节序列和音符序列输入如权利要求1至6任一项所述的一种音根据所述待合成歌曲的音节序列确定目标发音序列,并将所调用声码器对所述预测声学特征进行音频合成处理,得到所述待合成歌曲的合成音若发音元素为音素,则将所述待合成歌曲的音节序列输入由歌曲训练样本中各个音素的音素时长进行训练4理器调用所述存储器中存储的计算机程序,用于实现如权利要求1-8中任一项所述的音频5[0003]本申请实施例提供了一种音频处理方法及相关装置,可干声音频确定所述歌曲训练样本的第一基频序列和发[0007]将所述歌曲训练样本的音节序列和音符序列输入初始基频预测模型得到第二基频序列,并根据所述第二基频序列和所述第一基频序列对所述初始基频预测模型进行训生成所述待合成歌曲的预测基频序列;[0008]将所述歌曲训练样本的第一基频序列和发音序列输入初始声学模型得到第一声6[0016]处理单元,用于根据所述曲谱文件确定所述歌曲训练样本的音节序列和音符序成歌曲的曲谱文件生成所述待合成歌曲的预测基频序列;符序列的深度建模能力,能够使目标基频预测模型准确地预测出待合成歌曲的基频序列;7习、自动驾驶、智慧交通等几大方向。语音处理技术的关键技术有自动语音识别技术8[0047]图1所示的系统架构可以实现本申请实施例提供的音频处理方法,以终端设备11[0049]在第二阶段中,服务器12会搭载训练得到的目标基频预为本申请实施例提供的一种音频处理方法的流程示意图。该方法可以应用于上述图1中的[0052]曲谱文件中的曲谱是指记录有音乐音高或者节奏的各种书面符号的有规律的组一个歌曲的干声音频,该至少一个歌曲的干声音频中的一个为歌曲训练样本的干声音频,服务器可以从第二数据集中获取歌曲训练样本频确定歌曲训练样本的第一基频序列和发音序列。[0056]歌曲训练样本的曲谱文件中包含有歌曲训练样本的歌词以及多个音符(音乐符9确定歌曲训练样本中的各个音符的时间信息,每个音符的时间信息包括音符开始时间(反映音符发音的开始时间)和音符结束时间(反映音符发音的结束时间),以及根据音符开始时间和音符结束时间之间的差值确定的音符时长(反映音符发音的持续时间)。可理解的,该每个音节的音节开始时间。将该各个辅助音符的音符结束时间中最晚的音符结束时间,定歌曲训练样本的音节序列。除以预设单位帧长后进行取整运算后得到的,取整运算可以是向上取整或向下取整。该任一音节的个数表示该任一音节需持续的预设单位帧长的个数,可以反映该音节演唱时需持据预设单位帧长和任一音节的时间信息包括的音节开始时间,确定任一音节的序列开始位置。其中,任一音节的序列开始位置是将任一音节的音节开始时间除以预设单位帧长后进可见,音节序列不仅可以体现歌曲训练样本中的音节的自身信曲训练样本的发音情况。[0061]进一步地,服务器在得到歌曲训练样本的曲谱文件中的各个音符的时间信息之歌曲训练样本的音符序列。音符的序列开始位置是将任一音符的音符开始时间除以预设单位帧长后进行取整运算得步可以根据干声音频中的各个发音元素的时间信息以及预设单位帧长(可以人为设定,例为第一基频序列。预测基频序列。[0069]参阅图5,将歌曲训练样本的音节序列和音符序列输入初始基频预测模型得到第编码序列对应的音节序列特征和音符编码序列对应的音符序列特征(可以均是固定大小的长短期记忆(LongShort-TermMemory,LSTM)模型以及BERT(BidirectionalEncoder[0073]在一实施例中,服务器可以根据下述式(2)确定第二基频序列F0_hat和第一基频序列ytrue之间的差异数据loss1。再根据第二基频序列和第一基频序列之间的差异数据loss1对初始基频预测模型进行一次训练,一次训练是指利用差异数据loss1反向调整一次对初始基频预测模型进行多次训练,当某次训练时获取的差异数据loss1小于第一预设阈[0075]需解释的是,本申请会沿着差异数据loss1变小的方向对初始基频预测模型进行[0077]参阅图6,将歌曲训练样本的第一基频序列和发音序列输入初始声学模型得到第[0078]进一步地,通过将第一基频序列和发音编码序列分别输入初始声学特征包括的频序列对应的基频序列特征和发音编码序列对应的发音序列特征(可以均是固定大小的向学特征和干声音频的第二声学特征之间的差异数据loss2(可以是根据第一声学特征和干声音频的第二声学特征之间的差的平方得到的)对初始声学模型进行一次训练,一次训练差异数据loss2小于第二预设阈值(可以人为设置)时或训练次数达到第二预设次数时,将歌曲的预测基频序列。特征和音符序列特征具体可以是将音节编码序列和音符编码序列分别输入目标基频预测模型包括的embedding层(嵌入层)得到的。再将音节序列特征输入目标基频预测模型包括测基频序列。频序列。最终可以将预测音素序列确定映音素演唱时需持续的时长。入初始时长预测模型包括的embedding层(嵌入层)得到音节序列特征,再将音节序列特征训练样本中的各个音素的真实音素时长和训练音素时长对初始时长预测模型进行训练得音素时长之间的差异数据loss3(可以是根据真实音素时长和训练音素时长之间的差的平设置)时或训练次数达到第三预设次数时,将训练后的初始时长预测模型确定为音素时长个音素的预测音素时长的处理逻辑与训练过程中将歌曲训练样本的音节序列输入初始时以采用独热one-hot编码等其他编码方式实现。再对待合成歌曲的预测基频序列和发音编序列特征具体可以是将第一基频序列和发音编码序列分别输入目标声学特征包括的成歌曲的发音情况的目标发音序列以及指示待合成歌曲的音调变化情况的预测基频序列,歌曲的曲谱文件可以得到待合成歌曲中的各个音符和对应的时间信息,从而得到音符序待合成歌曲的曲谱文件生成所述待合成歌曲的预测基频序列;[0118]所述处理单元1102,还用于根据所述待合成歌曲的音节[0119]所述处理单元1102,还用于调用声码器对所述预测声学述音素时长预测模型是根据歌曲训练样本中的各个音素的真实音素时长和训练音素时长上述方法实施例中的方法具体实现,其具体实现过程可以参照上述方法实施例的相关描机设备120内部结构如图12所示,包括:一个或多个处理器1201、存储器1202、通信接口机设备120的各类数据,例如:CPU可以用于解析用户向计算机设备120所发送的开关机指干声音频确定所述歌曲训练样本的第一基频序列和发[0127]将所述歌曲训练样本的音节序列和音符序列输入初始基频预测模型得到第二基频序列,并根据所述第二基频序列和所述第一基频序列对所述初始基频预测模型进行训[0128]将所述歌曲训练样本的第一基频序列和发音序列输入初始声学模型得到第一声音素时长预测模型是根据歌曲训练样本中的各个音素的真实音素时长和训练音素时长对[0146]本领域普通技术人员可以理解上述实施例的各种方法中的全部

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论