CN115691511B 音频旋律识别模型的训练方法、音频处理方法及相关设备 (腾讯音乐娱乐科技(深圳)有限公司)_第1页
CN115691511B 音频旋律识别模型的训练方法、音频处理方法及相关设备 (腾讯音乐娱乐科技(深圳)有限公司)_第2页
CN115691511B 音频旋律识别模型的训练方法、音频处理方法及相关设备 (腾讯音乐娱乐科技(深圳)有限公司)_第3页
CN115691511B 音频旋律识别模型的训练方法、音频处理方法及相关设备 (腾讯音乐娱乐科技(深圳)有限公司)_第4页
CN115691511B 音频旋律识别模型的训练方法、音频处理方法及相关设备 (腾讯音乐娱乐科技(深圳)有限公司)_第5页
已阅读5页,还剩32页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

司本申请实施例公开了一种音频旋律识别模翻唱歌曲数据以外的其他歌曲数据三类歌曲数每组音频数据中提取每一类歌曲数据的频谱峰标特征向量和歌曲标注数据输入神经网络模型式可以提高音频旋律识别模型的可靠性和训练2获取样本数据集,所述样本数据集包括多组音频数据,每组据包括用于指示所述原唱歌曲数据的第一标签、用于指示所述翻唱歌曲数据的第二标签、从所述每组音频数据中提取每一类歌曲数据的频谱峰值特征向量和将所述每组音频数据中每一类歌曲数据的目标特征向量和歌曲标注数据输入神经网据的目标特征向量及所述第一标签,所述翻唱歌曲数据的目标特征向量及所述第二标签,以及所述其他歌曲数据的目标特征向量及所述第三标签输入从所述每组音频数据中提取所述每一类歌曲数据的峰值点序列,对从所述每组音频数据中提取每一类歌曲数据的梅尔频谱特征,并根据所数据的梅尔频谱特征确定所述每一类歌曲数将所述每一类歌曲数据的梅尔频谱特征输入预训练的用户识别将所述每一类歌曲数据的梅尔频谱特征输入预训练的音频情感类别确定所述每一类歌曲数据的用户特征向量和所述每一类歌曲数据的音频情感类别特对所述每一类歌曲数据的峰值点序列进行归一化得到归一化序列,计根据所述归一化序列、均值和方差,计算得到所述每一类歌曲数据据的目标特征向量和歌曲标注数据输入神经网络模型进行训练,得到音频旋律识别模型,将所述每组音频数据中所述原唱歌曲数据的目标特征向量及所述第3第三标签输入神经网络模型,得到所述每组音频数据中所述原唱歌曲数据的第一特征向根据所述第一特征向量、所述第二特征向量以及所述第三特征值,并根据所述目标损失函数值对所述神经网络模型进行训练得到所述音频旋律识别模根据所述第一特征向量和所述第二特征向量计算所述每组音频数据中所述原唱歌曲根据所述第一特征向量和所述第三特征向量计算所述每组音频数据中所述原唱歌曲根据所述每组音频数据的所述第一距离和所述第二距离确定所述目标将所述每组音频数据中的所述原唱歌曲数据和所述原唱歌曲数据对应的歌曲标注数将所述原唱歌曲数据的旋律特征向量存储至指定获取待识别音频,并从所述待识别音频中提取频谱峰述无关特征向量为与所述待识别音频的旋律无对所述频谱峰值特征向量和所述无关特征向量进行拼接处理得到所述待识别音频的待识别特征向量;将所述待识别特征向量输入如权利要求1-7任一项所述的音频旋律识别若所述待识别音频的旋律特征向量与指定数据库中各原唱歌曲数据的旋律特征向量10.一种计算机可读存储介质,其特征在于,该计算机可读存储介质中存储有程序指4[0003]本申请实施例提供了一种音频旋律识别模型训练方法、音频处理方法及相关设[0006]从所述每组音频数据中提取每一类歌曲数据的频谱峰值特征向量和无关特征向[0007]将所述每组音频数据中每一类歌曲数据的目标特征向量和歌曲标注数据输入神[0009]获取待识别音频,并从所述待识别音频中提取频谱峰值特征向量和无关特征向[0010]对所述频谱峰值特征向量和所述无关特征向量进行拼接处理得到所述待识别音频的待识别特征向量;将所述待识别特征向量输入如第一方面所述的音频旋律识别模型,[0011]若所述待识别音频的旋律特征向量与指定数据库中各原唱歌曲数据的旋律特征5[0014]从所述每组音频数据中提取每一类歌曲数据的频谱峰值特征向量和无关特征向[0015]将所述每组音频数据中每一类歌曲数据的目标特征向量和歌曲标注数据输入神[0017]获取待识别音频,并从所述待识别音频中提取频谱峰值特征向量和无关特征向[0018]对所述频谱峰值特征向量和所述无关特征向量进行拼接处理得到所述待识别音[0019]若所述待识别音频的旋律特征向量与指定数据库中各原唱歌曲数据的旋律特征6中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施[0035]人工智能(ArtificialIntelligence,AI)是利用数字计算机或者数字计算机控[0037]语音技术(SpeechTechnology)的关键技术有自动语音识别技术(ASR)和语音合[0038]自然语言处理(NatureLanguageprocessing,NLP)是计算机科学领域与人工智7[0041]本申请实施例提供的音频旋律识别模型的训练方法可以应用于一种音频旋律识实施例的音频处理可以应用到任意与音频处理相关联的场[0044]下面结合附图对本申请实施例提供的音频旋律识别模型的训练方法以及音频处原唱歌曲数据的翻唱歌曲数据可以包括原唱歌曲数据对应的一个或多个不同版本的翻唱8值特征向量和无关特征向量时,可以从每组音频数据中提取每一类歌曲数据的峰值点序曲数据的梅尔频谱特征确定每一类歌曲数据的组音频数据中的原唱歌曲数据和原唱歌曲数据对应的歌曲标注数据输入音频旋律识别模9[0065]本申请计算频谱峰值特征向量有助于让音频旋律识别模型快速学习音频数据中[0073]本申请实施例通过从样本数据集中的每组音频数据的每一类歌曲数据中提取峰的翻唱歌曲数据以及添加第三标签的其他歌曲数据输入用户特征向量进行特征拼接,将拼接得到的目标特征向量输入18层的深度神经网络到待识别音频如待识别音频的embedding特征和库内距离最近的原唱歌曲数据的[0100]所述存储器1001可以包括易失性存储器(volatilememory);存储器1001也可以包括非易失性存储器(non-volatilememory);存储器1001还可以包括上述种类的存储器1002还可以进一步包括硬件芯片。上述硬件芯片可以是专用集成电路(application-PLD)或其组合。上述PLD可以是复杂可编程逻辑器件(complexprogrammablelogic[0101]所述存储器1001用于存储程序,所述处理器1002可以调用存储1001中存储的程[0103]从所述每组音频数据中提取每一类歌曲数据的频谱峰值特征向量和无关特征向[0104]将所述每组音频数据中每一类歌曲数据的目标特征向量和歌曲标注数据输入神曲数据的峰值点序列进行归一化处理得到所述每一类歌曲数据的频谱峰值特征向量;以歌曲数据的梅尔频谱特征确定所述每一类歌曲数据[0111]确定所述每一类歌曲数据的用户特征向量和所述每一类歌曲数据的音频情感类个峰值点为所述每一类歌曲数据的峰值点序列。将所述每组音频数据中每一类歌曲数据的目标特征向量和歌曲标注数据输入神经网络模[0122]根据所述第一特征向量和所述第二特征向量计算所述每组音频数据中所述原唱[0123]根据所述第一特征向量和所述第三特征向量计算所述每组音频数据中所述原唱[0124]根据所述每组音频数据的所述第一距离和所述第二距离确定所述目标损失函数[0126]将所述每组音频数据中的所述原唱歌曲数据和所述原唱歌曲数据对应的歌曲标[0131]所述存储器1101可以包括易失性存储器(volatilememory);存储器1101也可以包括非易失性存储器(non-volatilememory);存储器1101还可以包括上述种类的存储器1102还可以进一步包括硬件芯片。上述硬件芯片可以是专用集成电路(application-PLD)或其组合。上述PLD可以是复杂可编程逻辑器件(complexprogrammablelogic[0132]所述存储器1101用于存储程序,所述处理器1102可以调用存储1101中存储的程[0133]获取待识别音频,并从所述待识别音频中提取频谱峰值特征向量和无关特征向[0134]对所述频谱峰值特征向量和所述无关特征向量进行拼接处理得到所述待识别音[0135]若所述待识别音频的旋律特征向量与指定数据库中各原唱歌曲数据的旋律特征储有计算机程序,所述计算机程序被处理器执行时实现本申请所对应实施例中描述的方所述设备上配备的插接式硬盘,智能存储卡(SmartMediaCard,SMC),安全数字(Secure碟、光盘、只读存储记忆体(Read-OnlyMemory,ROM)或随机存储记忆体(RandomAccess

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论