CN112382309B 情绪识别模型的训练方法、装置、设备及存储介质(平安科技(深圳)有限公司)_第1页
CN112382309B 情绪识别模型的训练方法、装置、设备及存储介质(平安科技(深圳)有限公司)_第2页
CN112382309B 情绪识别模型的训练方法、装置、设备及存储介质(平安科技(深圳)有限公司)_第3页
CN112382309B 情绪识别模型的训练方法、装置、设备及存储介质(平安科技(深圳)有限公司)_第4页
CN112382309B 情绪识别模型的训练方法、装置、设备及存储介质(平安科技(深圳)有限公司)_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

(19)国家知识产权局(12)发明专利(22)申请日2020.12.11道福安社区益田路5033号平安金融中心23楼务所(普通合伙)44507专利代理师张传义(56)对比文件审查员林登樟权利要求书2页说明书9页附图2页储介质(57)摘要绪识别模型的训练方法、装置、设备及存储介质,述正面情绪音频和所述负面情绪音频进行特征样本音频中的所述正面情绪音频进行音频过滤,情绪音频输入至预设的神经网络进行模型训练,2获取样本音频,所述样本音频中包括正面情绪音频和负面情绪音频,并分别对所述正面情绪音频和所述负面情绪音频进行特征提取,得到语音特征;根据所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤,得到过滤后的样本音频;对所述样本音频中的负面情绪音频进行数据增强,得到新增负面情绪音频;将所述过滤后的样本音频以及所述新增负面情绪音频作为训练数据,并将所述训练数据输入至预设的神经网络进行模型训练,以得到情绪识别模型。2.根据权利要求1所述的情绪识别模型的训练方法,其特征在于,所述根据所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤,包括:分析所述正面情绪音频的语音特征的正向特征值和所述负面情绪音频的语音特征的负向特征值,得到语音特征、语音特征的特征值和情绪类别的规律曲线;基于所述规律曲线确定筛选阈值,并根据所述筛选阈值和所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤;其中,所述分析所述正面情绪音频的语音特征的正向特征值和所述负面情绪音频的语音特征的负向特征值,得到语音特征、语音特征的特征值和情绪类别的规分析所述样本音频中每一个正面情绪音频对于所述语音特征的正向特征值,获得所述语音特征对应的正向特征值的变化趋势;分析所述样本音频中每一个负面情绪音频对于所述语音特征的负向特征值,获得所述语音特征对应的负面特征值的变化趋势;基于同一所述语音特征对应的所述正向特征值的变化趋势以及所述负面特征值的变化趋势,绘制所述语音特征对应的从正面情绪音频到负面情绪音频的变化趋势,获得所述规律曲线。3.根据权利要求1所述的情绪识别模型的训练方法,其特征在于,所述方法包括:对所述样本音频进行音频分析,得到所述样本音频的信号能量值变化;根据所述样本音频的信号能量值变化对所述样本音频进行端点检测,并基于检测出的端点对所述样本音频进行切割,得到所述样本音频中的有声音频片段。4.根据权利要求1所述的情绪识别模型的训练方法,其特征在于,所述方法包括:对所述样本音频进行语音识别,确定所述样本音频中是否包括语音信息;若所述样本音频中不包括语音信息,则删除所述样本音频;若所述样本音频中部分包括语音信息,则对所述样本音频进行切割,得到包括语音信息的音频片段。5.根据权利要求1所述的情绪识别模型的训练方法,其特征在于,所述预设的神经网络包括输入层、特征提取层、隐藏层、池化层和输出层;所述将所述训练数据输入至预设的神将所述训练数据通过所述输入层输入预设的神经网络;基于所述特征提取层对所述训练数据进行特征提取,得到第一训练特征;将所述第一训练特征输入所述隐藏层,得到与所述第一训练特征对应的第二训练特3基于所述池化层对所述第二训练特征进行特征降维,得到第三训练特征;基于所述第三训练特征进行分类,并通过所述输出层输出分类结果;基于所述分类结果和所述训练数据中音频的情绪类型对所述预设的神经网络进行迭代训练。6.根据权利要求1所述的情绪识别模型的训练方法,其特征在于,所述方法包括:对所述样本音频进行噪声去除,得到去除噪声后的样本音频。7.根据权利要求1所述的情绪识别模型的训练方法,其特征在于,所述数据增强包括语速扰动、相位扰动和频谱掩蔽中的至少一项。特征提取模块,用于获取样本音频,所述样本音频中包括正面情绪音频和负面情绪音频,并分别对所述正面情绪音频和所述负面情绪音频进行特征提取,得到语音特征;音频过滤模块,用于根据所述语音特征对所述样本音频中的所述正面情绪音频进行音数据增强模块,用于对所述样本音频中的负面情绪音频进行数据增强,得到新增负面情绪音频;模型训练模块,用于将所述过滤后的样本音频以及所述新增负面情绪音频作为训练数据,并将所述训练数据输入至预设的神经网络进行模型训练,以得到情绪识别模型。9.一种计算机设备,其特征在于,所述计算机设备包括存储器和处理器;所述存储器用于存储计算机程序;所述处理器,用于执行所述计算机程序并在执行所述计算机程序时实现如权利要求1至7中任一项所述的情绪识别模型的训练方法。10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有计算机程序,所述计算机程序被处理器执行时使所述处理器实现如权利要求1至7中任一项所述的情绪识别模型的训练方法。4情绪识别模型的训练方法、装置、设备及存储介质技术领域[0001]本申请涉及模型训练领域,尤其涉及一种情绪识别存储介质。背景技术[0002]随着互联网的飞速发展,大量的业务开始在线上进行处理。目前设置了大量的网络客服来解答用户的问题。为了保证客服的服务质量,大多会对通话过程进行录音,通过录音转文字的方式来对本次的服务过程进行记录。但语音转文字的方式仅能够得知录音的文字内容,而对于对话双方的情绪识别,尤其是对于客户的情绪无从得知,这导致无法对用户的负面情绪进行识别,也就无法得知用户对于本次服务过程是否满意。[0003]因此,如何训练情绪识别模型,使情绪识别模型能够准确对用户的情绪进行识别成为亟待解决的问题。发明内容[0004]本申请提供了一种情绪识别模型的训练方法、装置、设备及存储介质,以使情绪识别模型能够准确对用户的情绪进行识别。[0006]获取样本音频,所述样本音频中包括正面情绪音频和负面情绪音频,并分别对所述正面情绪音频和所述负面情绪音频进行特征提取,得到语音特征;根据所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤,得到过滤后的样本音频;对所述样本音频中的负面情绪音频进行数据增强,得到新增负面情绪音频;将所述过滤后的样本音频以及所述新增负面情绪音频作为训练数据,并将所述训练数据输入至预设的神经网络进行[0008]特征提取模块,用于获取样本音频,所述样本音频中包括正面情绪音频和负面情绪音频,并分别对所述正面情绪音频和所述负面情绪音频进行特征提取,得到语音特征;音频过滤模块,用于根据所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤,得到过滤后的样本音频;数据增强模块,用于对所述样本音频中的负面情绪音频进行数据增强,得到新增负面情绪音频;模型训练模块,用于将所述过滤后的样本音频以及所述新增负面情绪音频作为训练数据,并将所述训练数据输入至预设的神经网络进行模型训练,以得到情绪识别模型。[0009]第三方面,本申请还提供了一种计算机设备,所述计算机设备包括存储器和处理器;所述存储器用于存储计算机程序;所述处理器,用于执行所述计算机程序并在执行所述计算机程序时实现如上述的情绪识别模型的训练方法。[0010]第四方面,本申请还提供了一种计算机可读存储介质,所述计算机可读存储介质存储有计算机程序,所述计算机程序被处理器执行时使所述处理器实现如上述的情绪识别5模型的训练方法。[0011]本申请公开了一种情绪识别模型的训练方法、装置、设备及存储介质,通过获取样本音频,其中,样本音频中包括正面情绪音频和负面情绪音频,然后分别对正面情绪音频和负面情绪音频进行特征提取,得到语音特征,然后根据语音特征对样本音频中的正面情绪音频进行音频过滤,得到过滤后的样本音频,再对样本音频中的负面情绪音频进行数据增强,得到新增负面情绪音频,最终将过滤后的样本音频和新增负面情绪音频作为训练数据,利用训练数据对预设的神经网络进行模型训练,得到情绪识别模型。通过对样本音频中的正面情绪音频进行音频过滤,提高过滤后的样本音频中负面情绪音频的数据占比,然后对样本音频中的负面情绪音频进行数据增强,将得到的新增负面情绪音频以及过滤后的样本音频共同作为训练数据进行模型训练,进一步提高训练数据中负面情绪音频的数据占比,从而解决模型训练过程中的数据不平衡问题,使训练得到的情绪识别模型对于负面情绪音频的识别准确率提高。附图说明[0012]为了更清楚地说明本申请实施例技术方案,下面将对实施例描述中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图是本申请的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他的附图。[0013]图1是本申请实施例提供的一种情绪识别模型的训练方法的示意流程图;[0014]图2是本申请实施例提供的对正面情绪音频进行音频过滤的步骤示意流程图;[0015]图3为本申请实施例提供的一种情绪识别模型的训练装置的示意性框图;[0016]图4为本申请实施例提供的一种计算机设备的结构示意性框图。具体实施方式[0017]下面将结合本申请实施例中的附图,对本申请实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例是本申请一部分实施例,而不是全部的实施例。基于本申请中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施[0018]附图中所示的流程图仅是示例说明,不是必须包括所有的内容和操作/步骤,也不执行的顺序有可能根据实际情况改变。[0019]应当理解,在此本申请说明书中所使用的术语仅仅是出于描述特定实施例的目的而并不意在限制本申请。如在本申请说明书和所附权利要求书中所使用的那样,除非上下[0020]还应当理解,在本申请说明书和所附权利要求书中使用的术语“和/或”是指相关联列出的项中的一个或多个的任何组合以及所有可能组合,并且包括这些组合。[0021]本申请的实施例提供了一种情绪识别模型的训练方法、装置、计算机设备及存储介质。情绪识别模型的训练方法可用于训练基于用户音频对用户的负面情绪进行识别的情绪识别模型,提高训练得到的情绪识别模型对于负面情绪识别的准确率。训练得到的情绪识别模型可基于音频,对用户的负面情绪进行识别。6[0022]例如,本申请的实施例提供的情绪识别模型的训练方法训练的情绪识别模型,可应用于线上客服系统中,通过对服务过程中的音频进行情绪识别,可得知用户的负面情绪,进而提高客服质量。[0023]下面结合附图,对本申请的一些实施方式作详细说明。在不冲突的情况下实施例及实施例中的特征可以相互组合。[0024]请参阅图1,图1是本申请实施例提供的一种情绪识别模型的训练方法的示意流程图。该情绪识别模型的训练方法通过对正面情绪音频进行音频过滤,以及对负面情绪音频进行数据增强,来提高训练数据中负面情绪数据的数据比例,进而解决模型训练过程中的数据不平衡问题,提高情绪识别模型对于负面情绪的识别准确率。[0026]S101、获取样本音频,所述样本音频中包括正面情绪音频和负面情绪音频,并分别对所述正面情绪音频和所述负面情绪音频进行特征提取,得到语音特征。[0027]其中,所述样本音频是指在业务处理过程中所真实产生的业务数据。例如,以客服系统为例,样本音频为历史客服过程中的录音音频。由于真实产生的业务数据中的负面情绪音频数量的占比极少,因此,需要对样本音频进行处理来缩减样本音频中的数据比例。[0028]样本音频中包括正面情绪音频和负面情绪音频,正面情绪音频是指说话人的情绪[0029]对正面情绪音频和负面情绪音频进行特征提取,具体是指从正面情绪音频和负面对应的特征值、频谱以及频谱对应的特征值。[0030]在一实施例中,所述情绪识别模型的训练方法包括:对所述样本音频进行噪声去除,得到去除噪声后的样本音频。[0031]由于实际采集到的音频中往往会有一定强度的背景音,这些背景音一般是背景噪音,当背景噪音强度较大时,从音频中提取出的语音特征中会包括大量的无关特征,因此,可以对样本音频进行噪声去除,从而得到去除噪声后的样本音频,从而提高得到的语音特征的准确度。[0032]在具体实施过程中,可以使用傅里叶变换对样本音频进行处理,得到样本音频的频谱,然后从样本音频的频谱中提取出噪声的频谱,并将样本音频根据噪声的频谱做一个反向的补偿运算,从而得到去除噪声后的样本音频。[0033]在一实施例中,所述情绪识别模型的训练方法包括:对所述样本音频进行音频分析,得到所述样本音频的信号能量值变化;根据所述样本音频的信号能量值变化对所述样本音频进行端点检测,并基于检测出的端点对所述样本音频进行切割,得到所述样本音频中的有声音频片段。[0034]对样本音频进行音频分析,具体是指获取样本音频中每帧的振幅,由于声音越小,声波的振幅越小,而声波的振幅也表示了信号能量值的大小,声波的振幅越小,信号的能量值越小。因此,可以根据样本音频的信号能量值变化,来对样本音频进行端点检测,得到样本音频中的有声音频片段的前后端点,然后根据前后端点对样本音频进行切割。[0035]例如,当样本音频在连续若干帧内(第0帧至第N帧之间)的信号能量值均低于能量7值阈值E,而在接下来的连续若干帧内(第N帧至第M帧之间)的信号能量值均高于能量值阈值E,则认为样本音频能量值增大的地方(第N帧)为样本音频的前端点。[0036]同样的,当样本音频在连续若干帧内(第N帧至第M帧之间)的信号能量值均高于能量值阈值E,而在接下来的连续若干帧内(第M帧至第P帧之间)的信号能量值均低于能量值阈值E,则认样本音频能量值减小的地方(第M帧)为样本音频的后端点。[0037]根据样本音频的前端点第N帧和后端点第M帧对样本音频进行切割,得到样本音频[0038]在一实施例中,所述情绪识别模型的训练方法包括:对所述样本音频进行语音识别,确定所述样本音频中是否包括语音信息;若所述样本音频中不包括语音信息,则删除所述样本音频;若所述样本音频中部分包括语音信息,则对所述样本音频进行切割,得到包括语音信息的音频片段。[0039]对于样本音频来说,样本音频中除了可能包括一些无声音片段之外,还可能会包括一些无效的声音片段,例如呼噜声等。因此,可以通过对样本音频进行语音识别,确定样本音频中是否包括语音信息,根据语音信息对样本音频进行筛选和切割,来得到样本音频中包括语音信息的音频片段,能够减少样本音频中的无效音频,进而提高训练的情绪识别模型的识别准确率。[0040]因此,在对样本音频进行语音识别,得到样本音频中不包括语音信息时,认为该样本音频为无效的样本音频,可以删除该样本音频。[0041]在对样本音频进行语音识别,得到样本音频中至少有一部分包括语音信息时,可以对样本音频中包括语音信息的部分进行切割,从而得到包括语音信息的音频片段。[0042]S102、根据所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤,得到过滤后的样本音频。[0043]根据语音特征对样本音频中的正面情绪音频进行音频过滤,从而减少样本音频中的正面情绪音频的数量,实现缩减正负面数据比例的目的。[0044]在一实施例中,请参阅图2,对正面情绪音频进行音频过滤的步骤具体包括:S1021、分析所述正面情绪音频的语音特征的正向特征值和所述负面情绪音频的语音特征的负向特征值,得到语音特征、语音特征的特征值和情绪类规律曲线确定筛选阈值,并根据所述筛选阈值和所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤。[0045]对于提取出的语音特征,分析样本音频中每一个正面情绪音频对于该语音特征的正向特征值,然后将多条正面情绪音频的正向特征值进行综合,可以得到对于该语音特征,正面情绪音频的正向特征值的变化趋势。[0046]同样的,分析样本音频中每一个负面情绪音频对于该语音特征的负向特征值,然后将多条负面情绪音频的负向特征值进行综合,可以得到对于该语音特征,负面情绪音频的负向特征值的变化趋势。[0047]例如,当一个音频为正面情绪音频时,其音频的基频对应的正向特征值是多少,将多个正面情绪音频的基频对应的正向特征值进行综合,可以得到在正面情绪音频中,对于基频这一语音特征,基频对应的正向特征值的变化趋势。[0048]当一个音频为负面情绪音频时,其音频的基频对应的负向特征值是多少,将多个8负面情绪音频的基频对应的负向特征值进行综合,可以得到在负面情绪音频中,对于基频这一语音特征,基频对应的负向特征值的变化趋势。[0049]对于同一语音特征,基于该语音特征在不同情绪类型的音频中,语音特征的特征值变化趋势可以得知,在该语音特征下,从正面情绪音频到负面情绪音频的变化趋势,将该变化趋势绘制为语音特征、语音特征的特征值和情绪类别的规律曲线。[0050]根据该规律曲线确定筛选阈值,然后根据筛选阈值和语音特征对样本音频中的正面情绪音频进行音频过滤,从而减少样本音频中正面情绪音频的数量。[0051]需要说明的是,根据规律曲线确定的筛选阈值并非一成不变的,可以根据实际的训练情况基于该规律曲线进行适应性的调整。[0052]当语音特征有多个时,可以分别对于每一个语音特征均构建语音特征、语音特征的特征值和情绪类别的规律曲线,然后根据多条规律曲线确定每一个语音特征的筛选阈值。[0053]S103、对所述样本音频中的负面情绪音频进行数据增强,得到新增负面情绪音频。[0054]其中,数据增强是指基于样本音频中的负面情绪音频,构建虚拟的样本,将构建的虚拟的样本作为新增负面情绪音频。通过数据增强进一步缩减正面情绪音频和负面情绪音频的数据比例,提高训练得到的情绪识别模型的泛化能力。[0055]在一实施例中,所述数据增强包括语速扰动、相位扰动和频谱掩蔽中的至少一项。[0056]语速扰动是指在时域对样本音频进行线性拉伸或者压缩,由于扰动后的样本音频在频域也会按照一定比例发生变化,因此在时域和频域变化的共同作用下,扰动后的样本音频经特征提取后,会和原样本音频呈现一定的差异性,从而实现了构造新样本的目的。例如,将样本音频在时域上的速度分别调整至0.9、1.0以及1.1三个级别。[0057]相位扰动的规则同语速扰动相同。频谱掩蔽主要是将样本音频中部分的频域值进行赋0处理,操作后的样本音频不会影响到真实的使用,仅是在某些频段进行做掩蔽处理。[0058]S104、将所述过滤后的样本音频以及所述新增负面情绪音频作为训练数据,并将所述训练数据输入至预设的神经网络进行模型训练,以得到情绪识别模型。[0059]将过滤后的样本音频和新增负面情绪音频共同作为训练数据,来对预设的神经网络进行模型训练,当预设的神经网络被训练至收敛时,将收敛的神经网络作为情绪识别模[0060]通过对样本音频中的正面情绪音频进行过滤,以及对负面情绪音频的数据增强,缩减了训练数据中正面情绪音频和负面情绪音频的比例,使在基于真实的业务数据来进行模型训练时,能够解决模型训练过程中的正面情绪音频和负面情绪音频的数据不平衡问题,提高训练得到的情绪识别模型对于负面情绪音频的识别准确率。[0061]在一实施例中,所述预设的神经网络包括输入层、特征提取层、隐藏层、池化层和输出层;所述将所述训练数据输入至预设的神经网络进行模型训练,包括:将所述训练数据通过所述输入层输入预设的神经网络;基于所述特征提取层对所述训练数据进行特征提取,得到第一训练特征;将所述第一训练特征输入所述隐藏层,得到与所述第一训练特征对应的第二训练特征;基于所述池化层对所述第二训练特征进行特征降维,得到第三训练特征;基于所述第三训练特征进行分类,并通过所述输出层输出分类结果;基于所述分类结果和所述训练数据中音频的情绪类型对所述预设的神经网络进行迭代训练。9[0062]将训练数据通过神经网络的输入层进行输入,然后输入的训练数据到达特征提取层后,由特征提取层对训练数据进行特征提取,得到第一训练特征。该第一训练特征被输入神经网络的隐藏层,其中,隐藏层可以是一个RNN网络,通过隐藏层得到输入的训练数据的高维特征,也即第二训练特征,然后通过池化层对第二训练特征进行降维,将高维特征映射到低维度,得到第三训练特征。最终根据第三训练特征进行二分类,并通过输出层输出分类结果。[0063]根据分类结果和训练数据中音频的情绪类型来计算预设的神经网络的损失函数,并对神经网络的参数进行迭代更新,直至损失函数的值达到预设值,认为神经网络收敛,将训练的神经网络作为情绪识别模型,完成模型训练。[0064]上述实施例提供的情绪识别模型的训练方法,通过获取样本音频,其中,样本音频中包括正面情绪音频和负面情绪音频,然后分别对正面情绪音频和负面情绪音频进行特征提取,得到语音特征,然后根据语音特征对样本音频中的正面情绪音频进行音频过滤,得到过滤后的样本音频,再对样本音频中的负面情绪音频进行数据增强,得到新增负面情绪音频,最终将过滤后的样本音频和新增负面情绪音频作为训练数据,利用训练数据对预设的神经网络进行模型训练,得到情绪识别模型。通过对样本音频中的正面情绪音频进行音频过滤,提高过滤后的样本音频中负面情绪音频的数据占比,然后对样本音频中的负面情绪音频进行数据增强,将得到的新增负面情绪音频以及过滤后的样本音频共同作为训练数据进行模型训练,进一步提高训练数据中负面情绪音频的数据占比,从而解决模型训练过程中的数据不平衡问题,使训练得到的情绪识别模型对于负面情绪音频的识别准确率提高。[0065]请参阅图3,图3是本申请的实施例的提供一种情绪识别模型的训练装置的示意性框图,该情绪识别模型的训练装置用于执行前述的情绪识别模型的训练方法。其中,该情绪识别模型的训练装置可以配置于服务器或终端中。[0066]其中,服务器可以为独立的服务器,也可以为服务器集群。该终端可以是手机、平[0067]如图3所示,情绪识别模型的训练装置200包括:特征提取模块201、音频过滤模块202、数据增强模块203和模型训练模块204。[0068]特征提取模块201,用于获取样本音频,所述样本音频中包括正面情绪音频和负面情绪音频,并分别对所述正面情绪音频和所述负面情绪音频进行特征提取,得到语音特征。[0069]音频过滤模块202,用于根据所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤,得到过滤后的样本音频。[0070]在一实施例中,音频过滤模块202包括曲线构建子模块2021和阈值过滤子模块[0071]其中,曲线构建子模块2021,用于分析所述正面情绪音频的语音特征的正向特征值和所述负面情绪音频的语音特征的负向特征值,得到语音特征、语音特征的特征值和情绪类别的规律曲线。阈值过滤子模块2022,用于基于所述规律曲线确定筛选阈值,并根据所述筛选阈值和所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤。[0072]数据增强模块203,用于对所述样本音频中的负面情绪音频进行数据增强,得到新增负面情绪音频。[0073]模型训练模块204,用于将所述过滤后的样本音频以及所述新增负面情绪音频作为训练数据,并将所述训练数据输入至预设的神经网络进行模型训练,以得到情绪识别模[0074]需要说明的是,所属领域的技术人员可以清楚地了解到,为了描述的方便和简洁,上述描述的情绪识别模型的训练装置和各模块的具体工作过程,可以参考前述情绪识别模型的训练方法实施例中的对应过程,在此不再赘述。[0075]上述的情绪识别模型的训练装置可以实现为一种计算机程序的形式,该计算机程序可以在如图4所示的计算机设备上运行。[0076]请参阅图4,图4是本申请实施例提供的一种计算机设备的结构示意性框图。该计算机设备可以是服务器或终端。[0077]参阅图4,该计算机设备包括通过系统总线连接的处理器、存储器和网络接口,其中,存储器可以包括非易失性存储介质和内存储器。[0078]非易失性存储介质可存储操作系统和计算机程序。该计算机程序包括程序指令,该程序指令被执行时,可使得处理器执行任意一种情绪识别模型的训练方法。[0079]处理器用于提供计算和控制能力,支撑整个计算机设备的运行。[0080]内存储器为非易失性存储介质中的计算机程序的运行提供环境,该计算机程序被处理器执行时,可使得处理器执行任意一种情绪识别模型的训练方法。[0081]该网络接口用于进行网络通信,如发送分配的任务等。本领域技术人员可以理解,图4中示出的结构,仅仅是与本申请方案相关的部分结构的框图,并不构成对本申请方案所应用于其上的计算机设备的限定,具体的计算机设备可以包括比图中所示更多或更少的部[0082]应当理解的是,处理器可以是中央处理单元(CentralProcessingUnit,CPU),该处理器还可以是其他通用处理器、数字信号处理器(DigitalSignalProcessor,DSP)、专用集成电路(ApplicationSpecificIntegratedCircuit,ASIC)、现场可编程门阵列(Field-ProgrammableGateArray,FPGA)或者其他可编程逻辑器件、分立门或者晶体管逻辑器件、分立硬件组件等。其中,通用处理器可以是微处理器或者该处理器也可以是任何常规的处理器等。[0083]其中,在一个实施例中,所述处理器用于运行存储在存储器中的计算机程序,以实现如下步骤:[0084]获取样本音频,所述样本音频中包括正面情绪音频和负面情绪音频,并分别对所述正面情绪音频和所述负面情绪音频进行特征提取,得到语音特征;根据所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤,得到过滤后的样本音频;对所述样本音频中的负面情绪音频进行数据增强,得到新增负面情绪音频;将所述过滤后的样本音频以及所述新增负面情绪音频作为训练数据,并将所述训练数据输入至预设的神经网络进行[0085]在一个实施例中,所述处理器在实现所述根据所述语音特征对所述样本音频中的所述正面情绪音频进行音频过滤时,用于实现:[0086]分析所述正面情绪音频的语音特征的正向特征值和所述负面情绪音频的语音特征的负向特征值,得到语音特征、语音特征的特征值和情绪类别的规律曲线;基于所述规律曲线确定筛选阈值,并根据所述筛选阈值和所述语音特征对所述样本音频中的所述正面情11绪音频进行音频过滤。[0088]对所述样本音频进行音频分析,得到所述样本音频的信号能量值变化;根据所述样本音频的信号能量值变化对所述样本音频进行端点检测,并基于检测出的端点对所述样本音频进行切割,得到所述样本音频中的有声音频片段。[0090]对所述样本音频进行语音识别,确定所述样本音频中是否包括语音信息;若所述样本音频中不包括语音信息,则删除所述样本音频;若所述样本音频中部分包括语音信息,则对所述样本音频进行切割,得到包括语音信息的音频片段。[0091]在一个实施例中,所述预设的神经网络包括输入层、特征提取层、隐藏层、池化层和输出层;所述处理器在实现所述将所述训练数据输入至预设的神经网络进行模型训练[0092]将所述训练数据通过所述输入层输入预设的神经网络;基于所述特征提取层对所述训练数据进行特征提取,得到第一训练特征;将所述第一训练特征输入所述隐藏层,得到与所述第一训练特征对应的第二训练特征;基于所述池化层对所述第二训练特征进行特征降维,得到第三训练特征;基于所述第三训练特征进行分类,并通过所述输出层输出分类结果;基于所述分类结果和所述训练数据中音频的情绪类型对所述预设的神经网络进行迭代[0093]在一个实施例中,所述处理器用于实现:[0094]对所述样本音频进行

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论