版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
司种分类模型是由多个训练音频的音素序列训练训练完成的目标语种分类模型记录有音频的音2调用训练完成的目标声学模型对所述频谱特征调用训练完成的目标语种分类模型对所述音素序列进行获取第一训练音频集,所述第一训练音频集包括至少一种语种调用初始声学模型对所述每个第一训练音频的频谱特征进根据音素词典和所述每个第一训练音频的预测音素序列,得到所基于所述第一字符序列和所述第二字符序列对所述初始声学模型中的参数进行训练,型和语种确定子模型,所述调用训练完成的目标语种分类模型对所述音素序列进行处理,调用所述特征提取子模型对所述音素序列进行处理调用所述语种确定子模型对所述音素特征向量进行处调用所述自注意力层,基于所述音素嵌入向量中每个向调用所述语种确定子模型中的映射规则,对所述音素特获取所述每个第一训练音频的待处理音素序列,所述待处理3声学模型对所述每个第一训练音频的频谱特调用初始语种分类模型对所述每个第一训练音频的待处基于所述每个第一训练音频所属的预设语种以及预测语种对所述初始语种分类模型获取第二训练音频集,所述第二训练音频集包括至少一种语种依次调用所述目标声学模型、所述目标语种分类模型对所基于所述每个第二训练音频所属的预测语种以及预设语种,更新所二训练音频的数量小于或等于所述第一训练音频集包括的第一获取第三训练音频集,所述第三训练音频集包括至少一种语种获取所述第三训练音频集中每个第三训练音频所属依次调用所述目标声学模型、所述目标语种分类模型对所述每4音素词典用于指示不同语种的字符与音素之间的频所属的语种;所述训练完成的目标语种分类模型是由多个训练音频的音素序列训练得[0013]所述调用所述特征提取子模型对所述音素序列进行处理,得到音素特征向量包5[0024]基于所述第一字符序列和所述第二字符序列对所述初始声学模型中的参数进行训练完成的目标声学模型对所述每个第一训练音频[0029]基于所述每个第一训练音频所属的预设语种以及预测语种对所述初始语种分类数量小于或等于所述第一训练音频集包括的第6标语种分类模型记录有音频的音素序列与音频所属语种的对应关系。7[0059]基于所述第一字符序列和所述第二字符序列对所述初始声学模型中的参数进行训练完成的目标声学模型对所述每个第一训练音频[0065]基于所述每个第一训练音频所属的预设语种以及预测语种对所述初始语种分类数量小于或等于所述第一训练音频集包括的第于调用程序代码实现如第一方面及第一方面的可能实现8典能够适应多种语种,从而使得训练完成的目标声学模型能够对不同语种的音频进行处9音素具有各自对应的发音动作。相同发音动作发出的音就是同一音素,不同发音动作发出常,在中文语音中以声韵母作为发音动作的符号表示形式(音素),在英文语音中以英文音[0096]其中,语音技术的关键技术有自动语音识别技术(automaticspeech的待分类音频经由训练完成的目标声学模型处理也可得到包含音素数量足够的音素序列通信功能的手持设备(例如智能手机、平板电脑)、计算设备(例如个人电脑(personal[0106]其中,该步骤用于基于训练完成的目标声学模型获取得到待分类音频的音素序l3力络和因子分解时延神经网络构建的自注意力机制的神经网络模型(CNN_TDNN_F_SA)等,本采用包含统一音素的音素词典减少了音素的[0109]示例地,音素词典中的音素可以由国际音标(internationalphonetic1序列中音素对应的嵌入向量与位置向量相加即可得到该音素对应的在音素嵌入向量中的[0121]进一步地,自注意力层对音素嵌入向量中各个向量分量对应的音素之间的位置、[0123]可选的,特征提取子模型中还可以在自注意力层和批标准化层之间加入残差连[0127]在一些可能实施方式中,上述调用所述语种确定子模型对音素特征向量进行处[0131]需要说明的是,这里的语种确定子模型可以采用支持向量机(supportvector[0132]在图2对应的实施例中,本申请可以基于音频对应的音素序列识别出音频所属的音频中的语音发音动作直接关联,能够作为语种[0133]下面对图2实施例中训练完成的目标声学模型和训练完成的目标语种分类模型的预测音素序列L1;接着经由音素词典(音素词典中存储有音素集合L与字符之间的对应关素构成的组合具有对应的字符,L1中的前三个音素构成的组合也具有对应的字符,在此情况下可以将前三个音素构成的组合对应的字符作为最终的查找结果。该过程与中文中的前[0143]需要说明的是,上述获取每个第一训练音频的频谱特征的方式与图2对应实施例对每个第一训练音频的频谱特征进行处理得到的;获取每个第一训练音频所属的预设语型和目标语种分类模型可以对这五种语种的音频进行分类(分类的原理与上述图2对应的征向量的取值映射为待分类音频属于各个语种的概率取值并基于概率取值确定音频的所语种对目标语种分类模型中语种确定子模型进行每个第三训练音频的预测语种,该过程与上述图2对应的实施例中的过程相同,在此不赘以将音素特征向量映射为包含新语种在内的语种的概的矩阵运算将音素特征向量映射为待分类音频属于语种A和语种B的概率分别为0.7和0.3,基于该概率可确定待分类音频属于语种A。当更新后的语种确定子模型接收到上述音素特[0159]在图3对应的实施例中,本申请可以先对初始声学模型进行训练以得到训练完成[0163]所述处理单元702,还用于调用训练完成的目标语种分类模型对所述音素序列进和语种确定子模型,所述处理单元702在用于调用训练完成的目标语种分类模型对所述音[0168]所述处理单元702在用于调用所述特征提取子模型对所述音素序列进行处理,得[0179]基于所述第一字符序列和所述第二字符序列对所述初始声学模型中的参数进行训练完成的目标声学模型对所述每个第一训练音频[0185]基于所述每个第一训练音频所属的预设语种以及预测语种对所述初始语种分类数量小于或等于所述第一训练音频集包括的第音素词典用于指示不同语种的字符与音素之间的频所属的语种;所述训练完成的目标语种分类模型是由多个训练音频的音素序列训练得[0203]应当理解,在一些可行的实施方式中,上述处理器801可以是中央处理单元(digitalsignalprocesso或者该处理器也可以是任何常规的处理器等。上述存储器802可以包括只读存储器(read_有前文提及的文本处理装置所执行的计算机可读指令,且该
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 社区工作者招录全真模拟冲刺密卷含完整答案
- 文职国防常识基础阶段达标检测卷含完整答案
- 外科患者压疮风险评估与预防措施
- 护理护理创新与实践应用
- 外科护理中的团队合作与领导力
- 导管护理的临床
- 医护人员礼仪素养提升
- 头发保养秘籍分享
- 医疗废物分类与处理
- 护理护理环境学要点
- THIS001-2022红外热电堆传感器
- 外墙水包砂质保合同范本
- 肢体创伤后水肿管理指南解读
- 招标代理业务管理规范与操作指南
- 旅游直播培训课件
- T/CAPA 3-2021毛发移植规范
- 急诊治疗过程中的医患沟通技巧
- 旅游客车交通安全检查
- 金属基体上的金属覆盖层 电沉积和化学沉积层 附着强度试验方法评述
- (完整)三年级数学口算题300道(直接打印)
- GB/T 19923-2024城市污水再生利用工业用水水质
评论
0/150
提交评论