CN119479646A 一种基于bert预训练语言模型的语音指令识别方法 (北京邮电大学)_第1页
CN119479646A 一种基于bert预训练语言模型的语音指令识别方法 (北京邮电大学)_第2页
CN119479646A 一种基于bert预训练语言模型的语音指令识别方法 (北京邮电大学)_第3页
CN119479646A 一种基于bert预训练语言模型的语音指令识别方法 (北京邮电大学)_第4页
CN119479646A 一种基于bert预训练语言模型的语音指令识别方法 (北京邮电大学)_第5页
已阅读5页,还剩33页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于BERT预训练语言模型的语音指令识别模型将待识别语音转化为文本序列;微调本发明考虑到音频数据较文本数据更难获取的2微调所述BERT预训练语言模型,并利用微调后的BERT预训练语言模型对所述文本2.根据权利要求1所述的方法,其特征在于,所述利用编码器解码器的Transformer模型将所述待识别将特殊标记对应的输出特征作为全连接分类器的输入,得到待计算压缩后的学生模型的损失函数,并利用计算结果调转化模块,用于接收待识别语音,并通过自动语音识别模型将所述分类模块,用于微调所述BERT预训练语言模型,并利用微调后压缩模块,用于利用知识蒸馏对微调后的BERT预训练语言模型特征提取模块,用于利用序列分类模型对所述文本序列进3存储器和处理器,所述存储器和所述处理器之间互相通信连接9.一种计算机可读存储介质,其特征在于,所述机执行权利要求1至6中任一项所述的基于BERT预训练语言模型的语音指令4制指令为无人机等设备提供了便捷的操作。5[0010]利用知识蒸馏对微调后的BERT预训练语言模型进行模型压缩,得到序列分类模[0013]在一种可选的实施方式中,自动语音识别模型为Whisper自动语音识别模型,[0020]本发明通过文本序列拆分,将拆分得到的token序列输入到利用BERT预训练语言[0025]计算压缩后的学生模型的损失函数,并利用计算结果调[0026]本发明通过根据压缩后的学生模型的损失函数计算结果,来对学生模型进行调6叉熵损失,y为样本x的类别标签,yk为第k个类别标签,K为总类别数,q为学生模型通过使计算机执行上述第一方面或其对应的任一实施方式的基于BERT预训练语言模型的语音[0040]图1是根据本发明实施例的基于BERT预训练语言模型的语音指令识别方法的流程[0041]图2是根据本发明实施例的基于BERT预训练语言模型的语音指令识别系统的框架7[0048]图9是根据本发明实施例的基于BERT预训练语言模型的语音指令识别装置的结构网络(RecurrentNeuralNetwork,RNN)、长短时记忆网络(LongShort_TermMemory,[0055]大语言模型主要基于Transformer架构,Transformer的关键创新是自注意力机下文理解,以及掩码语言模型(MaskedLanguageModel,MLM)和下一句预测(Next8[0058]在本实施例中提供了一种基于BERT预训练语言模型的语音指令识别方法,图1是[0060]在本发明实施例中,由于目前比较成熟的自然语言处理(NaturalLanguage调。9地识别语音信息。原始的Whisper模型包含五个大小的版本,以及经过提高其推理速度的[0075]Whisper模型是一个通用的语音识别模型,它使用了大量的多语言和多任务的监[0083]通过文本序列拆分,将拆分得到的token序列输入到BERT预训练语言模型中进行[0088]通过利用知识蒸馏对BERT预训练语言模型进行模型压缩为数据的类别标签;软标签为Teacher输出的logits通过带有温度参数T的softmax函数得到的概率分布P。训练时,Student输出的软标签的预测分布p同样通过具有温度参数T的[0098]L=aL[0106]本发明实施例采用的微调大语言模型的数据集共包含16类军事战术动作文本指序列分类模块通过将预训练语言模型BERT_base在文本指令数据集上进行微调,再将微调[0114]用于序列分类的BERT_base+分类器结构如图3所示,首先将输入的文本切分为集上对序列分类模型进行全量微调和部分微调,部分微调指仅训练分类器的全连接层部的类别标签;软标签为Teacher输出的logits通过带有温度参数T的softmax函数得到的概[0119]利用本发明实施例提供的基于BERT预训练语言模型的语音指令识别方法进行试[0121]通过100轮的训练迭代(每个小批量样本的训练为一个step),全量微调和部分微FasterWhisper拥有此参数;Time表示识别一条语音指令的时间,以秒为单位(此结果在确率却有不小的提高,最后综合观察其不同版本在Student上的推理准确率,我们选择了10_8馏得到的Student模型在表3.1所示的数据集上达到了100%的训练准确率和96.15%的测算环境下,Teacher和Student在数据集上对每条数据的平均推理时间分别为23.39ms和语音数据来评估系统的性能。系统的语音识别模块统一使用FasterWhisper_largev2(且使用相同的提示词),序列分类模块在使用Teacher和Student时分别达到了96.74%和95.65%的准确率(使用其它语音识别模型时的性能详见表5),压缩后的模型性能损失较[0135]系统的推理速度受到具体GPU/CPU型号的影响,我们最终选择在比较常规的[0153]本实施例中的基于BERT预训练语言模型的语音指令识别装置是以功能单元的形[0154]本发明实施例还提供一种计算机设备,具有上述图9所示的基于BERT预训练语言存储在远程存储介质或非暂时机器可读存储介质中并将被存储在本地存储介质中的计算该计算机读取并执行该指令,或者该计算机读取并安装该指令后再执行对应的安装后程的精神和范围的情况下做出各种修改和变型,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论