版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
机器学习原理与应用毋建军、姜波、郭舒2025年1月第8章语音识别本章学习目标(知识要点)掌握语音识别的方法和技术熟悉语音信号预处理、分析、数据特征提取处理方法;掌握DTW、HMM、GMM、DNN-HMM、端到端学习等典型算法及应用;目录
语音识别技术简介
常用工具及平台
语音数据特征处理
典型算法
在线语音识别8.18.28.38.48.5
综合案例:基于端到端的中文语音识别8.6语音识别技术简介8.18.1语音识别技术简介语音识别又称自动语音识别(ASR,AutomaticSpeechRecognition),或语音转为文本(SpeechtoText,STT),或电脑语音识别(ComputerSpeechRecgnition),是一项将人类语言内容转换为机器可读格式的技术。语音识别解决的主要问题如何让机器听懂的问题,根据每个对象的语音转换为正确的文本面临的挑战声学环境、讲话风格、口音/方言、说话对象的语言识别等。8.1语音识别技术简介1.语音识别技术的发展语音识别技术的发展大致可分为三个阶段,分别为早期阶段(1980年前)、发展阶段(1980-2010)、快速应用阶段(2010之后)。早期阶段:其研究主要是围绕模仿人类说话展开。1937年HomerDudley发明的声码合成器VODER1952年Bell实验室第一个推出的命名为Audrey的语音识别设备1960年IBM公司的可以简单识别数字和数学符号的Shoebox及日本京都大学发明的可以分隔系列口语声音的识别器1970年卡耐基梅隆大学推出的HARPY语音识别系统1980年IBM开发应用在试验转录系统Tangora中的语音转文本的工具8.1语音识别技术简介1.语音识别技术的发展发展阶段卡耐基梅隆大学的Sphinx系统、BBN的BYBLOS系统、SRI的DECIPHER系统等。1992年美国电话电报公司(AT&T)引入Bell实验室的语音识别呼叫处理系统(VRCP)FSM库、GRM库、HMIHY系统语音识别研究也由直接模式识别(基于模版的)范式转为统计模型框架其技术发展经历了从早期小规模→中规模→大规模→超大规模的量级变化研究方法从基于声学语音学的孤立字识别→基于模版的孤立词、连接数字、连续语言识别→基于统计的连续语音识别→基于句法及语义的连续语音识别→基于语义及多模态对话的多模态识别8.1语音识别技术简介1.语音识别技术的发展语音识别技术早期和发展阶段8.1语音识别技术简介1.语音识别技术的发展快速应用阶段在2010年之后,出现了RNNs、LSTM、神经网络声学模型、隐马尔可夫混合模型、多语言深度神经网络SHL-MDNN、DNN-HMM混合模型、CTC模型(ConnectionistTemporalClassification)、基于注意力的编码器-解码器(Attention-basedEncoder-Decoder,AED)、RNN-T(RNNTransducer)等模型。目前,语音识别技术已经广泛应用在云平台、移动设备等平台,语音业务也实现了在云端平台处理和移动端的处理,如谷歌公司的VoiceFilter-Lite、云知声、讯飞听见、百度智能云语音等。同时在智能语音助手、智能音箱、智能手机、智能可穿戴、翻译机、智能车载等设备上已广泛应用。8.1语音识别技术简介2.语音识别过程和系统语音识别过程是把语音信号转化为机器可读文本的过程步骤语音信号输入(采集)预处理语音特征提取语音分类和语音识别在语音信号采集输入后,预处理步骤通常会过滤语音信号,去除不需要的噪音,或对信道失真语音进行增强,并辨析确定词的开始、结束分隔位置,然后转换为特征向量,进行特征提取,接着把特征向量输入声学模型,声学模型打分,根据进行语音分类和识别。语音识别过程8.1语音识别技术简介2.语音识别过程和系统一个完整的语音识别系统架构通常会包含四个模块,分别为:语音信号处理提取模块(把语音信号处理和特征提取作为一个模块)声学模型模块语言模型模块解码搜索模块语音信号输入(采集)常用的声学特征处理方法有线性预测系数(LinearPredictiveCoefficient,LPC)、倒谱系数、梅尔频率倒谱系数(Mel-FrequencyCepstralCoefficients,MFCCs)和感知线性预测(PerceptualLinearPredictive,PLP)等声学模型模块结合声学和发音辅助知识,以提取的特征为模型输入,输出声学模型评分。语言模型以转化的文本为输入,学习词之间关系,输出词序列的评分。解码搜索模块综合声学模型评分和语言模型评分,最后输出识别结果。8.1语音识别技术简介2.语音识别过程和系统语音识别系统的性能影响因素不同的说话人、说话方式、环境噪音、传输信道等。语音识别系统的分类根据语音声源及语音对象呈现方式的不同,可以分为不同的类型按语音对象说话方式的不同,可以分为独立字词语音识别、连接词语音识别、连续语音识别。按语音声源的不同,可以分为特定对象语音识别、非特定对象语音识别、多目标对象语音识别。根据处理任务的不同,分为按关键词检测(电话监听、自动接听)、声纹检测、语种检测、连续语音检测等。按词汇量大小可分词汇量小(1~20个词),中等(20~l00个词),大(100词以上);讲话人范围分特定某个人、某些人;非特定的,男、女或儿童等;8.1语音识别技术简介2.语音识别过程和系统语音识别技术应用场景其主要应用场景有人与人、人与物体、物体与物体之间三个类型,如人与人的交流有翻译系统,人与物体的应用场景有:车载智能语音智能语音助手垂直行业领域应用:如智慧医疗-语音电子病历系统、向导诊机器人、问诊小程序、诊后随访系统、住院病房管理系统、临床决策支持系统等设备或系统的入口。其在设备上的应用如图所示。目录
语音识别技术简介
常用工具及平台
语音数据特征处理
典型算法
在线语音识别8.18.28.38.48.5
综合案例:基于端到端的中文语音识别8.6常用工具及平台8.2◎语音识别工具◎语音识别平台8.2.1语音识别工具语音识别工具根据应用类别、集成应用的不同,通常可以分为语音识别开源工具包语音转文字工具语音识别综合应用平台等。根据是否需要连接网络,分为在线语音识别和离线语音识别。常用的训练数据集有语音数据集和音频事件/音乐数据集。特点目前多任务、多语言、端到端应用处理,已经成为语音识别开源工具包的典型特点。应用场景广泛嵌入在移动端智能手机软件中,如微信、输入法等,或者集成到云端综合应用,让用户通过API远程调用提供服务,已成普通产品常用商业应用模式。8.2.1语音识别工具当前,广泛应用的语音识别开源工具包有许多,如ESPnet、Kaldi、wenet、speechbrain、htk、openasr、openspeech、lingvo、fairseq、athena、deepspeech、wav2letter、CAT、warp-transducer、sctk、librosa、Vosk、torchaudio等1.ESPnetESPnet(End-to-endspeechprocessingtoolkit)是一个基于Python语言开发的端到端的语音识别工具包,它采用了连接时序分类(CTC)和基于注意力的编码解码网络架构,延续Kaldi工具包的数据处理特征提取风格。8.2.1语音识别工具1.ESPnet其标准的流程包含了具有Kaldi风格的数据准备、特征提取、数据转换、语言模型训练、端到端自动语音识别训练、识别及打分共6个步骤ESPnet已作为深度学习引擎被嵌入进Chainer系统和PyTorch系统。8.2.1语音识别工具1.ESPnetESPnet基础上,延伸发展出了ESPnet-SE、ESPnet-SE++等工具包,ESPnet-SE在ESPnet的基础上,增加了语音增强和语音分离,在数据方面可同时处理单个和多个说话对象、时域和频域、单个和多个声音通道、单个声音源和多个声音源、无回声混响环境,引入支持TasNet(time-domainaudioseparationnetwork)、DPRNN(dual-pathRNN)、时频掩膜(T-Fmasking)等时域模型和频域模型。ESPnet-SE++与ESPnet-SE相比,除了增加了新的模型、损失函数和训练方法之外,还综合了语音识别(ASR)、声纹识别/说话人识别(SD)、语音翻译(ST)、口语理解(SLU)等ESPnet-SE++语音处理流程8.2.1语音识别工具2.KaldiKaldi是基于C++语言的开源语音识别工具包,当前最新版本为5.5.636,它包含通用的语音识别算法、脚本,Kaldi支持的声学模型有LDAHLDA、MLLT/STC、GMM、DNN、TDNN、Chain等,内部嵌入了OpenFst库,支持基于BLAS、LAPACK、OpenBLAS和MKL的线性代数运算库,以及众多扩展工具,如SRILM,Sph2pipe等。
ESPnet-SE++语音处理流程8.2.1语音识别工具3.WeNetWeNet是一个开源的端到端的语音识别工具包,采用了支持流式和非流式的统一混合模型CTC/attention架构
WeNet2.0提供了U2++、热词、统一语言模型、超大规模数据训练支持,除了前向的attentiondecoder之外,增加了后向的attentiondecoder,形成了SharedEncoder(共享编码)、CTCDecoder(连接时序分类解码)和AttentionDecoder(注意力解码)三部分组成的模型架构。WeNet框架结构8.2.1语音识别工具工具名称编程语言训练语言模型活跃度地址CMUSphinxC,Java,Python,其他英语,中文强https://cmusphinx.github.io/KaldiC++,Python,Java,其他英文,中文强/HTKC、Python英文较强https://htk.eng.cam.ac.uk/JuliusC日文,英文较强/julius-speech/juliusWav2Letter++C++英文较强/flashlight/wav2letterWeNetC++,Python,其他英文,中文强/wenet-e2e/wenetSpeechBrainPython,Perl,其他英文,中文,法文,意大利语等强/speechbrain/speechbrain语音识别工具注:除了表中语音识别工具之外,还有Fairseq、Lingvo、deepspeech、torchaudio、Openasr、openspeech、athena、CAT、librosa、warp-transducer等Wenet端到端语音识别、wetts端到端语音合成、wekws端到端唤醒、wespeaker端到端说话人项目8.2.2语音识别平台最新的典型的多语言语音识别平台有Whisper、Voicebox、DALL-E、VALL-E等1.
WhisperWhisper是由OpenAI于2022年9月发布的自动语音识别神经网络,它的架构采用端到端的编码解码Transformer(encoder-decoderTransformer),其执行流程:输入的语音被分割为30秒的语音块,转换为log-Melspectrogram特征(音频信号的频谱图特征),接着传输进编码器。编码器用来训练预测相应的文本内容,并结合位置标记,进行解码完成语言识别、短语水平的时间戳、多语言的转换等任务Whisper框架8.2.2语音识别平台1.
Whisper多任务训练格式8.2.2语音识别平台
2.
VALL-EVALL-E是由微软于2023年推出的文本到语音合成的单语言模型方法,它可以用时长仅为3秒的未见过的注册者的语音记录作为提示,合成高质量的个性化语音。目前DALL-E已经升级到DALL-E2版本。与DALL-E相比,VALL-E从语音的自然流畅性和说话者的相似性方面,都超过了它及以往的零样本文本到语音的合成系统(TTS)。同时,还能在合成中保留说话者的情绪和声学提示的声学环境。VALL-EX是在VALL-E的延伸,主要是解决多语言问题,是多语言条件编解码器语言模型,通过使用源语言语音和目标语言文本作为提示来预测目标语言语音的声学标记序列。VALL-EX可应用于零样本跨语言文本到语音合成和零样本语音到语音翻译任务。8.2.2语音识别平台
2.
VALL-EVALL-E和VALL-EX的模型框架8.2.2语音识别平台
3.
VoiceboxVoicebox是由Meta公司于2023年6月推出的语音生成式AI系统模型,Voicebox本质上是一个文本引导的非自回归流匹配模型。通过给定音频上下文和文本,在单语言或跨语言(英语、法语、西班牙语、德语、波兰语和葡萄牙语六种语言)的零样本文本上完成语音合成、噪声去除、声音编辑、风格转换等生成。其支持的主要功能有:零样本文本到语音合成:语音编辑及噪音消除:跨语言风格迁移不同语音采样8.2.2语音识别平台
3.
VoiceboxVoicebox与上述的VALL-E相比:1)功能方面增加了噪音消除、部分语音编辑;2)可理解性和音频相似性都有了大幅改进提升,速度提高了近20倍。3)Voicebox可以使用过去和未来的上下文,用于生成中间片段的编辑,更快的生成语音;4)Voicebox解耦连续时间模型和音频模型,实现细粒度的对齐控制Voicebox平台学习框架目录
语音识别技术简介
常用工具及平台
语音数据特征处理
典型算法
在线语音识别8.18.28.38.48.5
综合案例:基于端到端的中文语音识别8.6语音数据特征处理8.38.3语音数据特征处理语音数据来源于语音信号,在语音数据处理之前,通常需要对语音信号进行采集、存储、分析等工作,而语音信号的采集主要根据它的频域和时域特点进行设计,在频域内,语音信号的频谱一般为20Hz-3400Hz之间,人讲话的频率主要集中在区段1-3000Hz。
语音信号在时域内,具有短时性特点。
频域以频率为自变量,观测频率信号的幅度(振幅)为纵轴,而时域是以时间为自变量,信号变化(振幅)为纵轴,语音信号在频域表现为多个不同频率、振幅信号组成。8.3语音数据特征处理
1.
语音信号预处理语音数据的预处理通常包含语音信号采集、去除噪音、语音分隔等工作。语音信号采集中采样率、量化位数、通道数、语音长度等通常是关键指标,通过基于奈奎斯特(Nyquist)定理的采样将原始信号中的信息完整保留,并进行量化处理。常见的采样率有8kHz、16kHz、44.1kHz、48kHz,采样率越高,采集语音的质量和精度就越高,类似的量化位数指标有8位、16位、24位等,量化位数越高,同样质量和精度就越高。在对语音信号采集中,由于信号传输衰减失真、非线性、非平稳、时变等特性,一般需要对其进行预加重、分帧、加窗口等操作。8.3语音数据特征处理
1.
语音信号预处理预加重是在信号发送端对输入信号高频分量进行补偿的信号处理方式预加重通常用时域技术或频域技术实现。分帧则是利用语音信号在一个短时范围内(通常为小于50毫秒),基本保持不变的时变特性,进行按祯分取信号,同时为了使得语音祯之间有一个平滑的过渡,在相邻祯之间有一定的重叠,也就是通过相邻两祯的起始位置的时间差即祯移来完成加窗操作的目的是为了避免信号被非周期截断产生的新的频率成分,从而难以找到信号的真实频率,即缓解频率泄漏。加窗操作常用的方法有矩形窗、汉明窗(Hamming)、汉宁窗(Hanning)、布莱克曼窗(Blackman)。8.3语音数据特征处理
2.
语音信号分析语音信号分析是将语音信号进行分解,分解为分量叠加,然后对分量情况进行分析通常语音信号分析方法有时域分析、频域分析、倒谱分析等时域分析以波形为基础进行分析,常用的方法有短时能量、短时过零率、短时自相关函数、短时平均幅度差函数等。频域分析则是将时域信号变换到频域,进行分析频域特征,常用的频域分析方法有带通滤波器组法、傅里叶变换法、线性预测法等。倒谱分析是获取语音倒谱特征参数的过程,通常以同态处理来实现,即将非线性问题转化为线性问题来处理,通常分为乘积同态信号处理和卷积同态信号处理。8.3语音数据特征处理
3.
语音声学特征处理语音数据声学特征的提取过程如图所示,语音数据经过预加重、分帧、加窗预处理操作后,然后经过傅里叶变换分析,获取振幅谱,然后经过系列操作,分别可获取语谱图特征、Fbank特征、MFCC特征、IMFCC特征、LFCC特征、PLP特征、CQCC特征等。语音特征提取过程8.3语音数据特征处理
3.
语音声学特征处理1)语谱图特征:是一种通过语谱图数据分析提取的信号特征,它涵盖了三个维度的信息:频率,时间、幅度值大小,其横坐标为时间,纵坐标是频率,坐标点值表示语音数据能量,语音能量越强,则颜色表示越深。通过语谱图可以观察音素特征、共振峰特征等。2)Fbank特征:是基于梅尔滤波器组的特征,如图所示,它的提取流程是将信号进行预加重、分帧、加窗(常用汉明窗,α=0.46164)处理后,然后进行短时傅里叶变换(STFT),获得振幅谱;接着求取频谱平方,获得每个滤波器(Mel滤波器)输出的功率谱;最后将每个滤波器的输出取对数,计算后对应频带的对数功率谱,从而得到Fbank特征。3)MFCC特征:MFCC是Mel频率倒谱系数(Mel-scaleFrequencyCepstralCoefficients)的英文缩写,它是在Fbank特征提取的基础上,通过离散余弦变化(DCT),去除各维信号之间的相关性,将信号映射到低维空间,并得到多个MFCC系数,其从信号转换详细函数生成声学模型的图解如图所示。8.3语音数据特征处理
3.
语音声学特征处理
基于MFCC特征生成语音模型过程8.3语音数据特征处理
3.
语音声学特征处理4)PLP特征:是感知线性预测(PerceptualLinearPredictive)的英文缩写,它通过利用等响度预加重以及强度-响度转换(立方根压缩),以及离散傅里叶变换的逆变换(IDFT)、线性预测自回归模型获得倒谱系数。在经过预加重、分帧、加窗、离散傅里叶变换后,取短时语音频谱的实部和虚部的平方和,计算幅度平方后,得到短时功率谱。接着通过临界频带分析处理、等响度预加重、(信号)强度-(听觉)响度转换、离散傅里叶反变换、线性预测(LP)等流程,最终获得PLP特征。5)CQCC特征:是常数倒谱系数(ConstantQCepstralCoefficients)的英文缩写,它是针对STFT在时频分析中时频分辨率均匀缺陷而提出基于常量Q变换(CQT)的一种特征提取方法CQCC特征提取过程目录
语音识别技术简介
常用工具及平台
语音数据特征处理
典型算法
在线语音识别8.18.28.38.48.5
综合案例:基于端到端的中文语音识别8.6典型算法8.48.4典型算法
欧式距离与DTW距离8.4典型算法
序列X和Y对齐过程8.4典型算法
HMM概率及状态8.4典型算法
HMM示例8.4典型算法2.HMM(隐马尔可夫模型)
在HMM模型中,其基本三个问题是:1)给定HMM,如何估计观测序列的概率,即模型评估问题;2)给定HMM和观察序列,找出最优的状态序列,即寻找最优路径问题;3)给定HMM和观察序列,借助状态占用概率,寻找最优的模型参数,即模型训练参数学习问题。传统HMM语音识别建模过程8.4典型算法
维特比算法示例8.4典型算法
8.4典型算法
8.4典型算法4.DNN-HMM模型DNN-HMM是DeepNeuralNetworks-HiddenMarkovModel的缩写,通过利用DNN替换GMM充当声音模型,来评估概率密度函数,对输入语音信号的观察概率进行建模,进行词/音节的分类。如图所示,DNN用来训练预测给定语音观察状态下的后验概率,即DNN每个输出神经单元用来训练评估连续密度HMM状态的后验概率。DNN-HMM训练之前,通常需要先训练GMM-HMM,以实现祯与状态的对齐操作。其步骤:特征提取→GMM-HMM的单音素训练→GMM-HMM的三音素训练→维特比算法对齐→祯语音在DNN神经单元目标输出标签→DNN-HMM训练(正向传播,反向传播)。DNN-HMM基本架构DNN-HMMGMM-HMM考虑短词之间的关联假设输入词没有关联没有概率分布假设假设GMM为概率密度函数在生成分布中进行判别训练生成分布中没有进行判别训练祯层级上使用判别式语音模型,有监督学习差的判别-最大似然估计,无监督学习高性能低性能8.4典型算法
CTC算法输入词“team”的路径示例8.4典型算法
AED模型结构8.4典型算法
RNN-T基本结构目录
语音识别技术简介
常用工具及平台
语音数据特征处理
典型算法
在线语音识别8.18.28.38.48.5
综合案例:基于端到端的中文语音识别8.6在线语音识别8.5◎音频流识别◎文字转语音◎视频字幕文本生成8.5.1在线语音识别在线语音识别已经成为一种常见的应用模式。从应用端其通常有PC客户端、移动APP端(Android版和iPhone版)、小程序、云服务等。从操作系统来分,有基于Windows版本和基于MAC的版本。常见的平台有讯飞听见、百度语音、思比驰、云知声、腾讯语音、谷歌语音、阿里智能语音交互、微软语音识别等。从基于嵌入式芯片开发来分,有云知声蜂鸟芯片、百度鸿鹄语音芯片、科大讯飞智能离线语音模块、太行系列芯片、阿里语音芯片等。从基于开源的语音识别库来分,有DeepSpeech、Kaldi、Julius、Wav2Letter++、Whisper等8.5.1在线语音识别
音频流识别分为实时和非实时两种方法,实时音频流识别属于流式语音识别,它是在处理音频流的过程中,实时返回识别结果。而非实时音频识别属于非流式识别,则是在处理完整个音频后,才返回结果。流式语音识别根据持续接受音频流进行识别,并根据已经接收到的部分语音,计算、获取对应的后验概率最大的标志序列。使用MASR库进行音频流识别,在本地使用Anaconda创建Python3.8的虚拟环境,创建、激活命令如下:condacreate-nspeechpython=3.8//创建虚拟环境condaactivatespeech//激活虚拟环境接着安装opencv和安装Pytorch1.13.1的GPU版本:condainstall-cconda-forgeopencvcondainstallpytorch==1.13.1torchvision==0.14.1torchaudio==0.13.1pytorch-cuda=11.6-cpytorch-cnvidia源码安装MASR库,如下:8.5.1在线语音识别进行短语音和长语音识别,代码如下://短语音识别调用frommasr.predictimportMASRPredictor
predictor=MASRPredictor(model='conformer_streaming_fbank_aishell')
speech_path='bcpl/example_s.wav'result=predictor.predict(audio_data=speech_path,use_pun=False)score,text=result['score'],result['text']print(f"识别结果:{text},打分:{int(score)}")
//长语音识别调用frommasr.predictimportMASRPredictor
predictor=MASRPredictor(model='conformer_streaming_fbank_aishell')
speech_path='bcpl/example_l.wav'result=predictor.predict_long(audio_data=speech_path,use_pun=False)score,text=result['score'],result['text']print(f"识别结果:{text},打分:{score}")8.5.2文字转语音文本转语音(Text-To-Speech,TTS)属于语音合成应用,是将一段文字转换为自然语音片段,其在视觉障碍领域有着重要的应用,常见的开源工具有PaddleSpeech、DeepSpeech、DeepSpeech2、Kaldi、Bark、MARY、OpenTTS、eSpeak、Flite等。在上述的PaddleSpeech中,文本转语音主要包含三个步骤,第一步是先把文字转为字符或单字音节,然后第二步通过语音模型,把字符或单字音节转为语音特征,如mel语谱特征,最后第三步是把语音特征转化为语音波的形式。PaddleSpeech文本生成语音的命令如下:paddlespeechtts--input"你好,欢迎使用文字转语音框架学习!"--outputoutput.wav
以Bark为例,简要介绍文字转语音方法,Bark支持文本生成多语言语音,支持CPUandGPU(pytorch2.0+,CUDA11.7andCUDA12.0)。BarkTransformers库安装命令如下:pipinstallgit+https://github.com/huggingface/transformers.git8.5.2文字转语音Bark文本生成语音代码如下:fromtransformersimportAutoProcessor,BarkModelprocessor=AutoProcessor.from_pretrained("suno/bark")model=BarkModel.from_pretrained("suno/bark")voice_preset="v2/en_speaker_6"inputs=processor("welcome,ThisisBCPLspeechclass",voice_preset=voice_preset)audio_array=model.generate(**inputs)audio_array=audio_array.cpu().numpy().squeeze()8.5.3视频字幕文本生成视频字幕文本生成是通过音频采样、视频分析,将音频信号内容转为文本的处理方法。常见的开源工具有auto_ai_subtitle、VideoSrt、Video-subtitle-generator(vsg)等。下面以Video-subtitle-generator(vsg)为例,简要介绍视频字幕文本生成过程。1)如前所述,创建后虚拟环境后,使用命令安装相关依赖包:pipinstall-rrequirements.txt2)创建代码,生成提取视频字幕(详见书p293)3)执行命令,生成视频字幕文字,命令如下:python./main.py./test/test_cn.mp4-lzh-cn4)运行结果生成字幕文字文件目录
语音识别技术简介
常用工具及平台
语音数据特征处理
典型算法
在线语音识别8.18.28.38.48.5
综合案例:基于端到端的中文语音识别8.6综合案例:基于End-to-End(E2E)端到端的中文语音识别8.68.6综合案例:基于End-to-End(E2E)端到端的中文语音识别基于端到端(E2E)的语音识别系统主要包含三部分:输入端→端到端ASR模型→输出端,如图所示,它已经把传统语音识别中的声学模型、语言模型、发音字典封装为端到端ASR模型。端到端的语音识别系统有许多,常用的模型,如Transformer、GPT、CTC、RNN-T、TDNN、Conformer、Res2Net、ResNetSE、CAMPPlus、AudioLM、squeezeformer、deepspeech2等,都已封装到TensFlow、Pytorch、PaddlePaddle、Kaldi等不同平台。本节以单独端到端ASR模型处理为例进行介绍语音识别过程。传统语音识别与端到端语音识别8.6综合案例:基于End-to-End(E2E)端到端的中文语音识别1)数据准备阶段:下载数据AISHELL数据集data_aishell.tgz,网址:/33/。创建提取数据和创建audio文件列表的代码文件extract_aishell.py和prepare_data.py,命令如下:pythonextract_aishell.py./data_aishell.tgzpythonprepare_data.py${DIRECTORY_OF_AISHELL}2)预处理阶段:从语音波中提取fbank特征,保存为.npy格式文件,preprocess.py处理过程主要代码详见p302。3)设计模型阶段:主要分为模型结构设计和损失函数设计,模型既可以为单一的模型,也可以为多个模型混合,如encoding阶段和decoding阶段采用不同的模型,损失函数设计可以选用softmax损失函数(softmaxloss),也可以直接利用三元组损失函数(Tripletloss)、交叉熵损失函数、CTC损失函数其他损失函数。如使用torch定义一个Seqence2Seqence模型。8.6综合案例:基于End-to-End(E2E)端到端的中文语音识别4)训练阶段:训练可采用不同的策略,设置模型初始超参数,学习模型参数,如预训练、最小学习率、阈值等,代码详见工程附件源代码。5)评价模型:评价标准可采用等错误率(EER)、字符错误率(CER)、字错误率(WER)等指标评价,详细源代码见工程附件。6)测试模型,进行预测,运行结果示例如下:本章小结语音识别处理基础语音技术的发展常用工具ESPnet、Kaldi、wenet平台Whisper、Voicebox、DALL-E、VALL-E语音识别技术典型算法端到端学习文字转语音音视频流识别语音识别应用及实际操作案例习题概念题什么是智能语音识别,其成熟应用领域场景有哪些?语音识别主要任务是什么,其识别过程包含哪些步骤?什么是语音声学特征?其处理方法有哪些?什么是大模型端到端语音识别学习?操作题设计基于大模型GPT的语音识别模型。要求如下:(1)能在少样本上学习;(2)支持实时在线声音识别检测。参考文献JuangBH,RabinerLR.AutomaticSpeechRecognition-ABriefHistoryoftheTechnologyDevelopment[J].encyclopediaoflanguage&linguistics,2005.FuruiS.50yearsofprogressin
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026汽车零部件行业市场拓展与供应链优化投资竞争分析报告
- 2026生化行业市场发展现状与投资评估规划分析研究报告
- 2026船舶尾轴衬套海水腐蚀防护技术发展现状调研
- 2026日本智能机器人工业市场动态竞争格局与投资前景深度剖析研究报告
- 2026中国养老服务投资行业市场现状分析及投资发展评估报告
- 2026食品加工智能化系统市场潜在发展深度研究及投资分析
- 2026汽车后市场服务子板块分析与售后链投资研究
- 2026中国兽药行业市场供需分析及政策监管解读研究报告
- 2026生物医用材料市场现状与需求分析及投资机会规划研究报告
- 2026中国乡村旅游产业开发与生态保护分析评估报告
- QC/T 1231-2025乘用车电磁阀式连续阻尼控制减振器总成
- 医院耗材试剂采购制度及流程
- 城乡融合发展政策体系研究课题申报书
- dcs系统维护考核制度
- 审计法和内部审计准则知识竞赛试题(含答案)
- 新版胖东来考试题库及答案真题题库
- 基于血栓弹力图的骨科患者围手术期凝血功能管理方案
- 2025甘肃金川集团股份有限公司财务和审计一般管理岗位成熟人才社会招聘27人笔试历年难易错考点试卷带答案解析试卷3套
- 2025年怀化职业技术学院单招职业技能考试题库及参考答案详解培优b卷
- 电工施工应急预案
- 抽真空系统培训
评论
0/150
提交评论