人工智能-语音识别技术.ppt

上传人：闯*** IP属地：广东上传时间：2020-03-31 格式：PPT 页数：18 大小：1.02MB 积分：20 举报 版权申诉

已阅读5页，还剩13页未读，继续免费阅读

版权说明：本文档由用户提供并上传，收益归属内容提供方，若内容存在侵权，请进行举报或认领

文档简介

人工智能语音识别技术什么是语音识别技术与机器进行语音交流让机器明白你说什么这是人们长期以来梦寐以求的事情语音识别技术就是让机器通过识别和理解过程把语音信号转变为相应的文本或命令的高技术语音识别技术主要包括特征提取技术模式匹配准则及模型训练技术三个方面语音识别技术车联网也得到了充分的引用例如在翼卡车联网中只需按一键通客服人员口述即可设置目的地直接导航安全便捷两款语音机器人 Siri Cortana 语音识别的实现 1 首先我们知道声音实际上是一种波常见的mp3 wmv等格式都是压缩格式必须转成非压缩的纯波形文件来处理比如WindowsPCM文件也就是俗称的wav文件 wav文件里存储的除了一个文件头以外就是声音波形的一个个点了下图是一个波形的示例语音识别的实现 2 在开始语音识别之前有时需要把首尾端的静音切除降低对后续步骤造成的干扰这个静音切除的操作一般称为VAD 需要用到信号处理的一些技术要对声音进行分析需要对声音分帧也就是把声音切开成一小段一小段每小段称为一帧分帧操作一般不是简单的切开而是使用移动窗函数来实现这里不详述帧与帧之间一般是有交叠的就像下图这样语音识别的实现 3 图中每帧的长度为25毫秒每两帧之间有25 10 15毫秒的交叠我们称为以帧长25ms 帧移10ms分帧分帧后语音就变成了很多小段但波形在时域上几乎没有描述能力因此必须将波形作变换常见的一种变换方法是提取MFCC特征根据人耳的生理特性把每一帧波形变成一个多维向量可以简单地理解为这个向量包含了这帧语音的内容信息这个过程叫做声学特征提取实际应用中这一步有很多细节声学特征也不止有MFCC这一种具体这里不讲至此声音就成了一个12行假设声学特征是12维 N列的一个矩阵称之为观察序列这里N为总帧数观察序列如下图所示图中每一帧都用一个12维的向量表示色块的颜色深浅表示向量值的大小语音识别的实现 4 接下来就要介绍怎样把这个矩阵变成文本了首先要介绍两个概念音素单词的发音由音素构成对英语一种常用的音素集是卡内基梅隆大学的一套由39个音素构成的音素集参见TheCMUPronouncingDictionary 汉语一般直接用全部声母和韵母作为音素集另外汉语识别还分有调无调不详述状态这里理解成比音素更细致的语音单位就行啦通常把一个音素划分成3个状态语音识别是怎么工作的呢实际上一点都不神秘无非是第一步把帧识别成状态难点第二步把状态组合成音素第三步把音素组合成单词语音识别的实现 5 图中每个小竖条代表一帧若干帧语音对应一个状态每三个状态组合成一个音素若干个音素组合成一个单词也就是说只要知道每帧语音对应哪个状态了语音识别的结果也就出来了图中每个小竖条代表一帧若干帧语音对应一个状态每三个状态组合成一个音素若干个音素组合成一个单词也就是说只要知道每帧语音对应哪个状态了语音识别的结果也就出来了那每帧音素对应哪个状态呢有个容易想到的办法看某帧对应哪个状态的概率最大那这帧就属于哪个状态比如下面的示意图这帧对应S3状态的概率最大因此就让这帧属于S3状态语音识别的实现 6 那这些用到的概率从哪里读取呢有个叫声学模型的东西里面存了一大堆参数通过这些参数就可以知道帧和状态对应的概率获取这一大堆参数的方法叫做训练需要使用巨大数量的语音数据训练的方法比较繁琐这里不讲但这样做有一个问题每一帧都会得到一个状态号最后整个语音就会得到一堆乱七八糟的状态号相邻两帧间的状态号基本都不相同假设语音有1000帧每帧对应1个状态每3个状态组合成一个音素那么大概会组合成300个音素但这段语音其实根本没有这么多音素如果真这么做得到的状态号可能根本无法组合成音素实际上相邻帧的状态应该大多数都是相同的才合理因为每帧很短解决这个问题的常用方法就是使用隐马尔可夫模型 HiddenMarkovModel HMM 这东西听起来好像很高深的样子实际上用起来很简单第一步构建一个状态网络第二步从状态网络中寻找与声音最匹配的路径这样就把结果限制在预先设定的网络中避免了刚才说到的问题当然也带来一个局限比如你设定的网络里只包含了今天晴天和今天下雨两个句子的状态路径那么不管说些什么识别出的结果必然是这两个句子中的一句语音识别的实现 7 那如果想识别任意文本呢把这个网络搭得足够大包含任意文本的路径就可以了但这个网络越大想要达到比较好的识别准确率就越难所以要根据实际任务的需求合理选择网络大小和结构搭建状态网络是由单词级网络展开成音素网络再展开成状态网络语音识别过程其实就是在状态网络中搜索一条最佳路径语音对应这条路径的概率最大这称之为解码路径搜索的算法是一种动态规划剪枝的算法称之为Viterbi算法用于寻找全局最优路径语音识别的实现 8 这里所说的累积概率由三部分构成分别是观察概率每帧和每个状态对应的概率转移概率每个状态转移到自身或转移到下个状态的概率语言概率根据语言统计规律得到的概率其中前两种概率从声学模型中获取最后一种概率从语言模型中获取语言模型是使用大量的文本训练出来的可以利用某门语言本身的统计规律来帮助提升识别正确率语言模型很重要如果不使用语言模型当状态网络较大时识别出的结果基本是一团乱麻声学模型声学模型是把语音转化为声学表示的输出即找到给定的语音源于某个声学符号的概率对于声学符号最直接的表达方式是词组但是在训练数据量不充分的情况下很难得到一个好的模型词组是由多个音素的连续发音构成另外音素不但有清晰的定义而且数量有限因而在语音识别中通常把声学模型转换成了一个语音序列到发音序列音素的模型和一个发音序列到输出文字序列的字典需要注意的是由于人类发声器官运动的连续性以及某些语言中特定的拼读习惯会导致音素的发音受到前后音素的影响为了对不同语境的音素加以区分通常使用能够考虑前后各一个音素的三音子作为建模单元另外在声学模型中可以把三音子分解为更小的颗粒状态通常一个三音子对应3个状态但是这会引起建模参数的指数增长常用的解决方案是使用决策树先对这些三音子模型进行聚类然后使用聚类的结果作为分类目标最常用的声学建模方式是隐马尔科夫模型 HMM 在HMM下状态是隐变量语音是观测值状态之间的跳转符合马尔科夫假设其中状态转移概率密度多采用几何分布建模而拟合隐变量到观测值的观测概率的模型常用高斯混合模型 GMM 传统模型GMM HMM的算法语音识别过程就是输入一段语音信号找到一串文字字或词序列的过程语音输入O o1 o2 o3 ot对应的标注W w1 w2 w3 wn这个过程一般用概率来表示用O表示语音信号用W表示文字序列则是要解决下面这个问题由贝叶斯公式展开可得由于P O W P W P O 是对每个句子进行计算的而对每个句子来说P O 是不变的所以可以改写成如下其中P O W 称做观测最大释然由声学模型计算

人人文库> 全部分类> 教育资料 > 课件下载

温馨提示

1. 本站所有资源如无特殊说明，都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
2. 本站的文档不包含任何第三方提供的附件图纸等，如果需要附件，请联系上传者。文件的所有权益归上传用户所有。
3. 本站RAR压缩包中若带图纸，网页内容里面会有图纸预览，若没有图纸预览就没有图纸。
4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
5. 人人文库网仅提供信息存储空间，仅对用户上传内容的表现方式做保护处理，对用户上传分享的文档内容本身不做任何修改或编辑，并不能对任何下载内容负责。
6. 下载文件中如有侵权或不适当内容，请与我们联系，我们立即纠正。
7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

人工智能-语音识别技术.ppt

文档简介

温馨提示

最新文档

评论

人工智能-语音识别技术.ppt

文档简介

温馨提示

最新文档

评论

相关文档