数字语音信息处理 课件全套 第1-10章 绪论-语音分离_第1页
数字语音信息处理 课件全套 第1-10章 绪论-语音分离_第2页
数字语音信息处理 课件全套 第1-10章 绪论-语音分离_第3页
数字语音信息处理 课件全套 第1-10章 绪论-语音分离_第4页
数字语音信息处理 课件全套 第1-10章 绪论-语音分离_第5页
已阅读5页,还剩493页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

我们毕业啦其实是答辩的标题地方第一章绪论1.1语音信号处理介绍语音信号处理:跨学科的综合技术基于生理、心理、语言和声学等理论以信息论、控制论和系统论为指导理论通过应用信号处理、统计分析和模式识别等现代技术手段实现语音信号的获取、分析、改善、压缩与合成等在数据通信、人工智能、场景检测、音乐处理、听力辅助等领域起着至关重要的作用。1.1语音信号处理介绍语音信号处理:极大地拓宽了人机交互模式使得人们可以通过语音与机器进行交互1.2语音信号处理应用语音信号处理:语音信号处理已经成为现代通信、计算机科学、语言学和工程技术等领域中一个不可或缺的分支。语音信号处理的基本理论基础涉及信号采集、分析、增强、编码和识别等多个方面。这些技术为后续的应用提供了支持,每一项技术都在不断进化,以适应不断变化的应用需求和提高处理效率。1.2语音信号处理应用语音编码:

将语音信号转换为数字信号(或压缩数字信号)的技术,核心目标是在保证语音质量的前提下,减少数据传输或存储的带宽/空间,同时确保解码后能准确还原原始语音。它是语音通信(如电话、VoIP)、语音存储(如语音消息)、实时交互等场景的基础技术。1.2语音信号处理应用语音编码基本原理:

语音编码的过程分为编码和解码编码:对模拟语音信号(经采样、量化转为数字信号后)进行分析,提取关键特征(如基音频率、共振峰、能量等),并用少量数据表示这些特征,实现压缩。解码:根据编码后的特征参数,重建语音信号,还原为可听的模拟信号。7语音编码方式分类混合编码参数编码波形编码1.2语音信号处理应用混合编码:突破了波形编码和参数编码的界限,对音频信号参数建模的同时,将原始与重建信号的误差进行编码。参数编码:通过建立语音、音频信号的产生模型,提取代表信号特征的参数进行编码。波形编码:将语音频信号视为一般波形信号来处理,直接对信号时域或频域采样值进行编码,力争使得重构信号的波形与原始信号尽可能一致。1.2语音信号处理应用语音编码核心目标:

压缩效率:通过去除语音信号中的冗余信息(如无感知的高频成分、时间相关性),降低数据速率(单位:kbps,千比特每秒)。语音质量:解码后的语音需保持清晰度、自然度,避免失真或噪声。实时性:编码/解码延迟需足够低,满足实时通信需求(如电话对话延迟需<150ms)。鲁棒性:对传输中的噪声、丢包等干扰有一定抵抗能力1.2语音信号处理应用关键技术指标:

码率:单位时间内的数据量(kbps),码率越低,压缩效率越高,但可能牺牲音质。时延:编码和解码的总延迟,实时通信要求时延<200ms。信噪比(SNR):衡量解码语音与原始语音的相似度,值越高音质越好。主观语音质量评估(如MOS分):通过人耳主观评分(1-5分,5分为最佳),更贴近实际听感。1.2语音信号处理应用应用场景:

移动通信:手机通话(如4G/5G中的AMR-WB编码,支持高清语音)。网络通信:VoIP(如Zoom、微信语音)、视频会议的语音传输。语音存储:语音信箱、语音备忘录(用低码率减少存储占用)。应急通信:卫星电话、短波通信(低码率适应窄带宽)。1.2语音信号处理应用发展趋势:

高清语音(HDVoice):采用更宽的频率范围(如7kHz以上)和更高采样率,提升音质(如AMR-WB编码,16kHz采样,码率12.2kbps)。深度学习编码:基于神经网络的端到端编码(如WaveNet编码),在低码率下实现更自然的音质,逐步替代传统模型。自适应编码:根据场景(如安静/嘈杂环境)动态调整编码策略,平衡质量与效率。

语音编码技术的发展始终围绕“更高效率、更好音质、更低时延”的目标,支撑着从传统电话到5G实时交互、元宇宙语音通信等场景的演进。1.2语音信号处理应用语音识别:目的是将人类语音信号转换为文本的技术,属于人工智能和自然语言处理的重要分支。核心目标是让计算机听懂人类语言。所涉及的领域包括:信号处理、模式识别、概率论和信息论、发声机理和听觉机理、人工智能等等。1.2语音信号处理应用语音识别步骤:

语音信号采集:通过麦克风等设备将语音转换为电信号(模拟信号)。预处理:对信号进行降噪、去除干扰、标准化等处理,提升信号质量。特征提取:将处理后的信号转换为计算机可理解的特征(如梅尔频率倒谱系数MFCC),捕捉语音的频谱特性。声学模型:通过模型(如隐马尔可夫模型HMM、深度学习中的CNN/RNN/Transformer)分析语音特征,识别音素或子词单元。语言模型:结合上下文语境(如语法、语义规则),从声学模型的结果中选择最可能的文本序列(解决同音词等歧义问题)。解码输出:最终生成对应的文本结果。1.2语音信号处理应用关键技术与发展:

传统方法:早期依赖隐马尔可夫模型(HMM)和高斯混合模型(GMM),但对复杂语音(如噪音、口音)处理能力有限。深度学习革命:2010年后,基于神经网络的方法(如循环神经网络RNN、Transformer)成为主流,显著提升了识别准确率,尤其在端到端模型(如CTC、Attention机制)中,直接从语音映射到文本,简化了流程。预训练模型:类似自然语言处理中的BERT,语音领域的预训练模型(如Wav2Vec、HuBERT)通过大规模无标注语音数据训练,进一步提升了多场景适应性。1.2语音信号处理应用主流工具与平台:

开源工具:CMUSphinx、Kaldi(传统方法)、WeNet(端到端模型)、HuggingFaceTransformers(含语音模型)。商业API:谷歌CloudSpeech-to-Text、百度语音识别、阿里云语音识别、腾讯云语音识别等,提供高准确率的现成接口。1.2语音信号处理应用说话人识别:

通过分析语音信号中的个人声学特征,来识别或验证说话人身份的技术,属于生物识别的一种。它的核心是从语音中提取“人耳听不出但机器可识别”的独特个体特征,比如发音习惯、声带结构、语速节奏等,实现“闻声识人”。1.2语音信号处理应用核心目标:

身份确认(SpeakerVerification):验证“某人是否为其声称的身份”(如“你是不是张三?”),属于“一对一”比对,常用于身份验证场景(如语音解锁)。身份识别(SpeakerIdentification):从已知的说话人集合中,确定“当前说话人是谁”(如“这声音是张三、李四还是王五?”),属于“一对多”匹配,适用于需要确认身份的场景(如会议录音自动标注发言人)1.2语音信号处理应用主要流程:

语音采集:通过麦克风获取说话人的语音。预处理:去除噪声、截取有效语音片段(如去除静音),标准化信号(如统一音量)特征提取:从语音中提取能区分不同说话人的特征,核心是声纹特征(类似指纹的语音生物特征)。常用特征包括:-梅尔频率倒谱系数(MFCC):反映声道共鸣特性(与发音器官结构相关)。-基音频率(F0):与声带振动频率相关,体现个人声线高低。-频谱特征:语音的频率分布模式,受个人发音习惯影响。模型训练与匹配:-训练:用已知说话人的语音数据训练模型,建立“声纹模板库”。-匹配:将待识别语音的特征与模板库对比,计算相似度,判断身份。-常用模型:高斯混合模型(GMM)、支持向量机(SVM)、深度学习模型(如CNN、Transformer)。1.2语音信号处理应用应用场景:

身份验证:手机解锁、支付验证(如“用语音确认付款”)、门禁系统(如通过语音打开会议室门)。安全领域:电话银行身份核实(避免密码泄露)、刑侦破案(通过录音识别嫌疑人)。个性化服务:智能音箱识别不同家庭成员,提供定制化内容(如“爸爸的歌单”“妈妈的日程”)。多媒体处理:视频会议自动区分发言人、广播/录音文件的说话人标注。1.2语音信号处理应用发展趋势:

深度学习赋能:基于神经网络的模型(如基于自监督学习的声纹模型)能自动学习更鲁棒的特征,提升复杂场景下的准确率。多模态融合:结合人脸、指纹等其他生物特征,构建更可靠的身份识别系统。抗攻击技术:通过分析语音中的生理特征(如呼吸声、发音器官运动轨迹),抵御录音或合成语音攻击1.2语音信号处理应用语音合成:(Text-to-Speech,TTS)是将文本信息转换为自然语音的技术,核心是让机器“开口说话”,生成听起来流畅、自然、接近人类发音的语音。1.2语音信号处理应用主要流程:

文本预处理:-规范化:处理数字(如“123”→“一百二十三”)、缩写(如“Mr.”→“先生”)、标点(如逗号对应短暂停顿)。-分词与语法分析:确定词语边界和句子结构(如中文分词、英文词性标注)。韵律建模:决定语音的节奏、重音、停顿和语调(即“怎么说”),让语音更自然。例如:-陈述句结尾语调平缓,疑问句结尾语调上升。-关键词(如“重要”)会重读,语速稍慢。声学合成:将文本和韵律信息转换为实际的语音波形:-拼接合成:从真人录音库中截取对应音节/词语的片段,拼接成完整语音(优点:自然度高,缺点:依赖录音库规模,灵活性低)。-参数合成:通过数学模型(如频谱参数、基音频率)生成语音(优点:灵活,可调整音色,缺点:早期自然度较低)。-深度学习合成:基于神经网络(如Tacotron、WaveNet)直接生成语音波形,能平衡自然度和灵活性,是当前主流技术。1.2语音信号处理应用应用场景:

辅助工具:为视障人群朗读文字(如电子书、网页内容)、帮助语言障碍者交流。智能交互:智能音箱(如“小爱同学”语音回复)、手机助手(如Siri播报信息)、导航软件(实时路况语音)。内容创作:自动生成视频配音(如短视频旁白)、有声书录制、电话机器人(客服自动语音应答)。个性化服务:定制明星/角色语音(如游戏角色配音、偶像语音助手)。1.2语音信号处理应用发展趋势:

超自然语音:进一步缩小与真人发音的差距,甚至达到“以假乱真”的效果。情感与风格可控:根据文本内容自动匹配情感(如新闻用严肃语气,故事用亲切语气),或支持用户自定义风格。低资源适配:针对小语种、方言,用少量数据训练出高质量模型,降低技术门槛。多模态融合:结合表情、动作生成“会说话的虚拟人”,提升交互沉浸感(如虚拟主播)。语音合成技术已深入日常生活,从早期的机械音发展到如今的自然语音,未来将更贴近人类表达习惯,成为人机交互的重要桥梁。1.2语音信号处理应用语音增强:

从含噪声的语音信号中提取或增强有效语音,同时抑制背景噪声、回声、干扰音等,提升语音质量和可懂度的技术。它是语音处理的基础技术之一,直接影响语音识别、说话人识别、语音合成等后续任务的效果。1.2语音信号处理应用核心目标:

降噪:去除环境噪声(如街道杂音、风扇声、多人交谈声)、设备噪声(如麦克风电流声)。提升可懂度:即使语音仍有残留噪声,也要保证人类或机器能清晰理解内容。保留语音特征:在降噪过程中尽量不损伤原始语音的关键特征(如音调、节奏),避免语音失真(如变得机械、模糊)。1.2语音信号处理应用基本原理:核心是区分“语音”和“噪声”的差异(如频谱分布、时间连续性),并针对性抑制噪声。常见流程包括:

噪声估计:分析信号中噪声的特性(如噪声的频谱、能量、是否平稳)。例如:-平稳噪声(如空调声):统计特性稳定,可通过静音片段估计。-非平稳噪声(如汽车鸣笛、突发声响):特性随时间变化,需动态跟踪。降噪处理:基于噪声特性设计算法抑制噪声-谱减法:在频域中用语音加噪声的频谱减去估计的噪声频谱,简单高效,但可能引入“音乐噪声”(残留的周期性杂音)。-维纳滤波:通过统计学方法估计“干净语音”的频谱,在噪声和语音失真之间找平衡,适用于平稳噪声。-子空间方法:将语音和噪声映射到不同的信号子空间,通过投影分离两者,对非平稳噪声更有效。-深度学习方法:用神经网络(如CNN、LSTM、Transformer)直接学习“含噪语音→干净语音”的映射,尤其在复杂噪声场景(如多噪声混合)中表现优异。后处理:进一步优化语音质量,如去除处理过程中产生的artifacts(如突兀的杂音)。1.2语音信号处理应用关键技术难点:

低信噪比(SNR)场景:当噪声强度接近或超过语音(如嘈杂酒吧),很难区分语音和噪声,易导致语音被过度抑制。非平稳噪声:噪声特性快速变化(如多人对话中的插话),传统算法难以实时跟踪,深度学习通过动态建模能缓解这一问题。语音失真:过度降噪可能导致语音变得“干瘪”“模糊”(如丢失辅音细节),需平衡降噪效果和语音自然度。实时性要求:在通话、实时语音识别等场景中,算法需快速处理(延迟通常要求低于100ms),对模型复杂度有严格限制。1.2语音信号处理应用发展趋势:

端到端深度学习:用更高效的神经网络架构(如轻量级模型)实现实时、高精度降噪,适配手机、耳机等终端设备。多模态融合:结合视觉信息(如说话人嘴部动作)辅助区分语音和噪声,提升复杂场景的鲁棒性。个性化增强:针对不同用户的语音特征(如声调、语速)或特定噪声环境(如办公室、交通工具)定制模型,优化效果。1.2语音信号处理应用语音分离:

(SpeechSeparation)是一项重要的语音信号处理技术,其核心目标是从包含多个说话人或背景噪声的混合语音中,将目标说话人的语音信号单独提取出来,同时抑制其他干扰信号(如其他说话人、环境噪声等)。1.2语音信号处理应用鸡尾酒会效应CocktailPartyEffect:

在嘈杂环境中,人们仍能聚焦特定声音(如对话)‌的认知现象,核心是大脑对“目标声音”的选择性关注与干扰声的抑制。科学原理与认知机制‌听觉注意与选择性聚焦‌:大脑通过听觉系统对目标声音(如对话)进行优先处理,同时抑制背景噪音(如音乐、其他交谈),实现“目标识别”。‌神经科学基础‌:研究表明,大脑听觉皮层、颞叶等区域参与声音分离与注意力分配,是“筛选”关键信息的核心环节。1.2语音信号处理应用语音分离:

(SpeechSeparation)是一项重要的语音信号处理技术,其核心目标是从包含多个说话人或背景噪声的混合语音中,将目标说话人的语音信号单独提取出来,同时抑制其他干扰信号(如其他说话人、环境噪声等)。1.2语音信号处理应用核心任务:

分离混合语音中的不同说话人(多说话人分离)。去除背景噪声,保留目标语音(语音去噪,可视为单说话人+噪声的分离)。适用于单声道(单麦克风)或多声道(多麦克风阵列)场景,其中单声道分离难度更高。1.2语音信号处理应用应用场景:

语音通信:消除电话、视频会议中的背景噪声或多人说话干扰。语音识别辅助:提升嘈杂环境下语音识别系统的准确率。音频编辑:从混合录音中提取特定人声,用于podcast、影视后期等。助听设备:帮助听障人士在复杂环境中聚焦目标声音。安防监听:从监控音频中分离关键说话人声音1.2语音信号处理应用关键技术:

传统方法-基于信号处理:如傅里叶变换、小波变换,结合谱减法(抑制噪声)、波束形成(多麦克风空间滤波)等。-局限性:依赖先验假设(如噪声平稳性),复杂场景下效果差。深度学习方法(主流)-端到端模型:直接输入混合语音,输出分离后的语音,如基于循环神经网络(RNN)、卷积神经网络(CNN)、Transformer的模型。-代表性模型:-Conv-TasNet:用卷积网络捕获局部特征,通过时间-频率掩码分离语音。-DPRNN:引入双路径RNN,同时建模局部和全局时序依赖。-分离与识别结合:利用说话人嵌入(如x-vector)区分不同说话人特征,提升分离精度。1.2语音信号处理应用发展趋势:

结合自监督学习(无需大量标注数据)提升泛化能力。融合多模态信息(如唇动视频)辅助分离。轻量化模型设计,适配移动端设备。我们毕业啦其实是答辩的标题地方第二章语音产生与听觉感知北京工业大学38目录2心理声学原理1语音产生2.1语音产生语音的产生过程:肺部气流的形成(发声动力)、声源的产生(声带振动)以及语音的形成(声道共鸣)三部分。肺部通过呼吸作用将外界空气吸入体内,当人体开始说话时,肺部的肌肉收缩迫使空气流出。流出的空气经气管进入喉部,到达声带时引起声带振动产生了声音。振动的声带将声音向上传入由咽腔、口腔、鼻腔等组成的声道。声道能够对声音频谱中的一些频率进行加强或减弱。声道的大小和形状随着发音器官的活动而改变,引起声道的共鸣性质发生变化,产生不同的语音音调和音色,进而形成语音信号。最后,语音从唇或鼻辐射到外界,经过外界传导被人耳感知。2.1.1发音器官人类用来产生语音的发音器官:发声器官和构音器官两部分。发声器官由肺部和喉部构成,用于产生声音。其中,肺部的呼吸作用形成气流,气流引起喉部的声带振动而发声。通过协同调整肺部和喉部的运动,能够变换声音的音调、响度和音质,为进一步形成语音特征奠定基础。2.1.1发音器官人类用来产生语音的发音器官:发声器官和构音器官两部分。构音器官由上下颚、舌、唇、软腭等构成,用于对声音进行频谱变换,以产生语音。其中,相互邻近的构音器官共同构成口腔、咽腔、鼻腔等共鸣腔,并形成声道。在声道中,从喉部传来的声音被不断地反射和增强引发共振,改变原始声音的频谱,形成语音信号。当发音器官进行不同活动时,声道形状变化,由此形成元音和辅音特征。2.1.2发音原理元音的产生:元音是发音时气流通过口腔不受阻碍发出的音气流从肺部通过声门冲击声带,使声带发出均匀振动,然后气流不受阻碍地通过口腔发出不同的语音。元音的产生是发声和构音机制共同作用的结果。发声和构音都是由物体振动产生声波,但二者的区别在于,发声是在气流推动下利用喉部的声带振动产生声源,而构音是利用声门以上声道中的共振构成语音。“声源-滤波器”理论是解释语音产生过程的一个重要概念。其中,喉部的声带作为声源发生器发出声带声源,声道则作为声学滤波器对声源声音进行调制以构成语音,最终从唇辐射到外部空间。2.1.2发音原理元音的产生:元音是发音时气流通过口腔不受阻碍发出的音声带在人脑指令的控制下通过喉部肌肉的收缩打开或闭合。呼吸时,声带打开,空气无任何阻力地通过声门。发声时,大脑通过神经系统向声带肌肉发出指令,声带肌肉开始收缩,拉动声带使声门关闭。当声门完全闭合时,从肺部呼出的气流在声门处被阻断,声带上方和下方均收到气流冲击,从而产生振动;当振动累积到一定程度时,闭合的声带被重新打开;由于声带具有韧性,重新打开后会迅速闭合;由此,声带在不断振动的过程中产生一系列气流脉冲,这些气流脉冲被转化为声能脉冲信号,形成语音产生的基本声源,即声带声源。声带声源的响度、音高受声带振动程度的影响。2.1.2发音原理清音和浊音:

在语音学定义中,将发音时声带振动的音称为浊音,声带不振动的音称为清音。辅音

有清有浊,而多数语言中的元音均为浊音,鼻音、边音、半元音也是浊音。发元音时声带振动的叫浊元音。有些语言发元音时声带不振动,发出的为清元音。当发出浊元音时,声道在声门端关闭,除了喉腔会发生适度的收缩,其余空间没有明显的缩小。当发出清元音时,声门打开,舌部对发音的影响效果减弱。2.1.2发音原理清音和浊音:

在语音学定义中,将发音时声带振动的音称为浊音,声带不振动的音称为清音。辅音

有清有浊,而多数语言中的元音均为浊音,鼻音、边音、半元音也是浊音。辅音是指气流在经过在口腔或咽腔时受到阻碍而形成的音。按照发音时声带振动或不振动,可以将辅音分为浊辅音或清辅音两大类。这两类辅音的区别涉及特定语言中对喉部及喉部以上构音器官的精细时间控制。发出浊辅音时,声道闭合或变窄,气流持续存在并引起声带振动。但由于声道的容积增加(口腔扩张,由下颚下降和颊部的外扩引起;咽腔扩张,由侧壁外扩和喉部的下降引起),声门两侧的气流减少,声门间的压力差减小。声门处的气压变化不仅来自口腔和咽腔,还来自鼻腔,因为口腔内的声压会传播到鼻腔并从前鼻孔辐射到外部空间。发出清辅音时,口腔内的压力值上升,达到声门下的压力大小,声门间的压力差被迅速减小,声带振动受到抑制。2.2心理声学原理心理声学(Psychoacoustics):研究人耳听觉系统对声音的感知过程。外界声音通过耳廓传到耳道,振动鼓膜后所产生的能量依次通过听小骨(锤骨、砧骨、镫骨)传到耳蜗,耳蜗中的基底膜将声音转换为神经信号,最后通过听觉神经传入大脑。由此,声音中的物理属性(如强度和频率)与人耳对声音感知的心理声学属性(如响度和音高的感知)建立了联系。2.2.1听觉范围人耳的听觉范围涵盖了从刚好能够被人耳感知的声音到足以对人耳构成伤害的声音。一般来讲,人耳可以识别的声音的频率范围是20Hz到20000Hz之间。

声压级(SoundPressureLevel,SPL)是一种用于描述声音强度的物理量,以分贝(dB)为单位衡量待测声压相较于基准声压的大小

2.2.1听觉范围人耳的听觉范围涵盖了从刚好能够被人耳感知的声音到足以对人耳构成伤害的声音。一般来讲,人耳可以识别的声音的频率范围是20Hz到20000Hz之间。

声压级(SoundPressureLevel,SPL)是一种用于描述声音强度的物理量,以分贝(dB)为单位衡量待测声压相较于基准声压的大小

无噪声环境下,以特定频率的纯音进行测试时,人耳刚好能够感知到的纯音的声压级称为听阈,该值被定义为0dBSPL;人耳的痛阈约为140dBSPL。2.2.2绝对听阈绝对听阈在无噪声环境中、频率特定的条件下,人耳听觉系统能够感知到的最小纯音强度值,通常用dBSPL表示。在不同的频率下,人耳对声音的感知灵敏程度不同,即绝对听阈不同。1940年,弗莱彻等人就公布了美国国立卫生研究院(NIH)对一众测试者进行听力灵敏度测试的研究结果,并量化了绝对听阈与频率之间的关系。在无噪声环境中,一个听觉灵敏的年轻人的听觉阈值与频率的非线性关系被表示为:

2.2.2绝对听阈绝对听阈无噪声环境下的绝对听阈2.2.3临界频带临界频带在耳蜗的基底膜上发生着从频率到位置的转换。传入耳道的声波会振动鼓膜和鼓室内部的听小骨,而听小骨的机械振动会传导到耳蜗。由于基底膜与神经受体相连,行波会在与每种频率相关的特定位置产生峰值响应,不同的神经受体分别对应了其位置所在处的不同频段对于正弦波激励,基底膜上的行波从输入端的椭圆形窗口开始,向前传播直到接近其共振频率所对应的位置。在位置处幅度增大到峰值,但在该位置之后,波速减慢且幅度迅速衰减。波峰的位置被称为激励信号频率的“最佳位置”,而在特定位置的行波到达峰值的输入频率被称为“最佳频率”。由此,就产生了耳蜗的频率-位置转换关系。2.2.3临界频带耳蜗可以被看作为一组高度重叠的带通滤波器组。但这组带通滤波器的振幅响应是不对称且非线性的(与电平有关)。同时,耳蜗所对应的各带通滤波器的通带带宽呈不均匀分布,带宽随着中心频率的增加而增加,可以用“临界带宽”(CriticalBandwidth,CB)量化不同频率上的带宽。当中心频率小于500Hz时,临界带宽通常约为100Hz;但中心频率大于500Hz时,临界带宽的值约为中心频率的20%。对于一般听者而言,临界带宽与中心频率之间的关系可以表示为:

2.2.3临界频带Bark频带中心频率(频率/Hz)下界频率(频率/Hz)上界频率(频率/Hz)150010021501002003250200300435030040054504005106570510630770063077088407709209100092010801011701080127011137012701480121600148017201318501720200014215020002320152500232027001629002700315017340031503700184000370044001948004400530020580053006400217000640077002285007700950023105009500120002413500120001550025187751550022050理想化的临界频带分布情况2.2.3临界频带进行建模,得到Hz到Bark尺度的转换函数为:

等效矩形带宽(EquivalentRectangularBandwidth,ERB)是另一种描述带宽的度量方法,提供近似人耳听觉对带宽的感知。在信号处理中,等效矩形带宽的定义与信号的功率谱有关,它指的是将信号等效成一个矩形谱,使得等效后的矩形谱与原信号有相同功率。2.2.4同时掩蔽听觉掩蔽是一种常见的心理声学现象。当两个声音同时出现时,相对较弱的声音受较强声音的影响,将不易被人耳感知。较强的音是掩蔽音,较弱的音是被掩蔽音。当两个及以上声源同时发声时,会发生同时掩蔽。同时掩蔽:当一个响度较强的噪声或纯音作为掩蔽音时,其临界频带在基底膜上所对应的位置会产生一个足够强的刺激,从而有效阻断人耳在位置对较弱信号的感知。三种方式:噪声-掩蔽-纯音(Noise-Masking-Tone,NMT)、纯音-掩蔽-噪声(Tone-Masking-Noise,TMN)和噪声-掩蔽-噪声(Noise-Masking-Noise,NMN)2.2.4同时掩蔽噪声-掩蔽-纯音同一临界带内,当一个纯音的强度低于某个与窄带噪声强度和中心频率相关的阈值时,窄带噪声可掩蔽该纯音信号,此现象称为噪声-掩蔽-纯音临界频带是指当某个纯音被以它为中心频率且具有一定带宽的连续噪声所掩蔽时,如果该纯音刚好能被听到时的功率等于这一频带内噪声的功率。信号和掩蔽阈值之间的声级差,为信号掩蔽比(Signal-to-Maskratio,SMR),SMR越大掩蔽效果越小。2.2.4同时掩蔽纯音-掩蔽-噪声当噪声的强度低于某个与掩蔽纯音强度和中心频率相关的阈值时,临界频带中心频率处的纯音可掩蔽任何亚临界带宽或形状的噪声在纯音掩蔽噪声带的检测阈值处,当掩蔽音的频率接近噪声的中心频率时,会出现最小SMR,即掩蔽音纯音的强度与被掩蔽噪声的强度之间差异最小。与噪声相比,纯音在掩蔽方面具有较大的信号掩蔽比(SMR)。低频纯音容易掩蔽高频纯音,而高频纯音相对较难掩蔽低频纯音。频率相近的纯音容易互相掩蔽。当增加掩蔽声的声压级时,掩蔽阈值会提高,同时被掩蔽的频率范围也会扩展。2.2.4同时掩蔽噪声-掩蔽-噪声一种窄带噪声掩蔽另一种窄带噪声的现象称为噪声-掩蔽-噪声。相比于NMT和TMN,NMN的研究更为困难

NMN的掩蔽效果会受掩蔽音和被掩蔽音之间的相位关系影响。基本每种噪声成分之间的不同相位可能导致不同的阈值SMR。2.2.5异时掩蔽掩蔽效应发生在掩蔽音与被掩蔽音不同时作用时,也称作时域掩蔽。声音信号多为非稳态的瞬时信号,其声压级会随着时间快速变化,强音后面会跟着弱音,弱音后面又可能跟着强音。比较强的声音信号会掩蔽随后到来的较弱音,这个现象就是时域掩蔽。时域掩蔽分为前向掩蔽和后向掩蔽。在掩蔽音出现之前的一段时间内发生的掩蔽效应,称为前向掩蔽。在掩蔽音出现之后的一段时间内发生的掩蔽效应,称为后向掩蔽。我们毕业啦其实是答辩的标题地方第三章语音特征提取马勇江苏师范大学61目录2频域特征3倒谱域特征4线性预测特征1时域特征0特征提取概述语音信号特征是语音信号处理的前提和基础,只有分析出可表示语音信号特征的参数,才能利用这些特征进行高效的语音通信、语音合成和语音识别等处理。语音特征分析是建立在“短时分析技术”基础上。语音信号从整体来看其特征及参数均是随时间而变化的,所以是一个非平稳随机过程,不能采用常规数字信号处理技术进行分析处理。

但是在一个短时间范围内(一般取10-40ms),其特性基本保持不变,即相对稳定,因而可以将其看作是一个准平稳过程,即语音信号具有短时平稳性。根据所分析参数的性质不同,语音特征可分为:

时域特征、频域特征、倒频域特征,线性预测特征等;不论是分析怎么样的特征参数以及采用什么分析方法,在按帧进行语音分析,提取语音特征参数之前,有一些共同的短时分析技术必须预先进行,如语音信号的数字化、预加重、加窗和分帧等,这些也是所有语音信号分析的关键基础。

语音分帧帧长与帧移的示例

分帧概念分帧是用可移动的有限长度窗口进行加权的方法来实现的,这就是用一定的窗函数ω(n)来乘语音信号s(n),从而形成加窗语音信号sω(n)=s(n)*ω(n)。在语音信号数字处理中常用的窗函数是矩形窗和汉明窗等,它们的表达式如下(其中N为帧长):矩形窗:汉明窗:一个好的窗函数的标准是:在时域因为是语音波形乘以窗函数,所以要减小时间窗两端的坡度,使窗口边缘两端不引起急剧变化而平滑过渡到零,这样可以使截取出的语音波形缓慢降为零,减小语音帧的截断效应;在频域要有较宽的3dB带宽以及较小的边带最大值。这里只以典型的矩形窗和汉明窗为例进行比较。1.窗的形状矩形窗与汉明窗的比较窗类型旁瓣峰值主瓣宽度最小阻带衰减矩形窗-134π/N-21汉明窗-418π/N-53从上表我们可以看出,汉明窗的主瓣宽度比矩形窗大一倍,即带宽约增加一倍,同时其带外衰减也比矩形窗大一倍多。矩形窗的谱平滑性能较好,但损失了高频成分,使波形细节丢失;而汉明窗则相反,从这一方面来看,汉明窗比矩形窗更为合适。因此,对语音信号的短时分析来说,窗口的形状是至关重要的。例如,选用不同的窗口将使时域分析参数的短时平均能量的平均结果不同。采样周期Ts=1/fs,窗口长度N和频率分辨率Δf之间存在下列关系:Δf=1/NTs可见,采样周期一定时,Δf随窗口宽度N的增加而减小,即频率分辨率相应得到提高,但同时时间分辨率降低;如果窗口取短,频率分辨率下降,而时间分辨率提高,因而二者是矛盾的。应该根据不同的需要选择合适的窗口长度。2.窗的长度窗口长度的选择,更重要的是要考虑语音信号的基音周期。通常认为在一个语音帧内应包含1~7个基音周期。然而不同人的基音周期变化很大,从女性和儿童的2ms到老年男子的14ms(即基音频率的变化范围为500~70Hz),所以N的选择比较困难。通常在10kHz取样频率下,N折中选择为100~200点为宜(即10~20ms持续时间)。这样,经过上面介绍的处理过程,语音信号就已经被分割成一帧一帧的加过窗函数的短时信号,然后再把每一个短时语音帧看成平稳的随机信号,利用数字信号处理技术来提取语音特征参数。

窗长选择标准3.1时域特征语音信号的时域特征就是分析和提取语音信号的时域参数。进行语音分析时,最先接触到并且也是最直观的是它的时域波形。语音信号本身就是时域信号,因而时域分析是最早使用,也是应用最广泛的一种分析方法,这种方法直接利用语音信号的时域波形信息。时域分析通常用于最基本的参数分析及应用,如语音的分割、预处理、分类等。时域特征分析方法的特点:①表示语音信号比较直观、物理意义明确。②实现起来比较简单、运算量少。③可以得到语音的一些重要的参数。

短时过零率表示一帧语音中语音信号波形穿过横轴(零电平)的次数。过零分析是语音时域分析中最简单的一种。对于连续语音信号,过零即意味着时域波形通过时间轴;而对于离散信号,如果相邻的取样值改变符号则称为过零。过零率就是样本改变符号的次数。定义语音信号xn(m)的短时过零率Zn为:式中,sgn[]是符号函数,即1.短时过零率特征分析利用短时平均过零率还可以从背景噪声中找出语音信号,可用于判断无声段和有声段的起点和终点位置。在孤立词的语音识别中,必须要在一连串连续的语音信号中进行适当分割,用以确定一个一个单词的语音信号,即找出每一个单词的开始和终止位置,这在语音处理中是一个基本问题。此时,在背景噪声较小时用平均能量识别较为有效,而在背景噪声较大时用平均过零率识别较为有效。但是研究表明,在以某些音为开始或结尾时,如当弱摩擦音(如[f]、[h]等音素)、弱爆破音(如[p]、[t]、[k]等音素)为语音的开头或结尾只用其中一个参量来判别语音的起点和终点是有困难的,必须同时使用这两个参数。

短时过零率特征分析设语音波形时域信号为x(t)、加窗分帧处理后得到的第n帧语音信号为xn(m),则xn(m)满足下式:xn(m)=ω(m)x(n+m)其中,n=0,1,2,…,N,N为帧长。设第n帧语音信号xn(m)的短时能量用En表示,则其计算公式如下:2.短时能量特征分析度量语音信号幅度值变化的函数,即短时平均幅度函数Mn,它定义为:Mn也是一帧语音信号能量大小的表征,它与En的区别在于计算时小取样值和大取样值不会因取平方而造成较大差异,在某些应用领域中会带来一些好处。3.短时平均幅度特征分析相关分析是一种常用的时域波形分析方法,并有自相关和互相关之分。这里主要讨论自相关函数。自相关函数具有一些性质,如它是偶函数;假设序列具有周期性,则其自相关函数也是同周期的周期函数等。我们可以把自相关函数的这些性质应用于语音信号的时域分析中。例如,对浊音语音可以用自相关函数求出语音波形序列的基音周期。此外,在进行语信号的线性预测分析时,也要用到自相关函数。和其他语音参数一样,在语音信号分析中,我们分析的是短时自相关函数。

4.短时自相关分析定义语音信号xn(m)的短时自相关函数Rn(k)的计算式如下:这里K是最大的延迟点数。短时自相关函数具有以下性质:(1)如果xn(m)是周期的(设周期为N),则自相关函数是同周期的周期函数,即Rn(k)=Rn(k+Np)。(2)Rn(k)是偶函数,即Rn(k)=Rn(-k)。(3)当k=0时,自相关函数具有最大值,即Rn(0)≥|Rn(k)|,并且Rn(0)等于确定性信号序列的能量或随机性序列的平均功率。

4.短时自相关函数3.2频域特征从广义上讲,语音信号的频域特征包括语音信号的频谱、功率谱、倒频谱、频谱包络分析等,而常用的频域分析方法有带通滤波器组法、傅里叶变换法等几种。因为语音波是一个非平稳过程,因此适用于周期、瞬变或平稳随机信号的标准傅里叶变换不能用来直接表示语音信号,而应该用短时傅里叶变换对语音信号的频谱进行分析,相应的频谱称为“短时谱”。

我们还可以上式写成另一种形式。设语音信号序列和窗口序列的标准傅里叶变换均存在。当n取固定值时,ω(n-m)的傅里叶变换为:根据卷积定理有:因为上式右边两个卷积项均为关于角频率ω的以2π为周期的连续函数,所以也可将其写成以下的卷积积分形式:即,假设x(m)的DTFT是X(ejω),且ω(m)的DTFT是X(ejω),那么Xn(ejω)是X(ejω)和W(ejω)的周期卷积。语音短时频谱的物理意义

在语音信号数字处理中,功率谱具有重要意义,在一些语音应用系统中,往往都是利用语音信号的功率谱。根据功率谱定义,可以写出短时功率谱与短时傅里叶变换之间的关系:或者:式中*表示复共轭运算。并且功率谱Sn(ejω)是短时自相关函数Rn(k)的傅里叶变换。语谱图特征

语谱图是语音信号分析常用的方法,之后人们在计算机上通过短时傅里叶变换实现语谱图的绘制。语谱图在二维空间中反应语音的不同频段的能量随时间变化的情况。语谱图为语音信号的时频表示,横坐标单位为时间,纵坐标单位为频率,语谱图的颜色深浅表示时频点能量大小。滤波器组特征

滤波器组特征,又称FBank(FilterBank)特征,是通过滤波器组分析语音信号频谱特征的方法。语音信号频谱经过Mel滤波器组,这些滤波器为带通滤波器,对每个滤波器频带求频谱能量,然后进行叠加,最后计算各频带对应的功率谱。语音信号

预加重分帧、加窗

短时傅里叶变换

计算功率谱

幅度取平方

梅尔刻度滤波器组

对数计算

FBank特征

3.3倒谱特征信号的倒谱就是将该信号的离散傅里叶变换的对数幅度做离散傅里叶逆变换(IDTFT),Borgert等人在1963年首次提出倒谱(Cepstrum)概念。1967年,Noll把倒谱引入语音信号处理。语音信号的倒谱特征提取的过程,它可以通过同态处理来实现。同态信号处理也称为同态滤波,它实现了将卷积关系变换为求和关系的分离处理,即解卷。对语音信号进行解卷,可将语音信号的声门激励信息及声道响应信息分离开来,从而求得声道共振特征和基音周期,用于语音编码、合成、识别等。

同态信号处理的基本原理我们日常生活中遇到的许多信号,它们并不是加性信号(即组成各分量按加法原则组合起来)而是乘积性信号或卷积性信号,如语音信号、图像信号、通信中的衰落信号、调制信号等。这些信号要用非线性系统来处理。而同态信号处理就是将非线性问题转化为线性问题的处理方法。按被处理的信号来分类,大体分为乘积同态处理和卷积同态处理两种。由于语音信号可视为声门激励信号和声道冲击响应的卷积,所以这里仅讨论卷积同态信号处理。

同态信号处理的基本原理

同态信号处理的基本原理第一个子系统D*[]完成将卷积性信号转化为加性信号的运算,即对于信号x(n)=xl(n)*x2(n)进行了如下运算处理:

由于x^(n)为加性信号,所以第二个子系统可对其进行需要的线性处理得到y^(n)。第三个子系统是逆特征系统D*-1[],它对y^(n)=

y1^(n)+y2^(n)进行逆变换,使其恢复为卷积性信号,即进行了如下处理:从而得到卷积性的恢复信号。

复倒谱和倒谱虽然D*[]与D*-1[]系统中的x^(n)和y^(n)信号也均是时域序列,但它们所处的离散时域显然不同于x(n)和y(n)所处的离散时域,所以我们把它称之为“复倒频谱域”。x^(n)是x(n)的“复倒频谱”,简称为“复倒谱”,有时也称作对数复倒谱。其英文原文为“ComplexCepstrum”,Cepstrum是一个新造的英文词,它是由Spectrum这个词的前四个字母倒置而构成的。同样,序列y^(n)也是y(n)的复倒谱。

复倒谱和倒谱在绝大多数数字信号处理中,X(z),X^(z),Y(z),Y^(z)的收敛域均包含单位圆,因而D*[]与D*-1[]系统有如下形式:D*[]=D*-1[]=设:则取其对数得:即复数的对数仍是复数,它包含实部和虚部。注意,这时对数的虚部arg[X(ejω)]由于是X(ejω)的相位,所以将产生不一致性。如果,我们只考虑X^(ejω)的实部,令:显然c(n)是序列x(n)对数幅度谱的傅里叶逆变换。c(n)称为“倒频谱”或简称为“倒谱”,有时也称“对数倒频谱”。倒谱对应的量纲是“Quefrency”,它也是一个新造的英文词,是由“Frequency”转变而来的,因此也称为“倒频”,它的量纲是时间。c(n)实际上就是我们要求取的语音信号倒谱特征。复倒谱和倒谱特点和关系(1)复倒谱要进行复对数运算,而倒谱只进行实对数运算。(2)在倒谱情况下一个序列经过正逆两个特征系统变换后,不能还原成自身,因为在计算倒谱的过程中将序列的相位信息丢失了。(3)与复倒谱类似,如果c1(n)和c2(n)分别是x1(n)和x2(n)的倒谱,并且x(n)=x1(n)*x2(n),则x(n)的倒谱c(n)=c1(n)+c2(n)。(4)已知一个实数序列x(n)的复倒谱x^(n),可以由x^(n)求出它的倒谱c(n)。(5)已知一个实数序列x(n)的倒谱c(n),能否用它来求出复倒谱x^(n)?

语音信号两个卷积分量的复倒谱语音信号可看做是声门激励信号和声道冲激响应两信号的卷积,因此下面将分别讨论这两个信号的复倒谱的性质。

复倒谱分析中的相位卷绕及避免相位卷绕的方法在复倒谱分析中,z变换后得到的是复数,所以取对数时进行的是复对数运算。这时存在相位多值性问题,称为“相位卷绕”。相位卷绕使得求语音的复倒谱,以及从复倒谱中恢复语音等运算都会由于不确定性而产生错误。下面来分析复倒谱分析中相位卷绕是怎样产生的。上式的相位也可表示为:式中,虽然φl(ω)和φ2(ω)的范围均在(0,2π)内,但φ(ω)的值可能不在(0,2π)之内,而计算机处理时总相位值只能用主值Φ(ω)(在(0,2π)内)来表示。所以可能存在下面的情况:(k为整数)此时即产生了相位卷绕。显然,相位卷绕的产生是由于相位的多值性问题。它会使后面求复倒谱以及由复倒谱恢复语音等运算存在不确定性而产生错误。求复倒谱时避免相位卷绕的方法有限制法、微分法、最小相位信号法等。其中,限制法的思想是将复倒谱的相位限制在-π<φ(ω)<π的范围内,从而有φ(ω)=Φ(ω)。但对于语音信号来讲,由于语音信号是随机的,所以这种限制是不科学的。下面介绍其他两种求复倒谱时避免相位卷绕的方法。

语音信号倒谱分析实例1.由同态分析求出的语音信号倒谱实例一个信号的倒谱定义为信号频谱模的自然对数的逆傅里叶变换(即设相位恒定为零)。设信号为s(n),则其倒谱为:根据语音信号产生模型,语音信号s(n)是由声门脉冲激励e(n)经声道响应v(n)滤波而得到,即:设三者的倒谱分别为s^(n)、e^(n)及v^(n),则有:2.MEL频率倒谱参数(MFCC)与普通实际频率倒谱分析不同,MFCC(Mel-FrequencyCepstralCoefficents,简称MFCC)的分析着眼于人耳的听觉特性,因为,人耳所听到的声音的高低与声音的频率并不成线性正比关系,而用Mel频率尺度则更符合人耳的听觉特性。所谓Mel频率尺度,它的值大体上对应于实际频率的对数分布关系。Mel频率与实际频率的具体关系可用式表示:这里,实际频率的单位是Hz。语音信号倒谱分析实例Mel频率尺度滤波器组MFCC特征提取框图MFCC特征

语音信号

预加重分帧、加窗

短时傅里叶变换

计算功率谱

幅度取平方

梅尔刻度滤波器组

对数计算

离散余弦变换

差分计算

MFCC一阶差分特征MFCC二阶差分特征

3.4语音信号的线性预测分析线性预测分析:由于语音样点之间存在相关性,所以可以用过去的样点值来预测现在或未来的样点值,即一个语音的抽样能够用过去若干个语音抽样或它们的线性组合来逼近。通过使实际语音抽样和线性预测抽样之间的误差在某个准则下达到最小值来决定唯一的一组预测系数。而这组预测系数就反映了语音信号的特性,可以作为语音信号特征参数用于语音识别、语音合成等。

线性预分析的基本原理线性预测分析的基本思想是:用过去p个样点值来预测现在或未来的样点值:预测误差ε(n)为:这样就可以通过在某个准则下使预测误差ε(n)达到最小值的方法来决定惟一的一组线性预测系数ai(i=1,2,…,p)。线性预分析的基本原理这里,系统的输入e(n)是语音激励,s(n)是输出语音,模型的系统函数H(z)可以写成有理分式的形式:采用全极点模型,辐射、声道以及声门激励的组合谱疚的传输函数为:在模型参数估计程中,把如下系统称为线性预测器:式中ai称为线性预测系数。从而,p阶线性预测器的系统函数具有如下形式:预测误差为:线性预测分析要解决的问题是:给定语音序列(显然,鉴于语音信号的时变特性,LPC分析必须按帧进行),使预测误差在某个准则下最小,求预测系数的最佳估值ai,这个准则通常采用最小均方误差准则。下面推导线性预测方程。把某一帧内的短时平均预测误差定义为:为使E{ε2(n)}最小,对aj求偏导,并令其为零,有:上式表明采用最佳预测系数时,预测误差ε(n)与过去的语音样点正交。由于语音信号的短时平稳性,要分帧处理(10-30ms),对于一帧从n时刻开窗选取的N个样点的语音段Sn,记Φn(j,i)为则有:

线性预测方程组的求解对于语音段Sn,它的自相关函数为:因此,可以定义Φn(j,i)为因此有:把上式展开写成矩阵形式:这种方程叫Yule-Wslker方程,方程左边的矩阵称为托普利兹(Toeplitz)矩阵,它是以主对角线对称的、而且其沿着主对角线平行方向的各轴向的元素值都相等。这种Yule-Wslker方程可用莱文逊-杜宾(Levinson—Durbin)递推算法来高效地求解。下面介绍Durbin快速递推算法。

线性预测方程组的求解完整的递推过程为:ifi<pgoto(1)

LPC谱估计和LPC复倒谱1.LPC谱估计当求出一组预测器系数后,就可以得到语音产生模型的频率响应,即:因此在共振峰频率上其频率响应特性会出现峰值。所以线性预测分析法又可以看做是一种短时谱估计法。其频率响应H(ejω)即称为LPC谱。

1.LPC谱估计LPC谱估计具有一个特点:在信号能量较大的区域即接近谱的峰值处,LPC谱和信号谱很接近;而在信号能量较低的区域即接近谱的谷底处,则相差比较大。这个特点对于呈现谐波结构的浊音语音谱来说,就是在谐波成分处LPC谱匹配信号谱的效果要远比谐波之间好得多。LPC谱估计的这一特点实际上来自均方误差最小准则。从以上讨论我们知道如果p选得很大,可以使|H(ejω)|精确地匹配于|S(ejω)|,而且极零模型也可以用全极点模型来代替,但却增加了计算量和存储量,且p增加到一定程度以后,预测平方误差的改善就很不明显了,因此在语音信号处理中,p一般选在8~14之间。2.LPC复倒谱LPC系数是线性预测分析的基本参数,可以把这些系数变换为其他参数,以得到语音的其他替代表示方单。LPC系数可以表示整个LPC系统冲激响应的复倒谱。按上式求得的复倒谱h^(n)称之为LPC复倒谱。LPC复倒谱由于利用了线性预测中声道系统函数H(z)的最小相位特性,避免了相位卷绕问题;且LPC复倒谱的运算量小,它仅是用FFT求复倒谱时运算量的一半;又因为当p→∞时,语音信号的短时复频谱S(ejω)满足|S(ejω)|=|H(ejω)|,因而可以认为h^(n)包含了语音信号频谱包络信息,即可近似把h^(n)当作s(n)的短时复倒谱s^(n),来分别估计出语音短时谱包络和声门激励参数。在实时语音识别中也经常采用LPC复倒谱作为特征矢量。对以上所介绍的进行总结可知,为了估计语音信号的短时谱包络,有三种方法:①由LPC系数直接估计语音信号的谱包络;②由LPC倒谱估计谱包络;③求得复倒谱s^(n),再用低时窗取出短时谱包络信息,这种方法称之为FFT倒谱。3.LPC美尔倒谱系数(LPCCMCC)由式(3-143)求得复倒谱h^(n)后,由c(n)=1/2[h^(n)+h^(-n)]即可求出倒谱c(n)。但是,这个倒谱c(n)是实际频率尺度的倒谱系数(称为LPC倒谱系数:LPCC)。根据人的听觉特性可以把上述的倒谱系数进一步按符合人的听觉特性的美尔(MEL)尺度进行非线性变换,从而求出如下所示的LPC美尔倒谱系数(LPCMCC)。感知线性预测预处理语音信号离散傅里叶变换临界频带分析等响度预加重强度-响度变换逆离散傅里叶变换线性预测分析PLP的提取主要步骤:

1)语音信号首先经过加窗、分帧和预加重等预处理。2)分帧后的语音信号经过离散傅里叶变换得到短时谱,这里还需要进一步计算短时谱的实部和虚部的平方和,最后得到语音的功率谱。3)通过Bark尺度的滤波器分析临界带功率谱。4)等响度预加重,近似人耳对信号不同频率分量的不同敏感度,进行强度-响度转换。5)傅里叶逆变换后,计算线性预测系数。6)通过Levinson-Durbin算法计算LPC系数,进一步求得倒谱系数,最终得到PLP的特征参数。

1.线谱对(LSP)分析线谱对分析也是一种线性预测分析方法,只是它求解的模型参数是“线谱对”(LineSpectrumPair,简称为LSP),它是频域参数,因而和语音信号谱包络的峰有着更紧密的联系;同时它构成合成滤波器H(z)时容易保证其稳定性,合成语音的数码率也比用格型法求解时要低。LPC推演参数两边同时乘以[1z-1z-2…z-p],得:分别将kp+1=-1和kp+1=1时的Ap+1(z)用P(z)和Q(z)表示,可得:这两个式子均为p+1阶多项式,则由上面二式可直接得出:并有:所以如果知道了P(z)=0和Q(z)=0的根,我们就可以求得A(z)。并且ωi、θi按下列关系排列:由于因式分解中的系数ωi、θi成对出现,反映了谱的特性,故称为“线谱对”。而且可以证明,P(z)和Q(z)的零点互相分离,是保证合成滤波器H(z)=1/A(z)稳定的充分必要条件。从上面的分析可以看到,线谱对分析的基本出发点是将A(z)的p个零点通过P(z)和Q(z)映射到单位圆上,这样使得这些零点可以直接用频率ω来反映,且P(z)和Q(z)各提供p/2个零点频率;而从物理意义上来说,P(z)和Q(z)就对应着声门全开或全闭时的全反射情况(因为反射系数是kp+1=±1)。在用线谱对对语音信号进行分析时,主要的任务是要求解参数ωi、θi。当A(z)的系数(线性预测系数{ai}求出后,我们可以采用下面的方法求P(z)和Q(z)的零点。1.用代数方程式求根由于

所以P(z)/(1+z-1)=0是关于x的一个p/2次代数方程。同理Q(z)/(1-z-1)=0也是关于x的一个p/2次代数方程。2.DFT法对P(z)和Q(z)的系数求离散傅里叶变换,得到zk=e-jωπ/N(k=0,1,…,N—1)(实际中N值常取64~128)各点的值,根据两点间嵌入零点的内插,能够推定零点。2.反射系数

3.对数面积比系数

我们毕业啦其实是答辩的标题地方第四章常用建模方法马勇江苏师范大学123目录2高斯混合模型3隐马尔可夫模型4支持向量机5神经网络1矢量量化深度神经网络64.1矢量量化矢量量化(VQ,即VectorQuantization)是一种极其重要的信号压缩方法。VQ在语音信号处理中占十分重要的地位。广泛应用于语音编码、语音识别和语音合成等领域。量化分为两类:*标量量化:将取样后的信号值逐个地进行量化。*矢量量化:将若干取样信号分成一组,即构成一个矢量,然后对此矢量一次进行量化。凡是要用量化的地方都可以采用矢量量化。

矢量量化是实现数据压缩的一种有效方法,早在50和60年代就被用于语音压缩编码。直到70年代线性预测技术被引入语音编码后,矢量量化技术才活跃起来。80年代初,矢量量化技术的理论和应用研究得到迅速发展。采用矢量量化技术对信号波形或参数进行压缩处理,可以获得很好的效益,使存储要求、传输比特率需求或和计算量需求降低.采用矢量量化的效果优于标量量化的原因?

矢量量化能有效的应用矢量中各分量之间的四种相互关联性质来消除数据中的冗余度。这四种相互关联的性质是线性依赖(相关性)、非线性依赖(统计不独立)、概率密度函数的形状和矢量量化的维数,而标量量化仅能利用线性依赖和概率密度函数的形状来消除冗余度。矢量量化研究的目的?

针对特定的信息源和矢量维数,设计出一种最优化的量化器,在R(量化速率)一定的情况下,给出的量化失真尽可能接近D(R)(最小量化失真)。矢量量化的基本原理

标量量化是对信号的单个样本或参数的幅度进行量化;标量是指被量化的变量,为一维变量。

矢量量化的过程是将语音信号波形的K个样点的每一帧,或有K个参数的每一参数帧构成K维空间的一个矢量,然后对这个矢量进行量化。

标量量化可以说是K=1的矢量量化。矢量量化过程和标量量化过程相似。将K维无限空间划分为M个区域边界,然后将输入矢量与这些边界进行比较,并被量化为“距离”最小的区域边界的中心矢量值。矢量量化的定义

将信号序列的每K个连续样点分成一组,形成K维欧式空间中的一个矢量,矢量量化就是把这个K维输入矢量X映射成另一个K维量化矢量。其中量化矢量构成的集合称为码书或码本,码书中的每个矢量称为码字或者码矢。

以K=2进行说明:当K=2时,所得到的是二维矢量。所有可能的二维矢量就形成了一个平面。记为(a1,a2),所有可能的(a1,a2)就是一个二维空间。如图所示矢量量化概念示意图

矢量量化就是将这个平面划分为M块S1,S2,…,Si…SM,然后从每一块中找出代表值Yi(i=1,2….M),这就构成一个有M个区间的二维矢量量化器。图所示的是一个7区间的二维矢量量化器,即K=2,M=7。通常这些代表值Yi称为量化矢量。对一个矢量X进行量化,首先选择一个合适的失真测度,然后用最小失真原理,分别计算用量化矢量Yi替代X所带来的失真。其中最小失真值所对应的那个量化矢量,就是矢量X的重构矢量(或恢复矢量)。

所有M个量化矢量构成的集合称为码书或码本;把码书中的每个量化矢量Yi(i=1,2….M)称为码字或码矢。不同的划分或不同的量化矢量选取就可以构成不同的矢量量化器。注:根据仙农信息论,矢量越长越好。实际中码书是不完备的,即矢量数是有限的,而对于任何一个实际应用来说,矢量通常是无限的。在实际运用中,输入矢量和码书中码字不匹配的情况下,这种失真是允许的。存在的问题

一、如何划分M个区域边界。方法是:将大量欲处理的信号的矢量进行统计划分,进一步确定这些划分边界的中心矢量值来得到码书。二、如何确定两矢量在进行比较时的测度。

这个测度就是两矢量间的距离,或以其中某一矢量为基准时的失真度。它描述了当输入矢量用码书所对应的矢量来表征时所付出的代价。

VQ的原理框图编码端译码端信道

工作过程:在编码端,输入矢量Xi与码书中的每一个码字进行比较,分别计算出它们的失真。搜索到失真最小的码字的序号(或该码字所在码书中的地址),这些序号就作为传输或存储的参数。在恢复时,根据此序号从恢复端的码书中找出相应的码字。由于两本码书完全相同,此时失真最小,所以

就是输入矢量Xi的重构矢量。特点:传输存储的不是矢量本身而是其序号,所以据有高保密性能收发两端没有反馈回路,因此比较稳定矢量量化器的关键是编码器的设计,译码器只是简单的的查表过程。矢量量化的性能指标除了码书的大小M以外还有由于量化而产生的平均信噪比。

矢量量化的准则:在给定码本大小K时使量化所造成的失真最小。

矢量量化的设计:从大量信号样本中训练出好的码书,从实际效果出发寻找最好的失真测度定义公式,设计出最佳的矢量量化系统,以便用最少的搜索和计算失真的计算量,来实现最大可能的平均信噪比。4.1.2失真测度

前面我们讲过设计矢量量化器的关键是编码器的设计。而在编码的过程中,就需要引入失真测度的概念。

失真测度(距离测度):是将输入矢量Xi用码本重构矢量Yi来表征时所产生的误差或失真的度量方法,它可以描述两个或多个模型矢量间的相似程度。失真测度是矢量量化和模式识别中一个十分重要的问题,选择合适与否直接影响系统的性能。

失真是将输入信号矢量用码书的重构矢量来表征时的误差或所付出的代价。这种代价的统计平均值(平均失真)描述了矢量量化器的工作性。失真度选择必须具备的特性必须在主观评价上有意义,即小的失真应该对应于好的主观语音质量;必须是易于处理的,即在数学上易于实现,这样可以用于实际的矢量量化器的设计;平均失真存在并且可以计算;易于硬件实现失真测度主要有均方误差失真测度(即欧氏距离)、加权的均方误差失真测度、板仓-斋藤(Itakura-Saito)距离,似然比失真测度等,还有人提出的所谓的“主观的”失真测度。VQ常用的失真测度

4.1.3VQ模型学习方法

VQ学习注意的内容在VQ模型学习过程中,码书的初始化和空胞腔的去除对模型的结果有重要的影响。下面介绍一下这两方面内容。码书的初始化方法包括随机初始化法和分裂法。随机初始化方法是从训练序列中选取N个矢量作为初始码字,构成初始码书。随机初始化方法的优点是计算效率较高,不存在空胞腔问题。但是也存在选取非典型矢量码字作为形心的问题,还会造成部分空间把胞腔分的过细或者过大的情况。4.1.4矢量量化的改进1.无记忆的矢量量化器无记忆矢量量化器是指量化每个矢量时,不依赖此矢量前面的其他矢量,每一个输入矢量都是独立进行量化的。全搜索矢量量化器也是一种无记忆的矢量量化器。2.有记忆的矢量量化器

有记忆矢量量化器在量化的每一个输入矢量时,不仅与此矢量本身有关,而且与前面矢量有关,即在VQ过程中通过记忆来利用矢量与矢量之间的相关性。常用的有记忆矢量量化器包括预测矢量量化器(PredictiveVQ,PVQ)和有限状态矢量量化器(FiniteStateVQ,FSVQ)。4.2.1GMM的基本原理

混合高斯分布模型是只有一个状态的模型,在这个状态里具有多个高斯分布函数GMM模型的基本概念

高斯混合模型(GMM)可以看做一种状态数为1的连续分布隐马尔科夫模型CDHMM。一个M阶混合高斯模型的概率密度函数是由M个高斯概率密度函数加权求和得到,所示如下:

其中是一个D维随即向量,是子分布,,是混合权重。每个子分布是D维的联合高斯概率分布,可表示为:

其中是均值向量,是协方差矩阵,混合权重值满足以下条件:

完整的混合高斯模型由参数均值向量、协方差矩阵和混合权重组成,表示为:

对于给定的时间序列,利用GMM模型求得的对数似然度可定义如下:4.2.2期望最大化算法GMM模型的训练就是给定一组训练数据,依据某种准则确定模型参数。最常用的参数估计方法是最大似然估计(ML)估计。对于一组长度为T的训练矢量序列

,GMM的似然度可以表示为:

由于上式是参数的非线性函数,很难直接求出上式的最大值。因此,常常采用EM算法估计参数。EM算法的计算是从参数的一个初值开始,采用EM算法

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论