模态基础及学习 6_第1页
模态基础及学习 6_第2页
模态基础及学习 6_第3页
模态基础及学习 6_第4页
模态基础及学习 6_第5页
已阅读5页,还剩52页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Introduction

to

Information

Retrieval语音特征Live

Q&A/jinCS3245

–

Information

Retrieval多模态机器学习23.1数据采集:声音如何从物理信号转变为数字信号。3.2预处理:为特征提取做准备的关键步骤(预加重、分帧、加窗)。3.3手工特征提取:传统方法,涉及时域、频域和倒谱域分析。3.4基于神经网络的特征提取:利用深度学习和预训练模型自动学习特征。核心思想:将原始、不定长的语音信号转换为计算机易于处理的、固定长度的特征向量。Ch.

11-12本章内容概述CS3245

–

Information

Retrieval多模态机器学习3声音的本质:是一种通过介质(如空气)传播的纵波。由声源振动产生,引起空气压力波动。关键物理参数:频率:单位时间内声波的周期数;决定音调的高低。频率越高,则声音的音调越高,反之,则音调越低。振幅:在振动中距离其振动中心的最大位移;反映声波携带能量多少;决定响度的大小。振幅越大,则声音的响度越大,反之,则响度越小。

Ch.

11-12声音的物理特性与信号转换CS3245

–

Information

Retrieval多模态机器学习4采集流程:麦克风接收声波→转换为模拟信号(连续电压信号)。为了使计算机可以处理这种信号,必须先对其进行采样(sampling)和量化(quantify)将其转化为时间和幅度上均呈离散变化的数字信号。

Ch.

11-12声音的物理特性与信号转换CS3245

–

Information

Retrieval多模态机器学习5定义:在时间轴上对连续模拟信号进行离散化取值。关键指标:采样率(Hz),即每秒采样的点数。采样率越高→间隔越小→波形越逼真奈奎斯特定理:采样率需至少为信号最高频率的2倍,才能完整保留信息。典型采样率:电话/嵌入式设备:8kHz智能手机/计算机:8kHz~44.1kHz专业音乐制作:88.2kHz/96kHzCh.

11-12采样CS3245

–

Information

Retrieval多模态机器学习6定义:在幅度轴上对采样值进行离散化处理。将幅度划分为有限区间同一区间内的采样点用同一幅度值表示量化位数:表示每个采样点所用的二进制位数(如8位、16位)。8位量化示例:00000000₂(0)~11111111₂(255)振幅划分为256个等级影响:位数越高,精度越高,质量越好,但存储空间也越大。Ch.

11-12量化量化失真量化失真:量化前后波形存在差异→信息损失一种不可逆的信息损失。CS3245

–

Information

Retrieval多模态机器学习8为什么需要预加重?唇端辐射抑制效应→高频能量明显降低高频缺失→共振峰不明显→音素信息丢失预加重的本质一阶高通滤波器提升高频部分相对低频的能量弥补高频损耗,保护声道信息目的:弥补语音信号在传播过程中高频部分的能量损耗。Ch.

11-12预处理:预加重CS3245

–

Information

Retrieval多模态机器学习9

Ch.

11-12预处理:预加重CS3245

–

Information

Retrieval多模态机器学习10短时分析思想语音信号宏观不平稳→短时(20-50ms)近似平稳浊音时声带振动有规律→短时内基音频率相对稳定帧长定义:一帧信号的时间长度上限:<音素长度(50ms),保证平稳性下限:>基音周期(约10ms),保证频率分析准确常见取值:20ms~50msCh.

11-12预处理:分帧CS3245

–

Information

Retrieval多模态机器学习11帧移:前后帧之间的重叠长度->保证语音特征的连续性和平滑性方式:重叠取帧计算示例采样率:16kHz;帧长:25ms→400个采样点帧移:10ms→160个采样点Ch.

11-12预处理:分帧CS3245

–

Information

Retrieval多模态机器学习12

Ch.

11-12预处理(二):加窗CS3245

–

Information

Retrieval多模态机器学习13常见窗函数:矩形窗:频率分辨率高,但无法解决频谱泄露问题。汉明窗(最常用):能有效克服频谱泄露,很好地保留原信号频率特性。汉宁窗:与汉明窗类似,加权系数不同,频率分辨率较好。Ch.

11-12预处理(二):加窗

注:分帧本身相当于加矩形窗CS3245

–

Information

Retrieval多模态机器学习14原理:直接从语音信号的波形中分析提取特征。1.短时能量与短时平均幅度计算:每帧信号的能量(平方和)或幅值(绝对值之和)。用途:区分浊音(能量高)和清音(能量低),区分有声段与无声段。Ch.

11-12时域特征提取

CS3245

–

Information

Retrieval多模态机器学习15短时能量特点度量能量波动平方运算→放大高低信号差距短时平均幅度特点绝对值代替平方→简化运算对信号电平高低不敏感共同用途区分浊音(能量大)与清音(能量小)信噪比高时,区分有声段与无声段Ch.

11-12时域特征提取

CS3245

–

Information

Retrieval多模态机器学习162.短时过零率计算:一帧内信号穿过零电平的次数。用途:区分浊音与清音浊音:过零率低,集中在低频端清音:过零率高,集中在高频端端点检测(VAD)短时能量:适用于背景噪声小短时过零率:适用于背景噪声大两者结合→准确判断有声段/无声段起止点Ch.

11-12时域特征提取CS3245

–

Information

Retrieval多模态机器学习173.短时自相关函数计算:信号与其延迟信号之间的相似度。短时自相关函数:可用于语音区分浊音:自相关函数具有周期性清音:类似白噪声,无周期性基音周期估算:根据第一个峰值位置确定基音周期窗长选择:需>2倍基音周期(保证检测到峰值)不宜过大(保证短时平稳性)Ch.

11-12时域特征提取加窗处理后得到

修正的短时自相关函数背景:标准自相关要求窗长>2倍基音周期不同人基音周期差异大→需动态调整窗长窗长固定无法同时满足所有情况核心思路两个长度不同的窗口短窗包含N个样本点长窗额外包含K个样本点保证乘积项数恒为N(短窗长度)

修正的短时自相关函数

修正的短时自相关函数维度窗口数量一个两个(长短各一)两段序列同一段不同段乘积项数随k减少恒为N本质自相关互相关对称性偶函数非偶函数基音检测可行可行(峰值法)本质:修正函数是两段不同有限语音段的互相关不是严格意义上的自相关;不满足偶函数性质基音检测:虽不是自相关,但在周期整数倍处仍出现峰值仍可根据峰值位置推测基音周期;实际应用中有效频域分析的生物学与工程学基础生物学依据人类听觉机制:人耳基底膜相当于一台精密的“频谱分析仪”。感知基础:人类对语音的感知高度依赖于对其动态频谱的分析。技术推导核心概念:频谱是频率谱密度的简称,本质是频率的分布曲线。频域分析定义与意义定义:利用语音信号的频谱信息来捕捉信号特征的技术。地位:是认识和处理语音信号必不可少的技术手段。CS3245

–

Information

Retrieval多模态机器学习22语音信号具有明显的非平稳特性

长时间范围内,语音波形随时间快速变化但在短时间范围内,可近似看作平稳信号传统傅里叶变换(FT)的局限:假设信号具有整体平稳性无法反映语音信号随时间变化的频率特征1946年,Gabor提出短时傅里叶变换(Short-TimeFourierTransform,STFT)

通过短时窗口对语音进行局部频域分析实现时域与频域信息的联合表示Ch.

11-12短时傅里叶变换(STFT)CS3245

–

Information

Retrieval多模态机器学习23

Ch.

11-12短时傅里叶变换(STFT)CS3245

–

Information

Retrieval多模态机器学习24

Ch.

11-12短时傅里叶变换(STFT)CS3245

–

Information

Retrieval多模态机器学习25固定窗长带来的时间–频率分辨率折中STFT采用固定长度窗函数:短窗:时间分辨率高;频率分辨率低长窗:频率分辨率高;时间分辨率低因此固定窗长无法同时满足快速变化语音信号的时域分析需求和精细频率分析需求。主要问题缺乏自适应能力对非平稳语音信号分析存在限制需要结合其他方法进一步提升时频分析性能Ch.

11-12短时傅里叶变换(STFT)CS3245

–

Information

Retrieval多模态机器学习26定义:一种用于描述语音信号时频变化特征的二维表示方法。坐标含义:横轴:时间

纵轴:频率

颜色深浅:频谱能量大小

Ch.

11-12语谱图CS3245

–

Information

Retrieval多模态机器学习27语谱图反映:不同时间位置上的频率分布语音频谱随时间的动态变化过程将语音信号三维信息(时间、频率、幅值)映射到二维平面可视化。Ch.

11-12语谱图语谱图生成过程

语谱图的特点与应用语谱图包含丰富的语音信息,通过其可以观察:共振峰特征

反映发音器官的声学特性基音频率

表征语音的周期性结构清音/浊音特征

判断不同发声类型应用领域:广泛应用于语音识别(ASR);语音合成(TTS);说话人识别;语音情感分析谱质心(SpectralCentroid)谱质心定义谱质心是描述声音音色特征的重要声学参数。表示语音信号频谱中能量分布的中心位置

即频率成分的“能量重心”计算方式:对不同频率分量进行能量加权平均单位:Hz1977年由Grey提出。谱质心计算方法

归一化能量分布:因此:谱质心的特点与应用谱质心反映声音明亮程度谱质心较高

高频能量占比较大;声音更加明亮、清晰谱质心较低

低频能量占比较大;声音更加低沉、浑厚应用领域:🎵音乐分类🌳环境声音识别😊音乐情绪分析🗣️语音特征分析总结谱质心通过量化频谱能量分布中心,有效刻画声音的音色和频率特性,是重要的低层声学特征。CS3245

–

Information

Retrieval多模态机器学习33

Ch.

11-12倒谱域分析CS3245

–

Information

Retrieval多模态机器学习34

Ch.

11-12倒谱特征提取步骤CS3245

–

Information

Retrieval多模态机器学习35Mel频率倒谱系数(MFCC)MFCC(Mel-FrequencyCepstralCoefficient)1980年由Davis和Mermelstein提出特点基于人耳听觉感知特性不依赖输入信号假设对噪声具有较好的鲁棒性应用语音识别(ASR);说话人识别;语音情感分析;语音分类Ch.

11-12常用倒谱特征——MFCCMFCC特征提取流程图CS3245

–

Information

Retrieval多模态机器学习37

Ch.

11-12Mel尺度(MelScale)更加符合人耳听觉特性CS3245

–

Information

Retrieval多模态机器学习38Mel滤波器组:由多个三角滤波器组成对频谱进行非线性压缩主要作用平滑频谱降低谐波影响突出语音共振峰降低计算复杂度Ch.

11-12Mel滤波器组作用CS3245

–

Information

Retrieval多模态机器学习39

Ch.

11-12FBank特征提取

CS3245

–

Information

Retrieval多模态机器学习40

Ch.

11-12离散余弦变换(DCT)CS3245

–

Information

Retrieval多模态机器学习41

Ch.

11-12动态差分MFCCCS3245

–

Information

Retrieval多模态机器学习42

Ch.

11-12MFCC特征总结CS3245

–

Information

Retrieval多模态机器学习43

Ch.

11-12线性预测编码(LPC)CS3245

–

Information

Retrieval多模态机器学习44优势:能够从局部时频区域中学习有效模式。输入形式:1DCNN:直接处理原始语音信号。2DCNN:处理“图像化”的语音特征,如语谱图、Mel语谱图。核心操作:卷积层:使用多个卷积核提取局部特征,生成特征图。池化层:进行下采样,压缩特征,减少计算量,并增强鲁棒性(对微小平移不敏感)。作用:在语音特征提取中作为“前端”特征抽取器。

Ch.

11-12卷积神经网络(CNN)的应用卷积神经网络(CNN)的应用1DCNN:直接处理原始语音信号2DCNN:处理“图像化”的语音特征,如语谱图CS3245

–

Information

Retrieval多模态机器学习46Ch.

11-12RNN的应用RNN(循环神经网络)专为处理时序数据设计,能捕捉语音信号中的长时上下文依赖。输入:原始信号或帧级特征(如MFCC)。变种:LSTM

通过门控机制解决长期依赖问题。CS3245

–

Information

Retrieval多模态机器学习47CRNN(卷积循环神经网络)结构:CNN+RNN。流程:CNN负责提取局部声学特征→RNN负责建模时间序列上的全局依赖。优势:结合了CNN的特征抽取能力和RNN的时序建模能力。Ch.

11-12CRNN的应用自监督语音预训练模型

自监督预训练模型(CPC)CPC基本思想2018年DeepMind提出基于对比学习(ContrastiveLearning)

核心思想:利用语音序列之间的时间关联,预测未来语音表示,学习有效特征。目标捕获上下文信息去除噪声信息学习高质量语音表示自监督预训练模型(CPC)

CS3245

–

Information

Retrieval多模态机器学习51Ch.

11-12自监督预训练模型(wav2vec)CPCwav2vecCNN+GRU全CNN结构依赖RNN上下文建模并行计算效率更高训练效率较低更适合大规模训练wav2vec简介2019年FacebookAIResearch提出延续CPC的对比学习思想与CPC区别CS3245

–

Information

Retrieval多模态机器学习52Ch.

11-12自监督预训练模型(wav2vec)CPCwav2vecCNN+GRU全CNN结构依赖RNN上下文建模并行计算效率更高训练效率较低更适合大规模训练wav2vec简介2019年FacebookAIResearch提出延续CPC的对比学习思想CS3245

–

Information

Retrieval多模态机器学习53Ch.

11-12自监督预训练模型(wav2vec)wav2vec2.0引入Transformer;加入量化模块提升大规模语音建模能力优势在LibriSpeech等数据集达到SOTA大幅降低ASR标注需求局限对比学习依赖正负样本设计量化器训练复杂因此提出HuBERT:更加稳定的自监督语音表示学习方法非ASR任务表现有限CS3245

–

Information

Retrieval多模态机器学习54Ch.

11-12自监督预训练模型(HuBERT)wav2vec2.0HuBERT量化器生成目标聚类生成目标对比预测Mask预测训练复杂更稳定HuBER

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论