多模态机器学习 课件 第1-7章 绪论、文本特征提取-多模态融合_第1页
多模态机器学习 课件 第1-7章 绪论、文本特征提取-多模态融合_第2页
多模态机器学习 课件 第1-7章 绪论、文本特征提取-多模态融合_第3页
多模态机器学习 课件 第1-7章 绪论、文本特征提取-多模态融合_第4页
多模态机器学习 课件 第1-7章 绪论、文本特征提取-多模态融合_第5页
已阅读5页,还剩224页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Introduction

to

Information

Retrieval绪论Live

Q&A/jinCS3245

–

Information

Retrieval多模态机器学习2世界是多模态的人类通过视觉、听觉、味觉等多种感官获取信息不同模态信息相互补充、融合,形成更加准确的认知人工智能需要具备类似的人类多模态理解能力多模态机器学习(MultimodalMachineLearning,MML)研究如何融合不同形式的数据,实现理解、推理与生成相比单模态学习,多模态学习能够利用更丰富的信息Ch.

11-12多模态信息与人工智能CS3245

–

Information

Retrieval多模态机器学习3多模态(Multimodality)同一对象或语义下存在的不同形式的信息典型形式:同一对象的多媒体数据:图像、视频、文本描述不同传感器数据:RGB图像、红外图像、医学影像不同结构的信息表示:图像、语言、公式、符号Ch.

11-12什么是多模态?

同一事物的不同模态:图像、中文描述和英文描述CS3245

–

Information

Retrieval多模态机器学习41.异质性(Heterogeneity)不同模态具有不同的数据结构和表达形式图像:像素矩阵文本:词语序列Ch.

11-12多模态数据的核心性质CS3245

–

Information

Retrieval多模态机器学习52.相关性(Correlation)不同模态描述同一对象,包含共享信息模态间存在语义关联

Ch.

11-12多模态数据的核心性质CS3245

–

Information

Retrieval多模态机器学习63.交互性(Interaction)多模态融合产生新的信息模态之间相互作用增强理解能力Ch.

11-12多模态数据的核心性质CS3245

–

Information

Retrieval多模态机器学习7表示学习(Representation)

学习统一、多模态语义表示翻译(Translation)

实现不同模态之间转换对齐(Alignment)

建立不同模态之间对应关系融合(Fusion)

综合多模态信息进行决策协同学习(Co-learning)

利用辅助模态增强目标模态Ch.

11-12主要研究内容CS3245

–

Information

Retrieval多模态机器学习8目标:学习能够表达跨模态信息的统一表示两类方法:1.表示融合将多个模态映射到共享空间前期融合、后期融合、混合融合Ch.

11-12多模态表示学习CS3245

–

Information

Retrieval多模态机器学习91.表示融合前期融合:表示层面融合,先融合多单模态表示得到统一多模态表示,再送入单模态适配模型。后期融合:决策层面融合,各模态单独训练模型生成独立模态决策,再融合全部决策输出最终结果。混合融合:融合前期、后期融合两种思路,同时完成表征层融合与决策层融合。Ch.

11-12多模态表示学习CS3245

–

Information

Retrieval多模态机器学习102.表示协同利用辅助模态增强目标模态常用于训练阶段多模态、测试阶段单模态场景

Ch.

11-12多模态表示学习CS3245

–

Information

Retrieval多模态机器学习11目标:根据一种或多种模态生成新的目标模态三类任务:多模态总结从丰富信息生成简洁描述多模态翻译模态之间语义保持一致转换多模态创作根据条件生成新的内容Ch.

11-12多模态生成CS3245

–

Information

Retrieval多模态机器学习12目标:建立不同模态之间的对应关系存在不同粒度对齐跨模态检索中,对齐对象是同一事物的图像数据和文本数据。图像语义分割中,对齐对象是图像数据中的某个区域与文本数据中的某个单词。Ch.

11-12多模态生成CS3245

–

Information

Retrieval多模态机器学习13目标:建立不同模态之间的对应关系两类方法:显式对齐直接学习模态间对应关系代表:跨模态对比学习隐式对齐学习不同模态空间之间的潜在联系代表:对抗学习Ch.

11-12多模态生成CS3245

–

Information

Retrieval多模态机器学习14早期阶段:心理学与认知研究McGurk效应揭示多模态信息交互作用计算模型阶段AVSR语音识别手势语音转换系统深度学习阶段深度表示学习推动多模态发展图像描述、多模态翻译等任务快速发展当前趋势大规模预训练模型推动多模态智能发展Ch.

11-12多模态对齐CS3245

–

Information

Retrieval多模态机器学习15三大任务类别Ch.

11-12多模态机器学习主要任务CS3245

–

Information

Retrieval多模态机器学习16智能推荐融合商品图像、文本、用户行为实现个性化推荐Ch.

11-12多模态机器学习应用淘宝平台中个性化推荐界面CS3245

–

Information

Retrieval多模态机器学习17智能气象预测融合卫星图像、雷达数据提升天气预测能力Ch.

11-12多模态机器学习应用华为云盘古气象模型预测结果展示

CS3245

–

Information

Retrieval多模态机器学习18自动驾驶融合摄像头、雷达、传感器实现环境理解与决策Ch.

11-12多模态机器学习应用CS3245

–

Information

Retrieval多模态机器学习19多模态智能交互多模态对话系统能够:理解多源输入信息;融合不同模态内容;生成更加自然、智能的回复GPT-4等大型多模态模型支持

Ch.

11-12多模态机器学习应用CS3245

–

Information

Retrieval多模态机器学习20人机交互多模态大模型支持图像+文本理解实现自然语言交互医疗健康融合MRI、PET等医学影像辅助疾病预测与诊断科学研究AlphaFold利用多模态信息预测蛋白结构加速生命科学研究Ch.

11-12多模态智能应用拓展CS3245

–

Information

Retrieval多模态机器学习21多模态机器学习:面向真实世界复杂信息环境通过融合多源数据提升机器理解能力已广泛应用于:推荐系统自动驾驶智能交互医疗科研未来方向:构建具备感知、理解、推理能力的多模态人工智能系统Ch.

11-12小结NLPCoreModules文本特征提取自然语言处理核心技术核心定义:向量化的艺术文本特征提取是NLP的基础任务,旨在将非结构化的文本数据转换为机器可处理的结构化数值向量。它本质上是一个向量化建模过程,将人类可读的文本符号映射到数学空间,是实现机器理解语言的第一步。为什么它如此重要?捕捉语义本质:不仅是对词汇的简单统计,更是对文本真实含义、情感倾向与上下文逻辑的深度量化表达。决定模型上限:为分类、情感分析、相似度计算等下游任务提供高质量输入,直接影响AI模型的最终效果与准确率。降维与提效:将稀疏、高维的原始文本数据转化为稠密、低维的特征向量,大幅降低计算复杂度,提升模型训练与推理的效率。文本特征提取:从文字到向量PART01传统文本特征提取方法词袋模型(BoW)核心思想:忽略顺序的“词汇统计”将文本视为一个无序的词汇“袋子”,核心关注词汇的出现频率,完全舍弃词序、语法结构及上下文语义关联。标准实现流程构建词表:从语料库中提取所有唯一词汇,形成全局Vocabulary初始化向量:为每个文档创建长度等于词表大小的零向量填充频率:统计词汇出现次数,将频率值填入向量对应维度✅核心优势:实现简单直观,计算效率极高,是文本分类任务的经典基线模型。❌主要局限:丢失语序信息(无法区分语义相反的句子)、易造成维度灾难、存在语义鸿沟(无法理解一词多义)。自然语言处理基础独热编码(One-hotEncoding)核心机制:词袋模型的简化特例,向量值仅取0或1,1代表词汇在文档中出现,0代表未出现。关键特征:仅关注词的“存在性”而非出现频率,极大简化了向量结构,但也丢失了词频这一重要的统计特征。适用场景:轻量级文本匹配、快速存在性检索,或对词频敏感度较低的基础分类任务。N-grams语言模型核心思想:打破词袋的无序性,将连续的N个词作为一个整体特征单元(如2-gram“纽约”、3-gram“人工智能”)。核心优势:能够捕捉局部上下文关联与短语级语义,有效弥补了BoW丢失语序的缺陷,提升语义表达能力。潜在挑战:随着N的增大,特征空间会呈指数级膨胀,导致数据稀疏性加剧,同时显著增加计算与存储成本。BoW的变体:独热编码与N-grams文本特征工程核心原理:加权词袋模型词频(TF):单一文档内,词出现的频率越高,对该文档越重要。逆文档频率(IDF):全语料库中,含该词的文档越少,其区分度越高。计算公式:TF-IDF=TF×log(N/df),其中N为总文档数,df为含词文档数。算法优劣势分析优点:自动降低“的、是”等通用停用词权重,突出核心关键词。局限:仅基于统计频率,无法理解词义、语境及语义相似度。词频-逆文本频率(TF-IDF)“重要的词,不仅在本文档中常见,在全库中罕见”TF-IDF是信息检索与文本挖掘的基石,通过简单的统计学方法,高效量化词语对文档的表征能力,是理解文本向量空间模型的第一步。从统计视角定义关键词权重,解决传统词袋模型权重同质化问题基于主题模型的方法主题模型旨在从海量非结构化文本中自动挖掘潜在的语义主题结构,其本质是建立“文档-主题-词汇”的三层概率生成机制,解决传统词袋模型语义稀疏与歧义问题。LSA(潜在语义分析):通过奇异值分解(SVD)对高维词-文档矩阵降维,映射至低维潜在语义空间,有效发现词汇间的隐性关联。PLSA(概率潜在语义分析):为LSA赋予概率模型解释,假设文档是主题的混合分布,主题是词汇的概率分布,奠定了概率生成模型的基础。LDA(隐狄利克雷分配):引入狄利克雷先验分布,构建完全贝叶斯模型,具备更强的泛化能力,能够对未见文档进行有效主题推断。PLSA与LDA的概率图模型结构对比(左为PLSA,右为LDA)Part2:DeepLearningModels基于神经网络的

文本特征提取方法自然语言处理基础什么是静态词向量?指词在模型训练完成后,其向量表示即固定不变,不会随上下文语境的变化而动态调整,是词嵌入技术中最基础的表示形式。Word2vec:分布式语义假设•核心思想:“一个词的含义由其周围的词决定”,通过浅层神经网络在海量文本中学习稠密向量。•经典特性:向量空间具备线性语义关联,如vec(国王)-vec(男人)+vec(女人)≈vec(王后),直观体现语义推理。GloVe:融合全局与局部统计•原理:结合全局词频统计(共现矩阵)与局部上下文窗口优势,通过最小化重构误差训练。•优势:既保留全局语料的统计规律,又捕捉局部语境的语义联系,在小数据场景下表现更稳健。静态词向量:语义的固定表达词向量模型解析CBOW(ContinuousBag-of-Words)逻辑:以目标词的上下文词向量作为输入,通过求和平均后预测中心词。优势:训练收敛速度快,对高频词汇的语义表征更稳健,计算效率高。Skip-gram逻辑:以中心词为输入,分别预测其在窗口内的上下文词汇。优势:能更好地学习到低频/罕见词的特征表示,语义捕捉更细腻。Word2vec的两种核心架构序列模型:RNN与LSTM循环神经网络(RNN):时序建模的基础利用循环结构将前一时刻的隐藏状态传递到当前时刻,打破了传统神经网络的输入长度限制,能够处理任意长度的序列数据,捕捉文本的上下文关联。长短期记忆(LSTM):突破长期依赖瓶颈引入“输入门、遗忘门、输出门”三大门控机制,精准控制信息的保留与遗忘,解决了传统RNN的梯度消失问题,能够有效建模长距离的语义依赖关系。模型结构解析:图中展示了RNN的两种形态:上方为折叠结构,体现了网络的循环特性;下方为按时间步展开的结构,清晰展示了信息如何在时间轴上流动和传递。这种链式结构使其天然适合处理语音、文本等序列数据。核心价值:为每个词生成动态的上下文感知表示,是机器翻译、文本生成等任务的核心基石循环神经网络进阶LSTM通过三个可学习的“门”结构来精确控制信息的流动与遗忘,解决了传统RNN难以捕捉长距离依赖的问题:❶遗忘门(ForgetGate):决定从细胞状态(CellState)中丢弃哪些历史冗余信息,是实现“忘记”的关键。❷输入门(InputGate):筛选当前时刻的输入信息,决定有多少新内容需要更新并加入到细胞状态中。❸输出门(OutputGate):基于更新后的细胞状态,计算并输出当前时刻的隐藏状态(HiddenState)。LSTM:长短期记忆网络的门控机制什么是动态词向量?不同于静态词向量(如Word2Vec),动态词向量能根据上下文语境实时调整词的语义表示,完美解决“一词多义”难题,是现代大模型的基础。ELMo:双向语境的先驱基于双向LSTM架构,通过预训练提取不同层级的特征并加权融合,生成包含句法与语义信息的深度语境化向量。GPT:生成式语言模型基于TransformerDecoder,采用自回归语言模型预训练,专注于单向上下文建模,在文本生成任务上表现卓越。BERT:双向理解的变革者基于TransformerEncoder,利用掩码语言模型(MLM)实现双向上下文建模,成为NLP领域通用的预训练基座。动态词向量与预训练模型核心价值:预训练模型通过大规模无监督数据学习通用语言知识,极大降低了下游任务的标注成本,实现了NLP技术的工业化落地。BERT模型核心机制详解创新的预训练任务设计掩码语言模型(MLM):随机遮盖15%的输入词,模型预测被遮盖部分,强制学习双向上下文语义,打破传统单向语言模型的限制。下一句预测(NSP):输入句子对,模型判断第二句是否为第一句的真实后续,有效增强模型对句间逻辑与篇章连贯性的理解。三位一体的输入表示体系将三个向量相加作为输入:TokenEmbedding(词本身语义)+SegmentEmbedding(区分句子A/B)+PositionEmbedding(绝对位置编码),实现对文本语义、结构与语序的多维编码。Introduction

to

Information

Retrieval语音特征Live

Q&A/jinCS3245

–

Information

Retrieval多模态机器学习373.1数据采集:声音如何从物理信号转变为数字信号。3.2预处理:为特征提取做准备的关键步骤(预加重、分帧、加窗)。3.3手工特征提取:传统方法,涉及时域、频域和倒谱域分析。3.4基于神经网络的特征提取:利用深度学习和预训练模型自动学习特征。核心思想:将原始、不定长的语音信号转换为计算机易于处理的、固定长度的特征向量。Ch.

11-12本章内容概述CS3245

–

Information

Retrieval多模态机器学习38声音的本质:是一种通过介质(如空气)传播的纵波。由声源振动产生,引起空气压力波动。关键物理参数:频率:单位时间内声波的周期数;决定音调的高低。频率越高,则声音的音调越高,反之,则音调越低。振幅:在振动中距离其振动中心的最大位移;反映声波携带能量多少;决定响度的大小。振幅越大,则声音的响度越大,反之,则响度越小。

Ch.

11-12声音的物理特性与信号转换CS3245

–

Information

Retrieval多模态机器学习39采集流程:麦克风接收声波→转换为模拟信号(连续电压信号)。为了使计算机可以处理这种信号,必须先对其进行采样(sampling)和量化(quantify)将其转化为时间和幅度上均呈离散变化的数字信号。

Ch.

11-12声音的物理特性与信号转换CS3245

–

Information

Retrieval多模态机器学习40定义:在时间轴上对连续模拟信号进行离散化取值。关键指标:采样率(Hz),即每秒采样的点数。采样率越高→间隔越小→波形越逼真奈奎斯特定理:采样率需至少为信号最高频率的2倍,才能完整保留信息。典型采样率:电话/嵌入式设备:8kHz智能手机/计算机:8kHz~44.1kHz专业音乐制作:88.2kHz/96kHzCh.

11-12采样CS3245

–

Information

Retrieval多模态机器学习41定义:在幅度轴上对采样值进行离散化处理。将幅度划分为有限区间同一区间内的采样点用同一幅度值表示量化位数:表示每个采样点所用的二进制位数(如8位、16位)。8位量化示例:00000000₂(0)~11111111₂(255)振幅划分为256个等级影响:位数越高,精度越高,质量越好,但存储空间也越大。Ch.

11-12量化量化失真量化失真:量化前后波形存在差异→信息损失一种不可逆的信息损失。CS3245

–

Information

Retrieval多模态机器学习43为什么需要预加重?唇端辐射抑制效应→高频能量明显降低高频缺失→共振峰不明显→音素信息丢失预加重的本质一阶高通滤波器提升高频部分相对低频的能量弥补高频损耗,保护声道信息目的:弥补语音信号在传播过程中高频部分的能量损耗。Ch.

11-12预处理:预加重CS3245

–

Information

Retrieval多模态机器学习44

Ch.

11-12预处理:预加重CS3245

–

Information

Retrieval多模态机器学习45短时分析思想语音信号宏观不平稳→短时(20-50ms)近似平稳浊音时声带振动有规律→短时内基音频率相对稳定帧长定义:一帧信号的时间长度上限:<音素长度(50ms),保证平稳性下限:>基音周期(约10ms),保证频率分析准确常见取值:20ms~50msCh.

11-12预处理:分帧CS3245

–

Information

Retrieval多模态机器学习46帧移:前后帧之间的重叠长度->保证语音特征的连续性和平滑性方式:重叠取帧计算示例采样率:16kHz;帧长:25ms→400个采样点帧移:10ms→160个采样点Ch.

11-12预处理:分帧CS3245

–

Information

Retrieval多模态机器学习47

Ch.

11-12预处理(二):加窗CS3245

–

Information

Retrieval多模态机器学习48常见窗函数:矩形窗:频率分辨率高,但无法解决频谱泄露问题。汉明窗(最常用):能有效克服频谱泄露,很好地保留原信号频率特性。汉宁窗:与汉明窗类似,加权系数不同,频率分辨率较好。Ch.

11-12预处理(二):加窗

注:分帧本身相当于加矩形窗CS3245

–

Information

Retrieval多模态机器学习49原理:直接从语音信号的波形中分析提取特征。1.短时能量与短时平均幅度计算:每帧信号的能量(平方和)或幅值(绝对值之和)。用途:区分浊音(能量高)和清音(能量低),区分有声段与无声段。Ch.

11-12时域特征提取

CS3245

–

Information

Retrieval多模态机器学习50短时能量特点度量能量波动平方运算→放大高低信号差距短时平均幅度特点绝对值代替平方→简化运算对信号电平高低不敏感共同用途区分浊音(能量大)与清音(能量小)信噪比高时,区分有声段与无声段Ch.

11-12时域特征提取

CS3245

–

Information

Retrieval多模态机器学习512.短时过零率计算:一帧内信号穿过零电平的次数。用途:区分浊音与清音浊音:过零率低,集中在低频端清音:过零率高,集中在高频端端点检测(VAD)短时能量:适用于背景噪声小短时过零率:适用于背景噪声大两者结合→准确判断有声段/无声段起止点Ch.

11-12时域特征提取CS3245

–

Information

Retrieval多模态机器学习523.短时自相关函数计算:信号与其延迟信号之间的相似度。短时自相关函数:可用于语音区分浊音:自相关函数具有周期性清音:类似白噪声,无周期性基音周期估算:根据第一个峰值位置确定基音周期窗长选择:需>2倍基音周期(保证检测到峰值)不宜过大(保证短时平稳性)Ch.

11-12时域特征提取加窗处理后得到

修正的短时自相关函数背景:标准自相关要求窗长>2倍基音周期不同人基音周期差异大→需动态调整窗长窗长固定无法同时满足所有情况核心思路两个长度不同的窗口短窗包含N个样本点长窗额外包含K个样本点保证乘积项数恒为N(短窗长度)

修正的短时自相关函数

修正的短时自相关函数维度窗口数量一个两个(长短各一)两段序列同一段不同段乘积项数随k减少恒为N本质自相关互相关对称性偶函数非偶函数基音检测可行可行(峰值法)本质:修正函数是两段不同有限语音段的互相关不是严格意义上的自相关;不满足偶函数性质基音检测:虽不是自相关,但在周期整数倍处仍出现峰值仍可根据峰值位置推测基音周期;实际应用中有效频域分析的生物学与工程学基础生物学依据人类听觉机制:人耳基底膜相当于一台精密的“频谱分析仪”。感知基础:人类对语音的感知高度依赖于对其动态频谱的分析。技术推导核心概念:频谱是频率谱密度的简称,本质是频率的分布曲线。频域分析定义与意义定义:利用语音信号的频谱信息来捕捉信号特征的技术。地位:是认识和处理语音信号必不可少的技术手段。CS3245

–

Information

Retrieval多模态机器学习57语音信号具有明显的非平稳特性

长时间范围内,语音波形随时间快速变化但在短时间范围内,可近似看作平稳信号传统傅里叶变换(FT)的局限:假设信号具有整体平稳性无法反映语音信号随时间变化的频率特征1946年,Gabor提出短时傅里叶变换(Short-TimeFourierTransform,STFT)

通过短时窗口对语音进行局部频域分析实现时域与频域信息的联合表示Ch.

11-12短时傅里叶变换(STFT)CS3245

–

Information

Retrieval多模态机器学习58

Ch.

11-12短时傅里叶变换(STFT)CS3245

–

Information

Retrieval多模态机器学习59

Ch.

11-12短时傅里叶变换(STFT)CS3245

–

Information

Retrieval多模态机器学习60固定窗长带来的时间–频率分辨率折中STFT采用固定长度窗函数:短窗:时间分辨率高;频率分辨率低长窗:频率分辨率高;时间分辨率低因此固定窗长无法同时满足快速变化语音信号的时域分析需求和精细频率分析需求。主要问题缺乏自适应能力对非平稳语音信号分析存在限制需要结合其他方法进一步提升时频分析性能Ch.

11-12短时傅里叶变换(STFT)CS3245

–

Information

Retrieval多模态机器学习61定义:一种用于描述语音信号时频变化特征的二维表示方法。坐标含义:横轴:时间

纵轴:频率

颜色深浅:频谱能量大小

Ch.

11-12语谱图CS3245

–

Information

Retrieval多模态机器学习62语谱图反映:不同时间位置上的频率分布语音频谱随时间的动态变化过程将语音信号三维信息(时间、频率、幅值)映射到二维平面可视化。Ch.

11-12语谱图语谱图生成过程

语谱图的特点与应用语谱图包含丰富的语音信息,通过其可以观察:共振峰特征

反映发音器官的声学特性基音频率

表征语音的周期性结构清音/浊音特征

判断不同发声类型应用领域:广泛应用于语音识别(ASR);语音合成(TTS);说话人识别;语音情感分析谱质心(SpectralCentroid)谱质心定义谱质心是描述声音音色特征的重要声学参数。表示语音信号频谱中能量分布的中心位置

即频率成分的“能量重心”计算方式:对不同频率分量进行能量加权平均单位:Hz1977年由Grey提出。谱质心计算方法

归一化能量分布:因此:谱质心的特点与应用谱质心反映声音明亮程度谱质心较高

高频能量占比较大;声音更加明亮、清晰谱质心较低

低频能量占比较大;声音更加低沉、浑厚应用领域:🎵音乐分类🌳环境声音识别😊音乐情绪分析🗣️语音特征分析总结谱质心通过量化频谱能量分布中心,有效刻画声音的音色和频率特性,是重要的低层声学特征。CS3245

–

Information

Retrieval多模态机器学习68

Ch.

11-12倒谱域分析CS3245

–

Information

Retrieval多模态机器学习69

Ch.

11-12倒谱特征提取步骤CS3245

–

Information

Retrieval多模态机器学习70Mel频率倒谱系数(MFCC)MFCC(Mel-FrequencyCepstralCoefficient)1980年由Davis和Mermelstein提出特点基于人耳听觉感知特性不依赖输入信号假设对噪声具有较好的鲁棒性应用语音识别(ASR);说话人识别;语音情感分析;语音分类Ch.

11-12常用倒谱特征——MFCCMFCC特征提取流程图CS3245

–

Information

Retrieval多模态机器学习72

Ch.

11-12Mel尺度(MelScale)更加符合人耳听觉特性CS3245

–

Information

Retrieval多模态机器学习73Mel滤波器组:由多个三角滤波器组成对频谱进行非线性压缩主要作用平滑频谱降低谐波影响突出语音共振峰降低计算复杂度Ch.

11-12Mel滤波器组作用CS3245

–

Information

Retrieval多模态机器学习74

Ch.

11-12FBank特征提取

CS3245

–

Information

Retrieval多模态机器学习75

Ch.

11-12离散余弦变换(DCT)CS3245

–

Information

Retrieval多模态机器学习76

Ch.

11-12动态差分MFCCCS3245

–

Information

Retrieval多模态机器学习77

Ch.

11-12MFCC特征总结CS3245

–

Information

Retrieval多模态机器学习78

Ch.

11-12线性预测编码(LPC)CS3245

–

Information

Retrieval多模态机器学习79优势:能够从局部时频区域中学习有效模式。输入形式:1DCNN:直接处理原始语音信号。2DCNN:处理“图像化”的语音特征,如语谱图、Mel语谱图。核心操作:卷积层:使用多个卷积核提取局部特征,生成特征图。池化层:进行下采样,压缩特征,减少计算量,并增强鲁棒性(对微小平移不敏感)。作用:在语音特征提取中作为“前端”特征抽取器。

Ch.

11-12卷积神经网络(CNN)的应用卷积神经网络(CNN)的应用1DCNN:直接处理原始语音信号2DCNN:处理“图像化”的语音特征,如语谱图CS3245

–

Information

Retrieval多模态机器学习81Ch.

11-12RNN的应用RNN(循环神经网络)专为处理时序数据设计,能捕捉语音信号中的长时上下文依赖。输入:原始信号或帧级特征(如MFCC)。变种:LSTM

通过门控机制解决长期依赖问题。CS3245

–

Information

Retrieval多模态机器学习82CRNN(卷积循环神经网络)结构:CNN+RNN。流程:CNN负责提取局部声学特征→RNN负责建模时间序列上的全局依赖。优势:结合了CNN的特征抽取能力和RNN的时序建模能力。Ch.

11-12CRNN的应用自监督语音预训练模型

自监督预训练模型(CPC)CPC基本思想2018年DeepMind提出基于对比学习(ContrastiveLearning)

核心思想:利用语音序列之间的时间关联,预测未来语音表示,学习有效特征。目标捕获上下文信息去除噪声信息学习高质量语音表示自监督预训练模型(CPC)

CS3245

–

Information

Retrieval多模态机器学习86Ch.

11-12自监督预训练模型(wav2vec)CPCwav2vecCNN+GRU全CNN结构依赖RNN上下文建模并行计算效率更高训练效率较低更适合大规模训练wav2vec简介2019年FacebookAIResearch提出延续CPC的对比学习思想与CPC区别CS3245

–

Information

Retrieval多模态机器学习87Ch.

11-12自监督预训练模型(wav2vec)CPCwav2vecCNN+GRU全CNN结构依赖RNN上下文建模并行计算效率更高训练效率较低更适合大规模训练wav2vec简介2019年FacebookAIResearch提出延续CPC的对比学习思想CS3245

–

Information

Retrieval多模态机器学习88Ch.

11-12自监督预训练模型(wav2vec)wav2vec2.0引入Transformer;加入量化模块提升大规模语音建模能力优势在LibriSpeech等数据集达到SOTA大幅降低ASR标注需求局限对比学习依赖正负样本设计量化器训练复杂因此提出HuBERT:更加稳定的自监督语音表示学习方法非ASR任务表现有限CS3245

–

Information

Retrieval多模态机器学习89Ch.

11-12自监督预训练模型(HuBERT)wav2vec2.0HuBERT量化器生成目标聚类生成目标对比预测Mask预测训练复杂更稳定HuBERT(HybridUniversalBERT)2021年FacebookAIResearch提出核心思想:使用聚类生成伪标签,通过掩码预测学习语音表示。与wav2vec2.0区别CS3245

–

Information

Retrieval多模态机器学习90Ch.

11-12自监督预训练模型(HuBERT)HuBERT(HybridUniversalBERT)2021年FacebookAIResearch提出核心思想:使用聚类生成伪标签,通过掩码预测学习语音表示。CS3245

–

Information

Retrieval多模态机器学习91Ch.

11-12自监督预训练模对比模型核心思想特点CPC对比预测未来首次引入自监督语音表示wav2vecCNN+对比学习提升训练效率wav2vec2.0Transformer+量化ASR性能突破HuBERTMask+聚类标签训练稳定WavLM噪声增强+相对位置通用语音表示自监督预训练模型通过利用大规模无标注语音数据学习通用表示,有效降低了语音任务对人工标注数据的依赖,并成为当前语音表示学习的重要方向。CS3245

–

Information

Retrieval多模态机器学习92数据采集:完成了从物理声波到数字信号的转换。预处理:通过预加重、分帧、加窗,为特征提取做好准备。手工特征:时域:短时能量、过零率等,物理意义明确。频域:语谱图、谱质心,反映频谱特性。倒谱域:MFCC,符合人耳听觉,是经典特征。LPC:模型化发声过程,参数高效。神经网络特征:CNN/RNN/CRNN:自动学习更优的深层特征表示。预训练模型(CPC/wav2vec/HuBERT):利用海量无标注数据,大幅提升下游任务性能。Ch.

11-12小结Introduction

to

Information

Retrieval图像特征

Live

Q&A/jinCS3245

–

Information

Retrieval多模态机器学习944.1图像特征基本概念:图像存储格式与理想特征的性质。4.2手工特征提取:局部特征:斑点、边缘、角点。全局特征:直方图、SIFT、SURF等。4.3基于神经网络的特征提取:卷积神经网络(CNN)基础。经典模型:LeNet、AlexNet、VGG、GoogleNet、ResNet。新方法:ViT与对比学习(SimCLR)。核心思想:将量级庞大、含冗余信息的图像像素数据,转换为量级较小、能描述关键内容的特征向量。Ch.

11-12本章内容概述CS3245

–

Information

Retrieval多模态机器学习95图像本质:由像素组成的矩阵,分辨率为宽×高。主流色彩模式:RGB(最常用):三通道(R/G/B),每个通道取值0~255。输入格式:C(通道)×W×H的三维矩阵。HSV:H(色调)、S(饱和度)、V(明度),符合人类视觉直觉。灰度图:单通道二维矩阵,取值0~255(黑~白)。注意事项:传统手工特征提取一般只接受灰度图输入。神经网络方法可直接处理RGB三维矩阵,保留更丰富的信息。Ch.

11-12图像在计算机中的表示CS3245

–

Information

Retrieval多模态机器学习96稳定性(Robustness)对输入图像的微小变化(如噪声、亮度微调),特征值不应剧烈变化。保证特征在不同图像中具有较好的一致性。仿射不变性(AffineInvariance)无论图像如何平移、旋转、缩放,都能提取到相同的特征。泛化性(Generalization)主要针对神经网络方法。模型能够适用于未见过的图像,而非仅记忆训练集。Ch.

11-12一个理想的图像特征应具备的性质CS3245

–

Information

Retrieval多模态机器学习97历史地位:伴随计算机视觉学科发展而出现,是传统方法的核心。优点:计算效率高,物理意义明确。缺点:处理复杂图像内容的能力有限。适用场景:特征明显、变化规律简单、语义简单的任务(如目标匹配、人脸识别)。分类:局部特征:关注图像中局部的形状特征(斑点、边缘、角点)。全局特征:对整个图像进行总体统计描述。Ch.

11-12手工特征提取概述CS3245

–

Information

Retrieval多模态机器学习98定义:在像素坐标系中,对每个像素的值与周围像素的值进行计算,得到新的像素值。滤波核:用于计算的权重矩阵。响应图:对所有像素进行空间滤波后得到的结果图像,尺寸与原图一致。Ch.

11-12局部特征提取的基础:空间滤波CS3245

–

Information

Retrieval多模态机器学习99关键步骤:扩充(Padding):为让边缘像素也参与计算,需在图像外围补零。阈值化:响应值可能超出0~255范围,需设定阈值筛选并归一化。本质:响应图中的每个像素值,代表该点附近某种形状特征(如点、边、角)的显著性。Ch.

11-12局部特征提取的基础:空间滤波CS3245

–

Information

Retrieval多模态机器学习100

Ch.

11-12斑点特征(LoG)CS3245

–

Information

Retrieval多模态机器学习101Ch.

11-12斑点特征(LoG)LoG滤波效果示意图:原图(左)以及检测结果(右)LoG滤波核示意图:3D视图(左)以及表格视图(右)LoG(高斯拉普拉斯)CS3245

–

Information

Retrieval多模态机器学习102

Ch.

11-12斑点特征(DoG)斑点特征(DoG)DoG差分计算示意图DoG与LoG曲线对比图两种计算结果大体相似CS3245

–

Information

Retrieval多模态机器学习104定义:图像中灰度沿某个方向显著变化、沿另一个方向变化不大的区域。常见检测方法:Sobel边缘特征Canny边缘特征LoG/Marr边缘特征Ch.

11-12边缘特征CS3245

–

Information

Retrieval多模态机器学习105定义:对图像区域内两个正交方向(X/Y)亮度变化的描述。核心原理:边缘处法线方向存在显著且均匀的亮度差异。检测方式:X方向计算差值→检测垂直边缘Y方向计算差值→检测水平边缘合成两个分量的向量模量→作为最终边缘响应Ch.

11-12Sobel边缘特征核设计特点:中间隔一列/行→采用中心差分,误差更小中心取2、两侧取1→重点计算主方向差值,兼顾邻域平均CS3245

–

Information

Retrieval多模态机器学习106定义:对图像区域内两个正交方向(X/Y)亮度变化的描述。核心原理:边缘处法线方向存在显著且均匀的亮度差异。检测方式:X方向计算差值→检测垂直边缘Y方向计算差值→检测水平边缘合成两个分量的向量模量→作为最终边缘响应Ch.

11-12Sobel边缘特征CS3245

–

Information

Retrieval多模态机器学习107核设计特点:中间隔一列/行→采用中心差分,误差更小中心取2、两侧取1→重点计算主方向差值,兼顾邻域平均Ch.

11-12Sobel边缘特征CS3245

–

Information

Retrieval多模态机器学习108

Ch.

11-12Sobel边缘特征CS3245

–

Information

Retrieval多模态机器学习109

Ch.

11-12Sobel边缘特征

CS3245

–

Information

Retrieval多模态机器学习110定位:改进Sobel,通过筛选去除冗杂响应,使边缘更清晰、简洁三步核心流程:高斯平滑

→防止结果过度敏感,使Sobel响应更平滑非极大值抑制

→取响应峰值,去除密集、重复的边缘响应滞后阈值(双阈值)→高于上限设为白,低于下限设为黑核心优势:Ch.

11-12Canny边缘特征双阈值策略更好避免噪声影响得到更精确干净的边缘响应CS3245

–

Information

Retrieval多模态机器学习111思想:LoG既可检测斑点(大滤波核),也可检测边缘(小滤波核)本质:Sobel是一阶差分近似,LoG是二阶差分近似边缘处亮度函数经过拐点→一阶导为零,二阶导非零边缘越尖锐→二阶导数值越大响应计算:直接求取像素点处的二阶差分LoG值,作为边缘响应多尺度检测:不同大小滤波核与σ值→检测不同粗细的边缘线条优势:效果与Sobel类似,但抗噪声能力更强经典应用:Marr-Hildreth边缘检测方法划分图像为多个小块→分别计算二阶导→寻找二阶导零点→判定边缘位置

Ch.

11-12LoG边缘特征CS3245

–

Information

Retrieval多模态机器学习112定义:边缘的转折点,在两个正交方向上梯度都发生显著变化。Moravec角点思路:计算四个主方向(0°、90°、180°、270°)的亮度变化量,取最小值作为响应。局限:对对角方向的亮度变化不敏感。Harris角点(改进)思路:利用泰勒展开近似任意方向的亮度变化,拟合更精确曲率。优势:检测更精确,对旋转具有较好的一致性。Ch.

11-12角点特征CS3245

–

Information

Retrieval多模态机器学习113动机:避免曲线拟合带来误差,直接通过亮度变化量近似计算曲率核心公式:特定方向(u,v)上的亮度总体变化量计算四个主方向:代入(u,v)=(1,0)、(0,1)、(-1,0)、(0,-1)分别得到水平、垂直及相反方向的亮度变化量Ch.

11-12角点特征-Moravec角点

CS3245

–

Information

Retrieval多模态机器学习114角点判定依据:角点处→四个主方向均出现较大亮度变化边缘处→仅某一方向变化明显平坦区域→各方向变化均较小响应值计算:取四个方向计算结果中的最小值作为该点的角点特征响应值局限性:只考虑四个主方向,对对角方向亮度变化不敏感后续Harris算法针对此问题进行了改进Ch.

11-12角点特征-Moravec角点角点特征-Harris角点改进:通过泰勒展开拟合任意方向曲率,实现更精确角点检测数学推导:像素值通过一阶梯度近似:P(x+i+u,y+j+v)≈P+(∂P/∂x)·u+(∂P/∂y)·v代入亮度变化公式,得到任意方向(u,v)上的变化量E(u,v)E(u,v)=A·u²+2C·uv+B·v²A=Σ(∂P/∂x)²B=Σ(∂P/∂y)²C=Σ(∂P/∂x)·(∂P/∂y)

角点特征-Harris角点简化计算(避免额外梯度计算):原始曲率公式需计算Mx、My(引入额外计算量)Harris通过矩阵分解简化为:κ_k=A·B-C²-k·(A+B)²直接通过A、B、C计算角点响应,无需额外梯度检测效果:角点处响应值显著高于边缘和平坦区域CS3245

–

Information

Retrieval多模态机器学习117定义:对整个图像特定属性的分布进行统计,以柱状图形式表示。特点:输出为固定长度的向量(不依赖于图像尺寸)。对微小扰动不敏感,具有较好的稳定性。常见类型:亮度直方图:横坐标为亮度值,纵坐标为像素数量。梯度方向直方图:横坐标为梯度角度,纵坐标为强度(或像素数量)。处理:通常需要进行归一化,以获得缩放不变性等性质。

Ch.

11-12全局特征(1):直方图CS3245

–

Information

Retrieval多模态机器学习118图像亮度直方图(左)与图像角度-梯度直方图(右)Ch.

11-12全局特征(1):直方图CS3245

–

Information

Retrieval多模态机器学习119全称:尺度不变特征变换(Scale-InvariantFeatureTransform)地位:计算机视觉领域最著名的图像特征描述方法之一。优势:对旋转、缩放、平移具有不变性。对光照变化、噪声、视角变化有很好的容忍度。信息量大,少量特征即可精确描述目标。Ch.

11-12全局特征(2):SIFT概述CS3245

–

Information

Retrieval多模态机器学习120提取四步骤:尺度空间极值点检测(使用DoG)每个尺度空间内递推生成极值点响应图通过平均池化将图像长宽缩放1/2,进入下一个尺度极值点筛选:在相邻尺度的3×3×3邻域内搜索,保留极值绝对值最大点输出:每个极值点包含坐标和尺度信息(x,y,σ)Ch.

11-12全局特征(2):SIFT提取步骤1CS3245

–

Information

Retrieval多模态机器学习121关键点定位(亚像素级矫正)极值点坐标是离散的,与真实值存在偏差通过曲线插值进行矫正,得到真实极值点位置关键点即矫正后的真实极值点过滤条件:移除超出图像范围的点+移除构成边缘的点确定特征点主方向在关键点邻域(半径3×1.5σ)内计算每个点的梯度方向和幅度构建角度-梯度直方图,取波峰方向作为主方向实现旋转不变性输出:特征点由(x,y,σ,θ)完整表示Ch.

11-12全局特征(2):SIFT提取步骤2&3CS3245

–

Information

Retrieval多模态机器学习122生成特征点描述子根据主方向θ旋转邻域内所有点,实现旋转对齐取8×8窗口,划分4个象限(种子点);每个种子点统计8个方向梯度累加实际应用:采用16个种子点(4×4划分),每个特征点生成

16×8=128维向量输出:N×128维特征向量,可用于图像检测、匹配、识别等下游任务Ch.

11-12全局特征(2):SIFT提取步骤4CS3245

–

Information

Retrieval多模态机器学习123SURF(加速稳健特征):SIFT的加速改进版(2006年)。使用Haar小波特征代替梯度直方图来确定主方向。使用积分图加速Haar-like特征计算。优势:计算速度显著快于SIFT,同时保持较好的鲁棒性。Ch.

11-12全局特征(3):SURF及其他方法常用的Haar特征模板

:左二列为边缘特征;中三列为线性特征;右一列为环绕特征。窗口内黑色覆盖的像素减去白色覆盖的像素的结果之和作为一个模板的响应。

CS3245

–

Information

Retrieval多模态机器学习124历史:始于1969年(Fukushima),但受限于算力。21世纪后随算力发展而超越传统方法。核心优势:能够自动学习高阶语义信息。具备更强的仿射不变性和稳定性。可同时提取局部和全局特征(在网络不同位置截取输出)。主流方法:CNN:LeNet→AlexNet→VGG→GoogleNet→ResNet视觉Transformer(ViT)对比学习(SimCLR)Ch.

11-12基于神经网络的特征提取概述CS3245

–

Information

Retrieval多模态机器学习125

Ch.

11-12卷积神经网络(CNN)基础相比全连接层,参数量更少,不易过拟合。堆叠可形成层次化特征CS3245

–

Information

Retrieval多模态机器学习126提出时间:1989年(YannLeCun)历史地位:现代卷积神经网络的开山之作。结构:2个卷积层+平均池化+全连接层。首次将反向传播(BP)

与卷积操作结合。应用:手写数字识别(MNIST数据集),错误率1.7%。贡献:证明了CNN的泛化能力优于全连接网络。LeNet5成为现代CNN的基础架构。Ch.

11-12经典CNN模型(1):LeNetCS3245

–

Information

Retrieval多模态机器学习127Ch.

11-12经典CNN模型(1):LeNetLeNet1结构示意图

LeNet5结构示意图

CS3245

–

Information

Retrieval多模态机器学习128提出时间:2012年(ImageNet冠军)历史意义:以15.3%

失误率夺冠,领先第二名约11%。标志着深度学习在计算机视觉领域的崛起。数据:ImageNet(1000类,120万+张图像)。Ch.

11-12经典CNN模型(2):AlexNetCS3245

–

Information

Retrieval多模态机器学习129结构特点:5个卷积层+3个全连接层。使用GPU进行训练(算力突破)。引入ReLU激活函数、Dropout正则化。

Ch.

11-12经典CNN模型(2):AlexNetCS3245

–

Information

Retrieval多模态机器学习130提出时间:2014年(ILSVRC检测任务冠军)核心设计:全部使用

3×3

小卷积核(K=3,P=1)。感受野相同,但参数量更少(5×5>3×3×2)。引入更多ReLU非线性,提升学习能力。结构规律:特征图尺寸减半时,通道数翻倍。Ch.

11-12经典CNN模型(3):VGGNetCS3245

–

Information

Retrieval多模态机器学习131代表版本:VGG16(13个卷积层+3个全连接层)。局限:参数量巨大(1.38亿),主要由全连接层贡献。Ch.

11-12经典CNN模型(3):VGGNetCS3245

–

Information

Retrieval多模态机器学习132提出时间:2014年(ILSVRC分类/检测双料冠军)核心创新:Inception模块

–增加网络宽度。并排使用1×1、3×3、5×5卷积核。1×1卷积:削减特征图深度,实现稀疏连接,大幅减少参数量。参数量:约500万(仅为VGG16的1/20,AlexNet的1/12)。额外技巧:使用平均池化替代全连接层进行线性化,减少参数。添加辅助分类器缓解梯度消失问题。Ch.

11-12经典CNN模型(4):GoogleNet(InceptionV1)CS3245

–

Information

Retrieval多模态机器学习133GoogleNet卷积层结构Ch.

11-12经典CNN模型(4):GoogleNet(InceptionV1)CS3245

–

Information

Retrieval多模态机器学习134

Ch.

11-12经典CNN模型(5):ResNetCS3245

–

Information

Retrieval多模态机器学习135优势:使深层网络具备回归浅层网络的能力。有效缓解梯度消失问题。成就:2015年ILSVRC冠军,可训练152层网络。影响:ResNet50成为最广泛使用的预训练模型之一。Ch.

11-12经典CNN模型(5):ResNetCS3245

–

Information

Retrieval多模态机器学习136Ch.

11-12经典CNN模型(5):ResNetCS3245

–

Information

Retrieval多模态机器学习137背景:受VisualBert启发,探索Transformer在纯视觉任务中的应用。核心思想:将图像视为“序列”。Ch.

11-12基于Transformer的图像特征提取:ViT将图像切分为固定大小的像素块(Patch)。像素块序列+位置编码→输入Transformer。使用CLStoken的输出进行分类。CS3245

–

Information

Retrieval多模态机器学习138优势:结构简洁,收敛速度快于ResNet。局部细节提取能力强。Ch.

11-12基于Transformer的图像特征提取:ViTAttention结果提供可解释性线索。地位:成为CNN之外的主流图像特征提取新选择。CS3245

–

Information

Retrieval多模态机器学习139背景:传统监督学习受限于人工标注成本,只能学习有限类别。核心思想:自监督对比学习。对同一张图像进行不同的数据增强(旋转、裁剪、颜色变换等)。让模型最大化同一图像不同增强版本特征之间的相似度。Ch.

11-12基于对比学习的图像特征提取:SimCLR最小化不同图像特征之间的相似度。CS3245

–

Information

Retrieval多模态机器学习140优势:无需人工标注,可利用海量无标签数据。预训练模型在下游任务中表现优于有监督预训练。Ch.

11-12基于对比学习的图像特征提取:SimCLRCS3245

–

Information

Retrieval多模态机器学习141图像特征的核心:从高维冗余像素→低维判别性表征。手工特征:局部(斑点、边缘、角点)→关注几何结构。全局(直方图、SIFT/SURF)→关注整体分布。优点:可解释性强、效率高;缺点:复杂场景能力有限。神经网络特征:CNN(LeNet→ResNet):层次化学习,端到端训练。ViT:将Transformer引入视觉,提供新范式。对比学习(SimCLR):自监督利用海量无标签数据。趋势:从手工设计→数据驱动,通用性越来越强。aCh.

11-12本章小结MultimodalMachineLearning视频特征多模态机器学习2视频由连续图像帧构成,同时包含静态外观与动态运动。视频分类、字幕生成、视频问答等任务,都依赖准确的视频特征。目前主要包括三类方法:手工特征提取、神经网络特征提取和预训练模型特征提取。视频本身是多模态信息的结合体,不仅包含图像和声音,还包含深度、动作等其他模态信息。为什么要学习视频特征多模态机器学习3手工设计的视频特征:从时空兴趣点、轨迹和梯度中描述动作。基于神经网络的视频特征:以双流网络和三维卷积自动学习表示。基于预训练模型的视频特征:借助大规模预训练迁移空间与时间知识。其他模态的视频特征:利用骨架、深度、点云、音频等补充视觉信息。本章内容多模态机器学习4时空兴趣点(STIP):寻找空间和时间上变化显著的局部区域。改进的密集轨迹(iDT):用光流跟踪密集采样点并编码轨迹。三维尺度不变特征变换(3D-SIFT):把SIFT扩展到时间维。三维方向梯度直方图(HOG-3D):统计三维时空梯度方向。立方体特征(Cuboid):检测局部响应峰值并描述邻域。手工设计的视频特征多模态机器学习5STIP(Space-timeInterestPoints)在时间和空间两个维度上,图像强度都发生显著变化的局部点。例如:行走视频中,腿部区域随时间变化最明显,因此产生较多兴趣点。常见检测器:Hessian、Harris-3D、Dollar。时空兴趣点(STIP)图5.1行走动作中的时空兴趣点多模态机器学习6构造线性尺度空间:L=g∗f,对视频进行时空平滑。建立二阶矩矩阵:由Lₓ、Lᵧ、Lₜ描述局部空间与时间梯度。计算响应函数:H=det(μ)−k[trace(μ)]³。当x、y、t三个方向的变化都足够大时,该位置被判定为时空兴趣点。Harris-3D兴趣点检测多模态机器学习7DT的核心步骤:多尺度密集采样→光流跟踪→基于轨迹提取关键特征。在各尺度以固定步长采样,排除结构不明显的点,再跟踪其运动路径并提取描述符。密集轨迹:整体流程多模态机器学习8

利用光流跟踪采样点多模态机器学习9轨迹形状:对长度为L的位移序列归一化,得到30维轨迹描述符。轨迹邻域:围绕轨迹构造N×N×L的Cuboid,并划分为时空网格。局部描述符:HOG为96维、HOF为108维、MBH为96维。特征串联:将轨迹、HOG、HOF和MBH描述符连接起来。固定长度编码:使用Bag-of-Features(BoF)得到视频特征表示。轨迹周围的局部描述子多模态机器学习10相机运动估计:假设帧间满足单应性,用RANSAC估计单应性矩阵。特征点选择:结合SURF与Shi-Tomasi。轨迹处理:剔除相机移动产生的背景轨迹。正则化:L₂→L₁。编码:BoF→FisherVector(FV)。改进的密集轨迹(iDT)图5.3改进的密集轨迹多模态机器学习11SIFT具有尺度不变性和旋转不变性,但二维SIFT不能表达时间变化。3D-SIFT将时间轴加入局部邻域,用三维时空梯度描述动作。三维尺度不变特征变换多模态机器学习12时空梯度方向计算:在3D邻域中计算梯度大小m₃D和方向θ、φ。构建加权直方图:对θ、φ分组,经立体角归一化和高斯加权;峰值作为主方向。构建3D-SIFT描述符:将主方向对齐到θ=φ=0,划分子块并串联直方图,形成256维或2048维描述符。3D-SIFT的计算过程多模态机器学习13HOG-3D将二维HOG扩展到x、y、t三个维度。它同时编码局部几何结构与时间运动信息,适用于动作识别。三维方向梯度直方图多模态机器学习14确定局部区域:采样点为中心确定区域Q,并划分单元和子块。平均梯度向量计算:计算每个子块在x、y、t方向的平均梯度。平均梯度量化:使用正多面体(通常n=12或20)量化梯度方向。梯度投影求和:将同一单元内各子块的描述符相加。构建HOG-3D描述符:连接所有单元;M=N=4、n=12时为768维。HOG-3D的计算过程多模态机器学习15为解决Harris-3D对噪声敏感、计算复杂度高等局限,Dollar等提出Cuboid方法。空间域采用高斯滤波器,时间域采用相互正交的一维Gabor滤波器。响应函数的局部最大值为时空兴趣点,并在每个兴趣点处提取Cuboid。立方体特征(Cuboid)多模态机器学习16兴趣点检测:以空间高斯和时间正交一维Gabor滤波计算响应,局部最大值为兴趣点。生成Cuboid:在每个时空兴趣点处提取三维区域,边长约为检测尺度的6倍。构建局部直方图:划分子区域并统计直方图,再用PCA对描述符降维。生成Cuboid原型:对训练集描述符做K-means,聚类中心构成原型库。生成描述子:将新Cuboid与原型库进行比较;相似度超过阈值则归入相应类型,否则作为异常排除。统计视频片段中各类型Cuboid的出现次数,形成Cuboid类型直方图。Cuboid特征提取流程多模态机器学习17手工特征依赖预先定义的检测器、梯度公式和编码规则。神经网络能够从数据中端到端学习外观与运动表示。本节重点介绍两类经典方法:双流网络与三维卷积网络。关键问题:如何保留图像空间信息,同时建模跨帧时间变化?从手工设计到自动学习多模态机器学习18光流是在连续视频帧之间描述物体位置变化的位移向量场。位移向量dₜ(u,v)表示t帧中点(u,v)到t+1帧对应点的移动。光流:显式描述运动多模态机器学习19空间流输入单张图像,学习视频帧中的空间信息。时间流输入连续稠密光流的堆叠,学习运动信息。两路网络分别预测,并在预测阶段进行概率融合。双流卷积神经网络多模态机器学习20二维卷积只在高、宽方向滑动;即使多帧作为通道输入,也会较早压缩时间信息。三维卷积在时间、高、宽三个维度滑动,输出仍是时空特征。体。二维卷积与三维卷积多模态机器学习21八个卷积层:使用3×3×3

的卷积核,步长为1×1×1,并进行边缘填充。五个最大池化层:Pool1为1×2×2,Pool2~Pool5为

2×2×2。两个全连接层:连续连接,为输出层做准备。一个Softmax输出层

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论