人工智能通识与进阶(中篇共上中下3篇)_第1页
人工智能通识与进阶(中篇共上中下3篇)_第2页
人工智能通识与进阶(中篇共上中下3篇)_第3页
人工智能通识与进阶(中篇共上中下3篇)_第4页
人工智能通识与进阶(中篇共上中下3篇)_第5页
已阅读5页,还剩232页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第六章

强化学习:揭秘AI自主进化的核心驱动逻辑问题与导读:AI怎么实现“自学成才”?当AlphaGo在棋盘上落下神之一手,当自动驾驶汽车在复杂路况中自如穿梭,当AI在电子游戏中从新手成长为“大神”,它们背后共同的秘密武器是什么?核心思想:强化学习(ReinforcementLearning,RL)一种模拟人类“尝试-反馈-学习”模式的人工智能技术。它让AI无需预设答案,仅凭与环境的互动和奖励信号,自主探索最优策略。博弈决策·AlphaGo从零开始,通过自我对弈超越人类顶尖棋手复杂控制·自动驾驶在城市路况中自主感知、规划与决策,安全通行策略探索·游戏AI从随机操作到掌握游戏机制,成为通关“大神”AI的“试错学习课堂”Trial&Error模拟人类最自然的

自主成长与决策机制你是否想过,AI是如何像人一样学会应对复杂世界的?AlphaGo落子、自动驾驶避险、游戏AI通关...它们共享同一种核心技术——强化学习(ReinforcementLearning)。不断尝试像学骑车一样

探索不同的动作奖惩反馈从失败与成功中

获取关键经验迭代调整优化决策模型

最终掌握平衡基础交互机制拆解智能体与环境的表扬与批评系统具备长远眼光学习如何让AI具备延迟满足的决策智慧高效协同训练探索“演员-评论家”双网络协同工作的奥秘真实世界落地看懂AI从仿真环境走向真实世界的挑战方案本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读6.1强化学习基本原理监督学习vs强化学习核心概念定义智能体(Agent):学习主体,输入环境观测,输出决策动作。环境(Environment):外部世界,接收动作,反馈新观测与奖励信号。感知:环境提供「观测(Observation)」,作为智能体的输入依据决策:智能体执行「动作(Action)」,直接对环境产生影响与改变持续动态循环非单次决策,而是不断迭代的交互过程累积奖励最大化学习策略π(s)→a,优化长期收益6.1强化学习基本原理:智能体与环境的互动循环6.1强化学习基本原理:三大领域的“试错”实践电子游戏·太空侵略者场景:高维像素输入,离散动作交互奖励:击中+5/通关+1000/碰撞-10核心:即时奖励反馈,动作关联性强棋类博弈·AlphaGo场景:19×19棋盘状态,离散落子动作奖励:极度稀疏,仅终局胜负(+1/-1)核心:长周期延迟反馈,需具备大局观6.1强化学习基本原理:三大领域的“试错”实践自动驾驶·复杂路况场景:多模态融合输入,连续控制动作奖励:多目标动态平衡(安全/舒适/效率)核心:应对现实环境的复杂性与不可预测6.1强化学习基本原理:三大领域的“试错”实践本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读6.2强化学习框架、评价机制与参数优化01/建模构建环境与智能体交互的数学模型,定义状态空间与动作空间。02/评价设计奖励函数与价值网络,量化智能体策略在环境中的表现。03/优化基于梯度下降更新策略网络参数,持续迭代以逼近最优解。强化学习的“三步走”▍核心机制与原理Softmax输出:将网络原始分数转化为概率分布,确保动作的可解释性随机探索机制:按概率采样动作,避免陷入局部最优,实现策略探索6.2强化学习框架--构建智能体模型策略网络:AI的“决策大脑”6.2强化学习框架--制定评价机制

电子游戏中的奖励▍评价标准的演进6.2强化学习框架--制定评价机制

智能体与环境交互轨迹回报R是轨迹τ中所有即时奖励的累加

延迟满足高额回报轨迹(Trajectory,τ)为状态-动作对分配回报权重系数

策略梯度(PolicyGradient)算法6.2强化学习框架--参数优化6.2强化学习框架--参数优化

权重系数定义为状态-动作对分配回报权重系数本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读

6.3评价动作标准的四代演进6.3评价动作标准的四代演进1即时奖励

核心问题短视性:仅关注当前步收益,忽略长期累积回报。解决方案将从当前时刻开始的所有后续奖励求和,衡量动作对长期收益的贡献累积奖励

核心问题高估远期:此计算会高估早期动作的远期价值解决方案引入折扣因子γ,衰减远期收益权重3折扣累积

核心问题高方差:所有历史动作权重均为正,奖励信号波动剧烈,难以收敛解决方案引入状态基线b(s),降低评价方差优势函数

核心问题基准确立后问题基本解决,评价体系趋于稳健核心价值相对优势:直观判断动作优劣(>0优/<0劣)12346.3评价动作的标准-即时奖励评价即时奖励评价方式

即时奖励评价6.3评价动作的标准-即时奖励评价

累积奖励评价方式累积奖励评价6.3评价动作的标准-折扣累积奖励评价

折扣累积奖励评价方式折扣累积奖励评价6.3评价动作的标准-折扣累积奖励评价

折扣因子γ调节了智能体的“远见”程度(1)当γ取值趋近于0时,智能体更关注即时奖励。当γ=0时,公式退化为版本1的即时奖励评价策略。(2)当γ取值趋近于1时,智能体更关注长期回报。当γ=1时,公式退化为版本2的无折扣累积奖励评价策略。折扣累积奖励评价

6.3评价动作的标准-带基线的折扣累积奖励评价带基线的折扣累积奖励评价带基线的折扣累积奖励评价本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读6.4策略梯度训练流程以带基线的折扣累积奖励作为动作评价标准与环境交互、评价动作优势、更新模型参数策略梯度算法流程老手车·优动作(A>0)规划穿小巷→避开主干道拥堵省5分钟,高效完成配送,获得正向收益。同一行为在不同策略决策下,收益结果迥异解决方案:异策略学习(Off-Policy)行为策略(β):负责“数据采集”基于“旧策略(新手车)”与真实环境交互,持续收集海量原始交互数据。目标策略(π):负责“学习优化”基于“新策略(老手车)”进行模型训练,从历史数据中迭代学习最优决策路径。核心优势:1批数据⇒N次更新打破数据时效性限制,大幅提升样本利用率与训练效率。新手车·劣动作(A<0)执意穿小巷→误入死胡同迷路,导致配送延误,产生明显的负面收益。核心故事:外卖智能车“抄近道”6.4策略梯度算法--数据局限引入随机性,让智能体主动尝试未知动作的技巧熵正则化EntropyRegularization通过增大动作分布的熵H(π),迫使策略分布更均匀,鼓励智能体尝试更多样化的动作。参数噪声ParameterNoise直接在神经网络的权重中加入随机噪声,让智能体在面对同一状态时,产生不同的动作输出。ε-贪心策略ε-GreedyPolicy以ε的小概率进行随机探索,以1-ε的大概率利用当前已知的最优策略,平衡探索与利用。WithoutExploration(无探索)智能体只会机械执行“已知最优”动作,陷入局部最优陷阱,永远无法发现“开火”比“右移”更好的策略。解决之道:需要强制智能体进行“冒险”,在探索未知与利用已知之间寻找平衡。探索(exploration)6.4策略梯度算法--强化学习探索Actor·策略执行者

Critic·价值评论员

Actor-Critic(演员-评论员)架构6.4策略梯度算法--Actor-Critic双网络架构

Actor-Critic(演员-评论员)架构6.4策略梯度算法--Actor-Critic双网络架构

蒙特卡洛法

蒙特卡洛法(MC法)6.4策略梯度算法--蒙特卡洛法(MC法)时序差分法

每走一步就能训练,效率高,且分数更稳定6.4策略梯度算法--时序差分法(TD法)时序差分法(TD法)对比维度蒙特卡洛(MC)法时序差分(TD)法打分依据一局游戏的完整折扣累积奖励训练时机必须等一局结束后走一步就能训练打分准确性准(基于真实游戏结果)可能不准(依赖Critic之前的水平)分数稳定性不稳定(不同局结果差异大)稳定(参考之前的打分)效率低(等一局才能练)高(每步都能练)6.4策略梯度算法--MC法

vs

TD

法MC与TD优劣对比核心:定义并迭代更新动作价值函数(Action-ValueFunction),记为Q(s,a)量化了“在状态s做动作a”的长期价值——Q值越高,说明该状态-动作对越有可能导向最终的高回报。价值迭代通过与环境交互,不断修正Q(s,a)的估计值,使其逐步逼近真实的动作价值策略推导基于更新后的Q(s,a),采用“贪心策略”生成最优策略,无需单独设计策略网络。Q-Learning6.4策略梯度算法--Q-Learning对比维度Q-LearningActor-Critic核心学习对象动作价值函数Q(s,a)策略生成方式策略网络采样(离散动作输出概率,连续动作输出分布参数)学习范式纯价值学习策略学习+价值学习数据利用效率单步更新(每交互一步即可更新Q值)单步更新(Critic与Actor同步单步优化)动作空间适配性支持连续动作(策略网络可输出连续分布)异策略特性天然异策略(更新Q值时无需依赖当前策略的动作分布)可设计为异策略(如结合重要性采样),也可同策略Q-Learning与Actor-Critic

的对比6.4策略梯度算法--QL与AC策略对比本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读💡核心主线:强化学习的所有演进始终围绕一个核心目标——最大化长期回报(MaximizeLong-termReward)基础交互原理建立Agent与Environment的闭环交互流,通过感知与动作持续循环。多维评价体系

核心训练挑战解决样本时效性差、数据分布非平稳问题,平衡探索与利用(ExplorationvsExploitation)。经典高效架构掌握Q-Learning(价值法)与Actor-Critic(演员-评论家)主流算法框架的设计逻辑。✨启示:强化学习是一门“实践驱动”的科学,其核心力量在于让智能体在与真实世界的持续“对话”中,自主进化出超越人类经验边界的智慧。6.5本章总结与延伸阅读《ReinforcementLearning:AnIntroduction(2nded.)》《深度学习与强化学习实战》(李宏毅)《深度学习详解:基于李宏毅老师“机器学习”课程》(王琦等,2024)6.5本章总结与延伸阅读知识应用Task1:动手实现简单算法——比如用Python结合OpenAIGym实现策略梯度解决倒立摆问题,在调试中理解奖励设计、探索率调整对训练效果的影响。Task2:

尝试用本章的框架“透视”身边的智能应用:分析AlphaGo的自我对弈逻辑、自动驾驶的奖励函数设计、游戏AI的策略进化。6.5本章总结与延伸阅读第七章AI赋能自然语言处理:从词袋到语境41问题与导读:NLP赋予机器“思考”能力自然语言处理目标是使计算机能够理解和处理人类语言,以实现人机之间的自然交流。常见的自然语言处理任务:语音识别:将语音信号转换为相应的文本信息,例如,智能语音助手、语音控制系统等。机器翻译:利用计算机将一种自然语言(源语言)转换为另一种自然语言(目标语言)的过程。情感分析:通过计算技术自动识别、提取和分析文本中的主观信息,判断作者对特定主题、产品或服务的态度是正面、负面还是中性。4243机器翻译语音助手情感分析问题与导读:NLP赋予机器“思考”能力自然语言处理+软硬件=机器智能语音控制搜索引擎舆情监控44问题与导读:NLP赋予机器“思考”能力大语言模型Deepseek本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战根本性问题:如何将充满歧义和抽象符号人类语言转化为计算机能够处理的数学形式?7.1从符号开始:语言的离散式表示独热编码47核心原理:向量映射为词汇表中的每个词分配唯一的“二进制身份证”。向量长度等于词汇表大小,仅对应词的索引位置为1,其余全为0。显著优势:轻量高效编码逻辑简单直观,计算成本极低,易于在计算机中快速实现和存储。单词猫喜欢吃鱼猫1000喜欢0100吃0010鱼0001词汇表

|𝑉|=4单词表示:独热编码所有词按照出现的顺序排序每个词语将对应唯一的下标

𝑉根本性问题:如何将充满歧义和抽象符号人类语言转化为计算机能够处理的数学形式?7.1从符号开始:语言的离散式表示独热编码48单词猫喜欢吃鱼喜爱猫10000喜欢01000吃00100鱼00010喜爱00001词汇表

|𝑉|=5单词表示:独热编码的缺陷“喜欢”→[0,1,0,0,0]“喜爱”→[0,0,0,0,1]“喜欢”⨂“喜爱”=0局限性维度灾难:词汇量大时向量极度稀疏,占用大量内存语义鸿沟:无法体现词间语义关联(如“喜欢”与“喜爱”的相似度)。每个单词被转换为一个只有单一维度为1的稀疏向量,丢失了词汇间的内在联系。任意两个词之间的相似度都为0!根本性问题:如何将充满歧义和抽象符号人类语言转化为计算机能够处理的数学形式?7.1从符号开始:语言的离散式表示独热编码49词袋模型:又叫向量空间模型,将文档视为独立词汇的集合,完全忽略语法与语序,仅统计每个词在文本中的绝对出现频率。文档表示:词袋模型根本性问题:如何将充满歧义和抽象符号人类语言转化为计算机能够处理的数学形式?7.1从符号开始:语言的离散式表示独热编码50文档表示:词袋模型的缺陷文档猫喜欢吃鱼不猫喜欢吃鱼11110猫不喜欢吃鱼11111鱼喜欢吃猫11110“猫喜欢吃鱼”→[1,1,1,1,0]“猫不喜欢吃鱼”→[1,1,1,1,1]“鱼喜欢吃猫”→[1,1,1,1,0]局限性丢失语序:只统计了词语出现次数,忽略了词序,如“猫喜欢吃鱼”和“鱼喜欢吃猫”。忽略语义:完全忽略了语言的语法,割裂了词语间的逻辑关联。维度灾难:词汇表的大小决定了向量的维度,通常高达数万维,甚至数十万维。无法捕捉否定关系:否定词的存在可能被模型完全误解,如“猫不喜欢吃鱼”。本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战分布式表示7.2捕捉关联:语言的分布式表示为了克服独热编码和词袋模型的核心缺陷,“分布式表示”思想的核心假设是:一个词的含义可以由与它频繁共现的其它词来定义。52实体独热编码(维度1,2,3,4)分布式表示(维度1,维度2,维度3)国王(1,0,0,0)(1.0,0.8,0.2)王后(0,1,0,0)(0.0,0.8,0.2)男人(0,0,1,0)(1.0,0.1,0.9)女人(0,0,0,1)(0.0,0.1,0.9)独热编码与分布式表示的区别N元语法7.2捕捉关联:语言的分布式表示53N元语法:捕捉局部词序核心原理将文本按顺序切分成连续的N个词的序列,通过统计局部词序的共现概率,捕捉上下文的局部依赖关系。一元、二元、三元语法:以“我/爱/首都/北京/天安门”为例:一元语法(Unigram):独立分词,["我","爱","首都","北京","天安门"]二元语法(Bigram):连续双词,["我爱","爱首都","首都北京","北京天安门"]三元语法(Trigram):连续三词,["我爱首都","首都北京天安门"]局限性:数据稀疏性(N越大越严重)、短视性。共现矩阵7.2捕捉关联:语言的分布式表示54共现矩阵:基于窗口的统计关联通过统计词汇在特定“上下文窗口”内共同出现的频率,来量化它们之间的关联强度。

语料库中有两句话:“我爱首都北京天安门”“我爱首都北京紫禁城”,以窗口大小=1描述共现矩阵:第一步:分词与建立词汇表。

句子1:

[我,爱,首都,北京,天安门]

句子2:

[我,爱,首都,北京,紫禁城]

合并词汇表:[我,爱,首都,北京,天安门,紫禁城]第二步:设定窗口并扫描(窗口大小=1)。

用窗口大小为1的上下文窗口分别扫描两个句子,记录下所有共现词对。第三步:合并统计,生成共现矩阵。

将两个句子的所有记录合并,统计每一对词共同出现的总次数,填入一个6行6列的矩阵,得到共现矩阵。共现矩阵7.2捕捉关联:语言的分布式表示55我爱首都北京天安门紫禁城我020000爱202000首都020200北京002011天安门000100紫禁城000100核心原理通过滑动窗口统计目标词与邻词的共现次数,构建词-词频率矩阵,量化词汇间的同现关系。核心优势能有效捕捉词汇间的语义关联,共现频率越高的词汇,在语义空间中的相似度越高。主要局限维度灾难:矩阵规模随词汇表呈平方级增长,成本极高。高维稀疏:真实语料中大部分词对不共现,矩阵充满零值。优化方案利用SVD(奇异值分解)进行矩阵降维,将高维稀疏矩阵压缩为稠密的低维词向量。矩阵示例解读图中矩阵展示了词汇共现的统计结果。行与列代表具体的词汇(如我,爱,天安门等),单元格中的数值代表两个词在滑动窗口内共同出现的频次。本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战57词嵌入:把人类理解的“词语”映射到一个低维、稠密的实数向量空间中,使得语义相近的词在向量空间中也彼此靠近。7.3词嵌入:让语义在向量空间中浮现词嵌入(1)连续词袋模型(CBOW):采取类似于“完形填空”的策略,通过一个词的上下文(周围的词)来预测中心词本身。(2)跳字模型(SkipGram):采取“词语联想”的策略,通过一个中心词来预测其上下文(周围的词)。我

首都

北京

天安门我

首都

北京

天安门核心技术:Word2Vec模型,由上下文定义词义58

两种Word2Vec的训练架构:7.3词嵌入:让语义在向量空间中浮现词嵌入输入层投影层输出层SUMxtxt-2xt-1xt+2xt+1输入层投影层输出层xt-2xt-1xt+2xt+1(a)CBOW模型图(b)Skip-Gram模型图59

基于神经网络的单个单词的词向量生成模型:7.3词嵌入:让语义在向量空间中浮现词向量生成1000···0输入层隐藏层输出层⋮⋮⋮⋮⋮one-hot表达输入单词的

维隐式表达全连接权重⋮全连接权重⋮输入单词的

维词向量归一化概率输出优化得到的模型参数60

基于神经网络的单个单词的词向量生成模型:7.3词嵌入:让语义在向量空间中浮现词向量生成

61

基于CBOW模型和神经网络的单词词向量生成:从单个输入扩展到多个输入7.3词嵌入:让语义在向量空间中浮现词向量生成隐藏层⋮归一化概率输出层⋮⋮全连接权重⋮⋮⋮⋮全连接权重⋮⋮⋮概率输出值最大维向量

隐式表达

62 Word2Vec最令人惊叹的特性:类比语义7.3词嵌入:让语义在向量空间中浮现词向量生成单词通过训练(如CBOW或Skip-gram模型),使得语义或语法相似的词在向量空间中位置接近。国王国王-男人男人王后女人王后-女人二者相等语义相近词距离近Vec(王后)=Vec(女人)+Vec(国王)-Vec(男人)相似语义的词(如国王/男人)在空间中聚集本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战64信息并不是孤立的:生活中很多信息是有着前后关联的序列信息7.4革命:让模型拥有“记忆”与“上下文”语言文字股票走势音频信号65循环神经网络7.4革命:让模型拥有“记忆”与“上下文”循环神经网络:让网络具备“记忆”能力,能够利用之前看到的信息来理解当前的内容,能够有效捕捉数据中的顺序信息和上下文语义关联。

我RNNcellRNNcellRNNcellRNNcellRNNcell

首都

北京

天安门局限性:梯度消失与信息稀释当序列过长时,早期信息在不断传递中会被逐渐“稀释”,导致模型难以记住远距离的关键信息,这就是RNN的长程依赖问题。

66LSTM7.4革命:让模型拥有“记忆”与“上下文”LSTM:长短期记忆网络,通过“门”结构解决了传统RNN中的“长距离依赖”问题,使其能够记住长期信息。

:我LSTMcellLSTMcellLSTMcellLSTMcellLSTMcell

:爱

:首都

:北京

:天安门遗忘门丢弃无用信息输入门

存入关键新息输出门

控制当前输出67LSTM7.4革命:让模型拥有“记忆”与“上下文”LSTM:长短期记忆网络,通过“门”结构解决了传统RNN中的“长距离依赖”问题,使其能够记住长期信息。

遗忘门:输入门:输出门:LSTMcell68GRU7.4革命:让模型拥有“记忆”与“上下文”GRU:LSTM的一种流行变体,它简化了结构,将参数合并,从而计算效率更高。

:我GRUcellGRUcellGRUcellGRUcellGRUcell

:爱

:首都

:北京

:天安门更新门同时扮演了LSTM中遗忘门和输入门的角色重置门决定在生成新记忆时要忽略多少过去的记忆69GRU7.4革命:让模型拥有“记忆”与“上下文”GRU:LSTM的一种流行变体,它简化了结构,将参数合并,从而计算效率更高。

GRUcell重置门:更新门:70编码-解码模型7.4革命:让模型拥有“记忆”与“上下文”拥有了LSTM/GRU这样强大的序列建模工具后,如何完成机器翻译、文本分类等“序列到序列”(Seq2Seq)任务呢?答案是:编码器(Encoder)-解码器(Decoder)模型71编码-解码模型7.4革命:让模型拥有“记忆”与“上下文”编码器-解码器架构:序列到序列任务的范式信息信息信息编码解码发送人信道接收人编码器语义向量解码器输入文本输出文本(a)通信模型中的编解码结构(b)文本处理的编解码结构72编码-解码模型7.4革命:让模型拥有“记忆”与“上下文”编码器-解码器架构:序列到序列任务的范式编码器我爱深度学习<eos>上下文向量解码器Ilovedeeplearning<bos>Ilovedeeplearning<eos>编码器输入解码器输出解码器输入<eos>:序列结束词元<bos>:序列开始词元一个机器翻译的Seq2Seq的编解码结构示例图:编码器(Encoder)读取输入序列,将其压缩为一个包含全局信息的固定长度“上下文向量”。编码器(Encoder)接收上下文向量作为初始状态,通过自回归方式逐个生成目标输出序列。73编码-解码模型7.4革命:让模型拥有“记忆”与“上下文”Seq2Seq模型的推广应用:序列到序列模型序列到序列模型序列到序列模型Ilovemusic狗儿们在玩皮球Howareyoudoing?语音识别图像描述视频字幕生成架构局限性:长序列信息丢失所有输入信息被压缩到单一固定长度向量中。对于长文本,早期输入的信息会被稀释,导致细节丢失。74小结与延伸阅读小结NLP的发展历程从最基础的符号表示(如独热编码和词袋模型)到深度语义理解(如词向量和BERT/GPT)经历了多次关键突破,逐步实现了从浅层分析到深度理解与生成的转变,同时也在架构效率上不断优化,从RNN到Transformer的演进,提高了处理序列和语境的能力。然而,随着技术的进步,也伴随着幻觉、推理缺陷和偏见等社会伦理问题的挑战,这要求我们在开发和应用技术时,保持批判性思维,关注其可能带来的社会影响。第七章AI赋能自然语言处理:从词袋到语境75本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战导读:何为“注意力”?人类大脑中的注意力人脑每个时刻接收的外界输入信息非常多,包括来源于视觉、听觉、触觉的各种各样的信息就视觉来说,眼睛每秒钟都会发送千万比特的信息给视觉神经系统人脑通过注意力来解决信息超载问题:核心逻辑是从关注全部到关注重点78导读:何为“注意力”?例如,人在阅读时会快速扫描全局以确定目标区域,随后将有限的认知资源集中于标题、粗体字、显目图片等关键信息,同时抑制其他无关噪声,从而快速筛选出高价值信息。79导读:何为“注意力”?当一个人在吵闹的鸡尾酒会上和朋友聊天时,尽管周围噪音干扰很多,他还是可以听到朋友的谈话内容,而忽略其他人的声音。如果他注意到的背景声中有重要的词(比如他的名字),他会马上注意到。80鸡尾酒会效应大脑会自动聚焦+寻找呼叫你名字的来源导读:何为“注意力”?注意力实验81所有黑色牌的数字之和为多少?导读:何为“注意力”?受人类的注意力的方式启发,

如何通过注意力提示,

用神经网络来设计注意力机制的框架呢?8283注意力模型注意力机制可以分为两步1.计算注意力分布𝛼:2.根据𝛼来计算输入信息的加权平均7.5进阶到Transformer:架构革命注意力机制

84

7.5进阶到Transformer:架构革命注意力机制

加性模型:点积模型:缩放点积模型:双线性模型:85注意力模型示例7.5进阶到Transformer:架构革命注意力机制

dotproductdotproductdotproduct

Softmaxlayer0.0630.4680.468我爱南京q

867.5进阶到Transformer:架构革命自注意力机制自注意力机制(self-attention)87当同一组词元同时充当查询、键和值时,由于查询、键和值来自同一组输入,因此被称为自注意力(self-attention)。7.5进阶到Transformer:架构革命自注意力机制核心思想:打破瓶颈解决Encoder-Decoder架构中单一上下文向量的局限性。让模型在生成每个词时,动态地从整个输入序列中寻找最相关的信息。工作原理:加权融合计算输入序列中各词的“关联分数”,以此作为权重对信息进行加权求和,最终得到融合全局上下文的新语义表示。88将多组变换后的查询、键和值将并行地送到注意力机制并将输出拼接在一起,通过另一个可以学习的线性投影进行变换,产生最终输出。这种设计被称为多头注意力(multi-headattention)。

7.5进阶到Transformer:架构革命多头注意力机制线性变换…线性变换线性变换单头自注意力单头自注意力单头自注意力head1head2headH+核心思想摒弃单组Q、K、V单次注意力计算,划分多个注意力头(Transformer采用8头)。每组头使用独立权重矩阵,对Q、K、V分别做不同线性映射。优势多子空间学习:从不同特征表示空间捕捉多重上下文关联。信息完整保留:避免单头注意力平均化造成特征丢失。多位置融合:有效整合序列不同位置的语义信息。897.5进阶到Transformer:架构革命TransformerTransformer模型:并行处理的强大架构层归一化前置反馈层多头注意力层层归一化位置嵌入+位置编码N×输入位置嵌入+位置编码输出掩码多头注意力层层归一化多头注意力层层归一化层归一化前置反馈层Softmax线性层×N完全基于注意力机制彻底抛弃了RNN的循环结构,将注意力机制作为核心驱动力,从根本上重构了序列数据的建模方式。自注意力(Self-Attention)编码器内部会计算每个词与其他所有词的关联权重,打破了序列距离限制,能够精准捕捉长距离的依赖关系。极致的并行计算能力由于不存在循环依赖,模型可以一次性并行处理整个输入序列,相比RNN模型,训练效率得到了指数级的提升。90预训练:让模型在一个海量无标注的文本库(如维基百科、新闻、书籍)上进行“自学”,掌握语言的通用知识。当模型具备了强大的语言基础后,只需要提供少量的具体任务标注数据(如情感分析、问答、文本分类),对预训练好的模型进行“二次教育”,引导它把学到的通用知识应用到特定场景中。7.5进阶到Transformer:架构革命预训练和微调917.5进阶到Transformer:架构革命TransformerBERT与GPT:预训练范式的双星BERT自编码语言模型,双向的“完形填空”大师。擅长:深度语言理解任务,例如:阅读理解、情感分析、文本分类、命名实体识别。GPT自回归语言模型,单向的“续写”作家。擅长:开放式文本生成任务,

例如:故事续写、文案创作、智能对话、代码编写。92BERT:只使用了Transformer的编码器部分。在预训练时,BERT会随机把输入句子中15%的单词“遮住”(用

[MASK]

标记代替),然后让模型根据上下文预测。GPT:只使用了Transformer的解码器部分。给定上文信息,通过循环预测下一个最可能出现的词,逐步生成完整的文本序列。7.5进阶到Transformer:架构革命Transformer掩码多头注意力层层归一化多头注意力层层归一化层归一化前置反馈层掩码多头注意力层层归一化多头注意力层层归一化层归一化前置反馈层去掉中间的多头注意力层Transformer解码器GPT解码器GPT网络结构图(去掉了编码器-解码器注意力层)937.5进阶到Transformer:架构革命TransformerBERT与GPT:预训练范式的双星特性BERT(理解大师)GPT(生成大师)核心目标理解语言生成语言思考方式双向:像做完形填空,同时看左右上下文单向:像玩词语接龙,只能看前面的词训练游戏完形填空

(MaskedLanguageModel)下一个词预测

(NextTokenPrediction)Transformer部件编码器解码器经典任务文本分类、问答、语义分析文本续写、对话、创作本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战95“预训练+微调”范式的出现,彻底颠覆了传统的训练模式。它模仿了人类“先通识教育,再专业深造”的高效学习路径,让AI模型首次具备了强大的通用语言能力。7.6大语言模型时代:深度理解与生成大语言模型967.6大语言模型时代:深度理解与生成大语言模型大模型的ScalingLaw有点类似于哺乳动物进化97机器学习算法从数据中学习模式并做出预测或决策深度学习使用深层神经网络来自动学习特征,网络结构呈现出越来越复杂和性能越来越好的趋势大模型同时处理多种任务,具有更强大的表达能力和泛化能力数据驱动深度学习到大模型时代模型性能提升模型参数量增长7.6大语言模型时代:深度理解与生成大语言模型98预训练+微调:从“通才专家”到“专业工匠”7.6大语言模型时代:深度理解与生成大语言模型预训练海量数据通用大模型语言知识知识推理预训练构建通用知识体系让模型通过海量阅读,无师自通地学会词汇、语法、事实知识乃至初步的逻辑推理,掌握语言的通用规律与常识。惊人的数据规模与计算成本海量数据基石:GPT-3包含约3000亿Tokens(约45TB原始文本数据)。顶级算力集群和漫长训练周期:数千张NVIDIAA100/H100高性能GPU组建超算中心,不间断持续训练数周甚至数月,对系统稳定性要求极高。预训练模型的短板缺乏领域专业性,不懂“你想要什么”,可能输出有害内容,甚至可能出现模型幻觉(Hallucination)。因此,我们需要“微调(Fine-tuning)”来解决这些问题。997.6大语言模型时代:深度理解与生成大语言模型方法:任务适配,在预训练模型的基础上,利用相对少量、针对特定任务的标注数据(如“指令-回答”对)进行短期、高效的针对性训练。第一阶段:监督微调(SupervisedFine-Tuning,SFT),教模型"什么是好答案"。将模型从单纯的“文字接龙机器”转变为可执行任务的“助手模型”。问题+答案训练STF模型监督微调学会好答案微调的目标:塑造“专家”将博学的“通才”基础模型,快速塑造成符合特定垂直领域或场景需求的“专家”。100对齐阶段:7.6大语言模型时代:深度理解与生成大语言模型监督微调只告诉了模型"该做什么",还没告诉它"不该做什么"。第二阶段:对齐(Alignment),教模型"什么是坏答案"。换言之就是"纠正错误"—告诉模型:“这样做不对,应该避免”。利用人类反馈(接受/拒绝)优化奖励模型,规避幻觉与有害输出,将模型从“能力强大的助手”打磨成“值得信赖的合作伙伴”。接受答案拒绝答案问题?对齐数据告诉模型:避免什么101大语言模型预训练-微调-对齐-部署等链条的流程:7.6大语言模型时代:深度理解与生成大语言模型海量训练数据预训练模型预训练监督微调监督微调模型对齐模型最终模型{<input,accept,reject><input,accept,reject><input,accept,reject><input,accept,reject>}对齐部署Question?Answsertest-time测试推理阶段预训练打造模型的“知识基座”微调赋予模型“专业技能”对齐校准模型的“价值观”这一范式的建立,正式开启了自然语言处理(NLP)的新时代102以DeepSeek为例,与DeepSeek的一次对话及其创作过程展示:7.6大语言模型时代:深度理解与生成大语言模型103有了自回归这个通用引擎,对话和创作就只是“输入提示”不同而已。比如诗歌、故事、代码等等。7.6大语言模型时代:深度理解与生成大语言模型104如果每次都选概率最高的词,生成结果可能会很机械、重复。如何控制大预言模型的“创意度”呢?7.6大语言模型时代:深度理解与生成大语言模型答案是使用“温度”来调节预测概率分布的平滑程度。105温度(temperature):低温“保守”,高温“冒险”。7.6大语言模型时代:深度理解与生成大语言模型核心数学思想:概率的链式法则。自回归生成的本质是:一个序列的联合概率,可以分解为一系列条件概率的乘积。假设需要生成文本序列:

,那么整个序列的概率是:大语言模型所做的就是在每一步用一个巨大的神经网络(如Transformer)来近似计算条件概率:106温度(temperature):低温“保守”,高温“冒险”。7.6大语言模型时代:深度理解与生成大语言模型LLM的“下一步决策”:LLM的输出层会得到一个针对词汇表中所有词的“分数”向量。这个分数向量经过Softmax的函数转换成一个概率分布:概率分布转换模型输出词汇表中所有词的“分数”向量(Logits),再通过Softmax函数将其归一化为有效的概率分布,确保所有词的概率之和为1。模型就像一位严谨的考官,它为词汇表中的每个词进行打分(Logits),而Softmax则像一个公正的规则,把绝对的分数转化为相对的、可被采样的概率分布,决定下一个词是谁。107温度(temperature):低温“保守”,高温“冒险”。7.6大语言模型时代:深度理解与生成大语言模型❄

低温(τ≈0.2)保守模式,倾向选高概率词。输出稳定、可预测,适合:事实问答、代码生成。🔥

高温(τ≈0.8)创意模式,低概率词也有机会。输出更多样、随机,适合:文学创作、头脑风暴。108语境理解示例:从指代消解到情感分析7.6大语言模型时代:深度理解与生成大语言模型1.指代消解:确定代词(如“他”“她”“它”)所指代的具体对象。例如,“小明把蛋糕给了小红,因为她很喜欢吃。”其中的“她”指的是谁?步骤:解析事件结构→调用世界常识→构建推理链109语境理解示例:从指代消解到情感分析7.6大语言模型时代:深度理解与生成大语言模型2.情感分析:判断一段文本所表达的整体情感倾向(如正面、负面、中性)。例如,“这手机的相机功能惊艳到我了,就是续航实在太拉胯”为例,机器能否判断出情感?步骤:识别评价对象与逻辑关系→量化与权衡情感强度→结合常识进行综合判断110语境理解示例:从指代消解到情感分析7.6大语言模型时代:深度理解与生成大语言模型3.阅读理解:基于给定的文本(篇章),准确回答所提出的问题。例如文章:“苏轼,号东坡居士,是北宋著名的文学家、书法家。他的词作《水调歌头·明月几时有》广为传唱。”

问题:“《水调歌头·明月几时有》的作者是谁?”步骤:实体识别与知识关联→指代消解→关系抽取→精准定位与匹配111大语言模型展现的的基本能力:7.6大语言模型时代:深度理解与生成大语言模型模型展现的能力在对话中的具体体现对应的技术基础深度语义理解从“文学家+政治家+改革+贬谪”等抽象描述中捕捉核心特征,关联到具体历史人物。词嵌入、上下文感知表示知识关联与推理将“月亮主题的词”与《水调歌头》关联,进而锁定苏轼;区分王安石变法与苏轼地方治理的不同。大规模预训练获得的知识图谱、逻辑推理能力对话状态跟踪在整个多轮对话中,始终保持“核心人物是苏轼”这一焦点,每一轮回答都基于之前上下文。注意力机制、长上下文建模结构化生成规划行程时,分时段、分主题、有理由、有总结,生成条理清晰的文本。指令遵循、文本规划与控制生成跨领域知识融合将文学史、历史地理、旅游规划、饮食文化等不同领域的知识自然融合在一个回答中。多源数据预训练、统一语义空间本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战113大语言模型最典型的成功应用7.7自然语言处理的未来与挑战未来与挑战智能客服搜索引擎内容创作114核心挑战:幻觉、推理、常识7.7自然语言处理的未来与挑战未来与挑战1.幻觉(Hallucination):模型会生成听起来合理、但事实上完全错误或凭空捏造的信息。模型本质是概率模型,可能会一本正经地编造事实或引用不存在的文献,它追求的是“听起来像真的”而非“事实本身”。115核心挑战:幻觉、推理、常识7.7自然语言处理的未来与挑战未来与挑战2.深层推理与逻辑:深层推理时输出错误答案,导致答案与推理链条之间产生矛盾。对于数学证明等需要复杂逻辑链的任务,模型表现仍有欠缺。其所谓的“推理”大多基于海量数据的模式匹配,而非真正的逻辑推导。116核心挑战:幻觉、推理、常识7.7自然语言处理的未来与挑战未来与挑战3.常识缺失:忽略底层认知与物理基础。模型缺乏真实的物理世界体验和生活常识,对于人类习以为常的空间关系、因果逻辑或社会常识,往往会产生令人啼笑皆非的理解错误。117社会影响:偏见、公平与责任7.7自然语言处理的未来与挑战未来与挑战1.偏见与歧视的放大镜大语言模型通过人类历史数据学习,可能继承并放大性别、种族、职业等偏见。招聘、影响:信用评估、内容推荐等领域可能加剧社会不平等。2.公平性:技术普惠的挑战语言不平等:高资源语言如英语占主导地位,小语种和方言缺乏高质量的模型与服务。文化适应性:

基于特定文化背景训练的模型可能无法理解其他文化的表达与习俗。影响:技术可能成为新的排斥工具,加剧“数字鸿沟”。3.责任与问责:当AI出错时谁应对AI系统出错承担责任(如司法、医疗、金融领域的错误决策)?技术的未来由代码和数据塑造,但也受到价值观和伦理约束的决定。理解这些社会影响是每位技术开发者和公民的责任。118未来展望:通往更智能的NLP

?7.7自然语言处理的未来与挑战未来与挑战未来的大语言模型需要:1.更具常识将海量的世界知识(不仅仅是文本知识)有效地注入模型,来构建对世界的基本认知框架。2.更具解释性让模型的决策过程变得更透明。这对于在医疗、法律、金融等高风险领域应用AI至关重要。3.更多模态深度融合融合了视觉、听觉、触觉等多种感官,未来的语言模型将不再是纯文本模型,而是能同时理解图片、视频、声音和文本的多模态通用模型。119小结与延伸阅读小结NLP的发展历程从最基础的符号表示(如独热编码和词袋模型)到深度语义理解(如词向量和BERT/GPT)经历了多次关键突破,逐步实现了从浅层分析到深度理解与生成的转变,同时也在架构效率上不断优化,从RNN到Transformer的演进,提高了处理序列和语境的能力。然而,随着技术的进步,也伴随着幻觉、推理缺陷和偏见等社会伦理问题的挑战,这要求我们在开发和应用技术时,保持批判性思维,关注其可能带来的社会影响。第十章

视觉计算:从人工到深度学习(第一讲)120问题与导读:为什么视觉对智能至关重要视觉不仅仅是“看见”,更是“理解”,也是人类理解世界与推理的重要基础。通过视觉,人类可以:

识别物体和场景:分辨出这是一只猫、那是一张桌子,以及我们身处办公室还是厨房?

把握上下文和关系:看到一个人伸手去拿水杯,我们能推断出他“可能渴了”。这种对物体间关系和事件因果的理解是高级智能的核心。

进行空间推理:判断一个物体能否放进一个箱子里,或者规划从A点到B点的路径,都严重依赖视觉提供的空间信息。121122问题与导读:为什么视觉对智能至关重要问题与导读:为什么视觉对智能至关重要工业是我国国民经济的主导,我国积极抢抓以人工智能为驱动的新一轮科技产业变革

的机遇,工业视觉智能成为了国家及业界高度重视的领域方向。123智能缺陷检测智能识别分拣智能尺寸检测智能生产安全巡检工业智能视觉系统工业成像设备+AI视觉分析软件=火眼金睛124玻璃瓶表面质量检测汽车仪表盘缺陷检测二维码/条形码识别产品颜色智能识别生成现场智能巡检环境数据智能读取问题与导读:为什么视觉对智能至关重要视觉检测设备+AI视觉分析软件=火眼金睛问题与导读:为什么视觉对智能至关重要125

视觉计算是遥感对地观测等重要的分析任务,地物和目标等对象的检测、分割提取、动态目标跟踪等都涉及大量的视觉计算问题,AI+遥感已成为地球科学的重要研究方向遥感探测成像设备+AI视觉分析软件=火眼金睛本章目录8.1视觉计算导论8.2图像:视觉计算的基础8.3从图像到特征:经典视觉表征8.4特征工程的得与失1本章目录8.1视觉计算导论8.2图像:视觉计算的基础8.3从图像到特征:经典视觉表征8.4特征工程的得与失112820世纪80年代初,麻省理工学院(MIT)人工智能实验室的DavidMarr出版了著作《视觉》(Vision:AComputationalInvestigationintotheHumanRepresentationandProcessingofVisualInformation)(Marr,1982)马尔认为,要理解如此复杂的系统,我们必须从三个层次来分析:(1)计算理论层:系统要解决什么问题?为什么要解决它?(2)表示与算法层:解决这个问题需要什么数据表示和计算步骤?(3)硬件实现层:这些计算在物理上如何实现?8.1视觉计算导论Marr视觉129视觉计算典型任务与目标1.重建:精准地还原世界2.识别:准确地辨别万物3.理解:深入地解读语义4.交互:智能地与环境互动视觉计算任务8.1视觉计算导论1305.生成与创造:从理解到创造

视觉生成大模型(Sora、智谱等)可以生成非常逼真的视频能AI对话、写作与画图生成工具的领先方案/new-video视觉计算任务8.1视觉计算导论131Marr视觉第一步:初始简图—提取二维要素第二步:2.5维草图—重建表面深度第三步:三维模型表示—识别物体本质

“轮廓

→立体

→概念”8.1视觉计算导论本章目录8.1视觉计算导论8.2图像:视觉计算的基础8.3从图像到特征:经典视觉表征8.4特征工程的得与失1图像数字化表示8.2视觉计算基础:图像

经过采样和量化,可以得到数字图像。

数字灰度图像用数字矩阵或2维数组表示,矩阵中的行和列对应元素称为像素(Pixel,来自术语“PictureElement”),其值对应该像素值。

像素是广泛应用于表示数字图像元素的词汇,是图像的最小单元。

数字图像按照2维数组(矩阵)形式进行存储133134数字二值图像

如果

则称图像

为二值图像。这是一类特殊的图像,此时像素值的量化比特数为1,图像像素取值要么为0(黑色),要么为1(白色)。数字灰度图像

一幅数字灰度图像表示为

,其像素此时B表示像素的量化比特数,通常取B=8,此时灰度的等级

,0表示最灰度等级(最黑),255表示最大灰度等级(最亮)。(a)(b)数字二值图像数字灰度图像8.2视觉计算基础:图像图像数字化表示135数字彩色图像

彩色图像具有三个通道,分别是红、绿和蓝通道,表示

其中各个通道均为一幅灰度图像。

三种类型的图像例子8.2视觉计算基础:图像图像数字化表示1368.2视觉计算基础:图像

图8.5数字图像处理系统

图像处理系统可以建模为一种输入输出关系:

图像处理系统137线性系统遵循两大基本原则:(1)可加性:

两个输入叠加后通过系统的输出,等于它们分别通过系统后的输出之和。(2)齐次性:

输入放大K倍,输出也相应放大K倍。

不满足上述条件的系统为非线性系统图像处理系统8.2视觉计算基础:图像1388.2视觉计算基础:图像知识库预处理图像获取识别与解释分割表示与描述问题结果低级处理中级处理高级处理图8.6

经典的图像处理系统及其处理层次第一阶段:任务定义与图像采集第二阶段:图像预处理(底层视觉计算)第三阶段:图像目标检测与分割(中层视觉计算)第四阶段:表示与描述(中层视觉计算)第五阶段:模式识别与理解(高层模式分析)图像处理系统1398.3从图像到特征:经典视觉表征特征工程(FeatureEngineering)

是传统计算机视觉流程中的核心环节,其目标是通过人为设计和提取一系列具有区分度的数值或符号,将原始的、无结构的图像数据转换为一个能够被机器学习模型(如SVM、随机森林等)有效理解和处理的特征表示,最终有利于图像分类或识别等高层模式分析任务。

特征工程+监督学习进行模式分类视觉特征计算140特征工程的四大目标:降维与简化:从数百万像素的图像中提取出少量但信息丰富的特征,大幅减少数据冗余和计算负担。不变性:使特征对光照、平移、旋转等变化不敏感,提升模型鲁棒性。区分性:确保提取的特征能够有效地区分不同类别的物体,例如“猫”和“狗”的特征应有明显差异。语义化:尽管是手工设计,但好的特征应尽可能对应图像中有意义的视觉模式,如边缘、角点、纹理等。8.3从图像到特征:经典视觉表征视觉特征计算1418.3从图像到特征:经典视觉表征

代表性特征-边缘:

通常而言,边缘是图像灰度产生突变位置的像素,可以对应目标的轮廓,具有一定的方向性和连续性

其途径是采取边缘检测算法,是图像处理和计算机视觉的经典问题。

边缘检测1428.3从图像到特征:经典视觉表征边缘检测:常见方法是采取求取图像亮度微分,通过求取梯度模值的极大值(对应突变或奇异性点)来确定(a)灰度图(b)亮度变化曲线梯度模极大值点(c)梯度模极值点方法原理:梯度向量包含水平和垂直方向的偏导数,利用差分【求相邻像素的左右和上下的亮度差】边缘检测143

边缘细化边缘图YESNO非边缘像素图8.8边缘检测算法8.3从图像到特征:经典视觉表征边缘检测144

角点检测8.3从图像到特征:经典视觉表征角点检测:角点检测是计算机视觉和图像处理中的一种基本技术,用于识别图像中特征点(或称兴趣点)的位置。这里的“角点”并不是严格的数学上的角,而是指图像中在两个或多个方向上像素强度(颜色、亮度)变化都非常剧烈的点。1458.3从图像到特征:经典视觉表征

角点检测Harris角点检测,核心思想是:用一个小的滑动窗口在图像上移动,观察窗口向各个方向移动时,窗口内像素灰度值的变化情况,可分为三类:

平坦区域:无论窗口往哪个方向移动,窗口内的灰度值都没有明显变化.

边缘(边界):沿着边缘方向移动窗口,灰度值变化不大;但垂直于边缘方向移动窗口,灰度值变化剧烈。

角点:窗口向任何方向移动,窗口内的灰度值都会发生剧烈变化。直观结论:角点是在任何方向上移动窗口,灰度都会剧烈变化的点。它们通常是物体轮廓的拐角、纹理丰富的交点等,是图像中非常稳定且具有代表性的“关键锚点”1468.3从图像到特征:经典视觉表征

纹理表征纹理:是一种描述图像表面局部区域内在重复性、规律性模式的重要视觉特征。与关注轮廓的边缘检测和关注关键交汇点的角点检测不同,纹理特征旨在量化区域的平滑度、粗糙度、规律性等感知特性。147经典的局部二值模式(LocalBinaryPattern,LBP)算子:定义在一个3×3的像素块内。其计算过程选择中心与邻域:对于图像中的每一个像素,以其作为中心点,并选择一个3×3的邻域窗口。阈值化(二值化):将邻域内8个周围像素的灰度值,分别与中心像素的灰度值进行比较。如果周围像素值大于或等于中心像素值,则该位置被标记为1。如果周围像素值小于中心像素值,则该位置被标记为0。生成二进制模式:将这8个二进制位(0或1)按一个固定的顺序(比如顺时针方向)串联起来,形成一个8位的二进制数。转换为十进制标签:将这个二进制数转换为一个十进制数,这个十进制数就是中心像素的LBP编码值(范围在0到255之间)。8.3从图像到特征:经典视觉表征

纹理表征1485460586159555257560101*0000顺时针顺序(从左上开始)得到的二进制序列为:01000010。将其转换为十进制:=66。

该中心像素的LBP编码值为66。例子:LBP计算示例

纹理表征8.3从图像到特征:经典视觉表征149纹理特征抽取可以广泛应用于生物特征识别等领域指纹识别掌纹识别虹膜识别8.3从图像到特征:经典视觉表征

纹理表征150虹膜识别8.3从图像到特征:经典视觉表征

纹理表征151方向梯度直方图HOGHOG是一个特征描述符,用于自动检测图像中的对象;HOG描述符对图像中局部部分的梯度方向的分布进行编码;核心思想:通过边缘方向的直方图来描述图像内的对象外观和形状。主要步骤梯度计算单位直方图块描述符块归一化8.3从图像到特征:经典视觉表征

方向梯度直方图1528.3从图像到特征:经典视觉表征

方向梯度直方图HOG描述符153

3220S3064-101-101水平和垂直梯度其实就是按照如下方式得到:

8.3从图像到特征:经典视觉表征

方向梯度直方图HOG描述符计算过程:

梯度计算154将图像按照8×8大小的单元进行切割。每个单元都有固定数量的梯度方向区间均匀分布在0~180°之间或0~360°之间例如,对于原尺寸为64×128的图像,会被切成8×16个单元。HOG描述符计算过程:单元分块8.3从图像到特征:经典视觉表征

方向梯度直方图155梯度直方图是以格子为单位进行的。由于10°和0°以及20°都接近,所以它们各自增加数值2。HOG描述符计算过程:8.3从图像到特征:经典视觉表征

方向梯度直方图156HOG描述符计算过程:形成单元方向直方图计算规则是循环的,当度数位于160°~180°时,那么按照比例分摊到0°和160°8.3从图像到特征:经典视觉表征

方向梯度直方图157为了处理关照和对比度的变化,通过将单元组合在一起形成更大的空间上相连的块,局部地归一化梯度强度。HOG描述符计算过程:描述符块8.3从图像到特征:经典视觉表征

方向梯度直方图158归一化因子算法:或或HOG描述符计算过程:

块归一化8.3从图像到特征:经典视觉表征

方向梯度直方图1598.3从图像到特征:经典视觉表征

方向梯度直方图HOG描述符计算可视化结果160核心概念SIFT是基于尺度空间的,对图像平移、旋转、缩放、甚至仿射变换保持不变性的图像局部特征描述算子;尺度不变特征变换SIFT主要步骤建立尺度空间关键点精确定位关键点方向分配关键点描述符8.3从图像到特征:经典视觉表征SIFT1618.3从图像到特征:经典视觉表征SIFT图8.13创建由梯度的模加权的所有梯度方向直方图,在该分布中找到显著峰值,估计主方向进阶难点:SIFT关键步骤图8.12

使用子八度高斯差分金字塔进行尺度空间特征检测,(a)子八度高斯金字塔的相邻相减以产生高斯差分,(b)将像素与其26个邻居比较以检测极值162特征特点稳定性,局部特征对平移、旋转、缩放甚至仿射变换保持稳定性独特性,适用于在海量特征数据库中进行快速、准确的匹配多量性,即使是一个很小的物体也可以产生大量的SIFT特征高速性,经优化的SIFT匹配算法可以达到实时的要求尺度不变特征变换SIFT8.3从图像到特征:经典视觉表征SIFT163尺度不变特征变换SIFTSIFT8.3从图像到特征:经典视觉表征1648.3从图像到特征:经典视觉表征加速鲁棒特征SURF是SIFT描述符的加速版(HerbertBay,2

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论