版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第七章AI赋能自然语言处理:从词袋到语境1问题与导读:NLP赋予机器“思考”能力自然语言处理目标是使计算机能够理解和处理人类语言,以实现人机之间的自然交流。常见的自然语言处理任务:语音识别:将语音信号转换为相应的文本信息,例如,智能语音助手、语音控制系统等。机器翻译:利用计算机将一种自然语言(源语言)转换为另一种自然语言(目标语言)的过程。情感分析:通过计算技术自动识别、提取和分析文本中的主观信息,判断作者对特定主题、产品或服务的态度是正面、负面还是中性。23机器翻译语音助手情感分析问题与导读:NLP赋予机器“思考”能力自然语言处理+软硬件=机器智能语音控制搜索引擎舆情监控4问题与导读:NLP赋予机器“思考”能力大语言模型Deepseek本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战根本性问题:如何将充满歧义和抽象符号人类语言转化为计算机能够处理的数学形式?7.1从符号开始:语言的离散式表示独热编码7核心原理:向量映射为词汇表中的每个词分配唯一的“二进制身份证”。向量长度等于词汇表大小,仅对应词的索引位置为1,其余全为0。显著优势:轻量高效编码逻辑简单直观,计算成本极低,易于在计算机中快速实现和存储。单词猫喜欢吃鱼猫1000喜欢0100吃0010鱼0001词汇表
|𝑉|=4单词表示:独热编码所有词按照出现的顺序排序每个词语将对应唯一的下标
⋮
𝑉根本性问题:如何将充满歧义和抽象符号人类语言转化为计算机能够处理的数学形式?7.1从符号开始:语言的离散式表示独热编码8单词猫喜欢吃鱼喜爱猫10000喜欢01000吃00100鱼00010喜爱00001词汇表
|𝑉|=5单词表示:独热编码的缺陷“喜欢”→[0,1,0,0,0]“喜爱”→[0,0,0,0,1]“喜欢”⨂“喜爱”=0局限性维度灾难:词汇量大时向量极度稀疏,占用大量内存语义鸿沟:无法体现词间语义关联(如“喜欢”与“喜爱”的相似度)。每个单词被转换为一个只有单一维度为1的稀疏向量,丢失了词汇间的内在联系。任意两个词之间的相似度都为0!根本性问题:如何将充满歧义和抽象符号人类语言转化为计算机能够处理的数学形式?7.1从符号开始:语言的离散式表示独热编码9词袋模型:又叫向量空间模型,将文档视为独立词汇的集合,完全忽略语法与语序,仅统计每个词在文本中的绝对出现频率。文档表示:词袋模型根本性问题:如何将充满歧义和抽象符号人类语言转化为计算机能够处理的数学形式?7.1从符号开始:语言的离散式表示独热编码10文档表示:词袋模型的缺陷文档猫喜欢吃鱼不猫喜欢吃鱼11110猫不喜欢吃鱼11111鱼喜欢吃猫11110“猫喜欢吃鱼”→[1,1,1,1,0]“猫不喜欢吃鱼”→[1,1,1,1,1]“鱼喜欢吃猫”→[1,1,1,1,0]局限性丢失语序:只统计了词语出现次数,忽略了词序,如“猫喜欢吃鱼”和“鱼喜欢吃猫”。忽略语义:完全忽略了语言的语法,割裂了词语间的逻辑关联。维度灾难:词汇表的大小决定了向量的维度,通常高达数万维,甚至数十万维。无法捕捉否定关系:否定词的存在可能被模型完全误解,如“猫不喜欢吃鱼”。本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战分布式表示7.2捕捉关联:语言的分布式表示为了克服独热编码和词袋模型的核心缺陷,“分布式表示”思想的核心假设是:一个词的含义可以由与它频繁共现的其它词来定义。12实体独热编码(维度1,2,3,4)分布式表示(维度1,维度2,维度3)国王(1,0,0,0)(1.0,0.8,0.2)王后(0,1,0,0)(0.0,0.8,0.2)男人(0,0,1,0)(1.0,0.1,0.9)女人(0,0,0,1)(0.0,0.1,0.9)独热编码与分布式表示的区别N元语法7.2捕捉关联:语言的分布式表示13N元语法:捕捉局部词序核心原理将文本按顺序切分成连续的N个词的序列,通过统计局部词序的共现概率,捕捉上下文的局部依赖关系。一元、二元、三元语法:以“我/爱/首都/北京/天安门”为例:一元语法(Unigram):独立分词,["我","爱","首都","北京","天安门"]二元语法(Bigram):连续双词,["我爱","爱首都","首都北京","北京天安门"]三元语法(Trigram):连续三词,["我爱首都","首都北京天安门"]局限性:数据稀疏性(N越大越严重)、短视性。共现矩阵7.2捕捉关联:语言的分布式表示14共现矩阵:基于窗口的统计关联通过统计词汇在特定“上下文窗口”内共同出现的频率,来量化它们之间的关联强度。
语料库中有两句话:“我爱首都北京天安门”“我爱首都北京紫禁城”,以窗口大小=1描述共现矩阵:第一步:分词与建立词汇表。
句子1:
[我,爱,首都,北京,天安门]
句子2:
[我,爱,首都,北京,紫禁城]
合并词汇表:[我,爱,首都,北京,天安门,紫禁城]第二步:设定窗口并扫描(窗口大小=1)。
用窗口大小为1的上下文窗口分别扫描两个句子,记录下所有共现词对。第三步:合并统计,生成共现矩阵。
将两个句子的所有记录合并,统计每一对词共同出现的总次数,填入一个6行6列的矩阵,得到共现矩阵。共现矩阵7.2捕捉关联:语言的分布式表示15我爱首都北京天安门紫禁城我020000爱202000首都020200北京002011天安门000100紫禁城000100核心原理通过滑动窗口统计目标词与邻词的共现次数,构建词-词频率矩阵,量化词汇间的同现关系。核心优势能有效捕捉词汇间的语义关联,共现频率越高的词汇,在语义空间中的相似度越高。主要局限维度灾难:矩阵规模随词汇表呈平方级增长,成本极高。高维稀疏:真实语料中大部分词对不共现,矩阵充满零值。优化方案利用SVD(奇异值分解)进行矩阵降维,将高维稀疏矩阵压缩为稠密的低维词向量。矩阵示例解读图中矩阵展示了词汇共现的统计结果。行与列代表具体的词汇(如我,爱,天安门等),单元格中的数值代表两个词在滑动窗口内共同出现的频次。本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战17词嵌入:把人类理解的“词语”映射到一个低维、稠密的实数向量空间中,使得语义相近的词在向量空间中也彼此靠近。7.3词嵌入:让语义在向量空间中浮现词嵌入(1)连续词袋模型(CBOW):采取类似于“完形填空”的策略,通过一个词的上下文(周围的词)来预测中心词本身。(2)跳字模型(SkipGram):采取“词语联想”的策略,通过一个中心词来预测其上下文(周围的词)。我
爱
首都
北京
天安门我
爱
首都
北京
天安门核心技术:Word2Vec模型,由上下文定义词义18
两种Word2Vec的训练架构:7.3词嵌入:让语义在向量空间中浮现词嵌入输入层投影层输出层SUMxtxt-2xt-1xt+2xt+1输入层投影层输出层xt-2xt-1xt+2xt+1(a)CBOW模型图(b)Skip-Gram模型图19
基于神经网络的单个单词的词向量生成模型:7.3词嵌入:让语义在向量空间中浮现词向量生成1000···0输入层隐藏层输出层⋮⋮⋮⋮⋮one-hot表达输入单词的
维隐式表达全连接权重⋮全连接权重⋮输入单词的
维词向量归一化概率输出优化得到的模型参数20
基于神经网络的单个单词的词向量生成模型:7.3词嵌入:让语义在向量空间中浮现词向量生成
21
基于CBOW模型和神经网络的单词词向量生成:从单个输入扩展到多个输入7.3词嵌入:让语义在向量空间中浮现词向量生成隐藏层⋮归一化概率输出层⋮⋮全连接权重⋮⋮⋮⋮全连接权重⋮⋮⋮概率输出值最大维向量
隐式表达
22 Word2Vec最令人惊叹的特性:类比语义7.3词嵌入:让语义在向量空间中浮现词向量生成单词通过训练(如CBOW或Skip-gram模型),使得语义或语法相似的词在向量空间中位置接近。国王国王-男人男人王后女人王后-女人二者相等语义相近词距离近Vec(王后)=Vec(女人)+Vec(国王)-Vec(男人)相似语义的词(如国王/男人)在空间中聚集本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战24信息并不是孤立的:生活中很多信息是有着前后关联的序列信息7.4革命:让模型拥有“记忆”与“上下文”语言文字股票走势音频信号25循环神经网络7.4革命:让模型拥有“记忆”与“上下文”循环神经网络:让网络具备“记忆”能力,能够利用之前看到的信息来理解当前的内容,能够有效捕捉数据中的顺序信息和上下文语义关联。
我RNNcellRNNcellRNNcellRNNcellRNNcell
爱
首都
北京
天安门局限性:梯度消失与信息稀释当序列过长时,早期信息在不断传递中会被逐渐“稀释”,导致模型难以记住远距离的关键信息,这就是RNN的长程依赖问题。
26LSTM7.4革命:让模型拥有“记忆”与“上下文”LSTM:长短期记忆网络,通过“门”结构解决了传统RNN中的“长距离依赖”问题,使其能够记住长期信息。
:我LSTMcellLSTMcellLSTMcellLSTMcellLSTMcell
:爱
:首都
:北京
:天安门遗忘门丢弃无用信息输入门
存入关键新息输出门
控制当前输出27LSTM7.4革命:让模型拥有“记忆”与“上下文”LSTM:长短期记忆网络,通过“门”结构解决了传统RNN中的“长距离依赖”问题,使其能够记住长期信息。
遗忘门:输入门:输出门:LSTMcell28GRU7.4革命:让模型拥有“记忆”与“上下文”GRU:LSTM的一种流行变体,它简化了结构,将参数合并,从而计算效率更高。
:我GRUcellGRUcellGRUcellGRUcellGRUcell
:爱
:首都
:北京
:天安门更新门同时扮演了LSTM中遗忘门和输入门的角色重置门决定在生成新记忆时要忽略多少过去的记忆29GRU7.4革命:让模型拥有“记忆”与“上下文”GRU:LSTM的一种流行变体,它简化了结构,将参数合并,从而计算效率更高。
GRUcell重置门:更新门:30编码-解码模型7.4革命:让模型拥有“记忆”与“上下文”拥有了LSTM/GRU这样强大的序列建模工具后,如何完成机器翻译、文本分类等“序列到序列”(Seq2Seq)任务呢?答案是:编码器(Encoder)-解码器(Decoder)模型31编码-解码模型7.4革命:让模型拥有“记忆”与“上下文”编码器-解码器架构:序列到序列任务的范式信息信息信息编码解码发送人信道接收人编码器语义向量解码器输入文本输出文本(a)通信模型中的编解码结构(b)文本处理的编解码结构32编码-解码模型7.4革命:让模型拥有“记忆”与“上下文”编码器-解码器架
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026 年师德师风教育:正视自身差距推动高中教师师德自我革新课件
- 2026年航空安保考试试题及答案
- 2026年北京市朝阳区公安招聘辅警考试试卷含答案
- 2026网站自查报告(3篇)
- 分布式电源接入对变电站继电保护的影响及应对策略研究
- 分布式姿态基准系统技术:原理、实现与应用探索
- 分布式SAR卫星姿态与相对轨道确定:技术、挑战与前沿探索
- 2025-2026年九年级综合实践上册第2单元实践活动测试卷
- 冥想对生命质量及执行功能的影响:基于多维度的科学剖析
- 《产科护理常规》课件
- 2025年计算机二级wps真题题库及答案操作题
- RTO焚烧炉日常巡检操作规程
- 新疆兵团二中等校2025-2026学年高一(上)期末数学试卷(含答案)
- 新版教科版一年级上册科学全册教案教学设计
- 2026 年秋季高一开学第一课高中生课外阅读拓展视野教育
- 延长导管在冠状动脉介入诊疗中的应用专家共识(2026年)
- CSCO结直肠癌诊疗指南(2026版)
- 2.2天然纤维(课件)-《服装材料》同步教学(高教版)
- (2026秋新版)冀教版五年级数学上册全册教案
- 2026年四川高考化学试卷答案详解及复习备考指导
- 2026年秋季学期中小学1530安全教育记录
评论
0/150
提交评论