版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第七章AI赋能自然语言处理:从词袋到语境1本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战导读:何为“注意力”?人类大脑中的注意力人脑每个时刻接收的外界输入信息非常多,包括来源于视觉、听觉、触觉的各种各样的信息就视觉来说,眼睛每秒钟都会发送千万比特的信息给视觉神经系统人脑通过注意力来解决信息超载问题:核心逻辑是从关注全部到关注重点4导读:何为“注意力”?例如,人在阅读时会快速扫描全局以确定目标区域,随后将有限的认知资源集中于标题、粗体字、显目图片等关键信息,同时抑制其他无关噪声,从而快速筛选出高价值信息。5导读:何为“注意力”?当一个人在吵闹的鸡尾酒会上和朋友聊天时,尽管周围噪音干扰很多,他还是可以听到朋友的谈话内容,而忽略其他人的声音。如果他注意到的背景声中有重要的词(比如他的名字),他会马上注意到。6鸡尾酒会效应大脑会自动聚焦+寻找呼叫你名字的来源导读:何为“注意力”?注意力实验7所有黑色牌的数字之和为多少?导读:何为“注意力”?受人类的注意力的方式启发,
如何通过注意力提示,
用神经网络来设计注意力机制的框架呢?89注意力模型注意力机制可以分为两步1.计算注意力分布𝛼:2.根据𝛼来计算输入信息的加权平均7.5进阶到Transformer:架构革命注意力机制
10
7.5进阶到Transformer:架构革命注意力机制
加性模型:点积模型:缩放点积模型:双线性模型:11注意力模型示例7.5进阶到Transformer:架构革命注意力机制
dotproductdotproductdotproduct
Softmaxlayer0.0630.4680.468我爱南京q
127.5进阶到Transformer:架构革命自注意力机制自注意力机制(self-attention)13当同一组词元同时充当查询、键和值时,由于查询、键和值来自同一组输入,因此被称为自注意力(self-attention)。7.5进阶到Transformer:架构革命自注意力机制核心思想:打破瓶颈解决Encoder-Decoder架构中单一上下文向量的局限性。让模型在生成每个词时,动态地从整个输入序列中寻找最相关的信息。工作原理:加权融合计算输入序列中各词的“关联分数”,以此作为权重对信息进行加权求和,最终得到融合全局上下文的新语义表示。14将多组变换后的查询、键和值将并行地送到注意力机制并将输出拼接在一起,通过另一个可以学习的线性投影进行变换,产生最终输出。这种设计被称为多头注意力(multi-headattention)。
7.5进阶到Transformer:架构革命多头注意力机制线性变换…线性变换线性变换单头自注意力单头自注意力单头自注意力head1head2headH+核心思想摒弃单组Q、K、V单次注意力计算,划分多个注意力头(Transformer采用8头)。每组头使用独立权重矩阵,对Q、K、V分别做不同线性映射。优势多子空间学习:从不同特征表示空间捕捉多重上下文关联。信息完整保留:避免单头注意力平均化造成特征丢失。多位置融合:有效整合序列不同位置的语义信息。157.5进阶到Transformer:架构革命TransformerTransformer模型:并行处理的强大架构层归一化前置反馈层多头注意力层层归一化位置嵌入+位置编码N×输入位置嵌入+位置编码输出掩码多头注意力层层归一化多头注意力层层归一化层归一化前置反馈层Softmax线性层×N完全基于注意力机制彻底抛弃了RNN的循环结构,将注意力机制作为核心驱动力,从根本上重构了序列数据的建模方式。自注意力(Self-Attention)编码器内部会计算每个词与其他所有词的关联权重,打破了序列距离限制,能够精准捕捉长距离的依赖关系。极致的并行计算能力由于不存在循环依赖,模型可以一次性并行处理整个输入序列,相比RNN模型,训练效率得到了指数级的提升。16预训练:让模型在一个海量无标注的文本库(如维基百科、新闻、书籍)上进行“自学”,掌握语言的通用知识。当模型具备了强大的语言基础后,只需要提供少量的具体任务标注数据(如情感分析、问答、文本分类),对预训练好的模型进行“二次教育”,引导它把学到的通用知识应用到特定场景中。7.5进阶到Transformer:架构革命预训练和微调177.5进阶到Transformer:架构革命TransformerBERT与GPT:预训练范式的双星BERT自编码语言模型,双向的“完形填空”大师。擅长:深度语言理解任务,例如:阅读理解、情感分析、文本分类、命名实体识别。GPT自回归语言模型,单向的“续写”作家。擅长:开放式文本生成任务,
例如:故事续写、文案创作、智能对话、代码编写。18BERT:只使用了Transformer的编码器部分。在预训练时,BERT会随机把输入句子中15%的单词“遮住”(用
[MASK]
标记代替),然后让模型根据上下文预测。GPT:只使用了Transformer的解码器部分。给定上文信息,通过循环预测下一个最可能出现的词,逐步生成完整的文本序列。7.5进阶到Transformer:架构革命Transformer掩码多头注意力层层归一化多头注意力层层归一化层归一化前置反馈层掩码多头注意力层层归一化多头注意力层层归一化层归一化前置反馈层去掉中间的多头注意力层Transformer解码器GPT解码器GPT网络结构图(去掉了编码器-解码器注意力层)197.5进阶到Transformer:架构革命TransformerBERT与GPT:预训练范式的双星特性BERT(理解大师)GPT(生成大师)核心目标理解语言生成语言思考方式双向:像做完形填空,同时看左右上下文单向:像玩词语接龙,只能看前面的词训练游戏完形填空
(MaskedLanguageModel)下一个词预测
(NextTokenPrediction)Transformer部件编码器解码器经典任务文本分类、问答、语义分析文本续写、对话、创作本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战21“预训练+微调”范式的出现,彻底颠覆了传统的训练模式。它模仿了人类“先通识教育,再专业深造”的高效学习路径,让AI模型首次具备了强大的通用语言能力。7.6大语言模型时代:深度理解与生成大语言模型227.6大语言模型时代:深度理解与生成大语言模型大模型的ScalingLaw有点类似于哺乳动物进化23机器学习算法从数据中学习模式并做出预测或决策深度学习使用深层神经网络来自动学习特征,网络结构呈现出越来越复杂和性能越来越好的趋势大模型同时处理多种任务,具有更强大的表达能力和泛化能力数据驱动深度学习到大模型时代模型性能提升模型参数量增长7.6大语言模型时代:深度理解与生成大语言模型24预训练+微调:从“通才专家”到“专业工匠”7.6大语言模型时代:深度理解与生成大语言模型预训练海量数据通用大模型语言知识知识推理预训练构建通用知识体系让模型通过海量阅读,无师自通地学会词汇、语法、事实知识乃至初步的逻辑推理,掌握语言的通用规律与常识。惊人的数据规模与计算成本海量数据基石:GPT-3包含约3000亿Tokens(约45TB原始文本数据)。顶级算力集群和漫长训练周期:数千张NVIDIAA100/H100高性能GPU组建超算中心,不间断持续训练数周甚至数月,对系统稳定性要求极高。预训练模型的短板缺乏领域专业性,不懂“你想要什么”,可能输出有害内容,甚至可能出现模型幻觉(Hallucination)。因此,我们需要“微调(Fine-tuning)”来解决这些问题。257.6大语言模型时代:深度理解与生成大语言模型方法:任务适配,在预训练模型的基础上,利用相对少量、针对特定任务的标注数据(如“指令-回答”对)进行短期、高效的针对性训练。第一阶段:监督微调(SupervisedFine-Tuning,SFT),教模型"什么是好答案"。将模型从单纯的“文字接龙机器”转变为可执行任务的“助手模型”。问题+答案训练STF模型监督微调学会好答案微调的目标:塑造“专家”将博学的“通才”基础模型,快速塑造成符合特定垂直领域或场景需求的“专家”。26对齐阶段:7.6大语言模型时代:深度理解与生成大语言模型监督微调只告诉了模型"该做什么",还没告诉它"不该做什么"。第二阶段:对齐(Alignment),教模型"什么是坏答案"。换言之就是"纠正错误"—告诉模型:“这样做不对,应该避免”。利用人类反馈(接受/拒绝)优化奖励模型,规避幻觉与有害输出,将模型从“能力强大的助手”打磨成“值得信赖的合作伙伴”。接受答案拒绝答案问题?对齐数据告诉模型:避免什么27大语言模型预训练-微调-对齐-部署等链条的流程:7.6大语言模型时代:深度理解与生成大语言模型海量训练数据预训练模型预训练监督微调监督微调模型对齐模型最终模型{<input,accept,reject><input,accept,reject><input,accept,reject><input,accept,reject>}对齐部署Question?Answsertest-time测试推理阶段预训练打造模型的“知识基座”微调赋予模型“专业技能”对齐校准模型的“价值观”这一范式的建立,正式开启了自然语言处理(NLP)的新时代28以DeepSeek为例,与DeepSeek的一次对话及其创作过程展示:7.6大语言模型时代:深度理解与生成大语言模型29有了自回归这个通用引擎,对话和创作就只是“输入提示”不同而已。比如诗歌、故事、代码等等。7.6大语言模型时代:深度理解与生成大语言模型30如果每次都选概率最高的词,生成结果可能会很机械、重复。如何控制大预言模型的“创意度”呢?7.6大语言模型时代:深度理解与生成大语言模型答案是使用“温度”来调节预测概率分布的平滑程度。31温度(temperature):低温“保守”,高温“冒险”。7.6大语言模型时代:深度理解与生成大语言模型核心数学思想:概率的链式法则。自回归生成的本质是:一个序列的联合概率,可以分解为一系列条件概率的乘积。假设需要生成文本序列:
,那么整个序列的概率是:大语言模型所做的就是在每一步用一个巨大的神经网络(如Transformer)来近似计算条件概率:32温度(temperature):低温“保守”,高温“冒险”。7.6大语言模型时代:深度理解与生成大语言模型LLM的“下一步决策”:LLM的输出层会得到一个针对词汇表中所有词的“分数”向量。这个分数向量经过Softmax的函数转换成一个概率分布:概率分布转换模型输出词汇表中所有词的“分数”向量(Logits),再通过Softmax函数将其归一化为有效的概率分布,确保所有词的概率之和为1。模型就像一位严谨的考官,它为词汇表中的每个词进行打分(Logits),而Softmax则像一个公正的规则,把绝对的分数转化为相对的、可被采样的概率分布,决定下一个词是谁。33温度(temperature):低温“保守”,高温“冒险”。7.6大语言模型时代:深度理解与生成大语言模型❄
低温(τ≈0.2)保守模式,倾向选高概率词。输出稳定、可预测,适合:事实问答、代码生成。🔥
高温(τ≈0.8)创意模式,低概率词也有机会。输出更多样、随机,适合:文学创作、头脑风暴。34语境理解示例:从指代消解到情感分析7.6大语言模型时代:深度理解与生成大语言模型1.指代消解:确定代词(如“他”“她”“它”)所指代的具体对象。例如,“小明把蛋糕给了小红,因为她很喜欢吃。”其中的“她”指的是谁?步骤:解析事件结构→调用世界常识→构建推理链35语境理解示例:从指代消解到情感分析7.6大语言模型时代:深度理解与生成大语言模型2.情感分析:判断一段文本所表达的整体情感倾向(如正面、负面、中性)。例如,“这手机的相机功能惊艳到我了,就是续航实在太拉胯”为例,机器能否判断出情感?步骤:识别评价对象与逻辑关系→量化与权衡情感强度→结合常识进行综合判断36语境理解示例:从指代消解到情感分析7.6大语言模型时代:深度理解与生成大语言模型3.阅读理解:基于给定的文本(篇章),准确回答所提出的问题。例如文章:“苏轼,号东坡居士,是北宋著名的文学家、书法家。他的词作《水调歌头·明月几时有》广为传唱。”
问题:“《水调歌头·明月几时有》的作者是谁?”步骤:实体识别与知识关联→指代消解→关系抽取→精准定位与匹配37大语言模型展现的的基本能力:7.6大语言模型时代:深度理解与生成大语言模型模型展现的能力在对话中的具体体现对应的技术基础深度语义理解从“文学家+政治家+改革+贬谪”等抽象描述中捕捉核心特征,关联到具体历史人物。词嵌入、上下文感知表示知识关联与推理将“月亮主题的词”与《水调歌头》关联,进而锁定苏轼;区分王安石变法与苏轼地方治理的不同。大规模预训练获得的知识图谱、逻辑推理能力对话状态跟踪在整个多轮对话中,始终保持“核心人物是苏轼”这一焦点,每一轮回答都基于之前上下文。注意力机制、长上下文建模结构化生成规划行程时,分时段、分主题、有理由、有总结,生成条理清晰的文本。指令遵循、文本规划与控制生成跨领域知识融合将文学史、历史地理、旅游规划、饮食文化等不同领域的知识自然融合在一个回答中。多源数据预训练、统一语义空间本章目录7.1从符号开始:语言的离散式表示7.2捕捉关联:语言的分布式表示7.3词嵌入:让语义在向量空间中浮现7.4革命:让模型拥有“记忆”与“上下文”17.5进阶到Transformer:架构革命7.6大语言模型时代:深度理解与生成7.7自然语言处理的未来与挑战39大语言模型最典型的成功应用7.7自然语言处理的未来与挑战未来与挑战智能客服搜索引擎内容创作40核心挑战:幻觉、推理、常识7.7自然语言处理的未来与挑战未来与挑战1.幻觉(Hallucination):模型会生成听起来合理、但事实上完全错误或凭空捏造的信息。模型本质是概率模型,可能会一本正经地编造事实或引用不存在的文献,它追求的是“听起来像真的”而非“事实本身”。41核心挑战:幻觉、推理、常识7.7自然语言处理的未来与挑战未来与挑战2.深层推理与逻辑:深层推理时输出错误答案,导致答案与推理链条之间产生矛盾。对于数学证明等需要复杂逻辑链的任务,模型表现仍有欠缺。其所谓的“推理”大多基于海量数据的模式匹配,而非真正的逻辑推导。42核心挑战:幻觉、推理、常识7.7自然语言处理的未来与挑战未来与挑战3.常识缺失:忽略底层认知与物理基础。模型缺乏真实的物理世界体验和生活常识,对于人类习以为常的空间关系、因果逻辑或社会常识,往往会产生令人
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 个性化医疗与基因检测
- RCA分析之给药错误专家讲座
- 输血相关试题及答案详细解析
- 进展性脑卒中中医治疗效果观察
- 2026中国智能家电用智能音箱行业市场现状供需分析及投资评估规划分析研究报告
- 肿瘤生物治疗研究进展与临床应用探讨
- 耳鸣与听力损失治疗
- 课程研究的生态学审视
- 根管治疗术-根管充填方法垂直加压法(口腔科技术)
- 护理康复技术的研究与应用
- EAST5.0数据结构一览表
- 术中获得性压力性损伤预防
- DL-T596-2021电力设备预防性试验规程
- 新学期开笔礼
- 大学语文(第三版)课件 都江堰
- 混凝土浇灌证明1
- 安规考试题库
- GB/T 19363.1-2022翻译服务第1部分:笔译服务要求
- 山东2023年青岛银行总行部门社会招聘考试参考题库含答案详解
- 遥控匹配防盗设定方法-丰田it2使用知识
- SB/T 10530-2009商务领域射频识别标签数据格式
评论
0/150
提交评论