版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
《现代深度学习教程》第10章
基础模型核心技术——提示学习主讲:XXX时间:2026/9/21目录CONTENTS01提示学习的基本流程03提示学习示例05自我微调02提示学习主要构造04提示微调06本章小结AI10.1提示学习的基本流程10.1从监督学习到提示学习传统NLP监督学习输入文本x,模型为p(y|x),通过包含输入-输出对的数据集训练参数,往往需要大量标注数据。现实局限:许多任务无法找到大量数据。→基于提示的学习在输入段添加额外文本(提示),突破预训练与微调之间的壁垒,直接使用预训练语言模型的知识。不需要训练数据修改下游任务来适应预训练模型,绝大多数NLP任务都可以直接使用。①填空提示(ClozePrompt)填补文本字符串的空白,适合掩码式语言模型。②前缀提示(PrefixPrompt)延续字符串的前缀,适合自回归语言模型。4/3210.1填空提示与前缀提示的经典案例填空提示:Petroni等人(MLM)探讨预训练语言模型如何学到语言知识:利用多种数据集构造填空提示,看预训练模型能否预测出缺失词。Iliketoeat(
)模型预测空缺位置的词,预测正确说明预训练语言模型学到了这些知识。前缀提示:Brown等人(GPT-3)通过设计多种前缀提示模板解决各种NLP任务:文前提供任务描述,让模型预测句子末尾的单词。TranslateEnglishtoChinese:Smart将翻译任务转换成前缀提示。如何选择?生成任务或自回归语言模型→前缀提示更有利(与从左到右的性质融合);掩码式语言模型→填空提示更合适(与预训练任务形式接近);全文重构模型两者皆可。多输入任务(如文本对分类)的模板须包含两个输入空间[X1]和[X2]或更多。5/3210.1提示学习的规范化形式式(10.1)提示工程函数f_prompt将输入文本x转化成提示的形式x'f_prompt的两步操作(1)使用一个模板:通常为一段自然语言,包含两个空位置——用于填输入x的位置[X],和用于生成答案文本z的位置[Z]。(2)把输入x填到[X]。通常情况下,[X]的数量和[Z]的数量可以根据手头任务的需要灵活地变化。示例:文本情感分类输入:"Ilovethisplace."模板:"[X]Overall,itisa[Z]place."得到的提示:"Ilovethisplace.Overall,itisa[Z]place."6/3210.1搜索潜在答案并映射到输出①定义答案空间:将Z定义为z允许的集合,如{"great","fine","bad"}表示标签集Y={++,+,-}中的每个类别。②填充提示:用函数f_fill将潜在答案z填入提示x'中的[Z]。填入真实答案后即得到"有答案的提示",如:Ilovethisplace.Overall,itisabadplace.式(10.2)用预训练好的大模型P(θ)计算已填充提示的概率来搜索潜在答案;可以是得分最高的argmax搜索,也可以是按概率分布随机抽样的抽样。③答案→输出映射:从最高分的答案ẑ得到最高分的输出ŷ。答案本身就是输出的情况很简单(如翻译等生成任务);但多个答案可能对应同一个输出(如"beautiful"、"great"、"wonderful"都代表类别"++"),此时需要在答案与输出值之间建立映射。7/32AI10.2提示学习主要构造10.2主要构造总览
与10.2.1预训练模型的选择提示学习的基本流程包含4部分:提示模板(Template)的构造、提示答案空间映射(Verbalizer)的构造、将文本代入模板、使用预训练语言模型进行预测。①预训练模型的选择预训练模型用于计算P(x),对学习性能有巨大影响,目的在于计算包含某种预测文本x的概率。训练目标多样:降噪目标、损坏的文本重建、全文重构等(已在第8章介绍)。②提示工程(模板)在不改变模型参数的情况下,通过设计输入文本引导大模型产生理想输出;分为离散型与连续型两大类自动生成方法。③答案工程寻找答案空间Z与原始输出Y的映射,从而形成有效的预测模型;分为人工设计与自动设计。9/3210.2.2提示工程:从人工构造到自动生成提示工程是在不改变模型参数的情况下,通过设计输入文本来引导大模型产生理想输出的方法。它对提示学习的效果影响很大,目前仍处于经验探索阶段——不同模型对提示的反应差异显著,需要进行大量实验不断尝试。人工构造(起点)最初的提示模板由人工构造,直观但成本高。自动生成(两大类)离散型:提示语挖掘、提示语转述、基于梯度的搜索、提示语生成、提示语评分。连续型:前缀优化、离散提示初始化的优化、离散-连续提示混合优化。核心思想:每种方法都在寻找更有效的提示方式,以提升模型的表现力。10/3210.2.2提示工程:离散型方法1提示语挖掘(PromptMining)江政宝等人提出:在大型文本语料库中搜索同时包含输入x和输出y的字符串,找到二者之间的中间词或依赖路径,高频出现的即可作为模板,如"[X]中间词[Z]"。2提示语转述(PromptParaphrasing)将现有种子提示转述成一组候选提示再择优:翻译成另一种语言再翻译回来、用同义/近义短语替换等。3基于梯度的搜索(Gradient-BasedSearch)TaylorShin等人提出:遍历词表组合成提示,用梯度下降不断尝试,让预训练模型生成需要的词——相当于逆向操作(详见下页图10.1)。4提示语生成(PromptGeneration)用自然语言生成模型来生成提示,如LM-BFF引入T5模型:固定标签词映射→在标签词前后添加[MASK]→T5解码多个候选模板→逐一微调选最佳。5提示语评分(PromptScoring)JoeDavison等人提出:人工筛选候选模板并填补输入和答案,用单向模型对填充提示打分,选择概率最高者为每个输入定制模板。11/32基于梯度的搜索:自动提示基本思路:从词表中遍历所有的词,看哪些词组成的提示模板能最终生成训练数据中待填充的词——相当于做一个逆向操作。如图10.1所示,提示模板需要填充的词用
[MASK]
初始化,然后看使用什么词替换[MASK]会让标签正确的概率最大,再逐步替换,得到模板。应用场景:自动提示来探测MLM(掩码语言模型)进行情感分析的能力。图10.1应用自动提示来探测MLM进行情感分析的能力12/3210.2.2提示工程:连续型方法核心思想:没有必要将提示限定为人类可理解的自然语言——直接在模型的嵌入空间中进行提示。消除了两个约束:①模板词嵌入不必是自然语言词嵌入;②模板不再由预训练LM的参数决定,而是拥有自己的可调参数。(1)前缀优化(PrefixTuning)将连续的特定任务向量序列(前缀)预加到输入中,只对每个任务优化对应的前缀。只需存储一个大型Transformer和任务特定前缀的副本,每个额外任务开销非常小。(2)用离散提示初始化的优化如钟泽轩等人的OptiPrompt:先用离散搜索(自动提示)定义模板,再据此初始化虚拟标记并微调嵌入。人工模板初始化可为搜索提供更好的起点。(3)离散-连续提示混合优化(P-tuning)在人工提示模板中插入可优化的嵌入,详见下页。图10.2前缀优化流程示意13/32离散-连续混合优化:P-tuningP-tuning通过在嵌入输入中插入可训练的变量来学习连续的提示语。给定预训练语言模型M,输入序列x=(x₀,x₁,…,xₙ)经模型M的映射层映射为输出embedding:e(x₀),e(x₁),…,e(xₙ);V为词表,T为模板,[Pᵢ]为第i个提示标记。传统做法
式(10.3)给定模板T={[P₀],y,x,[P₁:i:m],y},离散模板满足[P]∈V并将T映射为P-tuning式(10.4)将[P]视为伪标记,将模板映射为优化目标
式(10.5)hᵢ是可学习的张量;设下游任务损失函数为L,通过优化损失去找连续提示h₍₀:m₎意义:能更好地找到连续的提示,而不是局限于模型M的词汇表表达V。14/3210.2.3答案工程目的:寻找答案空间Z与原始输出Y的映射,形成有效的预测模型。必须考虑两个方面:决定答案形式、选择答案设计方法。根据提示,BERT能回答JDK是Oracle研发的;BART知道人类想问的是文章摘要;ERNIE知道鸟类的能力是飞行。答案的三种形式(按粒度区分)①标记:预训练LM词汇表中的一个标记或其子集②文本跨度(Span):简短的多标记跨度,通常与前缀提示一起使用③句子(Sentence):一个句子或文档,通常与前缀提示一起使用标记或文本跨度广泛用于分类任务;较长的句子答案空间常用于语言生成任务。图10.3答案工程图示15/32答案设计方法:人工设计
与
自动设计人工设计潜在答案空间Z和它与Y的映射由人设计。无约束空间下(所有标记、固定长度跨度或标记序列),最常见的是将答案Z直接映射到输出Y;受限空间针对标签空间有限的任务(文本分类、实体识别、多选题)——手动设计与主题、情感相关的词语列表,并在Z与基础类之间建立映射Y。自动设计:离散答案搜索①答案解析从初始答案空间出发,用解析扩展空间以扩大覆盖范围。如多选问答:将问题I(X)与候选答案集合一同输入语言模型,选概率最大者为答案。②先修剪再搜索(PET)先用可信答案组成修剪过的答案空间,再进一步搜索。模式利用训练(PET):x经提示工程转为带[MASK]的文本P_prompt(x),用LM预测掩码标记;类别y的概率即预测标记为M(y)的概率。③标签分解(KnowPrompt)关系抽取中将每个关系标签分解为组成词作为答案:如"per:city_of_death"去掉连接词of后对应候选答案{person,city,death}。连续答案搜索研究尚少:WRAP(词级对抗重编程)为每类别指定一个连续变量表征,经梯度回传更新词嵌入。16/32AI10.3提示学习示例10.3.1Zero-Shot(零样本)提示学习零样本提示学习是指直接将任务描述成文本输入模型,且不需要向模型提供任何示例,模型据此生成对应的结果。Zero-Shot和Few-Shot是常见的提示学习方法,通常被用于比较模型的基准性能。提示输入将文本分类为中性、负面或正向。文字:我觉得假期还可以。情绪:输出中性18/3210.3.2Few-Shot(少样本)提示学习作为上下文学习技术,在提示中加入多个任务示例(每个均含完整输入与输出),帮助模型更好地理解任务要求。相比零样本通常性能更好,但代价是更长的上下文输入,可能超过模型最大输入长度限制。示例:学会使用新词(2020年)"Whatpu"是一种生长在坦桑尼亚的小型毛茸茸的动物。使用该词的句子示例:我们在非洲旅行时看见了这些非常可爱的Whatpu。"扑啦费"是指快速地跳上跳下。使用该词的句子示例:输出:当我们赢得游戏时,我们所有人都开始扑啦弗。模型通过一个示例即可执行任务;更难的任务可多次输入示例。局限:复杂推理任务上会出错这组数中的奇数相加是一个偶数:4、8、9、15、12、2、1。A:答案是假的。……(多个示例)这组数中的奇数相加是一个偶数:15、32、5、13、82、7、1。A:输出:答案是真的。(15+5+13+7+1=41,为奇数,实际错误)19/3210.3.3CoT(思维链)提示学习思维链(ChainofThought,CoT)提示被广泛应用于解决更复杂的算术、常识和符号推理任务。与传统的提示相比,思维链提示多了中间推导的逻辑推理过程,这种推理解释往往引导出更准确的结果,且可与少样本提示结合使用。Q:奇数相加得到偶数:15、32、5、13、82、7、1。A:将所有奇数(15、5、13、7、1)加起来得到41。答案是False。提供推理步骤后,得到了正确的结果。图10.4传统提示与思维链提示对比20/32零样本思维链(Zero-Shot-CoT)将零样本与思维链提示结合:对于一个问题,仅提供一行文字提示
"Let'sthinkstepbystep",模型就可以自己生成对问题的推理过程,并得出正确的答案。阶段①:生成推理过程对原问题添加文字提示,使用模型生成推理过程(图10.5左侧)。阶段②:生成最终答案将模型生成的推理过程加入原问题,并添加生成答案的提示,使用模型生成问题的最终答案(图10.5右侧)。图10.5
Zero-Shot-CoT流程21/3210.3.4自一致性提示学习在思维链提示的基础上提出,旨在取代思维链提示中使用的幼稚贪心解码。核心假设:复杂推理任务一般可以通过多个推理路径获得正确答案——从解码器中抽样生成多样化的推理路径集合,选择一致性最高的输出结果作为最终答案,降低单次采样的随机性。①
思维链提示②
对语言模型进行多次采样,生成多个推理路径③
对不同推理路径生成结果基于投票策略选择最一致的答案输出图10.6自一致性提示学习的核心流程22/32自一致性示例:多条推理路径+投票提示输入(含9个带推理的问答示例)Q:我6岁时,我的妹妹的年龄是我的一半。现在我70岁了,我的妹妹今年多少岁?A:(示例覆盖种树、停车场、巧克力、棒棒糖、玩具、计算机、高尔夫球、百吉饼等算术推理场景)输出1:她当时是3岁。现在我是70岁,所以她的年龄是70-3=67。答案是67。输出2:他的妹妹就会有70-3=67岁。答案是67。输出3:她就是我的年龄的一半,也是35岁。答案是35。三条推理路径中
67出现两次(多数)——投票策略选择最一致的答案:67。23/32AI10.4提示微调10.4提示微调(PromptTuning)总述大语言模型规模庞大,直接修改模型架构或参数会带来高昂的计算和存储成本。提示微调通过设计输入提示,在少样本甚至零样本条件下显著提升模型的生成质量。当前ChatGPT等模型多部署于云端,用户无法访问模型的梯度或结构等内部信息——在此类黑盒环境下,进化计算方法凭借高度的灵活性和有效性受到广泛关注。基本流程:利用演化算法搜索最优提示,以最大化目标任务的性能——仅依赖模型的推理结果,不需要获取任何内部梯度信息。按提示的类型分为两种:连续提示微调采用连续型演化算法(如协方差矩阵适应进化策略CMA-ES)优化提示嵌入向量。代表:乾元大模型BBT/BBTv2。离散提示微调设计离散型演化算法,在提示词空间直接搜索,用手工设计的遗传算子修改提示词。代表:GrIPS无梯度指令提示搜索。25/32连续提示微调:BBT(BigBangTransformer)传统下游任务适应依赖梯度下降,调整成本随模型规模线性增长;BBT仅利用模型的前向推理过程优化提示。给定黑盒APIf(接收连续提示p与转换文本X̃,输出[MASK]标记逻辑值),将下游任务表述为语言建模任务:式(10.6)在提示空间P中找最优提示p*,最小化损失函数Γ(如交叉熵)式(10.7)p通常数万维,无导数优化不可行→BBT用随机投影A∈ℝ^(D×d)生成低维子空间Z⊂ℝ^D执行优化p₀为初始提示嵌入——若不使用预训练的提示嵌入,p₀就是从词汇表中随机抽取的词嵌入。图10.7
BBT方法流程26/32BBTv2:深度提示微调(算法10.1)算法10.1:用于BBTv2的提示微调算法输入:L层预训练模型APIf,损失函数Γ,
API调用预算B,无导数优化器{M_j}1:初始化随机投影{A_j}2:初始化权重{z^(j)}3:深度提示p=⟨A₁z⁽¹⁾,…,A_Lz⁽ᴸ⁾⟩4:fori从1到B/L:5:
forj从1到L:6:
评估:loss=Γ(f(p))7:
更新:z⁽ʲ⁾←M_j(z⁽ʲ⁾,loss)8:
替换:p_j=A_jz⁽ʲ⁾9:
结束循环10:结束循环11:返回优化的深度提示p受深度提示调整启发:在预训练模型每一层都引入连续提示标记,用无导数方法优化;24层RoBERTa每层插入50个提示标记,参数量达120万→提出分而治之算法,将高维问题分解为多个低维子问题,从下到上交替优化。与BBT的三个不同①不需要预训练的提示嵌入p₀,可完全摆脱梯度②用模型特定的正态分布(而非均匀分布)生成随机投影③不仅在输入层,还用分而治之交替优化每一层的提示27/32离散提示微调:GrIPS指令搜索GrIPS(GradientFreeInstructionalPromptSearch):为大语言模型改善任务指令的无梯度、基于编辑的搜索方法,在零样本设置下提高任务性能——克服手动重写费时主观、梯度调整成本高且对API模型不可行的问题。(1)基础指令:从人类设计的初始任务指令开始(2)短语级编辑:随机应用替换(swap)、删除(del)、添加(par)等操作(3)多次迭代搜索:在小示例池(分数集,约100例)上评分引导搜索,评分含平衡准确度与预测熵度量(4)评分与选择:最佳候选超过当前基础指令则替换,否则继续(5)终止条件:分数连续P次迭代无改进,或达最大迭代次数n图10.8
GrIPS方法流程在InstructGPT上8个分类任务平均提升
4.30个百分点,在OPT、BLOOM、FLAN-T5上也有类似改进。28/32AI10.5自我微调10.5自我微调:Promptbreeder(提示进化器)得益于LLM自身强大的生成能力,LLM被嵌入演化算法作为遗传操作,自动生成高质量提示(可用
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 网络营销推广 教案全套 第1-12章 市场调研与分析 -策略调整与优化
- 秋季学校消防安全工作计划范文(3篇)
- 部编版四年级上册语文6.《方帽子店》分层练习(含答案)
- 海理定理在量子超分辨成像中的PSF工程
- 基因治疗产品预案
- 2026再生医学在神经退行性疾病中的治疗潜力探讨
- 2026中国医用敷料行业进出口现状及竞争策略研究报告
- 2026医疗行业市场全面调研及互联网医疗与远程医疗服务分析报告
- 2026年EVA研究分析报告
- 牛奶配送物流可行性研究报告
- 颅脑外伤急救现场急救课件
- 2026上海浦东新区农业农村委员会文员公开招聘4人考试备考题库及答案详解
- 2026车载显示屏行业技术迭代与供应链安全研究报告
- 2026年有限空间安全培训考核押题宝典模考模拟试题带答案(最-新)
- 2026年全国农业行业职业技能大赛(动物检疫检验员赛项)理论考试题库-含答案
- 2026年新疆广播电视台招聘事业单位人员笔试真题及答案
- 2026年人教版高三数学一轮复习第3章函数测试题库试卷
- 2025-2026学年北京市房山区北京版五年级上册期末测试数学试卷(原卷+解析)
- 26秋新人教PEP版六上英语知识点总结
- 2026年纯碱行业建设报告及市场投资分析
- T-CAQI 501-2026 乘用车用电驱动系统镁合金压铸壳体技术规范
评论
0/150
提交评论