大模型技术深度解析(微课版) 课件5.1大模型推理能力_第1页
大模型技术深度解析(微课版) 课件5.1大模型推理能力_第2页
大模型技术深度解析(微课版) 课件5.1大模型推理能力_第3页
大模型技术深度解析(微课版) 课件5.1大模型推理能力_第4页
大模型技术深度解析(微课版) 课件5.1大模型推理能力_第5页
已阅读5页,还剩33页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大模型推理主要内容一、介绍二、大模型推理背景三、大模型推理的主要任务四、提示工程方法五、推理数据集的构建六、缓解逆转诅咒七、应用场景讨论一、介绍AI已有类人推理能力?数学推理测试成绩优异代码生成能力优异AI模型的推理模式与问题给予概率的模式匹配标记偏差逆转诅咒一、介绍AI发展的潜在危机高质量数据即将被AI学习用完赋予LLM推理能力提示工程更复杂的思维架构构建更适合AI推理的数据集二、LLM推理的背景Transformer架构LLM使用因果掩码损失进行下一个标记预测的自回归语言建模是成功的自我监督学习方法编码器与解码器多头注意力机制二、LLM推理的背景LLM推理过程主流仅解码器LLM,通常采用自回归方法来生成输出句子。在每个步骤中,LLM将之前的加上此步的整个Token序列作为输入,并生成下一个Token。LLM的基本推理能力随着模型大小和训练数据的增加,LLM的性能会显著提高。解锁小型模型中所没有的非凡能力,例如上下文学习、角色扮演和类比推理完成代码生成、机器人控制和agent三、LLM推理的主要任务数学问题推理解决数学问题通常需要一步或多步算术推理。基于对输入问题、隐含算术运算和概念知识的理解,解题者需要根据已有知识和已知条件推导出一系列结果,从而得到最终答案。例:多项选择题测试包含4个问题,每个问题有5个答案选项。如果每个问题都尚未回答,那么答案有多少种填法?数学问题推理的特点包含小学水平的数学知识。这包括加、减、乘、除等基本运算;一些考试的基准测试;或是大量高级数学知识和数学推理技巧,以及多步思考的能力才能解决的问题。三、LLM推理的主要任务常识性问题推理常识性推理指的是基于日常生活经验和世界常识进行的推理能力。它涉及理解隐含的知识、处理模糊信息,以及做出符合现实世界逻辑的判断。例:我该如何为豚鼠笼子里的新主人做好准备?常识性问题推理的特点常识性推理具有隐含性,普适性,模糊性,动态性等特点。涉及大量的细节,并且往往模棱两可。常识性问题的挑战AI需要处理模糊和非结构化的信息。三、LLM推理的主要任务符号推理符号推理是一种基于符号表示和逻辑规则的推理方式,通常用于精确地解决问题,进行数学推导、逻辑推理和知识表示。符号推理的特点符号推理的核心在于使用明确的规则、定义和关系,通过符号进行逻辑推断。具有精确性,可解释性,基于规则,离散性的特点、常识性问题的挑战语言模型展示了理解简单符号操作的能力,但它们被认为不太擅长复杂的符号推理任务。三、LLM推理的主要任务符号推理例三、LLM推理的主要任务思维偏差与逆转诅咒当训练文档偏离模型的首选结构时,它们的知识应用能力可能会变得不稳定,甚至违反直觉。逆转诅咒是指对于“A=B”的关系,在“AisB”形式的文档上训练的LLM无法推广到反向版本“BisA”。正向和反向的形式严重影响LLM生成的准确率四、提示工程方法问题分析在开放域问答中,用户提出的问题往往存在歧义,这给准确回答带来了很大挑战。解决思路歧义检测,用于识别用户提出的问题是否存在歧义。澄清问题生成,为检测到的歧义问题生成合适的澄清问题。基于澄清的问答,根据用户对澄清问题的反馈,系统给出精确答案。复杂任务分解将问题分解为中间步骤并在给出最终答案之前解决每个步骤的方法。目标是赋予语言模型生成类似思维链的能力,即一系列连贯的中间推理步骤,从而得出问题的最终答案。四、提示工程方法思维链方法将问题分解为中间步骤并在给出最终答案之前解决每个步骤的方法。目标是赋予语言模型生成类似思维链的能力,即一系列连贯的中间推理步骤,从而得出问题的最终答案。思维链的基本形式四、提示工程方法思维链的性质思维链原则上允许模型将多步骤问题分解为中间步骤,可以将额外的计算分配给需要更多推理步骤的问题。思维链为模型的行为提供了一个可解释的窗口,并提供调试推理路径出错的地方的机会。思维链推理可用于数学问题、常识推理和符号操作等任务,并且可能适用于人类可以通过语言解决的任何任务。只需将思维链序列的示例包含在少数镜头提示的示例中,就可以在足够大的现有LLM中轻松引出思维链推理。四、提示工程方法思维链的性质自回归Transformer架构下COT要比RNN架构有更好的性能,并且模型确实在一定程度上学习了解决方案(而不是记住数据分布)CoT对数据质量有稳健性,对缺少中间CoT步骤并涉及单标记损坏的数据进行实验,模型仍然可以达到很高的准确率。四、提示工程方法思维链方法的延伸自洽思维链在思维链的基础上先从大模型生成一定数量的推理路径,通过边缘化采样的推理路径来确定最佳答案,以在最终答案集中找到最一致的答案。对比思维链的方法对比了有效和无效的答案解释,引导模型生成更准确的推理链,从而提高复杂任务的性能。思维图

允许LLM探索多条推理路径,评估潜在结果,迭代选择最有希望的路径。思维图将信息表示为图表。这种方法允许更灵活、更复杂的推理形式四、提示工程方法自我评估基于显示反馈的自我评估:实施详细的评估标准以灌输自我评估能力,或者利用自我辩论进行交叉验证。多智能体辩论利用多模型生成与辩论。将其他模型的答案反馈给每个模型,促使其更新答案。重复此过程,逐步达成一致。可以调整提示词引导模型“固执”或“开放”。通过讨论(以小组形式工作)、审查(理审查彼此的推理链和代码以确保正确性)和检索(代理评估来自其他代理的推理链)减小开销。四、提示工程方法自我纠正自我纠正是指通过反映先前响应中的错误来迭代改进未来响应的能力。外源性自我纠正LLM使用外部知识来源来提炼自己的答案。此过程使模型能够根据更新或专业信息进行交叉引用和纠正潜在错误,从而提高其响应的准确性和可靠性。内源性自我纠正指导LLM评估自己的“信心”,促进内在的自我纠正。四、提示工程方法压缩输入原因:模型的有效上下文长度是有限的思维骨架引导LLM自己推导出一个骨架。基于骨架,LLM可以并行完成每个点。提高了推理效率和否定了完全顺序编码的必要性。思维骨架图例四、提示工程方法思维递归通过生成特殊标记来递归地创建多个上下文。即使问题的解决方案超出了最大上下文大小,模型也可以将其划分为多个短上下文,以产生具有极长(100K+标记)推理步骤的能力。思维递归图例四、提示工程方法总结对LLM处理更长输入和更复杂问题的需求不断增长,这凸显了提示工程技术的重要性。在这些技术中,构建中间步骤类方法专注于提高LLM在推理过程的准确性和可解释性。对于基于API的LLM,压缩输入方法不但可以方法可以降低与输入令牌相关的API成本,也可以缓解输入过长导致的中间迷失问题。在可预见的未来,提示工程在拆解中间步骤,备选提案等方法,对于提高推理性能将变得越来越必要。五、推理数据集的构建人工标注人工标注在为LLM构建数据集中的作用是必不可少的,人工标注更为细致和准确,并且更能处理模糊的问题,各种研究也揭示了人工标注的数据在增强大型语言模型的推理能力方面起着关键作用。人工标注的问题与替代LLM的训练往往需要大量的数据,仅通过人工标注构建数据集变得越来越不切实际。需要替代方法来改进推理。协作标注:LLM来执行第一轮标注,在细化阶段,使用人工标注评估LLM生成的注释的质量,并专注于仅更正质量较差的注释子集。五、推理数据集的构建使用更强的LLM进行标注LLM可以大大加速注释过程,特别是在面对大规模数据时。LLM能保持注释的一致性,并且节省成本,适合大规模任务。基于蒙特卡洛的方法在中间解的完成时使用蒙特卡洛抽样来获得逐步训练标注.具体来说,对于每个中间解决方案,通过样本解码机制使用推理器多次完成解决方案,完成的解决方案正确的百分比称为解决方案的正确性。五、推理数据集的构建使用推理器多次完成中间解决方案,并获得这些完成的正确百分比值。二分查找的蒙特卡洛方法六、缓解逆转诅咒逆转诅咒的评估轻量级的方法都难以解决逆转诅咒。在互联网上,有许多事实只涉及单向的描述。可能的原因LLM可能会根据事实的方向以不同的方式存储关联。现有解决思路重排训练,演绎闭合训练,模型编辑,使用非自回归模型等。重排训练——逆向训练小成本逆向训练主要包括token反转,单词反转,实体翻转,随机段反转。逆向转换可以看作是模型学习的第二种“语言”。优点这种方法构造数据集的方法较为简单而且没有使用额外的数据结构。六、缓解逆转诅咒重排训练——语义感知排列训练辅助模型将原始训练句子分割成几个语义块。然后,以一定的概率对语义块重新排序。对语义的处理更加合理。六、缓解逆转诅咒演绎闭合训练标准监督目标会导致LLM为其训练数据中的语句分配高概率,但不一定是这些语句的逻辑结果。需要一个替代程序来确保LLM在经过训练和微调时为一组完整且一致的事实分配高概率。演绎闭合训练通过语言模型生成与这些文档相关或矛盾的其他文本。然后,模型会对这些生成的文本进行推理,判断哪些部分最可能是真实的,并基于这一推理结果进行微调。六、缓解逆转诅咒演绎闭合训练给定一个初始种子文档,为每个生成的文档分配一个分数。确定联合真实性得分最高的文档子集。最后,在此集合上进行微调。六、缓解逆转诅咒散列掩码使用无意义标识符,用唯一的散列值替换文本,允许在整个文本中被引用。散列方法可以优化自由文本和表格格式的表现。六、缓解逆转诅咒模型编辑——双向关系建模通过修改模型的权重,捕捉事实知识中主语与宾语之间的正向和反向关系(即以(主语,关系,宾语)三元组表示的事实知识)。在编辑过程中将双向可逆的关系融入模型,即一对一、一对多、多对一和多对多的基本关系,帮助模型在两种方向上更好地泛化和回忆事实。(a)双向加强新事实的双向关联(b)双向削弱旧事实的关联。六、缓解逆转诅咒使用非自回归模型自回归模型的顺序采样过程效率低下,限制了非顺序的推理能力。原因:模型通过概率链式法则来表征联合分布。主要思路使用扩散模型代替自回归模型。六、缓解逆转诅咒重参数化离散扩散删除了时间条件,是一种没有时间条件的专用扩散模型,用于表征与时间无关的条件概率。优点实现简单当噪声样本在采样间隔内保持不变时,还可以通过缓存与时间无关的网络的输出来减少函数评估的数量。缺点对于可变长度支持的灵活性不足。六、缓解逆转诅咒掩码扩散模型填充序列中的掩码位置来实现灵活的双向上下文建模。优点有效地克服了反向诅咒保持了相同的性能而且对时间变化更稳健,缓解了模型老化现象更适合不断发展的数据分布评估的数量。缺点但是在规模定律和条件生成方面,与自回归模型相比存在差距。七、应用场景讨论提示工程的交叉多种提示工程方法往往可以互相兼容,将多种兼容的提示工程方法因地制宜的组合使用应该是提示工程应用的有效方向。例如:思维图可以与思维骨架相结合使得LLM可以遵循动态的思维图。缩短思维链现象:延长推理步骤也会大大提高LLM的推理能力。相反,在保留关键信息的同时缩短推理步骤会显著降低模型的推理能力。尝试使用LLM的内部隐式推理,取代显式推理步骤的研究并未取得好的效果。可能的方法:使用不同的初始提示标记来调节较长和较短的思维链,LLM可以学习它们之间的差异和联系,以生成更短的思维链。七、应用场景讨论文档结构扩充通过LLM自身构造更多范式,正向反向的数据,为LLM提供符合更多结构的数据集,减轻LLM的思维偏差和逆转诅咒现象。结果奖励与过程奖励结果奖励相对容易构建,但它缺乏对中间步骤的监督,LLM可能通过错误的中间推理步骤得到正确的结果,这可能会降低推理性能,一个具有挑战性但是有效的方向是将结果奖励高效低成本的转化为过程奖励。多模态大模型推理多模态大模型具有类似人类的反应,因此它们常常给人一

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论