大模型基础及应用教程课点3-4 大语言模型_第1页
大模型基础及应用教程课点3-4 大语言模型_第2页
大模型基础及应用教程课点3-4 大语言模型_第3页
大模型基础及应用教程课点3-4 大语言模型_第4页
大模型基础及应用教程课点3-4 大语言模型_第5页
已阅读5页,还剩38页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大模型概述大模型基础及其应用

第1章☆K08:叙述大语言模型定义。☆K09:描述神经网络训练过程☆K10:说明Transformer工作过程☆K11:描述大语言模型底层逻辑★K12:叙述思维链原理☆K13:叙述知识增强三种方法☆K14:陈述大模型概念★K15:辨别大模型和小模型☆K16:论证大模型和大语言模型关系☆K17:描述大模型发展历程★K18:解释大模型生态。课点3-4教学目标大语言模型课点03人工智能机器学习神经网络深度学习NLP大语言模型大语言模型(LLM,LargeLanguageModel):处理自然语言的模型。Tansformer是特殊的神经网络,适合自然语言处理任务。描述神经网络训练过程描述神经网络训练过程

一个神经网络有很多很多层,层与层之间有很多的线(权重)把它们连起来,每一层里面有很多的点(神经元),每一个神经元对输入的数据进行大量的乘法(图1.13)。然后,每一个神经元再把输出发散到下一层的所有点再乘一遍,以此类推,随着层次的增多,乘法的数量是天文数字。描述神经网络训练过程

深度学习——调整权重自动化体验神经网络:/说明Transformer工作过程

循环神经网络RNN说明Transformer工作过程RNN弊端:记忆的路径很短

Transformer:RNN+注意力机制Transformer三要素:Encode、Decode、Atention☆K08:叙述大语言模型定义。☆K09:描述神经网络训练过程☆K10:说明Transformer工作过程☆K11:描述大语言模型底层逻辑★K12:叙述思维链原理☆K13:叙述知识增强三种方法☆K14:陈述大模型概念★K15:辨别大模型和小模型☆K16:论证大模型和大语言模型关系☆K17:描述大模型发展历程★K18:解释大模型生态。课点3-4教学目标说明Transformer工作过程Transformer里面所有的计算都是以数字为基础进行运算的。大语言模型底层逻辑预训练微调提示词Agent大语言模型底层逻辑

(1)pretraining(预训练——词接龙)

计算量非常大。当我们问一个问题的时候,我们想到的是一个回答,而不是单纯存的下面会出现的高频的字。

(2)finetuning(提示词)

计算量会大大的减少,但是会极大的依赖“人工”。

(3)reinforcementlearningwithhumanfeedback(RLHF,微调)。

对于不同的模型在训练最后的RLHF,一些数据的处理上面,都会有不同的选择,造就了这些模型不一样的优势和劣势。

当你理解了LLM如何实现的以后,现在AI做出来的事情就不会再像是魔法。你会理解它是一个有很多数学,还有数据存储,以及很多的计算堆砌而成的一个以人类语言为基础的输入、计算和输出。知识增强三种方法这种方法比较容想到的,就是你可能没有问清楚。这个时候,就是要把prompt整理成一个让大模型能听得懂的话语来描述。Prompt有四种形式:方法1:优化Prompt知识增强是一种可通过结合外部知识源,来增强语言模型的能力的技术,让大语言模型提供更准确的与上下文相关的响应。这项技术在自然语言处理(NLP)领域至关重要,解决了传统模型由于训练数据的时效性、有效性和准确性等挑战。优化Prompt

(1)零样本提示,是指不使用任何示例数据,只依靠一个精心设计的提示来激活语言大模型中与目标任务相关的知识和能力。

零样本提示对使用者门槛较高。

(2)少样本提示,是指在一个自然语言提示后面附加一些示例数据,作为语言大模型的输入。其可以提高语言大模型在不同领域和任务上的适应性和稳定性。少样本提示也存在一些挑战,例如如何确定合适的示例数量、如何选择示例等。优化Prompt

(3)上下文学习,也称情境学习。情境学习可以看作是一种特殊形式的少样本提示,在提示词中包含了对目标任务的约束信息。优化Prompt

(4)思维链

思维链(ChainofThought,CoT),在人工智能领域,是一个非常新颖的概念。如,我们在工作、学习经常用到的思维导图,把问题描述为分步骤求解的过程,很像算法描述。识别任务:我们需要找出“deepseek”中字母“e”的数量。观察单词:仔细观察单词“deepseek”,注意每个字母。计数:逐个字母地数,每遇到一个“e”就计数一次。连续字母处理:特别要注意连续的字母“e”,确保每个都被计数。得出结果:将所有“e”的数量加起来,得出最终答案。优化Prompt知识增强三种方法RAG(RetrivalAugmentedGeneration)有可能是我欠缺相关领域的知识。这个时候怎么办?一个正确的方案是给我讲清楚问题,最好围绕问题给我把XX行业的相关的一些背景知识给我讲清楚,让我明白问题的背景问题。方法2:RAG知识增强三种方法如果RAG也没有办法解决,那我可能去考虑第三个原因,有可能是我自身的能力的不足。第3种情况,实际上就是不要再去抱怨外部的环境,而是先重点提高自己。方法3:微调RAG和微调选择简单理解的话,RAG里面大模型是没有被训练的。但是在微调里面,我们是叫训练大模型的。它俩的区别?我们来讨论几个场景,然后来判判断到底哪个场景适合用RAG还是微调。RAG和微调选择第二场景就是定制模型的能力。比如我们在开发的时候,希望模型具备一定特殊的能力。比如说它以特殊的口吻去跟用户去交流。那这种能力可能是第一种模型没有具备。显然这个时候候,需合的就是微调。比如我们模型需要去阅读一些金融的研报,或者抽取一些内容,比如说某种口吻去进行销售。2第一种场景是动态的数据。这里的动态数据指的是经常会变化的数据。比如说像企业里的一些业务数据,为了能够满足这个场景,最适合的明显是RAG。如果使用微调的话,每次数据的改变,我们都要重新去微调我们的模型,这显然是不太划算的。使用RAG的话,我们其实不太需要关注它的数据的改动有多频繁,我们只需要在需要的时候,把数据检索出来就可以。1RAG和微调选择第五场景是成本,从成本的角度来讲,那很显然RAG也是我们的首选。因为,在RAG里面,我们不太需要去训练一个模型。我们只需要通过一个工程的方式,把这套流程搭起来。但是微调的话,需要收集数据,然后进行微调,微调效果不好。我们还要接着去做迭代,所以它的成本是比较高的。2第四场景是可解释性。因为有些时候呢,我们希望模型具备一定的可解释性。它告诉我们为什么。从这个角度来讲,RAG肯定是要优胜于微调的。因为微调很多时候它就是一个黑盒子,我们不太清楚它到底内部是怎么工作的,而且出了问题,我们也很难去追溯到为什么某一个单词生成了。所以,这时候RAG肯定是我们的首选。4第三场景幻觉。实际上,RAG和微调对幻觉都是有帮助的。从效果的角度来讲,RAG对幻觉的影响要大于微调。1RAG和微调选择第七场景是,有些时候我们需要低延迟的场景,就是对延迟的要求比较高。这个时候微调是我们的首选。因为RAG本身为包含了很多的流程,那这个流程里面,既包含像检索,还有像排序,这些都是比较耗时间的。所以,如果我们的要求是非常低得延迟。那肯定是微调是首选。还有就是像智能设备的场景,在智能设备的场景下,就是硬件本身它的资源是比较有限的(边缘计算)。所以很多时候我们可能不得不去使用一些小模型。那小模型我们也知道它的通用能力是比较差的。在这样的场景下,我们更希望这个模型可以在某一个方面能力比较强,它不需要懂很多。所以,这个情况下,微调可能也是我们的首选。7第六场景是,我们的业务场景依赖于一定的大模型的通用能力,包括它的对话能力。这个时候很显然也是RAG是我们的首选。当我们去进行模型微调的时候,本质上我们对模型进行了改变,这种改变,它不可避免的会导致原有模型能力的一些降低,我们也把它叫做模型的遗忘。6☆K08:回忆大语言模型定义。☆K09:描述神经网络训练过程☆K10:说明Transformer工作过程☆K11:描述大语言模型的底层逻辑★K12:叙述思维链原理☆K13:叙述知识增强三种方法☆K14:陈述大模型概念★K15:辨别大模型和小模型☆K16:论证大模型和大语言模型关系☆K17:描述大模型发展历程★K18:解释大模型生态。教学目标回顾大模型课点04大模型和小模型

在ChatGPT之前,被公众关注的AI模型是用于单一任务的,比如众所周知的AlphaGo可以基于全球围棋棋谱的计算,打赢所有的人类围棋大师。这种专注于某个具体任务建立的AI数据模型叫“小模型”。ChatGPT与“小模型”不同,ChatGPT更像人类的大脑,可以在海量通用数据上进行预先训练,能大幅提升AI的泛化性、通用性、实用性。

小模型通常指参数较少、层数较浅的模型,它们具有轻量级、高效率、易于部署等优点,适用于数据量较小、计算资源有限的场景,例如移动端应用、嵌入式设备、物联网等。

大模型让机器有常识,大模型最本质的特征不在于“大”(大参数、大计算、大数据),这只是一个表象,大模型本质是“涌现”“出乎意料”“创造”。大模型也叫“教师模型”小模型也叫“学生模型”大模型特点巨大的规模:大模型包含数十亿个参数,模型大小可以达到数百GB甚至更大。巨大的模型规模使大模型具有强大的表达能力和学习能力。预训练+微调:大模型可以通过在大规模数据上进行预训练,然后在特定任务上进行微调,从而提高模型在新任务上的性能。0103涌现能力:涌现能力指的是当模型的训练数据突破一定规模,模型突然涌现出之前小模型所没有的、意料之外的、能够综合分析和解决更深层次问题的复杂能力和特性。自监督学习:大模型可以通过自监督学习在大规模未标记数据上进行训练,从而减少对标记数据的依赖,提高模型的效能(类似于强化学习)。0204大模型和大语言模型

大模型是多模态大模型的简称,可以处理自然语言处理、语音识别、计算机视觉等领域的大模型,LLM是大模型的基础。人工智能发展态势ANI过度AGI过度ASI能学

会学

想学用力

用脑

用心人工智能研究范式大模型发展历程大模型生态大模型生态大模型生态大模型生态教学目标回顾☆K14:陈述大模型概念★K15:辨别大模型和小模型☆K16:论证大模型和大语言模型关系☆K17

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论