人工智能通识教程(微课版) 课件 05人工智能技术的突破-大语言模型技术_第1页
人工智能通识教程(微课版) 课件 05人工智能技术的突破-大语言模型技术_第2页
人工智能通识教程(微课版) 课件 05人工智能技术的突破-大语言模型技术_第3页
人工智能通识教程(微课版) 课件 05人工智能技术的突破-大语言模型技术_第4页
人工智能通识教程(微课版) 课件 05人工智能技术的突破-大语言模型技术_第5页
已阅读5页,还剩83页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

05人工智能技术的突破-大语言模型技术011本章目标了解大语言模型发展现状及趋势理解token和向量理解注意力机制重点难点重点难点2/42大语言模型发展现状及趋势大语言模型与大模型单模态模型专注于处理单一类型数据(文本、图像或音频)多模态模型能够处理和融合多种类型的数据4/42GPT的影响2-1GPT影响GPT是OpenAI公司在大语言模型领域推出的里程碑式产品。GPT的出现对人工智能,尤其是自然语言处理领域的技术格局产生了深远影响。特别值得注意的是GPT-3模型。进一步提升了模型的能力边界,能够处理更加复杂的任务,展现了前所未有的语言理解和生成能力。这一突破性进展不仅标志着GPT系列模型的重大飞跃,也为整个人工智能领域的未来发展提供了新的思路和可能性。5/42GPT的影响2-2自然语言处理机器翻译问答系统文本分析编程&代码代码生成代码解释代码修复创意内容生成创作文学作品音乐生成图像生成教育&学习自动化教学知识检索数据分析论文写作商业应用客服服务市场分析娱乐休闲智能家居语音助手6/42GPT的发展史7/42GPT的使用可选的GPT模型新建对话访问地址问题输入框上传附件、搜索工具、搜索网页8/42大模型的关键进展SuperCLUE:Al大模型2025年上半年关键进展ref:《中文大模型基准测评2025年上半年报告20250804》9/42大模型的关键进展•o3以73.78的总分取得总榜第一,领跑全球。海外头部模型o3

、o4-mini(high)和Gemini-2

.5-Pro在本次七月通用基准测评中取得了73.78分

、73.32分和68.98分的总成绩,

分别位于榜单前三

。Doubao-Seed-1.6-thinking-250715以68.04的总分取得国内第一

、全球第四的成绩。•国内外头部模型之间的差异较大,海外模型在推理任务上的优势尤其明显。海外模型在推理任务上的优势尤其显著,

o3和o4-mini(high)在推理任务上分别取得了

75.02和72

.

68的分数,

领跑推理任务榜单

国内推理任务成绩最好的模型分别是DeepSeek-R1-0528和Doubao-Seed-1.6-thinking-250715

,均有超过65分的表现

,但与海外头部模型依旧相差近10分。•国内开源模型相较于海外开源模型优势显著。DeepSeek-R1-0528

、Qwen3-235B-A22B-Thinking-2507和GLM-4.5分别以66.

15分、64.34分和63.25分取得了开源榜单的前三名,

海外开源模型最好成绩仅有46.37分,

与国内开源模型最好成绩相差近20分,

国内开源模型的优势显著。•国内大模型在智能体Agent和幻觉控制任务上的表现良好。在智能体Agent任务上,

Doubao-Seed-1.6-thinking-250715以90.67分领跑全球,

GLM-

4.5和SenseNova

V6

Reasoner以83.58分并列国内第二

。在幻觉控制任务上,

Doubao-Seed-1.6-thinking-250715

、ERNIE-X1-Turbo-32K-Preview和Hunyuan-T1-20250711分别位于国内前三。•Qwen3系列的开源小参数量模型表现亮眼。Qwen3系列的多款开源小参数量模型展现出惊人潜力

。其中8B

、4B和1

.7B版本分别在10B级别和端侧5B级别的榜单中遥遥领先。10/42国内大模型发展2025年最值得关注的中文大模型及智能体全景图11/42大模型的未来发展大模型需要与人类对齐,才能在人类的驱动下改正错误,实现自我进化把大模型和周围的虚拟环境结合起来,让环境提示它的错误,从而有反思的机会去改正错误通过加上机器人,让大模型在物理世界也能工作多模态生成对产业的发展非常重要,因为大模型不仅可以生成文本,还可以生成图像、声音、视频、代码等具身智能AIAgent(智能体)多模态生成与人类对齐一些研究尝试通过微调多模态模型在多模态场景中生成高质量的思维链来探索思维链推理。推理能力12/42小结简述GPT的重要影响简述大模型的发展阶段大模型的未来发展趋势是怎么样的?13/42理解token和向量token的定义token在NLP中,token是文本的基本单位。token在大语言模型中的作用至关重要,因为它们是模型理解和处理自然语言的基础单位。token可以是一个完整的词、词的一部分(子词),甚至是单个字符。tokenization,即分词过程,是将文本转换为token的关键步骤。15/42token划分方式将文本按照词语或词组进行分割,每个词或词组作为一个token。01词级别分词将单词拆分为更有意义的小单元(子词),是目前最主流的方式。BPE:一种常见的子词算法,通过不断合并最高频的字符对来创建词表WordPiece:与BPE类似,但合并原则略有不同,广泛用于BERT等模型。02子词级别分词将文本中的每个字符都作为一个token。这种方法的粒度最细,适用于语言结构不固定、词汇边界不明确的场景。03字符级别分词16/42例句:“我正在研究引力波透镜,感觉很emo”“我

正在

研究

感觉

很”“我

镜...”BPE:“我正在研究引力波透镜,感觉

很emo”WordPiece:“我正在研究引力波透镜,感觉

很UNK”从独热编码到wordembedding独热编码‌独热编码(One-HotEncoding)是一种将离散变量表示为二进制向量的方法,主要用于机器学习和深度学习中处理分类变量。‌其基本原理是为每个分类特征的每个可能值创建一个新的二进制特征,其中只有一个特征在任何给定时间被激活(标记为1),而其他所有特征都被标记为0。17/42向量的定义2-1文本转向量向量在空间中的表示18/42向量的定义2-219/42向量的意义统一表示向量的使用使得各种不同类型的数据能够在相同的数学框架下进行处理。相似度计算通过计算向量之间的距离或相似度,可以实现各种任务,如图像检索、语义相似度计算、音频匹配等特征提取向量表示数据的核心特征,这些特征提取对于LLM的理解和决策至关重要跨模态关联向量表示使得大语言模型能够建立不同模态数据之间的关联数学运算与转换向量支持各种数学运算(如加法、减法、点积等),这使得大语言模型能够进行复杂的语义操作可扩展性向量表示的灵活性使得大语言模型可以不断扩展其能力,适应新的数据类型和任务,而无需彻底改变其基础架构。20/42常见的embedding模型Embedding模型Word2Vec

通过上下文预测单词,生成语义上相近的词向量。BERT通过双向编码器的方式,从左右两个方向同时理解文本上下文。text-embedding-3

是OpenAI新一代文本嵌入家族(small/large),在多语种检索与RAG等任务上较ada-002质量更高、成本更低,并支持长文本与向量数据库等应用场景。BGE(BAAIGeneralEmbedding)基于双向编码器与层次化语义理解框架,通过大规模多语言预训练生成高维向量(如1024维),动态融合上下文信息以捕捉词汇、短语及篇章级语义关联。21/42token与embedding之间的关系22/42embedding实例展示向量展示相似度展示23/42理解注意力机制注意力机制4-1Source注意力机制Query(Q):查询向量,用于表示当前要关注的信息。每个注意力头会根据输入序列生成自己的查询向量。Q向量用于与K向量进行相似度计算,以确定哪些值(V)应该被关注。Key(K):键向量,代表输入序列中每个元素的特征。每个输入元素都有一个对应的K向量,Q与K的相似度决定了该元素对当前查询的重要性。Value(V):值向量,实际包含的信息。每个K向量都有一个对应的V向量,最终的输出是通过加权求和V向量得到的,其中权重由Q和K的相似度决定。25/42注意力机制4-226/42注意力机制4-3注意力工作流程27/42最终的AttentionValue=0.1*Value1+0.2*Value2+0.3*Value3+0.1*Value4+0.3*Value5,这个AttentionValue是一个综合了句子中所有词信息的向量,但它更偏重于与“喜欢”相关的词汇,例如“猫”和“狗”。“我”的注意力权重可能是0.1;“喜欢”的注意力权重可能是0.2;“猫”的注意力权重可能是0.3;“和”的注意力权重可能是0.1;“狗”的注意力权重可能是0.3;Query和Key1(“我”的键向量):计算相似度,可较低。Query和Key2(“喜欢”的键向量):计算相似度,可能较高,因为它们是同一个词。Query和Key3(“猫”的键向量):计算相似度,可能较高,因为“喜欢”与“猫”有语义关联。Query和Key4(“和”的键向量):计算相似度,可能较低。Query和Key5(“狗”的键向量):计算相似度,可能较高,因为“喜欢”与“狗”也有语义关联。注意力机制4-4步骤1-计算相似度步骤2-计算注意力权重步骤3-加权求和值向量28/42自注意力机制(Self-Attention)自注意力机制(Self-Attention)Query、Key、Value都来自同一个序列内部,自己关注自己的机制29/42自注意力机制:让所有词并行思考Q(Query)矩阵:句子中所有词的“Query”K(Key)矩阵:句子中所有词的“Key”V(Value)矩阵:句子中所有词的“Value”输入核心计算流程第3步:加权融合(MatMul)根据“注意力权重”,将所有词的“核心含义”(V)进行加权混合。第1步:批量匹配。一次性计算出所有词对所有词的“相关性得分表”第2步:归一化将原始得分转换为0到1之间的“注意力权重”(可理解为百分比)。打包整个句子

输出(理解上下文后的新向量)30/42自注意力机制和RNN、LSTM的区别SelfAttentionRNN、LSTMselfAttention在计算过程中会直接将句子中任意两个单词的联系通过一个计算步骤直接联系起来,所以远距离依赖特征之间的距离被极大缩短,有利于有效地利用这些特征;SelfAttention对于一句话中的每个单词都可以单独的进行Attention值的计算,也就是说SelfAttention对计算的并行性也有直接帮助作用,而对于必须得依次序列计算的RNN而言,是无法做到并行计算的。如果是RNN或者LSTM,需要依次序列计算,对于远距离的相互依赖的特征,要经过若干时间步步骤的信息累积才能将两者联系起来,而距离越远,有效捕获的可能性越小。31/42多头注意力机制多头注意力机制是Transformer模型中的核心部分,旨在让模型可以同时从多个不同的“视角”来关注输入数据的不同部分。多头注意力机制的核心思想就是将注意力机制分成多个“头”,每个头负责从不同的“角度”去学习输入之间的关系。每个头可以专注于不同的子空间或信息,从而捕捉到不同类型的关系。多头注意力机制单头多头32/42掩码注意力机制2-1掩码注意力机制MaskedSelfAttention模型,这里的Masked就是要在做语言模型(或者像翻译)的时候,不给模型看到未来的信息,掩码注意力机制是Transformer模型中的一种重要机制,用于控制模型在处理序列数据时对不同元素的关注程度。它主要通过在注意力权重计算过程中引入掩码(Mask),来实现特定的注意力模式,如防止未来信息泄露、处理不同长度的序列等。33/42掩码注意力机制2-234/42多种多样的注意力机制不同的qkv来源定义不同的qkv计算加速方式不同的模型结构不同的加权计算方式不同的掩码注意力机制多头注意力、多层注意力自注意力机制、交叉注意力机制快速注意力、分组注意力点乘注意力、矩阵注意力、基于相似度的注意力、基于MLP的注意力BERT(双向掩码)、GPT(单向掩码)35/42GPT:通过注意力机制让Token语义更精准自注意力单向掩码注意力多层注意力多头注意力核心:多维注意力机制其参数中压缩了海量的训练数据,成为一个巨大的知识库。作为知识载体作为复杂计算器处理和转换文本数据作为一个函数将输入序列映射到输出序列能够理解和生成人类语言作为一种智能多维度理解GPT36/42小结为何文本需转向量再计算?自注意力机制中,Q、K、V如何分工合作找句子重点?自注意力机制高效在哪?37/42总结了解大语言模型发展现状及趋势理解token和向量理解注意力机制38/42作业作业1梳理本章内容,整理笔记,绘制思维导图、完成课后练习作业2:课后习题1~339/424005人工智能技术的突破-大语言模型技术0241本章目标理解大语言模型工程了解大语言模型的应用技术了解大语言模型评估重点难点42/48大语言模型工程大语言模型工程的实现数据工程(Data)能力层级(Capabilities)规模扩展(Scalingup)实现三维度44/48规模扩展:大力出奇迹3-1ScalingLaw在人工智能领域,尤其是在大模型的发展中scalinglaw扮演着至关重要的角色。它描述了模型性能如何随着模型规模(如参数数量)、数据量和计算资源的增加而提升。这一定律对于理解大模型的能力扩展和优化训练策略具有重要意义。45/48规模扩展:大力出奇迹3-2模型规模与性能计算资源与性能数据量与性能模型参数量增加通常会提升性能,但这种提升遵循幂律关系,即小幅度规模增加可能带来较大性能改进,而规模进一步增加时,性能提升速率会逐渐放缓。训练数据量的增加也与模型性能的提升相关联。更多的数据可以帮助模型学习更丰富的特征,但同样存在一个饱和点,超过这个点后,性能提升的速率会减缓计算资源的增加,如更多的FLOPs(浮点运算次数),同样与模型性能的提升相关。46/48规模扩展:大力出奇迹3-3性能提升能力涌现大模型参数量不断增长,从亿级到百亿级性能提升显著,超100B后边际效益减弱。词表从几千词扩大到几万甚至十几万词,增强语义表达准确性。词向量维度从512维增至768、1024或2048维,提升语义捕捉能力,但过高维度会增计算开销。Transformer模型层数从8层增至48层、96层甚至上百层,增强表达和泛化能力,但过多层数可能遇梯度消失等问题。当模型规模超10B时,会出现能力涌现现象,即模型在训练时未被特别设计的能力,在实际使用时却能表现出来。如GPT主要任务是预测下一个token,但达百亿参数时,能进行上下文学习、具备推理能力、遵循指令生成内容,甚至处理未训练过的新任务。能力涌现非绝对发生,但为大模型增添吸引力和应用潜力。47/48数据:大语言模型能力的来源4-12134如图书馆的公开藏书、研究论文等数据公开数据互联网数据是大模型的主要数据来源,尤其是社交媒体、博客、新闻等文本数据。互联网数据例如GitHub上的代码数据,它对大模型的推理能力提升起到了重要作用。半公开数据未来可能包括图像、视频、语音等多模态数据,但如何有效结合这些数据以用于语言模型的训练仍在研究中。其他领域数据48/48数据:大语言模型能力的来源4-2数据来源说明维基百科在线百科,严谨图书经典为主的古登堡计划和自助出版

平台Smashwords等杂志期刊论文:ArXiv等链接WebText,RedditCommon

Crawl开源项目,爬取互联网数据GitHub程序员聚集地合计700多GB,约有19万套四大名著的阅读量,5000亿左右的token数量GPT-3的训练数据49/48数据:大语言模型能力的来源4-3语言过滤指标过滤统计特征过滤关键词过滤质量过滤句子级别文档级别数据集级别冗余去除隐私数据发现隐私数据消除隐私消除子词词元化字节对编码WordPiece词元切分小红爱吃苹果,**@她吃完苹果会写作业。小红爱吃苹果。她喜欢吃苹果。小红的身份证号是32343455.小红爱吃苹果。小红/爱吃/苹果数据处理流程50/48数据:大语言模型能力的来源4-4AB数据比例数据顺序与轮次例如,维基百科、知乎、互联网爬取的文本和代码数据等,它们在训练中占据的比例会影响模型的文本生成能力、知识覆盖面和推理能力。在训练时,数据被分批送入模型,不同类型数据的输入顺序及每轮训练中的数据比例是否一致,都会对模型的训练效果产生影响。数据混合策略51/48能力:大语言模型的能力层级语言表达能力是模型最基本的能力。如ChatGPT等模型,早在2018年GPT-1就已展现此能力,能生成自然语言和代码语言,未来或能理解动物语言。因语言模型本质是建模语言规律,通过大量数据转化为模型,使大语言模型在语言处理上出色。模型的推理能力是涌现能力,需100亿级以上参数。目前的大模型中,100亿以上的基本上都有一定的推理能力,得益于强化学习技术的突破。模型具备知识存储能力,能存储海量公开知识,但存在“幻觉”和灾难性遗忘问题,大模型在知识存储上表现更佳。推理能力知识存储能力语言表达能力52/48案例剖析——GPT的“成长之路”预训练(自监督)监督微调人类反馈强化学习阶段1:模型训练接收输入处理输入进行推理生成输出上下文学习+训练知识阶段2:推理53/48深入“大脑”:GPT的工作流程010203概率模型构建构建一个能够准确表示token序列分布的概率模型。这个模型需要捕捉复杂语言模式和语义关系。表示学习利用神经网络创建能够理解上下文的有效token表示。参数优化通过前向/反向传播、迭代优化模型参数,以最小化误差。1.训练阶段:构建大脑010203上下文生成接收输入序列,并生成上下文相关的内部表示。自回归生成根据先前生成的序列,按顺序预测下一个最有可能的token(NTP)。输出序列重复生成直到达到指定长度或生成特定结束标记。模型参数保持不变。2.推理阶段:应用知识54/48深入“大脑”:GPT的记忆存储在模型的数百万或数十亿个参数中。这种记忆在推理过程中是静态的,反映了其训练数据中的海量知识和语言模式,确保了知识的一致性和稳定性。长期记忆主要通过输入上下文(即提示和正在进行的对话)来管理。这种动态记忆使模型能够在特定任务或对话中保持对话流、跟踪细节和保持连贯性。短期记忆55/48小结数据处理和模型规模,哪个对AI能力影响更大?为什么?大语言模型有哪些能力?56/48大语言模型的应用大语言模型应用场景分析3-1如撰写文章、编写文案等文本生成将文本从一种语言翻译成另一种语言翻译对长文本进行概括,提取出主要内容摘要对文本进行情感分析、主题分类等文本分析2341语言处理场景58/48大语言模型应用场景分析3-2模型回答用户提出的问题,提供准确且相关的信息智能问答系统它能够处理客户的咨询、问题解答和其他常见服务需求,减少人工客服的负担,提高响应速度和服务质量客户服务系统帮助企业和用户分析数据趋势、生成报告、提供商业洞察等,通常应用于金融、市场研究等领域。智能数据分析助手231知识助手场景 59/48大语言模型应用场景分析3-3模型将复杂的任务分解成多个可执行的步骤,并依次执行任务分解与执行模型能够理解编程语言,解释代码逻辑,甚至生成新的代码代码解释与生成如调用代码解释器、使用软件接口plug-in等软件接口操作231任务执行场景60/48大语言模型应用类型分析在模型即服务中,模型被打造成一种服务,通过API或其他形式提供给用户使用。例如,OpenAI提供的API服务,开发者可以通过调用API来利用模型的强大能力进行各种自然语言处理任务。模型增强AI赋能指的是将大语言模型嵌入到现有的工作流程和工具中,以提高效率和质量。这类应用通过将模型与现有工具结合,实现工具功能的增强和流程的改进。AI赋能AI原生应用是基于人工智能技术创造出的全新应用场景和需求。这些应用是完全依赖于人工智能技术的创新。如斯坦福小镇的智能代理(Agent)应用,靠多个智能代理协作完成复杂任务。AI原生61/48应用方法微调技术promptRAG在已有的预训练模型基础上,使用特定任务的数据对模型进行再训练,以优化其在该任务上的表现。结合检索和生成的技术,通过检索外部知识来增强模型的回答准确性和相关性。设计特定的输入提示来引导模型生成预期的输出,常用于对话系统和文本生成。62/48大模型微调技术大模型微调微调是对预训练模型进行进一步训练的过程。被微调的模型可能是预训练的基座模型,也可能是已经微调过的模型。微调的核心在于引入新数据,调整模型的训练数据分布,使模型参数进行适度变化。与完全重新训练不同,微调可以只对部分参数进行小幅度调整,以保留模型原有的知识和能力。63/48全量微调3-1"总结这篇文章的主要观点。"[相应的总结]"解释光合作用的过程。"[关于光合作用的详细解释]指令遵循微调(SupervisedFine-Tuning,SFT)64/48全量微调3-2对齐微调(AlignmentFine-Tuning)65/48全量微调3-3全量微调的挑战tokens选择、隐私处理、混合策略、数据顺序和训练轮次等batchsize、训练轮次、checkpoint设置等如QKV矩阵运算、自动微分、梯度计算等GPU利用率、显存管理、精度选择(如FP16、FP32或TF精度)等计算方法优化超参数调整硬件参数优化数据处理66/48高效微调(回顾)参数高效微调技术67/48通过在输入前添加一组可学习的“前缀”嵌入,来引导模型生成更符合特定任务的输出,而不需要修改模型的其他部分。PrefixTuning在训练时,固定住原来预训练模型的参数不变,只对新增的Adapter结构和LayerNorm层进行微调,从而保证了训练的高效性。AdapterTuning核心思想就是通过低秩分解来模拟参数的改变量,从而以极小的参数量来实现大模型的间接训练Lora全量微调与高效微调优缺点全量微调优点缺点性能最优:能够充分利用模型的所有参数,通常在特定任务上达到最佳性能计算资源消耗大:需要训练所有参数,对硬件资源要求高适应性强:不受限于任务类型或数据集特性,适用范围广训练时间长:由于参数量大,训练过程耗时,不利于快速迭代无需额外优化:直接对所有参数进行调整,无需复杂的优化策略容易过拟合:在小规模数据集上容易出现过拟合高效微调计算资源消耗低:仅更新少量参数,显著减少计算资源需求,适合在资源有限的环境中使用性能上限较低:在某些复杂任务上,可能无法达到全量微调的性能水平训练速度快:由于更新参数少,训练时间大幅缩短,适合快速迭代适应性有限:对某些特定任务或数据集的适应能力可能不如全量微调,尤其是在任务复杂或数据分布差异较大时泛化能力强:较少的参数更新降低了过拟合的风险,尤其适用于小规模数据集优化难度较高:部分高效微调方法(如PrefixTuning、P-tuning)需要对训练过程进行精细优化68/48为什么使用RAG69/48RAG的工作原理6-1数据输入获取案例用户输入:“人工智能的发展历程是怎样的?”文档方面:准备人工智能相关的资料70/48RAG的工作原理6-2信息检索-检索相关文档文档切分:将长文档切分成较小的段落或片段。文本向量:将输入问题和知识库文档转换为向量表示。知识库和向量数据:构建和存储包含向量表示的知识库。检索和排序:根据输入问题检索和排序相关文档片段。71/48RAG的工作原理6-3信息检索-检索相关文档案例系统从知识库中检索相关的文档。例如,检索到以下文档:文档A:介绍了人工智能的起源和早期发展。文档B:讨论了人工智能在20世纪末的突破。文档C:描述了近年来深度学习的发展及其影响。72/48RAG的工作原理6-4答案生成prompt预处理答案生成答案筛选格式化输出输出答案73/48RAG的工作原理6-5答案生成案例答案可能是:“人工智能的发展历程可以分为几个阶段:起源和早期发展、20世纪末的突破、以及近年来的深度学习革命。这些阶段共同推动了人工智能技术的快速发展和应用。”74/48RAG的工作原理6-675/48RAG适用场景动态知识环境在需要频繁更新知识库或处理最新信息的场景中,RAG表现出色。开放域问答当系统需要回答广泛且不可预测的问题时,RAG能够灵活地检索和整合相关信息。专业领域应用在医疗、法律、金融等专业领域,RAG可以有效结合专业知识库和语言模型,提供准确的专业回答。大规模信息处理对于需要从海量文档中快速提取信息的场景,如企业知识管理、学术研究等,RAG能够显著提高效率。个性化服务在需要根据用户背景或历史交互提供定制化回答的应用中,RAG可以有效整合用户相关信息。76/48RAG实际应用场景客户服务系统科研文献助手法律咨询系统医疗诊断辅助企业知识管理系统RAG可以协助律师快速检索相关法律条文、判例和解释,提供更准确的法律建议。RAG可以帮助客服人员快速检索产品信息,提供准确的客户支持。在科研领域,RAG可以帮助研究人员快速定位和综合大量学术文献中的关键信息。通过检索最新的医学文献和病例,辅助医生进行诊断和治疗决策。在大型企业中,RAG技术可以有效整合和利用企业内部的庞大知识库。77/48RAG的优势与局限优势局限提高回答准确性:通过引入外部知识,减少知识幻觉计算资源需求:实时检索和知识整合需要较高的计算资源。增强专业性:能够处理特定领域的专业问题。知识库质量依赖:系统性能很大程度上取决于知识库的质量和全面性。实时性:可以利用最新更新的知识库内容。潜在的检索偏差:检索结果可能不完全匹配用户意图,影响回答质量。灵活性:适应各种类型的查询,包括开放性问题。RAG优势与局限78/48RAG与微调的对比RAG微调原理RAG结合了检索(Retrieval)和生成(Generation)两部分。首先,它通过检索模块从外部知识库中获取相关信息,然后将这些信息作为上下文传递给生成模块,用于生成回答。微调是对预训练语言模型进行再训练,使其在特定领域或特定任务上表现更好。通过在包含领域特定知识和问题的训练数据上进行微调,模型可以更准确地回答相关问题,减少幻觉现象。实现方式检索模块生成模块选择预训练模型准备领域特定数据微调训练应用场景适用于需要动态获取最新信息的场景,如实时新闻、问答系统。适用于知识库比较完善且易于更新的系统。适用于特定领域的应用,如医学、法律等。适用于数据量较大且领域知识稳定的场景。区别依赖性:RAG依赖于外部知识库的检索,而微调依赖于高质量的领域特定数据。灵活性:RAG更灵活,可以动态获取最新信息;微调依赖于训练时的数据,更新较为困难。实现复杂度:RAG需要构建和维护检索系统,微调需要大量高质量标注数据和计算资源进行再训练。79/48小结微调和RAG,分别适用于解决什么问题?RAG的工作流程分为哪两个核心阶段?它如何解决模型的“幻觉”问题?80/48大语言模型的评估现有的模型评估的方法评估方法优点缺点客观题测试自动化程度高有刷题”现象,即模型并非真正理解问题,而是通过记忆相似的输入输出进行推断,影响评估的公正性。人工测评贴近实际使用场景,能够捕捉更丰富的模型表现覆盖面有限,评估标准主观,不同测评者可能对同一模

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论