版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第12章
自然语言处理与大语言模型AI第11章知识导图自然语言处理与大语言模型自然语言处理基础什么是自然语言处理第1章计算机工具与计算机演进史第2章计算机系统组成第3章计算机中的数据表示第4章操作系统与网络基础第5章软件构建基础:语言、编译与工程第6章算法与数据结构第7章数据管理与大数据技术第8章人工智能概述第9章机器学习基础第10章深度学习基础第11章机器人学、智能体与具身智能第12章自然语言处理与大语言模型第13章AI伦理、法律、治理与未来第14章AI赋能行业典型应用第15章前沿技术与实践能力培养自然语言处理的技术方法演进大语言模型自然语言的特性与处理难点自然语言处理技术体系自然语言处理的核心任务AIGC自然语言处理的工作原理
应用案例:智能客服系统自然语言处理的典型应用场景大语言模型的概念与特点大语言模型的训练流程Transformer模型架构大语言模型的核心技术要素国内外主流大语言模型应用场景对比大语言模型的挑战大语言模型的发展趋势什么是AIGCAIGC的技术原理AIGC的模态分类AIGC的典型应用场景内容导航AI第12章
自然语言处理与大语言模型12.1自然语言处理基础12.2大语言模型12.3AIGC12.1.1什么是自然语言处理自然语言处理(NaturalLanguageProcessing,NLP)是人工智能领域的重要研究方向,是一门集计算机科学、人工智能和语言学于一体的交叉学科,包含自然语言理解和自然语言生成两个主要方面,研究内容包括字、词、短语、句子、段落和篇章等多个层次,是机器语言和人类语言之间沟通的桥梁。其核心目标是使机器理解、解释并生成人类语言,实现人机有效沟通,让计算机能够执行语言翻译、情感分析、文本摘要等任务。在日常生活中,自然语言处理技术无处不在:手机中的语音助手(如Siri、小爱同学)能响应我们的语音指令,电商平台的智能客服能自动回复购物咨询,翻译软件能实时将一种语言转换为另一种语言,这些都是自然语言处理技术的实际应用。12.1.2自然语言处理的技术方法演进自然语言处理的技术演进大致可分为如图12.1所示的五个发展阶段。规则阶段(1956-1992年)以词法分析、句法分析等语言学理论为基础,采用基于规则的方法进行自然语言处理;其可扩展性和准确性受限于人类先验知识与编码能力。统计机器学习阶段(1993-2012年)基于大规模语料库,利用统计机器学习算法进行自然语言处理隐马尔可夫模型(HMM)、条件随机场(CRF)等统计学习模型得到广泛应用
采用深度神经网络模型进行自然语言处理,如RNN、CNN、LSTM、Transformer等的应用,使得NLP技术可以实现更高的精度和效率深度学习阶段(2013-2018年)大型语言模型阶段(2023年起)大模型具备极强的语言理解与生成能力,可执行多种复杂任务大型语言模型的出现,标志着NLP技术正逐步向通用人工智能迈进预训练阶段(2018-2022年)Transformer架构催生BERT、GPT等预训练+微调范式,实现“一次预训练、多任务迁移”,突破任务壁垒图12.1NLP的技术演进过程12.1.3自然语言的特性与处理难点人类自然语言具有模糊性、上下文相关性、多样性等固有特性,这些特性使计算机处理自然语言面临诸多挑战,也是自然语言处理技术的核心难点。(1)自然语言的核心特性①模糊性:同一语言表达在不同语境下可能具有不同含义。例如中文句子“我看见拿望远镜的人”,既可以理解为“我用望远镜看见的人”,也可以理解为“那个人拿着望远镜”;英文单词“bark”,既可以表示“狗叫”,也可以表示“树皮”。②上下文相关性:语言的含义依赖于具体的语境。例如“他今天没来上班,因为他生病了”,第二个“他”的指代需要结合前文确定;“你真行”这句话,在表扬场景下是肯定含义,在讽刺场景下则是否定含义。③多样性:同一含义可以通过多种语言表达实现。例如表达“感谢”,可以说“谢谢”“多谢”“感激不尽”等;描述“天气好”,可以有“晴空万里”“阳光明媚”“风和日丽”等多种表达。12.1.3自然语言的特性与处理难点(2)自然语言处理的核心难点自然语言处理的困难根源在于语言各个层次上广泛存在的歧义性或多义性,从字、词、词组到句子、篇章,每一个层次的转换都可能存在歧义。难点类型具体说明示例单词边界界定口语中词与词之间连贯无分隔,中文等语言的书面形式也无词边界,需要计算机自动划分中文句子“吉林市长春药店”,可能划分为“吉林市/长春/药店”或“吉林/市长/春药/店”词义消歧多义词在不同语境下的含义不同,需要计算机结合上下文确定正确含义“苹果”既可以指水果,也可以指苹果公司的产品;“打”可以表示“打球”“打电话”“打车”等不同动作句法模糊性同一句子可能存在多种句法结构,需要计算机结合语义和上下文选择正确的解析方式“咬死了猎人的狗”可以理解为“狗把猎人咬死了”,也可以理解为“被咬死的是猎人的狗”不规范输入实际应用中,语音输入可能存在口音、噪音,文本输入可能存在错别字、语法错误等语音输入中“把盐递过来”可能因口音被识别为“把烟递过来”;文本输入中“今天天气真好”可能误写为“今天天汽真好”表12.1自然语言处理的核心难点12.1.4自然语言处理技术体系图12.2展现了NLP领域的典型技术架构,从底层理论到实际应用分为四个层次。这一架构体现了NLP技术从理论到应用的递进关系:底层理论支撑基础技术,基础技术赋能子领域任务,最终通过任务落地形成实际应用。图12.2NLP典型技术架构12.1.4自然语言处理技术体系(1)底层理论①机器学习:传统算法(如SVM、决策树)及统计模型,为NLP提供基础建模能力。②深度学习:神经网络(RNN、CNN、Transformer等)实现端到端学习,是当前主流技术。③逻辑规则:基于人工定义的语义规则(如词性标注规则),用于结构化任务。④经验推理:结合数据特征与领域知识,通过推理优化模型效果。12.1.4自然语言处理技术体系(2)基础技术①文本处理:中文分词、词性标注、NER(命名实体识别)、依存分析等,解决中文分词、多义词消歧等问题。②语言理解:句法分析、依存分析、语义分析、关系抽取等,解析句子结构与语义关联。③语言模型:基于大规模语料训练,预测文本概率分布,支持文本生成、补全等任务。12.1.4自然语言处理技术体系(3)子领域任务①文本分析:文本分类、信息抽取、信息检索、阅读理解、文本相似度等。②交互与检索:信息检索、问答系统、推荐系统,结合用户输入与知识图谱生成结果。③语音与多模态:语音识别、机器翻译,实现“听懂”与“说”的功能或跨语言转换。④内容生成:自动摘要、文本创作,从文本中提取关键信息。12.1.4自然语言处理技术体系(4)主要应用①搜索、广告、推荐:优化搜索结果、定向广告投放、个性化内容推荐。②智能交互:通过语音/文本交互解答用户问题,如语音助手、智能客服。③跨语言与知识构建:跨语言文本转换,构建实体、关系、属性的知识网络,如机器翻译、知识图谱。12.1.5自然语言处理的核心任务NLP主要包含两大核心任务:自然语言理解(NaturalLanguageUnderstanding,NLU)和自然语言生成(NaturalLanguageGeneration,NLG)。NLU旨在让计算机分析和理解人类语言,包括词法分析、句法分析、语义理解等步骤,具体任务有命名实体识别、词性标注、情感分析、信息抽取等;NLG则让计算机根据结构化数据生成符合语法和语义规则的自然语言文本,包括机器翻译、文本摘要、对话系统、语音合成等任务。NLU处理输入,NLG创造输出,两大任务相辅相成,共同驱动智能交。12.1.5自然语言处理的核心任务(1)NLU类任务NLU是指计算机系统对自然语言文本进行分析、理解和推理的过程,主要包括分词、词性标注、命名实体识别、文本分类等,具体如下:①分词:将连续的文本分隔成最小的语言单元(通常是单词或词)。对于英语等拉丁语系语言,单词之间有空格分隔,分词相对简单;中文等语言无显式词边界,分词是基础且关键的任务,直接影响后续语义理解的准确性。例如,中文文本“我爱人工智能”,正确的分词结果是“我/爱/人工智能”,若错误分词为“我爱/人工/智能”,则会影响语义理解;再如“吉林市长春药店”,正确分词为“吉林市/长春/药店”,错误分词“吉林/市长/春药/店”将导致语义误解。②词性标注:为每个词语标注语法类别,如名词、动词、形容词、副词等。例如,句子“他在公园跑步”,“他”是名词,“在”是介词,“公园”是名词,“跑步”是动词。词性标注是理解句子语法结构的基础。12.1.5自然语言处理的核心任务③命名实体识别:从文本中识别并分类具有特定意义的实体,如人名、地名、组织机构名、时间、数字等。例如从句子“2025年3月,DeepSeek公司在杭州发布了新模型”中,可提取出时间实体“2025年3月”、组织机构实体“DeepSeek公司”、地名实体“杭州”。命名实体识别在信息抽取、智能问答等场景中具有重要作用。④文本分类:将文本按照预先定义的类别进行划分。文本分类是自然语言处理中应用最广泛的任务之一,典型应用包括垃圾邮件检测(分为“垃圾邮件”和“非垃圾邮件”)、新闻分类(分为“政治”“科技”“体育”“娱乐”等)、产品评论情感分析(分为“正面评论”“负面评论”“中性评论”)。⑤信息抽取:从大量非结构化文本中提取特定的结构化信息,如从新闻中提取公司股价、从医疗病历中提取患者症状、从简历中提取个人基本信息等。信息抽取能够将海量无序的文本数据转换为有序的结构化数据,方便后续分析和应用。12.1.5自然语言处理的核心任务(2)NLG类任务NLG是指计算机系统根据特定的规则和语言模型,生成自然语言文本的过程,主要包括机器翻译、文本摘要、问答系统、文本创作等,具体如下:①机器翻译:将文本从一种语言转换为另一种语言,是跨语言交流的重要工具。例如将中文“春节快乐”翻译为英文“HappySpringFestival”,将英文“Artificialintelligenceischangingtheworld”翻译为中文“人工智能正在改变世界”。随着技术的发展,机器翻译的准确性和流畅度不断提升,已广泛应用于日常交流、商务活动、学术研究等领域。②文本摘要:自动提取文本中的核心信息,生成简洁、连贯的摘要。对于长篇文档、新闻报道、学术论文等,文本摘要能够帮助用户快速了解文本核心内容,提高信息获取效率。例如对一篇关于大模型的新闻报道生成摘要,需包含“发布时间、发布主体、模型特点、应用价值”等核心信息。12.1.5自然语言处理的核心任务③问答系统:接收用户的自然语言问题,通过分析问题意图并检索相关信息,生成准确的自然语言答案。问答系统是智能助手、智能客服的核心技术,例如用户问“DeepSeek是什么时候成立的?”,系统应回答“DeepSeek成立于2023年7月,由幻方量化宣布成立”。④文本创作:根据用户需求生成各类文本内容,如新闻报道、小说、诗歌、广告文案、代码等。随着生成式AI技术的发展,文本创作的质量和多样性不断提升,例如可生成符合李白风格的诗歌,也可生成电商平台的商品描述文案。12.1.6自然语言处理的工作原理NLP的工作流程通常可分为以下五个关键步骤,如图12.3所示:5语料获取数据预处理特征处理模型训练评估与部署从公开数据集、专业语料库或通过网络爬虫抓取原始文本数据语料清洗(去重、删噪)、分词、词性标注以及去除停用词词袋模型或词向量进行特征工程,随后通过DF、MI筛选出关键特征传统机器学习模型或深度学习模型或预训练大模型进行训练与调优使用准确率、召回率、F1值等指标评估模型性能;离线/在线学习部署模型投入应用
图12.3NLP的工作流程12.1.6自然语言处理的工作原理(1)语料获取从公开数据集、专业语料库或通过网络爬虫抓取等方式,获取用于NLP任务的原始文本数据。(2)数据预处理对原始语料进行清洗与结构化,主要包括:语料清洗(去重、删噪)、分词、词性标注(使用HMM等方法)以及去除停用词。(3)特征处理将文本转化为机器可识别的数值特征:首先通过词袋模型(如TF-IDF)或词向量(如Word2Vec)进行特征工程,随后通过DF、MI等方法筛选出关键特征。12.1.6自然语言处理的工作原理(4)模型训练根据任务需求,选择传统机器学习模型(SVM、朴素贝叶斯等)或深度学习模型(RNN、LSTM、预训练大模型等)进行训练与调优,并注意处理过拟合、梯度消失等问题。(5)评估与部署使用准确率、召回率、F1值及AUC等指标评估模型性能。评估通过后,以离线部署或在线学习的方式将模型投入实际应用。12.1.8自然语言处理的典型应用场景图12.4NLP的典型应用场景机器翻译
信息抽取语音识别与合成智能写作辅助金融风控与反欺诈教育领域应用法律与医疗文本分析智能客服情感分析文本摘要NLP应用领域(1)机器翻译应用场景:跨语言沟通、全球化内容本地化。如,有道翻译、Google翻译、DeepL。(2)智能客服应用场景:企业客户服务、电商咨询、银行自助服务。如,阿里巴巴“店小蜜”、BankofAmerica的Erica。(3)情感分析应用场景:品牌监测、市场调研、社交媒体舆情分析。如,Brandwatch、字节跳动云雀、百度AI情感分析。(4)文本摘要与生成应用场景:新闻聚合、报告生成、自动写作。如,OpenAI的GPT系列、百度文心大模型、智谱AI的GLM。(5)语音识别与合成应用场景:智能助手、语音导航、无障碍技术。如,Siri、小爱同学、科大讯飞。12.1.8自然语言处理的典型应用场景图12.4NLP的典型应用场景机器翻译
信息抽取语音识别与合成智能写作辅助金融风控与反欺诈教育领域应用法律与医疗文本分析智能客服情感分析文本摘要NLP应用领域(6)信息抽取与知识图谱应用场景:企业知识管理、智能搜索、医疗诊断。如,GoogleKnowledgeGraph、IBMWatson、阿里藏经阁、华为云知识图谱。(7)智能写作辅助应用场景:内容创作、学术写作、代码补全。如,GitHubCopilot、WPSAI写作助手、阿里通义灵码。(8)法律与医疗文本分析应用场景:合同审查、病历分析、药物研发。如,IBMWatsonforOncology、华宇法律AI、科大讯飞智慧医疗病历分析系统。(9)教育领域应用应用场景:智能批改、个性化学习、语言学习。如,Duolingo、作业帮智能批改系统、科大讯飞智学网。(10)金融风控与反欺诈应用场景:信贷评估、交易监控、反洗钱。如,PayPal、Bloomberg、腾讯云天御、蚂蚁集团“芝麻信用”。内容导航AI第12章
自然语言处理与大语言模型12.1自然语言处理基础12.2大语言模型12.3AIGC12.2.1大语言模型的概念与特点(1)大语言模型的概念大语言模型(LargeLanguageModel,LLM)是基于深度学习架构的人工智能系统,专门设计用于理解和生成人类自然语言。这类模型通过在海量文本语料库上训练,逐步掌握语言的语法结构、语义关联及常识推理能力。其核心思想是通过大规模无监督训练学习自然语言的模式和结构,在一定程度上模拟人类的语言认知和生成过程。12.2.1大语言模型的概念与特点(2)大语言模型的核心特点大语言模型之所以能够实现突破性的语言处理能力,主要源于其以下核心特点:①参数数量庞大:大语言模型的核心特征是具有海量的模型参数,参数规模通常达到数十亿、数百亿甚至万亿级别。例如,2025年,DeepSeek-R1参数达到6710亿,Qwen-Max约8000亿
参数,文心4.5Turbo为1.2万亿
参数、5.0版达8.2万亿参数,GeminiUltra约9.8万亿
参数。②训练数据海量:大语言模型的训练依赖海量文本数据,这些数据来自互联网、书籍、论文、新闻等多种来源,覆盖广泛的领域和主题。通过学习海量数据,模型能掌握不同领域的知识和语言表达习惯,具备跨领域语言处理能力。例如,GPT系列模型的训练数据包含数十亿网页文本、数百万书籍等。12.2.1大语言模型的概念与特点③计算资源需求高:海量参数的训练需要强大的计算资源支持,通常需数十台甚至数百台高性能GPU或专用AI芯片组成的计算集群,训练过程可能持续数周甚至数月。例如,DeepSeek-V3模型采用多头潜在注意力机制、FP8混合精度等工程优化技术,将显存占用优化到其他模型的5%-13%,极大提升了训练效率。④采用自监督学习:大语言模型主要采用自监督学习的训练方式,无需人工标注大量数据。自监督学习通过设计特定的任务让模型自己“出题”并“答题”,从海量无标注数据中自动提取知识。例如,给模型一个不完整的句子“我喜欢______”,让模型尝试填空并学习正确答案,从而掌握语言的语义关联规律。这种训练方式显著降低了对标注数据的依赖,提高了模型的学习效率。12.2.2大语言模型的训练流程LLM训练通常分为三个阶段:预训练(Pre-training)、监督微调(SFT)和基于人类反馈的强化学习(RLHF),部分场景会增加模型蒸馏阶段,如图12.5所示。预训练监督微调基于人类反馈的强化学习海量文本数据集深度学习任务:预测下一个词基础LLM深度学习任务:响应查询人工生成的响应数据集深度学习任务:预测人类评分深度学习任务:生成高质量响应响应排序数据集奖励模型指令微调LLM对话LLM人类对响应的排序LLM生成的响应图12.5大语言模型训练流程12.2.2大语言模型的训练流程(1)预训练(Pre-training)预训练阶段,模型采用自监督学习方式,通过海量无标注文本学习语言的基础模式、语法、知识和世界关联。这个过程虽然消耗巨大的计算资源,但使模型掌握语言的语法结构、语义关联、上下文依赖等通用知识,形成基础模型。【类比人类学习】老师给学生提供大量学习资料,让学生(LLM)自主学习,构建自己的知识库和思维体系;此过程中无老师直接指导,模型通过自身理解和生成自然语言完成学习。12.2.2大语言模型的训练流程(2)监督微调(SupervisedFine-Tuning,SFT)监督微调阶段,模型采用监督学习的方式进行训练,使用特定任务的小数据集上微调预训练模型以优化性能,使其能够适应对话生成、文本摘要、代码编写等特定的任务和场景。【类比人类学习】老师开始对学生们(LLM)进行更加具体的指导,例如布置作业和课堂提问,来让模型更适应特定的任务。12.2.2大语言模型的训练流程(3)基于人类反馈的强化学习(ReinforcementLearningfromHumanFeedback,RLHF)模型通过人类的反馈来调整自己的行为,例如复杂的人类偏好、问题、上下文的响应等。类比人类学习:老师在作业和提问基础上,增加鼓励与惩罚机制,例如回答正确加分、错误扣分,引导学生优化学习成果。PerferenceDatasetRewardModelBaseLLM偏好数据集奖励模型基础模型有监督训练循环训练强化学习图12.6RLHF的三步骤训练过程奖励模型通过人类反馈给予模型相应奖励或惩罚,从而准确预测人类对不同任务产出的偏好。奖励机制通过对模型生成内容进行排序、打分或提供其他形式的反馈来构建,通过持续循环训练优化奖励模型。12.2.2大语言模型的训练流程以DeepSeek-R1模型的训练流程为例,其采用“冷启动数据微调+多阶段强化学习”的方式:首先,给DeepSeek-V3Base模型提供数千条人工撰写的高质量推理示例(如详细的数学解题步骤),帮助模型“开窍”,植入初步推理能力;随后,通过基于规则的奖励模型和基于模型的奖励模型开展强化学习训练,提升推理能力;最后,结合写作、翻译等其他任务数据再次训练,使模型既具备强大推理能力,又能“说人话”。12.2.2大语言模型的训练流程(4)模型蒸馏(可选阶段)大语言模型通常参数规模庞大,计算成本高,难以部署在手机、边缘设备等资源有限的场景中。因此,在训练后期,通常会进行模型蒸馏(KnowledgeDistillation),将大模型的知识和能力“压缩”到小模型中,得到轻量化模型。【类比人类学习】“老师教学生”—让参数规模大、性能强的大模型(老师模型)指导参数规模小的小模型(学生模型)训练。老师模型不仅给学生模型提供最终答案(硬标签),还提供答案的概率分布(软标签),帮助学生模型学习老师模型的推理过程和知识。【例】DeepSeek-R1-Distill模型通过将DeepSeek-R1(6710亿参数)的知识蒸馏到Qwen、Llama等低参数模型(1.5B、7B、14B等)中,使小模型在数学题、逻辑推理等任务上的性能大幅提升,甚至超过了GPT-4o等大模型,同时降低了模型的计算成本和部署难度。12.2.3Transformer模型架构Transformer架构是基于自注意力机制(Self-Attention)的深度学习模型,由Google团队在2017年的论文《AttentionIsAllYouNeed》中首次提出。图12.6展示了中文版的Transformer模型。图12.6基于注意力机制的Transformer模型架构(中文)嵌入层嵌入层位置编码位置编码多头注意力掩码多头注意力逐位前馈神经网络求和&归一化多头注意力求和&归一化求和&归一化求和&归一化逐位前馈神经网络线性处理Softmax处理输入输出(右移)NxNx状态输出概率解码器编码器求和&归一化12.2.3Transformer模型架构(1)Transformer架构组成①输入处理(底部)嵌入层(Embedding)作用:将输入的单词(或token)转换成数字向量(比如“猫”→[0.2,-0.5,0.7…])。类比:就像给每个单词分配一个独特的“身份证号码”,但更智能(包含语义信息)。12.2.3Transformer模型架构②编码器(左侧虚框)●多头自注意力(Multi-HeadedSelf-Attention)作用:让模型同时关注输入中的所有单词,并计算它们之间的关系。举例:在句子“猫追老鼠”中,模型会学习到“猫"和“老鼠”的关联比“猫”和“追”更强。关键:并行处理所有单词,不像RNN需要逐个计算。●层归一化(Norm)
作用:稳定训练过程,防止数值过大或过小(类似“调音量”到合适范围)。●前馈神经网络(Feed-ForwardNetwork)作用:对每个单词的表示进行进一步加工(比如提取更复杂的特征)。类比:像对“猫”的向量做一次深度解读,补充细节(比如“猫是哺乳动物”)。12.2.3Transformer模型架构③解码器(右侧虚框)●掩码多头自注意力(MaskedMulti-HeadedSelf-Attention)作用:训练时防止模型“作弊”(只能看到当前和之前的单词,不能看未来的单词)。举例:生成“我爱__”时,模型只能基于“我”“爱”预测下一个词,不能提前知道答案是"你"。●多头注意力作用:让解码器询问编码器:“关于输入,我应该重点关注什么?”场景:翻译任务中,解码器生成英文时,会参考编码器处理的中文输入。●层归一化和前馈神经网络与编码器类似,对解码器的表示进行归一化和深度处理。12.2.3Transformer模型架构④输出(顶部)●Linear(线性层)作用:将解码器的输出映射到词表(比如预测下一个词是“你”的概率最高)。举例:输入“我爱”,模型输出“你”的概率可能是80%,“吃饭”的概率是10%…。12.2.3Transformer模型架构(2)Transformer的核心思想Transformer的核心思想可以用以下几个关键概念来概括:①词嵌入Transformer首先会把输入数据(例如一段文本)转化为向量表示,这一步叫做词嵌入。这些向量不仅仅是“字词的编号”,而是能在数学空间里反映出词语之间的语义关系。比如,在嵌入空间中,“king-man+woman≈queen”这样的关系会自然呈现。12.2.3Transformer模型架构②自注意力机制自注意力机制(Self-AttentionMechanism)是Transformer架构的核心,也是大语言模型能有效处理和理解语言的关键技术。其核心思想是,在处理一个序列(比如一句话)中的某个元素(比如一个词)时,模型会计算该元素与序列中所有其他元素(包括自身)的关联程度,根据这些关联程度加权汇总其他元素的信息,得到当前元素的新表示。这一过程可理解为模型在阅读时,会动态为每个词分配“注意力权重”,决定理解当前词时应重点关注序列中的哪些其他词。具体来说,自注意力机制通过将每个词的嵌入表示映射成三个不同的向量:查询向量(Query)、键向量(Key)和值向量(Value);通过计算查询向量与所有键向量的点积,得到一个注意力分数,这个分数衡量了当前词与其他词的相关性,这些分数经过缩放和Softmax归一化后,就得到了注意力权重;最后,用这些权重对值向量进行加权求和,得到当前词经过自注意力机制处理后的新表示,这个新表示融合了序列中所有其他词的信息,能突出与当前词最相关的部分。12.2.3Transformer模型架构图12.7展示了自注意力机制的工作流程。
公式:其中,Q(Query)、K(Key)、V(Value)是通过输入线性变换得到的矩阵。是缩放因子,防止点积过大导致梯度消失。图12.7自注意力机制的工作流程输入词嵌入查询向量Q计算注意力分数Softmax归一化键向量K值向量V加权求和输出表示单个注意力头可能只能捕捉到某种特定的关系模式。多头注意力通过并行运行多个注意力头,让模型能捕捉更丰富的上下文信息(如局部/全局依赖、语法/语义特征)。12.2.3Transformer模型架构③位置编码由于Transformer同时处理多个token,但Transformer本身没有循环或卷积结构,无法直接感知序列顺序,因此需要显式地注入位置信息。使用正弦/余弦函数或可学习的位置编码:
12.2.3Transformer模型架构④前馈神经网络在注意力机制之后,Transformer通常利用前馈神经网络来处理和转换从注意力层获得的信息,每个位置的表示会通过一个两层全连接网络(含非线性激活,如ReLU)进行进一步变换。
公式:12.2.3Transformer模型架构⑤层归一化为了稳定学习过程、提高收敛性并防止“内部协变量偏移”问题,在Transformer模型的每个子层中应用了层归一化,以加速训练。12.2.3Transformer模型架构⑥编码器-解码器结构从结构上看,Transformer通常包括编码器和解码器(Encoder-Decoder)两部分。编码器通过多头注意力和前馈网络,将输入序列转化为一系列蕴含丰富上下文信息的高维向量;解码器则利用这些信息生成输出(如翻译结果、摘要甚至图像)。值得一提的是,仅使用编码器的架构(如BERT)在理解任务上表现极佳,而仅使用解码器的架构(如GPT系列)则在生成任务上独占鳌头。12.2.4大语言模型的核心技术要素(1)提示词工程(PromptEngineering)提示词工程是实现与LLM高效交互的核心技术。通过精心设计与优化输入提示,用户可精准引导模型生成符合预期的输出结果,具体包括明确任务要求、提供示范样例、设定输出格式规范等实用技巧。优质的提示设计能显著提升模型输出质量与任务完成度,是LLM应用开发中的核心技能之一。(2)智能体(Agent)智能体的核心价值的是将LLM从被动的文本处理工具转变为主动的问题解决者。AI智能体可精准理解复杂任务需求,制定详尽的执行计划,调用适配的工具资源,并动态评估任务完成效果。这种能力使LLM能够应对更复杂的现实世界问题,实现真正意义上的智能辅助。12.2.4大语言模型的核心技术要素(3)微调(Fine-Tuning)微调技术可使通用大模型精准适配特定垂直领域的需求。通过在领域特定数据上开展续训,模型能深入掌握专业术语与领域知识,显著提升在特定应用场景下的表现效果。该方法相较于从头训练模型更高效、经济,大幅降低了AI技术的应用门槛。(4)检索增强生成(RAG)检索增强生成(Retrieval-augmentedGeneration,RAG)技术巧妙融合了LLM的内部存储能力与外部知识检索优势。通过从外部可信知识库中检索相关信息,并将其与生成模型深度结合,可生成更准确、信息更丰富的回答。RAG技术能有效缓解模型幻觉与知识陈旧问题,大幅提升输出内容的准确性与时效性。12.2.4大语言模型的核心技术要素(5)分词(Tokenization)分词(Tokenization)是文本处理的基础环节,直接影响模型的理解与生成能力。LLM会将输入文本分解为更小的处理单元(tokens),这些单元可能是完整单词、子词或单个字符。不同分词策略各有优劣,需结合具体任务与语言特性进行选择和优化。(6)嵌入表示(Embedding)嵌入表示(Embedding)技术可将离散的语言符号映射至连续的向量空间,捕获词汇间丰富的语义关系。这种分布式表示方法能让模型理解词语间的语义相似性与关联性,支撑各类复杂的语义计算任务,为深层次语言理解奠定坚实基础。12.2.4大语言模型的核心技术要素(7)思维链(CoT)大语言模型在处理复杂逻辑推理、数学计算、代码生成等任务时,核心依赖思维链(ChainofThought,CoT)技术。思维链是提升大语言模型推理能力的核心方法。传统的大语言模型提示方式(标准Prompting)是直接向模型输入问题,让模型直接输出答案。这种方式对简单问题有效,但面对复杂问题(如多步骤数学题、逻辑推理题)时,模型易出现逻辑错误——核心原因是无法展示中间思考过程,难以开展分步推理。思维链提示方式则通过在问题中嵌入中间推理步骤的示例,引导模型“边想边说”,分步解决问题。12.2.4大语言模型的核心技术要素例如,对于数学问题“罗杰有5个网球,他又买了两盒网球,每盒有3个网球,他现在有多少个网球?”,标准提示和思维链提示的对比如图12.7所示。图12.7思维链推理过程对比示意图从对比可见,思维链提示通过展示中间推理步骤,引导模型分步思考,能显著提升复杂问题的解决准确性。该方式模拟人类解决复杂问题的思维过程,推动模型从“直接给出答案”向“分步推导答案”转变,进一步增强推理的逻辑性与可解释性。12.2.6大语言模型的挑战(1)幻觉问题①大模型幻觉定义:又称AI幻觉,指大型语言模型在生成内容时,产生与事实不符、逻辑错误或无中生有等不合理信息的现象。②幻觉问题的产生原因:大模型幻觉的产生主要源于两大核心因素:一是训练数据层面,模型的训练数据可能存在偏差、不完整或错误;若训练数据包含虚假信息、过时信息,或特定领域数据匮乏,模型在学习过程中会引入不准确信息,进而导致生成内容出错。二是模型生成机制层面,大语言模型基于概率分布生成内容,核心目标是生成流畅、符合上下文的文本,而非确保内容绝对准确。在部分场景下,模型会选择看似合理但实则错误的生成路径,以保障文本流畅性。③
幻觉问题的应对策略:技术层面,可采用检索增强生成(RAG)技术,让模型在回答前先从可信知识库中检索相关信息,基于事实生成答案;应用层面,需设计严谨的提示词框架,要求模型标注信息不确定性并引用来源;流程层面,应建立人工审核机制,尤其针对关键决策类信息;模型选用层面,尽量选用支持联网功能、幻觉率较低的大语言模型,确保其生成内容时可检索最新、最准确的信息。12.2.6大语言模型的挑战(2)计算资源需求问题训练和部署大语言模型需要大量的GPU计算资源和电力消耗,这在一定程度上限制了技术的普及和应用。模型压缩、分布式训练、高效推理和绿色计算等技术正在努力解决这一问题,寻求性能与效率的最佳平衡。(3)模型偏见与伦理问题大语言模型通过学习海量数据掌握知识,若训练数据存在偏见(如性别偏见、种族偏见、地域偏见等),模型很可能在生成内容时复制甚至放大这类偏见,进而导致不公平或歧视性结果。此外,模型还可能被滥用,用于生成虚假信息、恶意内容,或实施欺诈等非法活动,引发严重的伦理与社会问题。如何有效识别并消除模型偏见,确保模型输出符合道德与法律规范,是当前研究的热点与难点。12.2.6大语言模型的挑战(4)可解释性与可控性仍然是一个重要挑战LLM的决策过程往往像黑盒子一样难以理解和解释,这使得用户难以完全信任模型的输出结果。提高模型的可解释性、透明度和可控性是当前研究的重要方向,包括开发新的解释性工具和可视化技术。(5)数据安全与隐私保护大语言模型的训练与运行需处理大量数据,其中可能包含个人隐私信息或商业敏感数据。如何确保这些数据在收集、存储、使用全流程的安全,防范数据泄露与滥用,是亟待解决的关键问题。此外,模型在生成内容时,也可能无意中泄露训练数据中蕴含的敏感信息;用户与模型的交互数据如何被规范使用与妥善保护,也是用户普遍关切的问题。12.2.6大语言模型的挑战(6)无法理解“真实世界”大语言模型只能基于文本数据学习,没有真实世界的“感知能力”(比如它知道“火是热的”,但无法真正“感受”热;能描述“猫的样子”,但无法像人类一样“看到”猫)。12.2.7大语言模型的发展趋势大语言模型正经历从“技术探索”到“价值创造”的深刻变革,核心演进逻辑是从文本处理转向世界交互、从技术驱动转向价值驱动,衡量标准不再是参数规模,而是理解并改善现实世界的能力,具体体现为六个关联进化维度:(1)认知跃迁:从文本理解到世界模型构建。(2)技术突破:超越Transformer的效率革命。(3)形态演化:从单一模型到协同智能体。(4)产业务实:从概念验证到商业价值落地。(5)基础与安全:开源普惠与风险防御并重(6)端侧渗透:轻量化模型加速终端落地。综上,大模型将以高效架构为支撑,承载深度世界理解,以智能体形态融入千行百业,在开放安全的生态基础上,创造切实的商业与社会价值。内容导航AI第12章
自然语言处理与大语言模型12.1自然语言处理基础12.2大语言模型12.3AIGC12.3.1什么是AIGCAIGC(ArtificialIntelligenceGeneratedContent)即人工智能生成内容,是基于深度学习模型自动生成文本、图像、音频等数字内容的技术体系。AIGC发展经历了四个阶段:规则驱动阶段(2012前):基于模板和语法规则生成;统计驱动阶段(2012-2017):N-gram模型、隐马尔可夫模型;神经驱动阶段(2017-2022);Transformer架构、注意力机制;多模态阶段(2023至今):Diffusion模型、CLIP跨模态对齐,GPT-4、Gemini等
多模态大模型展现跨领域能力。12.3.2AIGC的技术原理AIGC技术原理可概括为:一个核心基础、两套生成范式、两项关键优化与一套工程保障,形成完整的技术落地体系。(1)核心基础:预训练
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年浦发银行招聘题库及答案
- 高三地理教案 植被与自然环境的关系
- 初中物理中考力学与电学易错题型专题教学设计
- 小学四年级信息科技《初识WPS文字》教学设计
- 七年级人文地理《红松之乡》教学设计
- 小学信息技术第二册 沿途风景(1)-插入图片教案 河大版
- 七年级地理下册 第七章 我们邻近的地区和国家 7.3印度第2课时 热带季风气候与粮食生产 迅速发展的服务外包产业教学设计 (新版)新人教版
- 人教版七年级下册8.4三元一次方程组的解法教学设计
- 一五 永远未完成教学设计中职语文职业模块 服务类语文版
- 高中数学 第三章 导数及其应用 3.3 导数在研究函数中的应用 3.3.1 函数的单调性与导数教学设计 文 新人教A版选修1-1
- 2026年秋季教学骨干新课标落地教学实践课件
- 2026年浙江省人大机关遴选试题及答案
- 赣州市南康区智链家具产业集团有限公司2026年公开招聘子公司员工【18人】考试备考试题及答案详解
- 2026年丰收节主题班会:庆丰收迎金秋
- 教科版2026-2027学年度小学六年级科学上册第一单元《健康生活》单元素养测评卷
- 2026年班主任家校沟通技巧培训课件(高清可编辑课件)
- 入托入学预防接种查验报告(10篇)
- 小学道德与法治-《平安出行》教学课件设计
- 沥青路面修补车安全操作规程
- (完整)刘庆昌版遗传学答案
- GB/T 4743-2009纺织品卷装纱绞纱法线密度的测定
评论
0/150
提交评论