版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
课堂设计一、基本信息课次第9讲课次学时数2学时主题大语言模型基础二、设计方案课堂目标(一)知识目标能阐述语言模型、大语言模型等概念;描述大语言模型的基本架构和原理;比较分析不同类型的提示词工程;举例说明大模型的应用及其带来的影响。(二)能力目标能利用大语言模型工具解决自己学习、工作和生活中的问题;评价大模型生成结果的优劣;使用提示词工程提升模型和工具应用效果。(三)素质目标能通过提问和使用大模型,初步形成善于提问和善用工具的科学素养。教学重难点(一)教学重点大语言模型的历史、原理、提示词工程。(二)教学难点大语言模型的关键技术、提示词工程。教学设计思路(一)教学内容组织1.大语言模型简介2.大语言模型的原理3.提示词工程4.大模型的应用。(二)教学方法策略1.教学思路与方法采用案例式教学法讲解基本原理。采用演示、提问和研讨方式,对比分析不同大语言模型生成结果的差异。2.课程思政设计培养善于提问和善用工具的科学态度。教学资源1.头歌(EduCoder)平台在线资源2.《人工智能技术及其应用》在线课程内容备注课堂导入介绍OpenAI公司开发的大型语言模型,强调其通过学习大规模语料库中的语言规律来生成与人类语言相似的输出,并表现为一个对话机器人。提及ChatGPT的发布及其迅速获得大量用户的情况,引用比尔·盖茨等人对其重要性的评价,引发学生对大模型的兴趣。(一)大模型能做什么展示GPT-4可以根据网站草稿图生成HTML代码,以及Sora根据文字说明生成场景视频的能力,让学生直观感受大模型的强大功能。(二)大模型的特点1知识广博阐述大模型在多个领域的知识储备,如天文、地理、写作、编程等,强调其广泛的知识面。列举具体例子,如大模型能够写出高质量的科普文章或复杂的代码,帮助学生理解。2有条有理说明大模型能够逻辑地组合知识形成答案,具有一定的推理能力,举例说明其在解答复杂问题时的逻辑性。通过对比人类和大模型解答问题的方式,突出大模型的逻辑性。3善解人意讲解大模型能够准确理解用户意图,具有正确的价值观,并且会承认自己不知道的事情,强调其在交互中的理解和反馈能力。展示大模型与用户交互的对话实例,让学生感受其善解人意的特点。4交互能力强强调大模型在多轮对话中能够保持专注,聚焦主题,举例说明其在长时间对话中的表现。模拟多轮对话场景,让学生体验大模型的交互能力。理论讲授一、大模型历史大语言模型(LargeLanguageModels,LLM),也称大规模语言模型或大型语言模型,是一种由包含数百亿以上参数的深度神经网络构建的语言模型,使用自监督学习方法通过大量无标注文本进行训练。自2018年以来,Google、OpenAI、Meta、百度、华为等公司和研究机构都相继发布了包括BERT,GPT等在内多种模型,并在几乎所有自然语言处理任务中都表现出色。2019年大模型呈现爆发式的增长,特别是2022年11月ChatGPT(ChatGenerativePre-trainedTransformer)发布后,更是引起了全世界的广泛关注。用户可以使用自然语言与系统交互,从而实现包括问答、分类、摘要、翻译、聊天等从理解到生成的各种任务。大型语言模型展现出了强大的对世界知识掌握和对语言的理解。大规模语言模型的发展历程虽然只有短短不到五年的时间,但是发展速度相当惊人,截止2023年6月,国内外有超过百种大模型相继发布。中国人民大学赵鑫教授团队在文献按照时间线给出2019年至2023年5月比较有影响力并且模型参数量超过100亿的大规模语言模型,如下图所示。大规模语言模型的发展可以粗略的分为如下三个阶段:基础模型、能力探索、突破发展。基础模型阶段主要集中于2018年至2021年,2017年Vaswani等人提出了Transformer架构,在机器翻译任务上取得了突破性进展。2018年Google和OpenAI分别提出了BERT和GPT-1模型,开启了预训练语言模型时代。BERT-Base版本参数量为1.1亿,BERT-Large的参数量为3.4亿,GPT-1的参数量1.17亿。这在当时,相比其它深度神经网络的参数量已经是有数量级上提升。2019年OpenAI又发布了GPT-2,其参数量达到了15亿。此后,Google也发布了参数规模为110亿的T5模型。2020年OpenAI进一步将语言模型参数量扩展到1750亿,发布了GPT-3。此后,国内也相继推出了一系列的大规模语言模型,包括清华大学ERNIE(THU)、百度ERNIE(Baidu)、华为盘古-α等。这个阶段研究主要集中语言模型本身,包括仅编码器(EncoderOnly)、编码器-解码器(Encoder-Decoder)、仅解码器(DecoderOnly)等各种类型的模型结构都有相应的研究。模型大小与BERT相类似的算法,通常采用预训练微调范式,针对不同下游任务进行微调。但是模型参数量在10亿以上时,由于微调的计算量很高,这类模型的影响力在当时相较BERT类模型有不小的差距。能力探索阶段集中于2019年至2022年,由于大规模语言模型很难针对特定任务进行微调,研究人员们开始探索在不针对单一任务进行微调的情况下如何能够发挥大规模语言模型的能力。2019年Radford等人就使用GPT-2模型研究了大规模语言模型在零样本情况下的任务处理能力。在此基础上,Brown等人在GPT-3模型上研究了通过语境学习(In-ContextLearning)进行少样本学习的方法。将不同任务的少量有标注的实例拼接到待分析的样本之前输入语言模型,用语言模型根据实例理解任务并给出正确结果。在包括TriviaQA、WebQS、CoQA等评测集合都展示出了非常强的能力,在有些任务中甚至超过了此前的有监督方法。上述方法不需要修改语言模型的参数,模型在处理不同任务时无需花费的大量计算资源进行模型微调。但是仅依赖基于语言模型本身,其性能在很多任务上仍然很难达到有监督学习效果,因此研究人员们提出了指令微调(InstructionTuning)方案,将大量各类型任务,统一为生成式自然语言理解框架,并构造训练语料进行微调。突破发展阶段以2022年11月ChatGPT的发布为起点。ChatGPT通过一个简单的对话框,利用一个大规模语言模型就可以实现问题回答、文稿撰写、代码生成、数学解题等过去自然语言处理系统需要大量小模型订制开发才能分别实现的能力。它在开放领域问答、各类自然语言生成式任务以及对话上文理解上所展现出来的能力远超大多数人的想象。2023年3月GPT-4发布,相较于ChatGPT又有了非常明显的进步,并具备了多模态理解能力。GPT-4在多种基准考试测试上的得分高于88%的应试者,包括美国律师资格考试(UniformBarExam)、法学院入学考试(LawSchoolAdmissionTest)、学术能力评估(ScholasticAssessmentTest,SAT)等。它展现了近乎“通用人工智能(AGI)”的能力。各大公司和研究机构也相继发布了此类系统,包括Google推出的Bard、百度的文心一言、科大讯飞的星火大模型、智谱ChatGLM、复旦大学MOSS等。表1.1给出了截止2023年6月典型开源和未开源大规模语言模型的基本情况。可以看到从2022年开始大模型呈现爆发式的增长,各大公司和研究机构都在发布各种不同类型的大模型。简要介绍各个开源语言大模型,包括LLaMA系列、Falcon系列、BLOOM系列等。介绍KOSMOS-2、OpenFlamingo、BLIP-2等其他开源大模型,同样列出公司、包含模型和参数量,补充说明这些模型的特点和应用场景。结合实际应用案例,讲解这些模型的独特之处,帮助学生理解它们的应用价值。重点介绍国产大模型,如DeepSeek。二、大模型的基本原理(一)大语言模型的架构现有的语言大模型几乎全部是以Transformer模型作为基础架构来构建的,不过它们在所采用的具体结构上通常存在差异,如只使用Transformer编码器或解码器,或者同时使用两者。语言模型是什么?用最通俗的话讲,就是给定上文,预估下一个词出现的可能性。(二)Transformer架构2017年google的机器翻译团队在NIPS上发表了Attentionisallyouneed的文章,开创性地提出了在序列转录领域,完全抛弃CNN和RNN,只依赖Attention-注意力结构的简单的网络架构,名为Transformer;论文实现的任务是机器翻译。从宏观的视角开始,首先将这个模型看成是一个黑箱操作。在机器翻译中,就是输入一种语言,输出另一种语言。那么拆开这个黑箱,我们可以看到它是由编码组件、解码组件和它们之间的连接组成。编码组件部分由一堆编码器(encoder)构成(论文中是将6个编码器叠在一起)。解码组件部分也是由相同数量(与编码器对应)的解码器(decoder)组成的。(三)预训练与微调技术大语言模型的高效预训练策略包括:设计高效的优化任务目标、热启动策略、渐进式训练策略等。大语言模型的适配微调包括:指令理解、指令数据获取、指令对齐等。三、提示词工程(一)提示词的核心要素讲解提示词的四个核心要素:明确的任务提示、相关上下文、示例参考和用户输入输出的具体要求,强调这些要素在提高大模型回答质量中的重要性。通过实例,展示如何设计有效的提示词,让学生能够理解和应用这些要素。提示词就是一种用于指导大语言模型生成特定内容的文字。提示词的设计旨在以一种高效、精确的方式向模型传达用户的意图或所需的任务类型,从而使模型能够根据这些提示生成相应的文本、图像或其他形式的回应。提示词公式是提示的特定格式,通常由三个主要元素组成:(1)任务:对提示要求模型生成的内容进行清晰而简洁的陈述;(2)指令:在生成文本时模型应遵循的指令;(3)角色:模型在生成文本时应扮演的角色。(二)提示词工程通过几种提示样例的对比,让学生了解不同提示词对大模型回答质量的影响,引导学生思考如何优化提示词。组织学生进行小组讨论,分享不同提示词的设计思路和效果,促进学生之间的交流和学习。(1)指令提示技术指令提示技术是通过为模型提供具体指令来引导大语言模型的输出的一种方法。这种技术对于确保输出相关和高质量非常有用。要使用指令提示技术,需要为模型提供清晰简洁的任务,以及具体的指令以供模型遵循。(2)角色提示技术角色提示技术是通过为大语言模型指定一个特定的角色来引导其输出的一种方式。这种技术对于生成针对特定上下文或受众的文本非常有用。(3)其他提示技术(三)课堂实验或演示布置课堂实验任务,让学生设计不同的提示词,并观察大模型回答的质量,通过实践加深学生对提示工程的理解。指导学生进行实验操作,提供必要的技术支持和指导。四、大模型的应用(一)应用概览根据输入和输出,结合大模型的能力部署,在情报搜集整编、确定决心意图、处置威胁、复盘总结等方面概览其应用。。(二)大模型应用平台简要介绍美PalantirAIP、ScaleAIDonovan,中国的天机等大模型平台。(三)大模型的通用应用场景简要信息检索、新闻媒体、智慧城市、智慧办公等方面的通用应用前景。回顾小节回顾本节课的主要内容,包括大模型的基本概念、特点、关键技术、提示词工程和应用领域,强调大模型在各个领域的重要性和应用前景。鼓励学生提出问题,对学生的疑问进行解答,确保学生对本节课的内容有清晰的理解。开放提问环节,积极与学生互动,及时解答学生的疑问,增强学生的参与感和学习效果。通过案例引入,结合实际数据和名人评价,激发学生的求知欲。利用图片和视频资料,直观展示大模型的应用实例,加深学生对大模型功能的理解。大模型最早是大语言模型的简称,后来才发展到多模态大模型。讲述大语言模型发展历史,使学生理解语言模型解决的核心问题——填词任务(最终生成符合语法和语义的语句)。体会深度学习在将经典语言模型提升为神经语言模型中的地位和
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年记者《法规》试卷
- 2026年叉车司机车辆基本操作知识考试题库及答案(共50题)
- 远离毒品珍爱生命筑牢健康成长防线小学主题班会课件
- 多模态融合目标检测X专利分析论文
- 8.口腔类医疗服务价格项目落地政策解读
- 生命至上:警惕溺水风险小学主题班会课件
- 美容院SPA师技能及顾客满意度KPI考核表
- 树立法治意识远离不良行为小学主题班会课件
- 机械制造业工程师技术研发绩效评定表
- 幼儿园安全宣传教育管理办法
- GA/T 1999.3-2025道路交通事故车辆速度鉴定方法第3部分:基于视频图像
- GB/T 47661-2026温室气体产品碳足迹量化方法与要求风力发电
- 2026贵州农商联合银行第二批社会招聘11人笔试参考题库及答案详解
- 2026年新疆银行人员招聘笔试参考题库及答案详解
- 2026年联通考试试题及答案
- 2026年湖北公开遴选公务员考试(综合管理类)综合试题及答案
- 2026年专业技术人员继续教育公需科目人工智能及应用试题及答案
- 江苏徐州市交通控股集团招聘笔试题库2026
- 2026年河南省网格员招聘考试参考试题及答案解析
- 职工技师工作站工作制度
- 2025年株洲市荷塘区事业单位招聘笔试试题及答案解析
评论
0/150
提交评论