下载本文档
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
3-2-习题8及参考答案1.用自己的话说明什么是大语言模型的预训练,并指出它与监督微调在训练数据形式和优化目标上的主要区别。参考答案:预训练是让模型在海量无标注文本上反复做“根据前文猜下一个词”的练习,任何一段连贯文字都能拆成无数个“前文+下一个词”的小题目,不需要人工标注,模型通过调整全部参数让交叉熵损失尽可能小,从而学会语言规律和世界知识。这种数据本身就是题目和答案合体的学习范式称为自监督学习。两者的主要区别体现在数据形式和优化目标上。预训练使用万亿级token的原始网页文本,优化目标是在每个位置都把下一个词猜准;监督微调使用数万到数十万条人工精心撰写的对话样本,每条包含系统提示、用户问题和助手回答,优化目标是通过损失遮盖只降低助手回答部分的损失,让模型学会以助手身份回应提问。2.假设一个大语言模型的词表大小为32000,嵌入向量维度为1024,请计算嵌入层的参数数量。参考答案:嵌入层是一张巨大的查找表,每一行对应词表中的一个token,每一列对应一个语义维度,因此参数总数等于词表大小乘以嵌入维度,即32000×1024=32768000,约3277万个参数。3.注意力机制中的Query、Key和Value各自代表什么含义?自行设计一个生活中的场景(例如在食堂点菜、在二手平台搜索商品、在朋友圈翻找老照片等),说明Q、K、V三者在该场景中分别对应什么。参考答案:Query是当前词发出的查询,代表“我要找什么”;Key是每个词对外展示的标签,代表“我是什么”;Value是每个词真正携带的内容信息。注意力机制用Query与各个位置的Key做匹配,算出相关程度,再按相关程度对各位置的Value加权求和,把最相关词的信息吸收进来。以在二手平台搜索商品为例,我们输入的搜索词相当于Query,每件商品挂出的标题和标签相当于Key,商品本身的详细介绍相当于Value。搜索词与哪些商品的标题越匹配,这些商品就越受关注,我们点进去看到的商品详情就越多地影响最终的判断。4.解码器式Transformer在生成文本时如何保证不会“偷看”到未来位置的内容?请解释掩码自注意力机制的工作原理。参考答案:依靠掩码自注意力机制。在计算每个词与其他词的相关性时,模型把当前位置之后的所有未来位置遮盖掉,使这些位置的注意力权重为零,每个词只能看到它自己和之前的词。这样无论训练还是生成,模型在预测下一个词时可用的信息都与真实生成时完全一致,保证了预测的公平性。这种设计还带来了训练效率上的好处。一段长度为T的文本只需一次前向计算,就能在每个位置同时给出一个预测任务,一段文本被充分利用了T次,而且各位置的计算互不依赖,可以交给GPU并行完成。5.大模型训练通常分为预训练、监督微调和基于人类反馈的强化学习三个阶段。请说明每个阶段使用的数据形式以及对应产出的模型类型。参考答案:预训练使用海量无标注文本,通过自监督的下一词预测训练,产出具备通用语言能力的基座模型;监督微调使用人工撰写的高质量指令对话数据,每条样本包含系统提示、用户问题和助手回答,配合损失遮盖让模型只学习如何回答,产出会对话的SFT模型;基于人类反馈的强化学习使用成对比较的人类偏好数据,先据此训练奖励模型,再用PPO等算法让模型输出向高分回答靠拢,产出更贴合人类偏好的对话模型。三个阶段处理的数据量逐级递减,对数据质量的要求却逐级递增。6.在监督微调中,为什么要使用损失遮盖技术?如果把用户提问部分也纳入损失计算,会让模型出现什么问题?参考答案:损失遮盖把系统提示和用户问题只作为上下文输入给模型,不允许它们参与损失计算,只有助手回答部分的token才产生损失和梯度。这样模型只需专心学习助手该如何回答,把有限的训练精力用在刀刃上。如果把用户提问部分也纳入损失,模型会同时学习如何回答和如何提问,把用户的提问口吻也学得越来越像。这不仅稀释了训练目标、拉低回答质量,还可能让模型在生成时混淆对话角色,模仿用户继续提问,而不是以助手身份给出答案。7.解释RLHF训练中KL散度惩罚项的作用。结合“奖励黑客”现象说明,如果完全去掉这一约束,模型可能朝什么方向跑偏。参考答案:KL散度惩罚项衡量当前策略模型与起始SFT模型在同一问题上输出的差异,偏离越远惩罚越大。它相当于给训练拴上一根橡皮筋,模型可以朝高分方向探索,但不会被奖励模型彻底带跑,从而保住SFT阶段学到的流畅表达和基本规矩。如果去掉这一约束,模型容易出现奖励黑客,专门钻奖励模型的空子。例如发现奖励模型偏爱礼貌热情的开场白,模型就可能不管问题本身需不需要,把每条回答都用同一套客套话开头,把简单的事实问题铺成长篇大论。这种回答能拿到高分,读起来却前言不搭后语,真正的答案反而被埋在客套话堆里。8.什么是上下文学习?为什么说它和第5章介绍的传统监督学习有本质区别?按示例数量上下文学习可以分为哪三种形式?参考答案:上下文学习是指模型不需要任何参数更新,仅靠提示词里附上的几个示例,就能从眼前的样本中提取任务规律,再把规律用到新输入上的能力。传统监督学习要靠反向传播一遍遍调整模型参数,训练一次往往要数小时甚至数天,学到的规律固化在参数中;上下文学习的全过程只在一次推理里完成,模型参数一个也没动,学到的规律只存在于当前这段对话上下文里,对话一关闭就消失。按示例数量,上下文学习可分为零样本提示(不给示例)、单样本提示(给1个示例)和少样本提示(给2个及以上示例)三种形式。9.在直觉容易出错的数学题上,大模型常常会翻车。例如比较4/5与5/7的大小,或者计算“某商品先打七折再打八折,最终相当于打几折”,模型很容易给出错误答案。请分析这类错误的成因,并说明思维链提示为什么能改善这种情况。对于已经具备内部推理能力的推理模型,我们还需要手动加上“请逐步思考”吗?请给出理由。参考答案:大模型本质上是按统计规律逐词生成的概率模型,面对包含多步约束的题目,容易凭直觉一步到位,给出听起来顺口却算错了关键一步的结论,例如把两次折扣凭感觉直接说成打五折,而正确结果应是0.7×0.8=0.56,即五六折。思维链提示让模型把中间推理步骤显式写出来再下结论,把思考过程外化后,模型能在每一步上重新分配注意力和计算,从而减少跳步带来的错误。对于推理模型,通常不需要再手动加“请逐步思考”。这类模型内部已具备完整的多步推理能力,会先在自己的“草稿区”里逐步推演再作答,外加推理指令反而可能引发过度思考,让模型在简单问题上也展开冗长草稿,既拖慢回答速度,又可能在多余的中间步骤里引入新的错误。更合适的做法是只说清目标,把推理深度交给模型自己控制。10.在调用大模型API时,temperature参数的作用是什么?分别在做事实问答和广告文案生成两类任务时,应该如何设置temperature的取值?请说明依据。参考答案:temperature控制采样时概率分布的平滑程度。取值越低,模型越倾向于选择概率最高的词,输出越确定、越保守,接近贪心解码;取值越高,原本概率较低的词也有更多机会被选中,输出越多样、越发散。事实问答有确定的正确答案,需要稳定可靠的输出,应把temperature设得很低,接近0,以抑制随机性,避免同一问题每次得到不同说法。广告文案生成追求创意和新意,可适当调高temperature,例如1.0甚至更高,让模型跳出最常见的表达,产出更富想象力的文案。11.某Transformer模型的一个线性层尺寸为2048×8192。若采用LoRA微调并取秩r=16,请计算这一层的可训练参数数量,并与全量微调时该层的参数量做对比,写出压缩比例。参考答案:全量微调时该层的参数量为2048×8192=16777216,约1678万。LoRA冻结原始权重,把权重更新量分解为两个低秩矩阵的乘积,可训练参数为2048×16+16×8192=32768+131072=163840,约16万。压缩比例为163840÷16777216≈1/102,即可训练参数不到全量微调的百分之一,微调成本因此大幅下降。12.混合专家模型中的“总参数量”和“激活参数量”分别指什么?假设一个MoE模型在每个MoE层中设置了64个专家,每个token只激活其中4个,请说明这种“总量大、激活少”的设计在模型能力与推理成本之间是如何取得平衡的。参考答案:总参数量是模型全部参数的规模,包括所有专家的参数;激活参数量是每次推理时实际参与计算的参数量。64个专家中每个token只激活4个,意味着每次前向计算只用到约十六分之一的专家参数。这种设计让模型可以把总容量做得很大,用众多专家记住更丰富的知识和模式,能力上限随之提高;同时每次推理的计算量只按激活的那一小部分参数计算,推理成本接近一个小得多的稠密模型。能力按总参数量提升,成本按激活参数量支付,二者由此得到平衡,这也是采用MoE架构的国产模型能把API价格做到远低于同类模型的重要原因。13.结合本章内容,分析下面这个观点是否成立,并给出理由。“大语言模型就是把互联网上的所有内容记在参数里,在需要时再检索出来回复用户。”参考答案:这个观点不成立。大模型预训练的目标是在各种语境下把下一个词猜准,参数里固化的是从海量文本中归纳出的统计规律和模式,而不是网页原文的逐条副
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- T/SDECC 006-2025氢能服务区数据采集规范
- 零售店长服务流程评估表
- 沈阳市于洪区2025-2026学年中考联考数学试卷含解析
- 通信行业网络工程师网络维护效率及质量绩效评估表
- 软式内镜清洗消毒技术培训考核试题及答案
- T/NAHIEM 164-2026医院介入中心(导管室)建设与设备配置
- 产品创新设计与开发流程指导手册
- 云南省部分学校2027届高三上学期9月月考数学试卷(含答案)
- 金融投资行业投资顾问资产配置与风险控制绩效考核表
- 河南省豫东名校联考2026-2027学年高二上学期过程性作业评价数学试卷(人教A版)(无答案)
- 医疗健康管理与慢病防控
- 2026河北机关事业单位工人技能等级考试(汽车驾驶员·高级)历年参考题库含答案详解2卷
- 正压送风口阀体损坏更换安装调试方案
- 第二届重庆市市场监管系统执法办案电子数据取证技能大竞赛赛完整试题
- 中考物理电路设计与电路故障分析三年2023-2025中考真题分类汇编解析版
- 煤炭销售部管理制度(3篇)
- 中海大海洋工程环境学课件03波浪流体力学理论
- 十二指肠营养管
- 跟腱断裂的术后护理
- 物料预警管理办法
- 湖南省高等学校教师资格考试高等教育学真题1
评论
0/150
提交评论