2026年人工智能训练师三级理论考试试卷_第1页
2026年人工智能训练师三级理论考试试卷_第2页
2026年人工智能训练师三级理论考试试卷_第3页
2026年人工智能训练师三级理论考试试卷_第4页
2026年人工智能训练师三级理论考试试卷_第5页
已阅读5页,还剩18页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年人工智能训练师三级理论考试试卷考试时长:120分钟满分:100分合格线:60分作答要求:所有客观题答案请填涂在答题卡对应位置,主观题答案请写在答题纸指定区域,不得在试卷上做任何标记。第一部分单项选择题(共20题,每题1分,共20分。每题只有1个正确答案,错选、不选均不得分)1.依据2025年修订的《国家职业技能标准·人工智能训练师》,三级人工智能训练师的核心岗位职责不包括以下哪项?A.独立完成垂直领域大模型的参数高效微调工作B.负责标注项目的质量管控与进度跟进C.独立研发通用大模型的核心架构D.排查训练过程中的数据异常、效果异常问题2.多模态数据标注中,文本与图像内容的对齐误差行业通用合格阈值为?A.≤1%B.≤2%C.≤5%D.≤10%3.以下哪种参数高效微调方法仅需调整大模型注意力层的低秩矩阵参数,算力需求仅为全量微调的5%-10%?A.PrefixTuningB.LoRAC.IA3D.提示微调4.标注涉及个人信息的训练数据时,以下哪种脱敏方式不符合《网络安全法》《个人信息保护法》的要求?A.对身份证号、手机号等敏感字段做掩码处理B.删除数据中所有可识别到特定自然人的关联字段C.对人脸数据做不可逆的模糊化处理D.仅对姓名进行替换,保留手机号、住址完整字段5.大模型训练过程中,训练集准确率持续上升,验证集准确率持续下降,该现象属于以下哪种问题?A.欠拟合B.过拟合C.梯度消失D.梯度爆炸6.以下哪种训练数据划分比例符合垂直领域大模型微调的通用规范?A.训练集60%、验证集20%、测试集20%B.训练集80%、验证集10%、测试集10%C.训练集90%、验证集5%、测试集5%D.训练集70%、验证集15%、测试集15%7.以下哪种工具不属于2026年人工智能训练师常用的标注工具?A.LabelStudioB.ProdigyC.PhotoShopD.百度智能云数据标注平台8.面向客服场景的大模型训练效果评估中,以下哪个指标不属于业务效果评估维度?A.响应准确率B.响应时长C.用户满意度D.模型参数量9.大模型的幻觉问题指的是以下哪种现象?A.模型响应速度慢,卡顿明显B.模型生成的内容存在事实性错误、无中生有的信息C.模型无法识别用户的提问D.模型拒绝响应合法的用户请求10.以下哪种数据不属于训练数据集清洗阶段需要剔除的无效数据?A.重复出现的样本数据B.标注标签错误的噪声数据C.符合标注规则的低频率样本数据D.包含色情、暴力、反动内容的违规数据11.RLHF(人类反馈强化学习)流程中,三级人工智能训练师不需要参与以下哪个环节?A.对模型的响应结果做排序标注B.训练奖励模型C.校验奖励模型的输出效果D.标注人类偏好的优质响应样本12.3D点云标注场景中,针对自动驾驶场景的障碍物标注,以下哪种操作不符合规范?A.对遮挡率超过70%的障碍物仍做完整框选标注B.区分不同类型的障碍物(行人、机动车、非机动车等)C.标注障碍物的运动方向属性D.对边缘模糊的障碍物做标记后提交审核13.以下哪种prompt工程方法不属于提升大模型响应准确率的常用方法?A.思维链(ChainofThought)提示B.少样本(Few-shot)提示C.随机字符填充提示D.角色设定提示14.训练数据的版权合规要求中,以下哪种数据可以不经授权直接用于大模型训练?A.作者明确声明禁止用于训练的原创图文内容B.已经进入公共领域的无版权数据C.从第三方平台爬取的未授权用户生成内容D.购买的有使用范围限制的商用数据集15.以下哪种方法不属于解决大模型过拟合问题的常用方案?A.增加训练数据集的多样性B.增大训练的学习率C.加入正则化项D.提前停止训练16.语音标注场景中,针对带口音的普通话语音转写标注,以下哪种操作符合规范?A.直接按照发音人的口音转写为方言文字B.转写为标准普通话文字,同时标注口音类型C.直接丢弃带口音的语音样本D.按照发音人的语义做随意修正17.三级人工智能训练师在排查训练异常时,首先需要排查以下哪个环节的问题?A.模型架构问题B.算力资源问题C.训练数据问题D.算法逻辑问题18.以下哪个不属于大模型训练过程中的核心监控指标?A.损失值(Loss)的变化趋势B.验证集准确率的变化趋势C.训练服务器的CPU使用率D.训练数据的总存储容量19.面向未成年人的AIGC产品训练中,以下哪种数据可以纳入训练数据集?A.包含未成年人隐私信息的个人数据B.诱导未成年人沉迷网络的内容数据C.适合未成年人年龄的科普类正版内容D.包含暴力、低俗内容的动漫作品20.模型蒸馏的核心目标是?A.增大模型的参数量,提升效果B.将大模型的知识迁移到小模型中,兼顾效果和推理速度C.提升大模型的训练速度D.降低大模型的训练数据需求量第二部分多项选择题(共10题,每题2分,共20分。每题有2个及以上正确答案,多选、少选、错选、不选均不得分)1.三级人工智能训练师开展参数高效微调时,常用的方法包括以下哪些?A.LoRAB.PrefixTuningC.全量微调D.IA32.多模态数据标注的核心质量要求包括以下哪些?A.不同模态内容的对齐误差≤2%B.标注标签的准确率≥98%C.违规内容漏检率为0D.可以保留重复标注的样本3.训练数据脱敏的常用方法包括以下哪些?A.掩码处理B.数据泛化C.不可逆加密D.数据删除4.prompt工程的核心原则包括以下哪些?A.指令清晰明确,无歧义B.提供必要的背景信息C.尽可能使用模糊的表述D.设定合适的角色与输出格式5.垂直领域大模型训练效果的评估维度包括以下哪些?A.通用能力维度B.业务能力维度C.安全合规维度D.性能效率维度6.人工智能训练师的职业伦理要求包括以下哪些?A.不得泄露训练数据涉及的国家秘密、商业秘密、个人隐私B.不得训练生成违反法律法规、公序良俗的AI模型C.可以篡改训练数据的标注结果以提升模型效果D.主动排查模型的偏见、歧视问题,及时优化7.大模型训练中出现过拟合问题时,可采取的优化方案包括以下哪些?A.扩充训练数据集的规模和多样性B.加入L1、L2正则化项C.增大模型参数量D.提前停止训练8.标注项目的质量管控节点包括以下哪些?A.标注员自检B.小组组长抽检C.项目组终检D.客户方验收9.大模型训练过程中出现损失值不收敛的问题,可能的原因包括以下哪些?A.学习率设置过大B.训练数据噪声过多C.模型架构存在bugD.batchsize设置过小10.AIGC训练数据的版权合规要求包括以下哪些?A.优先使用公共领域、已获得授权的数据集B.不得使用作者明确禁止用于训练的原创内容C.对爬取的互联网数据可以直接使用,不需要授权D.保留训练数据的授权证明,以备溯源第三部分判断题(共15题,每题1分,共15分。请在答题卡对应位置填涂“√”或“×”,判断错误、不判断均不得分)1.三级人工智能训练师可以独立完成通用大模型的全量微调工作。2.LoRA微调仅需要调整大模型注意力层的低秩矩阵参数,不需要调整全量参数。3.多模态数据标注中,文本与图像的对齐误差可以超过2%,只要标注标签正确即可。4.训练数据中的低频率样本只要符合标注规则,就可以保留在训练数据集中,不需要剔除。5.人工智能训练师可以将标注的训练数据私自下载到个人设备中存储。6.大模型的幻觉问题只能通过优化prompt的方式解决。7.训练数据集划分时,测试集可以和训练集有重复样本。8.3D点云标注中,遮挡率超过70%的障碍物不需要做标注。9.参数高效微调的效果一定比全量微调的效果差。10.面向政务场景的大模型训练中,违规内容漏检率可以允许在1%以内。11.语音标注中,带口音的语音样本可以直接丢弃,不需要标注。12.RLHF流程中,人类反馈的标注结果直接影响奖励模型的效果。13.大模型训练过程中,损失值持续下降说明模型的效果一定在持续提升。14.已经进入公共领域的无版权数据,可以不经授权直接用于大模型训练。15.三级人工智能训练师不需要掌握训练异常的排查方法,只需要完成数据标注工作即可。第四部分简答题(共3题,每题8分,共24分。请在答题纸指定区域作答,表述清晰、逻辑严谨)1.请简述参数高效微调(PEFT)相比于全量微调的核心优势,以及三级人工智能训练师常用的3种PEFT实现方法的适用场景。2.在多模态对话大模型的训练数据标注过程中,需要遵循哪些核心质量管控规则?请至少列出6项。3.某企业训练面向客服场景的垂直大模型时,出现训练集准确率97%,测试集准确率仅82%的问题,请简述导致该问题的3种核心原因,以及对应的优化方案。第五部分案例分析题(共2题,第1题10分,第2题11分,共21分。请结合给定材料作答,逻辑清晰、措施可落地、数据准确)1.案例材料:某电商平台计划训练面向商品图文生成的多模态AIGC模型,由你作为三级人工智能训练师负责训练数据的全流程管控,已知待标注数据集包含120万张商品实拍图、对应的商品属性文本48万条,单条标注任务为“实拍图-商品属性文本对齐校验+缺失属性补全+违规内容筛查”,标注团队共30人,要求标注交付周期为20天,标注准确率要求≥98%,标注校验抽样比例为10%,标注不合格样本的返工率为2%。问题:(1)请计算该项目的人均日标注基准量(写出计算过程,结果保留整数)。(2)请列出该项目标注过程中需要设置的3个关键质量校验节点,以及每个节点的管控标准。2.案例材料:某政务服务单位计划训练面向群众咨询的政务大模型,当前已完成初始微调,测试阶段发现存在3类问题:1)群众提问涉及个人隐私信息时,模型仍会正常响应并泄露历史用户的隐私数据;2)群众咨询跨部门政务事项时,模型给出的办事流程存在30%的错误率;3)模型偶尔会生成不符合政策要求的违规内容。你作为负责该模型优化的三级人工智能训练师,请给出完整的优化方案,要求覆盖数据侧、训练侧、推理侧三个维度,每个维度至少2项可落地的优化措施,并且说明每项措施的预期效果。参考答案一、单项选择题1.C2.B3.B4.D5.B6.B7.C8.D9.B10.C11.B12.A13.C14.B15.B16.B17.C18.D19.C20.B二、多项选择题1.ABD2.ABC3.ABCD4.ABD5.ABCD6.ABD7.ABD8.ABCD9.ABCD10.ABD三、判断题1.×2.√3.×4.√5.×6.×7.×8.√9.×10.×11.×12.√13.×14.√15.×四、简答题1.核心优势(3分):(1)算力需求低:仅需调整1%-10%的模型参数,算力需求仅为全量微调的5%-15%,无需占用大规模GPU集群资源;(2)训练成本低:训练时间短、能耗低,可大幅降低垂直领域模型适配的成本;(3)部署灵活:微调生成的参数文件体积小(通常几十到几百MB),可直接挂载到原通用大模型上使用,无需重新部署全量模型。常用方法及适用场景(5分):(1)LoRA:适用于大多数垂直领域大模型微调场景,尤其是对话、内容生成类场景,可在不影响大模型通用能力的前提下,快速适配垂直领域的业务需求,是当前应用最广泛的PEFT方法(2分);(2)PrefixTuning:适用于生成类任务场景,比如文案生成、摘要生成等,通过固定模型参数、调整输入前缀的方式优化输出效果,对小样本数据的适配性更好(2分);(3)IA3:适用于算力资源极度有限的场景,仅需调整注意力层的缩放因子,算力需求比LoRA更低,适合边缘侧模型的微调适配(1分)。2.(每项1.5分,列出6项即可得满分):(1)对齐规则:文本、图像、语音等不同模态的内容必须一一对应,对齐误差≤2%,不得出现模态错配的问题;(2)标签准确规则:标注标签的准确率≥98%,不得出现事实性错误、标签错标的问题;(3)合规规则:所有标注样本不得包含违反法律法规、公序良俗的内容,违规内容漏检率为0;(4)去重规则:重复样本的占比必须≤0.5%,同一内容的多模态样本不得重复标注;(5)脱敏规则:所有涉及个人隐私、商业秘密、国家秘密的内容必须完成脱敏处理,敏感字段漏脱敏率为0;(6)一致性规则:同一类型的样本标注规则必须统一,不同标注员的标注结果一致性≥95%;(7)异常标记规则:对内容模糊、标注边界不清晰的异常样本必须做专门标记,提交审核人员判定,不得随意标注。3.该问题属于典型的过拟合问题,核心原因及优化方案如下:(1)原因1:训练数据集规模小、多样性不足,模型学习到的是训练数据的特有特征,无法泛化到未知的测试数据。优化方案:扩充训练数据集的规模,补充不同场景、不同用户提问方式的样本,提升训练数据的多样性,覆盖至少95%的客服场景常见问题(2.5分);(2)原因2:训练策略设置不合理,学习率过大、训练轮次过多,模型过度学习训练数据的噪声特征。优化方案:调整训练策略,降低学习率,加入L1、L2正则化项,监控验证集的损失值变化,在验证集损失值不再下降时提前停止训练(2.5分);(3)原因3:数据集划分不合理,训练集和测试集的分布差异过大,测试集包含大量训练集未覆盖的场景。优化方案:重新划分数据集,按照场景类别做分层抽样,保证训练集、验证集、测试集的分布一致,比例设置为8:1:1,同时补充测试集覆盖场景的训练样本(3分)。五、案例分析题1.(1)计算过程:首先计算项目总等效工作量:单条样本标注完成后需要经过校验、返工环节,等效工作量系数为1(标注)+0.1(校验)+0.02(返工)=1.12;总等效工作量=待标注总样本量*等效工作量系数=120万*1.12=134.4万条;项目总可用人天=标注人数*交付周期=30人*20天=600人天;人均日标注基准量=总等效工作量/总可用人天=134.4万/600=224条/人/天。(计算过程正确3分,结果正确1分,共4分)(2)关键质量校验节点及管控标准(每个节点2分,共6分):①自检节点:标注员完成单条样本标注后必须逐一自检,管控标准为自检准确率≥99%,对齐误差≤1.5%,违规内容漏检率为0,自检不合格的样本必须自行修正后再提交;②组抽检节点:各小组组长按20%的比例对本组标注员提交的样本做抽检,管控标准为抽检准确率≥98.5%,标注一致性≥96%,不合格样本返回标注员返工,抽检不合格率超过3%的标注员的当日所有样本必须全量重检;③终检节点:项目质量组按10%的比例对所有提交的样本做终检,管控标准为终检准确率≥98%,对齐误差≤2%,违规内容漏检率为0,敏感字段脱敏率为100%,终检不合格率超过1%的批次必须全量返工。2.优化方案如下:(1)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论