2026年人工智能训练师(三级)技能等级认定真题_第1页
2026年人工智能训练师(三级)技能等级认定真题_第2页
2026年人工智能训练师(三级)技能等级认定真题_第3页
2026年人工智能训练师(三级)技能等级认定真题_第4页
2026年人工智能训练师(三级)技能等级认定真题_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年人工智能训练师(三级)技能等级认定真题2026年人工智能训练师(三级)技能等级认定真题分为理论知识考试、操作技能考核两部分,其中理论知识考试满分100分,合格分数线60分,考试时长90分钟;操作技能考核满分100分,合格分数线60分,考试时长180分钟。第一部分理论知识考试一、单项选择题(共30题,每题1分,总计30分)1.根据2025版《中华人民共和国职业分类大典》,人工智能训练师的核心职责不包括以下哪项?A.人工智能产品需求调研B.人工智能训练数据标注与清洗C.人工智能模型训练与调优辅助D.人工智能模型性能及应用效果测试2.多模态训练数据标注任务中,优先级最高的标注对象是?A.文本实体B.图像核心主体C.音频关键语义D.决定模型下游任务输出的核心特征3.大模型监督微调(SFT)阶段的原始语料清洗环节,重复率超过()的样本需直接剔除?A.1%B.2%C.5%D.10%4.基于人类反馈的强化学习(RLHF)偏好数据标注环节,标注员间标注一致性的Krippendorffα系数最低需达到()方可判定批次合格?A.0.6B.0.7C.0.75D.0.855.包含自然人人脸信息的训练数据需执行不可逆脱敏,以下哪种算法符合脱敏要求?A.高斯模糊处理B.人脸关键点打码C.人脸特征向量不可逆哈希转换D.人脸区域裁剪6.小样本(Few-shot)微调场景下,单类别标注样本量的常规范围是?A.1-10条B.10-50条C.50-100条D.100条以上7.以下不属于多模态标注工具LabelStudio3.0原生支持的功能是?A.文本实体标注B.3D点云标注C.大模型推理结果自动预标注D.模型训练全流程自动化8.采用FP16精度微调7B参数开源大模型,不启用量化技术的前提下,单卡GPU最低显存需求为?A.8GBB.16GBC.24GBD.40GB9.标注批次质量抽检环节,标注错误率超过()的批次需全量返工?A.2%B.3%C.5%D.10%10.生成式AI训练数据采集环节,以下哪类数据可无需授权直接使用?A.某作家公开出版的小说全文B.某博主在社交平台发布的原创短视频C.国家政务服务平台公开的可免费复用政策文本D.某影院上映的热门电影片源11.文本实体标注中,以下哪类属于非命名实体标注范畴?A.人名B.机构名C.情感极性D.地名12.自动驾驶场景3D点云标注中,以下哪类目标标注优先级最高?A.静态路牌B.横穿马路的行人C.路边树木D.空中飞鸟13.大模型训练数据拆分的常规比例为?A.训练集6:验证集2:测试集2B.训练集7:验证集2:测试集1C.训练集8:验证集1:测试集1D.训练集9:验证集0.5:测试集0.514.以下哪项不属于低质量训练数据的判定标准?A.语义上下文关联度0.9B.乱码占比超过30%C.回复内容残缺不全D.存在明显事实性错误15.三级人工智能训练师需掌握的标注质量核验方法不包括?A.交叉标注核验B.抽样核验C.一致性系数计算D.模型架构优化16.教育场景AI作业批改模型的训练数据中,以下哪项属于敏感信息需脱敏?A.题目内容B.学生作答内容C.学生姓名、年级D.批改标准17.语音转写标注中,对于发音模糊无法识别的内容,正确标注方式为?A.自行猜测补充B.标记为[模糊]C.直接删除该段内容D.标记为静音18.大模型SFT数据格式中,用户输入和模型输出的分隔符作用是?A.提升模型训练速度B.明确对话角色边界,避免模型混淆输入输出C.降低显存占用D.提升模型推理精度19.以下哪种数据扩增方法不适用于文本训练数据?A.同义词替换B.语序调整C.亮度调整D.回译20.标注任务开展前的培训环节,三级训练师不需要掌握的内容是?A.标注规则B.标注工具操作方法C.质量判定标准D.项目定价规则21.图像分割标注中,标注区域与实际目标边缘的IOU值最低需达到()才算合格?A.0.7B.0.8C.0.9D.0.9522.以下哪项不属于训练数据伦理合规要求?A.不得包含歧视性内容B.不得侵犯他人知识产权C.数据量越大越好,无需筛选D.不得泄露国家秘密、商业秘密23.偏好数据标注中,对于3个候选回复的排序标注,要求标注员给出()排序结果?A.最优和最差即可B.从优到劣的全排序C.任意两个的对比即可D.随机排序24.以下哪种存储介质适合存放涉密训练数据?A.公有云存储B.未加密的移动硬盘C.内部加密离线存储服务器D.个人U盘25.训练数据质量评估指标中,召回率的定义是?A.正确标注的样本数占总标注样本数的比例B.正确检出的有效样本数占全部真实有效样本数的比例C.标注一致的样本数占总样本数的比例D.合格样本数占总样本数的比例26.以下哪类模型不属于三级训练师需要掌握的辅助标注工具范畴?A.敏感内容检测模型B.目标检测预标注模型C.大模型预训练架构D.文本相似度计算模型27.金融场景智能客服模型训练数据中,以下哪项需做不可逆脱敏?A.客户咨询的理财问题B.客户银行卡号、交易密码C.客服回复的利率说明D.业务办理流程28.多模态数据标注中,同一目标的文本、图像、音频标注结果的关联度最低需达到()才算合格?A.0.7B.0.8C.0.9D.0.9529.大模型微调阶段,验证集的主要作用是?A.训练模型参数B.调整模型超参数,评估模型泛化能力C.最终测试模型性能D.扩充训练数据量30.2025版《人工智能训练师国家职业技能标准》中,三级训练师的累计从业年限要求最低为?A.1年B.2年C.3年D.4年二、多项选择题(共15题,每题2分,总计30分,多选、少选、错选均不得分)1.三级人工智能训练师的法定岗位职责包括以下哪些?A.标注方案落地执行B.标注数据清洗与校验C.大模型监督微调数据预处理D.标注团队人员招聘与绩效管理E.标注质量抽检与一致性核验2.多模态训练数据标注的常规对象包括?A.文本语义、实体、情感B.图像目标、分割、关键点C.音频转写、情感、声纹特征D.视频动作、事件、场景E.3D点云障碍物、可行驶区域3.大模型SFT阶段的训练样本需满足以下哪些要求?A.单轮对话prompt长度不超过2048tokenB.response内容符合公序良俗及伦理要求C.prompt与response的语义关联度≥0.85D.样本重复率≤2%E.无涉政、涉黄、涉赌等敏感内容4.训练数据脱敏的适用场景包括以下哪些?A.包含自然人身份信息的数据B.包含患者病情的医疗数据C.包含用户交易记录的金融数据D.包含企业核心技术的商业秘密数据E.国家政务平台公开的可复用政策数据5.标注一致性核验的常规方法包括?A.交叉标注B.抽样核验C.Krippendorffα系数计算D.语义余弦相似度匹配E.人工复评6.以下哪些属于低质量训练数据?A.存在事实性错误的语料B.语义上下文无关联的语料C.乱码、残缺的语料D.重复率1%的语料E.包含敏感内容的语料7.文本标注的常见类型包括?A.实体标注B.关系标注C.情感标注D.语义角色标注E.分类标注8.大模型训练数据采集的合规要求包括?A.获得数据所有者的授权B.不得采集国家禁止传播的内容C.不得采集未公开的未成年人信息D.采集公开数据无需任何授权E.采集的数据需符合伦理要求9.三级人工智能训练师需要掌握的标注工具包括?A.文本标注工具BERT-ATTACKB.多模态标注工具LabelStudio3.0C.点云标注工具CloudCompareD.语音标注工具AudacityE.大模型训练框架PyTorch2.210.标注项目质量管控的核心指标包括?A.标注准确率B.标注错误率C.标注一致性系数D.敏感内容检出率E.标注完成效率11.以下哪些属于RLHF偏好数据标注的要求?A.对候选回复按照符合人类偏好的程度排序B.标注结果需符合伦理规范C.歧义样本直接标注即可,无需标记D.标注员需经过专项培训E.同一任务的标注规则需统一12.图像标注的常见类型包括?A.目标检测标注B.语义分割标注C.实例分割标注D.关键点标注E.纹理分类标注13.训练数据清洗的常规步骤包括?A.去重B.敏感内容过滤C.低质量数据剔除D.格式规整E.数据拆分14.以下哪些场景需要用到小样本标注?A.大模型垂直领域微调,可获取的标注数据量少B.新兴领域标注规则尚未成熟,样本量有限C.标注成本过高,无法大规模标注D.通用大模型预训练阶段E.模型上线前的性能测试阶段15.人工智能训练师的职业伦理要求包括?A.不得伪造标注数据B.不得泄露训练数据涉及的秘密C.不得歧视特定群体,标注内容需公平公正D.可以随意使用未授权的数据E.需主动排查训练数据中的违规内容三、判断题(共20题,每题1分,总计20分,正确打√,错误打×)1.2025版《人工智能训练师国家职业技能标准》要求,三级人工智能训练师独立完成单模态标注任务的准确率需不低于98%。()2.大模型训练数据重复率过高会导致模型生成内容出现重复幻觉、泛化能力下降等问题。()3.RLHF偏好数据标注仅需标注最优回复,无需对其余候选回复进行排序。()4.脱敏后的人脸数据可以随意用于商用训练,无需获得自然人授权。()5.自动驾驶场景3D点云标注中,动态障碍物的标注优先级高于静态障碍物。()6.标注任务开展前的培训仅需讲解标注规则,不需要做试标注考核。()7.大模型SFT数据格式化环节,不需要区分用户输入和模型输出的角色。()8.训练数据的测试集只能用于模型最终性能评估,不得参与训练和调参。()9.语义关联度低于0.7的文本问答对属于低质量数据,需剔除。()10.三级人工智能训练师可以独立负责10人以下标注团队的日常任务分配和质量巡检。()11.音频转写标注中,方言内容可以直接按照发音转写为普通话。()12.生成式AI训练数据可以包含未授权的文学作品、影视作品内容。()13.标注一致性系数越高,说明标注结果的可信度越高。()14.数据扩增的目的是提升训练数据的多样性,增强模型的泛化能力。()15.涉密训练数据可以连接公有网络传输。()16.图像目标检测标注中,标注框超出目标边缘10%以内属于合格标注。()17.中小学生作业训练数据属于未成年人敏感信息,需执行全程加密存储。()18.大模型微调阶段,验证集的准确率持续下降说明模型出现过拟合。()19.标注质量抽检的常规抽样比例为10%-20%。()20.三级人工智能训练师不需要掌握大模型微调的基本流程。()四、案例分析题(共2题,每题10分,总计20分)1.某电商平台计划训练智能客服大模型,已采集100万条2024-2025年的历史客户咨询-人工回复语料,交由你所在的团队完成SFT训练数据预处理,你作为三级人工智能训练师负责质量管控环节,请回答以下问题:(1)列出该批语料的清洗步骤(4分)(2)明确该批次标注质量管控的核心指标及阈值(3分)(3)列出该项目需要规避的3类核心合规风险及防控要点(3分)2.某自动驾驶企业采集了10万帧城市道路多模态数据(包含可见光图像、3D点云、车载音频三类数据),要求标注可行驶区域、交通标识、动态障碍物三类对象,你作为三级人工智能训练师负责标注执行落地,请回答以下问题:(1)列出三类标注对象的优先级排序及依据(3分)(2)明确交叉核验的抽样比例、一致性判定标准(3分)(3)列出该批次数据不合格的3类判定标准(4分)第一部分理论知识参考答案一、单项选择题1-5:ADBCC6-10:BDBBC11-15:CBCAD16-20:CBBCD21-25:DCBCB26-30:CBCBB二、多项选择题1.ABCE2.ABCDE3.ABCDE4.ABCD5.ABCDE6.ABCE7.ABCDE8.ABCE9.ABCD10.ABCD11.ABDE12.ABCDE13.ABCD14.ABC15.ABCE三、判断题1.√2.√3.×4.×5.√6.×7.×8.√9.√10.√11.×12.×13.√14.√15.×16.√17.√18.√19.√20.×四、案例分析题第1题参考答案(1)清洗步骤:①去重:采用simhash算法计算语料相似度,剔除重复率≥2%的语料;②敏感过滤:调用敏感内容检测模型,剔除涉政、涉黄、涉赌、涉恐等违规内容,剔除辱骂客户、引导私下交易、虚假承诺等不符合客服规范的回复;③低质量剔除:剔除上下文语义关联度<0.7、回复残缺、乱码、非中文语料、无实际业务价值的闲聊语料;④格式规整:统一对话格式,去除多余空格、特殊符号,脱敏客户手机号、地址、订单号、身份证号等敏感信息。(2)核心指标及阈值:标注准确率≥98%,标注员间一致性Krippendorffα系数≥0.75,敏感内容检出率100%,错误率≤2%。(3)合规风险及防控:①个人信息泄露风险:对所有用户敏感信息执行不可逆脱敏,数据存储、传输全程加密;②版权风险:确认历史语料的使用授权,剔除未授权的第三方内容;③伦理风险:剔除诱导用户差评、恶意引导超额消费等违反公序良俗的内容。第2题参考答案(1)优先级排序:动态障碍物>交通标识>可行驶区域,依据:动态障碍物直接影响行车安全,是自动驾驶模型识别的核心目标;交通标识决定驾驶规则,优先级次之;可行驶区域属于静态基础特征,优先级最低。(2)抽样比例及判定标准:交叉核验抽样比例为20%,同一任务3名标注员的标注结果一致性≥95%判定为合格,Krippendorffα系数≥0.75判定为批次合格。(3)不合格判定标准:①标注错误率≥3%;②一致性系数<0.75;③漏检动态障碍物、交通标识的样本占比≥1%。第二部分操作技能考核一、多模态数据标注与质量核验(35分,考试时长60分钟)任务背景现有200条多模态标注样本,包含50条电商咨询文本情感标注、50张商超商品图像目标检测标注、50条中文语音转写标注、50段门店服务视频动作分类标注,标注规范已同步下发。任务要求1.按照标注规范完成100条未标注样本的标注(20分),其中文本25条、图像25条、音频25条、视频25条;2.对100条已标注样本进行质量核验,检出所有错误标注并说明错误类型(10分);3.计算该批次标注的准确率、错误率、Krippendorffα系数三项核心指标(5分)。评分标准1.标注环节:标注准确率≥98%得20分,每低1个百分点扣2分,低于90%不得分;歧义样本未标记为待核验的每处扣1分;2.核验环节:错误标注检出率≥95%得10分,每低1个百分点扣1分,低于85%不得分;错误类型标注错误每处扣0.5分;3.指标计算环节:三项指标计算全部正确得5分,错1项扣2分,错2项及以上不得分。二、大模型SFT训练数据预处理(35分,考试时长70分钟)任务背景现有10万条通用领域问答原始语料,需预处理为符合7B大模型SFT训练要求的格式化数据集。任务要求1.数据清洗:完成原始语料的去重、敏感过滤、低质量剔除,输出清洗后的有效语料量及清洗规则说明(15分);评分标准1.数据清洗:清洗规则覆盖去重、敏感过滤、低质量剔除全环节,有效语料量误差≤2%得15分,规则缺1环节扣4分,误差每超1个百分点扣2分;2.数据格式化:格式转换准确率100%,过滤阈值符合要求得10分,格式错误每条扣1分,过滤阈值错误扣5分;3.数据拆分:拆分比例误差≤0.5%,统计指标全部正确得10分,比例

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论