2026人工智能训练师二级真题及答案_第1页
2026人工智能训练师二级真题及答案_第2页
2026人工智能训练师二级真题及答案_第3页
2026人工智能训练师二级真题及答案_第4页
2026人工智能训练师二级真题及答案_第5页
已阅读5页,还剩15页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026人工智能训练师二级真题及答案一、单项选择题(每题1分,共20分)1.在二分类问题中,精确率(Precision)的计算公式是?A.PB.PC.PD.P答案:A解析:精确率衡量的是预测为正类的样本中有多少真正为正类,分母是TP+F2.FocalLoss最主要解决的问题是?A.训练数据集过小B.正负样本比例悬殊且难易样本不均衡C.学习率设置过大D.深层网络梯度消失答案:B解析:FocalLoss通过调制因子降低易分类样本的权重,使模型聚焦于难分类样本,常用于目标检测等正负样本极不均衡的任务。3.下列操作中,最可能加剧模型过拟合的是?A.增大正则化系数B.提高Dropout比率C.大幅增加模型参数量D.扩充训练数据答案:C解析:模型参数量过大而训练数据不足时,模型容易记住噪声,导致过拟合。增大正则化、提高Dropout、扩充数据都会抑制过拟合。4.在目标检测数据标注中,COCO格式的bbox字段通常表示为[x,y,w,h],其中(x,y)指的是?A.目标中心点坐标B.矩形框左上角坐标C.矩形框右下角坐标D.矩形框左下角坐标答案:B解析:COCO标注中的矩形框采用“左上角坐标+宽高”表示,即x、y是矩形左上角顶点的横纵坐标。5.关于BatchNormalization,下列说法正确的是?A.训练时使用当前batch的均值和方差,推理时使用全局统计量B.推理时直接使用每个batch的均值和方差C.该操作只能用于卷积层D.加入BatchNormalization后通常会使训练更难收敛答案:A解析:BatchNormalization在训练时按batch计算均值和方差归一化,推理时使用训练过程中积累的全局统计量,以保证确定性输出。6.下列数据增强操作中,属于图像几何变换的是?A.随机亮度调整B.对比度变换C.水平翻转D.添加高斯噪声答案:C解析:水平翻转属于几何变换;亮度、对比度属于颜色变换;高斯噪声属于噪声扰动。7.在一个NLP文本分类任务中,训练集规模很小,最合适的策略是?A.从零训练一个大规模Transformer模型B.使用预训练语言模型进行微调C.随机初始化全连接网络直接训练D.不使用词向量,直接送入独热编码答案:B解析:预训练模型已经在大规模语料上学习到通用语言表示,在小数据集上微调可以获得更好的表现,也更容易收敛。8.关于AUC的语义,下列解释最准确的是?A.随机抽取一个正样本和一个负样本,正样本得分高于负样本得分的概率B.精确率和召回率的调和平均数C.模型预测错误样本占总样本的比例D.模型在训练集上的准确率答案:A解析:AUC反映模型对正负样本的排序能力,值越大说明正样本排在负样本前面的概率越高。9.在迁移学习中,将预训练模型应用于新的小数据集时,通常首先采用的做法是?A.冻结底层参数,只微调高层和新增分类头B.以较大学习率微调所有参数C.删除所有卷积层后重新随机初始化D.冻结所有参数,完全不训练答案:A解析:底层特征具有较强通用性,冻结底层可避免小数据导致特征破坏。同时微调高层和任务相关分类头,能在保留通用特征的基础上适配新任务。10.评价语义分割模型时,最常用的指标是?A.mIoUB.均方误差(MSE)C.困惑度(Perplexity)D.BLEU值答案:A解析:mIoU计算预测分割区域与真实标注区域的交并比均值,是语义分割任务的标准评价指标。11.在强化学习中,折扣因子γ通常的取值范围是?A.0B.γC.γD.任意实数答案:A解析:折扣因子γ决定未来奖励的衰减程度,通常取[0,112.训练过程中,训练集损失持续下降,但验证集损失先下降后上升,最可能的原因是?A.欠拟合B.过拟合C.学习率过小D.训练数据标注错误答案:B解析:训练损失下降而验证损失上升,是典型的过拟合现象,说明模型泛化能力不足。13.对于正负样本严重不均衡的数据集,下列做法中通常效果最好的是?A.随意删除部分样本B.使用重采样或类别加权损失C.将学习率调至非常大D.不进行任何处理直接训练答案:B解析:欠采样、过采样、合成样本(如SMOTE)以及给少数类更高损失权重,都是处理类不均衡的有效手段。14.在PyTorch中,推荐保存模型的方式是?A.直接保存整个模型对象B.保存模型的state_dictC.只保存优化器状态D.只保存训练日志文件答案:B解析:state_dict只包含模型参数,文件小且结构清晰,加载时也更容易处理网络结构变化。15.数据标注规范中,对于目标被大面积遮挡的情况,通常应如何处理?A.跳过该目标不标注B.只按可见部分标注,并忽略遮挡部分C.结合上下文推测完整目标范围,并添加“遮挡”属性标记D.将该目标标注为背景答案:C解析:遮挡目标应尽可能标注完整目标范围,同时使用属性标记记录遮挡状态,便于后续模型训练和质检。16.下列哪个应用场景更适合使用目标检测而不是图像分类?A.判断一张图像中是否有猫B.判断一张图像中猫的品种C.判断一张图像中多只猫各在什么位置D.判断一张图像中内容是猫还是狗答案:C解析:目标检测不仅识别目标类别,还输出目标位置,因此适合定位图像中多个目标及其空间范围。17.对抗攻击(AdversarialAttack)指的是?A.向训练数据中随机加入噪声B.向输入添加微小扰动,使模型给出错误输出C.增加网络层数以提升模型复杂度D.在网络中引入注意力机制答案:B解析:对抗攻击利用模型对微小扰动的敏感性,通过精心构造扰动欺骗模型,是模型安全领域的重要研究方向。18.人工智能训练师处理包含人脸、车牌等个人敏感信息的训练数据时,首先应当?A.直接删除所有相关数据B.遵循《个人信息保护法》等法规,对数据进行脱敏并确保有合法授权C.上传至公共云盘加速训练D.忽略隐私风险直接使用答案:B解析:敏感数据必须合规使用,删除数据并非最优解,脱敏处理、权限管控和合法授权是标准流程。19.在BERT类模型中,输入序列开头[CLS]位置的输出向量通常用于?A.预测下一个词B.作为整个句子的语义表示用于分类任务C.表示句子中每个词的词性标签D.计算模型的困惑度答案:B解析:BERT使用[CLS]向量聚合整个句子的信息,微调分类时通常将该向量接到全连接层进行预测。20.关于早停法(EarlyStopping),下列说法正确的是?A.当验证集性能不再提升时停止训练,以减少过拟合B.当训练集准确率达到100%时立即停止C.在测试集损失最低点停止D.在固定训练轮数越多越好答案:A解析:早停法观察验证集表现,在验证性能开始下降或不再提升时停止训练,既节省时间,也有助于泛化。二、多项选择题(每题2分,共20分)1.下列哪些策略可以有效缓解类别不均衡问题?A.对多数类样本进行欠采样B.对少数类样本进行过采样C.使用FocalLossD.增加网络层数E.降低学习率答案:A、B、C解析:欠采样、过采样、FocalLoss都能缓解类别不均衡。增加网络层数和调整学习率不属于针对类别不均衡的常规手段。2.关于超参数调优,下列说法正确的有?A.网格搜索会对所有超参数组合进行穷举B.随机搜索在超参数维度较高时通常比网格搜索更高效C.贝叶斯优化会利用历史评价结果选择下一组超参数D.学习率在整个训练过程中只能保持固定值E.批量大小只会影响训练速度,不会影响模型性能答案:A、B、C解析:学习率可以使用余弦退火、指数衰减等调度策略;批量大小会同时影响训练速度和模型收敛质量,因此D、E不正确。3.下列属于数据清洗操作的有?A.缺失值填充B.去除重复样本C.检测并处理异常值D.修改神经网络激活函数E.调整ResNet的层数答案:A、B、C解析:数据清洗处理的是数据质量问题,包括缺失、重复、异常等。修改网络结构和激活函数属于模型优化范畴。4.在深度学习训练过程中,损失值出现NaN,可能的原因有?A.学习率设置过高,参数发生爆炸B.数据中含有NaN或infC.梯度数值溢出D.正则化系数为0E.使用Adam优化器答案:A、B、C解析:学习率过大会导致参数更新过大,脏数据会污染前向计算,梯度溢出都会产生NaN。使用Adam本身不会导致NaN,正则化系数为0也不是直接原因。5.关于混淆矩阵,下列说法正确的有?A.TP表示实际为正且预测为正的样本数B.FP表示实际为负但预测为正的样本数C.FN表示实际为正但预测为负的样本数D.TN表示实际为负且预测为负的样本数E.TP与TN之和等于全部样本数答案:A、B、C、D解析:混淆矩阵四类样本共同组成全部样本,即TP6.关于数据标注质量控制,下列做法合理的有?A.制定详细的标注规范B.多人交叉标注并计算一致性指标(如Kappa系数)C.对标注结果按一定比例抽检D.为追求速度,删除全部质检环节E.使用主动学习筛选出高价值样本优先人工复核答案:A、B、C、E解析:质量抽检和一致性校验是保证标注质量的核心手段;删除质检环节会严重影响数据集质量,因此D错误。7.下列属于图像分类常用数据增强技术的有?A.RandomCrop(随机裁剪)B.ColorJitter(颜色抖动)C.MixUpD.CutMixE.直接修改类别标签答案:A、B、C、D解析:RandomCrop、ColorJitter属于单样本增强,MixUp和CutMix属于样本混合增强。直接修改标签属于造假行为,不能作为数据增强。8.关于卷积神经网络(CNN)与全连接网络(FCN)的对比,下列说法正确的有?A.卷积层具有局部连接和参数共享特性B.处理同尺寸图像时,全连接网络的参数通常远多于卷积网络C.卷积网络更适合学习图像的空间结构D.全连接网络完全不能用于图像分类E.卷积网络通过一层卷积就能建模全局长距离依赖答案:A、B、C解析:全连接网络也能完成图像分类,但参数量和空间结构建模能力通常不如CNN;单层卷积的感受野有限,无法快速建模全局依赖关系。9.关于Transformer模型,下列说法正确的有?A.核心机制是自注意力B.需要加入位置编码来保留词序信息C.Encoder部分可以对输入进行并行计算D.只能处理文本数据E.多头注意力可以捕捉不同子空间的信息答案:A、B、C、E解析:Transformer已被扩展用于图像(ViT)、语音等多模态任务,因此D错误。其余描述均为Transformer的基本特性。10.在模型训练过程中,TensorBoard可以用于?A.可视化训练和验证损失曲线B.可视化模型计算图C.查看分类模型的混淆矩阵D.自动调优模型超参数E.对比不同实验的指标曲线答案:A、B、C、E解析:TensorBoard是可视化工具,可以显示指标、图和模型结构,但不会自动调优超参数,因此D错误。三、判断题(每题1分,共10分)1.在目标检测中,IoU的计算公式是检测框与真实标注框的交集面积除以并集面积。答案:正确2.学习率设置得越小,模型最终的效果一定越好。答案:错误解析:学习率过小会导致训练极慢,还可能陷入局部最优;需要选取合适范围或配合学习率调度。3.做目标检测标注时,只要目标在框内,不管位置偏移多少,对训练结果都没有影响。答案:错误解析:边界框偏移会引入标注噪声,直接影响回归分支的学习,严重时会造成目标定位偏差和模型退化。4.使用SMOTE等过采样方法缓解样本不均衡时,有可能增加过拟合风险。答案:正确解析:SMOTE通过插值生成新样本,若局部噪声较大,生成的样本可能落入不合理区域,从而加剧过拟合。5.模型在测试集上表现良好,就一定能在线上业务中保持相同效果。答案:错误解析:真实业务数据分布可能随时间漂移,测试集不能完全覆盖线上所有场景,需要进行持续监测和评估。6.迁移学习只适用于计算机视觉任务,不能用于自然语言处理任务。答案:错误解析:迁移学习在NLP中同样广泛应用,如BERT、GPT等预训练模型微调。7.只要技术手段足够强大,使用包含个人敏感信息的数据训练模型时可以无需获得用户授权。答案:错误解析:合规使用是AI训练的基本前提,必须遵循相关法律法规并获得合法授权。8.早停法可以在防止过拟合的同时节省训练资源。答案:正确9.Softmax层输出的所有类别概率之和一定等于1。答案:正确10.图像分类网络通常会在卷积层后接全连接层或全局平均池化层,用于输出类别得分。答案:正确四、简答题(每题5分,共20分)1.简述人工智能训练师在数据标注前需要完成的主要准备工作。答案:(1)明确任务需求,确定标注目标、类别体系和标注粒度;(2)制定详细、可执行的标注规范,说明各类别定义、边界情况和特殊规则;(3)准备数据样本并对原始数据进行预处理,如去重、脱敏、格式转换;(4)设计标注工具和标注流程,分配标注人员并进行培训与试标;(5)制定质量控制与抽检方案,包括一致性指标和质检比例。2.简述解决模型过拟合的四种常用方法。答案:(1)扩充训练数据,或使用数据增强;(2)引入正则化,如L2正则化、Dropout;(3)采用早停法,在验证集性能不再提升时停止训练;(4)降低模型复杂度,如减少网络层数、参数量或简化特征维度。3.写出精确率、召回率与F1值的定义,并说明各自的适用场景。答案:(1)精确率P=(2)召回率R=(3)F1值是精确率和召回率的调和平均:F14.使用GPU训练模型时发现显存不足,至少写出四种可采取的解决措施。答案:(1)减小batchsize;(2)降低输入图像分辨率或缩小样本尺寸;(3)使用梯度累积,模拟更大batch的效果;(4)使用混合精度训练,降低显存占用;(5)启用梯度检查点(GradientCheckpointing),以计算换显存。五、综合分析题(每题15分,共30分)1.某电商平台构建商品评论情感分类模型。训练过程中发现训练集准确率达到95%,验证集准确率只有72%。请分析可能的原因,并给出排查方向和改进建议。答案:(1)原因分析该现象是典型的过拟合表现,即模型在训练集上过度学习,泛化能力不足。可能原因包括:训练数据量不足;模型参数量过大;数据标注噪声大;训练轮数过多;类别不均衡;训练集与验证集分布不一致。(2)排查方向①检查训练集与验证集的样本来源、时间分布、类别分布是否一致;②检查标注质量,随机抽取部分训练样本进行二次审核;③观察训练损失与验证损失曲线,确认是否存在验证损失先降后升;④统计训练集和验证集在难例上的表现差异,定位过拟合来源。(3)改进建议①扩充训练数据,对少数类样本进行过采样或引入外部语料;②使用正则化手段,如Dropout、L2正则化、权重衰减;③采用早停法,根据验证集表现选择最佳训练轮数;④降低模型复杂度,使用更小的预训练模型或减少全连接层维度;⑤使用交叉验证评估模型稳定性,避免单

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论