2026年人工智能训练师(一级)理论高频考点试题_第1页
2026年人工智能训练师(一级)理论高频考点试题_第2页
2026年人工智能训练师(一级)理论高频考点试题_第3页
2026年人工智能训练师(一级)理论高频考点试题_第4页
2026年人工智能训练师(一级)理论高频考点试题_第5页
已阅读5页,还剩13页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年人工智能训练师(一级)理论高频考点试题一、单项选择题(每题1分,共40分)1.在人工智能训练师的工作流程中,决定模型性能上限的最关键因素通常是?A.训练轮数B.数据质量与数量C.服务器数量D.模型文件大小答案B2.下列关于“弱监督”的描述,正确的是?A.完全不需要标注B.使用不完全、不准确或有噪声的标注进行训练C.只能使用小规模模型D.只适用于无监督任务答案B3.某二分类模型在测试集上的混淆矩阵为:TP=90,FP=10,FN=20,TN=180,则该模型的召回率(Recall)是?A.0.90B.0.82C.0.75D.0.69答案B解析召回率=T4.当模型在训练集上表现很好,但在验证集上表现明显变差时,最可能的问题是?A.欠拟合B.过拟合C.梯度消失D.学习率过小答案B5.下列哪种方法主要用于降低模型过拟合风险?A.增大学习率B.增加训练轮次C.DropoutD.移除验证集答案C6.在深度网络训练中,使用BatchNormalization的主要作用是?A.增加模型参数量B.缓解内部协变量偏移,加速收敛C.替代激活函数D.完全消除过拟合答案B7.Sigmoid函数在深层网络中的主要问题之一是?A.输出无界B.容易导致梯度消失C.不可导D.计算速度过慢答案B8.在卷积神经网络中,感受野(ReceptiveField)是指?A.输入图像的大小B.输出特征图上某个位置对应输入图像的区域大小C.卷积核的数量D.池化窗口的步长答案B9.在Transformer中,ScaledDot-ProductAttention的缩放因子通常是?A.dB.dC.dD.log答案A解析缩放点积注意力中,注意力得分除以dk,其中d10.BERT与GPT在预训练任务上的最主要区别是?A.BERT使用自编码式掩码语言模型,GPT使用自回归语言模型B.二者完全相同C.BERT不使用注意力机制D.GPT不使用神经网络答案A11.在文本分类任务中,将类别标签转换为one-hot编码后,配合使用的损失函数通常是?A.MSEB.交叉熵C.HingeD.感知器损失答案B12.在推荐系统中,评估排序质量时,下列哪项指标更关注“正样本排在前面”的能力?A.RMSEB.AUCC.MAED.准确率答案B13.关于AUC值,下列说法正确的是?A.AUC等于ROC曲线下的面积,取值通常在0到1之间B.AUC=0.5表示模型完美C.AUC只适用于回归任务D.AUC越大说明模型一定越好答案A14.在类别不平衡场景中,FocalLoss通过下列哪种方式缓解问题?A.增加batchsizeB.调整学习率C.降低易分类样本的损失权重D.增加模型深度答案C15.关于L1正则化,下列说法正确的是?A.会趋向于产生稀疏权重B.等价于在损失中加入权重的平方和C.不会影响模型参数D.只适用于线性模型答案A16.梯度下降中,如果学习率设置过大,可能出现的情况是?A.收敛速度稳定提升B.损失震荡甚至发散C.模型参数全部变为0D.梯度自动消失答案B17.在训练神经网络时,EarlyStopping的依据通常是?A.训练集损失持续下降B.验证集指标不再改善C.测试集准确率达到100%D.模型参数量不再变化答案B18.关于交叉验证,下列说法正确的是?A.可以完全替代测试集B.将数据划分为训练/验证的多个子集并轮流验证C.只在无监督学习中使用D.会显著增加训练数据量答案B19.在数据预处理中,对特征进行Z-score标准化后,特征的均值和标准差分别是?A.0和1B.1和0C.0和0D.1和1答案A20.当数据集中存在少量极端异常值时,使用下列哪种缺失值/异常值处理方式最稳健?A.均值填充B.中位数填充C.直接删除全部数据D.不做任何处理答案B21.在图像分类数据增强中,下列哪种操作会改变图像的语义类别?A.水平翻转B.随机裁剪C.颜色扰动D.将类别标签随机修改答案D22.在目标检测任务中,IoU(交并比)的计算公式是?A.交集面积/并集面积B.并集面积/交集面积C.预测框面积/真实框面积D.真实框面积/预测框面积答案A23.在语义分割任务中,常用的评价指标是?A.mIoUB.BLEUC.PerplexityD.RMSE答案A24.在序列标注任务中,若标注序列为B-Person、I-Person、O,则“B-”前缀通常表示?A.实体的开始B.实体的结束C.非实体D.实体内部答案A25.在大语言模型微调中,LoRA的主要优势是?A.只需训练少量低秩矩阵参数B.完全重新训练所有参数C.不需要训练数据D.不使用注意力机制答案A26.在RLHF中,奖励模型(RewardModel)的训练数据通常是?A.人类对多个模型回答的偏好排序B.无标注文本C.自动生成的标签D.图像分类标签答案A27.RAG(检索增强生成)在推理时首先执行的操作是?A.根据用户问题检索相关文档B.随机生成答案C.修改模型参数D.更新知识库答案A28.下列哪种方法最适用于缓解大模型“幻觉”问题?A.增加生成随机性B.检索增强生成并引用依据C.将温度降低到0D.删除模型所有参数答案B29.模型量化(如从FP16到INT8)的直接收益通常是?A.模型精度必然提升B.推理速度和内存占用改善C.训练时间必然减少D.模型参数量减少答案B30.模型剪枝的主要目的是?A.增加模型容量B.减少冗余参数,降低计算开销C.提高训练数据质量D.消除所有误差答案B31.知识蒸馏中,学生模型训练时通常以教师模型的什么作为监督信号之一?A.输出概率分布(软标签)B.模型权重C.梯度D.超参数答案A32.联邦学习与传统集中式训练相比,核心区别是?A.原始数据不需要集中到服务器B.不使用神经网络C.不需要梯度D.必须使用GPU答案A33.差分隐私技术主要通过下列哪种方式保护个体隐私?A.向查询结果注入受控噪声B.加密所有存储数据C.删除所有数据D.限制用户访问网络答案A34.根据《个人信息保护法》,处理个人信息应当具有明确、合理的目的,并与处理目的直接相关,采取对个人权益影响最小的方式。这体现了哪项原则?A.最小必要原则B.完全自由原则C.无限收集原则D.事后追认原则答案A35.《生成式人工智能服务管理暂行办法》要求,生成式人工智能服务提供者应当对下列哪些生成内容进行标识?A.仅文本B.仅音频C.图片、视频等可能引起公众混淆的内容D.所有内部日志答案C36.在算法推荐服务中,根据《互联网信息服务算法推荐管理规定》,用户有权?A.要求删除算法B.获得便捷的关闭算法推荐服务的选项C.查看模型全部参数D.修改训练数据答案B37.关于AI模型偏见,下列说法正确的是?A.偏见只来自算法本身B.训练数据中的不平衡和偏见会被模型学习并放大C.使用更多数据一定能消除偏见D.偏见与人类无关答案B38.在模型上线后,若发现线上数据分布与训练时不一致,最合适的做法是?A.立即回滚并启动监控、评估与再训练流程B.继续观察3年C.删除线上数据D.调高学习率答案A39.在组织大型数据标注项目时,人工智能训练师(一级)最优先制定的是?A.数据标注规范与质量抽检机制B.程序员着装规范C.服务器外观设计D.会议室预订流程答案A40.在模型迭代管理中,以下哪项做法最能保证结果可复现?A.只保存最终模型文件B.同时记录训练数据版本、代码版本、超参数与环境配置C.仅记录训练集准确率D.删除历史模型答案B二、多项选择题(每题2分,共20分)1.下列属于监督学习任务的有?A.垃圾邮件分类B.房价回归预测C.图像语义分割D.用户聚类答案ABC解析用户聚类属于无监督学习,其余三项均使用有标签数据进行监督学习。2.下列哪些措施可以缓解过拟合?A.增大训练数据量B.L2正则化C.DropoutD.无约束地增加模型隐藏层数量答案ABC解析无约束地增加模型隐藏层数量通常会增大模型容量,可能加重过拟合。3.在模型评估中,下列哪些指标适用于二分类任务?A.AUCB.F1-scoreC.精确率D.R²答案ABC解析R²是回归任务常用的决定系数,不适用于二分类。4.关于Transformer,下列说法正确的有?A.包含自注意力机制B.包含位置编码C.可以并行处理序列D.不能用于自然语言处理答案ABC解析Transformer已被广泛应用于自然语言处理、计算机视觉等多类任务。5.大语言模型常见的参数高效微调方法包括?A.LoRAB.Prefix-TuningC.AdapterTuningD.全量参数微调答案ABC解析全量参数微调不属于参数高效微调,前三项均只训练少量新增或低秩参数。6.在RLHF流程中,通常包含以下哪些环节?A.收集人类偏好标注B.训练奖励模型C.使用强化学习优化策略D.直接随机初始化语言模型答案ABC解析RLHF通常基于已预训练的语言模型,而不是随机初始化模型。7.生成式人工智能服务提供者依法应当履行的义务包括?A.对训练数据进行合法性处理B.采取有效措施防止生成有害内容C.提供投诉举报途径D.公开所有用户的输入内容答案ABC解析公开用户输入内容会侵犯个人信息和商业秘密,不属于法定义务。8.高质量训练数据管理通常包含下列哪些方面?A.数据版本管理B.标注规范统一C.数据质量抽检D.隐私与合规审查答案ABCD解析高质量数据管理需要覆盖数据全生命周期,包括版本、规范、质量和合规。9.下列属于模型推理优化技术的有?A.量化B.剪枝C.算子融合D.扩大训练集答案ABC解析扩大训练集属于训练阶段措施,不能直接优化推理性能。10.在部署AI服务时,下列哪些做法有利于保障安全与合规?A.输入输出内容审核B.设置访问控制与日志审计C.对敏感信息进行脱敏D.关闭所有监控答案ABC解析关闭监控会削弱安全审计和风险溯源能力,是不合规的做法。三、判断题(每题1分,共20分)1.人工智能训练师只需关注算法模型,不需要关注训练数据的来源合法性。答案错误2.训练数据质量直接决定模型性能的上限,算法和调参只是在逼近这个上限。答案正确3.在类别不平衡时,准确率可能虚高,不能单独作为评价指标。答案正确4.所有机器学习模型在训练前都必须进行特征标准化,否则无法收敛。答案错误5.过拟合是指模型在训练数据上表现很好,但在未见数据上表现较差。答案正确6.增加训练数据量是缓解过拟合的有效方法之一。答案正确7.Dropout在模型训练时随机失活部分神经元,在推理时保留所有神经元。答案正确8.在梯度下降中,学习率越小,模型最终一定越准确。答案错误9.交叉验证可以减少因数据划分不同而产生的评估波动。答案正确10.混淆矩阵只能用于二分类,不能用于多分类。答案错误11.Transformer的自注意力机制天然包含输入顺序信息,因此不需要位置编码。答案错误12.BERT的预训练任务中包含掩码语言模型,因此它属于自回归语言模型。答案错误13.大语言模型在生成时,温度(temperature)越低,输出通常越确定。答案正确14.RLHF的目标之一是让模型输出更好地符合人类偏好。答案正确15.RAG可以在不重新训练模型的情况下引入外部知识,减少幻觉。答案正确16.模型量化后推理速度一定提升,且精度完全不受影响。答案错误17.联邦学习允许参与方在不共享原始数据的情况下协同训练模型。答案正确18.根据我国《个人信息保护法》,处理个人信息必须始终取得个人同意。答案错误解析除“告知同意”外,法律还规定了合同必需、履行法定义务、应对突发公共卫生事件等其他合法基础。19.生成式人工智能服务提供者应当对图片、视频等生成内容进行标识。答案正确20.在模型迭代过程中,只要保存最终模型文件即可,无需记录训练数据版本和超参数。答案错误四、综合案例分析题(每题10分,共20分)1.背景:某金融科技公司开发个人信贷风控模型。原始样本中逾期客户占比约2%。团队先训练了一个逻辑回归模型,在测试集上整体准确率为97%,但逾期客户召回率仅为35%。请回答:(1)为什么不能仅以准确率评估该模型?(3分)(2)应重点采用哪些评估指标?请说明理由。(3分)(3)请列举至少三种提升逾期客户召回率的可行策略。(4分)答案:(1)样本类别严重不平衡,准确率主要反映多数类(非逾期)的预测效果。即使把所有客户都预测为“非逾期”,准确率也能达到约98%,但该模型对真正需要识别的逾期客户没有实际风控价值。(2)应重点采用精确率(Precision)、召回率(Recall)、F1-score、AUC和PR-AUC等指标。信贷风控更关注少数类“逾期客户”的识别能力,其中PR-AUC对类别不平衡更加敏感,能更好反映模型在少数类上的排序性能。(3)可行策略包括:-继续收集更多逾期样本,扩充少数类数据;-使用过采样方法(如SMOTE)或欠采样方法平衡类别分布;-在损失函数中为少数类设置更高权重,或使用FocalLoss;-在模型输出阶段降低逾期类的判定阈值;-使用集成学习或异常检测方法增强对少数类的识别;-采用成本敏感学习,将漏报

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论