2026年人工智能训练师竞赛实操试题_第1页
2026年人工智能训练师竞赛实操试题_第2页
2026年人工智能训练师竞赛实操试题_第3页
2026年人工智能训练师竞赛实操试题_第4页
2026年人工智能训练师竞赛实操试题_第5页
已阅读5页,还剩8页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年人工智能训练师竞赛实操试题本次实操竞赛总时长180分钟,满分100分,选手入场后需核验身份,统一使用竞赛组委会预置的云端算力平台(算力配置:单卡A10080G显存、16核vCPU、64G运行内存、1T高速存储,预装Python3.10、PyTorch2.2、TensorFlow2.15、LabelStudio1.12、LangChain0.2、LLaMAFactory0.8、Weights&Biases0.17、FAISS1.8、TensorRT8.6等标准化工具集,禁止外接存储设备、禁止访问公网,所有操作均需在指定工作目录下完成,提交内容需按要求命名存放,未按规范提交的内容不计分。模块一:多模态训练数据集构建与标注(分值30分,时长45分钟)本模块聚焦人工智能训练师核心基础能力,考察数据清洗、标注规则落地、质量校验的全流程操作能力,所有预置数据均来自真实政务、电商、工业场景脱敏数据,无人工构造的极端样本。子任务1:低质量数据清洗(10分)任务说明:组委会预置了12000条多模态图文对数据集,涵盖工业质检(4000条)、电商营销(4000条)、政务咨询(4000条)3个场景,其中包含15%的低质量数据,具体问题类型及判定标准如下:1.图文不匹配:图片内容与文本描述的主体、属性匹配度低于60%;2.文本存在敏感违规内容:包含涉政、涉恐、涉黄、涉赌、涉诈、恶意引导、虚假宣传等违反《互联网信息服务管理办法》的内容;3.图片分辨率低于320*320或长宽比超过5:1;4.文本重复冗余:同一文本对应不同图片的重复次数≥3次,或文本无效字符占比≥20%;5.图片存在水印/遮挡/模糊:SSIM结构相似性值低于0.7,或核心主体遮挡占比≥30%,或存在第三方平台logo、联系方式等商业水印。要求选手完成全量数据集的自动化清洗规则编写+人工抽检校准,清洗后数据的准确率需≥99%,召回率≥98%。操作要求:1.编写Python脚本实现自动化初筛,脚本需为每类低质量数据添加注释说明识别逻辑,输出初筛后的有效数据集、低质量数据集分类清单(清单需包含数据ID、低质量类型、判定依据3个字段);2.从初筛后的有效数据中随机抽取5%的样本完成人工校验,修正初筛误差,输出最终清洗后的数据集、校验报告,报告需包含每类低质量数据的占比统计、初筛误差原因分析、修正方案说明3部分核心内容。评分标准:清洗准确率每低于99%1个百分点扣2分,扣完为止;召回率每低于98%1个百分点扣2分,扣完为止;脚本逻辑不清晰、无注释每处扣1分,最多扣3分;校验报告缺失核心内容每缺一项扣2分,最多扣6分;未按时完成本模块任务本项不得分。子任务2:精细化标注与标注质量校验(20分)任务说明:从清洗后的3个场景数据中各抽取200条样本,完成多维度标注,标注规则如下:1.工业质检场景:需标注缺陷类型(裂纹/变形/色斑/异物4类)、缺陷位置边界框(交并比≥0.9为合格)、缺陷严重等级(轻微/一般/严重3级,判定标准为缺陷占比<5%为轻微,5%-20%为一般,>20%为严重);2.电商营销场景:需标注商品3级类目(共12个预设类目,标注与标准类目匹配度≥90%为合格)、商品核心属性(材质/功能/规格/适用人群4项,漏标、错标1项即为不合格)、营销文案合规性(合规/虚假宣传/低俗违规3类,判定标准参考《广告法》《网络直播营销管理办法》);3.政务咨询场景:需标注咨询意图分类(15个预设意图标签,匹配度≥90%为合格)、问题匹配的政策条目ID(共200条预设政策条目,错标即为不合格)、答复友好度评分(1-5分,得分与预设标准分差值≤1为合格)。标注完成后需完成跨标注员一致性校验,组委会预置了3名标注员的同批样本标注结果,要求选手计算Cohen'skappa系数,输出标注质量报告,对kappa系数低于0.8的标注项给出修正方案。操作要求:1.在LabelStudio中配置对应标注模板,完成600条样本的标注,标注过程需留存平台自动生成的操作日志,不得篡改日志内容;2.编写Python脚本计算3名标注员的标注一致性kappa系数,识别标注歧义项,输出标注质量分析报告,报告需包含一致性统计数据、歧义项分类、修正规则说明3部分核心内容。评分标准:标注准确率每低于95%1个百分点扣1分,扣完为止;kappa系数计算错误扣5分;标注模板配置不符合要求每处扣2分,最多扣6分;质量报告缺失核心内容每缺一项扣3分,最多扣9分;存在恶意标注、篡改预置数据的行为本项不得分。模块二:大语言模型垂直场景微调与效果优化(分值35分,时长60分钟)本模块考察大模型高效微调、RAG检索增强、推理加速的实操能力,所有预置模型权重、数据集均为合规授权内容,选手无需关注版权问题。子任务1:微调数据集处理与训练参数配置(12分)任务说明:组委会预置了政务咨询场景的12000条单轮对话标注数据集、Llama-3-7B基础模型权重,要求选手完成微调数据集的格式化处理,采用QLoRA高效微调方法完成政务咨询问答模型的训练。操作要求:1.将标注数据集转换为Alpaca格式,按8:1:1比例拆分训练集、验证集、测试集,拆分时需保证各意图标签的分布与全量数据集一致,输出格式化后的数据集文件;2.在LLaMAFactory中配置微调参数,要求显存占用不超过40G,训练轮次不低于3轮,学习率设置在2e-4到5e-4区间,LoRA秩设置为8-64区间,保存训练过程中的loss曲线、验证集准确率曲线,输出参数配置说明文档,说明各参数选择的依据。评分标准:数据集格式错误每处扣1分,最多扣3分;拆分比例不符合要求、标签分布偏差超过10%扣3分;显存占用超出阈值每超出5G扣2分,最多扣4分;参数配置无合理依据每处扣2分,最多扣4分;未留存训练过程曲线扣3分;未按时完成本模块任务本项不得分。子任务2:模型效果优化与推理加速(23分)任务说明:基于微调后的模型完成效果优化,要求模型在测试集上的准确率≥92%,推理速度≥30token/s,对敏感问题的拒答率≥100%(预置200条敏感测试用例,全部拒答即为达标)。组委会预置了2023-2025年本地政务政策文档共1200篇作为RAG检索知识库。操作要求:1.针对验证集中的badcase进行针对性优化,可采用补充微调样本、调整prompt模板、加入RAG检索增强模块3种方式,其中RAG模块需完成文本切分(块大小要求在256-512token之间,重叠率10%-15%)、向量化(采用bge-large-zh-v1.5embedding模型)、向量库构建,优化后输出测试集评估报告,报告需包含准确率、F1值、平均响应时长、拒答率4项核心指标;2.采用4bit量化+TensorRT推理加速方案对模型进行压缩,输出量化后的模型权重、推理速度测试报告,对比量化前后的指标变化,说明精度损失控制方案。评分标准:测试集准确率每低于92%1个百分点扣2分,扣完为止;推理速度每低于30token/s1个单位扣1分,最多扣5分;敏感问题拒答率未达100%每漏答1条扣1分,最多扣10分;RAG模块配置错误扣5分;量化后精度损失超过2%扣4分;优化方案无数据支撑每处扣2分,最多扣4分;未按时完成本模块任务本项不得分。模块三:RLHF人类反馈对齐与落地适配(分值25分,时长50分钟)本模块考察人类反馈对齐、边缘端模型适配、内容风险防控的实操能力,贴合产业落地的真实需求。子任务1:奖励模型训练与PPO对齐(14分)任务说明:组委会预置了微调后政务模型输出的5000条答复的人类排序标注数据(每条query对应3条答复,按质量从高到低排序,排序依据为答复准确性、合规性、友好度3个维度),要求选手完成奖励模型训练,基于PPO算法完成模型对齐,对齐后模型的答复满意度需≥90%(预置1000条测试用例,满意度由组委会预置的评判模型自动打分)。操作要求:1.基于Llama-3-7B基础模型训练奖励模型,损失函数采用排序损失(RankLoss),奖励模型在验证集上的排序准确率≥95%,输出奖励模型训练报告,包含loss曲线、排序准确率指标;2.采用PPO算法完成生成模型与人类反馈的对齐,PPO训练的学习率要求设置在1e-6到1e-5之间,KL散度阈值设置在0.05到0.2之间,输出对齐后的模型权重、测试集满意度评估报告,说明对齐前后的答复质量变化、存在的问题及优化方向。评分标准:奖励模型排序准确率每低于95%1个百分点扣2分,扣完为止;对齐后满意度每低于90%1个百分点扣2分,扣完为止;PPO参数配置不符合要求扣4分;报告缺失核心指标每缺一项扣2分,最多扣6分;未按时完成本模块任务本项不得分。子任务2:边缘端部署适配与风险防控(11分)任务说明:要求将对齐后的模型适配到ARM架构的边缘终端(算力配置:4核Cortex-A76、8G内存、支持NPU加速),适配后模型在边缘端的推理速度≥15token/s,精度损失≤3%,同时配置内容安全审核模块,对用户输入、模型输出的违规内容实现100%识别拦截。操作要求:1.采用ONNX格式转换+NPU算子适配完成模型轻量化转换,输出适配后的模型文件、边缘端推理测试报告,对比云端、边缘端的准确率、推理速度、内存占用指标差异;2.配置前后置内容安全审核规则,涵盖涉政、涉恐、涉黄、涉诈、虚假宣传5类违规内容,输出审核规则说明文档,提交20条违规测试用例的拦截结果。评分标准:边缘端推理速度每低于15token/s1个单位扣1分,最多扣3分;精度损失超过3%扣3分;违规内容拦截率每低于100%1个百分点扣2分,最多扣4分;适配文档缺失核心内容扣2分;未按时完成本模块任务本项不得分。模块四:项目复盘与落地方案输出(分值10分,时长25分钟)任务说明:基于前面三个模块的操作,输出完整的政务咨询AI服务落地实施方案,方案需包含数据集迭代机制、模型优化路径、算力成本核算、风险防控体系4个核心部分,要求方案具备可落地性,成本核算数据准确,核算标准如下:算力成本按A100卡每小时12元、边缘终端单台每年300元计算,数据标注成本按每条0.8元计算,服务规模按覆盖100万常住人口、日均咨询量10万次计算,运维人力成本按每人每年15万元计算,年度迭代次数不低于4次。操作要求:方案字数不少于1000字,数据准确,逻辑清晰,无冗余内容,采用PDF格式提交。评分标准:核心模块每缺一项扣2分,最多扣8分;成本核算错误每处扣2分,最多扣4分;方案不具备可落地性扣3分;内容逻辑混乱扣2分;未按时完成本模块任务本项不得分。提交规范与违规判定1.提交规范:所有提交内容需存放在以选手编号命名的根目录下,下设4个子目录分别对应4个模块的提交内容,每个子目录下需包含代码文件(带注释)、数据集文件、报告文档(PDF格式)、模型权重(仅需提交QLoRA权重、奖励模型权重、对齐后的模型权重、边缘端适配后的模型权重,基础模型权重无需提交),所有内容压缩为ZIP格式,压缩包大小不超过10G,提交后无法修改。2.

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论