基于不确定性感知的主动学习在深度学习数据标注成本降低中的策略优化研究综述_第1页
基于不确定性感知的主动学习在深度学习数据标注成本降低中的策略优化研究综述_第2页
基于不确定性感知的主动学习在深度学习数据标注成本降低中的策略优化研究综述_第3页
基于不确定性感知的主动学习在深度学习数据标注成本降低中的策略优化研究综述_第4页
基于不确定性感知的主动学习在深度学习数据标注成本降低中的策略优化研究综述_第5页
已阅读5页,还剩2页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于不确定性感知的主动学习在深度学习数据标注成本降低中的策略优化研究综述深度学习模型的性能高度依赖大规模高质量标注数据,而数据标注过程通常需要耗费大量人力、时间与经济成本。以计算机视觉领域的ImageNet数据集为例,其包含超过1400万张标注图像,标注过程累计投入了数万名工作人员的工时,总成本高达数千万美元。在医疗影像、自动驾驶等专业领域,数据标注还需要从业人员具备相应的专业资质,标注成本进一步提升,部分特殊场景下单样本标注成本可达数百元。主动学习通过选择最有价值的样本进行标注,能够在保证模型性能的前提下显著减少所需标注样本量,而不确定性感知作为主动学习中样本选择的核心依据,其策略设计直接决定了主动学习的效率与成本降低效果。近年来,随着深度学习模型复杂度的不断提升以及应用场景的日益多元,基于不确定性感知的主动学习策略在适配复杂模型特性、应对多样化数据分布、降低标注成本等方面涌现出大量研究成果,对该领域的研究脉络与最新进展进行系统梳理,能够为后续进一步优化标注成本控制策略提供理论参考与实践指引。一、不确定性感知的核心内涵与度量方法不确定性是指深度学习模型对样本预测结果的可信度水平,反映了模型在当前参数状态下对该样本信息的掌握程度。在主动学习框架中,不确定性越高的样本通常蕴含越多模型尚未学习到的信息,对这些样本进行标注能够为模型带来更大的性能提升,从而实现“每一份标注成本都产生最大收益”的目标。深度学习中的不确定性通常被划分为两类:一类是数据本身固有的随机性导致的偶然不确定性(AleatoricUncertainty),这类不确定性无法通过增加训练数据消除,通常由数据噪声、类间边界模糊等因素导致;另一类是模型参数未被充分训练导致的认知不确定性(EpistemicUncertainty),这类不确定性可以通过补充相关标注样本降低,是主动学习重点关注的不确定性类型。目前主流的不确定性度量方法可以分为三类:基于置信度的度量方法、基于不一致性的度量方法以及基于信息论的度量方法。基于置信度的度量方法是最直观的不确定性计算方式,直接使用模型对样本预测输出的概率分布进行计算,常见指标包括置信度(最大预测概率)、边际置信度(最大预测概率与次大预测概率的差值)、熵(预测概率分布的信息熵)等。这类方法的优势是计算成本极低,无需对模型进行额外改造,仅需通过一次前向传播即可得到结果,因此在早期主动学习研究中被广泛应用。但这类方法的缺陷也十分明显:深度学习模型通常存在过度自信问题,即使对错误预测也可能输出极高的置信度,导致不确定性度量结果失真。基于不一致性的度量方法通过多个模型或者同一模型的多个不同状态对同一样本的预测结果差异来衡量不确定性,核心假设是模型对同一个样本的预测结果差异越大,不确定性越高。常见的实现方式包括集成学习方法(训练多个不同初始化、不同结构的模型组成集成,计算多个模型预测结果的方差或者互斥度)、蒙特卡洛dropout方法(在模型推理阶段保持dropout层开启,通过多次前向传播得到多个预测结果,计算结果的不一致性)、多任务学习方法(利用多个相关任务的预测结果差异衡量不确定性)等。这类方法能够在一定程度上缓解模型过度自信的问题,度量结果的可靠性显著优于基于置信度的方法,是当前不确定性度量的主流方案。其不足在于需要多次前向传播,计算成本相比单模型单预测的方式提升了数倍至数十倍,在大规模数据场景下会增加主动学习的计算开销。基于信息论的度量方法则从信息增益的角度出发,将不确定性定义为标注该样本后能够为模型带来的信息量提升,常见指标包括贝叶斯主动学习差异(BALD)、预期信息增益等。这类方法不仅考虑了模型对样本的预测不确定性,还考虑了样本标注后对模型参数更新的潜在影响,理论上更贴合主动学习“选择最有价值样本”的核心目标。但这类方法通常需要基于贝叶斯神经网络框架实现,计算复杂度更高,在大规模深度模型上的落地难度较大,目前更多应用于小规模模型或者特定场景的主动学习任务中。二、基于不确定性感知的主动学习基础流程与成本构成基于不确定性感知的主动学习系统通常由五个核心模块构成:未标注数据池、初始标注数据集、深度学习模型、不确定性评估模块、标注者接口。其标准工作流程为:首先从未标注数据池中随机选择少量样本进行标注,构成初始训练集,用其训练得到初始模型;之后进入主动学习循环:使用不确定性评估模块对所有未标注样本进行不确定性打分,选择得分最高的一批样本提交给标注者进行标注,将新标注的样本加入训练集后重新训练模型;重复上述循环,直到模型性能达到预设阈值或者标注预算耗尽。在整个主动学习流程中,总成本主要由三部分构成:第一部分是样本标注成本,即支付给标注者的人力成本,这是总成本的核心组成部分,通常占比超过80%,也是主动学习主要试图降低的成本类型;第二部分是计算成本,包括模型训练成本、不确定性评估成本、样本选择策略的计算开销等,随着模型规模的增大,这部分成本的占比在逐年上升;第三部分是交互成本,包括样本筛选、标注结果校验、数据格式转换等流程产生的管理成本,在专业领域标注场景下这部分成本也不容忽视。早期主动学习研究通常只关注如何减少标注样本数量以降低标注成本,而忽略了计算成本与交互成本的上升,导致部分理论上高效的策略在实际落地时总成本反而高于随机采样标注,这也成为近年来策略优化研究重点解决的问题。传统基于不确定性感知的主动学习策略在实际应用中存在三个明显的性能瓶颈:首先是不确定性评估偏差问题,在主动学习的早期阶段,模型训练不充分,不确定性度量结果的可靠性较低,容易选择大量噪声样本或者冗余样本,导致标注成本浪费;其次是样本多样性缺失问题,仅基于不确定性选择样本容易集中选择某一类或者某几类靠近决策边界的样本,导致训练集分布偏移,模型在类别分布失衡的情况下性能提升受限,反而需要更多标注样本才能达到预期效果;最后是冷启动问题,初始阶段模型性能较差,无法提供可靠的不确定性估计,导致前几轮主动学习的样本选择效率接近随机采样,浪费了初始标注预算。这些瓶颈问题的存在,使得传统主动学习策略的实际成本降低效果通常只有理论预期的50%-70%,仍有较大的优化空间。三、不确定性感知主动学习的策略优化方向(一)不确定性度量方式的适配优化针对不同模型结构与任务场景设计适配的不确定性度量方式,是提升样本选择效率的首要优化方向。针对大语言模型这类生成式模型,传统基于分类概率的不确定性度量方法不再适用,研究人员提出了基于输出序列一致性的度量方法,通过多次采样生成多个候选输出,计算不同输出之间的语义相似度、编辑距离等指标衡量不确定性,在文本分类、摘要生成等任务的主动学习场景下,相比随机采样能够降低40%以上的标注成本。针对计算机视觉领域的Transformer模型,研究人员发现注意力权重的分布也能够反映模型对样本的不确定性,注意力权重越分散,说明模型无法聚焦于样本的关键区域,不确定性越高,基于注意力权重的不确定性度量方法相比传统熵度量方法,在图像分类任务上的样本选择效率提升了15%-20%。针对标注成本极高的专业领域场景,研究人员提出了分层不确定性度量策略,首先使用轻量级模型对所有未标注样本进行粗粒度的不确定性筛选,过滤掉明显低价值的样本,之后再使用高精度但计算成本更高的度量方法对剩余样本进行细粒度评估,在几乎不损失样本选择精度的前提下,将不确定性评估的计算成本降低了80%以上。例如在医疗影像标注场景中,首先用轻量级CNN模型对所有CT影像进行初筛,排除90%模型确定性极高的正常样本,之后对剩余10%的样本使用蒙特卡洛集成方法进行精细的不确定性评估,整体计算开销仅为直接使用集成方法的12%,大幅降低了主动学习的计算成本。(二)不确定性与多样性的联合优化仅基于不确定性选择样本容易导致训练集分布偏移,因此近年来的研究普遍将样本多样性作为与不确定性同等重要的选择指标,通过二者的联合优化平衡“信息价值”与“分布代表性”。常见的联合优化策略可以分为两类:一类是两阶段选择策略,首先基于不确定性筛选出高不确定性候选集,之后在候选集中使用聚类、覆盖度优化等方法选择具有多样性的样本,既保证了所选样本的信息价值,又避免了样本冗余。另一类是统一打分策略,将多样性指标与不确定性指标进行加权融合,得到综合的样本价值得分,直接基于综合得分进行样本选择。在多样性度量方面,早期研究通常使用样本特征的余弦相似度、欧氏距离等度量方式,随着对比学习的发展,研究人员开始使用预训练模型提取的语义特征进行多样性计算,能够更好地捕捉样本之间的语义差异,避免将语义相似但表层特征差异大的样本判定为多样性样本。例如在自然语言处理任务中,使用BERT模型提取的<[BOS_never_used_51bce0c785ca2f68081bfa7d91973934]>语义特征计算样本相似度,相比传统TF-IDF特征,能够更准确地识别语义冗余的高不确定性样本,进一步降低20%左右的标注成本。此外,针对类别不平衡的任务场景,研究人员还提出了类别感知的多样性约束,在样本选择时保证每个类别都有一定比例的样本被选中,避免模型过度关注高不确定性的少数类别,提升了模型在全类别上的性能表现,在类别不平衡比例达到10:1的场景下,相比仅基于不确定性的选择方法,标注成本降低效果提升了30%以上。(三)冷启动阶段的策略优化针对主动学习早期模型性能不足导致的不确定性评估不可靠问题,研究人员从两个方向提出了优化方案:第一个方向是引入半监督学习与自监督学习方法,在初始阶段利用大量未标注数据提升模型性能,为后续的不确定性评估提供更可靠的基础。例如在主动学习启动前,首先使用自监督学习方法在所有未标注数据上进行预训练,得到的初始模型相比随机初始化模型,不确定性评估的准确率提升了40%以上,前两轮主动学习的样本选择效率接近模型充分训练后的水平,大幅降低了冷启动阶段的标注成本浪费。第二个方向是引入先验知识指导初始样本选择,例如对于图像分类任务,根据数据的来源、采集时间、设备类型等元信息进行分层采样,保证初始训练集能够覆盖尽可能多的分布模式,或者利用领域知识选择具有代表性的核心样本作为初始标注集,相比随机选择初始样本,能够让初始模型获得更高的起点,减少后续主动学习的迭代轮次。还有研究提出了动态不确定性阈值策略,在主动学习的不同阶段使用不同的不确定性选择标准,在冷启动阶段适当降低不确定性阈值,选择更多样本进行标注,同时引入标注质量校验机制,对高不确定性样本的标注结果进行二次校验,避免错误标注样本影响模型训练,虽然小幅增加了单样本的标注成本,但整体标注成本仍比传统固定阈值策略低15%左右。(四)标注成本感知的差异化选择策略传统主动学习策略通常假设所有样本的标注成本相同,但在实际场景中不同样本的标注成本差异巨大。例如在目标检测任务中,包含多个目标的复杂图像的标注成本是仅包含单个目标的简单图像的3-5倍;在医疗影像标注中,疑难病例的标注需要专家花费数十分钟,而普通病例的标注仅需要几分钟。因此,近年来的研究开始将样本标注成本纳入样本价值评估体系,提出了“单位成本信息增益”的评估指标,即选择每单位标注成本能够带来最大模型性能提升的样本,而不是单纯选择不确定性最高的样本。这类策略的实现方式是首先建立样本标注成本预测模型,根据样本的复杂度、长度、包含目标数量等特征预测其标注成本,之后将不确定性得分除以预测标注成本,得到单位成本价值得分,基于该得分进行样本选择。在实际应用中,这类策略能够在相同标注预算下获得比传统策略更高的模型性能,或者在达到相同模型性能时降低25%-40%的总标注成本。部分研究还进一步提出了动态标注分配策略,将简单样本分配给普通标注者,将高不确定性的复杂样本分配给专家标注者,在保证标注质量的前提下,进一步降低整体标注成本。四、当前研究的挑战与未来发展方向尽管基于不确定性感知的主动学习策略已经在多个领域实现了标注成本的显著降低,但当前研究仍面临三个主要挑战:首先是大模型时代的适配挑战,大模型的训练成本极高,传统主动学习每轮迭代都重新训练模型的方式会导致计算成本大幅上升,甚至超过标注成本的降低幅度,如何设计无需频繁全量微调的主动学习策略是当前研究的热点问题;其次是开放世界场景的适配挑战,在开放集识别、增量学习等场景下,数据分布会不断发生变化,不确定性度量需要同时应对分布外样本、新类别样本等复杂情况,传统度量方式的可靠性大幅下降;最后是多模态场景的适配挑战,多模态数据的不确定性来源更加复杂,文本、图像、音频等不同模态的不确定性如何融合、如何基于多模态不确定性选择最有价值的样本,仍缺乏成熟的解决方案。未来该领域的研究将主要沿着四个方向推进:一是面向大模型的轻量级主动学习策略,研究基于参数高效微调、提示学习等技术的主动学习框架,降低模型迭代的计算成本,实现“标注成本-计算成本”的整体最优;二是融合多重信号的不确定性评估体系,将不确定性度量与样本难度、标注成本、分布代表性等多重信号深度融合,实现更精细化的样本价值评估;三是人机协同的主动学习框架,将标注者的反馈信息纳入不

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论