基于检验数据的机器学习临床模型开发与应用专家共识总结2026_第1页
基于检验数据的机器学习临床模型开发与应用专家共识总结2026_第2页
基于检验数据的机器学习临床模型开发与应用专家共识总结2026_第3页
基于检验数据的机器学习临床模型开发与应用专家共识总结2026_第4页
基于检验数据的机器学习临床模型开发与应用专家共识总结2026_第5页
已阅读5页,还剩26页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于检验数据的机器学习临床模型开发与应用专家共识总结2026机器学习(machinelearning,ML)从大规模数据中学习复杂模式、识别潜在关联并构建预测模型,实现对检验结果的精准解释。该技术在疾病早期筛查、辅助诊断、风险分层和预后评估中具有应用价值,并为推动个性化医疗提供了辅助工具

1,2,3,4,5]

。当前,随着算法、算力和数据的协同进化,ML的发展呈现出多学科协作、多模态数据融合、可解释性增强、对伦理问题的关注以及模型轻量化与边缘计算等趋势。ML可通过分析患者既往的检验数据,结合临床信息,预测未来检验指标变化,可识别出不同疾病亚型,可评估患者的生存概率、复发风险等

6,7]

。基于检验数据的ML临床预测/诊断模型,为提升医疗服务质量带来了新契机,但也面临多方面的挑战:(1)技术层面:在模型开发过程中,数据偏差、样本量不足、标签标注错误或群体代表性缺失,可能导致模型训练结果偏离真实情况,影响诊断准确性

8,9]

。算法可解释性差,限制了诊断依据的透明化,医生难以判断结果的可靠性

10]

。此外,模型容易出现过拟合现象,导致泛化能力下降,且难以满足临床动态的监测需求

11]

。(2)数据安全和伦理层面:在收集、存储、传输和使用过程中,隐私泄露风险客观存在;算法可能因数据偏倚产生歧视,导致特定亚群误诊率上升

7]

;自动化决策引发的医疗责任归属争议,也是亟需解决的伦理问题。(3)数据生态层面:当前医疗机构间数据标准尚未完全统一,数据孤岛现象依然存在,这使得构建多中心、高质量的训练数据集面临困难,限制了数据多样性和规模,制约模型泛化能力的提升,影响ML的应用潜力

9,10,12]

。为确保ML有效规范地应用于临床实践,应明确其应用场景,规范其应用流程,以更好地推进其临床实践,将检验数据转化为可利用的知识,实现疾病的早期诊断、准确预后判断和科学风险评估,从而提高医疗诊疗质量和效率,降低患者医疗费用。鉴于此,中华医学会检验医学分会联合中国健康管理协会检验医学分会组织相关领域专家,结合现有研究证据及国内外实践经验,制订了基于检验数据的ML临床模型开发与应用专家共识。本共识适用于基于多维度、多模态检验大数据构建的监督ML模型,旨在为医学检验专业人员、医院管理及研发团队、行业企业及监管机构提供开发与应用规范,覆盖疾病辅助诊疗、数字生物标志物及科研创新等核心场景。本共识所述ML临床模型仅作为辅助工具,不应在未经人工复核的情况下直接替代临床诊断,严禁高风险场景下的完全自动化临床决策。新一代人工智能技术日新月异,推荐意见可能被新技术所替代。医疗机构应严格遵守医学伦理与医疗器械监管法规,通过规范全流程的质量管理与数据合规,有效防范临床应用风险,推动检验医学领域数智化转型的科学、规范与可持续发展

13]

。一、共识制订方法(一)共识制订方法本共识制订遵循世界卫生组织和中华医学会制订/修订指南的基本方法及程序。在广泛征求专家组成员意见基础上,经归纳整理和讨论后,明确共识需要解决的核心问题,围绕ML在检验医学应用中的重要性、适用人群、建立方法与临床应用等方面,结合国内外最新循证医学证据与临床实践,通过多轮专家会议讨论与修订,最终确定了22条推荐意见。在制订这些推荐意见时,专家组采用基于证据的方法,利用临床实践数据进行分析制订推荐意见,相关文献检索覆盖PubMed、WebofScience、中国知网和万方等数据库。英文检索词包括“machinelearning”“diagnosticmodel”“predictivemodel”“artificialintelligence”等,中文检索词包括机器学习、诊断模型、预测模型、人工智能等。纳入标准:涵盖临床预测模型开发、验证、评估、算法风险管理,以及检验医学ML应用相关的系统评价、指南、专家共识、临床研究及方法学文献;排除标准:检验医学临床应用场景无关的ML研究。文献检索时间为各数据库建库至2025年10月31日。(二)专家遴选本共识由中华医学会检验医学分会联合中国健康管理协会检验医学分会组织编写,遴选来自全国大型综合医疗机构或研究机构的专家共61名,其中执笔专家12名、专家组成员49名,分别负责循证文献调研、共识的起草与修订,互审和定稿。执笔专家及专家组成员涵盖人工智能、ML、检验大数据等检验与计算机领域,具备相关ML算法的建立、实施、优化及管理经验,为本共识的制订提供了工作基础和技术支持。(三)循证过程及结果1.循证方法:共召开5次线上和2次现场专家研讨会及2轮征求意见函询。启动会论证了共识的临床需求、须解决的重点问题和最终目标。专家就循证结果对共识草案内容提出意见、建议,包括证据来源、证据强度、推荐意见和修改意见等,正文经过6轮修订,通过函询获得的意见和建议,由全体专家充分讨论。专家组对有争议及不确定或不同意的问题进行公开讨论改进、逐一调整和反馈,每次讨论后的修改稿均递交专家组再次审阅,最后形成共识审阅稿。2.制订征求意见函:基于共识第1稿和第2稿,设计专家征求意见函,每条推荐意见有同意、不确定、不同意3个选项,后两项需提供原因说明;采用问卷星对专家组进行函询;函询后组织专家会议研讨。3.函询结果:两轮函询共发放120份征求意见函,回收102份,有效回收率达到85%。专家们共提出66条修改意见,其中45条被采纳或部分采纳。(四)证据评价与推荐强度专家组根据文献的证据质量和分级,对每个推荐意见的必要性进行二次讨论,对于证据不充分的建议进行了删除。本共识的推荐意见共分为4个级别。1类推荐:选择同意的专家人数比例>90%,证据级别最高;2A类推荐:选择同意的专家人数比例为80%~90%,证据级别稍低;2B类推荐:选择同意的专家人数比例为70%~<80%,证据级别低,部分专家推荐;3类推荐:选择同意的专家人数比例<70%,专家意见存在分歧。根据推荐分级办法,专家组对更新后的共识推荐意见进行投票表决,最终形成完整的推荐意见。二、术语与定义下列术语和定义适用本共识。1.模型:一种基于输入数据或信息生成推理或预测的数学计算结构。2.算法:从数据中自动学习规律、模式或结构,并将其封装为模型的计算方法与过程。3.特征:用于模型进行预测的输入变量,可以是患者的人口学信息、临床症状、单个或多个检验指标等。4.标签:模型需要预测的目标变量,可以是疾病状态(如阳性/阴性)、疾病分期、生存时间、未来某个检验指标的具体数值等。5.数据:用于ML模型训练、验证和评估的信息记录。6.训练集:用于执行ML算法,以学习和确定模型内部参数的数据样本子集。7.验证集:在模型训练过程中,用于模型选择、超参数调优(如学习率、树的深度等)并进行初步性能评估的数据样本子集,独立于训练集。8.测试/评价集:在模型训练和验证完成后,用于内部评估模型性能的数据样本子集,在模型开发过程中应始终保持独立,不参与任何模型选择或调参过程。9.数据泄露:指在模型训练时,无意中使用了未来或真实预测场景中无法获得的信息,导致模型评估性能虚高、泛化能力显著下降的现象。10.模型训练:使用ML算法在训练数据上反复迭代,以学习数据中的模式并确定模型最优内部参数的过程。11.模型验证:对已训练模型在非训练数据上进行性能评估的过程。分为内部验证(使用源自同一数据集的独立子集进行验证,评估模型在相同医疗环境下的性能稳定性与过拟合风险)和外部验证(使用来自不同时间、不同医疗机构或不同特征的人群,评价模型的临床泛化能力)。12.模型评估:通过计算一系列性能指标[如准确性、精确率、召回率、F1分数、受试者工作特征曲线下面积(areaunderthecurve,AUC)、均方根误差等]来量化模型预测能力的过程。13.过拟合:指ML模型在训练数据上表现极好,但在新的、未见过的数据(如测试集或外部验证集)上表现下降的现象。14.超参数:是人为预设、用于指导和约束ML模型学习过程的配置选项,其最优值因数据和任务而异,需要通过训练过程来学习和调整。三、机器学习的开发路径ML模型的开发与验证是一个多阶段迭代过程,可参照国际临床化学与检验医学联合会(InternationalFederationofClinicalChemistryandLaboratoryMedicine,IFCC)、人工智能个体预后或诊断多变量预测模型透明报告指南(TransparentReportingofamultivariablepredictionmodelforIndividualPrognosisOrDiagnosis-ArtificialIntelligence,TRIPOD-AI)、人工智能预测模型偏倚风险评估工具(predictionmodelriskofbiasassessmenttool-artificialintelligence,PROBAST-AI)、欧洲临床化学和检验医学联合会(EuropeanFederationofClinicalChemistryandLaboratoryMedicine,EFLM)、美国病理学家协会(CollegeofAmericanPathologists,CAP)等指南或推荐

4,14,15,16,17]

,构建符合国际标准的检验医学模型全流程研发体系。(一)确定研究问题基于检验数据的ML预测/诊断模型,需要明确临床问题并将其转化为可建模的研究性问题。一个良好的研究问题定义应满足以下标准。1.临床需求明确,具备临床转化价值:研究问题需清晰界定模型目标,如早期筛查、辅助诊断、疗效预测、复发监测或指标异常预警

15,18]

。针对不同目标,选择适配的建模策略与变量设计:(1)早期筛查的核心价值在于识别高风险个体以实现早干预、早治疗,模型需重点关注高敏感性指标,常选用logistic回归、轻量梯度提升机等算法

19]

,并通过调整分类阈值或使用加权损失函数来优化召回率;(2)辅助诊断旨在提高疾病诊断的准确性,模型应注重可解释性,常用决策树、Lasso回归等,且变量涵盖检验指标及临床表型

20]

;(3)疗效预测侧重于预测治疗前或早期患者对特定疗法的反应,强调变量的动态变化,常引入时间序列特征进行建模;(4)复发监测价值在于动态评估治愈或病情稳定患者的复发风险,采用Cox等生存分析模型,并纳入治疗史与随访数据;(5)异常预警模型旨在提前预测关键检验指标的异常变化,为临床争取早期干预窗口,更加关注连续变量趋势,常用长短期记忆网络或极端梯度提升机等模型

21]

。最终设定的研究问题应服务于特定的临床工作场景,并具有明确的决策支持价值

15]

。模型构建前,应综合考量其能否提供新的临床参考依据、优化资源配置或提升风险预警效能。此外,需严格评估建模任务的数据敏感性与伦理风险,并履行必要的审批流程。只有当模型的预测结果具备临床可解释性、可落地性,并能对医疗行为产生正向引导时,该建模任务才具备实质性的临床意义。推荐意见1根据临床需求,设定早期筛查、辅助诊断、疗效预测、复发监测或异常预警等模型目标,选择相匹配的建模策略与变量设计,并明确模型的应用场景与部署路径,具备可实施性与临床转化潜力(1类推荐)。2.目标变量可度量,具备建模可行性:高质量建模依赖于明确且可度量的结构化标签。常见标签类型包括:(1)定量实验室指标(如血糖、肌酐):适用于回归或时间序列建模;(2)二分类结果(如病原PCR阳性/阴性):常用于早筛或复发预测;(3)分级/多分类诊断:用于辅助诊断或亚型分类;(4)时间事件数据(如诊断至复发、生存时间):适合生存分析建模(如Cox等);(5)动态事件判定(如3个月内血钾>5.5mmol/L):用于异常预警;(6)病原体及耐药谱结果:支持抗感染治疗。标签应具有医学意义和技术可行性。研究问题的设定还需结合数据资源的可及性,确保样本量与变量信息以支撑模型开发。优先筛选在常规流程中易获取、标准化程度高且质量可靠的指标作为核心变量或结局变量。若数据分布严重失衡、变量缺失比例较高或样本量不足,则需适当调整研究设计,或考虑先行数据采集与补充性研究。多中心数据中如存在标签异质性,应统一定义或构建子模型以降低偏倚,确保模型构建的准确性、可重复性与临床可推广性。推荐意见2应评估变量采集的可行性与样本量需求,优先选择在临床实践中可稳定获取、质量可靠、标准化程度高且临床意义明确的检验指标作为模型结局与核心变量,并在多中心研究中统一标签定义与数据标准(1类推荐)。3.预测时间窗合理,满足因果关系方向:研究问题应遵循因果推断原则,确保预测变量在时间序列上先于结局变量,严禁纳入未来信息而造成信息泄露

22]

。建模时需明确“预测时间点”,并合理界定与“观察窗口”(特征提取的时间段)和“预测窗口”(结局发生的时间段)。模型预测性能与临床实用性往往存在权衡:观察窗口越长或越接近结局发生时间,模型准确率通常越高;但为了给临床干预预留时间,必须设置合理的“提前期/盲期”。例如,在预测脓毒症休克时,若仅预测“未来1h”,虽准确率高但临床无暇处理;若预测“未来24h”,则干预价值大但难度剧增。建议遵循的操作原则:(1)设立“盲期”:在观察窗口结束与预测窗口开始之间设置一段“盲期”,以模拟真实的临床决策场景并防止结局信号泄露。(2)差异化设定:不同疾病特性决定时间设定策略。慢性病(如糖尿病风险)适合较长的纵向数据,如设置1~3年的观察窗口,预测未来5~10年的风险,以捕捉长期趋势;急性疾病(如急性肾损伤、急性心梗)需采集高频时序数据(24~72h),以捕捉病情的动态瞬时恶化。(3)变量冻结:严格屏蔽预测时间点之后产生的所有数据(如确诊后的药物使用、复查指标)。推荐意见3应明确界定“预测时间点”与“观察窗口”和“预测窗口”,充分权衡临床干预所需时间与疾病演变规律,并严格执行时间截断以确保因果顺序的科学性(2B类推荐)。(二)数据收集与准备从数据收集与准备开始,到模型训练与解释,再到外部验证与应用,流程见

图1

4,14,15,16,17]

。其中,数据质量是构建可靠ML预测模型的基石。数据的来源、收集方式和检测目的等因素会影响数据的质量,应在数据采集前制定多维数据管理计划(datamanagementplan,DMP),来保证数据质量,提高研究的可靠性和重复性。DMP涵盖数据全生命周期管理规范,需估算样本量,明确研究中需要收集的变量,包括预测变量和结局变量。图1

基于检验数据的机器学习模型构建及验证流程1.数据集分类:数据集分为开发集和验证集。开发集通过随机抽样(如按7∶3或8∶2比例)或K折交叉验证分为训练集和测试集。验证集分为内部验证集和外部验证集。为保障研究的可复现性,应在方法学中报告严格的随机化流程,并记录设定的随机种子。防止数据泄露是数据拆分与建模过程中的核心质量控制点,常见的错误场景有

22]

:(1)数据集之间未保持独立性:同一患者或重复样本被同时分配至训练集和测试集;在全体数据集上统一进行标准化、归一化、缺失值填补或特征筛选;基于测试集结果优化模型参数或调整研究设计。(2)目标变量不独立:预测变量包含预测时间点之后产生的信息;自变量中包含可直接推断目标变量的信息,如ID、时间戳等;或因列名错误、逻辑混淆而误将目标变量本身作为自变量。所有数据集子集之间严禁共享,应提供各子集的人口学及检验数据的描述性统计结果,以展示数据分布的均衡性。推荐意见4构建明确的开发集和验证集,开发集按科学比例拆分为训练集与测试集,验证集包含内部和外部验证集,且各数据集间应规避数据泄露风险(1类推荐)。2.样本量估算:样本量估算是模型开发中保障统计效能与模型稳健性的关键环节。样本量设计需充分考虑研究目的、模型复杂性及候选变量数量。开发集样本量估算的方法主要包括

8,14,15]

:(1)经验原则法:建议每个候选预测变量至少需对应10个目标结局事件。每个预测参数至少需对应10个结局事件。样本量不仅与预测参数相关事件的数量有关,还受目标人群中结局事件的发生率以及模型预期预测性能的影响。(2)逐步估计法:旨在通过统计学功率计算,综合考量以下4个维度取最大值:①实现模型准确估计结局的发生率所需的样本量,即可信区间法;②使得模型预测误差最小的样本量;③最小化过度拟合需要的样本量;④满足模型参数优化所需的统计稳定性。R语言中的pmsampsize是逐步估计法实现的工具,需预先给出结局发生率、候选预测参数数量、预期模型性能、允许过拟合程度等信息。但确定研究问题时,这些信息未知或不准确,影响样本量估算的准确性。验证集的样本量一般应占总样本的20%~30%,推荐验证集至少包含100例阳性事件和100例非阳性事件。针对低事件率或特定亚组分析,应报告性能指标的95%置信区间,若置信区间过宽提示验证结果精确度不足。若样本量不足,可采用自助法或重复K折交叉验证替代单一划分,以通过重抽样技术获得更稳健的性能估计及置信区间。推荐意见5研究设计时依据经验原则法或逐步估计法估算所需的最少样本量(2A类推荐)。3.数据收集:数据收集与预处理需遵循可发现(findable)、可访问(accessible)、可互操作(interoperable)、可重用(reusable)的FAIR原则,且满足多维度质量指标,如相关性、代表性、准确性、完整性、规模性、稳定性、合规性和可及性等

4]

。数据收集包含开发集和验证集,两者在时间和空间上应不同。建立高质量数据集的第一步就是确定变量,明确研究中需要收集的所有变量,包括预测(或特征)变量和结局(或目标)变量。预测变量中的数据用于预测结局变量,常见类型及测量注意事项见

表1

。预测变量的选择应考虑成本、测量先于预测时间点、和结局变量无关等。结局变量应注意明确性、可靠性、时间相关性、与预测变量独立性和数据稀疏性,常见类型及适用场景见

表2

。基于检验数据的模型开发中,数据变异性是一个核心挑战,它主要源于生物学因素(如个体内和个体间波动)和分析因素(如测量方法、仪器和试剂的差异)

23,24,25]

。这种变异性会引入显著的“噪声”,若处理不当,易导致模型过度拟合、泛化能力下降,并在跨中心或时间推移的应用中失效。数据收集时,需量化并报告检验数据的生物学与分析变异系数,确保模型在实际实验室变异下的鲁棒性与可靠性。推荐意见6应制定全生命周期的数据管理计划,遵循FAIR原则选择预测和结局变量,报告检验数据的变异性(1类推荐)。为保障ML模型在预测或诊断中的公平性,需考虑人口统计学和社会学特征,优先构建并使用具有广泛代表性的数据集

4,14]

。数据收集及处理流程,严格遵循医学伦理要求,应通过机构伦理委员会审批。在特定条件下,经所在机构伦理委员会评估并获得书面批准后,可豁免知情同意,包括:(1)研究对受试者个人风险极低且不涉及临床干预;(2)研究具有明确的临床医学价值;(3)采取匿名化或去标识化处理以确保隐私安全。通过汇聚多中心、多来源的检验数据,构建具备代表性和多样性的数据集,是训练高性能ML模型的关键。为提升模型的临床泛化能力,数据集构建应遵循样本代表性原则,明确界定目标人群特征并详细记录样本来源的临床背景,以规避转诊及幸存者偏差等系统性选择偏倚。研究者应通过计算标准化均值差等量化指标,主动评估并对比研究队列与真实临床应用人群在关键人口学及检验特征上的分布差异。针对不可避免的样本分布偏差,需采用分层策略进行统计纠偏,并明确标注模型泛化能力的边界及适用人群范围,确保评估结果准确反映模型在真实世界中的应用潜力。在模型开发与验证阶段,针对敏感亚组(如年龄、性别、种族、区域、医保等)执行严格的“分层性能评估”,报告各亚组间的区分度与校准度差异。若发现显著的性能偏差(如模型对老年组的误报率显著高于青年组),应采取样本加权、分层建模或针对特定亚组调整分类阈值等策略进行校正。同时,数据的可解释性不仅仅依赖于后期的算法工具,如沙普利加性解释法(Shapleyadditiveexplanations,SHAP),更应在数据收集阶段即明确“解释对象与使用目的”。若目标是辅助医生临床决策,应优先收集具备明确病理生理学意义的变量,避免纳入虽有统计学关联但缺乏临床逻辑的“黑箱特征”,确保模型输出与临床认知相符。推荐意见7研究设计遵循医学伦理要求,尽可能选用代表目标人群和诊断问题的大规模多样化数据集,应考虑敏感亚组的公平性问题(2A类推荐)。4.数据探索和准备:数据探索旨在揭示数据分布特征、特征之间的相关性及结局的相关性、识别潜在异常值(如离群点)、缺失值的频率和模式(即随机或非随机)、分析类别不平衡性,并评估数据质量是否符合后续分析要求

8,16]

。数据探索发现问题之后,需在模型构建前,对训练集执行数据准备流程(

图1

,步骤2),这一阶段不仅直接影响模型性能,更是防范数据泄露风险的防线。数据准备方法需在训练集、测试集及验证集中保持严格一致性。针对多中心数据整合面临的异源性挑战,需建立统一的标准化方案。ML建模的数据预处理仅限在训练集,相同策略或基于训练集的预处理模型应用到测试/验证集。预处理类别和方法如下:(1)缺失值处理:缺失值的处理应基于缺失机制判定与临床意义评价。不宜仅依据缺失比例(如>25%)机械地删除变量。若该指标为关键临床特征(可能是非随机缺失,提示病情严重程度),应予以保留并尝试插补。若为非核心且缺失严重的变量,可考虑剔除。多变量联合缺失时,推荐使用K近邻或链式方程多重插补,后者能更好地保持变量间的协方差结构。基于随机森林的缺失值填补方式可以同时处理连续型和分类变量,在某些情况下比主流的链式多重插补法更高效。建议在插补后进行敏感性分析,比较不同处理策略(如删除与插补)对模型性能的稳健性影响。(2)异常值处理:异常值识别可采用四分位距法、标准化残差法及狄克逊Q检验等。处理异常值时应严格区分“数据录入错误”与“真实生物学极端值”。对于明显错误的异常值可以删除;对于一些异常值超出检测上下限的情况,应将其修正为检测限边界值;对于罕见病或危重症患者,极端的生理参数(如超高乳酸、极低血小板)往往蕴含重要的预后信息,应予以保留并在元数据中详细标注,避免因简单删除造成选择性偏倚,导致模型在危重人群中失效。(3)特征转化与标准化:对于非正态分布的数据(如病毒载量),建议采用Box-Cox或Yeo-Johnson变换;多分类变量应通过哑变量编码转换为数值型特征。在标准化方面,正态分布的连续变量适合使用Z分数标准化,而对偏态分布或离群值敏感的变量(如癌胚抗原CEA)则应采用稳健Z分数标准化。应避免对含有极端值的变量使用最小-最大标准化。(4)类别不平衡处理:当少数类样本占比低于30%则为类别不平衡。可通过上采样、下采样或结合多重技术的算法调整类别比例

26]

。然而,过采样可能引入合成样本的噪声,而欠采样可能导致重要信息丢失。因此,亦可选用对不平衡不敏感的评价指标,并通过分类阈值(如约登指数)来提升对少数类的识别准确性。推荐意见8在进行数据探索性分析时,应同步处理缺失值、异常值、数据格式不一致、类别不平衡等问题。处理策略应基于临床合理性制定,并充分评估不同处理方法可能引入的偏倚及对模型性能产生的潜在影响(2B类推荐)。5.特征选择:特征工程是ML建模的核心步骤,通过对原始数据的增强、构建、选择与转换,提取更能表征潜在临床问题本质的特征。其中,特征选择旨在识别并筛选出与目标变量(如疾病诊断)高度相关的特征子集,其策略可归纳为:基于临床经验与共识的选择方式,如通过文献回顾、临床指南确定候选指标;以及基于数据驱动的选择方式,如统计学或ML算法实现特征选择。传统统计方法(如

t检验、Wilcoxon秩和检验、方差分析及卡方检验等)以假设检验为核心逻辑,通过分析组间差异或变量间分布独立性筛选特征。而ML算法导向的选择策略(如信息增益、随机森林重要性评分),更侧重于量化特征对模型性能的贡献度及其实际权重,能精准识别与特定疾病相关的生物标志物,构建出兼具生物学可解释性与算法高效性的特征指标。ML常用的特征选择策略主要包括:过滤法(如低方差过滤、差异倍数过滤等)、包裹法(如递归特征消除)、嵌入法(如Lasso回归、岭回归等)。须规避多重共线性与选择偏倚带来的风险。高维医学数据中常见的特征间高度相关(多重共线性)会导致模型参数估计不稳定及解释性下降,可通过方差膨胀因子筛选或使用带有L1/L2正则化的算法加以缓解。此外,为严防选择偏倚及潜在的数据泄露风险,严禁在全数据集上预先进行特征筛选。规范的建模策略要求将特征选择步骤严格限定在交叉验证的每一轮训练折内独立执行,以防止因利用验证集信息而导致模型泛化性能的虚假高估。科学的特征选择不仅能去除冗余和噪声,更能增强模型的稳健性与可解释性。推荐意见9对于高维、复杂的检验数据,通过特征科学的增强、构建、筛选和转换,提升模型预测能力。在特征选择过程中,需注意规避多重共线性与选择偏倚,以确保模型的稳健性及解释性(2A类推荐)。(三)模型训练与解释模型构建的核心目标是从临床数据中提取规律,建立可解释的ML模型。有监督ML框架下的预测任务分为目标变量为离散型数据的分类模型与目标变量为连续型数值的回归模型,在建模初期应明确任务类型,从而指导后续算法的选择与技术优化路径。ML通过多阶段迭代实现预测性能、稳定性与可解释性的动态平衡。1.算法选择:构建ML模型需克服疾病状态的多维异质性(如病理进程动态差异)与检测数据的动态复杂性(如多模态指标非线性关联),这对算法的适用性提出了更高要求。算法选择(

图1

,步骤3)需考虑:问题类型(分类或回归任务)、数据特征(包括线性可分性、特征维度等)以及算法原理(

表3

)。建议筛选策略:首先通过交叉验证评估多种不同原理算法的基准性能,随后结合重采样技术评估模型的稳定性和准确性,最后筛选出最优候选算法进行超参数优化。需特别指出的是,logistic回归、决策树、朴素贝叶斯等算法具有参数规模小、结构简单、算力需求低等优势,应优先纳入比较范畴

27]

。尽管各类算法存在大量衍生版本,但基础算法在可解释性、训练效率方面的特性更契合检验医学对模型透明度的要求。推荐意见10算法选择阶段,优先采用不同原理的基础算法(如logistic回归等)建立基准模型,并同步引入对应集成算法和衍生算法,通过多维度分析筛选出最优模型(2A类推荐)。2.交叉验证及模型比较:通过K折交叉验证策略评估模型稳定性,并识别过拟合与欠拟合风险。当训练集样本量>100例时,通常采用K=5或K=10的折数配置,而对于样本量<100例的情况,建议采用留一法,即K值等于训练集样本总数

28]

。交叉验证通过多次循环训练与评估,将数据划分为互斥的子集,确保每个样本均能参与验证过程。复杂算法是指具有高复杂度、超参数空间巨大且易产生过拟合的深度学习或多层神经网络算法。在临床检验数据应用中,建议优先采用统计学原理明确、参数规模可控的基准算法,如LASSO回归、弹性网络、岭回归或基于浅层树模型的算法进行对比分析。通过汇总多轮验证结果,系统评估不同算法的预测误差分布特性,为模型比较与调优提供稳定性依据。交叉验证评估需区分分类任务与回归任务

27,29]

。分类任务中,准确率易受类别不平衡影响,需结合F1分数及AUC综合评估模型区分能力;回归任务则优先采用均方根误差强化极端偏差惩罚,并辅以平均绝对误差分析预测偏差分布。临床需求驱动的指标适配需通过稳定性验证完成(

图1

步骤4~5)。此外,由于试剂更换、仪器校准偏移或质控偏差,样本数据分布可能随时间发生系统性偏移,需关注试剂批次效应。为应对该干扰,在小样本模型训练与评估中,采用“按试剂批次分层”的交叉验证方案:即确保每一个验证折中均包含不同批次的样本,或者将样本按批次进行留一法交叉验证。这能有效评估模型对试剂批次波动的鲁棒性,若分层交叉验证后模型性能表现出显著衰减,则说明该模型在当前小样本下无法剥离非生物学干扰,应停止部署或通过迁移学习进行批次校正。交叉验证过程中,对比不同算法在默认参数组合和默认选择策略条件下的稳定性与准确性,重点与逻辑回归等基础算法进行性能基线比较。最终通过抽样稳定性、计算效率及预测精度的多维度权衡,确定最优单算法或组合算法。推荐意见11交叉验证评估阶段,训练集样本量<100例时推荐采用留一法,样本量达到或超过100例时建议采用5折或10折交叉验证;二分类预测任务优先选用AUC,回归预测任务以均方根误差为核心评估指标;样本量<100例时建议慎用复杂机器学习算法,优先使用可解释性强的基准模型(如logistic回归、LASSO等)(2A类推荐)。3.超参数调优和构建最终模型:模型构建本质上是动态迭代过程。在确认某种算法对当前临床问题的适用性后,需通过参数空间优化提升模型精度与稳定性,包括参数组合范围与搜索策略。参数组合优化通过扩展参数取值范围并缩小调整步长实现精细化搜索,而搜索策略则根据计算资源与效率需求,在网格搜索(穷举组合)、随机搜索(概率抽样)、贝叶斯优化(高斯过程引导)或遗传算法(进化迭代)等方法中的适配选择。该过程需与交叉验证协同执行,通过多轮验证循环锁定最优参数组合,最终基于完整训练集与优化参数构建模型(

图1

步骤6~7)。推荐意见12超参数优化应扩大参数搜索空间并匹配相应搜索策略,在交叉验证框架下确定最优超参数,同时避免过度调优引发模型在训练集上过拟合。最终模型需基于完整训练集与最优超参数重新训练(2A类推荐)。4.模型解释:在确定最终预测模型后,对各特征重要性开展系统分析,是实现模型临床转化与辅助决策透明化的核心环节(

图1

,步骤8)。ML模型的可解释性分析分为全局解释、局部解释及个体水平解释

27,30]

。全局解释旨在量化特征在整个数据集上的总体贡献,包括模型内置重要性指标(如树模型的增益等)和模型无关的置换特征重要性

27,30]

。此类方法能有效识别主导模型预测的关键生物标志物及其相对贡献大小。然而,其局限在于难以直接反映特征重要性在不同临床亚组、疾病状态或患者特征分布下的异质性。局部解释则聚焦于量化每个特征对单个样本预测结果的具体贡献,以基于博弈论的SHAP方法最具代表性

26,31]

。通过对SHAP值的汇总分析(如SHAP摘要图、均值绝对SHAP值、蜂群图),可进一步获得可靠的全局层面特征重要性洞见。通过对SHAP值的分层统计与可视化,能够有效揭示关键生物标志物的作用方向、强度及其在不同临床亚组、病理状态或协变量组合中的异质性规律

26,31]

。此外,个体水平解释整合全局与局部分析结果,借助多种可视化手段实现病例级预测过程的透明溯源与直观呈现。常用技术包括SHAP瀑布图、SHAP力图、SHAP决策图。全局解释、局部解释与个体水平可视化手段的有机结合,共同构成了多层次、可理解且临床上可信的可解释性分析框架。在模型解释基础上,需针对敏感亚组开展严格的公平性检验。所谓“敏感亚组”,是指因人口统计学特征(如年龄、性别、民族)或社会经济属性(如医保类型)差异,而在数据分布上具有系统性偏差,导致模型性能可能存在歧视的群体。为保障公平性的可测可控,建议执行以下质量控制程序:(1)定量评价指标:若关键亚组间的预测性能(如AUC)差异超过5%,或采用DeLong检验显示性能差异具有统计学意义,应判定该模型存在公平性缺失;(2)分层建模策略:当亚组间性能差异无法通过全局特征对齐消除时,建议弃用单一全局模型,转而构建“分层模型”或采用带有公平性约束的目标函数进行优化。推荐意见13在训练集上开展全局解释与代表性样本的局部解释,明确解释对象与使用目的,以理解模型机制、识别关键特征;在验证集上,建议开展全局解释、个体水平局部解释以及敏感亚组分层性能与校准差异评估,明确最优亚组,多维度验证模型泛化能力、保障模型公平性并支撑临床决策(2A类推荐)。(四)模型评估模型通过交叉验证选择最优算法、完成超参数优化并在明确最终模型的可解释性后,下一步需评估其在非训练数据的模型性能、泛化性和实际应用价值。在评估模型性能时,应首先对模型进行内部验证(

图1

,步骤11),初步评估模型的泛化性和临床实用性后,再通过多中心研究,收集合适的外部数据,对模型进行外部验证(

图1

,步骤12)。1.内部验证:在内部验证阶段,应对分类模型评估准确率、精确率、F1分数、AUC等关键性能指标;对回归模型评估R平方/调整R平方、均方误差、均方根误差、平均绝对误差等关键性能指标,考察模型在测试集、独立验证集上的表现,而不应仅依赖交叉验证结果

23]

。验证结果通常通过预测概率的箱型图或散点图、不同组别的受试者工作特征曲线(包括95%置信区间)以及基于最优阈值的混淆矩阵来展示。这些可视化手段可以直观反映模型的分类效果和预测准确性,为临床应用提供科学依据

23]

。同时也应对主要亚组模型性能的异质性进行评估,避免亚组性能不平衡的问题。此外,对于数据分布与训练集存在差异的验证集,还应通过校准曲线、整体校准指标和观察/预期比等指标,评估模型的预测概率与实际观察概率的一致性,确保模型在实际临床场景中符合预期

23,32]

。在预测模型用于临床决策时,不仅要考虑其预测准确性,还应衡量其对患者和医疗结果的总体益处。可以通过计算模型应用后潜在的患者受益与伤害,从而得出净益值,以量化模型的临床价值。此外,还应采用决策曲线分析等方法,在不同的决策阈值下比较患者的净收益,帮助临床专家根据具体的临床场景和需求合理选择阈值,从而最大化模型的临床益处

33]

。推荐意见14在内部验证过程中,除了对模型的常规性能指标进行评估外,还应结合模型校准情况和临床实用性指标,全面分析模型的实际应用价值与可靠性(2A类推荐)。2.外部验证:使用单中心数据开发的模型通常会由于人群特征有限、设备差异或过程偏差而过度拟合。对于拟进行临床部署的模型,必须完成包括时间外、中心外的外部验证,以评估模型在不同人群、不同环境中的泛化性和临床实用性。此外,在条件允许下,可以整合多中心数据对模型进行更新和改进,从而提高模型的整体临床泛化性、适用性和可靠性

34]

。目前大多数ML模型还在科研探索阶段,难免在模型建立中出现数据采集不当,信息泄露等问题。例如,若实验组和对照组患者的某检测项目由该实验室的两台检测仪器完成,且两台仪器间存在实验室未知的偏差,则使用该项目建模可能产生数据泄露,导致模型性能被高估,而仅通过内部验证很难发现该问题

35]

。此外,由于目前信息安全与患者数据的相关政策尚不明晰,在报告此类研究时无法公开建模过程中使用的数据和代码。因此,仅根据对模型建立过程的描述和内部验证结果,难以准确判断其真实性能,尤其是性能极其出色但底层机制尚不明确的模型。外部数据通常独立于本地诊疗流程,或者其他导致信息泄露的影响,当内部验证结果和外部验证结果差异较大时,可以提示模型建立过程中存在问题,研究者应及时分析并明确这些问题。由于外部验证通常成本较高,进行探索性的模型建立研究时,若由于客观条件限制,可暂缓开展多中心外部验证,但必须通过完善的内部验证及严格的模型可解释性分析以确证其初步价值

34]

。此外,在外部验证中,模型性能可能受到不同时间、空间以及医疗场景的影响,多中心研究应通过中心外的数据集进行外部验证,而对于单中心研究中无法拿到外部数据时,首先考虑时间外的外部验证。需要注意的是,任何外部验证研究不可能覆盖所有的影响因素,即不存在“完整”的验证

36]

。然而,一旦模型进入医疗机构进行特定场景临床辅助决策部署,必须通过严谨的符合该场景的外部验证,以排除因数据采集方式、检测设备偏差及信息泄露带来的性能虚高。推荐意见15模型建立和开发中应在内部验证和可解释性分析显示模型具有医学价值。对于拟在临床实践中部署的模型,必须开展包括时间外、中心外的外部验证,确保模型性能的稳健性与泛化能力(2B类推荐)。3.多中心外部验证:模型外部验证可能需要研究者进行多中心研究,遵循多中心研究规范,包括伦理及人类遗传信息等要求。实施多中心ML研究前,应取得各医疗机构伦理委员会批准。研究过程中需严格保护受试者隐私,对数据采取去标识化或匿名化处理,并限制敏感数据的访问权限。此外,算法设计须确保透明性与公平性,避免模型偏见导致医疗决策偏差,并建立动态风险监控机制,定期向伦理委员会报告数据使用中的新风险。研究方应严格遵守医疗数据安全相关法律和规定,确保数据全流程管理的合法性。各参与中心应制定清晰和标准化的数据收集、预处理和分析方案,包括确保结局定义、预测因子测量和评估指标的一致性,基于此建立多中心协作平台。平台应利用安全平台和标准化数据格式、可信执行环境等隐私计算技术以实现安全、高效的数据集成和分析。同时,统一标准化的数据协作平台也能协助各中心遵守数据安全与伦理的规范,降低风险

24,37]

。推荐意见16实施多中心机器学习研究前,应取得伦理委员会批准,并严格遵守医疗数据安全相关法律和规定,保证患者安全和合法权利(1类推荐)。推荐意见17在满足数据安全的框架下,创建协作平台以促进多中心之间的数据共享(2A类推荐)。4.外部验证数据采集:在采集外部数据时,应保证数据来源的使用场景与建立模型的场景保持一致,若研究者计划拓展应用场景,也需对此类数据的适配性进行审慎考量,同时严格保障数据的标准化程度与质量。收集到的外部数据应包含模型所需的全套变量,且目标变量的定义应与模型开发阶段的数据保持一致

38]

。研究者还应分析数据缺失情况,如果缺失比例过高,或缺失规律存在数据泄露风险,则应重新评估使用该数据用于外部验证的价值,必要时考虑替换数据来源

24]

。外部验证所需样本量计算要求与模型训练不同,样本量计算是为了实验室在有限资源的条件下,计划充足的样本量是保证统计检验效能,同时避免过度采集导致资源浪费。样本量过小可能导致验证时检验效力不足,无法得出可靠的结论。因此,在收集外部验证数据集之前,应根据模型类型、预期效果大小和显著性水平,进行样本量计算,确保研究的统计效力

25]

。200例通常作为经验性的样本量计算标准,但也有研究通过模拟实验表明使用该经验性规则可能导致模型评估性能不够精确,并提出了更为精确的样本量估算方法

39]

。通常使用这类方法计算的样本量>200份,因此研究者在数据充足的情况下,可以使用该方法评估所需样本量

39]

。推荐意见18应根据临床目的和实际应用场景,选择合适的医疗机构、研究人群及数据,确保数据质量,并计算支持统计分析的样本量,同时还应评估偏倚风险和适用性,确保研究人群选择适当、变量定义一致、结果判断标准统一(2B类推荐)。5.模型评估:外部验证时需使用原始模型的完整参数规范(如逻辑回归系数、ML模型结构文件)进行预测生成,禁止任何模型参数的再调整。对于回归模型应严格按公式计算线性预测值

24]

。技术实现上推荐编写可重复的自动化代码,对所有模型需保证输入数据的预处理流程与开发阶段一致。外部验证时模型评估方法应与内部验证一致。此外,外部数据可能与原始数据中各亚组的占比和数据分布不同,更有可能出现亚组性能异质性,导致整体结果无法反映实际工作中的性能。例如,一个模型在外部验证时,对男性的预测效果较好,而对女性的预测结果较差,虽然整体模型性能满足临床需求,但对女性使用时可能存在较大风险,外部验证时需重点评估

40]

。推荐意见19在外部验证时,除了对整体性能评估外,应强调对模型在主要亚组中的性能进行评估,避免亚组性能异质性(2B类推荐)。四、机器学习算法的临床应用实验室将经过验证的ML模型集成到现有的临床工作流程中,以提高效率、准确性和医疗决策能力

18]

。模型的临床落地不仅涉及应用软件开发、硬件配置以及与现有数据库的接口对接等部署工作,还包括模型性能验证、应用评价、上线后漂移监测(数据漂移+性能漂移)、模型版本管理与更新等后续环节

41,42]

,以满足不同监管机构对医疗器械软件全生命周期管理的要求

43,44]

。1.模型部署:在模型对应的应用软件开发时,需要仔细考虑模型的使用场景,考虑模型输入和输出的响应速度,以及使用者与模型的交互。模型在部署时,应充分评估模型计算效率以及最大的计算负荷,应确保足够的IT基础设施满足应用需求。一些较为复杂的模型可能需要短时间内处理大量数据和计算,可能对硬件的计算能力和网络传输速度有较高的要求,应在软件部署前预案。部署软件需与现有实验室信息系统、医院信息系统数据整合,开发相应数据传输接口,保证自动化数据输入,降低对现有工作流程的干扰,使应用更易于访问,并且更可能被使用。此外,在模型部署时,也需遵循医疗数据相关法规,保护数据安全和患者隐私

41,42,44]

。2.模型性能验证、应用评价和监测:当实验室部署基于内部或外部开发的单中心或多中心模型应用时,鉴于此类应用通常可归类为医疗器械软件,原则上可参照国际标准化组织发布的ISO15189∶2022中关于医疗设备管理的相关要求,对模型实施规范化管理。在模型正式投入使用前,应进行性能验证。这是由于模型在开发阶段所使用的训练与验证数据,可能与实际应用场景存在差异,例如患者人群结构、检测流程、试剂批次或仪器平台的变化,均可能影响模型的性能和临床表现。尤其对于外部开发的多中心模型,其通常需兼顾不同中心间的异质性,常通过“平均化”策略提升整体兼容性,但这可能导致模型在特定单中心的本地人群中适配性不足,出现“整体性能尚可,但在本中心效果欠佳”的情况,从而带来潜在风险。性能验证应根据模型评估中的原则进行。模型应用后,随着时间变化,患者人群或医院流程可能改变,影响模型的实际性能,医疗机构应每半年对部署模型进行合适的性能评价以保证模型在实际工作中的适用性

41,45]

,其中高风险模型每季度或按需进行评估。此外,应及时评估模型使用者对模型实际的表现和实际使用的满意度,医疗机构应根据反馈不断改进

4]

。推荐意见20在完成模型部署后,应定期评估和监测应用的模型性能、使用情况、满意度以及模型运行故障率等指标,应根据这些指标不断改进模型和应用软件(2A类推荐)。3.模型版本管理和更新:模型更新可以通过重新校准、模型修订、模型扩展、动态更新等方法优化模型在当前本地数据中的性能。重新校准主要针对原始数据集和新数据集差异较小的情况,通过调整模型截距或分类阈值来改善校准性。而模型调整则在数据集差异较大时,重新估计模型系数。模型扩展则通过添加新的预测因子来提升模型性能。动态更新则针对需要持续更新的模型。由于模型校准和更新后,模型参数可能改变,性能可能较原模型有较大变化,根据目前医疗器械软件的监管原则,不建议实验室自行校准和更新模型,任何模型更新应按照监管政策、质量管理体系要求,根据具体情况再执行

15,18,40,44]

。模型版本管理应遵循医疗器械软件变更管理的原则,根据风险水平实施分级管控:(1)模型更新触发条件:当出现以下任一情形时,应启动更新评估程序:①性能漂移:外部验证显示模型在当前环境下的性能指标,如AUC的相对值较基线下降超过预设阈值(如5%);②数据漂移:检测系统(试剂/

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论