结直肠癌人工智能应用场景评测专家共识总结2026_第1页
结直肠癌人工智能应用场景评测专家共识总结2026_第2页
结直肠癌人工智能应用场景评测专家共识总结2026_第3页
结直肠癌人工智能应用场景评测专家共识总结2026_第4页
结直肠癌人工智能应用场景评测专家共识总结2026_第5页
已阅读5页,还剩14页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

结直肠癌人工智能应用场景评测专家共识总结2026结直肠癌作为全球范围内高发的恶性肿瘤,疾病负担在我国呈现出持续增长且年轻化的严峻趋势,发病率与死亡率在我国恶性肿瘤中分别高居第2位和第4位[1⁃3]。尽管近年来诊疗技术不断进步,但临床实践中仍面临巨大挑战。近年来,人工智能(artificialintelligence,AI)已深度嵌入结直肠癌临床诊疗领域,规范应用AI可提升腺瘤检出率、降低漏诊、提高分期准确性并减轻医师负担。然而,AI系统的快速迭代与结直肠癌临床应用的复杂性之间仍存在明显的评价鸿沟,不同产品在算法设计、训练数据、验证方式及性能指标等方面差异显著,且部分系统在真实世界场景中的稳定性与安全性尚缺乏充分验证[4⁃5]。因此,制定面向结直肠癌特异性应用场景的统一评测标准,有助于服务健康中国2030关于提高癌症防治水平和医疗服务质量的总体目标,同时对于规范AI临床应用、促进技术转化并支撑监管决策具有迫切现实意义。一、制订共识的目的与意义本共识旨在面向结直肠癌诊断、治疗与随访管理全过程中AI技术的临床应用场景,建立一套科学、系统、可量化且具有临床可操作性的评测指标体系。共识重点规范AI在结直肠癌诊疗中的辅助应用边界,明确其应作为医生临床决策的支持工具,而非替代医生进行独立诊断或治疗决策,以避免技术过度宣传、适应证泛化及不当使用。本共识适用于结直肠癌筛查、早诊、术前评估、治疗决策、手术辅助、疗效评价、复发风险预测和术后随访等场景中的AI系统评价。其使用对象包括临床科室、医疗机构管理部门、AI研发机构、评测机构和监管审评相关部门。本共识不是具体产品的审批结论,也不是脱离场景的统一评分表。不同AI系统应依据目标人群、输入数据、输出形式、风险等级和临床影响程度,选择相应评价指标和验证方法。二、共识的核心要点速览1.工具定位:结直肠癌AI系统仅作为临床辅助决策工具,不具备独立行医权,最终诊疗责任由临床医师承担。2.场景覆盖:本共识覆盖内镜、影像、病理、辅助决策、手术相关AI、随访管理和生成式AI等主要应用场景。3.评价框架:评价应同时关注算法性能、临床安全、临床效用、用户体验、可解释性、伦理合规和持续监管。4.安全底线:对可能导致漏诊、误治、延误治疗、不可逆手术损伤或严重隐私风险的输出,应设置红线测试和人工复核机制。5.动态监管:AI系统部署后应持续监测性能漂移、适用人群偏倚、版本更新影响和临床不良事件。三、共识形成方法与适用范围本共识为框架性、原则性和方法学指导性文件,旨在明确结直肠癌AI系统的应用边界、评价维度、核心指标、安全底线、验证路径及报告要求,而非建立单一评分体系。工作组系统检索PubMed、WebofScience、Embase、中国知网和万方等数据库(2020年1月至2026年1月),围绕结直肠癌、AI、大语言模型、机器学习、内镜、影像、病理、手术辅助、临床决策支持、疗效预测、预后评估、安全性、伦理合规及临床评价等关键词,同时结合国内外相关临床指南、监管文件、报告规范及专家共识进行补充证据整合。纳入标准包括:(1)研究对象为结直肠癌患者或可明确分离结直肠癌亚组数据的研究;(2)涉及人工智能或机器学习模型在筛查、诊断、治疗决策或预后评估中的应用;(3)提供明确模型构建或验证过程,并报告至少一项定量评价指标;(4)包括随机对照研究、队列研究、多中心验证研究及系统评价。排除标准包括:(1)仅进行算法理论描述而无临床或实验验证的研究;(2)无法从结果中提取结直肠癌相关数据的混合疾病研究;(3)缺乏可量化评价指标或结果不可重复验证的研究;(4)重复发表或数据重复的研究;(5)会议摘要、评论性文章及非同行评审文献。本共识采用GRADE方法学框架对证据质量进行分级,并结合临床实践进行适当简化,将证据分为A、B、C、D四级:A级为高质量证据,主要来源于高质量随机对照试验或多中心前瞻性研究;B级为中等质量证据,主要来源于队列研究、多中心回顾性研究或外部验证研究;C级为低质量证据,主要来源于单中心回顾性研究或探索性研究;D级为极低质量证据或专家意见支持的证据[6]。推荐强度分为强推荐与弱推荐两级。强推荐表示基于现有证据及专家一致意见,相关措施在多数临床情境下获益明确且风险可控,具有较高一致性;弱推荐(条件推荐)表示现有证据有限或不同临床情境差异较大,需结合具体患者情况及应用场景进行个体化判断[7];每条推荐意见均同时标注证据等级及推荐强度,以提高透明性与可追溯性(表1)。内镜、影像、病理、治疗推荐、手术导航及预后预测系统应根据临床用途、风险等级、输入类型、输出形式及对诊疗路径影响,选择评价指标与验证方法。量化指标和阈值为参考标准,重点安全性评价内容包括局部进展期(T3~4期或N+期)及晚期和转移性(M1期)结直肠癌的漏诊与分期错误风险,以及病理误判、不合理治疗推荐、低位直肠癌保肛决策偏倚、严重并发症预警不足及复发转移风险低估等关键安全问题。用户满意度、流程效率及一般辅助性能指标可作为参考。应用中应优先采用中国人群数据、临床指南及本土诊疗流程进行验证与校准。不同层级机构、专科场景及部署方式对系统需求和风险承受能力存在差异,不宜以单一指标覆盖所有场景。医疗机构在引入和部署系统时,应结合模型用途、目标人群、数据来源、临床风险等级、医师复核机制及真实世界表现进行综合评估。本共识总体框架见图1。四、共识的核心原则1.患者安全优先:任何AI系统的引入均不应降低现有诊疗安全标准。安全红线未通过时,系统不应进入相应临床应用场景[8]。2.临床价值导向:AI评价不应停留在受试者工作特征曲线下面积(areaunderthecurve,AUC)、准确率等算法指标,应重点考察其对检出率、漏诊率、分期准确性、诊疗一致性、手术安全、工作效率和患者结局的实际影响[9]。3.科学循证与方法学规范:评价数据、标注流程、研究设计、统计分析和结果报告应可追溯、可复核,并与系统风险等级相匹配。4.客观、公正与可重复性:评测方法、测试集构建、金标准设定、性能指标和失败案例应尽可能透明,便于第三方复现。5.伦理合规与隐私保护:AI研发、验证和部署应遵守个人信息保护、数据安全、网络安全、伦理审查和医疗器械监管要求。6.动态更新与持续评估:AI系统部署后应开展性能漂移监测、版本管理、回归测试、不良事件报告和必要的退出管理。五、评价维度与核心指标(一)准确性与可靠性评价准确性和可靠性是结直肠癌AI系统进入临床评价的基础。不同任务应采用差异化指标:内镜辅助检出强调检出率和漏检率;影像和病理强调分期、切缘和高危特征识别;预测模型强调校准和风险分层;生成式AI强调事实准确性、医学逻辑和严重错误控制[10]。推荐意见1:内镜AI辅助系统应以提升腺瘤检出质量为核心,综合评价腺瘤检出率、漏诊率及微小、扁平和锯齿状病变检出能力,腺瘤检出率增幅不宜设定统一强制阈值。用于微小息肉实时性质判断的计算机辅助诊断(computer⁃aideddiagnosis,CADx)系统,若支持诊断后保留或切除后弃置策略,直乙结肠≤5mm病变阴性预测值建议≥90%。(证据等级:A;推荐强度:强推荐)证据说明腺瘤检出率与结直肠癌发生及相关死亡风险密切相关。AI辅助结肠镜可提高腺瘤检出率,但增幅受基线腺瘤检出率、检查人群、医师经验和系统类型影响[11]。因此,不宜设置统一强制阈值。CADx用于微小息肉实时性质判断时,可参考美国胃肠内镜学会(AmericanSocietyforGastrointestinalEndoscopy,ASGEPIVI)标准,将直乙结肠≤5mm病变阴性预测值≥90%作为推荐目标[12⁃15]。推荐意见2:影像和病理辅助系统应围绕直接影响治疗路径的分期、切缘、淋巴结、高危病理特征和治疗反应进行评价,高风险输出必须设置人工复核。(证据等级:B;推荐强度:强推荐)证据说明直肠癌cT2与cT3鉴别、环周切缘(circumferentialresectionmargin,CRM)和直肠系膜筋膜(mesorectalfascia,MRF)受累、侧方淋巴结转移、切缘状态和高危病理特征会直接影响新辅助治疗、手术方式和随访策略。此类系统应报告总体性能、关键亚组表现和错误案例,不能仅以单一准确率作为临床可用依据[16⁃19]。推荐意见3:辅助诊断和预测模型应报告AUC、精准率⁃召回率曲线下面积(areaundertheprecision⁃recallcurve,AUPRC)、灵敏度、特异度、阳性预测值、阴性预测值、F1分数、校准指标、95%CI和关键亚组性能。高性能阈值应作为推荐目标值而非统一最低要求。(证据等级:B;推荐强度:条件推荐)证据说明辅助诊断模型和预测模型的评价重点不同,前者应重点反映模型对病变识别、分类和分期的判别能力,后者除区分度外,还应评价预测概率与实际结局的一致性。对于输出事件发生概率的模型,可补充报告布里尔评分(Brierscore),用于衡量预测概率与真实结局之间的总体偏差,数值越低提示概率预测越准确。对于高风险任务,还应报告不同中心、设备、医生年资及患者亚组中的模型表现[20⁃23]。推荐意见4:病历生成与结构化摘要系统应保证核心事实准确率≥95%;辅助诊疗建议系统在高风险场景下与多学科团队(multidisciplinaryteam,MDT)或权威指南一致性应≥85%或Kappa≥0.75,同时严格控制严重医学逻辑错误,并建立人工复核或风险提示机制,保障患者安全。(证据等级:B;推荐强度:条件推荐)证据说明:生成类系统在病历文本和结构化摘要中容易出现关键信息遗漏或错误,尤其涉及肿瘤部位、手术方案、病理分期和关键时间节点,保证核心事实准确率达到95%可以作为临床试用的参考标准。辅助诊疗建议系统的可靠性应通过与MDT决策或权威指南的一致性评估,高风险决策场景的一致性达到85%或Kappa值≥0.75能够有效降低误导性建议的风险。此外,系统必须防范严重医学逻辑错误,将可能导致错误治疗、延误或患者伤害的输出作为安全红线,并通过拒答、风险提示或人工复核机制确保临床安全,同时应在多中心数据和真实世界环境中验证其稳定性和可推广性[24⁃26]。推荐意见5:高风险结直肠癌AI系统进入临床试用或部署前,应完成独立、多中心、临床专家审核的外部验证,并报告不同中心、设备、操作者和患者亚组中的性能差异。(证据等级:A;推荐强度:强推荐)证据说明外部验证是判断AI系统泛化能力和临床安全性的关键环节。高风险任务建议至少纳入3家独立医疗机构作为最低参考要求,且评测集构建应由相应专科临床专家参与审核。外部验证机构应在地域、医院等级、设备平台、病例复杂度和目标使用场景方面具有代表性[27⁃29]。(二)安全性评价安全性评价旨在识别AI系统在结直肠癌诊疗过程中可能引入的医疗风险,重点防范因错误识别、错误分期、错误推荐、信息遗漏及自动化依赖所导致的误诊、治疗延误、手术损伤或不合理治疗。对于可能改变诊疗路径或影响患者预后的高风险应用场景,应建立专病安全事件分级、风险提示、人工复核和功能暂停机制。严重安全事件不宜仅以发生次数作为判断依据;对可能直接导致患者伤害的输出,即使单次发生且未触发风险提示或人工复核,也应启动原因分析和再评价。按严重度、是否触发不确定性提示、是否经人工复核、是否可能改变治疗路径分级。对红线测试集应报告严重错误率、漏预警率和复核纠正率,并要求回归测试(表2)。推荐意见6:结直肠癌AI系统应设专病安全红线,对可能导致进展期癌漏诊、关键分期低估、错误治疗路径、不可逆手术损伤或严重医学事实错误的输出,应列为严重安全事件重点测试。系统在高风险场景下应提供不确定性提示、风险警示及人工复核,未经临床医师确认的高风险输出不得直接用于诊疗决策。(证据等级:B;推荐强度:强推荐)证据说明结直肠癌诊疗路径高度依赖内镜、影像、病理等MDT综合判断,进展期病变漏诊、直肠癌分期低估、CRM受累判断错误、侧方淋巴结评估不足以及不恰当的观察等待建议,均可能直接影响新辅助治疗、手术范围、保肛策略及患者预后。生成式AI和临床决策支持系统还可能产生医学事实错误、证据来源错误或逻辑推理错误,尤其在复杂病例和指南边界情境下更需强调不确定性提示和人工复核。因此,本共识建议将上述高风险输出纳入专病安全红线,并以风险分级、人工复核和再评价机制替代单纯次数判定,以提高评价标准的临床可操作性和患者安全保障水平[10,30⁃35]。结直肠癌诊疗中应重点关注以下安全红线事件:(1)未识别进展期结直肠癌或高度疑似恶性占位性病变;(2)低估直肠癌局部进展程度、CRM或MRF受累风险,进而影响新辅助治疗或手术策略;(3)术中辅助系统误识别或未提示避让输尿管、盆腔自主神经、主要血管及重要邻近脏器;(4)对新辅助治疗后未达到临床完全缓解的局部进展期直肠癌患者建议观察等待;(5)生成式或决策支持系统输出错误分期、错误禁忌证、错误用药剂量、虚构指南依据、遗漏关键病理或影像信息,并可能导致治疗方向偏离。上述情形一经发现,应记录为严重安全事件,并结合事件严重程度、是否触发风险提示、是否经人工复核以及是否造成实际临床影响进行分级处置。对于未能识别自身适用范围、以确定性语气输出高风险错误建议,或反复产生同类严重错误的系统,不应进入相应临床应用场景。推荐意见7:AI系统应具备低质量输入、超适用范围病例和高风险不确定结果的识别、拒答或人工复核提示能力,高风险内容预警准确率≥85%可作为参考目标,并应同步报告漏预警率、误预警率、人工复核触发率及复核后错误纠正率。(证据等级:B;推荐强度:条件推荐)证据说明结直肠癌AI系统在低质量输入、资料缺失或超出适用范围的病例中更易出现错误判断,尤其在内镜视野受限、肠道准备不充分、影像质量欠佳、病理标本质量不足及复杂治疗决策场景下,确定性输出可能增加误诊、漏诊或治疗路径偏离的风险。因此,系统评价不应仅关注常规条件下的诊断准确性,还应考察其对低质量输入和高风险不确定结果的识别能力。对于可能影响分期判断、新辅助治疗、手术方式、保肛策略或随访处理的输出,应建立人工复核触发机制,并报告预警准确率、漏预警率、误预警率和复核后错误纠正率,以评价系统在真实临床环境中的安全边界和风险控制能力[36⁃39]。(三)临床效用与价值评价临床效用评价应回答AI是否真正改善诊疗流程和患者安全,而不仅是离线测试性能是否提高。推荐比较医师单独判断和医师+AI辅助的差异,并按医生年资、医院等级、设备平台和患者亚组进行分析(表3)。推荐意见8:结直肠癌辅助决策系统应按任务类型分层评价。分期评估和风险分层类任务应重点评价准确性、校准度和错误分期率;治疗决策类任务应评价其与权威指南、MDT专家决策及真实临床路径的一致性;生成式诊疗建议应重点评价事实准确性、医学逻辑、证据引用、禁忌证识别和严重错误输出。Kappa≥0.75可作为较高一致性的参考目标,但不宜作为唯一评价标准。(证据等级:B;推荐强度:条件推荐)证据说明结直肠癌辅助决策系统涉及分期评估、风险分层、治疗推荐、手术方式选择和随访管理等不同场景,各类任务的临床风险和评价重点不同。分期及风险分层任务更强调结果准确性和校准度,治疗决策任务更强调与指南、MDT专家意见及真实诊疗路径的符合度,生成式诊疗建议则需重点防范事实错误、证据引用错误、禁忌证遗漏和不合理治疗建议。Kappa系数可用于评价系统与专家决策的一致性,但系统是否具备临床应用价值,还需结合安全性、可解释性、人工复核结果和真实世界表现综合判断[22,25,27,40⁃42]。推荐意见9:手术相关AI系统应评价关键解剖识别、实时导航、解剖变异预警、手术质量、肿瘤学安全和围手术期结局;传统手术质量指标应结合病例复杂度和本中心水平解释。(证据等级:B;推荐强度:条件推荐)证据说明直肠癌手术应重点评价全直肠系膜切除术(totalmesorectalexcision,TME)标本质量、CRM和远端切缘(distalresectionmargin,DRM)、术中并发症及盆腔自主神经保护情况;结肠癌手术应重点评价完整结肠系膜切除(completemesocolicexcision,CME)手术平面、血管根部处理、淋巴结清扫质量和标本完整性[43]。机器人或腹腔镜AI还应评价软组织边界识别、术中实时导航、解剖变异预警、误提示率和警报疲劳。TME和CME完整率等指标应作为高质量中心或临床研究推荐目标,而非所有系统的最低门槛[30,44⁃45]。(四)用户体验与交互性评价AI系统只有在真实临床流程中可用、稳定并可理解,才可能产生临床价值。用户体验评价应纳入目标使用者,而不是仅由研发人员或单一科室完成。推荐意见10:结直肠癌AI系统临床部署前应评价实时响应、工程稳定性及人机交互可用性。内镜实时检测和术中导航等即时反馈系统应重点评估端到端延迟、帧率、画面同步性及连续运行的稳定性(端到端延迟≤100ms参考),系统可靠性可结合故障率、平均无故障时间(meantimebetweenfailures,MTBF)、平均修复时间和系统可用率评价(MTBF≥1000h参考),人机交互可通过系统可用性量表(systemusabilityscale,SUS)评估(平均分≥70分)。(证据等级:C;推荐强度:条件推荐)证据说明内镜实时检测和术中导航等任务应评价端到端延迟、帧率、画面同步性和连续运行稳定性;报告生成和辅助决策系统应评价报告时间、操作负担、医师采纳率和警报疲劳。SUS、MTBF、端到端延迟等指标可作为参考目标,应按系统类型和部署环境解释[46⁃48]。推荐意见11:诊断和决策类AI系统应提供与任务相匹配的可解释信息,包括病灶定位、关键特征、指南条款、证据来源、适用条件和不适用情形,但解释内容不能替代医师判断。(证据等级:B;推荐强度:强推荐)证据说明视觉类系统可提供定位框、分割轮廓、热力图或关键图像特征。辅助决策系统应给出可核查的指南条款和证据来源。对于大语言模型,尤其应防止将表面流畅的推理文本误认为真实证据[40⁃42,49]。(五)伦理与合规性评价伦理与合规评价应覆盖数据来源、隐私保护、算法公平性、网络安全、医师责任、患者告知、版本管理和上市后监测。推荐意见12:影响诊断、分期、治疗、手术或随访管理的AI输出应由具有资质的临床医师复核,并在医疗文书或信息系统中保留确认记录;患者应在适当环节获知AI的辅助属性和人工复核机制。(证据等级:A;推荐强度:条件推荐)证据说明AI系统不得替代临床医师独立作出诊疗或手术决策。医疗机构应建立AI准入评估、使用培训、权限管理、日志留存和异常事件上报制度。是否需要单独知情同意,应结合AI对诊疗路径的影响程度、机构伦理要求和现行法律法规确定[50⁃51]。推荐意见13:AI系统研发、验证、部署和监测所用数据应符合伦理审批、数据授权、隐私保护、网络安全和医疗器械监管要求,并建立版本管理、日志留痕、安全事件报告和退出机制。(证据等级:A;推荐强度:条件推荐)证据说明内镜图像、影像、病理切片、电子病历、基因检测和随访资料均属于高敏感医疗数据。生成式AI场景中,不应将可识别患者信息输入未经授权的外部模型。拟进入临床部署或注册路径的系统,应符合AI医疗器械、医疗器械软件和网络安全相关审查要求[8,51]。六、评价方法与流程建议(一)数据集构建用于结直肠癌系统评测的数据应优先来源于真实临床流程,覆盖不同地区、医院等级、设备平台、患者构成、疾病类型及数据质量。高风险任务应预先设定最低样本量、关键亚组样本量以及独立测试集构建方案。数据标注必须由与任务相对应的专科医师完成:内镜数据由消化内镜医师标注;影像数据由胃肠或腹部影像医师标注;病理数据由消化系统病理医师标注;手术视频或导航数据由结直肠外科医师参与;辅助决策类数据应由多学科专家共同判定。若医生个体差异导致金标准不唯一,应采用双专家独立标注、第三专家仲裁或MDT共识判定。对于仍无法明确判定的病例,应标注为不确定、低质量。(二)临床验证并行对照研究可用于评价AI系统对医师诊断和决策能力的辅助价值。研究设计应比较医师独立判断与AI辅助下医师判断在准确性、灵敏度、特异度、漏诊率、判读时间、严重错误率和决策一致性等方面的差异,并根据医师年资、专业背景和医疗机构层级进行分层分析。多中心前瞻性研究适用于评价AI系统在真实诊疗流程中的安全性、性能稳定性和临床获益。内镜辅助系统应重点评价腺瘤检出率、漏检率、假阳性负担、退镜时间、医师采纳率和相关不良事件;影像、病理及辅助决策系统应根据具体任务评价分期准确性、治疗建议合理性、人工复核结果和患者安全结局。MDT一致性研究可用于复杂辅助决策系统的早期评价。研究过程中可隐藏最终MDT结论,由系统独立生成建议,并与高水平MDT意见、权威指南推荐及真实临床路

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论