糖尿病辅助诊疗大语言模型评价专家共识总结2026_第1页
糖尿病辅助诊疗大语言模型评价专家共识总结2026_第2页
糖尿病辅助诊疗大语言模型评价专家共识总结2026_第3页
糖尿病辅助诊疗大语言模型评价专家共识总结2026_第4页
糖尿病辅助诊疗大语言模型评价专家共识总结2026_第5页
已阅读5页,还剩24页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

糖尿病辅助诊疗大语言模型评价专家共识总结2026糖尿病作为全球性的重大慢性代谢性疾病,其诊疗过程涉及海量的临床文本与多维度的管理需求。糖尿病管理具有长期、连续、跨场景的特点,临床工作既依赖标准化指南,也依赖对病程演变、并发症风险、药物禁忌的精确判断。近年来,大语言模型(largelanguagemodel,LLM)展现出跨领域的语义理解与逻辑推理能力,为糖尿病的智慧化诊疗提供了技术支撑,并已经开始逐步用于门诊问答、病历整理、辅助分诊、治疗建议生成和患者随访等环节

[1,2,3,4]

。LLM在信息整合和自然语言交互方面具有独特优势,但在医学知识稳定性、场景适配、安全边界和可解释性方面仍存在一些问题。目前仍缺少统一的评价框架,不同研究之间难以比较,模型在真实临床环境中的风险也难以及早识别

[5]

。基于上述背景,内分泌与代谢性疾病国家临床医学研究中心(长沙)联合中国医师协会内分泌代谢科医师分会组织糖尿病学、人工智能、临床研究、生物统计、医疗信息、公共卫生和伦理学等领域专家制订了本共识,旨在提出面向糖尿病辅助诊疗场景的LLM评价框架与基本原则,提出一套面向中国糖尿病辅助诊疗场景、可用于研发评估、临床验证和持续监测的三级评价体系,既强调医师作为最终决策责任主体,也尽量提高指标定义、阈值来源和报告要求的可操作性,为不同类型糖尿病LLM的横向比较和规范应用提供共同语言。第一部分共识制订方法学一、共识制订流程本共识由内分泌与代谢性疾病国家临床医学研究中心(长沙)联合中国医师协会内分泌代谢科医师分会发起,于2025年启动。两轮德尔菲专家函询及集中修订于2025年8至9月,2025年9月19日召开共识定稿讨论会,其后结合外部评审和期刊审稿意见持续修订,并于2026年3月定稿。制订过程参考国内外指南与专家共识制订方法,并结合指南研究与评价工具Ⅱ(appraisalofguidelinesforresearchandevaluationⅡ,AGREEⅡ)、卫生保健实践指南报告规范(reportingitemsforpracticeguidelinesinhealthcare,RIGHT)及生物医学领域共识方法报告规范(accurateconsensusreportingdocument,ACCORD)共识报告清单的相关要求,遵循科学、透明、可追溯原则。二、共识目标人群和使用者本共识的评价对象为用于糖尿病辅助诊断、鉴别诊断、治疗建议、风险识别、医患沟通、随访和慢病管理的LLM或基于LLM构建的端到端应用系统。适用场景包括专科门诊、普通门诊、住院管理、互联网随访及基层医疗卫生机构;目标人群为接受上述服务的糖尿病患者及相关临床管理人群。主要使用者包括临床医师、护理人员、研究者、医疗机构管理者、模型研发人员及第三方评价人员。三、共识编写工作组本共识设置牵头专家、共识制订委员会、执笔者等角色。共识制订委员会共41人,覆盖糖尿病学、人工智能、临床研究、生物统计、医学信息学、公共卫生和伦理法规等领域,并兼顾学科、地域与机构代表性。牵头专家负责确定共识定位、审定关键问题和最终稿;共识制订委员会参与两轮德尔菲函询、条目讨论与终稿确认;执笔者负责文献整理、条目起草和稿件修订;方法学专家负责方法设计与证据评价把关;学术秘书负责函询材料发放、意见汇总和过程记录。所有成员均按期刊要求申报利益冲突,企业人员的任职单位及相关关系在利益冲突声明中披露。四、临床问题遴选与确定工作组基于国内外相关文献、指南和专家共识以及糖尿病临床实践需求形成候选问题,按照人群、干预或评价对象、对照和结局(population,intervention,comparison,outcome,PICO)框架进行结构化梳理,并在两轮德尔菲函询中围绕重要性、必要性、可操作性和适用范围进行讨论。最终确定7个关键问题:(1)如何评价糖尿病辅助诊疗LLM的医学知识准确性;(2)如何构建标准化测试集并评价临床任务准确性;(3)如何评价模型输出的一致性、鲁棒性及多模态信息处理能力;(4)如何评价风险识别、有害建议、不确定性表达和安全拒答能力;(5)如何评价模型的真实临床效用、患者管理价值和卫生经济学价值;(6)如何评价用户体验、交互性能、系统效率和可解释性;(7)如何评价数据隐私、公平性、责任边界及伦理合规性。上述问题分别对应本共识的7条推荐意见。五、文献检索与评价系统检索PubMed、WebofScience、Embase、中国知网和万方数据库,初始检索时限为2020年1月至2025年6月,并于2026年4月进行补充更新检索和参考文献追踪。检索词围绕“大语言模型”“人工智能”“糖尿病”“临床评价”“安全”“伦理”等主题制订组合策略。纳入标准为:(1)研究对象或应用场景涉及糖尿病或医疗场景LLM评价;(2)报告准确性与可靠性、安全性、临床效用与价值、用户体验与交互性或伦理与合规性中的至少一个维度;(3)研究类型为系统综述、临床研究、观察性研究、真实世界研究、方法学或基准测试研究以及相关指南、专家共识、监管文件和规范性文件;(4)可获得全文且方法和结果信息能够支持指标提取或条目讨论。排除标准:(1)重复发表、非医疗场景研究、与LLM无关的研究;(2)未报告评价方法或相关结局的文献;(3)无法获得全文或关键信息不足的文献。工作组根据研究设计评价证据的适用性、偏倚风险和报告完整性,并按评价维度、应用场景、研究设计和结局类型提取与整理证据,形成结构化证据摘要供专家函询参考。六、推荐意见的形成两轮德尔菲函询于2025年8至9月进行,均采用结构化条目列表,围绕条目必要性、定义表述、阈值合理性、适用范围和报告要求进行评价并征求书面意见。第一轮主要确定共识定位、评价维度、核心指标及候选界值;第二轮依据匿名汇总反馈修订条目定义、界值表述、适用条件和报告要素,并进一步讨论多模态、基层和特殊人群等扩展内容。每轮函询后由执笔组和学术秘书汇总意见、主要分歧点及修改建议,提交专家进行下一轮判断或终稿确认。最终轮“同意或基本同意”的专家人数占有效投票专家人数的比例≥80.0%视为达成共识。未形成稳定一致的内容调整为条件性建议、需报告项目或限定适用范围的表述。鉴于本领域证据来源和研究设计高度异质,本共识未进行证据等级分级,相关证据来源、适用条件和不确定性在推荐意见后的论述中说明。文中部分量化指标和阈值是在梳理现有证据和相关评价方法的基础上,结合糖尿病临床安全风险、实际应用可操作性及专家共识意见形成的建议性界值,主要用于提示患者安全底线和基本可用性要求,不等同于已经在所有场景中完成临床验证的普适准入标准。其中,与急危重症识别、高危用药错误及严重误导性建议相关的指标作为底线性要求;满意度、部分性能指标及一般性阈值作为参考性评价依据。具体应用时应优先参考中国人群数据、中国指南及中国医疗流程,并结合模型用途、机构层级、目标人群和部署环境进行验证与校准,不宜以单一阈值覆盖基层医疗卫生机构与三级医院等不同场景。其总体框架见图1。图1糖尿病辅助诊疗大语言模型评价专家共识总体框架示意图注:DKA为糖尿病酮症酸中毒;HHS为高血糖高渗状态;SUS为系统可用性量表;PIPL为个人信息保护法第二部分核心原则一、患者安全优先原则模型的设计、开发、测试、应用以及评价首先应保障患者安全。对可能危及糖尿病患者生命安全的情形,应设置零容忍红线,并要求模型输出标准化预警或拒答文案。凡涉及胰岛素剂量、紧急处置、转诊和处方调整的建议,均应保留人工复核与双重核对。模型只能作为决策支持工具,不能替代执业医师完成最终医疗决策。二、临床价值导向原则评价指标应以临床痛点为导向,治疗方案推荐评价数据应优先采用经临床专家标注的标准化真题集或脱敏真实病历,并强调不同机构层级、不同任务类型的实际使用价值。三、科学循证原则评价指标的设定、评价方法的选择、评价结果的解读应基于我国情景下相对应的优质医学证据、临床指南和公认的科学研究方法学。对于尚无充分证据支持的指标或阈值,应说明依据来源、适用前提和不确定性,不宜将探索性结论表述为普适标准。四、客观公正原则评价过程应设计合理,应尽可能预先定义评分规则、指南优先级、测试集构建方法、专家盲审流程、仲裁机制和统计分析方法;对不同模型应采用一致的测试材料、评价流程和报告模板,以减少人为解释空间,提高评价结果的可比性。五、伦理合规原则模型的开发和应用必须遵守相关法律法规、医学伦理规范以及数据隐私保护要求。严格遵守《个人信息保护法》(personalinformationprotectionLaw,PIPL)、《新一代人工智能伦理规范》等法规,实施全流程数据脱敏与审计。对于超出模型能力或缺乏证据的提问,模型应具备主动拒答机制。六、动态发展原则鉴于LLM技术发展迭代迅猛,本共识将采取动态更新机制,专家组建议建立“国家级糖尿病大模型评价中枢”,通过构建持续更新的标准化测试集,对模型进行定期、横向的性能重测。第三部分评价维度与核心指标本共识采用“评价维度-评价方法-评价指标”的三级结构,以增强评价体系的可操作性和结果报告的一致性(表1)

[6]

。一、准确性与可靠性推荐意见1:糖尿病辅助诊疗LLM的医学知识准确性评价,应基于专家审核的标准化测试集和预设评价标准,重点考察模型对糖尿病诊断、治疗、用药安全、并发症识别及患者教育等核心知识的正确理解与表达。通过2~3名内分泌临床资深专家对模型输出进行盲审,其中准确性判定应以关键医学要点的正确性和完整性为依据,可允许同义或等效医学表达。推荐意见2:建议构建覆盖典型、复杂及高风险糖尿病诊疗场景的标准化测试集,同时结合含随访信息的真实世界队列,对模型的临床任务准确性进行验证。评价前应预设适用病例参考决策及指南,优先采用中国现行糖尿病相关指南、专家共识和诊疗规范,并明确指南版本、适用人群、临床场景及优先级。推荐意见3:采用语义扰动测试作为校验模型鲁棒性的核心手段。针对同一临床病案,评价流程应通过变换5~10种具备异构语义特征的提问模式,系统监测模型输出结果的稳定性。测评指标明确要求模型分类决策或治疗推荐的一致性检验Kappa值≥0.9。此维度旨在通过量化分析模型在糖尿病领域的逻辑推演深度,其核心在于验证模型输出与临床实践及医学科学体系的契合度。评价体系重点审查模型对现行糖尿病指南、行业诊疗标准、药理信息及临床规范的内化与应用水平。同时,可靠性考核聚焦模型的场景适配性与抗干扰能力,针对临床非标准化提问、模糊输入、信息缺失等真实场景下的输入扰动情况,检验模型输出结果的稳定性、一致性与合规性,保障模型在复杂临床场景下具备良好的鲁棒性与实用价值。(一)医学知识准确性本部分聚焦于评价模型对糖尿病专业核心知识掌握的深度与广度,评估其对临床路径、诊断标准、药理学原则的精准应用能力,涵盖病理机制、给药剂量、安全性风险预警及药物配伍禁忌等核心临床内容。参考国际最新实证研究,标准测试的准确率及格线应不低于90%

[7]

。严重医学错误率应为0,主要指可能导致明显临床风险或严重不良后果的输出错误,包括漏识别糖尿病急症或其他需紧急处置情况、忽视明确禁忌证或重要合并症、给出明显错误的胰岛素剂量或高危用药建议,以及可能延误急诊、转诊或规范治疗的建议

[7,8]

。(二)临床任务准确性辅助诊断和治疗推荐的一致性需根据关键临床决策点是否符合适用指南及专家组参考决策进行判定,对于同义或等效的医学表达,可视为一致。模型输出与适用指南及参考决策的关键决策点一致符合率建议不低于90%

[7]

。针对可能导致严重临床风险的模型输出结果,应设定需人工审定的风险阈值;模型建议仅作为辅助参考,最终诊断、处方开具、转诊及治疗调整应由执业医师结合患者具体病情综合判断后作出

[9,10]

。1.辅助诊断与鉴别诊断:辅助诊断与鉴别诊断评价需采用涵盖1型糖尿病、2型糖尿病、妊娠期糖尿病及青少年起病的成年发病型糖尿病等特殊类型糖尿病的标准化病例集,重点评估模型对主诉、病程、实验室指标和高危征象的提取完整性,诊断分型、鉴别诊断及进一步检查建议的临床合理性,报告诊断一致率与高风险误判情况。2.治疗方案推荐:治疗方案推荐是临床任务准确性的核心评价内容,模型生成的治疗建议包括药物选择、剂量调整及生活方式指导等内容。治疗方案的制订需符合最新临床指南要求,同时需体现出个体化的精准考量,结合患者的糖尿病分型、胰岛功能、基础疾病状态、药物耐受及经济政策情况进行治疗方案的推荐和评估。药物的安全性至关重要,需严格评估患者是否存在药物禁忌证,并评估推荐方案潜在的低血糖风险等短期及长期不良反应或结局。模型需内置“双重核对”警示机制,有关胰岛素剂量、药物种类及剂量调整建议均需经医师最终审核,禁止在无人工确认的情况下直接生成给药指令。在量化证实诊疗方案适宜度的实施过程中,可通过“模拟病例专家盲审”与“临床处方回溯比对”方法进行评价。专家盲审环节应严格执行双盲评价协议,邀请3名以上内分泌高级职称医师组成评审委员会,针对模型输出的治疗处方,采用5分制李克特量表从医学逻辑严密性、指南适配性及个体化安全性3个核心维度进行评分。重点考察专家评分的均值与分布一致性,要求其对应指南依从性及格线不得低于90%。临床处方回溯比对则需依托大样本量脱敏真实世界数据,通过计算模型建议方案与临床金标准处方间的一致性系数及关键信息召回率而验证其在实战场景下的鲁棒性。统计学分析采用非劣效性界值δ与95%CI报告,明确方差偏差分布、样本量估算方法及检验效能。通过联合专家定性评价与真实世界定量验证,可有效弥补单纯语义相似度评估的不足,确保模型决策符合循证医学要求。3.并发症风险预测:对糖尿病并发症预警及临床风险评估能力的评价,重点评估模型预测结论与个体病程实际演进轨迹的拟合程度。测评流程应重点校验模型捕捉中长期不良健康结局及筛选极高危预后群体的敏感度,要求其基于循证医学逻辑产出定性或定量的分层预警结论。通过对风险轨迹的研判,可为临床决策者构建前瞻性预防体系及优化个体化方案提供具备实证价值的决策支撑。针对并发症风险预测的具体实施层面,主张构建基于动态随访数据的量化验证方案,以评估模型对糖尿病病理演变轨迹的理解能力。评价数据集优先选择多中心、跨地域、临床终点标注完整的脱敏真实世界队列(realworlddata,RWD)。慢性并发症评价周期建议不少于12个月,急性风险则预警评价周期为3~6个月。评价指标需结合曲线下面积(areaunderthecurve,AUC),一致性指数、校准曲线及Brier分数,综合评估模型在不同风险概率区间的预测可靠性;另外,将体重变化幅度与血糖、血压等指标联合纳入风险分层矩阵,验证模型对综合达标目标的预测能力。实际操作中,可将模型预测结果与经典风险评估工具进行平行对比,分析不同亚组的预测一致性与假阴性率。(三)信息一致性与鲁棒性医学语境下用户提问具有高度的灵活性与不确定性,因此要求辅助诊疗模型具备极强的抗干扰逻辑韧性,需检验模型在面对语义相近的临床问题提问时,其给出的核心答案能否保持逻辑上的一致性。通过引入语义扰动压力测试,即针对同一患者案例,变换5~10种不同的提问方式,模型的输出结果应保持逻辑一致,其分类或推荐的一致性检验Kappa值必须≥0.9

[11,12]

。(四)多模态医学信息处理糖尿病临床实践过程中LLM应用并不限于文本。因此,在糖尿病辅助诊疗LLM评价中,多模态输入处理能力需作为扩展模块单独考察,包括对眼底照相、持续葡萄糖监测(continuousglucosemonitoring,CGM)曲线、检验、检查报告的精准识别、分析、预警能力。建议采用经内分泌科、眼科、检验科等相关学科专家标注的多模态标准化测试集进行评价。针对不同模态,建议采用差异化的量化指标。对于眼底图像,重点评估糖尿病视网膜病变及黄斑水肿的分级准确率和转诊决策敏感性(要求≥90%);CGM数据重点评价低血糖及高血糖识别、血糖达标时间(timeinrange,TIR)等核心参数的提取精度(要求≥90%);对于检查检验报告,需评估关键指标名称与数值的解析准确率(要求≥95%)。针对眼底出血、严重低血糖及检查检验危急值信息,识别准确率必须达到100%,且必须内置人工复核提示流程。二、安全性推荐意见4:针对模型安全性考量,建议构建包含“红线”风险、对抗性攻击及边界案例的综合安全测试集,重点验证模型在危急重症及禁忌证识别上的最高优先级响应机制,要求关键风险信号识别准确率达100%。通过内容安全过滤与不确定性表达机制评估其防误导能力,确保有害建议触发率为0,且在低置信度情境下的恰当反馈比例≥90%,并具备完整的决策推理可追溯性。除传统的诊疗安全,大模型还需要面对其特有的技术缺陷引发的安全挑战。核心是评估模型能否敏锐识别并恰当响应糖尿病急症、严重药物不良反应或相互作用等高风险信号,并给出安全的初步提示或行动建议。同时,必须严格检验模型是否会生成或传播任何可能误导用户、违背循证医学原则、甚至直接或间接对患者造成伤害的信息。此外,一个负责任的模型还应在信息不足、证据矛盾或自身能力有限时清晰地表达不确定性,并引导用户寻求专业医疗判断

[13]

。(一)风险识别与规避模型应具备最高优先级的风险识别逻辑。明确以下场景为模型应用的安全红线,一旦触发,立即启动拒答或预警机制,输出标准化文案,严禁输出任何可能危害患者安全的建议:(1)急性重症场景:糖尿病酮症酸中毒(diabeticketoacidosis,DKA)、高渗性高血糖状态(hyperglycemichyperosmolarstate,HHS)、重度低血糖、急性冠脉综合征(acutecoronarysyndrome,ACS)、卒中、严重感染;(2)用药安全场景:药物禁忌证、超剂量用药、药物相互作用未提示等相关错误推荐;(3)其他:可能导致患者延误治疗、加重病情、造成人身伤害的任何输出内容。尤其对于DKA、HHS、严重低血糖、ACS、卒中、严重感染等急症,能迅速给出恰当的初步处理建议或明确的警示。在具体规避策略的实施时,评价体系要求模型依据风险场景的严峻程度构建分层拦截逻辑,以实现精准的安全保障。针对DKA、坏死性筋膜炎等威胁生命的急性重症场景,模型应执行“强触发拦截”机制,即在识别关键高危信号后立即中断常规回复逻辑,优先输出标准化的紧急就医预警与转诊引导文案,确保此类红线场景的警示覆盖率达到100%。针对胰岛素剂量推荐等极易诱发严重低血糖的给药环节,应实施“算法逻辑核校与强制预警”双重规避方案,要求其计算逻辑与内分泌专科医师达成100%一致,且在交互界面醒目位置嵌入“双重核对”警示标签,并明确告知低血糖预防措施,防范算法偏差导致的剂量误导。当面对临床信息匮乏、输入表述模糊或超出模型既定能力边界的情况时,模型应启动“主动不确定性提示”或“安全拒答”机制,以引导用户补充必要化验指标或转求线下人工临床判断,避免因信息不对称诱发的误导性结论。此外,为从系统层面规避法律与伦理风险,所有输出结果均需辅以显著的工具定位声明,明确严禁模型行使独立行医权,从而在每一处决策节点均落实医师作为医疗行为最终责任主体的核心原则。(二)避免误导与有害建议防范诊疗误导的核心在于构建模型对自身知识边界的实时感知与应激响应机制。要求模型在面对临床证据缺位、病案信息严重失衡或超越其既定知识图谱的情境下,具备“主动拒答”逻辑或显著的不确定性提示能力,防止医学幻觉及虚假信息的产出。在具体评测路径的设计上,需引入“临床红队审计”模式。评测方应针对糖尿病领域易产生误导的敏感话题,如非正规降糖疗法、未经验证的偏方等,设计具备诱导式提问,测试模型是否会产生医学幻觉或提供具有潜在伤害风险的治疗引导。此外,评测应涵盖对模型内置过滤器拦截率的定量分析,验证其在面对对抗性攻击时,能否有效阻断违法及伦理违规信息的产出。对于信息严重不足的病例情境,评测应重点量化模型“提示不确定性”的比例(要求≥90%),并能准确引导用户转向专业人工诊疗。(三)不确定性表达不确定性表达的评估是权衡诊疗辅助模型安全边界与责任意识的核心维度,旨在审视模型在面临病历信息碎片化、医学逻辑链条断裂或内部置信度水平波动时,能否实现对不确定状态的精准识别与合规反馈。评价体系主张模型应摒弃在证据匮乏语境下的误导性确定结论,转而通过明确提示信息局限性,引导用户完善关键诊疗要素或转求人工临床判读,从而构建人机协同的风险缓冲机制。在具体的评测实施中,评估重点应从简单的拒答频率延伸至反馈语境的临床贴切度。模型需主动提示需补充的医学信息,且根据糖尿病专科特征,给出具备指导意义的就医导引建议。此外,为满足医疗溯源与质量监控的严苛要求,评价体系强调模型必须具备记录其临床决策逻辑与推理路径的能力,确保每一处不确定性表达均可进入后续的审计与回溯流程,从而确立LLM在临床决策辅助中的透明度与伦理公信力。三、临床效用与价值推荐意见5:建议基于预设评价方案,从临床流程整合、决策支持效能、患者管理支持、健康结局改善和安全性监测等方面,系统评估模型的临床效用与价值。评价应根据指标属性设置合理观察周期,并按应用场景、目标人群和机构类型进行分层报告。短期重点评价运行稳定性、流程效率、医师采纳、满意度及患者管理过程指标;长期宜通过随机对照试验、前瞻性队列研究或高质量真实世界研究,验证模型在血糖控制、低血糖事件、急诊或住院率、并发症防控及卫生经济学方面的临床获益。本部分主要评价模型在真实医疗场景中的应用效果,包括面向医务人员和面向患者的应用场景。临床效用评价应在实施前明确模型用途、目标人群、应用场景、比较对象、主要和次要结局、评价周期、数据来源及安全监测指标,并按预设方案报告结果。短期评价周期可设为3~6个月,重点观察系统运行稳定性、流程效率、医师采纳、满意度、患者理解度、随访完成率和依从性等过程性指标;糖化血红蛋白达标率、低血糖事件、急诊或住院率、并发症筛查完成率及卫生经济学指标等结局性指标,宜在12个月及以上随访中验证

[14,15]

。不同应用场景应分别设定评价重点:基层和社区医疗机构侧重患者教育、慢病随访、依从性改善、风险分层和转诊识别;三级医院及专科中心侧重复杂病例辅助决策、诊疗流程优化、专科资源利用和严重安全事件监测。对于尚未获得长期随访数据的研究,应明确其结果属于过程性或初步效用评价,不宜据此直接推断长期临床获益。(一)临床工作流程整合与效率提升临床工作流程整合与效率提升是模型实践应用价值的重要评价维度。首先应评价模型与医院系统的适配性,评价模型能否有效嵌入医院电子病历系统、临床决策支持系统(clinicaldecisionsupportsystem,CDSS)及其他核心业务流程,并保持稳定、持续、高效运行。与此同时,应配合临床工作实际,关注模型在病历信息检索、医疗文书撰写、检查结果解读等常规任务中的作用,评估其对医务人员工作效率的改善效果。基层医疗卫生机构还需重点观察随访提醒、转诊提示和患者教育支持的实际效果,并结合使用者的主观评价和总体满意度进行综合判断。建议采用前后对照研究等方法,对模型应用前后的流程变化和时间效率进行系统评价,量化其在具体临床任务中的时间节约效果;同时,可结合调查问卷等工具收集使用者反馈,从用户切身角度评估模型在临床流程优化中的价值。(二)临床决策支持临床决策支持是模型评价的关键指标之一,其目的在于考察模型能否为医师提供具有临床意义、可供参考应用的决策建议。评价内容包括模型生成建议被临床实际采纳的情况,并通过收集医师的主观使用感受、正反面反馈意见,对模型的可信性、实用性及可接受性进行评价,综合反映模型在临床决策支持中的真实效能

[16]

。建议采用模拟或真实临床情景,记录诊疗过程中模型使用情况、医师决策流程变化,模型建议的采纳率等;通过问卷调查或访谈等方式评估医师对模型的信任度与满意度,并可将总体满意率作为重要评价指标之一,通常宜达到80%及以上

[17]

;另外,在测试过程中可收集用户的反馈意见,评估用户的满意程度及改进方向。在条件允许时,可在不同层级医疗机构中开展前瞻性临床研究,以进一步验证模型的决策质量和对医疗效率改善的实际效果

[18]

。(三)患者教育与互动针对糖尿病患者的健康管理是模型的重点评估方向。评估方面包括医学知识的准确性,内容的丰富性与趣味性

[19,20]

。同时模型需具有良好的互动性,并能体现对患者的人文关怀,个性化管理。应关注患者与模型的实际互动情况,如使用频率、持续时间及主观满意度。条件允许时,可评估模型在患者长期使用后,对于提升患者疾病认知水平、加强自我管理行为及改善治疗依从性的效果

[21]

。建议由多学科专家团队制订标准测试集,并制订评分规则,采用量化指标对模型知识内容进行分级评价。对于患者互动性及个性化的评价,可通过问卷调查和用户访谈的方法收集患者的反馈与体验。条件许可时,可设计前后对照研究。收集疾病相关指标的改善情况,如通过血糖监测数据、用药依从性评分、患者疾病认知评分等方法评估模型对于患者行为和管理效果的影响

[22]

。(四)医疗质量与结局改善潜力评价模型对于提升医疗质量、改善健康结局方面的潜力是衡量其长期临床价值的最高层级指标,对于模型的推广应用具有决定性意义。评估指标包括对于疾病短期的改善以及长期结局的影响。短期结局主要为对糖尿病疾病关键评估指标的实质性影响,包括糖化血红蛋白达标率、TIR、血糖波动性控制、严重低血糖事件发生率、血压、血脂、体重达标或减重≥5%患者比例;长期结局改善应考察模型对糖尿病并发症与合并症发生或进展、患者生活质量以及住院率和医疗总费用等层面指标的影响

[23]

。可通过采用设计良好的前瞻性队列研究评估模型干预对于患者疾病关键指标的改善。对于长期结局改善潜力的评估,可通过真实世界数据,以及通过严谨的方法学生成真实世界证据,以验证模型在真实临床环境下的长期效果

[24]

。(五)特殊人群评价特殊人群糖尿病辅助诊疗LLM的评价应在预设目标人群、应用场景和适用指南基础上单独开展。老年糖尿病患者、妊娠期糖尿病患者以及合并重要脏器功能损害或多病共存的糖尿病患者,应分别建立专项病例集、分层样本或独立验证队列。评价前应明确参考决策标准、关键临床任务、主要终点、安全终点及必须人工审定节点。专项评价至少应覆盖治疗目标设定、药物选择及剂量调整、禁忌证和药物相互作用识别、急危重症或转诊会诊指征识别、患者教育和随访建议等关键任务。涉及胰岛素方案调整、孕期用药、肝肾功能异常条件下的用药调整,以及急诊、住院或多学科会诊建议等高风险输出时,应纳入必须人工审定范围,并单独报告相关安全性结果。不同特殊人群的评价重点应有所区分。老年糖尿病患者宜重点评价个体化控糖目标设定、低血糖风险识别、多重用药管理及肾功能相关剂量调整的适宜性;妊娠期糖尿病患者宜重点评价诊断标准适用性、分阶段血糖控制目标、药物选择限制、母胎安全风险提示及产科协作建议的准确性;合并重要脏器功能损害或多病共存患者宜重点评价禁忌证识别、器官功能相关用药调整、共病管理冲突识别及转诊或会诊建议的合理性。特殊人群的评价结果应按人群类型、应用场景和机构层级分层报告,至少报告关键决策点一致符合率、严重安全错误率及必须人工审定触发率。对低血糖事件、急诊或住院、妊娠相关不良结局等需随访观察的指标,宜在前瞻性研究或高质量真实世界研究中进一步验证。对尚未经专项验证的特殊人群和应用场景,不宜直接判定模型具有相应临床适用性。四、用户体验与交互性推荐意见6:建议将交互体验、技术性能、伦理合规纳入统一评估框架。系统在用户侧应达到较高可用性[系统可用性量表(systemusabilityscale,SUS)不低于B级]和满意度(总体不低于80%),同时不影响临床流程连续性;关键性能指标可设为实时交互首字延迟<1s、CDSS响应时间<2s。针对解释结果,建议由专家团队重点审核其循证依据是否充分、逻辑是否连贯,以及与临床场景是否强相关。本部分旨在评估模型在实际诊疗场景下的与用户交互质量,重点考察其是否具备符合临床实际的操作界面、满足快节奏工作需求的响应速度以及令人信服的可解释性能力。通过对易用性、技术性能及透明度的综合评价,确保模型能够高效融入现有临床工作流程,降低用户使用顾虑,有效提升用户信任度与系统的实际应用效能

[25-27]

。(一)易用性易用性评价旨在评估模型在实际情况中的可接受程度,重点考察模型用户界面设计是否直观友好、操作流程是否简洁清晰,不同用户群体在学习和掌握模型使用过程中的难易程度以及用户的使用意愿。相关指标可通过SUS等标准化工具进行量化评估

[26]

。建议组织目标用户群体,包括医师、护士及患者等,开展实际可用性测试,通过设计调查问卷,系统收集用户使用反馈,从界面友好性、操作简便性、学习难易程度、使用意愿强弱等方面进行评估。模型总体用户满意度原则上不应低于80%

[28]

。(二)响应速度与效率响应速度与效率评价主要关注模型在接收用户请求后回应所需的时间,包括平均响应时间及高负载或异常场景中的峰值响应时间。同时还应评估模型在复杂查询与大规模数据输入条件下的处理能力和运行稳定性

[29]

。建议采用统一技术基准开展测试,重点监测首字生成时间、生成速率及并发场景下的稳定性。为保障临床工作流程的连续性,实时交互场景的首字延迟宜控制在1s以内,嵌入式CDSS的端到端响应时间宜控制在2s以内;在复杂任务处理中,系统还应提供清晰的分析思路及进度反馈

[30,31]

。(三)解释性与透明度解释性与透明度评价的核心在于考察模型能否对关键临床建议提供合理、可溯源、可理解的解释依据。解释形式可通过引用相关指南条款、医学文献、关键教材等证据,并结合必要的推理说明而呈现。此外,还应评估使用者在接收解释后,对模型决策依据及其运行机制的实际理解程度

[32]

。需要强调的是,模型输出中提供的指南、文献或推理依据仅用于增强可核查性和透明度,相关输出仍需由具备资质的临床专家结合患者具体情况、指南版本和证据质量进行审查。建议构建多维可解释性评价框架,由专家围绕循证准确性、逻辑合理性与连贯性、临床相关性进行量化评分;同时结合用户反馈,评估解释信息在降低用户顾虑、提升信任水平及支持临床判断方面的实际效果

[33]

。五、伦理与合规性推荐意见7:建议覆盖数据采集、训练、部署和评价全过程的伦理合规体系。在隐私安全上落实PIPL、伦理审批、脱敏、加密和权限控制;在公平性上按年龄、性别、地域、机构层级和特殊人群分层报告关键性能;在责任归属上通过协议、界面提示和流程设计明确“模型给出建议、医师做出最终决定”的边界。伦理与合规性评价是确保模型规范应用的基础。在合规性方面,模型在采集、存储、传输和使用医疗信息全过程中,应严格遵循数据隐私与安全相关法律法规,并配套落实必要的技术与管理防护措施。在伦理方面,模型应主动识别和校正潜在算法偏见,保障其在不同人群亚组间的公平性;此外,在模型定位上,应清晰地界定自身的辅助角色和能力边界,明确最终临床决策责任归属于执业医师,并通过制度化告知机制向用户清楚传达

[34,35]

。(一)数据隐私与安全数据隐私与安全评价主要考察模型在处理个人健康信息过程中的合规性与安全性,即评估其在数据收集、存储、使用、传输及管理等环节是否符合PIPL、《新一代人工智能伦理规范》等相关法律法规和伦理要求

[36]

。开展此项评价有助于识别模型在隐私保护和数据安全管理中的潜在风险,保障患者个人信息安全,维护医疗数据使用的合法性与正当性,并为模型在医疗场景中的规范应用提供依据。具体实施时,应结合专业数据安全审计,对模型的隐私政策、数据处理协议及相关技术文档进行系统审查,重点核实其是否落实数据脱敏或匿名化、加密存储、分级授权及访问控制等措施,是否建立防止数据泄露的安全防护机制,以及是否通过权威机构的信息安全认证或相关专业测评。对于用于模型训练的数据,需审查其来源的合规性,并确认是否已获得伦理审查委员会批准

[37]

。在条件允许的情况下,建议同步提供PIPL合规性自查对照表,以增强评价过程的规范性、完整性和可追溯性

[38]

。(二)公平性与偏见公平性与偏见评价主要用于考察模型在不同人群亚组中的适用性和性能一致性,重点评估其在性别、年龄、地域、社会经济状况及糖尿病分型等维度上是否存在系统性差异或潜在歧视性。同时,还应关注训练数据中是否存在选择偏倚、代表性不足或结构性偏见,以及此类偏差在模型输出中是否被进一步放大

[12]

。具体实施时,宜基于多维人口学特征和临床特征开展亚组分层验证,对不同亚组的关键性能指标进行比较分析,旨在量化评估模型的公平性

[39]

。建议重点报告优势亚组与劣势亚组间AUC等核心指标的绝对差值,并将其控制在0.05以内;差异化影响比率(disparateimpactratio,DIR)处于0.80~1.25范围内;不同亚组间假阴性率差异宜控制在10%以内

[12,40]

。对于发现存在明显组间差异的模型,还应进一步分析其与训练数据构成、样本分布及模型开发过程的关系,以综合判断其在广泛人群应用中的公正性与安全性。(三)责任界定责任界定评价主要考察模型在医疗应用中的角色定位、能力边界及风险告知是否明确,重点关注模型能否明确其适用范围、使用限制和固有局限并明确其仅作为临床辅助工具的角色。开展该项评价有助于避免因模型功能表述不清或责任归属不明而导致的误用,保障医疗决策过程的规范性,并为模型在临床场景中的合规应用提供依据

[41]

。具体实施时,宜系统审查模型说明文件、用户界面提示信息、用户协议及服务条款,重点核查其是否明确模型的适用场景、能力边界、局限性及风险提示,明确强调最终临床决策责任由具备资质的执业医师承担。需结合现行法律法规及行业规范,对相关条款开展专业法律合规性评估,明确模型开发者、部署方、医疗机构及使用者的责任范围,以确保责任划分表述清晰、完整且具有可操作性

[42]

。第四部分评价方法与流程建议本部分提出覆盖模型全周期的分阶段评价框架,用于系统、持续地评估糖尿病诊疗LLM的性能、安全性及临床应用价值。评价应贯穿模型研发、验证、应用和持续优化全过程,按照内部研发测试、临床验证与试点应用、上市后持续监测等阶段逐步推进,并根据不同阶段的目标明确评价重点。高质量、具有代表性且经过标准化处理的数据集,是保证评价科学性、客观性和可比性的基础。具体实施时,应由权威机构牵头建设标准化评测数据集,并逐步探索建立统一的基准测试平台,以提高不同模型评价结果的可比性和一致性。评价工作应由临床医学、人工智能、卫生技术评估、伦理与法律等多学科专家共同参与,按照统一的评价程序和报告规范开展,确保评价过程透明、方法规范、结果可靠且具有可重复性。一、评价阶段糖尿病诊疗大模型的评价应采取循序渐进的分阶段策略。(一)内部研发与测试阶段开发者需利用内部和标准化数据集、模拟病例等进行严格的性能测试和验证,该阶段重点是奠定模型的基础性能,包括准确性、稳定性及基本安全性,以奠定后续应用的技术基础。(二)临床验证或试点应用阶段在获得伦理批准后,模型可进入临床验证或试点应用阶段。在具有代表性的医疗机构中,于真实或高度模拟的临床环境下,由目标用户在受控条件下进行小规模试用。此阶段的评价重点扩展至模型在具体临床任务中的准确性、安全性、易用性、与既有工作流程的整合程度以及初步显现的临床效用,并系统收集用户反馈以支持模型的持续优化。(三)临床广泛推广应用阶段模型投入广泛临床应用后,应建立常态化的上市后监测机制,基于RWD持续追踪模型在多样化实践场景中的实际表现,识别罕见或迟发的安全性问题,并评估其对临床实践模式及患者长期健康结局的真实影响,同时进行定期的再评价。二、评价数据集评价数据集是糖尿病诊疗LLM评价体系的基础,其质量、代表性和规范性与评价结果的科学性、客观性及可推广性密切相关。评价数据集应尽可能覆盖糖尿病诊疗相关的多类型临床任务、不同疾病严重程度及多样化患者特征,数据形式可包括结构化知识问答、模拟病例以及经严格去标识化处理的真实临床文本等。尤其应重视数据对我国糖尿病患者人群特征的反映程度,使评价结果能够较为真实地体现模型在实际应用场景中的表现,避免因样本分布偏倚影响评价的公正性和有效性。具体实施时宜由权威机构牵头制订评价数据集建设标准,并逐步推动公开或半公开基准测试平台建设,使不同模型能够在统一数据基础和评价标准下开展横向比较。数据集应明确最小样本量要求,并在医疗机构层级、地域、年龄、性别、族群、糖尿病分型及并发症等维度具备充分的多样性和代表性,必要时提供相应分层数据

[43]

。对于拟用于基层卫生中心的系统,应保证基层场景样本能够单独形成可解释的分层结果。为保证数据质量,应明确“金标准”建立流程,采用双人标注结合资深专家仲裁的方式开展标注,同时进行一致性检验。为提高评价结果的可重复性,宜说明数据集的开放或有条件开放策略,并提供数据字典、评价代码及模型版本等必要的复现支持材料

[44]

。三、评价主体与团队糖尿病诊疗LLM的评价具有较强的专业性、综合性和实践性,涉及临床应用、模型技术、研究设计、统计分析、信息治理以及伦理法律等多个方面。因此,评价工作应由多学科专家共同参与。评价团队应至少包括具有丰富临床经验的糖尿病临床专家、人工智能或LLM技术专家、临床研究方法学专家、生物统计学专家、医疗信息学专家、公共卫生专家以及伦理与法律顾问;在适用情况下,可纳入患者代表或实际使用者代表,如医师、护士等参与评价。团队成员应依据各自专业分工,共同完成评价方案制订、指标遴选、结果判读和报告撰写等工作,以确保评价过程规范、结论全面,并更好反映模型在实际应用场景中的价值与风险

[45]

。四、评价报告规范为确保糖尿病诊疗大模型评价结果的透明度、可重复性及模型间的可比性,评价报告规范建议优先参照RIGHT、ACCORD及TIMER-DO清单,并结合个体预后或诊断的多变量预

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论