肿瘤真实世界研究的设计策略与分析技巧2026_第1页
肿瘤真实世界研究的设计策略与分析技巧2026_第2页
肿瘤真实世界研究的设计策略与分析技巧2026_第3页
肿瘤真实世界研究的设计策略与分析技巧2026_第4页
肿瘤真实世界研究的设计策略与分析技巧2026_第5页
已阅读5页,还剩11页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

肿瘤真实世界研究的设计策略与分析技巧2026一、肿瘤真实世界研究背景随机对照试验(randomizedcontrolledtrial,RCT)是医学研究的金标准,但其设计方法较为理想化,研究对象的选择存在局限性,与现实世界中的临床实践存在较大差异。真实世界研究(real-worldstudy,RWS)使用来源于医疗实践的真实世界数据(real-worlddata,RWD),通过合理的设计策略与分析技巧生成真实世界证据(real-worldevidence,RWE),具有特殊优势。自20世纪70年代以来,监管机构已开始使用RWE来支持罕见疾病新疗法的批准。2016年,美国食品药品监督管理局(FoodandDrugAdministration,FDA)通过《21世纪治愈法案》,允许使用RWE替代传统临床试验,以支持扩大适应证的审批。2020年,中国发布了《真实世界证据支持药物研发与审评的指导原则(试行)》,加速了RWS在创新药研发中的应用。截至2023年,中国注册的RWS数量在全球处于领先地位,其中约1/3涉及肿瘤领域。本文以肿瘤领域为切入点,从数据源选择、研究设计类型等方面探讨肿瘤RWS的设计策略,并介绍关键数据分析技巧,旨在为RWS研究者提供方法学支持,同时阐明当前面临的挑战并展望未来发展方向。肿瘤是我国面临的重大公共卫生挑战,近几十年来,由于人口老龄化等原因,中国的恶性肿瘤负担一直在增加,患者群体庞大。在肿瘤领域的传统RCT研究中,肿瘤患者参加临床试验的比例<5%,入组和患者代表性面临挑战。罕见肿瘤因样本量不足而限制了RCT结果外推,因此,亟需开展真实场景下更大样本量的研究,利用大规模数据加速标志物发现,为肿瘤领域提供RWE。在肿瘤治疗领域,RCT通常评估单一疗法,而真实世界中的临床实践往往更为复杂。由于肿瘤患者随访长、病情动态变化,临床医师常需采用联合治疗或多线序贯治疗策略。RWS能够分析不同治疗策略(包括序贯方案)对患者的治疗模式及疗效的影响,揭示因费用、不良反应或医疗可及性导致的治疗中断现象,从而更全面地评估实际临床环境中影响疗效的因素。随着肿瘤靶向治疗、免疫治疗等创新疗法的快速迭代,RWS还可弥补传统临床试验在时效性方面的不足,如Liu等通过RWS发现,在晚期肝细胞癌患者中,程序性死亡受体1(programmeddeath-1,PD-1)抑制剂联合仑伐替尼较单药治疗具有更优的生存获益,为临床决策提供了重要依据。随着分子生物学和基因组学的发展,肿瘤分子分型日益精细,即使组织学类型相同,基于分子特征定义的亚型患者对治疗的反应也可能存在显著差异。这使得采用传统RCT确定药物疗效面临挑战,而RWS则能够有效揭示不同分子亚型间的疗效差异,如Pham等基于病历数据,比较了阿法替尼在携带表皮生长因子受体(epidermalgrowthfactorreceptor,EGFR)G719X突变的晚期非小细胞肺癌患者与携带其他罕见EGFR突变患者中的疗效。二、肿瘤RWS的设计策略:在肿瘤研究领域,RWS通过整合临床实践中的多维数据,全面反映抗肿瘤治疗在真实医疗环境下的实际应用效果,其设计过程需系统考量数据源选择、研究方向、设计类型及终点指标等核心要素。通过完整的研究设计策略、统计分析以及偏倚控制获得RWE,为临床决策、卫生政策制定及精准医学实践提供关键证据(图1)。1.

肿瘤RWS数据源选择:RWD来源渠道多样,不同数据源各具特点,了解RWD来源的潜在差异是正确选择和有效使用RWD进行肿瘤研究的核心。Penberthy等提出了一个概念模型,用于指导为特定肿瘤相关研究问题选择真实世界数据源。首先,要明确研究问题,可以使用PICOTS框架(人群、干预、对照、结果、时间和场景)清楚地确定研究问题的关键组成部分。其次,需要了解每个数据源内容和目标人群覆盖范围,如电子健康数据(electronichealthrecord,EHR)包含大量临床信息,涵盖结构化数据与非结构化数据,但只能体现患者的部分纵向轨迹,因为肿瘤诊疗过程可能在具有不同EHR系统的多个机构进行,跨系统互通还不完全;国家肿瘤登记数据,数据质量相对较高,是RWD的重要来源之一,其变量定义和质量标准遵循《中国肿瘤登记数据集标准》,但缺乏治疗信息及死亡以外的结局信息,可通过与医院信息系统等数据源的关联研究来解决缺陷,如Zhu等在进行中国和美国食管癌临床病理及治疗情况比较时,利用电子病历和肿瘤登记数据来收集中国食管癌患者人口统计学、生活方式、临床病理特征信息和治疗方式。肿瘤疾病信息复杂多样,1个RWD来源可能无法集齐所有相关数据,有些数据源未必能获取完整,因此整合基因组测序、药房记录、医学影像及病理报告等的多模态数据源,可以提供更为全面且实时的观察视角。最后,评估数据源与研究问题的相关性,了解数据生成的原始目的,评估数据质量,高质量、可靠的数据需具有肿瘤学经验的人员进行更多审查,可参考美国FDA发布的《FDA真实世界证据计划框架》和中国国家药品监督管理局发布的《真实世界证据支持药物研发与审评的指导原则(试行)》中的方法进行数据源的适用性评价,密切关注数据的相关性和可靠性,相关性从RWD是否与所关注的临床问题密切相关进行考虑,可靠性从RWD数据的完整性、准确性、数据来源收集治理是否透明以及数据的质量保证进行综合评估。2.

肿瘤RWS研究方向:RWS范围可覆盖肿瘤全生命周期,从预防、发生发展到治疗与预后。在肿瘤基础特征研究阶段,RWS可通过整合EHR和基因组等数据揭示肿瘤流行病学特征和分子异质性。在肿瘤治疗环节,RWS包含三大方向:(1)药物研发与评价:通过观察性研究或实用性随机对照临床试验(pragmaticclinicaltrial,PCT)生成RWE,支持新增适应证的批准与拓展。(2)治疗方案优化:通过对比真实世界疗效数据指导临床决策。(3)耐药机制研究:如基因突变与肿瘤靶向药耐药性的相关性。在肿瘤预后环节,RWS可识别临床试验中的治疗不良反应并进行长期随访;扩大患者基因组检测,识别高反应性患者有助于预测疾病进展、复发;结合人工智能(artificialintelligence,AI)技术开发预后预测模型,推动个体化治疗。在肿瘤管理环节,RWS可以在卫生经济学与医疗资源利用方面评估治疗方案的真实世界成本效益。3.

肿瘤RWS设计类型:在肿瘤RWS中,根据研究目的和分类依据不同,研究设计类型多样。这些方法学上的多样性增强了肿瘤RWS的适用性(图2)。肿瘤RWS观察性研究包括横断面研究、病例对照研究和队列研究等经典设计。近年来,随着因果推断方法的发展,一种高度结构化的研究范式“目标试验模拟”逐渐受到重视,即预设一个假想的RCT(目标试验),明确关键设计要素,包括入组标准、治疗策略、随访起点、结局指标、统计分析等,再借助观察性数据模拟RCT的研究路径,以增强研究结果证据强度。该设计类型在肿瘤RWS中的应用越来越广泛。肿瘤RWS目前虽仍以观察性研究为主,但干预性研究逐渐增多。PCT是一种重要的干预性研究,是指在真实临床环境下,采用随机对照的方式,比较干预措施之间的差异,了解干预措施在真实临床中的综合效果,在肿瘤RWS中具有独特优势,多用于初级保健或替代疗法研究。其主要特点包括:(1)真实世界环境:研究在日常医疗机构而非研究中心开展,干预由临床医师主导实施;(2)广泛纳入标准:减少限制以更好地代表真实人群;(3)灵活分组:随机化入组,通常不设盲法;(4)对照组设置:常规/标准治疗作为对照,避免安慰剂;(5)主动干预:引导实际临床行为。PCT通过整合EHR、基因组和肿瘤登记数据,可识别罕见突变患者的治疗反应,其成果已用于支持监管决策,例如FDA基于RWE加速批准帕博利珠单抗用于特定生物标志物阳性的实体瘤患者。此外,混合研究设计(将RCT与RWS框架相结合)正成为新趋势,其融合了RCT的科学严谨性与RWS的临床实用性,FDA将其分为3类:(1)基于RWD的临床试验:包括PCT和大型简单试验(largesimpletrials,LST),LST是指在常规医疗环境下实施,纳入大量研究对象随机化分组,并简化数据收集,聚焦关键终点(如死亡),高效评估干预措施的疗效和安全性。(2)采用外部对照的单臂试验:如在针对难治性淋巴瘤的嵌合抗原受体T细胞免疫疗法(chimericantigenreceptorT-cellimmunotherapy,CAR-T)单臂试验,以历史化疗数据为对照,评估其疗效与生存优势。(3)基于RWD的长期随访研究:抗肿瘤药物长期效果评估中,上市前依赖RCT提供的安全性证据,上市后通过RWD补充安全性监测或有效性研究。混合研究设计可以为医学研究提供更全面、更贴近临床实践的证据。

肿瘤RWS终点指标选择:在肿瘤RWS中,由于肿瘤结局种类繁多,终点指标的选择较为复杂。在临床研究设计中,通常根据其临床重要性和研究目的的不同,被系统划分为主要终点指标和次要终点指标2大类,并需要结合替代终点、中间终点及复合终点进行综合考量。主要终点指标包括总生存时间(overallsurvival,OS)、无进展生存时间(progression-freesurvival,PFS)等。次要终点指标可提供额外支持信息,辅助解释主要终点结果,如客观缓解率(objectiveresponserate,ORR)、不良事件发生率等。主次终点指标的合理搭配可全面反映疗效及疾病复杂性,在研究目的改变时可进行转换。不同肿瘤RWS的终点选择建议见表1。三、肿瘤RWS分析技巧核心要素(一)统计分析策略1.

数据治理:源数据是直接来源于临床环境的原始数据。在统计分析前,应首先评估源数据的适用性,确保数据定义明确、来源可追溯。因此,须进行系统性数据治理,主要步骤包括:(1)数据提取:从单/多个数据源中提取研究所需数据,进行去标识化处理,保障数据隐私与合规性。目前还有新兴技术,如快速医疗互操作性资源技术,可跨系统提取数据,还有AI从非结构化文本中提取数据等,但仍处于系统实施的早期阶段。(2)数据清洗:研究人员需要预先制定合理的离群值排除标准。采用参数或非参数统计方法进行数据缺失填补,也可以应用深度生成模型等算法驱动实现智能补全。(3)数据整合:借助通用数据模型对多源异构数据进行集中式标准化处理,统一数据格式,便于后续分析。最终需评估治理后的RWD是否满足生成RWE所需的统计分析要求。2.

数据统计分析:RWS的统计分析方法在总体框架上与传统临床研究基本一致,涵盖描述性分析、参数检验和非参数检验等常规统计方法。在统计分析时,要充分考虑常见的误区和错误做法。在治疗动态调整的RWS中,若未考虑时间依赖性变量(如治疗暴露时间),可能导致错误结论。当治疗变更频繁或依从性差时,意向性治疗分析对于治疗效果的估计是较为保守的,可能导致疗效评估偏差。生存分析是评估治疗效果的关键方法之一,通常使用Kaplan-Meier法或寿命表法计算PFS和OS,但容易出现竞争风险(如非肿瘤死亡),使用Kaplan-Meier可能会高估累积死亡率。在报告结论时,如果过度依赖P值而忽略临床意义,将统计学相关性推断成因果关系,将会影响结论的可靠性。因此,在具体分析中,应根据研究目的和数据类型选择恰当的统计分析方法,并结合领域知识对结果进行合理解读,以确保结论的科学性和可靠性。(二)偏倚控制策略1.

偏倚来源与类型:研究中的偏倚来源于研究设计、数据收集和结果分析等多个方面,识别和控制偏倚是确保RWS结果真实性的关键。肿瘤RWS的偏倚来源有选择偏倚、信息偏倚、时间依赖性偏倚、混杂偏倚等(表2)。2.

偏倚控制(1)选择偏倚控制:可通过严格设置研究对象的纳入排除标准,联合多个医疗机构数据库,确保所选人群具有代表性。采用新用户设计,将首次诊断患者作为用药研究对象。同时,应尽可能减少失访。(2)信息偏倚控制:应统一数据采集标准,优先使用结构化数据,采用客观医疗记录。对于缺失数据,应采用多重填补或智能算法模型进行补全。利用多数据源进行交叉验证,例如通过影像学、病理等数据核验肿瘤分期,减少错误分类。此外,采用盲法设计可降低人工主观因素所引入的偏倚。(3)时间依赖性偏倚控制:在永恒时间偏倚中,Landmark分析是一种常用方法,通过选择一个特定时间点作为新起点,排除此前死亡或删失的患者,并在此时间点重新测量基线数据,之后开始随访和结果分析。Weymann等提出了一种基于多重插补的新方法,将对照组缺失的等待时间视为需要填补的数据,利用治疗组的等待时间分布与患者特征,通过多重插补生成多个可能的填补值,以更合理地估计真实等待时间并反映不确定性。时间窗偏倚的控制主要是控制对照的选择,按照时间依赖性抽样选择对照或按照疾病的严重程度/病程匹配对照等。(4)混杂偏倚控制:在研究设计阶段,可通过严格限制研究对象特征进行初步控制,或将暴露组与对照组按混杂变量进行匹配,亦可采用随机化分组以降低混杂影响。在统计分析阶段,可通过分层分析、多变量回归模型、倾向性评分、工具变量、阴性对照方法、敏感性分析等方法实现对多种混杂因素的有效控制。倾向性评分(propensityscore,PS)是在观察到的协变量条件下,估计个体接受某种处理(或暴露)的概率,在处理组和对照组基线不平衡时使用。常用方法包括倾向性评分加权、倾向性评分分层、倾向性评分匹配以及在模型中调整倾向性评分。倾向性评分加权是一种重要的减少混杂偏倚的方式,指为样本赋予不同权重,使治疗组和对照组在协变量分布上达到平衡,从而在加权后的样本中进行因果效应估计。常用的权重分配方式包括逆概率权重和重叠权重,具体选择取决于研究目标。逆概率权重有2种经典的权重方案,当目标是评估治疗对总体人群(包括治疗组和对照组)的因果效应,采用平均处理效应加权,通过权重调整使两组的协变量分布与总体匹配;当目标是评估治疗对实际接受治疗群体的因果效应,采用处理组的平均处理效应加权,使对照组的协变量分布向治疗组靠拢。当目标是评估治疗在PS分布重叠区域(即治疗组和对照组特征相似个体)中的因果效应,采用重叠权重加权(赋予PS接近0.5的个体更高的权重,而逐渐减小PS接近0或1的个体权重),从而更精准地估计在重叠人群中的因果效应。工具变量分析用于控制未测量混杂因素。工具变量需满足3个条件:(1)与暴露变量相关;(2)通过暴露变量影响结局;(3)与未测量混杂因素无关。如Alawadi等基于美国国家肿瘤数据库数据探讨原发性肿瘤切除(primarytumorresection,PTR)是否能为无法切除转移灶的患者带来生存获益,使用医院级别的PTR率作为工具变量,医院级别的PTR率与患者实际接受PTR的概率高度相关,与混杂因素无关,通过工具变量分析方法控制混杂,从而更接近真实治疗效果。阴性对照方法是观察性研究中用于检测和校正混杂偏倚的重要方法。阴性对照分为阴性对照暴露(negativecontrolexposure,NCE)与阴性对照结局(negativecontroloutcome,NCO)。阴性对照方法包含2个核心环节:(1)偏倚检测:理论上,NCE与目标结局、NCO与目标暴露应无因果关系,若存在统计学关联,则提示存在未测量混杂。(2)偏倚校正:包括仅使用NCE、仅使用NCO和同时使用NCE和NCO的双重阴性对照法来进行偏倚校正。在仅使用NCO中采用双重差分法(difference-in-differences,DID),可扩展为NCO-DID,其适用性需要满足平行趋势假设,即未测量混杂对处理组和对照组的影响在时间上保持一致,通过比较处理组和对照组在处理前后的变化差异来控制偏倚,利用NCO与暴露之间观测到的统计关联这种“伪效应”估计潜在的混杂偏倚,并对主效应进行相应调整。双重阴性对照法是同时引入NCE和NCO,利用两者的统计关联构建混杂桥函数来推断未测量混杂,也可采用其他半参数或非参数方法来校正偏倚。敏感性分析是评估模型对参数变动反应程度的技术,可以引入两个统计量E值和稳健性值(robustnessvalue,RV),定量评估对未测量混杂因素的敏感性。E值用观察到的相对危险度(relativerisk,RR)来计算,公式为:E值量化了需要多大的未测量混杂效应才能推翻暴露与结局之间的统计关联。E值越大,表明需要越强的未测量混杂效应才能将该关联解释为虚假关联。但E值仅为理论敏感性分析工具,不能替代严谨的研究设计和混杂控制。RV用残差方差百分比来计算,RV描述了未观察到的混杂因素需要与治疗和结局同时具有何种关联才能解释观察到的关联。RV与E值的概念相似,但使用的度量不同,可结合使用,评估对未测量混杂因素的敏感性。此外还有贝叶斯双回归建模、差分法、经验分布校准等其他敏感性分析方法,这些方法在实施过程中较为复杂且需要额外假设条件,需要根据混杂因素的性质及可用信息情况选择。3.AI在肿瘤RWS中的应用AI正在重塑肿瘤RWS的全过程,其核心是机器学习算法,其子领域深度学习,以及依赖这些技术的应用,如自然语言处理等的发展,使AI成为肿瘤RWS中不可或缺的驱动力。(1)机器学习:可处理大量EHR信息,预测个体治疗反应,如Benzekry等利用电子病历数据开发基于随机森林分类算法的机器学习模型,预测非小细胞肺癌患者的免疫治疗效果。(2)深度学习:通过深度神经网络自动学习多层次特征表示,擅长处理高维、非线性、非结构化数据。①监督学习:Arbour等以放射学报告文本为输入,以实体瘤疗效评价标准为标签,训练了一个全连接的深度自然语言处理模型,自动预测非小细胞肺癌患者的治疗反应和PFS。②弱监督学习:Yang等开发MAIGGT框架,整合病理图像与EHR临床表型,精准预测乳腺癌中致病性BRCA1/2突变。③无监督学习:Sikora等利用无监督学习对重症监护室患者用药数据进行聚类分析,识别新药物表型与临床结局之间的关联。(3)自然语言处理:用于分析文本数据,将自然语言转化为机器可读形式,使定性数据融入定量分析流程,如杨丽冰等应用该技术自动处理非结构化数据,构建AI驱动的肺癌数据库,提升数据管理和分析效率。现有文献也从不同维度验证了AI在肿瘤学特定诊疗环节的应用价值,揭示了AI在肿瘤全周期管理中的渗透路径。(1)预防:AI系统预测乳腺癌,在与临床相关的乳腺癌识别任务中优于放射科医师。(2)诊断:一种新型的集成深度学习系统,用于使用MRI数据进行准确的脑肿瘤分类。(3)治疗:结合多组学和机器学习算法构建多发性骨髓瘤疗效预测模型,有助于临床医师对原发难治性多发性骨髓瘤患者的管理。(4)康复:使用可穿戴传感器收集腹部癌手术患者术后数据(如心率、呼吸频率等),通过XGBoost算法训练回归模型预测每日恢复评分,以支持临床决策(确定合适的出院时间、检测并发症和规划康复治疗)。(5)预后:AI和机器学习在预测非肌层浸润性膀胱癌复发中展现出巨大潜力,但仍有挑战。四挑战与未来方向RWD在医学研究中具有重要价值,但其应用仍面临数据质量、多中心多模态

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论