2026年物统计学专业研究入学试题(附答案)_第1页
2026年物统计学专业研究入学试题(附答案)_第2页
2026年物统计学专业研究入学试题(附答案)_第3页
2026年物统计学专业研究入学试题(附答案)_第4页
2026年物统计学专业研究入学试题(附答案)_第5页
已阅读5页,还剩11页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年物统计学专业研究入学试题(附答案)一、单项选择题(每题3分,共30分)1.某癌症队列研究中,观察500例患者的生存时间(月),其中120例在随访结束时仍存活(删失)。若采用Kaplan-Meier法估计生存率,计算第12个月生存率时,分母应取()A.500B.500-120C.第12个月期初的风险集人数D.所有未删失患者数2.为比较两种降压药的疗效,将100名高血压患者按年龄、性别、基线血压分层后,每层内随机分配药物,该设计主要控制的混杂因素通过()A.随机化B.匹配C.分层分析D.协变量调整3.某基因表达数据集包含20000个基因,100例样本(50例病例,50例对照)。若对每个基因进行两样本t检验(α=0.05),则期望的假阳性数约为()A.1000B.500C.100D.504.泊松回归模型中,若解释变量X的系数为0.4(指数化后为1.49),则正确的解释是()A.X每增加1单位,事件发生次数增加40%B.X每增加1单位,事件发生次数的对数增加0.4C.X每增加1单位,事件发生率比(IRR)为1.49D.X每增加1单位,事件发生概率增加49%5.生存分析中,Cox比例风险模型的基本假设是()A.生存时间服从指数分布B.风险函数的对数与协变量呈线性关系C.不同个体的风险比不随时间变化D.删失机制与协变量无关6.进行两独立样本均值比较时,若数据严重偏离正态分布且方差不齐,最优的非参数检验方法是()A.Wilcoxon符号秩检验B.Mann-WhitneyU检验C.Kruskal-Wallis检验D.Friedman检验7.某临床试验采用2×2析因设计,考察药物A(有/无)和药物B(有/无)对疗效的影响。若主效应A显著(p<0.05),主效应B不显著(p>0.05),但交互作用A×B显著(p<0.01),则正确的结论是()A.药物A单独使用有效,药物B无效B.药物A的效果依赖于药物B的存在与否C.应忽略交互作用,仅报告主效应D.两药物联合使用效果等同于单独使用A8.在病例对照研究中,计算OR值时,若存在回忆偏倚(病例组比对照组更可能回忆暴露史),则OR值会()A.高估真实关联B.低估真实关联C.无系统偏差D.无法判断方向9.主成分分析(PCA)中,第一主成分是()A.方差最小的线性组合B.与原始变量相关性最高的线性组合C.使数据在该方向上投影方差最大的线性组合D.解释原始变量协方差矩阵中最小特征值的方向10.贝叶斯统计中,后验分布是()A.先验分布与似然函数的和B.先验分布与似然函数的乘积,再标准化C.仅由似然函数决定的分布D.数据分布的经验估计二、简答题(每题8分,共40分)1.简述Ⅰ型错误(α)和Ⅱ型错误(β)的关系,以及样本量计算时需要考虑的主要参数。2.解释生存分析中“竞争风险”的概念,并说明与传统Kaplan-Meier估计的区别。3.广义线性模型(GLM)包含哪三个组成部分?以Logistic回归为例说明各部分的具体形式。4.什么是倾向得分匹配(PSM)?其在观察性研究中的主要作用是什么?5.高维数据(如基因组数据)分析中,为什么需要进行多重检验校正?常用的校正方法(如Bonferroni、FDR)的区别是什么?三、计算题(每题15分,共45分)1.某研究比较两种化疗方案对白血病患者的缓解率,方案A治疗60例,缓解42例;方案B治疗50例,缓解30例。(1)计算两方案缓解率的差值(pA-pB)及其95%置信区间(使用Wald法);(2)进行卡方检验(α=0.05),写出检验假设、计算过程及结论。2.某队列研究随访5年,记录100例糖尿病患者的空腹血糖(mmol/L)和是否发生心血管事件(1=发生,0=未发生)。拟合Logistic回归模型得到:logit(P)=-3.2+0.4×空腹血糖(1)解释空腹血糖每升高1mmol/L,发生心血管事件的优势比(OR);(2)若某患者空腹血糖为7.0mmol/L,计算其发生心血管事件的概率。3.以下是5例患者的生存时间(月)和删失状态(1=死亡,0=删失):(6,1),(8,0),(12,1),(15,1),(20,0)(1)计算12个月时的Kaplan-Meier生存率估计值;(2)若假设生存时间服从指数分布,估计其平均生存时间(μ),并计算12个月生存率(S(12)=e^(-12/μ))。四、论述题(每题25分,共50分)1.随机对照试验(RCT)被认为是评价干预措施疗效的“金标准”,但在实际应用中常面临伦理限制、成本高昂等问题。请结合生物医学研究实例,论述观察性研究(如队列研究、病例对照研究)的优势与局限性,以及如何通过统计方法(如倾向得分分析、工具变量法)提高观察性研究的因果推断效度。2.随着多组学技术(基因组学、转录组学、蛋白组学等)的发展,生物医学数据呈现高维、多源、非线性的特点。请从统计建模的角度,讨论多组学数据整合分析面临的主要挑战(如维度灾难、异质性、缺失数据),并举例说明可能的解决方法(如正则化方法、潜变量模型、机器学习)。答案一、单项选择题1.C2.B3.A(20000×0.05=1000)4.C5.C6.B7.B8.A9.C10.B二、简答题1.Ⅰ型错误是原假设为真时拒绝原假设的概率(假阳性),Ⅱ型错误是原假设为假时接受原假设的概率(假阴性)。两者在样本量固定时呈反向关系,降低α会增加β,反之亦然。样本量计算需考虑:α(通常0.05)、β(通常0.2,对应检验效能1-β=0.8)、总体效应大小(如均值差、OR值)、变异程度(如标准差)。2.竞争风险指研究终点(如死亡)可能被其他事件(如失访、其他疾病死亡)“竞争”,导致原终点无法被观测。传统Kaplan-Meier法假设删失与生存时间独立,而竞争风险需明确区分不同事件类型,使用累积发生率函数(CIF)或Fine-Gray模型,考虑竞争事件对原终点的影响,避免高估原终点的风险。3.GLM由三部分组成:(1)随机部分:因变量的概率分布(如二项分布、正态分布);(2)系统部分:线性预测器(如β0+β1X1+…+βpXp);(3)连接函数:将因变量均值与线性预测器关联(如Logistic回归中使用Logit连接,g(μ)=ln(μ/(1-μ))=β0+β1X)。4.倾向得分是个体接受某种处理的概率,通过Logistic回归等方法估计(以协变量为预测变量)。PSM通过匹配倾向得分相近的处理组与对照组个体,平衡两组协变量分布,减少混杂偏倚,使观察性研究结果接近RCT的因果推断效果。5.高维数据中进行大量假设检验(如20000次基因差异表达检验),传统α=0.05会导致大量假阳性(Ⅰ型错误膨胀)。Bonferroni校正通过将α除以检验次数(α’=α/m)控制家族错误率(FWER),但过于保守;FDR(错误发现率)控制假阳性占显著结果的比例,更适用于高维数据,常用Benjamini-Hochberg法。三、计算题1.(1)pA=42/60=0.7,pB=30/50=0.6,差值=0.1。标准误SE=√[pA(1-pA)/nA+pB(1-pB)/nB]=√[0.7×0.3/60+0.6×0.4/50]=√[0.0035+0.0048]=√0.0083≈0.091195%CI=0.1±1.96×0.0911≈0.1±0.1786→(-0.0786,0.2786)(2)H0:两方案缓解率无差异(πA=πB);H1:πA≠πB合并率p=(42+30)/(60+50)=72/110≈0.6545卡方统计量χ²=Σ[(O-E)²/E],其中E11=60×0.6545≈39.27,E12=60-39.27=20.73,E21=50×0.6545≈32.73,E22=50-32.73=17.27χ²=(42-39.27)²/39.27+(18-20.73)²/20.73+(30-32.73)²/32.73+(20-17.27)²/17.27≈(7.45/39.27)+(7.45/20.73)+(7.45/32.73)+(7.45/17.27)≈0.19+0.36+0.23+0.43=1.21自由度df=1,查卡方界值表,χ²0.05,1=3.84,1.21<3.84,P>0.05,不拒绝H0,认为两方案缓解率无统计学差异。2.(1)OR=exp(0.4)≈1.49,即空腹血糖每升高1mmol/L,发生心血管事件的优势比增加49%。(2)logit(P)=-3.2+0.4×7=-3.2+2.8=-0.4P=exp(-0.4)/(1+exp(-0.4))≈0.6703/(1+0.6703)≈0.401(或40.1%)3.(1)按时间排序:6(死亡),8(删失),12(死亡),15(死亡),20(删失)风险集:t=6时,风险集n1=5,死亡数d1=1,生存率S(6)=1×(5-1)/5=0.8t=8时,删失,风险集n2=5-1=4(因t=8时未死亡的个体为原风险集减去t=6死亡的1例),生存率不变t=12时,风险集n3=4-1(t=8删失不减少风险集,因删失发生在t=8,而t=12时风险集为t>8且未死亡的个体,即原n=5-1(t=6死亡)-0(t=8删失不影响后续风险集)=4?需注意:风险集是“在时间t时尚未发生事件且未被删失的个体数”。正确计算:t=6:风险集5,死亡1→S(6)=4/5=0.8t=8:个体8被删失,此时风险集为5-1(t=6死亡)=4,删失不影响生存率计算,S(8)=S(6)=0.8t=12:风险集为4-1(t=8删失是否在t=12前?删失时间8<12,所以该个体在t=12时已退出风险集,故t=12期初风险集为5-1(t=6死亡)-1(t=8删失)=3,死亡数d=1→S(12)=0.8×(3-1)/3=0.8×2/3≈0.533(2)指数分布似然函数L(μ)=∏[f(ti)/S(ti)]^δi×S(ti)^(1-δi),其中f(t)=1/μe^(-t/μ),S(t)=e^(-t/μ)δ=1时,贡献f(ti)/S(ti)=1/μ;δ=0时,贡献S(ti)=e^(-ti/μ)数据:(6,1),(8,0),(12,1),(15,1),(20,0)L(μ)=(1/μ)^3×e^(-6/μ)×e^(-8/μ)×e^(-15/μ)×e^(-20/μ)=μ^(-3)e^(-(6+8+12+15+20)/μ)=μ^(-3)e^(-61/μ)对数似然lnL=-3lnμ-61/μ求导得d(lnL)/dμ=-3/μ+61/μ²=0→61/μ²=3/μ→μ=61/3≈20.33个月S(12)=e^(-12/20.33)=e^(-0.590)≈0.554四、论述题(要点)1.优势:观察性研究无需主动干预(如RCT中安慰剂对照可能不符合伦理),可研究罕见病或长期结局(如癌症幸存者的二次肿瘤风险),成本低、样本量大(如英国生物银行)。局限性:存在混杂偏倚(如吸烟与肺癌研究中年龄、职业的混杂)、选择偏倚(如队列研究的失访)、无法控制暴露(如无法随机分配吸烟行为)。统计方法:倾向得分分析通过匹配/分层平衡协变量(如比较吸烟与不吸烟者时匹配年龄、性别);工具变量法利用与暴露相关但与结局无关的变量(如医生处方习惯作为药物使用的工具变量),减少混杂;孟德尔随机化以基因变异作为工具变量(如利用ALDH2基因多态性研究酒精对肝病的影响)。2.挑战与方法:(1)维度灾难:变量数远大于样本量(如20000基因vs100样本),传统回归模型过拟合。解决:正则化(LASSO通过L1惩罚筛选重要基因)、主成分分析(提取少数综合变量)。(2)异质性:不同组学数据测量尺度、分布差异大(如RNA-seq的计数数据vs蛋白的连续数据)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论