化验检查诊断问题_第1页
化验检查诊断问题_第2页
化验检查诊断问题_第3页
化验检查诊断问题_第4页
化验检查诊断问题_第5页
已阅读5页,还剩9页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、2009 高教社杯全国大学生数学建模竞赛承诺书我们仔细阅读了中国大学生数学建模竞赛的竞赛规则.我们完全明白,在竞赛开始后参赛队员不能以任何方式(包括电话、电子邮件、网上咨询等)与队外的任何人(包括指导教师)研究、讨论与赛题有关的问题。我们知道,抄袭别人的成果是违反 竞赛规则的 , 如果引用别人的成果或其他公开的资料(包括网上查到的资料) ,必须按照规定的参考文献的表述方式在正文引用处和参考文献中明确列出。我们郑重承诺,严格遵守竞赛规则,以保证竞赛的公正、公平性。如有违反竞赛规则的行为,我们将受到严肃处理。我们参赛选择的题号是(从A/B/C/D 中选择一项填写):我们的参赛报名号为(如果赛区设置

2、报名号的话):所属学校(请填写完整的全名) :参赛队员(打印并签名 ) : 1.2.3.指导教师或指导教师组负责人(打印并签名 ):日期:年月日赛区评阅编号(由赛区组委会评阅前进行编号):2009 高教社杯全国大学生数学建模竞赛编号专用页赛区评阅编号(由赛区组委会评阅前进行编号):赛区评阅记录(可供赛区评阅时使用):评阅人评分备注全国统一编号(由赛区组委会送交全国前编号):全国评阅编号(由全国组委会评阅前进行编号):摘要本文就是针对健康人与肾炎病人体内 Zn、Cu、Fe、Ca、Mg、K、Na七种元素含量的不同,通过建立七种元素含量的数学模型, 来寻找一种方法来判断任意一个就诊人员是否为肾炎病人

3、。在问题一的求解中,我们采用了费歇尔判别模型。利用表B.1 中前 20 名肾炎患者和前 20 名健康人的数据对模型进行求解,提出了一种简单的判别方法,然后我们把剩余的 10 名肾炎患者和 10 名健康人的数据代入模型进行检验, 发现该判别方法的正确率高达 95%。接着我们以此模型对表 B.2 中 61 到 90 号就诊人员进行判断,求得结果,其中 15 人为患者, 15 人健康,具体见正文表 3。在问题二的求解中,我们采用了主成分分析模型。在对表 B.1 中的 60 组数据进行主成分分析后,我们选取 Zn,Ca,Mg,K,Na 五个指标为影响人们是否患肾炎的关键因素。 然后重复对问题一的求解,

4、 提出了新的判别方法, 在对新的判别方法进行检验时,我们发现新的判别方法的正确率有所下降,达 80%。接着利用新模型对 B.2 中的就诊人员重新进行判断,其中 16 人患肾炎, 14 人健康,具体结果见正文表 6。最后,我们通过对两个模型对同一组未知数据的判断结果的比较,发现两种模型判断结果的一致率为 83.33%。基于以上两个问题的求解, 我们发现两个模型各有优缺点。 一种需要测量的元素种类较多,但结果相对准确;另一种操作简便,但误差相对较大。因此我们得出结论:认为应结合实际情况,在不同情况下使用不同的模型。关键字:肾炎诊断费歇尔判别模型主成分分析诊断判别方法一、问题重述肾炎是一种困扰人们生

5、活和健康的疾病,及时发现和治疗能够有效地避免和遏制肾炎恶化。 人们到医院就诊时, 通常要化验一些指标来协助医生的诊断。诊断就诊人员是否患肾炎时, 通常要化验人体内各种元素含量。表 B.1 是确诊病例的化验结果,其中130 号病例是已经确诊为肾炎病人的化验结果;3160 号病例是已经确定为健康人的结果。表 B.2 是就诊人员的化验结果。 基于上面的数据我们要完成下面的问题:1:根据表 B.1 中的数据,提出一种简便的判别方法,判别属于患者或健康人的方法,并检验你提出方法的正确性。并按照提出的方法,判断表B.2 中的 30名就诊人员的化验结果进行判别,判定他(她)们是肾炎病人还是健康人。2:能否根

6、据表 B.1 的数据特征,确定哪些指标是影响人们患肾炎的关键或主要因素,以便减少化验的指标。根据所得结果,重复 1 中的工作,然后将所得的结果与问题 1 的结果进行比较,作进一步的分析。二、模型假设和变量符号说明2.1 模型假设1)题中所给的内容和数据都是真实可信的;2)除了表中列出的元素外,其他元素对是否会患肾炎的影响很小;3)没该病的个体都是健康体;4)假设病例没有其他疾病导致某种元素含量不正常;5)检测是在同等条件下进行的,即同样的外界环境和生理条件。2.2 变量符号说明X :某个病人的 7 种元素组合;f X:某个病人的费歇尔判别函数;12:总体 1 的协方差矩阵;:总体 2 的协方差

7、矩阵;u1 :总体 1的均值向量;u2 :总体 2 的均值向量;:判别临界值;xi :某病人第 i 种元素的值;ci :第 i 种元素的判别系数;Fi :第 i 个主成分。三、问题分析及思路对于该问题的第 1 问,实际上就是利用 30 名肾炎患者和 30 名健康者人体内的 Zn,Cu,Fe,Ca,Mg,K,Na 这 7 种微量元素的含量, 给出一个简单的判别方法, 判定其是肾炎患者还是健康人。然后对未诊断的 30 名就诊人员进行判别,判定他(她)们是肾炎病人还是健康人。在已知健康人和肾炎患者各自体内微量元素含量的基础上 , 我们可以采用某医院化验的 30名肾炎患者和 30名健康人体内的 Zn,

8、Cu,Fe,Ca,Mg,K,Na7 种微量元素的含量作为基础数据 , 先从中选取 20名肾炎患者和 20名健康人的数据作为样本 , 进行采样分析 , 建立费歇尔 (Fisher) 判定模型 , 然后利用剩余的 10名肾炎患者和10名健康人的数据对判定模型进行检验 , 并计算该判定模型的正确率。再利用该判定模型对 30名就诊人员进行判别,判定他(她)们是肾炎病人还是健康人。对于问题的第 2问,实际上就是根据表 B.1 的数据特征,确定哪些指标是影响人们患肾炎的关键或主要因素, 以便减少化验的指标。 因此,我们选择了主成分分析模型来求出影响人们是否患肾炎的关键或主要因素,进而减少化验的指标。接着重

9、复问题 1的求解过程,给出新的判别方法, 对30名就诊人员进行重新判别,将结果与问题 1的结果进行对比分析。四、模型建立与求解4.1 问题 1的建模求解费歇尔 (Fisher) 判别是按照各类 ( 总体 ) 中的方差尽可能小, 不同类中的均值之间差距尽可能大的原则,即类间距离最大而类内离散性最小的原则求判别函数,并利用判别函数进行最小距离分类。2个总体 ( 总体 1和总体 2) 的基本函数表达 式1 为:f ( X ) XT () 1(u1 u2 )12式中 :1和2分别为总体 1和总体 2的协方差矩阵 ; u1 和 u2 分别为总体 1和总体 2的均值向量。判别规则 :若 f ( X ) d

10、 , X 总体 1;若 f ( X ) d , X 总体 2;其中: d f ( X 1 )f ( X 2 ) / 2在此题中总体 1就是指肾炎病人, 总体 2指健康人, X就是每个样本中的 7种元素的值构成的一个向量。通过化简,原判别函数就可以转换为:7f ( X ) c1x1 c2 x2 c3x3 c4x4 c5x5 c6 x6 c7 x7ci xii 1其中: xi 为样本中第 i 种元素的值, ci 为第 i 种元素的判定系数。现选取 20名肾炎患者和 20名健康人的数据作为样本,通过 matlab 编程求出判定函数的各个判定系数,然后确定判定函数。结果如下:f ( X ) 0.003

11、5503x1 0.09342x2 - 0.0095448x3 - 0.001848x4 - 0.0038447x5 - 0.00090735x6 0.0024786x7确定判定临界值 d f ( X 1 )f ( X 2 ) / 20.89323 。依据求出的判定函数表达式和判定临界值就得到了一种简单的判定方法, 即:根据每个就诊人员中各元素值, 计算出判定函数的值, 然后将计算出的判定函数的值与判定临界值进行比较, 如果判定函数的值大于等于判定临界值, 则判定其为患病,否则判定其为健康。现利用剩下的 10名肾炎患者和 10名健康人的数据对该费歇尔判别模型进行检验,并计算该判定模型的准确率。计

12、算结果如表 1、表 2所示。表1 10 名肾炎患者对模型的检验病例号212223242526272829301.591.42-0.50.23-0.71.460.141.520.601.10f ( X)8217275577880936731744743876958196034563与 d 的比较大于大于大于大于大于大于大于大于大于大于是否患病患病患病患病患病患病患病患病患病患病患病表 2 10 名健康人对模型的检验病例号51525354555657585960-0.-4.3-1.8-1.6-2.1-5.4-4.3-5.1-2.85-2.2714f ( X)98210257288877633523

13、7493022334697405与 d 的大比较小于小于小于小于小于小于小于小于小于于是否患患病健康健康健康健康健康健康健康健康健康病从表 1、表2可以看出在对剩余 20人的判定中,仅有 1个判定错误,所以该模型的判定正确率高达 95%。根据该判定模型,对 30名就诊人员的化验结果进行判别,具体结果如表3所示。表 3 对30组就诊人员进行预测病例号616263646566676869700.41-0.6-1.10.92-0.4-1.1-2.1-0.20.01-2.6f ( X)111726265819443076249843477922785075306与 d 的比较大于大于小于大于大于小于小

14、于大于大于小于是否患病患病患病健康患病患病健康健康患病患病健康病例号717273747576777879800.310.950.45-1.7-0.80.27-1.5-1.5-0.1-3.1f ( X)3133395611666553240893291195806973663与 d 的比较大于大于大于小于大于大于小于小于大于小于是否患病患病患病患病健康患病患病健康健康患病健康病例号12345678910-4.1-2.91.33-1.70.67-2.3-0.7-4.1-7.3-1.5f ( X)486624816701466656348045702025680392与 d 的比较小于小于大于小于大

15、于小于大于小于小于小于是否患病健康健康患病健康患病健康患病健康健康健康从表 3可以看出在对 30名就诊人员的化验结果进行的判定中,其中 15名就诊人员为肾炎病人, 15名就诊人员为健康人。4.2 问题 2的建模求解4.2.1 主成分分 析2 模型介绍主成分分析是把各变量之间互相关联的复杂关系进行简化分析的方法。在力求数据信息丢失最少的原则下, 对高维的变量空间降维, 即研究指标体系的少数几个线性组合,并且这几个线性组合所构成的综合指标将尽可能多地保留原来指标变异方面的信息。这些综合指标就称为主成分。要讨论的问题是:(1) 基于相关系数矩阵还是基于协方差矩阵做主成分分析。 当分析中所选择的经济变

16、量具有不同的量纲, 变量水平差异很大, 应该选择基于相关系数矩阵的主成分分析。(2) 选择几个主成分。主成分分析的目的是简化变量,一般情况下主成分的个数应该小于原始变量的个数。 关于保留几个主成分, 应该权衡主成分个数和保留的信息。(3)如何解释主成分所包含的经济意义。假设我们所讨论的实际问题中,有 p个指标,我们把这 p个指标看作 p个随机变量,记为 X1,X2, , Xp,主成分分析就是要把这 p个指标的问题, 转变为讨论 p个指标的线性组合的问题, 而这些新的指标 F1,F2, ,Fk(k p),按照保留主要信息量的原则充分反映原指标的信息,并且相互独立。这种由讨论多个指标降为少数几个综

17、合指标的过程在数学上就叫做降维。 主成分分析通常的做法是,寻求原指标的线性组合 Fi 。满足如下的条件:( 1)每个主成分的系数平方和为1。即:u12iu 22iu2pi1( 2)主成分之间相互独立,即无重叠的信息。即:Cov ( Fi, F j) 0, ij, i , j1, 2, p( 3)主成分的方差依次递减,重要性依次递减,即:Var ( F1) Var ( F2 )Var ( Fp )根据 B.1 中的数据,我们利用 Matlab7.0 中的 princomp 3 命令实现,具体程序见附录。通过计算,我们求出了前三个主成分,即:Z10.25589x10.48187 x20.38535

18、 x30.50744 x40.53169 x50.11673 x60.00031x7Z20.38138x10.20829 x20.13866 x30.036237 x40.067207 x50.60908 x60.643x7Z30.71858x10.15736 x20.48667 x30.16987 x40.0668 x50.35508x60.25028 x7第一主成分贡献率为 44.702 ,第二主成分贡献率为 28.192 ,第三主成分贡献率为 10.327 ,前三个主成分累计贡献率达 83.221 。如果按 80 以上的信息量选取新因子,则可以选取前三个新因子。第一新因子 Z1包含的信息

19、量最大为 44.702 ,它的主要代表变量为x4 (Ca), x5 (Mg),其权重系数分别为 -0.50744 、-0.53169 ,反映了这两个变量与是否患病密切相关,第二新因子Z 2包含的信息量次之为28.192%,它的主要代表变量为x6(K) ,x7( Na)其权重系数分别为0.60908 、 -0.643 ,第三新因子 Z 3 包含的信息量为10.327 ,代表变量为 x1 (Zn),权重系数为 -0.71858 。这些代表变量反映了各自对该新因子作用的大小, 它们是判别是否患病中最重要的影响因素。 因此我们选择 Zn, Ca,Mg,K, Na五个指标为影响人们患肾炎的关键因素。重复

20、问题 1的过程,依据前 20名肾炎患者和前 20名健康人的数据得到新的判定函数为:f ( X )0.001176x10.00102x40.000287x5 - 0.00058x60.002603x7判定临界值为 d=-0.21104 ,用剩下的 10名肾炎患者和 10名健康人的数据对该费歇尔判别模型进行检验,并计算该判定模型的准确率。计算结果如表 4,表 5 所示。表 4 选取新的指标后 10名肾炎患者对模型的检验病例号21222324252627282930f ( X)1.621.36-0.30.3-0.21.04-0.20.811.25-0.328566988669931386314392

21、16213985756671185与 d 的大比较大于大于小于于小于大于小于大于大于小于是否患患病患病患病健康病健康患病健康患病患病健康表5 选取新的指标后 10名健康人对模型的检验病例号51525354555657585960-1.0-0.8-0.6-0.7-3.4-2.5-2.6-1.2-1.3-0.4f ( X)3331055442428181013795517073973553798463与 d 的比较小于小于小于小于小于小于小于小于小于小于是否患病患病健康健康健康健康健康健康健康健康健康从表 4、表5可以看出在对剩余 20人的判定中,有 4个判定错误,所以该模型的判定正确率达 80%

22、。所以我们得出结论:在减少了化验指标后,模型的正确率下降了。根据该判定模型,对 30名就诊人员的化验结果进行判别, 具体结果表 6所示。表6 选取新的指标后的预测结果病例号616263646566676869701.010.620.471.450.16-0.00.240.990.69-0.3f ( X)0108737679222376185311482043490229710443与 d 的比较大于大于大于大于大于大于大于大于大于小于是否患病患病患病患病患病患病患病患病患病患病健康病例号717273747576777879801.861.480.79-0.7-0.90.39-0.9-0.3-0

23、.5-1.8f ( X)44219547537265935345030388062014215363与 d 的比较大于大于大于小于小于大于小于小于小于小于是否患病患病患病患病健康健康患病健康健康健康健康病例号12345678910-2.2-1.61.40-0.71.23-1.30.65-1.3-2.7-1.0f ( X)2245646862947414373718170579424835726872与 d 的小于小于大于小于大于小于大于小于小于小于比较是否患病健康健康患病健康患病健康患病健康健康健康从表 6可以看出在对 30名就诊人员的化验结果进行的判定中, 其中 16个就诊人员为肾炎病人,

24、14个就诊人员为健康人。4.3 结果比较对简化前后的结果进行对比发现,病例号为 3、6、7、15、19共5位急诊人员的诊断结果不同,占总人数的 83.33%基于以上两个问题的求解,我们发现主成分分析前后的两个模型各有优缺点。一种需要测量的元素种类较多,但结果相对准确;另一种操作简便,但误差相对较大。因此我们最终得出结论, 认为应结合实际情况, 在不同情况下使用不同的模型。医疗条件相对较差的医院, 可以采用操作简便的模型, 医疗条件相对较好的医院因采用准确率较高的模型。 在初步诊断的情况下, 可以采用测量元素相对较少的模型可以省时省事, 在复诊或对准确率较高的情况下, 对 7 种元素进行测量,保

25、证结果的准确率。五、模型评价5.1优点:本文采用的费歇尔判别模型对总体的分布类型没有要求;该模型简单,但对是否患病的判别正确率较高;5.2缺点:本文采用的费歇尔判别模型由于变量之间的相关性和多元线性函数变量之间可能存在多重共线性 , 从而将影响判别的准确性;六、模型的应用与推广这种判别在实际生活中很多,所以这些判别法在日常发挥着很多的作用,除了看病外,地质学中判断有矿无矿, 工厂判断产品合格不合格,为新发现的物种分类都可以用这些方法进行分析。在对某一事物的影响因素进行研究时,可以通过主成分分析,在多个影响因素中选取几个最重要的因素进行研究, 以减少研究的难度, 加快研究的效率, 又不减少研究的

26、准确率。因此在研究或疾病诊断中有很好的推广前景。七、参考文献钟冲,郭强,费歇尔判别法及其应用,西南交通大学学报,第 43卷第 1期:第136页至第 141页, 2008年。范金城,梅长林,数据分析,北京:科学出版社, 2002年。研学论坛,如何用 matlab 中主成分分析的函数 princomp ,http:/bbs.matwav. com/viewthread.php?tid=798666 , 2009年 8月 28日。附录程序 :clear;x=Sheet1;stdr=std(x);求各变量标准差n,m=size(x);sddata= x. stdr(ones(n,1),:);标准化变换

27、p ,princ , egenvalue=princomp(sddata)调用主成分分析程序p3=p( :, 1:3)输出前三个主成分系数sc=princ( :,1:3)输出前三个主成分得分egenvalue输出特征根per=100*egenvalue sum(egenvalue) 输出各个主成分贡献率表 B.1 确诊病例的化验结果病例号ZnCuFeCaMgKNa116615.824.5700112179513218515.731.570112518442731939.8025.9541163128642415914.239.789699.2239726522616.223.860615270

28、.321861719.299.2930718745.5257720113.326.655110149.4141814714.530.065910215468091728.857.8655175.798.43181015611.532.56391071035521113215.917.757892.4131413721218211.311.3767111264672131869.2637.195823373.0347141628.2327.162510862.4465151506.6321.06271401796391615910.711.761219098.53901711716.17.049

29、8895.51365721818110.14.0414371841015421914620.723.8123212815010922042.310.39.7062993.74398882128.212.453.137044.14548522215413.853.36211051607232317912.217.9113915045.22182413.53.3616.813532.651.6182251755.8424.980712355.61262611315.847.362653.61686272750.511.66.3060858.958.91392878.614.69.7042170.8

30、1334642990.03.278.1762252.37708523017828.832.499211270.21693121319.136.2222024940.01683217013.929.8128522647.93303316213.219.8152116636.21333420313.090.8154416298.903943516713.114.1227821246.31343616412.918.6299319736.394.53716715.027.0205626064.62373815814.437.0102510144.672.53913322.831.0163340118

31、08994015613532267471090228810411698.00308106899.153.02894224717.38.65255424177.9373431668.1062.81233252134649442096.4386.9215728874.0219451826.4961.738704321433674623515.623.4180616668.81884717319.117.0249729565.82874815119.764.220314031828744919165.435.053613921376885022324.486.0360335397.74795122120.115531723681507395221725.028.223433731104945316422.235.52212281153549541738.99

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论