数学建模题目及其答案(疾病的诊断)_第1页
数学建模题目及其答案(疾病的诊断)_第2页
数学建模题目及其答案(疾病的诊断)_第3页
数学建模题目及其答案(疾病的诊断)_第4页
数学建模题目及其答案(疾病的诊断)_第5页
已阅读5页,还剩16页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

数学建模疾病的诊断

现要你给出疾病诊断的一种方法。

胃癌患者容易被误诊为萎缩性胃炎患者或非胃病者。从胃癌患者中抽

取5人(编号为1-5),从萎缩性胃炎患者中抽取5人(编号为670),以

及非胃病者

中抽取5人(编号为1175),每人化脸4项生化指标:血清铜蓝蛋白(XQ、

蓝色反应(X,/)、尿叫味乙酸(X,,)、中性硫化物(小)、测得数据如表1

所示:

表1.从人体中化验出的生化指标

No.12345678910

228245200170100255130150120160

x2134134167150167125100117133100

X30.20.10.120.070.200.070.060.070.10.05

X40.110.40.270.080.140.140.120.060.260.10

1112131415

185170165135100

115125142108117

0.050.060.050.020.07

0.190.040.080.120.02

根据数据,试给出鉴别胃病的方法。

论文题目:胃病的诊断

摘要

在临床医学中,诊断试脸是一种诊断疾病的重要方法。好的诊断试验方法将对临床

诊断的正确性和疾病的治疗效果起重要影响。因此,对于不同疾病不断发现新的诊断试

验方法是医学进步的重要标志。传统的诊断试脸方法有生化检测、DNA检测和影像检测

等方法。而本文则通过利用多元统计分析中的判别分析及SPSS软件的辅助较好地解决

了临床医学中胃病鉴别的问题。在临床医学上,既提高了临床诊断的正确性,又对疾病

的治疗效果起了重要效果,同时也减轻了病人的负担。

判别分析是在分类确定的条件下,根据某一研究对象的各种特征值判别其类型

归属问题的一种多变量统计分析方法。

其基本原理是按照一定的判别准则,建立一个或多个判别函数,用研究对象的

大量资料确定判别函数中的待定系数,并计算判别指标。

首先,由判别分析定义可知,只有当多个总体的特征具有显著的差异时,进行判别

分析才有意义,且总体间差异越大,才会使误判率越小。因此在进行判别分析时,有必

要对总体多元变量的均值进行是否不等的显著性检验。

其次,利用判别分析出的费歇判别和贝叶斯判别进行判别函数的建立。

最后,利用所建立的判别函数进行回判并测得其误判率,以及对其修正。

本文利用SPSS软件实现「对总体间给类变量的均值是否不等的显著性检验并根据

样本建立了相应的费歇判别函数和贝叶斯判别函数,最后进行了回判并测得了误判率,

从而获得了在临床诊断中模型,给临床上的诊断试验提供了新方法和新建议。

关键词:判别分析;判别函数;Fisher判别;Bayes判别

一问题的提出

在传统的胃病诊断中,胃癌患者容易被误诊为萎缩性胃炎患者或非胃病患者,为了

提高医学上诊断的准确性,也为了减少因误诊而造成的病人死亡率,必须要找出一种最

准确最有效的诊断方法。为诊断疾病,必须从人体中提取4项生化指标进行化验,即血

清铜蓝蛋白、蓝色反应、尿叫喋乙酸、中性硫化物。但是,从人体中化验出的生化指标,

必须要确定一个精准的指标来判断疾病所属的类型。设想,使用判别分析法,利用SPSS

软件对各个变量进行系统的分析,使该问题得到有效地解决。

二、问题的分析

由题意可知,目的就是为了建立一种模型,解决医学上的这种误诊问题。在该问题

中,必须确定血清铜篮蛋白、蓝色反应、尿呷味乙酸、中性硫化物与胃癌、萎缩性胃炎

的关系。衡量该四项指标的数学要点必然是相应的标准差、方差、均值等,同时,会建

立一个或几个函数分析其间关系的正相关或负相关,即其具有一定的相关性,然后利用

所给数据求解出一定的数学模型表达式,便可求解出胃病的鉴别方法。

三、符号的说明

X1:血清铜蛋白

X2:蓝色反应

X3:尿明味乙酸

X4:中型硫化物

N:被调查的样本数

WiIks的lambda:组内平方和与总平方和之比(当所有观测的组均值相等时,Wilks的

lambda值为1;当组内变异与总变异相比小时,WiIks的lambda值接近于0。因此,WiIks

的lambda值大,表示各个组的均值基本相等;WiIks的Iambda小表示组间有差异。在

判别分析中,只有组均值不等时,判别分析才有意义)

F:F值,F分布中的统计检定值

df:自由度

sig.:统计显著性,即出现目前样本的机率

P:p值

四、问题的假设

1.该四项生化指标是分别可以测得的。

2.每个生化指标都不是其他三个指标的线性组合,即两两之间无相关性。

3.被抽取的三类人员中彼此没有任何血缘关系。

4.除了本题研究的疾病外,被调查的人员无任何疾病。

(2)按顺序单击分析T分类T判别菜单项,如图7所示,系统弹出判别分析的对话框,

如图-2所示

文件(E)焉属(国视图(y)^fe(D)就怏(D分析(A)图形(@实用程序(LD附加内容(。)窗口加)帮助

1:

类型X1x2x3x4变量变量

11228.00134.00.200.11

21245.00134.00.100.40

31200.00167.00.120.27

41170.00150.00.070.08

51100.00167.00.200.14

62255.00125.00.070.14

72130.00100.00.060.12

82150.00117.00.070.06

92120.00133.00.100.26

102160.00100.00.050.10

113185.00115.00.050.19

123170.00125.00.060.04

133165.00142.00.050.08

143135.00108.00.020.12

153100.00117.00.070.02

图7先选择菜单进入判别分析对话框

注:X1:血清铜蛋白

X2:蓝色反应

X3:尿叫味乙酸

X4:中型硫化物

(3)选择参与判别分析的变量及其他相关设置

1)分组变量框:从左侧选入分类变量“类型”于分组变量框中。

2)定义范围按钮:定义分类变量的取值范围。单击分类变量按钮,系统弹出一个对话

框,如图-3所示。最小值输入1,最大只输入3.完成设置后,单击继续按钮,返回

判别分析主对话框,见图-2.

强判别分析

分组变量(Q):

类型SI

x1

定义范围

x2

x3自变量①:

x4

④一总循入自变量©

使用步法式方•法(U)

S选择变量(D:

图-2判别分析的主对话框

图-3指定分类变量范围对话框

3)自变量列表框:从左侧的变量列表将参与判别分析的变量“X1—X4”于其中,如图

-4所示。

4)一起输入变量单按钮:表示选择所有变量参与判别分析,如图-4所示。

图-4

(4)判别分析的统计输出设置。单击统计量按钮,系统弹出一个对话框,如图-5所示。

x

圜列别分标Al

缓计量(§二

描述性矩阵

方法(的…

回均值M□组内招美®

分类©...

叵单变量ANOVA(A)□组内加方差(V)

保存(⑥…

□Box'sM(B)□分组方方差(日

函数系数□总体加方笈(D

0Fisher(F)

引来标准优也)

取消语助

图-5判别分析的统计输出设置

1)描述性框:描述统计量选项组,包括3个复选框项,复选均值复选框和单变量复选

框。如图-5所示

均值复选框:各类中个变量的均值、标准差和各自变量总样本的均值、标准差;

单变量复选框:变量均值的单因子差异假设实骏。

2)函数系数框:判别函数系数选项组,复选Fisher复选框和未标准化复选框,如图

-5所示。

Fisher复选框:给出贝叶斯判别函数的系数。

未标准化复选框:给出未标准化的Fisher判别函数的系数。

(5)指定判别分析的有关参数及有关输出结果设置。单击分类按钮,系统弹出一个对

话框,如图-6所示。

强工与分析阳Y吩析分类凶

先驹概率使用次方差矩阵

®所有组相等(A)@在组内奥

O报惬组大小计现(6O分组⑥

输出-----------------------

0个案结果@H合并组(Q)

倩个案限制在前(U:叵分组G)

0檎要表&)回区域图①

H不考虑该个案时•的分•类(0

使用均的苦袂域失值(9

型纹取酒相助

图-6指定参数与结果对话框

1)先验概率框:先验概率选项组,包括两个单选项,单选所有组相等框如图-6所示。

所有组相等框:个二类先险概率相等。

2)输出框:分类结果选项组,包括三个复选项,复选个案结果、摘要表和不考虑该个

案时的分类复选框如图-6所示。

个案结果复选项:对每个样品输出判别函数值、实际类、预测类和后验概率。

摘要表复选项:输出分类小结,给出正确分类的样品数、错分样品数和错分率。

不考虑该个案时的分类复选项:交叉验证的判别分类结果。

3)使用协方差矩阵框:分类使用的协方差矩阵,单选在组内单选项如图-6所示。

在组内单选项:使用合并类内协方差矩阵。

4)图框:复选合并组、分组和区域图复选框如图-6所示。

合并组复选项:使出包括各个类的散点图。

分组复选项:每类输出一个散点图。

区域图复选项:揄出领域图。

所有设置完成后,单击继续按钮返回判别分析主对话框。

强心别分析Al

皎计量⑤...

方法(M)..

分类©...

保存(④…

图-7建立新变量对话框

(6)单击保存按钮,系统弹出一个对话框,复选预测组成员、判别得分和组成员概率

复选项如图-7所示。

1)预测组成员复选项:根据判别函数的值,按后验概率计算预测分类结果。

2)判别得分复选项:建立判别函数值变量。

3)组成员概率复选项:建立新变量,表明每一个样品属于某一类的概率。

所有设置完成后,单击继续按钮返回判别分析主对话框。

(7)上述设置完成后,单击确定按钮进行判别分析,得到输出结果。

七、模型的结果

(1)描述性输出

分析案例处理摘要

未加权案例N百分比

有效15100.0

排除的缺失或越界组代码0.0

至少一个暴失判别变量0.0

缺失或越界组代码还有至少一0.0

个缺失判别变量

合计0.0

合计15100.0

图-8

图-8表示有效样本及样本变量的实际情况o

组均值的均等性的检脸

WiIks的LambdaFdf1df2Sig.

X1.888.758212.490

x2.4268.074212.006

x3.4427.564212.007

x4.7861.633212.236

图-9

由图-9可知显著水平X2、X3最大,而X1、X4显著水平最小。但是由于判别变量间可能相

互关联,仅单独检验是不够的。但是通过将X1和X4分别与X2和X3联合后发现,他们对判

别的提高有很大的贡献。

组统计量

有效的N(列表状态)

类型均值标准差未加权的已加权的

1x1188.600057.1384355.300

x2150.400016,5015255.300

x3.1380.0593355.300

x4.2000.1332355.300

2x1163.000053,8052055.300

x2115.000014.8155355.300

x3.0700.0187155.300

x4.1360.0753755.300

3x1151.000033.8008955.300

x2121.400013.0115355.300

x3.0500.0187155.300

x4.0900.0678255.300

合计x1167.533348.475131515.300

x2128.933321.049151515.300

x3.0860.052211515.300

x4.1420.100941515.300

图TO

上表(图-10)表示各组变量的描述统计情况,给出了各个类型的均值、标准差等统计

量。通过这些数据,可以大致了解3种类型在这4个指标上的差异。

(2)判别函数的检验

特征值

函数特征值方差的%累积气正则相关性

12.768193.593.5.857

2.192*6.5100.0.402

a.分析中使用了前2个典型判别式函数。

图T1

WiIks的Lambda

函数检

脸Wilks的Lambda卡方dfSig.

1到2.22315.7758.046

2.8391.8473.605

图72

“特征值”(图71)表格给出了两个典型判别函数所能解释的方差变异,其中第一个

函数解释了所有变异的93.5%,第二个函数解释了余下的6.5%。因而第二个函数的相对

重要性远远小于第一个函数。

“WiIks的lambda”(图72)表格用来检验各个判别函数有无统计学上的显著意义,根

据该表反应的值,这些数据表明,第二个判别函数对判别组仍有显著贡献(犯错概率为

60.5%)o

(3)典型判别式函数摘要

标准化的典型判别式函数系数

函教

12

x1.382.011

x2.567861

x3.673.633

x4.296.515

结构矩阵

函致

12

x3.670'.314

图73

x1.2C8,.178

x2.673696'

x4.296.390,

判别变量和标准化典型判别式函

“标准化的典型判别式函数系数”数之间的汇聚组间相关性表格(图一⑶是两个

判别函数中各个变量的标准化系按函数内相关性的绝对大小排序数,由此可以判断各

的变量。

个函数主要受那些变量的影响;”结构矩阵”(图74)给

*.每个变量和任意判别式函数间

出的是判别变量和标准化判别函数最大的绝对相关性之间的相关性数据,

同样可以用来判断各个函数受那些判别变量的影响最大。对于判别函数1,变量X2、X3

的判别意义最大,而对判别函数2变量X3、X4的判别意义最大。

(4)未标准化系数和质心函数

典型判别式函数系数组质心处的函数

函教函数

12类型12

x1.008.00012.095053

x2.0380582873.505

x317.95416.8803-1.221452

x43.0625.327在组均值处评估的非标准化典型

(常量)-8.2045.228判别式函数

非标准化系.数

图75图76

非标准化系数在使用时可以直接通过原始变量进行计算,如图75所示。

“组质心处的函数”(图76)表格给出的是各类别的重心在平面上的坐标,如类型一的

坐标是(2.095,-0.053).只要根据这里的典型判别函数(未标准化的),计算出每个

观测的平面坐标,再计算它们和各类重心的距离,就可以判断其类型归属。

(5)Fisher判别函数

分类函数系数

类型

.127.104.101

.715.569.611

x368.59924.7232.328

组的光险概率

x44.742-1.376-7.537

用于分析的案例(常量)-71.993-43.041-45.525

类型先骏未加权的已加权的Fisher的线性判别式函数

1.33355.000

2.33355.000

3.33355.000

合计1.0001515.000

图77

图-18

Fisher判别函数的输出如图T7、图T8所示。

根据分类函数系数表格可骞出各类型的Fisher判别函数为:

8(x)=0.127*%+0.715*/+68.599*%+4.742%—71.993

g2(x)=0.104*xl+0,569*x2+24.723*x3-1.376x4-43.041

&(x)=0.101*%+0.611*%+2382*当一7.537x4-45.525

将某待诊者的四项生化指标分别带入到上述各类型对应的Fisher判别函数,得到三个对

应的Fisher函数值,根据Fisher后验概率最大这一判别规则,即所得函数值最大,可以

判断某待诊者所属的类型。

(6)典型判别的散点图

典则判别函数

类型二1

组质心

■组质心

O1

函数1

图79

典则判别函数

类型=2

组质心

■俎舸心

02

图-20

典则判别函数

类型二3

组质心

■组质心

03

函数1

图-21

以上三图给出的是胃癌、萎缩性胃炎、非胃病三种类型的判别函数值的散点图。第一个

图形表示将类型1,即胃癌的5个样本分别代入两个典型判别函数,得到5对判别函数

值,从而构成散点图,其中,横坐标是第一典型判别函数值,纵坐标是第二典型判别函

数值。在用SPSS软件进行判别分析时,都可以得到类似的判别函数值散点图。以上三

点图比较直观地反映了各组观测的分类情况和各组的重心。

典则判别函数

类胆

O1

02

3

■组质心

函数1

图-22

上图给出了三种类型的典型判别函数值总的散点图,同样是把各类的样品分别代入两个

典型判别函数,计算得到15对判别函数值,从而构成这样的散点图,其中,横坐标是第

一典型判别函数值,纵坐标是第二典型判别函数值。从图中可以看出,三种类型在图中

有各自的分布领域,说明所建立的判别函数的判别精度不太好。

(7)每个个体的判别结果

按照案例顺序的统计量

最高组第

案例数

aP(D>d|G=g)

到质心的平方

Mahalanobis距

实际组预测组PdfP(G=g|D=d)离组P(G=g

初始111.2732.9942.5972

211.3692.9491.9942

311.5572.9981.1702

413-.1142.5974.3361

511.6582.999.8382

622.4702.4871.5123

722.4752.6751.4873

823”.9072.516.1962

922.4412.5641.6361

1022.5352.6161.2523

1132”.9992.611.0033

1233.9102.664.1882

1333.3172.7782.2972

1433.5082.6191.3542

1533.8972.614.2182

交叉险证.112-.0004.58338.0671

212”.0054.91314.9501

311.3904.9974.1192

413-.3944.8554.0892

511.0044.99915.5392

62r.1484.8246.7743

722.5214.5353.2253

823”.9754.566.4892

92r.1934.9186.0843

1022.6994.5072.1983

1132”.9694.723.5463

1233.8744.6011.2222

1333.3284.6124.6262

1432”.5894.5262.8193

1532”.6314.5182.5773

对初始数据来说,平方Mahalanobis距离基于典则函数。

对交叉险证数据来说,平方Mahalanobis距离基于观察值。

**.错误分类的案例

a.仅对分析中的案例进行交叉脸证。在交叉验证中,每个案例都是按照从该案例以外的所有其他案例派生的函数来分类的。

图-23

上表中的案例数目列,是所有个体的编号。实际组列是每个个体实际上所在的类型。

在最高组(具有最大分辨率)下的预测组列,是按照计算结果的类型。可以看到编号4

经过判别分析后被判到了第三种类型中,即非胃病;编号8经过判别分析后被判到了第

三种类型中,即非胃病;编号11经过判别分析后被判到了第二种类型中,即萎缩性胃炎。

上表中的最高组(具有最大分辨率)下的P(D>d|G=g)列和df列,是在样本属于

该类型而判别不是相应类型的条件概率及其自由度。表中P(D=d|G=g)列是判别样本

属于相应类型,而样本确实是相应类型的后脸概率。从表中可以看出后验概率还是比较

大的。表中的最高组下的到质心的平方Mahalanobis距离列,是相应个体距类别重心

的马氏距离的平方。

上表中的第二最高组(具有第二大分辨率)下的组列,是把相应判为相应类型的情

况。表中的第二最高组下的P(D二d|G=g)是判别样本属于相应类型,而样本顼实是相

应类型的后验概率。表中第二最高组下的到质心的平方Mahalanobis距离列,与表中

最高组下的定义相同。

表中最后一列是两个典则判别函数之值.

分类结果比。

预测组成员

类型123合计

初始计数14015

20415

30145

%180.0.020.0100.0

2.080.020.0100.0

3.020.080.0100.0

交叉验证"计数12215

22215

30325

%140.040.020.0100.0

240.040.020.0100.0

3.060.040.0100.0

a.仅对分析中的案例进行交叉验证。在交叉脸证中,每个案例都是按照从该案例

以外的所有其他案例派生的函数来分类的。

b.已对初始分组案例中的80.0%个进行了正确分类。

c.已对交叉脸证分组案例中的40.0%个进行了正确分类。

图-24

由图-24可以得出该模型的判别正确率为80%,较低。

八模型的评价与改进方向

在此模型下,我们是假设把所有存在的判别变量都选入判别函数,并说明如何通过

计算标淮化判别函数系薮,辨认出不重要的判别变量,但最后的判别正确率不太高,因

此我们必须对模型进行改进。

根据图71和图73可计算各个指标对整个判别函数总体的判别系数。

对X1,其判别系数为:0.935*0.382+0.065*0.011=0.357885;

对X2,其判别系数为:0.935*0.567+0.065*(-0.861)=0.47418:

对X3,其判别系数为:0.935*0.673+0.065*0.633=0.6704;

对X4,其列别系数为:0.935*0.296+0.065*0.515=0.310235o

根据以上平均判别系数的数据,可以发现X3的平均判别系数最大,判别意义最大;

X4的平均判别系数最小,即其判别意义最小。因此,我们在此过程中可以考虑将X4舍去。

通过以上类似过程,我们可以得到每个个体的判别结果如图-25和图-26所示,贝]最后的

判别正确率为93.3%。

按照案例顺序的统计量

最高组第

P(D>d|G=g)

到质心的平方

案例数Mahalanobis距

目实际组预测组PdfP(G=gID=d)离组P(G=g

初始111.0432.9966.3062

211.6542.815.8482

311.4152.9961.7603

411.1332.4424.0313

511.6562.999.8452

622.4112.4591.7791

722.4742.6261.4933

822.9822.547.0363

922.5642.4541.1443

1022.5492.625

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论