版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
数学建模疾病的诊断
现要你给出疾病诊断的一种方法。
胃癌患者容易被误诊为萎缩性胃炎患者或非胃病者。从胃癌患者中抽
取5人(编号为1-5),从萎缩性胃炎患者中抽取5人(编号为670),以
及非胃病者
中抽取5人(编号为1175),每人化脸4项生化指标:血清铜蓝蛋白(XQ、
蓝色反应(X,/)、尿叫味乙酸(X,,)、中性硫化物(小)、测得数据如表1
所示:
表1.从人体中化验出的生化指标
No.12345678910
228245200170100255130150120160
x2134134167150167125100117133100
X30.20.10.120.070.200.070.060.070.10.05
X40.110.40.270.080.140.140.120.060.260.10
1112131415
185170165135100
115125142108117
0.050.060.050.020.07
0.190.040.080.120.02
根据数据,试给出鉴别胃病的方法。
论文题目:胃病的诊断
摘要
在临床医学中,诊断试脸是一种诊断疾病的重要方法。好的诊断试验方法将对临床
诊断的正确性和疾病的治疗效果起重要影响。因此,对于不同疾病不断发现新的诊断试
验方法是医学进步的重要标志。传统的诊断试脸方法有生化检测、DNA检测和影像检测
等方法。而本文则通过利用多元统计分析中的判别分析及SPSS软件的辅助较好地解决
了临床医学中胃病鉴别的问题。在临床医学上,既提高了临床诊断的正确性,又对疾病
的治疗效果起了重要效果,同时也减轻了病人的负担。
判别分析是在分类确定的条件下,根据某一研究对象的各种特征值判别其类型
归属问题的一种多变量统计分析方法。
其基本原理是按照一定的判别准则,建立一个或多个判别函数,用研究对象的
大量资料确定判别函数中的待定系数,并计算判别指标。
首先,由判别分析定义可知,只有当多个总体的特征具有显著的差异时,进行判别
分析才有意义,且总体间差异越大,才会使误判率越小。因此在进行判别分析时,有必
要对总体多元变量的均值进行是否不等的显著性检验。
其次,利用判别分析出的费歇判别和贝叶斯判别进行判别函数的建立。
最后,利用所建立的判别函数进行回判并测得其误判率,以及对其修正。
本文利用SPSS软件实现「对总体间给类变量的均值是否不等的显著性检验并根据
样本建立了相应的费歇判别函数和贝叶斯判别函数,最后进行了回判并测得了误判率,
从而获得了在临床诊断中模型,给临床上的诊断试验提供了新方法和新建议。
关键词:判别分析;判别函数;Fisher判别;Bayes判别
一问题的提出
在传统的胃病诊断中,胃癌患者容易被误诊为萎缩性胃炎患者或非胃病患者,为了
提高医学上诊断的准确性,也为了减少因误诊而造成的病人死亡率,必须要找出一种最
准确最有效的诊断方法。为诊断疾病,必须从人体中提取4项生化指标进行化验,即血
清铜蓝蛋白、蓝色反应、尿叫喋乙酸、中性硫化物。但是,从人体中化验出的生化指标,
必须要确定一个精准的指标来判断疾病所属的类型。设想,使用判别分析法,利用SPSS
软件对各个变量进行系统的分析,使该问题得到有效地解决。
二、问题的分析
由题意可知,目的就是为了建立一种模型,解决医学上的这种误诊问题。在该问题
中,必须确定血清铜篮蛋白、蓝色反应、尿呷味乙酸、中性硫化物与胃癌、萎缩性胃炎
的关系。衡量该四项指标的数学要点必然是相应的标准差、方差、均值等,同时,会建
立一个或几个函数分析其间关系的正相关或负相关,即其具有一定的相关性,然后利用
所给数据求解出一定的数学模型表达式,便可求解出胃病的鉴别方法。
三、符号的说明
X1:血清铜蛋白
X2:蓝色反应
X3:尿明味乙酸
X4:中型硫化物
N:被调查的样本数
WiIks的lambda:组内平方和与总平方和之比(当所有观测的组均值相等时,Wilks的
lambda值为1;当组内变异与总变异相比小时,WiIks的lambda值接近于0。因此,WiIks
的lambda值大,表示各个组的均值基本相等;WiIks的Iambda小表示组间有差异。在
判别分析中,只有组均值不等时,判别分析才有意义)
F:F值,F分布中的统计检定值
df:自由度
sig.:统计显著性,即出现目前样本的机率
P:p值
四、问题的假设
1.该四项生化指标是分别可以测得的。
2.每个生化指标都不是其他三个指标的线性组合,即两两之间无相关性。
3.被抽取的三类人员中彼此没有任何血缘关系。
4.除了本题研究的疾病外,被调查的人员无任何疾病。
(2)按顺序单击分析T分类T判别菜单项,如图7所示,系统弹出判别分析的对话框,
如图-2所示
文件(E)焉属(国视图(y)^fe(D)就怏(D分析(A)图形(@实用程序(LD附加内容(。)窗口加)帮助
1:
类型X1x2x3x4变量变量
11228.00134.00.200.11
21245.00134.00.100.40
31200.00167.00.120.27
41170.00150.00.070.08
51100.00167.00.200.14
62255.00125.00.070.14
72130.00100.00.060.12
82150.00117.00.070.06
92120.00133.00.100.26
102160.00100.00.050.10
113185.00115.00.050.19
123170.00125.00.060.04
133165.00142.00.050.08
143135.00108.00.020.12
153100.00117.00.070.02
图7先选择菜单进入判别分析对话框
注:X1:血清铜蛋白
X2:蓝色反应
X3:尿叫味乙酸
X4:中型硫化物
(3)选择参与判别分析的变量及其他相关设置
1)分组变量框:从左侧选入分类变量“类型”于分组变量框中。
2)定义范围按钮:定义分类变量的取值范围。单击分类变量按钮,系统弹出一个对话
框,如图-3所示。最小值输入1,最大只输入3.完成设置后,单击继续按钮,返回
判别分析主对话框,见图-2.
强判别分析
分组变量(Q):
类型SI
x1
定义范围
x2
x3自变量①:
x4
④一总循入自变量©
使用步法式方•法(U)
S选择变量(D:
图-2判别分析的主对话框
图-3指定分类变量范围对话框
3)自变量列表框:从左侧的变量列表将参与判别分析的变量“X1—X4”于其中,如图
-4所示。
4)一起输入变量单按钮:表示选择所有变量参与判别分析,如图-4所示。
图-4
(4)判别分析的统计输出设置。单击统计量按钮,系统弹出一个对话框,如图-5所示。
x
圜列别分标Al
缓计量(§二
描述性矩阵
方法(的…
回均值M□组内招美®
分类©...
叵单变量ANOVA(A)□组内加方差(V)
保存(⑥…
□Box'sM(B)□分组方方差(日
函数系数□总体加方笈(D
0Fisher(F)
引来标准优也)
取消语助
图-5判别分析的统计输出设置
1)描述性框:描述统计量选项组,包括3个复选框项,复选均值复选框和单变量复选
框。如图-5所示
均值复选框:各类中个变量的均值、标准差和各自变量总样本的均值、标准差;
单变量复选框:变量均值的单因子差异假设实骏。
2)函数系数框:判别函数系数选项组,复选Fisher复选框和未标准化复选框,如图
-5所示。
Fisher复选框:给出贝叶斯判别函数的系数。
未标准化复选框:给出未标准化的Fisher判别函数的系数。
(5)指定判别分析的有关参数及有关输出结果设置。单击分类按钮,系统弹出一个对
话框,如图-6所示。
强工与分析阳Y吩析分类凶
先驹概率使用次方差矩阵
®所有组相等(A)@在组内奥
O报惬组大小计现(6O分组⑥
输出-----------------------
0个案结果@H合并组(Q)
倩个案限制在前(U:叵分组G)
0檎要表&)回区域图①
H不考虑该个案时•的分•类(0
使用均的苦袂域失值(9
型纹取酒相助
图-6指定参数与结果对话框
1)先验概率框:先验概率选项组,包括两个单选项,单选所有组相等框如图-6所示。
所有组相等框:个二类先险概率相等。
2)输出框:分类结果选项组,包括三个复选项,复选个案结果、摘要表和不考虑该个
案时的分类复选框如图-6所示。
个案结果复选项:对每个样品输出判别函数值、实际类、预测类和后验概率。
摘要表复选项:输出分类小结,给出正确分类的样品数、错分样品数和错分率。
不考虑该个案时的分类复选项:交叉验证的判别分类结果。
3)使用协方差矩阵框:分类使用的协方差矩阵,单选在组内单选项如图-6所示。
在组内单选项:使用合并类内协方差矩阵。
4)图框:复选合并组、分组和区域图复选框如图-6所示。
合并组复选项:使出包括各个类的散点图。
分组复选项:每类输出一个散点图。
区域图复选项:揄出领域图。
所有设置完成后,单击继续按钮返回判别分析主对话框。
强心别分析Al
皎计量⑤...
方法(M)..
分类©...
保存(④…
图-7建立新变量对话框
(6)单击保存按钮,系统弹出一个对话框,复选预测组成员、判别得分和组成员概率
复选项如图-7所示。
1)预测组成员复选项:根据判别函数的值,按后验概率计算预测分类结果。
2)判别得分复选项:建立判别函数值变量。
3)组成员概率复选项:建立新变量,表明每一个样品属于某一类的概率。
所有设置完成后,单击继续按钮返回判别分析主对话框。
(7)上述设置完成后,单击确定按钮进行判别分析,得到输出结果。
七、模型的结果
(1)描述性输出
分析案例处理摘要
未加权案例N百分比
有效15100.0
排除的缺失或越界组代码0.0
至少一个暴失判别变量0.0
缺失或越界组代码还有至少一0.0
个缺失判别变量
合计0.0
合计15100.0
图-8
图-8表示有效样本及样本变量的实际情况o
组均值的均等性的检脸
WiIks的LambdaFdf1df2Sig.
X1.888.758212.490
x2.4268.074212.006
x3.4427.564212.007
x4.7861.633212.236
图-9
由图-9可知显著水平X2、X3最大,而X1、X4显著水平最小。但是由于判别变量间可能相
互关联,仅单独检验是不够的。但是通过将X1和X4分别与X2和X3联合后发现,他们对判
别的提高有很大的贡献。
组统计量
有效的N(列表状态)
类型均值标准差未加权的已加权的
1x1188.600057.1384355.300
x2150.400016,5015255.300
x3.1380.0593355.300
x4.2000.1332355.300
2x1163.000053,8052055.300
x2115.000014.8155355.300
x3.0700.0187155.300
x4.1360.0753755.300
3x1151.000033.8008955.300
x2121.400013.0115355.300
x3.0500.0187155.300
x4.0900.0678255.300
合计x1167.533348.475131515.300
x2128.933321.049151515.300
x3.0860.052211515.300
x4.1420.100941515.300
图TO
上表(图-10)表示各组变量的描述统计情况,给出了各个类型的均值、标准差等统计
量。通过这些数据,可以大致了解3种类型在这4个指标上的差异。
(2)判别函数的检验
特征值
函数特征值方差的%累积气正则相关性
12.768193.593.5.857
2.192*6.5100.0.402
a.分析中使用了前2个典型判别式函数。
图T1
WiIks的Lambda
函数检
脸Wilks的Lambda卡方dfSig.
1到2.22315.7758.046
2.8391.8473.605
图72
“特征值”(图71)表格给出了两个典型判别函数所能解释的方差变异,其中第一个
函数解释了所有变异的93.5%,第二个函数解释了余下的6.5%。因而第二个函数的相对
重要性远远小于第一个函数。
“WiIks的lambda”(图72)表格用来检验各个判别函数有无统计学上的显著意义,根
据该表反应的值,这些数据表明,第二个判别函数对判别组仍有显著贡献(犯错概率为
60.5%)o
(3)典型判别式函数摘要
标准化的典型判别式函数系数
函教
12
x1.382.011
x2.567861
x3.673.633
x4.296.515
结构矩阵
函致
12
x3.670'.314
图73
x1.2C8,.178
x2.673696'
图
x4.296.390,
判别变量和标准化典型判别式函
“标准化的典型判别式函数系数”数之间的汇聚组间相关性表格(图一⑶是两个
判别函数中各个变量的标准化系按函数内相关性的绝对大小排序数,由此可以判断各
的变量。
个函数主要受那些变量的影响;”结构矩阵”(图74)给
*.每个变量和任意判别式函数间
出的是判别变量和标准化判别函数最大的绝对相关性之间的相关性数据,
同样可以用来判断各个函数受那些判别变量的影响最大。对于判别函数1,变量X2、X3
的判别意义最大,而对判别函数2变量X3、X4的判别意义最大。
(4)未标准化系数和质心函数
典型判别式函数系数组质心处的函数
函教函数
12类型12
x1.008.00012.095053
x2.0380582873.505
x317.95416.8803-1.221452
x43.0625.327在组均值处评估的非标准化典型
(常量)-8.2045.228判别式函数
非标准化系.数
图75图76
非标准化系数在使用时可以直接通过原始变量进行计算,如图75所示。
“组质心处的函数”(图76)表格给出的是各类别的重心在平面上的坐标,如类型一的
坐标是(2.095,-0.053).只要根据这里的典型判别函数(未标准化的),计算出每个
观测的平面坐标,再计算它们和各类重心的距离,就可以判断其类型归属。
(5)Fisher判别函数
分类函数系数
类型
.127.104.101
.715.569.611
x368.59924.7232.328
组的光险概率
x44.742-1.376-7.537
用于分析的案例(常量)-71.993-43.041-45.525
类型先骏未加权的已加权的Fisher的线性判别式函数
1.33355.000
2.33355.000
3.33355.000
合计1.0001515.000
图77
图-18
Fisher判别函数的输出如图T7、图T8所示。
根据分类函数系数表格可骞出各类型的Fisher判别函数为:
8(x)=0.127*%+0.715*/+68.599*%+4.742%—71.993
g2(x)=0.104*xl+0,569*x2+24.723*x3-1.376x4-43.041
&(x)=0.101*%+0.611*%+2382*当一7.537x4-45.525
将某待诊者的四项生化指标分别带入到上述各类型对应的Fisher判别函数,得到三个对
应的Fisher函数值,根据Fisher后验概率最大这一判别规则,即所得函数值最大,可以
判断某待诊者所属的类型。
(6)典型判别的散点图
典则判别函数
类型二1
组质心
■组质心
O1
函数1
图79
典则判别函数
类型=2
组质心
■俎舸心
02
图-20
典则判别函数
类型二3
组质心
■组质心
03
函数1
图-21
以上三图给出的是胃癌、萎缩性胃炎、非胃病三种类型的判别函数值的散点图。第一个
图形表示将类型1,即胃癌的5个样本分别代入两个典型判别函数,得到5对判别函数
值,从而构成散点图,其中,横坐标是第一典型判别函数值,纵坐标是第二典型判别函
数值。在用SPSS软件进行判别分析时,都可以得到类似的判别函数值散点图。以上三
点图比较直观地反映了各组观测的分类情况和各组的重心。
典则判别函数
类胆
O1
02
3
■组质心
函数1
图-22
上图给出了三种类型的典型判别函数值总的散点图,同样是把各类的样品分别代入两个
典型判别函数,计算得到15对判别函数值,从而构成这样的散点图,其中,横坐标是第
一典型判别函数值,纵坐标是第二典型判别函数值。从图中可以看出,三种类型在图中
有各自的分布领域,说明所建立的判别函数的判别精度不太好。
(7)每个个体的判别结果
按照案例顺序的统计量
最高组第
案例数
aP(D>d|G=g)
到质心的平方
Mahalanobis距
实际组预测组PdfP(G=g|D=d)离组P(G=g
初始111.2732.9942.5972
211.3692.9491.9942
311.5572.9981.1702
413-.1142.5974.3361
511.6582.999.8382
622.4702.4871.5123
722.4752.6751.4873
823”.9072.516.1962
922.4412.5641.6361
1022.5352.6161.2523
1132”.9992.611.0033
1233.9102.664.1882
1333.3172.7782.2972
1433.5082.6191.3542
1533.8972.614.2182
交叉险证.112-.0004.58338.0671
212”.0054.91314.9501
311.3904.9974.1192
413-.3944.8554.0892
511.0044.99915.5392
62r.1484.8246.7743
722.5214.5353.2253
823”.9754.566.4892
92r.1934.9186.0843
1022.6994.5072.1983
1132”.9694.723.5463
1233.8744.6011.2222
1333.3284.6124.6262
1432”.5894.5262.8193
1532”.6314.5182.5773
对初始数据来说,平方Mahalanobis距离基于典则函数。
对交叉险证数据来说,平方Mahalanobis距离基于观察值。
**.错误分类的案例
a.仅对分析中的案例进行交叉脸证。在交叉验证中,每个案例都是按照从该案例以外的所有其他案例派生的函数来分类的。
图-23
上表中的案例数目列,是所有个体的编号。实际组列是每个个体实际上所在的类型。
在最高组(具有最大分辨率)下的预测组列,是按照计算结果的类型。可以看到编号4
经过判别分析后被判到了第三种类型中,即非胃病;编号8经过判别分析后被判到了第
三种类型中,即非胃病;编号11经过判别分析后被判到了第二种类型中,即萎缩性胃炎。
上表中的最高组(具有最大分辨率)下的P(D>d|G=g)列和df列,是在样本属于
该类型而判别不是相应类型的条件概率及其自由度。表中P(D=d|G=g)列是判别样本
属于相应类型,而样本确实是相应类型的后脸概率。从表中可以看出后验概率还是比较
大的。表中的最高组下的到质心的平方Mahalanobis距离列,是相应个体距类别重心
的马氏距离的平方。
上表中的第二最高组(具有第二大分辨率)下的组列,是把相应判为相应类型的情
况。表中的第二最高组下的P(D二d|G=g)是判别样本属于相应类型,而样本顼实是相
应类型的后验概率。表中第二最高组下的到质心的平方Mahalanobis距离列,与表中
最高组下的定义相同。
表中最后一列是两个典则判别函数之值.
分类结果比。
预测组成员
类型123合计
初始计数14015
20415
30145
%180.0.020.0100.0
2.080.020.0100.0
3.020.080.0100.0
交叉验证"计数12215
22215
30325
%140.040.020.0100.0
240.040.020.0100.0
3.060.040.0100.0
a.仅对分析中的案例进行交叉验证。在交叉脸证中,每个案例都是按照从该案例
以外的所有其他案例派生的函数来分类的。
b.已对初始分组案例中的80.0%个进行了正确分类。
c.已对交叉脸证分组案例中的40.0%个进行了正确分类。
图-24
由图-24可以得出该模型的判别正确率为80%,较低。
八模型的评价与改进方向
在此模型下,我们是假设把所有存在的判别变量都选入判别函数,并说明如何通过
计算标淮化判别函数系薮,辨认出不重要的判别变量,但最后的判别正确率不太高,因
此我们必须对模型进行改进。
根据图71和图73可计算各个指标对整个判别函数总体的判别系数。
对X1,其判别系数为:0.935*0.382+0.065*0.011=0.357885;
对X2,其判别系数为:0.935*0.567+0.065*(-0.861)=0.47418:
对X3,其判别系数为:0.935*0.673+0.065*0.633=0.6704;
对X4,其列别系数为:0.935*0.296+0.065*0.515=0.310235o
根据以上平均判别系数的数据,可以发现X3的平均判别系数最大,判别意义最大;
X4的平均判别系数最小,即其判别意义最小。因此,我们在此过程中可以考虑将X4舍去。
通过以上类似过程,我们可以得到每个个体的判别结果如图-25和图-26所示,贝]最后的
判别正确率为93.3%。
按照案例顺序的统计量
最高组第
P(D>d|G=g)
到质心的平方
案例数Mahalanobis距
目实际组预测组PdfP(G=gID=d)离组P(G=g
初始111.0432.9966.3062
211.6542.815.8482
311.4152.9961.7603
411.1332.4424.0313
511.6562.999.8452
622.4112.4591.7791
722.4742.6261.4933
822.9822.547.0363
922.5642.4541.1443
1022.5492.625
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026四川关于常年引进高层次人才的模拟试卷附答案详解(黄金题型)
- 2026陕西铁路工程职业技术学院招聘备考题库【综合卷】附答案详解
- 2026北京大学未来技术学院招聘劳动合同制人员4人模拟试卷附参考答案详解(考试直接用)
- 2026广西物资学校秋学期招聘兼职教师备考题库及完整答案详解(各地真题)
- 2026北京师范大学一带一路学院教学助理招聘笔试题库附完整答案详解(考点梳理)
- 2026上海复旦大学附属肿瘤医院中西医结合科大学科团队招聘临床协调员1名模拟试卷附完整答案详解【夺冠系列】
- 2026江西宜春市园林事务中心招聘1人考前冲刺密卷及答案详解(名校卷)
- 2025年市场营销(客户关系管理)试题及答案
- 2026年吉林省教师公需课《人工智能赋能制造业高质量发展》试题及答案解析
- 2025-2026学年阿坝藏族羌族自治州黑水县数学三年级下学期期中考试模拟试题含答案
- 硅pu篮球场铺设专项施工方案
- 垃圾发电厂建设、调试与运营管理全流程培训
- 校本课程开发全流程指南-含完整需求诊断框架、课程设计模板、实施SOP流程、多场景案例拆解、质量检查清单与KPI评估体系
- 膝关节韧带损伤护理指南
- 2026国家统计局诸暨调查队招聘编外用工1人(浙江)笔试备考试题及答案解析
- 《药理学》全套题库(附答案)
- 2026年内蒙古电子信息职业技术学院单招职业技能考试题库及答案解析(夺冠)
- 工务安全生产管理系统
- 生而逢盛世+筑梦新青年+-2025-2026学年高二上学期爱国主义教育主题班会
- 《电站煤粉锅炉高碱煤掺烧技术导则》
- 矿山爆破管理办法
评论
0/150
提交评论