1队影响戒烟成功因素的分析.doc_第1页
1队影响戒烟成功因素的分析.doc_第2页
1队影响戒烟成功因素的分析.doc_第3页
1队影响戒烟成功因素的分析.doc_第4页
1队影响戒烟成功因素的分析.doc_第5页
已阅读5页,还剩16页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

影响戒烟成功因素的分析 摘要 本文对B题中所给出的影响戒烟因素和戒烟天数的研究数据进行了比较详细讨论。运用多元统计分析的思想,建立数学模型,对影响戒烟成功因素进行了分析,最后为有志于戒烟的人士提供一些建设性的戒烟对策和建议。对于实验数据的缺失,运用多重插补法,利用R软件,将从一个包含缺失值的数据集中进行重复模拟生成一组完整的数据集,每个模拟数据集中,缺失数据将用蒙特卡洛方法来填补,最后从观测值中进行抽样,选取一组比较合理的数据对所缺数据进行了填补。对于问题一,运用单一变量的分析方法,利用R软件,对实验数据进行分析处理,绘画出直方图,描绘出不同年龄段、不同性别等因素下再次吸烟的累加发病率分布情况。分析结果显示,累加发病率在不同年龄段、不同CO浓度水平、不同调整的CO浓度水平中变化比较明显,而在不同性别、不同每日抽烟支数水平中变化不大。对于问题二,本文选取戒烟天数小于365天的被调查者为研究对象,利用R软件,分别求出年龄、性别、每日抽烟支数、CO浓度、调整的CO浓度与戒烟天数的相关系数,然后画出各影响因素与戒烟天数的散点图,对各因素数据进行等距分组处理,画出散点图,进行线性拟合分析,最后对各因素提取第一主成分,通过看各变量对第一主成分的贡献率大小,综合前面两种分析结果可知,各因素对戒烟时间的影响程度由大到小为:CO浓度、调整的CO浓度、每天抽烟支数、年龄、性别。对于问题三,基于问题一和问题二中的分析过程发现,各影响因素与戒烟时间的相关系数均小于0.3,即各个单一影响因素与戒烟时间不相关,几乎不呈线性关系,而各影响因素之间的相关系数较大,具有一定的相关关系,对于此,本文利用R软件对年龄、性别等六个影响因素进行主成分分析,并且分别利用问题二的分析和系统聚类分析对模型进行了可靠性分析验证,得到的结论是先前抽烟的数量和吸烟依赖性是影响戒烟成功的最主要因素。对于问题四,本文综合数学模型的分析,对模型进一步的推广和应用,为有志于戒烟的人士提供一些建设性的戒烟对策和建议,其中最主要的是建议烟民正确认识吸烟的危害,要想戒烟成功就必须要提高自制力,同时还要有决心和坚强的毅力。 关键词:多重插补;相关系数;主成分分析;R语言;系统聚类分析 一、问题的重述众所周知,吸烟不仅危害自身健康,而且由此引起的被动吸烟更是危害公众身心健康的主要原因。并且,目前我国一方面是吸烟者队伍有不断壮大和年轻化趋势,一方面是有戒烟意向的人无适宜技术,得不到有效的帮助,形成“痛下决心戒烟戒而复吸”的怪圈。为了帮助相关人士摆脱烟瘾的困扰,研究小组展开了调查,对234个自愿表示戒烟但还未戒烟的人进行跟踪调查,在他们戒烟的这一天,测量了每个人的CO(一氧化碳)水平并记下他们抽最后一支烟的CO测定时间。CO的水平提供了一个他们先前抽烟数量的客观指标,但其值也受到抽最后一支烟的时间的影响, 因此抽最后一支烟的时间可以用来调整CO的水平。记录下研究对象的性别、年龄及自述每日抽烟支数。这个调查跟踪1年, 考察他们一直保持戒烟的天数, 由此估计这些人中再次吸烟的累加发病率, 也就是原吸烟者戒烟一段时间后又再吸烟的比例。其中假设原烟民戒烟的可信度是很低的(更恰当地说多数是再犯者)戒烟天数是从0到他(她)退出戒烟或研究截止时间(1 年)的天数。假定他们全部没有人中途退出研究。调查发现,影响戒烟成功的因素有很多,可能的因素包括年龄、性别、每日抽烟的支数、烟民体内CO的浓度等。但影响烟民戒烟成功的主要因素有哪些?各个因素的影响程度如何?是否还存在一些隐藏的因素影响戒烟成功?对于有意愿戒烟的烟民如何才能更好地把握这些因素,更有效地采取有效对策戒烟?本文尝试解决以下问题:1) 由于烟民年龄、性别、每日抽烟支数等均存在较大的差异性,需对各影响因素与再次吸烟的累加发病率的关系进行分析,分析上述234人中再次吸烟的累加发病率分布情况(如不同年龄段、不同性别等因素下的累加发病率分布情况)。2) 影响戒烟成功的因素有很多,弄清各影响因素的影响程度对找出戒烟对策很重要。需根据附录中的数据,分别给出戒烟时间与上述认为有影响的因素之间的定量分析结果。3) 影响戒烟成功的主要因素是能否戒烟成功的关键,所以需利用附录中的数据建立适当的数学模型,讨论影响戒烟成功的主要因素有哪些,并对所建模型进行可靠性分析。4) 对模型进行推广和应用是数学建模的重要意义所在,因此根据所建模型,撰写一篇500字左右的短文,向有志于戒烟的人士提供戒烟对策和建议。 二、模型假设1. 假定234个被调查者全部没有人中途退出研究。2. 假设被调查者中没有坚持戒烟365天的都是再犯者。3. 假设所填补数据接近真实情况,并且不对模型造成决定性影响。4. 假设被调查者自述提供的数据是可靠的,不受主观干扰因素影响。5. 假设记录下来的数据中部分存在较大的误差,建模过程中允许忽略解析。6. 假设被调查者是随机选取的,具有一定的代表性和研究价值。 三、符号说明Id被调查者编号Age年龄Gender性别(1表示男,2表示女)Cig_Day每日抽烟支数Min_last距离抽最后一支烟的分钟数LogCOadj调整的CO浓度COCO浓度Day_abs戒烟天数XY两组数据的相关系数PC1、RC1第一主成分RC2第二主成分h2成分公因子方差u2成分唯一性 四、问题的分析根据题意可知,每个被调查者在戒烟的前一天均有抽最后一支烟,随后测出当时烟后的CO浓度作为调整的CO浓度,并且记录了距离抽最后一支烟的分钟数。在戒烟的这一天,测量了每个人的CO平均水平。原题定义,累加发病率是原吸烟者戒烟一段时间后又再吸烟的比例。由原题分析可知,被调查者在跟踪调查这一年中没有再抽烟为戒烟成功,而在研究截止时间(1年)内如果再抽烟为戒烟失败,作为再犯者。对于问题一,题目要求分析上述234人中再次吸烟的累加发病率分布情况。根据附录中的数据,运用R软件将年龄、性别、CO含量等数据进行恰当的分段处理,然后分别作出相应不同年龄段、不同性别等因素下的累加发病率分布直方图,从而分析累加发病率的分布情况。对于问题二,由数据的分析可知,年龄、性别、每日抽烟支数及调整的CO浓度等因素都会影响戒烟时间,题目要求分别给出戒烟时间与有影响的因素之间的定量分析结果。而根据问题一的累加发病率直方图,只能初步判断出各影响因素与累加发病率的关系,还并不能给出各影响因素与戒烟时间的定量分析结果。由于调查只跟踪一年,对于戒烟成功者,他们的戒烟天数是不确定的。本文在解析问题二进行数据处理时把戒烟天数是365天的数据排除,只对戒烟天数小于365天的数据进行处理和分析。首先利用R软件求出各影响因素与戒烟时间的相关系数,用相关系数的大小判断各因素对戒烟时间的影响程度,如果相关性不明显,将进行线性拟合分析。在线性拟合分析中,为了减小数据的分散程度,看清数据之间的关系,利用R语言编制一个统一的数据处理程序,对数据进行等距求平均值处理,作出相应的散点图,进行线性拟合分析。最后对各因素提取第一主成分,通过看各变量对第一主成分的贡献率大小,综合前面两种分析结果,判断出各影响因素对戒烟时间影响程度的大小关系。对于问题三,题目要求讨论影响戒烟成功的主要因素有哪些,并对所建模型进行可靠性分析。在处理问题二时发现,各影响因素与戒烟天数之间的关系并不非常的明显,不能有力判断出影响戒烟成功的主要因素。因此,本文采用主成分分析来分析、简化数据集。求出主成分对整个数据集的方差解释度和累积解释度,和获取主成分的得分来写出第一和第二主成分的方程,从提取的主成分中归纳出影响戒烟成功的主要因素。为了检验模型的可靠性,对234个数据进行系统聚类。由聚类分析的结果和问题二的分析结果来检验主成分提取模型的可靠性。对于问题四,可根据问题一、二、三的模型分析结果,撰写一篇500字左右的短文,向有志于戒烟的人士提供戒烟对策和建议,从而实现对模型的应用。 五、模型建立与求解5.1问题一的模型建立和求解 根据题意,累加发病率=(该变量段吸烟复发人数/该段变量总调查人数)*100%,通过编写程序统计出吸烟复发人数,即戒烟天数不足365天的人,再求出不同因素的累加发病率。对于上述234人中再次吸烟的累加发病率分布情况采用分布直方图的方法进行分析。图5.1 不同年龄段的累加发病率直方图 由图5.1可以知道年龄在2160岁的人累加发病率都在90%左右,而6180岁的人的累加发病率在75%左右。图5.2 不同性别的累加发病率直方图 由图5.2可以知道男女的累加发病率都在80%90%之间,性别不同对累加发病率的影响不大。图5.3 每天抽烟支数的累加发病率直方图由图5.3可以知道每天抽烟支数的141以上的累加发病率也都在80%以上,由此得出每天吸烟支数的不同对累加发病率的影响也不大。 图5.4 不同CO浓度段的累加发病率直方图 由图5.4可知,CO浓度在1100的范围内发病率为75%左右,而在101以上的发病率都在90%左右,由此可以知道CO浓度越大,发病率也大。图5.5 不同的CO调整浓度的累加发病率直方图由图5.5可知,CO调整浓度在1000以内的发病率在65%以下,而1001以上的累加发病率都是在90%左右。由此可知,CO的调整浓度对发病率有一定的影响,CO调整浓度越小,发病率越小。由上分析可得出,性别和每天吸烟支数的不同对发病率的影响较小,而年龄、CO浓度和CO调整浓度对发病率的影响相对大些。年龄越高,发病率越小;CO浓度和CO调整浓度越高,发病率越高。5.2问题二的模型建立和求解 通过对各变量与戒烟天数的相关度分析,如下表: AgeGenderCig_DayCOMin_lastLogCOadj XY0.048717190.006203030.02658426-0.18828180.14893848-0.1479339 表5.6 各变量与戒烟天数的相关系数表相关分析是用相关系数来表示两个变量间相互线性关系,并判断其密切程度的统计方法。相关系数没有单位。在-1+1范围内变动,其绝对值愈接近1,两个变量间的线性相关愈密切,愈接近0,相关愈不密切。相关系数若为正,说明一变量随另一变量增减而增减,方向相同;若为负,表示一变量增加、另一变量减少,即方向相反。由表5.6发现各影响因素与戒烟天数中有正相关也有负相关,影响程度由大到小排序为:CO浓度,Min_last, 调整的CO浓度,每日抽烟支数,年龄, 性别。但是,以上各变量与戒烟天数的相关系数值均小于0.3(说明:相关系数的绝对值在0到0.3的呈无相关性,0.3到0.8的呈弱相关性,0.8到1呈强相关性),即可知各变量与戒烟天数均不表现出直线关系,单从相关系数的方法进行定量分析还不足以得出各变量对戒烟天数的影响程度大小结论。因此,下面将运用线性拟合的方法进一步分析。为了了解各被调查者的戒烟情况,做出了如下散点图: 图5.7 戒烟情况散点图由图5.7可知,被调查的234人中大多数经过很短时间后又再次抽烟,并且戒烟天数的分布很不规则,如果直接观察散点图,将会发现数据比较分散,波动较大,各个影响因素与戒烟天数之间的关系都不是非常明显,不便于对数据进行直接处理。因此本文决定采取等距处理数据求平均值的方法。将戒烟天数是365天的戒烟者的数据删除后,按影响因素的值等距分段,再计算每段所对应戒烟天数的平均值,最后以各影响因素为横坐标,以戒烟天数为纵坐标做出散点图,并进行线性拟合分析。这样处理数据能在不影响数据关系特征的前提下,减小数据的分散程度,更好地看清数据之间的关系。将筛选后得到的201组数据等距分为20组,求平均值,作出相应散点图。用局部加权回归散点平滑法(locally weighted scatterplot smoothing,LOWESS或LOESS)观察二维变量之间的关系,下图中红色是最佳拟合的线性直线,而绿色则是用局部加权回归散点平滑法得出一条平滑曲线。因为现实生活中规律不总是一条直线,所以也采用了平滑曲线拟合。各散点图如下: 图5.8 年龄-戒烟天数拟合散点图 图5.9 每天吸烟支数-戒烟天数拟合散点图 图5.10 CO含量-戒烟天数拟合散点图 图5.11 距离抽最后一支烟时间-戒烟天数拟合散点图 图5.12 调整的CO浓度-戒烟天数拟合散点图由图5.8和图5.9可以看出,年龄和每天抽烟支数的直线拟合斜率较小,一定程度上反应出年龄和每天抽烟支数对影响戒烟时间的程度较小。由图5.10和图5.11可知,CO浓度和距离抽最后一支烟时间的直线拟合斜率较大,也一定程度上反应CO浓度和距离抽最后一支烟时间对影响戒烟时间的程度较大。综合图5.8至图5.12看,发现各变量与戒烟天数均不表现出明显的线性关系,只有图5.10中的曲线拟合较明显,可以看出随着CO的增大戒烟天数不断减小的关系。 针对数据分布不规则,线性拟合不明显的缺陷,本文采取主成分分析的方案对模型进一步改进和优化,在各变量中提取一个主成分,通过各变量对主成分贡献率的大小来判断各因素对戒烟天数的影响程度大小。提取一个主成分:Standardized loadings (pattern matrix) based upon correlation matrix PC1 h2 u2Age 0.00 1.1e-06 1.00Gender -0.15 2.4e-02 0.98Cig_Day 0.61 3.7e-01 0.63CO 0.95 8.9e-01 0.11Min_last -0.52 2.7e-01 0.73LogCOadj 0.80 6.4e-01 0.36 PC1SS loadings 2.20Proportion Var 0.37Test of the hypothesis that 1 component is sufficient.The degrees of freedom for the null model are 15 and the objective function was 2.43The degrees of freedom for the model are 9 and the objective function was 1.21 The total number of observations was 234 with MLE Chi Square = 277.89 with prob 0.8)。而Age为0,即是不相关。除去Age相关系数绝对值由大到小排列依次是:CO,LogCOadj,Cig_Day,Min_last,Gender SS loadings包含了与主成分相关联的特征值,其含义是与特定主成分相关联的标准化后的方差值。比如,本例中,第一主成分的值为2.20。接下来的proportion var为主成分对整个数据集的方差解释度。第一主成分解释了6个变量37%的方差。最后,获取主成分的得分: AgeGenderCig_DayCOMin_lastLogCOadjPC10.0--0.20.4根据上述的结果,即可写出第一主成分的方程: Y =(-0.1Gender) +0.3Cig_Day +0.4CO+ (-0.2Min_last) + 0.40LogCOadj 从上述的方程中可知,第一主成分中,CO与LogCOadj的系数最高,其次是Cig_Day,再到Min_last 和Gender,Age为0. 综合前面两种分析结果可知,各因素对戒烟时间的影响程度由大到小为:CO浓度、调整的CO浓度、每天抽烟支数、年龄、性别。5.3问题三的模型建立和求解 由5.2问题的分析求解得知,列出的CO与调整的CO浓度、每日抽烟支数、性别和年龄因素和戒烟时间(天数)长短相关性不大,并不是主要影响因素。求出各变量相关系数和作出各变量的相关系数图: 图5.13 各个变量的相关系数矩阵 图5.13 各个变量的相关图 先从下三角单元格(在主对角线下方的单元格)开始解释这幅图形。默认地,蓝色和从左下指向右上的斜杠表示单元格中的两个变量呈正相关。反过来,红色和从左上指向右下的斜杠表示变量呈负相关。色彩越深,饱和度越高,说明变量相关性越大。相关性接近于0的单元格基本无色。本图为了将有相似相关模式的变量聚集在一起,对矩阵的行和列都重新进行了排序(使用主成分法)。上三角单元格用饼图展示了相同的信息。颜色的功能同上,但相关性大小由被填充的饼图块的大小来展示。正相关性将从12点钟处开始顺时针填充饼图,而负相关性则逆时针方向填充饼图。可以看出,LogCOadj跟CO,Cig_Day跟CO,Cig_Day跟LogCOadj正相关较高,Min_last跟CO负相关较高,各变量之间的相关系数较高,因此采用主成分分析(principal components analysis, PCA)来分析、简化数据集。分析的步骤为:(1) 判断主成分的个数;(2) 提取主成分;(3) 获取主成分得分;(4) 列出主成分方程,解释主成分意义。因为5.2模型建立及求解只是解释了6个变量37%的方差,所以要重新判断选择主成份个数。首先用平行分析(parallel analysis)生成若干组与原始数据结构相同的随机矩阵,求出其特征值并进行平均,然后和真实数据的特征值进行比对,根据交叉点的位置来选择主成分个数。 图5.14 碎石图 上图中,直线与x符号链接的曲线为碎石图,1.0水平线为1准则的特征值,虚线为100次随机数据模拟的平行分析。碎石图画出了特征值与主成分分数的图形。从图中可见第一、二主成分位于红线上方,结果表明,选择2个主成分即可保留样本中的大量分信息。第二步,提取主成分。Standardized loadings (pattern matrix) based upon correlation matrix RC1 RC2 h2 u2Age -0.11 -0.79 0.63 0.368Gender -0.07 0.59 0.36 0.643Cig_Day 0.58 -0.26 0.40 0.600CO 0.95 -0.01 0.91 0.089Min_last -0.45 0.46 0.42 0.584LogCOadj 0.84 0.22 0.76 0.242 RC1 RC2SS loadings 2.18 1.30Proportion Var 0.36 0.22Cumulative Var 0.36 0.58Proportion Explained 0.63 0.37Cumulative Proportion 0.63 1.00Test of the hypothesis that 2 components are sufficient.The degrees of freedom for the null model are 15 and the objective function was 2.43The degrees of freedom for the model are 4 and the objective function was 1.25 The total number of observations was 234 with MLE Chi Square = 286.83 with prob 0.8),第二主成分(RC2)与Age高度相关。 h2栏是成分公因子方差,是主成分对每个变量的方差解释度。U2栏是成分唯一性,是主成分无法解释变量方差的比例,其值 = 1-h2。本例中,第一主成分对CO变量方差的解释为91%,8.9%不能解释。 SS loadings包含了与主成分相关联的特征值,其含义是与特定主成分相关联的标准化后的方差值。比如,本例中,第一主成分的值为2.18。接下来的proportion var和cumulative var分别为主成分对整个数据集的方差解释度和累积解释度。 本题中,第一主成分解释了4个变量36%的方差,第二主成分解释了22%的方差,累计方差的解释度为58%。第三步,获取主成分的得分。 RC1 RC2Age -0.09 -0.62Gender 0.00 0.46Cig_Day 0.26 -0.17CO 0.44 0.04 Min_last -0.19 0.33LogCOadj 0.40 0.21根据上述的结果,即可写出第一和第二主成分的方程: Y1=-0.09Age+0.00Gender+0.26Cig_Day+0.44CO+-0.19Min_last+0.40LogCOadj Y2=-0.62Age+0.46Gender + -0.17Cig_Day + 0.04CO+ 0.33Min_last+0.21LogCOadj 从上述的两个方程中可知,第一主成分中,LogCOadj、CO的系数较高,Cig_Day、Min_last 的系数稍低,Age系数较小,Gender为0 ,因此第一主成分可归纳为先前抽烟数量。同理,第二主成分主要由Age、Gender、Min_last决定,可归纳为吸烟依赖性。总结得,吸烟复发者之间的差异主要表现为先前抽烟数量,其次是吸烟依赖性。为了检验模型的可靠性,对模型进行聚类分析。聚类分析,是树立统计的重要方法,它是研究多要素失误分类问题的数量方法。原理是,根据样本自身的属性,用数学方法按照某些相似性或差异性指标,定量的确定样本之间的亲疏关系,并按照这种亲疏关系程度对样本进行聚类。 对234个数据进行系统聚类分析,使得类间差异最大,而类内差异最小,看分出的类别能否对应两个主成份。首先根据234个数据或指标找出能度量这些数据或指标之间相似程度的统计量;然后以统计量作为划分类型的依据,把一些相似程度大的变量(或样品)首先聚合为一类,而把另一些相似程度较小的变量(或样品)聚合为另一类,直到所有的变量(或样品)都聚合完毕,最后根据各类之间的亲疏关系,逐步画成一张完整的分类系统图,又称谱系图。其相似程度由距离或者相似系数定义。得到下列图和数据: 图5.15 系统聚类图 1 1 1 1 1 1 1 1 1 1 1 2 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 37 1 1 1 2 1 1 1 1 1 1 2 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 2 1 1 1 1 1 1 1 1 2 73 1 1 1 1 1 1 1 2 1 1 1 2 1 2 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 2 1 1 1 1 1 1109 1 2 1 1 1 1 1 1 1 1 1 1 2 1 1 1 1 1 1 1 1 1 1 1 1 1 1 2 1 1 1 1 1 1 1 1145 1 1 1 2 1 2 1 1 1 1 1 1 2 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1181 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 2 1 1 1 1 1 1 1 2 1 1 2 2 1 2 1 2 1 1 2217 1 1 1 1 1 1 1 1 1 1 1 1 1 1 2 1 1 1 每行记录所属的聚类(1代表属于第一个聚类,2代表属于第二个聚类)利用r软件统计得到如下数据:第一聚类第二聚类聚类个数21123可见,第一聚类的聚类个数是211,第二聚类的聚类个数是23,对应模型中的第一主成分先前抽烟数量,一部分是第二主成分吸烟依赖性。再结合5.2模型建立及求解两种可验证了模型是可靠的。 因此可以得出影响戒烟成功的主要因素是先前抽烟数量,其次是个人的吸烟依赖性。 六、模型的应用综合模型的建立与求解分析,5.1问题一的模型建立和求解中可以发现累加发病率在不同年龄段、不同性别等均有不同,但普遍表现出的特点是累加发病率均居高;5.2问题二的模型建立和求解中发现年龄、性别、人体CO含量等因素均跟戒烟天数存在一定的关系,各因素对戒烟时间的影响程度由大到小为:CO浓度、调整的CO浓度、每天抽烟支数、年龄、性别;5.3问题三的模型建立和求解中归纳总结出了先前抽烟数量和吸烟依赖性是影响戒烟成功的重要因素。从模型中也可以看出,模型5.1、5.2、5.3均不能反应出所研究变量跟戒烟天数呈明显的线性关系,这说明其中还隐含着很多未研究的因素在影响着烟民的戒烟天数,例如个人决心,生活环境、职业工作等因素。戒烟天数少于15天的被调查者却超过一半,这一定程度表明了很多想戒烟但还没成功戒烟的烟民的戒烟决心不足,自制力差,毅力不够好,基于模型反馈出的问题,本文向有志于戒烟的人士提供以下几点戒烟对策和建议:1.年龄和性别对戒烟成功的影响不是很大,所以建议烟民不要有因为年龄或性别的关系而认为戒不了烟,只要有成功戒烟的信心,戒烟总会成功的。2.先前抽烟的数量和对烟的依赖性是影响戒烟成功的主要因素,因此建议烟民应该尽早下决心戒烟,从时间上控制抽烟的数量,使得戒烟更容易成功。3.建议有志于戒烟的人可以在开始戒烟前先减少每天吸烟量和增大吸烟间隔,慢慢地减少对烟的依赖性,这样的戒烟成功率将会比一开始什么都没做就直接戒烟的成功率高。4.在戒烟的过程中,之前烟瘾过大而且自制力较差的原烟民可能会因为烟瘾的折磨而放弃戒烟,这时,原烟民可以选择做别的事情例如嚼口香糖之类的来减小对烟的依赖性,提高戒烟过程中戒烟的成功率。 5.烟民想要戒烟成功最重要的是应该明确认识到吸烟有害健康的重要性,为自己着想,为他人着想,应该相信自己,只要有决心,有坚强的毅力,就一定能把烟瘾彻戒掉。 七、模型评价缺点:(1) 编程时数据量较大,存在很多困难。(2)数据与数据间很难将其联系起来。(3)5.2模型中,并没有很好地利用直线拟合和曲线拟合,对拟合的直线和曲线没有做出具体解析。优点:(1)对数据进行合理的处理,采用多重插补法对缺失数据填补,使得问题分析与图像更加合理化,明显化。(2)运用R语言来做模型的统计计算和作图。R语言是一门特别擅长于统计计算和作图的语言,具有统治性的地位,最主要的特点是免费、开源、各种各样的模块十分齐全。(3)在5.2模型中,对数据做等距分组处理,使数据分散程度减少,更好地显示两个变量之间的关系,还运用了多种方法进行定量分析,对模型进行了优化个改进。(4) 模型建立后,分别利用问题二的分析和系统聚类分析对模型进行了可靠性分析验证。(5)将每个小问题的分析串联起来,使其思路更加清晰(6)由问题二的分析得知,题目给出的变量并不是影响吸烟天数的主要因素,利用主成份分析来分析、简化数据集,从而找出潜在影响吸烟天数的主要因素 八、参考文献1姜启源,谢金鑫,叶俊.数学建模,北京:高等教育出版社,20042单锋,朱丽梅,田贺民,数学建模,北京:国防工业出版社,2012.23(美)吉奥丹诺(Giordano,F.R)叶其孝,姜启源,数学建模(原书第三版)北京:机械工业出版社,2005,14Robert I. Kabacoff 高涛, 肖楠 , 陈钢 .R语言实战,北京:人民邮电出版社,20135张润楚,多元统计分析,北京:科学出版社,2006.96高惠璇,应用多元统计分析,北京:北京大学出版社,2005.17王斌会,多元统计分析及R语言建模,广州:暨南大学出版社,2011.98 林元震,主成分分析之R篇,/blog-1114360-736595.html,2014年5月7日附录analyse_data - analyse_dataorder(analyse_data$Cig_Day),;i - 1;count - 1;while( count=20 )sum - 0;day_sum - 0;temp_count - 1;while( temp_count=10 )sum - sum + analyse_data$Cig_Dayi;day_sum - day_sum + analyse_data$Day_absi;temp

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论