数据分析方法及软件应用_第1页
数据分析方法及软件应用_第2页
数据分析方法及软件应用_第3页
数据分析方法及软件应用_第4页
数据分析方法及软件应用_第5页
已阅读5页,还剩9页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

数据分析方法及软件应用

(作业)

题目:4、8、13、16题

指导教师:

学院:交通运输学院

姓名:

学号:

4、在某化工生产中为了提高收率,选了三种不同浓度,四种不同温度做试脸。在同

一浓度与温度组合下各做两次试验,其收率数据如下面计算表所列。试在a=0.05显

著性水平下分析

(1)给出SPSS数据集的格式(列举前3个样本即可);

(2)分析浓度对收率有无显著影响;

(3)分析浓度、温度以及它们间的交互作用对收率有无显著影响。

解答:(1)分别定义分组变量浓度、温度、收率,在变量视图与数据视图中输入

表格数据,具体如下图。

名称类型宽度标签值缺失列n

1浓度数值80无无8

2温度数值80无无8

3收率数值80无无8

(2)思路:本问是研究一个控制变量即浓度的不同水平是否对观测变量收率产生

了显著影响,因而应用单因素方差分析。假设:浓度对收率无显著影响。

步骤:【分析-比较均值-单因素】,将收率选入到因变量列表中,将浓度选入到因

子框中,确定。

输出:

爱蹑分析

收率

平方和dfF均值平方F^著性

群组之39.083219.5&25.074.016

在群组内80.875213.851

黜十119.9582,

显著性水平Q为。.05,由于概率p值小于显著性水平Q,则应拒绝原假设,认为

浓度对收率有显著影响。

(3)思路:本问首先是研究两个控制变量浓度及温度的不同水平对观测变量收

率的独立影响,然后分析两个这控制变量的交互作用能否对收率产生显著影响,因而

应该采用多因素方差分析。假设,Hoi:浓度对收率无显著影响;Ho2:温度对收率无

显著影响;H03:浓度与温度的交互作用对收率无显著影响。

步骤:【分析-一般线性模型-单变量工把收率制定到因变量中,把浓度与温度制

定到固定因子框中,确定。

输出:

主旨冏效果检定

因燮数:收率

第(II^平方

来源和df平均值平方F^著性

修正的模型70.4581116.4051.553.230

截距2667.04212667.042646.556.000

浓度39.083219.5424.737.030

温度13.79234.5971.114.382

浓度*温度17.58362.931.710.648

的49.500124.125

獭十2787.00024

校正119.95823

a.R平方=.587(飘整的R平方=.209)

第一列是对观测变量总变差分解的说明;第二列是观测变量变差分解的结果;

第三列是自由度;第四列是均方;第五列是F检验统计量的观测值;第六列是检验统

计量的概率P值。可以看到观测变量收率的总变差为119.958,由浓度不同引起的变

差是39.083,由温度不同引起的变差为13.792,由浓度和温度的交互作用引起的变差

为17.583,由随机因素引起的变差为49.500。浓度,温度和浓度*温度的概率p值分别

为0.030,0.382和0.648o

浓度:显著性<0.05说明拒绝原假设(浓度对收率无显著影响),证明浓度对收率

有显著影响;温度:显著性>0.05说明不拒绝原假设(温度对收率无显著影响),证

明温度对收率无显著影响;浓度与温度:显著性>0.05说明不拒绝原假设(浓度与温

度的交互作用对收率无显著影响),证明温浓度与温度的交互作用对收率无显著影响。

8、以高校科研研究数据为例:以课题总数X5为被解释变量,解释变量为投入人年数

X2、投入科研事业费X4、专著数X6、获奖数X8;建立多元线性回归模型,分析它们之

间的关系。解释变量采用逐步筛选策略,并做多重共线性、方差齐性和残差的自相关

性检验。

解答:

思路:根据要求采用逐步筛选的解释变量筛选策略,利用回归分析方法建立多元

线性回归模型,分析它任之间的关系,并且要求做多重共线性、方差齐性和残差的自

相关性检验。

(1)步骤:【分析-回归-线性】,X5选入因变量,X2、X4、X6、X8选入自变量,

方法选择【逐步】。【统计量】勾选【估计】、【模型拟合度】、【共线性诊断】与

[Durbin-Waston(U)]o[绘制(T)按钮工将*ZRESID添加到Y(Y)框中,将*ZPRED添

加到X2(X)框中,勾选【正态概率图】,【保存(S)]按钮。在预测值与残差中勾选

【标准化】选项。选择菜单【分析一相关一双变量】将标准化预测值和标准化残差选

入【变量】框,在相关系数中选择Spearman,各项完成后点击【确定】。

输出:

燮数已输入/已移除‘

模型燮数已输入燮数已移除方法

1逐步(TOJ:

F-to-enter的

投入人年数•微率<=,050>

F-to-remove的

微率>=.100)

a.鹰燮歌课题总数

模型摘

模型RR▼方^整接R千方襟型偏斜度^Durbin-Watson

1.959'.919.917241.95821.747

a.^测值:(常数),投入人年数

b.鹰燮数:课题总数

表中变量为投入人年数,参考调整的判定系数,由于调整的判定系数(0.917)较

接近于1,因此认为拟合优度较高,被解释变量可以被模型解释的部分较多,未能被

解释的部分较少。方程DW检验值为1.747,残差存在一定的正自相关。

建昇敷分析'

模型平方和df平均值平方F掾i著性

150^19379040.047119379040.047331.018.oooh

残差1697769.9532958543.791

缴十21076810.00030

a.鹰燮数:课题总数

b.耻值:(常数),投入人年数

被解释变量的总离差平方和为21076810.00,回归平方和及均方分别为

19379040.047和19379040.047,剩余平方和及均方分别为1697769.953和58543.791,

产检验统计量的观测值为331.018,对应的概率p值近似为0。依据该表可进行回归方

程的显著性检验。如果显著性水平a为0.05,由于概率p值小于显著性水平a,应拒

绝回归方程显著性检验的零假设,认为回归系数不为0,被解释变量与解释变量的线

性关系是显著的,可建立线性模型。

保酸

非檄型化保数襟型化保教共绿性^■资半

模型BBetaT^著性允差VIF

1(常数)-94.52472.442-1.305.202

投入人年数.492.027.95918.194.0001.0001.000

a.鹰燮数上课题总数

依据该表可以进行回归系数显著性检验,写出回归方程和检测多重共线性。可以

看到,如果显著性水平窃为0.05,投入人年数变量的回归系数显著性t检验的概率p值

小于显著性水平d因此拒绝零假设,认为其偏回归系数与0有显著差异,与被解释变

量与解释变量的线性关系是显著的,应保留在方程中。同时从容忍度和方差膨胀因子

看,解释变量与投入人年数多重共线性很弱,可以建立模型。最终回归方程为,课题

总数二-94.524+0.492投入人年数。

排除的爨数”

共缥性统三十资料

模型Beta人T偏相R同允差VIF允差下限

1投入科研事业费(百元).152b1.528,138.278.2673.748.267

专著数.023b.182.857.034.1885.308.188

获奖数.030b.411.684.077.5421.846.542

a.鹰等数:课题M数

b.模型中的颈测值:(常数)•投入人年数

该表展示回归方程的剔除变量,可以看到,如果显著性水平]为0.05,表中三个

变量的回归系数显著性t检验的概率p值大于显著性水平出因此不拒绝零假设,认为

其偏回归系数与0无显著差异,与被解释变量与解释变量的线性关系是不显著的,不

应保留在方程中。同时从容忍度和方差膨胀因子看,解释变量与三个解释变量多重共

线性严重,在建立模型的时候应当被剔除。

共^性渐疗

燮累数比例

模型雉度特徵值修件指数(常数)投入人年数

111.8001.000.10.10

2.2003.001.90.90

a.鹰燮数:课题总数

依据该表可进行多重共线性检测,从方差比例上看第二个变量可解释常量的

90%,也可解释投入人年数的90%,一次认为这些变量存在多重共线性。条件指数都

小于10,说明存在共线性较弱,低个变量特征值小于0.7,说明线性相关关系较弱。

残差统资料’

最小值最大值平均数梯型偏差N

-57.6423246.986960.000803.721331

残差-466.2850509.6787.0000237.891431

-1.2662.845.0001.00031

襟举残差-1.9272.106.000,98331

a.鹰燮数:课题总数

汨蝇枳津化2分的金住P-PM

数据点围绕基准线还存在一定的规律性,但标准化残差的非参数检验结果表明标

准化残差与标准正态分右不存在显著差异,可以认为残差满足了线性模型的前提要

求。

热号攻:课JB总数

惊卑化珀;W值

随着标准化预测值的变化,残差点在0线周围随机分布,但残差的等方差性并不

完全满足,方差似乎有增大的趋势。但计算残差与预测值的Spearman等级相关系数

为-0.176,且检验并不显著,因此认为异方差现象并不明显。

相^

StandardizedStandardized

PredictedVa1ueResidual

Spearman的rhoStandardizedPredicted相防)保数1.000-.176

Value^著性(矍尾)•.344

N3131

StandardizedResidual相居月保数-.1761.000

^著性(曼尼).344•

N3131

依据该表可以对标准化残差和标准化预测值的Spearman等级进行分析,可以看

到,计算残差与预测值的相关性弱,认为异方差现象不明显。

13、利用1950年〜1990年的天津食品消费数据,分析这段时间内的人均生活费用年

收入的变化情况。要求:数据进行对数变换后,运用Holt线性趋势平滑模型分析。

(1)输出均方根误差和参数估计结果;

(2)输出ACF和PACF图形并对其特征进行分析,是否满足白噪声序列的条件;

(3)给出199L1992的预测值,并输出拟合图。

解答:

思路:根据题意,先不进行序列图和自相关、偏自相关的观察和检验阶段处理。

直接利用指数平滑模型中的Holt线性趋势模型对数据进行分析,同时输出均方根误差

和参数估计误差,ACF和PACF图像判断是否满足白噪音序列的条件;最后然后对数据

进行1991年、1992年做出预测,并用模型进行拟合。

步骤:【分析・预测•创建模型工将人均生活费总收入选入【因变量】中,将【方

法】选为【指数平滑法】;点击【条件】,在【因变量转换】中选【自然对数]在【模

型类型】中【Holt线性趋势】,【继续】。

【统计量工在【拟合度量】中选择【平稳的R方、均方根误差工在【个别模型

的统计量】中选中【参数估计】,在【比较模型的统计量】中选中【拟合优度工选中

【显示预测值】,【确定】

【图表】,在【单个模型图】中选择【序列、残差自相关函数、残差部分自相关

函数]在【每张图显示的内容】中现则【观察值、预测值、拟合值】。

【选项】,在【预测阶段】选择第二个,在【E期】的【年】框中填入【1992】。

输出:

模型道合度

遹合度统百分位数

京演料平均数SE最小值最大值5102550759095

平穰R平

.221.221.221.221.221.221.221.221.221.221

R平方.994.994.994.994.994.994.994.994.994.994

RMSE28.17928.17928.17928.17928.17928.17928.17928.17928.17928.179

MAPE3.5173.5173.5173.5173.5173.5173.5173.5173.5173.517

MaxAPE12.49512.49512.49512.49512.49512.49512.49512.49512.49512.495

MAE17.14617.14617.14617.14617.14617.14617.14617.14617.14617.146

MaxAE82.91182.91182.91182.91182.91182.91182.91182.91182.91182.911

襟型化

6.858•6.8586.8586.8586.8586.8586.8586.8586.8586.858

BIC

模型而弼

模型通合度^•资料Ljung-BoxQ(8)

平稳R平St群值数

模型目方RMSE统资料DF^著性目

人均生活费年收入-模

0.22128.17916.36016.4280

型」

均方根误差为28.179,误差较小。

指数平滑化模型'

模型估^SE’「^著性

人均生活费年收入-模型」自然差攫攵Alpha(水型)1.000.1576.381.000

Gamma(超要j),400.1782.244.031

模型的两个参数分别为:1.0和0.4,则具体模型为fi+m=l.0+0.4m,

残差ACF残差PACF

[=]

□□

□口

D1

□□

0

D

D

I匕

0

1

□□

0

-1

D

钙I0

-l'o-OSOJO0510-050001510

Residual

虽然残差自相关函数和偏自相关函数绝大多数处于置信区间内,但两函数都具有

明显减少趋势,且具有一定的季节性,因此不属于白噪音序列。

模型:9911992

人均生活费年收入-模型」fg测1708.821920.58

UCL1887.022274.43

LCL1543.631609.99

斜封每一(周模型,棺湖I是在所要求的估料期涉箍冏内的前次非覆

漏^始,加在其所有值测值的非超漏值可用的前次期IU1,或是在

所要求的测期^的留吉束日期多吉束,取较早的畤^。

一烹I整

200000-一西洌

1500.00-

8」

q

E

n

N100000-

500,00-

-a「「-▲A「1--A-21■-

.00111111

9,L99999*9999998999

5w55666677777886

26802468024660246患善篦

日期

1991、1992年的预测值与1990年的观测值有较大的增长趋势。从整个数据来看,

19so年至1980年这段时期较为平稳的增长,但是1980年之后迅速上升,最后预测值

上升较为明显,这与实际趋势基本一致。且1991、1992年预测值分别为1708.82、

1920.58o

16、结合自己的研究方向、参与项目等,举出一个说明SPSS在交通运输中应用的例子。

例子需包含问题说明、教据来源、统计方法、统计结果及其主要结论。

解答:

问题说明;利用1950年〜2013年美国么历年定期航班旅客周转量(单位:“台亿

客公里)历年数据数据,建立几种指数平滑模型,预测2016年美国定期航班旅客周转

量。

数据来源:《从统计看民航(2014)》中国民航出版社,2014年11月第一扳。

年份19501951195219531954195519561957195819$9

定期航班做客周转

164.4211.8250.3292.1331.6391.8444.5503506.958&3

依,‘亿客公里

年份19601961196219631961196s倒6196719681969

定期航班旅客周转

625.4540.9704.2810.4941.31105.21285.71605.81830.72017.3

证/亿客公里

年份197019711972197319741975197619771978即9

定期航班旅客周转

2131.32155.9145326062621262028823110364040S0

此,‘亿客公里

年份198019811982198319811985198619871988[瞰

定期肮班旅客周转

3930395041001160472052795800617067436918

量亿客公里

年份1990199119921993199419951996199719981999

定期航班旅客周耕

731471H3心1・4“39KWl.b92H.K州》79X4/1M4K.(

员/亿客公里

年份2000200120022003200420052006200720082009

定期航班族客周转

11109.5IM14.810218.410389.611813.7121-16.912753.813120.51279012570

H/亿客公里

年份2010201120122013

定期航班旅今周转

12998.7B105.413247.513525.2

员/亿客公里

解题思路:首先首先绘制和观察彩电出口量的序列图,通过图形观察和检验寻找

规律,然后通过指数平滑模型一简单、HOIT线性趋势、Brown线性趋势三个模型进行

分析预测,比较选择最佳模型预测2016年亿客公里数。

统计结果:

美国亿客公里时间序列图如下:

15COCOCOOO-

10COCOCOOO-

5C0C0C0C0-

亿

-5COCOCOOO-

-10COCOCOOO-

-15COCOCOOO-

JII-△△I4

SM200M0

8S880081

O0246®02

年6

幢盘:difference(16)

该序列图为平稳序列则可以直接进行建模分析。

(1)简单指数平滑模型

型^^明

模型^型

模型ID亿客公里模型」

模型财弼

模型逾合度统rt•资料Ljung-BoxQ(18)

模型值测建数数目平稳R平方RAISE统舒•资料DF雕群值数目

亿客公里-模型」0-.417367.91812.51117.0460

指数平滑化模型参数

模型估三十SET^著性

亿客公里•模型」自然封数Alpha(水型)1.030.1228.175.000

犍差ACF残短PACF

o

24n

23-—

22

21叶

19—

18”

16□挈

15□

14帘

1—

13什

11□

109□

8□

7□

6□

sO

4D

3O

a

2-1n

n

一现房值

一讽鳖

一用湖

1-,「「-A,--,「

1111

999999s-9L99999

666777888999

258147o369258

模型201420152016

亿客公里•模型」13638.2113752.1613867.06

UCL17502.4819474.7921137.62

LCL10451.729393.228654.28

至I•封每一值1馍型,^测是在所要求的估M•期^^凰内的前次非遗漏

始,加在其所有洌值的非迨漏值可用的前次期^•或是在所要求的^

测期^的结束日期结束'取较早的^^。

(2)HOIT线性趋势指数平滑模型

型^^明

模型^型

模型ID亿客公里模型」Holt

模型统料资料

模型通合度统:十资料Ljung-BoxQ(18)

模型覆;,即燮数数目平稳R平方RMSE统割■资料DF覆箸性雄群值数目

亿客公里-模型」0.610417.99015.33616.0500

指数平滑化模型参数

模型估^SET「著性

亿客公里-模型」自然封数Alpha(水型).694.1185.893.000

Gamma(超劈).117.0621.895.063

然并ACF耀邦PACF

一□

口1

。□

一0

O1

一□

o0

□1

□0

□□

一0

口□

口1

口1

口1

C口[

。□

”0

0

-05000510-10-050005

Residual

模型201420152016

亿客公里-模型」测13940.7814300.6314680.08

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论