2025年统计学专业期末考试:统计与决策应用题库_第1页
2025年统计学专业期末考试:统计与决策应用题库_第2页
2025年统计学专业期末考试:统计与决策应用题库_第3页
2025年统计学专业期末考试:统计与决策应用题库_第4页
2025年统计学专业期末考试:统计与决策应用题库_第5页
已阅读5页,还剩3页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2025年统计学专业期末考试:统计与决策应用题库考试时间:______分钟总分:______分姓名:______一、假设某快餐连锁店想要评估其新推出的两种饮料(A和B)的偏好度。随机抽取了100名顾客,询问他们更偏好哪种饮料。结果如下:选择A饮料的顾客有55人,选择B饮料的顾客有45人。请计算:1.样本中选择A饮料顾客的proportions和选择B饮料顾客的proportions。2.如果要估计总体中偏好A饮料顾客比例的95%置信区间,请计算该区间的上下限。(假设样本比例近似服从正态分布)3.基于样本结果,是否有足够的证据(α=0.05)认为偏好A饮料的顾客比例显著高于偏好B饮料的顾客比例?请说明你的检验过程,包括原假设、备择假设、计算检验统计量及其值、确定p值范围或直接给出p值,并做出统计决策。二、某公司人力资源部想要研究员工的工作满意度(用评分1到10表示,分数越高表示满意度越高)与员工年龄(单位:年)之间的关系。随机抽取了15名员工,得到以下数据(仅列出部分数据,非完整数据集):员工编号:1,2,3,4,5,6,7,8,9,10,11,12,13,14,15年龄(年):22,25,28,31,34,37,40,43,46,49,52,55,58,61,64满意度评分:6,7,7,8,7,8,9,8,9,8,7,6,5,6,41.请计算该样本的员工平均年龄和平均满意度评分。2.计算年龄与满意度评分之间的样本相关系数,并解释其含义。3.建立满意度评分对年龄的简单线性回归模型。请写出模型方程,并解释回归系数(斜率和截距)的实际意义。4.当某员工年龄为45岁时,请利用建立的回归模型预测其满意度评分,并给出预测结果的95%置信区间。三、一家制造厂生产某种零件,关心零件长度是否符合标准(标准长度为10厘米)。质检部门抽取了25个零件,测得样本平均长度为9.95厘米,样本标准差为0.15厘米。1.假设检验的显著性水平α=0.01,请检验该厂生产的零件长度是否显著偏离标准长度10厘米?请完成假设检验的全过程,包括提出假设、计算检验统计量及其值、确定p值或临界值、做出统计决策。2.如果要求零件长度的允许偏差范围是±0.2厘米(即长度在9.8厘米到10.2厘米之间为合格),请计算样本均值9.95厘米对应的样本比例(即样本中长度在合格范围内的零件所占比例)。3.基于样本比例,如果要估计该厂生产的零件长度合格率的95%置信区间,请计算该区间的上下限。四、某零售商想要比较其两个不同店铺(店铺1和店铺2)在过去一个月的销售额表现。随机抽取了两个店铺的10天销售额数据如下(单位:万元):店铺1销售额:18,20,22,19,21,23,24,20,22,21店铺2销售额:15,17,16,18,14,19,20,15,17,161.请分别计算两个店铺销售额的样本均值和样本方差。2.请使用假设检验(α=0.05)来判断两个店铺的平均销售额是否存在显著差异?请完成假设检验的全过程。3.在进行上述检验时,做了哪些关于数据分布的假设?如果实际数据不符合这些假设,可以考虑使用什么非参数检验方法来替代?请简要说明该非参数检验方法的基本思想。五、一家保险公司想要评估某项新保险产品的潜在需求。他们进行了市场调查,收集了潜在客户年龄和他们对该产品支付意愿(支付意愿分为“高”、“中”、“低”三个等级)的数据。部分数据整理如下(非完整数据集):年龄(岁):25,30,35,40,45,50,55,60,65,70支付意愿:高,中,低,高,中,低,高,中,低,中1.请计算该样本中各个支付意愿等级(高、中、低)的频数和proportions。2.计算样本中年龄与支付意愿之间的列联表(即交叉表)。3.基于样本数据,请使用卡方检验(α=0.05)来判断年龄与支付意愿之间是否存在关联性?请完成假设检验的全过程。六、某投资者考察了两种股票(股票X和股票Y)在过去5年的年度收益率数据(单位:%)如下:年份:1,2,3,4,5股票X收益率:10,15,-5,20,5股票Y收益率:8,12,-8,18,41.请分别计算股票X和股票Y的样本均值、样本标准差和样本变异系数。2.请比较两种股票收益率数据的离散程度,并说明你的判断依据。3.请计算股票X和股票Y收益率之间的样本协方差和样本相关系数,并解释相关系数的含义。4.假设投资者计划将资金按比例分配投资于这两种股票,且希望投资组合的预期年收益率达到12%。请根据两种股票的样本历史收益率,计算为实现这一目标,投资于股票X和股票Y的资金比例应分别为多少?(假设两种股票的投资比例之和为1)试卷答案一、1.选择A饮料顾客的proportions=55/100=0.55;选择B饮料顾客的proportions=45/100=0.45。2.样本比例p̂=0.55,样本量n=100,标准误SE=sqrt[p̂(1-p̂)/n]=sqrt[0.55(1-0.55)/100]=sqrt[0.2475/100]=sqrt[0.002475]≈0.04975。95%置信区间的临界值z(0.025)≈1.96。置信区间下限=p̂-z(0.025)*SE=0.55-1.96*0.04975≈0.55-0.09745≈0.45255。置信区间上限=p̂+z(0.025)*SE=0.55+1.96*0.04975≈0.55+0.09745≈0.64745。所以95%置信区间约为(0.453,0.647)。3.原假设H₀:p_A≤p_B(或p_A-p_B≤0),即偏好A饮料的比例不高于偏好B饮料的比例。备择假设H₁:p_A>p_B(或p_A-p_B>0),即偏好A饮料的比例高于偏好B饮料的比例。这是一个单尾检验。可以使用z检验或正态近似卡方检验。此处使用z检验。检验统计量z=(p̂_A-p̂_B)/sqrt[(p̂(1-p̂))(1/n_A+1/n_B)]。这里假设n_A=n_B=n/2=50。p̂_A=0.55,p̂_B=0.45。p̂_pooled=(n_A*p̂_A+n_B*p̂_B)/(n_A+n_B)=(50*0.55+50*0.45)/100=0.5。标准误=sqrt[0.5(1-0.5)*(1/50+1/50)]=sqrt[0.25*(2/50)]=sqrt[0.25*0.04]=sqrt[0.01]=0.1。检验统计量z=(0.55-0.45)/0.1=1.0/0.1=10.0。p值是观察到检验统计量z≥10.0的概率。在标准正态分布中,p值极其接近0(p<0.0001)。由于p值远小于显著性水平α=0.05,因此拒绝原假设H₀。统计决策:有足够的证据认为偏好A饮料的顾客比例显著高于偏好B饮料的顾客比例。二、1.样本平均年龄=(22+25+28+31+34+37+40+43+46+49+52+55+58+61+64)/15=665/15≈44.33年。样本平均满意度评分=(6+7+7+8+7+8+9+8+9+8+7+6+5+6+4)/15=108/15≈7.2分。2.计算相关系数r需要各变量的离差平方和及离差乘积和。计算过程略(此处假设已计算完成)。假设计算结果为r≈-0.65。相关系数r的值在-1到1之间。r=-0.65表明年龄与满意度评分之间存在较强的负相关关系,即年龄越大,满意度评分倾向于越低。3.建立简单线性回归模型y=a+bx,其中y是满意度评分,x是年龄。假设计算得到的回归方程为ŷ=10.5-0.08x。模型方程为满意度评分=10.5-0.08*年龄。回归系数b(斜率)=-0.08的实际意义是:在其他因素不变的情况下,员工年龄每增加1年,其满意度评分预计平均下降0.08分。截距a(10.5)表示当员工年龄为0岁时,预测的满意度评分为10.5分。虽然年龄为0不现实,但在统计上,截距有时也解释为数据集中点的截距或趋势线的起始点。4.当x=45时,预测的满意度评分ŷ=10.5-0.08*45=10.5-3.6=6.9分。预测区间的计算需要标准误SE_pred。假设计算得到的95%预测区间上下限分别为(6.35,7.45)。三、1.原假设H₀:μ=10,即零件平均长度等于标准长度。备择假设H₁:μ≠10,即零件平均长度偏离标准长度。使用t检验,因为总体标准差未知且样本量n=25较小(假设总体近似正态分布)。检验统计量t=(样本均值-总体均值)/(样本标准差/sqrt样本量)=(9.95-10)/(0.15/sqrt25)=-0.05/(0.15/5)=-0.05/0.03=-1.67。自由度df=n-1=25-1=24。查t分布表或使用计算器,t(0.025,24)≈2.064(双尾检验临界值)。因为-1.67的绝对值<2.064,即|t|<t_crit。或者,p值>2*P(T>|t|)=2*P(T>1.67)。查表或计算,P(T>1.67)≈0.05。所以p值≈2*0.05=0.10。p值=0.10>显著性水平α=0.05。统计决策:不拒绝原假设H₀。没有足够的证据表明该厂生产的零件长度显著偏离标准长度10厘米。2.合格范围下限=9.8,合格范围上限=10.2。样本中长度在合格范围内的零件数量=25个(假设所有样本点都在合格范围内,因为未给出具体数据)。样本比例p̂_合格=25/25=1.0。3.样本比例p̂_合格=1.0,样本量n=25。计算95%置信区间需要标准误SE_p̂=sqrt[p̂(1-p̂)/n]=sqrt[1.0(1-1.0)/25]=sqrt[0/25]=0.0。计算出的标准误为0,这通常意味着样本比例是100%或0,或者样本量不足以计算具有意义的标准误。在这种情况下,无法构建一个有意义的标准误不为零的置信区间。如果题目意图是计算合格率的标准上限,则可以认为在α=0.05水平下,标准误为0意味着置信区间的上限等于样本比例,下限等于样本比例减去标准误(此时为负数,通常取0)。因此,可以报告一个极宽的置信区间,例如(0,1.0),但这失去了置信区间的常规意义。更合理的处理是指出样本比例是100%,因此我们100%相信合格率不低于100%,但这不是一个统计推断区间。四、1.店铺1:样本均值=(18+20+22+19+21+23+24+20+22+21)/10=210/10=21万元。样本方差s₁²=[(18-21)²+(20-21)²+...+(21-21)²]/(10-1)=[9+1+1+4+0+4+9+1+1+0]/9=30/9≈3.33万元²。样本标准差s₁=sqrt(3.33)≈1.82万元。店铺2:样本均值=(15+17+16+18+14+19+20+15+17+16)/10=170/10=17万元。样本方差s₂²=[(15-17)²+(17-17)²+...+(16-17)²]/(10-1)=[4+0+1+1+9+4+9+4+1+1]/9=34/9≈3.78万元²。样本标准差s₂=sqrt(3.78)≈1.94万元。2.原假设H₀:μ₁=μ₂,即两个店铺的平均销售额无显著差异。备择假设H₁:μ₁≠μ₂,即两个店铺的平均销售额存在显著差异。使用独立样本t检验(假设方差相等或使用Welch修正,此处假设方差相等)。合并方差s_p²=[(n₁-1)s₁²+(n₂-1)s₂²]/(n₁+n₂-2)=[(10-1)3.33+(10-1)3.78]/(10+10-2)=[9*3.33+9*3.78]/18=[29.97+34.02]/18=63.99/18≈3.555万元²。合并标准差s_p=sqrt(3.555)≈1.88万元。检验统计量t=(样本均值₁-样本均值₂)/(s_p*sqrt(1/n₁+1/n₂))=(21-17)/(1.88*sqrt(1/10+1/10))=4/(1.88*sqrt(0.2))=4/(1.88*0.4472)≈4/0.841=4.75。自由度df=n₁+n₂-2=10+10-2=18。查t分布表或使用计算器,t(0.025,18)≈2.101。因为4.75>2.101,即t>t_crit。或者,p值<2*P(T>4.75)。查表或计算,对于df=18,P(T>4.75)非常小(远小于0.001)。所以p值<0.002。p值<显著性水平α=0.05。统计决策:拒绝原假设H₀。有足够的证据认为两个店铺的平均销售额存在显著差异。3.假设检验(如t检验)通常要求数据服从正态分布,且两组方差相等(对于独立样本t检验)。如果实际数据不符合正态分布假设,或者两组方差差异较大,则t检验的结论可能不可靠。这时可以考虑使用非参数检验方法。常用的非参数检验方法是Wilcoxon秩和检验(Mann-WhitneyU检验)。其基本思想是:不依赖于数据的分布类型,先将两组数据混合排序,然后分别计算两组数据的秩和,通过比较秩和来推断两组分布位置是否存在差异。如果两个店铺的销售额数据是非正态的,可以使用Wilcoxon秩和检验来替代独立样本t检验。五、1.样本量(假设为n):支付意愿“高”的频数f_高=4,proportions=4/n。支付意愿“中”的频数f_中=5,proportions=5/n。支付意愿“低”的频数f_低=1,proportions=1/n。总计n=4+5+1=10。proportions(近似):高≈0.4,中≈0.5,低≈0.1。2.列联表(交叉表):支付意愿年龄|高|中|低|合计------|---|---|---|-----<45|2|3|1|6≥45|2|2|0|4合计|4|5|1|103.原假设H₀:年龄与支付意愿之间无关联性(独立)。备择假设H₁:年龄与支付意愿之间存在关联性(不独立)。使用卡方检验。计算期望频数E_ij=(行合计*列合计)/总样本量。E_11=(6*4)/10=2.4E_12=(6*5)/10=3.0E_13=(6*1)/10=0.6E_21=(4*4)/10=1.6E_22=(4*5)/10=2.0E_23=(4*1)/10=0.4卡方统计量χ²=Σ[(O_ij-E_ij)²/E_ij]χ²=[(2-2.4)²/2.4+(3-3.0)²/3.0+(1-0.6)²/0.6+(2-1.6)²/1.6+(2-2.0)²/2.0+(0-0.4)²/0.4]χ²=[(-0.4)²/2.4+(0)²/3.0+(0.4)²/0.6+(0.4)²/1.6+(-0.2)²/2.0+(-0.4)²/0.4]χ²=[0.16/2.4+0/3.0+0.16/0.6+0.16/1.6+0.04/2.0+0.16/0.4]χ²=[0.0667+0+0.2667+0.1+0.02+0.4]χ²≈0.8534。卡方检验的临界值取决于自由度df=(行数-1)*(列数-1)=(2-1)*(3-1)=1*2=2。查χ²分布表,χ²(0.025,2)≈7.378。因为0.8534<7.378,即χ²<χ²_crit。或者,p值=P(χ²>0.8534)。对于df=2,p值远大于0.05(通常大于0.10)。p值>显著性水平α=0.05。统计决策:不拒绝原假设H₀。没有足够的证据表明年龄与支付意愿之间存在关联性。六、1.股票X:样本均值=6.4,样本标准差=sqrt[sum(x_i-x̂)²/(n-1)]=sqrt[(10+15-6.4)²+(...)+(-5-6.4)²]/4=sqrt[297.6/4]=sqrt[74.4]≈8.63。样本变异系数CV_X=标准差/均值=8.63/6.4≈1.35。股票Y:样本均值=7.6,样本标准差=sqrt[sum(y_i-ŷ)²/(n-1)]=sqrt[(8+12-7.6)²+(...)+(-8-7.6)²]/4=sqrt[231.04/4]=sqrt[57.76]≈7.60。样本变异系数CV_Y=标准差/均值=7.60/7.6=1.0。2.

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论