高考数学总复习 第八章 计数原理、概率与统计 第52讲 变量的相关性、统计案例练习 理(含解析)新人教A版-新人教A版高三数学试题_第1页
高考数学总复习 第八章 计数原理、概率与统计 第52讲 变量的相关性、统计案例练习 理(含解析)新人教A版-新人教A版高三数学试题_第2页
高考数学总复习 第八章 计数原理、概率与统计 第52讲 变量的相关性、统计案例练习 理(含解析)新人教A版-新人教A版高三数学试题_第3页
高考数学总复习 第八章 计数原理、概率与统计 第52讲 变量的相关性、统计案例练习 理(含解析)新人教A版-新人教A版高三数学试题_第4页
高考数学总复习 第八章 计数原理、概率与统计 第52讲 变量的相关性、统计案例练习 理(含解析)新人教A版-新人教A版高三数学试题_第5页
已阅读5页,还剩17页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第52讲变量的相关性、统计案例夯实基础【p116】【学习目标】1.会收集现实问题中两个有关联变量的数据并作出散点图,会利用散点图直观认识变量间的相关关系;2.了解最小二乘法的思想,能根据给出的线性回归方程系数公式建立线性回归方程;3.了解独立性检验(只要求2×2列联表)的基本思想、方法及其简单应用;4.了解回归的基本思想、方法及简单应用.【基础检测】1.已知下表所示数据的回归直线方程为y=4x-4,则实数a的值为()x23456y3711a21A.16B.18C.20D.22【解析】由表中数据可知x=eq\f(2+3+4+5+6,5)=4,y=eq\f(3+7+11+a+21,5)=eq\f(a+42,5),回归直线方程过样本中心(x,y),所以eq\f(a+42,5)=12,解得a=18.【答案】B2.以下四个命题中是真命题的是()A.对随机变量K2的观测值k来说,k越小,判断“分类变量X与Y有关系”的把握程度越大B.两个随机变量的线性相关性越强,相关系数的绝对值越接近于0C.若数据x1,x2,x3,…,xn的方差为1,则2x1,2x2,2x3,…,2xn的方差为2D.在回归分析中,可用相关指数R2的值判断模型的拟合效果,R2越大,模型的拟合效果越好【解析】依据线性相关及相关指数的有关知识可以推断,选项D是正确的.【答案】D3.下面是2×2列联表:y1y2合计x1a2173x2222547合计b46120则表中a,b的值分别为()A.94,72B.52,50C.74,52D.52,74【解析】∵a+21=73,∴a=52.又a+22=b,∴b=74.【答案】D4.通过随机咨询110名性别不同的大学生是否爱好某项运动,得到如下的列联表:男女总计爱好402060不爱好203050总计6050110由K2=eq\f(n(ad-bc)2,(a+b)(c+d)(a+c)(b+d))算得,K2=eq\f(110(40×30-20×20)2,60×50×60×50)≈7.8.附表:P(K2≥k)0.0500.0100.001k3.8416.63510.828参照附表,得到的正确结论是()A.在犯错误的概率不超过0.1%的前提下,认为“爱好该项运动与性别有关”B.在犯错误的概率不超过0.1%的前提下,认为“爱好该项运动与性别无关”C.有99%以上的把握认为“爱好该项运动与性别有关”D.有99%以上的把握认为“爱好该项运动与性别无关”【解析】因为K2≈7.8≥6.635,而P(K2≥6.635)=0.010,故由独立性检验的意义可知,相关的概率大于1-0.010=0.99.【答案】C5.某运动制衣品牌为了成衣尺寸更精准,现选择15名志愿者,对其身高和臂展进行测量(单位:cm),图1为选取的15名志愿者身高与臂展的折线图,图2为身高与臂展所对应的散点图,并求得其回归方程为eq\o(y,\s\up6(^))=1.16x-30.75,以下结论中不正确的为()A.15名志愿者身高的极差小于臂展的极差B.15名志愿者身高和臂展成正相关关系C.可估计身高为190cm的人臂展大约为189.65cmD.身高相差10cm的两人臂展都相差11.6cm【解析】A.身高极差大约为18cm,臂展极差大约为23cm,故正确;B.很明显根据散点图象以及回归直线得到,身高矮臂展就会短一些,身高高一些,臂展就长一些,故正确;C.身高为190cm,代入回归方程可得到臂展估计值等于189.65cm,但是不是准确值,故正确;D.身高相差10cm的两人臂展的估计值相差11.6cm,但并不是准确值,回归方程上的点并不都是准确的样本点,故说法不正确.【答案】D【知识要点】1.相关关系的分类从散点图上看,点散布在从左下角到右上角的区域内,对于两个变量的这种相关关系,我们将它称之为__正相关__;点散布在从左上角到右下角的区域内,两个变量的这种相关关系称为__负相关__.2.线性相关从散点图上看,如果这些点从整体上看大致分布在一条直线附近,则称这两个变量之间具有线性相关关系,这条直线叫__回归直线__.3.回归方程(1)最小二乘法:使得样本数据的点到回归直线的__距离的平方和__最小的方法叫最小二乘法.(2)回归方程:两个具有线性相关关系的变量的一组数据:(x1,y1),(x2,y2),…,(xn,yn),其回归方程为eq\o(y,\s\up6(^))=eq\o(b,\s\up6(^))x+eq\o(a,\s\up6(^)),则eq\b\lc\{(\a\vs4\al\co1(\o(b,\s\up6(^))=\f(\o(∑,\s\up6(n),\s\do4(i=1))(xi-x)(yi-y),\o(∑,\s\up6(n),\s\do4(i=1))(xi-x)2)=\f(\o(∑,\s\up6(n),\s\do4(i=1))xiyi-nxy,\o(∑,\s\up6(n),\s\do4(i=1))xeq\o\al(2,i)-nx2),,\o(a,\s\up6(^))=y-\o(b,\s\up6(^))x.))其中eq\o(b,\s\up6(^))是回归方程的__斜率__,eq\o(a,\s\up6(^))是在y轴上的截距.4.样本相关系数r=eq\f(\o(∑,\s\up6(n),\s\do4(i=1))(xi-x)(yi-y),\r(\o(∑,\s\up6(n),\s\do4(i=1))(xi-x)2\o(∑,\s\up6(n),\s\do4(i=1))(yi-y)2)),用来衡量两个变量间的线性相关关系.(1)当r>0时,表示两个变量__正相关__;(2)当r<0时,表示两个变量__负相关__;(3)r的绝对值越接近1,表明两个变量的线性相关性__越大__;r的绝对值越接近于0,表示两个变量之间几乎不存在相关关系.通常当|r|>0.75时,认为两个变量有很强的线性相关关系.5.线性回归模型(1)y=bx+a+e中,a,b称为模型的未知参数,e称为随机误差.(2)相关指数用相关指数R2来刻画回归的效果,其计算公式是:R2=1-eq\f(\o(∑,\s\up6(n))^\o(,\s\do4(i=1))(yi-\o(y,\s\up6(^))i)2,\o(∑,\s\up6(n))^\o(,\s\do4(i=1))(yi-y-)2),R2的值越大,说明残差平方和越小,也就是说模型的拟合效果__越好__.在线性回归模型中,R2表示解释变量对预报变量变化的贡献率,R2越接近于1,表示回归效果越好.6.独立性检验(1)用变量的不同“值”表示个体所需的不同类别,这种变量称为分类变量.(2)列出的两个分类变量的频数表,称为列联表.(3)一般地,假设有两个分类变量X和Y,它们的值域分别为{x1,x2}和{y1,y2},其样本频数列联表(称2×2列联表)为:y1y2总计x1aba+bx2cdc+d总计a+cb+da+b+c+dK2=eq\f(n(ad-bc)2,(a+b)(a+c)(c+d)(b+d))(其中n=a+b+c+d为样本容量),可利用独立性检验判断表来判断“X与Y的关系”.这种利用随机变量K2来确定在多大程度上可以认为“两个分类变量有关系”的方法称为两个分类变量的独立性检验.典例剖析【p117】考点1相关关系的判断eq\a\vs4\al(例1)(1)对四组数据进行统计,获得如图所示的散点图,关于其相关系数的比较,正确的是()A.r2<r4<0<r3<r1B.r4<r2<0<r1<r3C.r4<r2<0<r3<r1D.r2<r4<0<r1<r3【解析】由相关系数的定义,以及散点图所表达的含义可知r2<r4<0<r3<r1.【答案】A(2)已知变量x和y满足关系y=-0.1x+1,变量y与z正相关.下列结论中正确的是()A.x与y正相关,x与z负相关B.x与y正相关,x与z正相关C.x与y负相关,x与z负相关D.x与y负相关,x与z正相关【解析】因为y=-0.1x+1的斜率小于0,故x与y负相关.因为y与z正相关,可设z=eq\o(b,\s\up6(^))y+eq\o(a,\s\up6(^)),eq\o(b,\s\up6(^))>0,则z=eq\o(b,\s\up6(^))y+eq\o(a,\s\up6(^))=-0.1eq\o(b,\s\up6(^))x+eq\o(b,\s\up6(^))+eq\o(a,\s\up6(^)),故x与z负相关.【答案】C【点评】相关关系的判断的2种方法(1)散点图法:如果所有的样本点都落在某一函数的曲线附近,变量之间就有相关关系.如果所有的样本点都落在某一直线附近,变量之间就有线性相关关系.若点散布在从左下角到右上角的区域,则正相关.(2)相关系数法:利用相关系数判定,当|r|越趋近于1相关性越强.考点2回归分析eq\a\vs4\al(例2)某测试团队为了研究“饮酒”对“驾车安全”的影响,随机选取100名驾驶员先后在无酒状态、酒后状态下进行“停车距离”测试,测试的方案:电脑模拟驾驶,以某速度匀速行驶,记录下驾驶员的“停车距离”(驾驶员从看到意外情况到车子停下所需要的距离),无酒状态与酒后状态下的试验数据分别列于表1和表2中表1停车距离d(米)(10,20](20,30](30,40](40,50](50,60]频数26ab82表2平均每毫升血液酒精含量x毫克1030507090平均停车距离y米3050607090已知表1数据的中位数估计值为26,回答以下问题.(1)求a,b的值,并估计驾驶员无酒状态下停车距离的平均数;(2)根据最小二乘法,由表2的数据计算y关于x的回归方程eq\o(y,\s\up6(^))=eq\o(b,\s\up6(^))x+eq\o(a,\s\up6(^));(3)该测试团队认为:驾驶员酒后驾车的平均“停车距离”y大于(1)中无酒状态下的停车距离平均数的3倍,则认定驾驶员是“醉驾”.请根据(2)中的回归方程,预测当每毫升血液酒精含量大于多少毫克时为“醉驾”?(附:回归方程eq\o(y,\s\up6(^))=eq\o(b,\s\up6(^))x+eq\o(a,\s\up6(^))中,eq\o(b,\s\up6(^))=eq\f(\o(∑,\s\up6(n),\s\do4(i=1))xiyi-nxy,\o(∑,\s\up6(n),\s\do4(i=1))xeq\o\al(2,i)-nx2),eq\o(a,\s\up6(^))=y-eq\o(b,\s\up6(^))x.)【解析】(1)依题意,得eq\f(6,10)a=50-26,解得a=40,又a+b+36=100,解得b=24;故停车距离的平均数为15×eq\f(26,100)+25×eq\f(40,100)+35×eq\f(24,100)+45×eq\f(8,100)+55×eq\f(2,100)=27.(2)依题意,可知x=50,y=60,eq\o(b,\s\up6(^))=eq\f(10×30+30×50+50×60+70×70+90×90-5×50×60,102+302+502+702+902-5×502)=eq\f(7,10),eq\o(a,\s\up6(^))=60-eq\f(7,10)×50=25,所以回归方程为eq\o(y,\s\up6(^))=0.7x+25.(3)由(1)知当y>81时认定驾驶员是“醉驾”,令eq\o(y,\s\up6(^))>81,得0.7x+25>81,解得x>80,当每毫升血液酒精含量大于80毫克时认定为“醉驾”.【点评】1.回归直线方程中系数的2种求法(1)利用公式,求出回归系数b,a.(2)待定系数法:利用回归直线过样本点中心求系数.2.回归分析的2种策略(1)利用回归方程进行预测:把回归直线方程看作一次函数,求函数值.(2)利用回归直线判断正、负相关:决定正相关还是负相关的是回归系数b.考点3独立性检验eq\a\vs4\al(例3)某中学对“学生性别和是否喜欢看NBA比赛”作了一次调查,其中男生人数是女生人数的2倍,男生喜欢看NBA的人数占男生人数的eq\f(5,6),女生喜欢看NBA的人数占女生人数的eq\f(1,3).(1)若被调查的男生人数为n,根据题意建立一个2×2列联表;(2)若有95%的把握认为是否喜欢看NBA和性别有关,问男生至少有多少人?附:K2=eq\f((a+b+c+d)(ad-bc)2,(a+b)(c+d)(a+c)(b+d))P(K2≥k)0.1000.0500.0250.0100.001k2.7063.8415.0246.63510.828【解析】(1)由已知,得喜欢NBA不喜欢NBA总计男生eq\f(5n,6)eq\f(n,6)n女生eq\f(n,6)eq\f(n,3)eq\f(n,2)总计neq\f(n,2)eq\f(3n,2)(2)K2=eq\f(\f(3n,2)\b\lc\(\rc\)(\a\vs4\al\co1(\f(5n,6)·\f(n,3)-\f(n,6)·\f(n,6)))\s\up12(2),n·\f(n,2)·\f(n,2)·n)=eq\f(3,8)n.若有95%的把握认为是否喜欢看NBA和性别有关.则K2>3.841,即eq\f(3,8)n>3.841,n>10.24.∵eq\f(n,2),eq\f(n,3),eq\f(n,6)为整数,∴n最小值为12,即男生至少12人.【点评】1.独立性检验的关键是准确的计算K2,在计算时,要充分利用2×2列联表.2.独立性检验的步骤:(1)根据样本数据制成2×2列联表.(2)根据公式K2=eq\f(n(ad-bc)2,(a+b)(a+c)(b+d)(c+d))计算K2的观测值k.(3)比较k与临界值的大小关系作统计推断.考点4概率与统计的综合问题eq\a\vs4\al(例4)为了比较注射A,B两种药物后产生的皮肤疱疹的面积,选200只家兔做试验,将这200只家兔随机地分成两组,各组100只,其中一组注射药物A,另一组注射药物B.(1)甲、乙是200只家兔的2只,求甲、乙分在不同组的概率;(2)下表1和表2分别是注射药物A和B后的试验结果.(疱疹面积单位:mm2)表1:注射药物A后皮肤疱疹面积的频数分布表疱疹面积[60,65)[65,70)[70,75)[75,80)频数30402010表2:注射药物B后皮肤疱疹面积的频数分布表疱疹面积[60,65)[65,70)[70,75)[75,80)[80,85)频数1025203015①完成下面频率分布直方图,并比较注射两种药物后疱疹面积的中位数的大小;注射药物A后皮肤疱疹面积的频率分布直方图注射药物B后皮肤疱疹面积的频率分布直方图②完成下面2×2列联表,并回答是否有99.9%的把握认为“注射药物A后的疱疹面积与注射药物B后的疱疹面积有差异”.表3:疱疹面积小于70mm2疱疹面积不小于70mm2合计注射药物Aa=b=注射药物Bc=d=合计n=附:K2=eq\f(n(ad-bc)2,(a+b)(c+d)(a+c)(b+d))P(K2≥k)0.1000.0500.0250.0100.001k2.7063.8415.0246.63510.828【解析】(1)甲、乙两只家兔分在不同组的概率为P=eq\f(Ceq\o\al(1,100)Ceq\o\al(1,100),Ceq\o\al(2,200))=eq\f(100,199).eq\b\lc\(\rc\)(\a\vs4\al\co1(或P=1-\f(2Ceq\o\al(98,198),Ceq\o\al(100,200))=\f(100,199)))(2)①如下图所示注射药物A后皮肤疱疹面积的频率分布直方图注射药物B后皮肤疱疹面积的频率分布直方图可以看出注射药物A后的疱疹面积的中位数在65至70之间,而注射药物B后疱疹面积的中位数在70至75之间,所以注射药物A后疱疹面积的中位数小于注射药物B后疱疹面积的中位数.②表3疱疹面积小于70mm2疱疹面积不小于70mm2合计注射药物Aa=70b=30100注射药物Bc=35d=65100合计10595n=200K2=eq\f(200×(70×65-35×30)2,100×100×105×95)≈24.56.由于K2>10.828,所以有99.9%的把握认为“注射药物A后的疱疹面积与注射药物B后的疱疹面积有差异”.【点评】本题主要考查概率,频率分布直方图,中位数,2×2列联表等知识,同时也考查了绘图能力及运算求解能力.方法总结【p119】1.现实世界中存在不能用函数模型描述的变量关系,这种与函数关系不同的变量间的相关关系,常常通过散点图加以直观认识,然后再寻求这两个变量之间的相关性.2.两个变量的线性相关:假设两个具有线性相关关系的变量的一组数据为:(x1,y1),(x2,y2),…,(xn,yn),所求的回归方程是eq\o(y,\s\up6(^))=eq\o(b,\s\up6(^))x+eq\o(a,\s\up6(^)),①其中eq\o(b,\s\up6(^))=eq\f(\o(∑,\s\up6(n),\s\do4(i=1))(xi-x)(yi-y),\o(∑,\s\up6(n),\s\do4(i=1))(xi-x-)2)=eq\f(\o(∑,\s\up6(n),\s\do4(i=1))xiyi-nxy,\o(∑,\s\up6(n),\s\do4(i=1))xeq\o\al(2,i)-nx2).②3.通过求Q=(y1-bx1-a)2+(y2-bx2-a)2+…+(yn-bxn-a)2的最小值而得到②,并进而得到回归直线①的方法叫做最小二乘法.走进高考【p119】1.(2018·全国卷Ⅱ)下图是某地区2000年至2016年环境基础设施投资额y(单位:亿元)的折线图.为了预测该地区2018年的环境基础设施投资额,建立了y与时间变量t的两个线性回归模型.根据2000年至2016年的数据(时间变量t的值依次为1,2,…,17)建立模型①:eq\o(y,\s\up6(^))=-30.4+13.5t;根据2010年至2016年的数据(时间变量t的值依次为1,2,…,7)建立模型②:eq\o(y,\s\up6(^))=99+17.5t.(1)分别利用这两个模型,求该地区2018年的环境基础设施投资额的预测值;(2)你认为用哪个模型得到的预测值更可靠?并说明理由.【解析】(1)利用模型①,该地区2018年的环境基础设施投资额的预测值为eq\o(y,\s\up6(^))=-30.4+13.5×19=226.1(亿元).利用模型②,该地区2018年的环境基础设施投资额的预测值为eq\o(y,\s\up6(^))=99+17.5×9=256.5(亿元).(2)利用模型②得到的预测值更可靠.理由如下:(ⅰ)从折线图可以看出,2000年至2016年的数据对应的点没有随机散布在直线y=-30.4+13.5t上下,这说明利用2000年至2016年的数据建立的线性模型①不能很好地描述环境基础设施投资额的变化趋势.2010年相对2009年的环境基础设施投资额有明显增加,2010年至2016年的数据对应的点位于一条直线的附近,这说明从2010年开始环境基础设施投资额的变化规律呈线性增长趋势,利用2010年至2016年的数据建立的线性模型eq\o(y,\s\up6(^))=99+17.5t可以较好地描述2010年以后的环境基础设施投资额的变化趋势,因此利用模型②得到的预测值更可靠.(ⅱ)从计算结果看,相对于2016年的环境基础设施投资额220亿元,由模型①得到的预测值226.1亿元的增幅明显偏低,而利用模型②得到的预测值的增幅比较合理,说明利用模型②得到的预测值更可靠.2.(2017·全国卷Ⅱ)海水养殖场进行某水产品的新、旧网箱养殖方法的产量对比,收获时各随机抽取了100个网箱,测量各箱水产品的产量(单位:kg),其频率分布直方图如下:(1)设两种养殖方法的箱产量相互独立,记A表示事件:“旧养殖法的箱产量低于50kg,新养殖法的箱产量不低于50kg”,估计A的概率;(2)填写下面列联表,并根据列联表判断是否有99%的把握认为箱产量与养殖方法有关:箱产量<50kg箱产量≥50kg旧养殖法新养殖法(3)根据箱产量的频率分布直方图,求新养殖法箱产量的中位数的估计值(精确到0.01)附:P(K2≥k)0.0500.0100.001k3.8416.63510.828【解析】(1)记B表示事件“旧养殖法的箱产量低于50kg”,C表示事件“新养殖法的箱产量不低于50kg”,由题意知P(A)=P(BC)=P(B)P(C),旧养殖法的箱产量低于50kg的频率为(0.012+0.014+0.024+0.034+0.040)×5=0.62,故P(B)的估计值为0.62,新养殖法的箱产量不低于50kg的频率为(0.068+0.046+0.010+0.008)×5=0.66,故P(C)的估计值为0.66,因此,事件A的概率估计值为0.62×0.66=0.4092.(2)根据箱产量的频率分布直方图得列联表箱产量<50kg箱产量≥50kg旧养殖法6238新养殖法3466K2=eq\f(200×(62×66-34×38)2,96×104×100×100)=15.705.由于15.705>6.635,故有99%的把握认为箱产量与养殖方法有关.(3)因为新养殖法的箱产量频率分布直方图中,箱产量低于50kg的直方图面积为(0.004+0.020+0.044)×5=0.34<0.5,箱产量低于55kg的直方图面积为(0.004+0.020+0.044+0.068)×5=0.68>0.5,故新养殖法箱产量的中位数的估计值为50+eq\f(0.5-0.34,0.068)≈52.35(kg).考点集训【p238】A组题1.四名同学根据各自的样本数据研究变量x,y之间的相关关系,并求得回归直线方程,分别得到以下四个结论:①y与x负相关且eq\o(y,\s\up6(^))=2.347x-6.423;②y与x负相关且eq\o(y,\s\up6(^))=-3.476x+5.648;③y与x正相关且eq\o(y,\s\up6(^))=5.437x+8.493;④y与x正相关且eq\o(y,\s\up6(^))=-4.326x-4.578.其中一定不正确的结论的序号是()A.①②B.②③C.③④D.①④【解析】正相关指的是y随x的增大而增大,负相关指的是y随x的增大而减小,故不正确的为①④.【答案】D2.已知某产品连续4个月的广告费用为xi(i=1,2,3,4)千元,销售额为yi(i=1,2,3,4)万元,经过对这些数据的处理,得到如下数据信息:①x1+x2+x3+x4=18,y1+y2+y3+y4=14;②广告费用x和销售额y之间具有较强的线性相关关系;③回归直线方程eq\o(y,\s\up6(^))=bx+a中的b=0.8(用最小二乘法求得),那么,当广告费用为6千元时,可预测销售额约为()A.3.5万元B.4.7万元C.4.9万元D.6.5万元【解析】依题意得x=4.5,y=3.5,由回归直线必过样本中心点得a=3.5-0.8×4.5=-0.1.当x=6时,eq\o(y,\s\up6(^))=0.8×6-0.1=4.7.【答案】B3.某医疗机构通过抽样调查(样本容量n=1000),利用2×2列联表和K2统计量研究患肺病是否与吸烟有关.计算得K2=4.453,经查对临界值表知P(K2≥3.841)≈0.05,现给出四个结论,其中正确的是()A.在100个吸烟的人中约有95个人患肺病B.若某人吸烟,那么他有95%的可能性患肺病C.有95%的把握认为“患肺病与吸烟有关”D.只有5%的把握认为“患肺病与吸烟有关”【解析】由已知数据可得有1-0.05=95%的把握认为“患肺病与吸烟有关”.【答案】C4.某社区为了了解本社区居民的受教育程度与年收入的关系,随机调查了100位居民,得到如下表所示的2×2列联表(单位:位):分类年收入5万元以下年收入5万元及以上总计高中文化以上104555高中文化及以下153045总计2575100若推断“受教育程度与年收入有关系”,则这种推断犯错误的概率不超过()A.2.5%B.1%C.5%D.10%【解析】由表中的数据可得K2=eq\f(100×(10×30-15×45)2,55×45×25×75)≈3.030,由于3.030>2.706,所以推断“受教育程度与年收入有关系”,犯错误的概率不超过10%.【答案】D5.如图所示,有5组数据:A(1,3),B(2,4),C(3,8),D(7,10),E(10,12),去掉________组数据后剩下的4组数据的线性相关系数最大.【解析】仔细观察点A(1,3),B(2,4),C(3,8),D(7,10),E(10,12),可知点A,B,D,E在一条直线附近,而C点明显偏离此直线上,由此可知去掉点C后,使剩下的四点组成的数组相关关系数最大.【答案】C6.物价部门对本市的5家商场的某商品一天的销售量和价格进行调查,得到5家商场的售价x(元)和销售量y(件)之间的一组数据如下表所示:价格x99.5m10.511销售量y11n865由散点图可知,销售量y与价格x之间有较强的线性相关关系,其线性回归方程是eq\o(y,\s\up6(^))=-3.2x+40,且m+n=20,则n=________.【解析】x=eq\f(1,5)×(9+9.5+m+10.5+11)=eq\f(1,5)×(40+m),y=eq\f(1,5)×(11+n+8+6+5)=eq\f(1,5)×(30+n).因为其线性回归方程是eq\o(y,\s\up6(^))=-3.2x+40,所以有eq\f(1,5)×(30+n)=-3.2×eq\f(1,5)×(40+m)+40,即30+n=-3.2×(40+m)+200.又m+n=20,所以m=n=10.【答案】107.炼钢是一个氧化降碳的过程,由于钢水含碳量的多少直接影响冶炼时间的长短,因此必须掌握钢水含碳量和冶炼时间的关系.现已测得炉料熔化完毕时钢水的含碳量x与冶炼时间y(从炉料熔化完毕到出钢的时间)的一组数据,如下表所示:i12345678910xi/0.01%104180190177147134150191204121yi/min100200210185155135170205235125xiyi10400360003990032745227851809025500391554794015125(1)据统计表明,y与x之间具有线性相关关系,请用相关系数r加以说明(|r|≥0.75,则认为y与x有较强的线性相关关系,否则认为没有较强的线性相关关系,r精确到0.001);(2)建立y关于x的回归方程(回归系数的结果精确到0.01);(3)根据(2)中的结论,预测钢水含碳量为160个0.01%的冶炼时间.参考公式:回归方程eq\o(y,\s\up6(^))=eq\o(b,\s\up6(^))x+eq\o(a,\s\up6(^))中斜率和截距的最小二乘估计分别为eq\o(b,\s\up6(^))=eq\f(\o(∑,\s\up6(n),\s\do4(i=1))xiyi-nxy,\o(∑,\s\up6(n),\s\do4(i=1))xeq\o\al(2,i)-nx2),eq\o(a,\s\up6(^))=y-eq\o(b,\s\up6(^))x,相关系数r=eq\f(\o(∑,\s\up6(n),\s\do4(i=1))xiyi-nxy,\r(\b\lc\(\rc\)(\a\vs4\al\co1(\o(∑,\s\up6(n),\s\do4(i=1))xeq\o\al(2,i)-nx2))\b\lc\(\rc\)(\a\vs4\al\co1(\o(∑,\s\up6(n),\s\do4(i=1))yeq\o\al(2,i)-ny2)))).参考数据:x=159.8,y=172,eq\o(∑,\s\up6(10),\s\do4(i=1))xeq\o\al(2,i)=265448,eq\o(∑,\s\up6(10),\s\do4(i=1))yeq\o\al(2,i)=312350,eq\o(∑,\s\up6(10),\s\do4(i=1))xiyi=287640,eq\r(\b\lc\(\rc\)(\a\vs4\al\co1(\o(∑,\s\up6(10),\s\do4(i=1))xeq\o\al(2,i)-10x2))\b\lc\(\rc\)(\a\vs4\al\co1(\o(∑,\s\up6(10),\s\do4(i=1))yeq\o\al(2,i)-10y2)))=12905.【解析】(1)由题得r=eq\f(287640-10×159.8×172,12905)≈0.991,∵r>0.75,∴可以认为y与x有较强的线性相关关系.(2)eq\o(b,\s\up6(^))=eq\f(\o(∑,\s\up6(10),\s\do4(i=1))xiyi-10xy,\o(∑,\s\up6(10),\s\do4(i=1))xeq\o\al(2,i)-10x2)≈1.27,∴eq\o(a,\s\up6(^))=y-eq\o(b,\s\up6(^))x≈-30.95,所以回归方程为eq\o(y,\s\up6(^))=1.27x-30.95.(3)当x=160时,eq\o(y,\s\up6(^))=1.27×160-30.95≈172(min),即大约需要冶炼172min.8.某高校共有学生15000人,其中男生10500人,女生4500人.为调查该校学生每周平均体育运动时间的情况,采用分层抽样的方法,收集300位学生每周平均体育运动时间的样本数据(单位:小时).(1)应收集多少位女生的样本数据?(2)根据这300个样本数据,得到学生每周平均体育运动时间的频率分布直方图(如图所示),其中样本数据的分组区间为:[0,2],(2,4],(4,6],(6,8],(8,10],(10,12].估计该校学生每周平均体育运动时间超过4小时的概率;(3)在样本数据中,有60位女生的每周平均体育运动时间超过4小时,请完成每周平均体育运动时间与性别列联表,并判断是否有95%的把握认为“该校学生的每周平均体育运动时间与性别有关”.P(K2≥k0)0.100.050.0100.005k02.7063.8416.6357.879附:K2=eq\f(n(ad-bc)2,(a+b)(c+d)(a+c)(b+d)).【解析】(1)300×eq\f(4500,15000)=90,所以应收集90位女生的样本数据.(2)由频率分布直方图得每周平均体育运动超过4小时的频率为1-2×(0.100+0.025)=0.75,所以该校学生每周平均体育运动时间超过4小时的概率的估计值为0.75.(3)由(2)知300位学生中有300×0.75=225(位)的每周平均体育运动时间超过4小时,75人的每周平均体育运动时间不超过4小时.又因为样本数据中有210个是关于男生的,90个是关于女生的,所以每周平均体育运动时间与性别列联表如下:男生女生总计每周平均体育运动时间不超过4小时453075每周平均体育运动时间超过4小时16560225总计21090300结合列联表可算得K2=eq\f(300×(165×30-45×60)2,75×225×210×90)=eq\f(100,21)≈4.762>3.841.所以有95%的把握认为“该校学生的每周平均体育运动时间与性别有关”.B组题1.某工厂为了对新研发的一种产品进行合理定价,将该产品按事先拟定的价格进行试销,得到如下数据:单价x(元)456789销量y(件)908483807568由表中数据,求得线性回归方程为eq\o(y,\s\up6(^))=-4x+a.若在这些样本点中任取一点,则它在回归直线左下方的概率为()A.eq\f(1,6)B.eq\f(1,3)C.eq\f(1,2)D.eq\f(2,3)【解析】依题意得x=eq\f(1,6)×(4+5+6+7+8+9)=eq\f(13,2),y=eq\f(1,6)×(90+84+83+80+75+68)=80,又回归直线必经过样本中心点(x,y),于是有a=80+4×eq\f(13,2)=106.不等式4x+y-106<0表示的是回归直线的左下方区域.注意到在6个样本数据中,共有2个样本数据位于回归直线的左下方区域,因此所求的概率等于eq\f(1,3).【答案】B2.某医疗研究所为了检验某种血清预防感冒的作用,把500名使用血清的人与另外500名未使用血清的人一年中的感冒记录作比较,提出假设H0:“这种血清不能起到预防感冒的作用”,利用2×2列联表计算得K2≈3.918,经查临界值表知P(K2≥3.841)≈0.05.则下列结论中,正确结论的序号是________.①有95%的把握认为“这种血清能起到预防感冒的作用”;②若某人未使用该血清,那么他在一年中有95%的可能性得感冒;③这种血清预防感冒的有效率为95%;④这种血清预防感冒的有效率为5%.【解析】K2≈3.918≥3.841,而P(K2≥3.814)≈0.05,所以有95%的把握认为“这种血清能起到预防感冒的作用”.要注意我们检验的是假设是否成立,和该血清预防感冒的有效率是没有关系的,不是同一个问题,不要混淆.【答案】①3.某村2011年至2017年人均纯收入(单位:千元)的数据如下表:年份2011201220132014201520162017年份代号t1234567人均纯收入2.93.33.64.44.85.25.9(1)求y关于t的线性回归方程;(2)利用(1)中的回归方程,分析2011年至2017年该村人均纯收入的变化情况,并预测该村2020年人均纯收入.附:回归直线的斜率和截距的最小二乘法估计公式分别为:eq\o(b,\s\up6(^))=eq\f(\i\su(i=1(ti-t)(yi-y),∑n,i=1,7,)(ti-t)2),eq\o(a,\s\up6(^))=y-eq\o(b,\s\up6(^))t.【解析】(1)由所给数据计算得t=eq\f(1,7)(1+2+3+4+5+6+7)=4,y=eq\f(1,7)(2.9+3.3+3.6+4.4+4.8+5.2+5.9)=4.3,eq\i\su(i=1(ti-t)2=9+4+1+0+1+4+9=28,,∑7,i=1,7,)(ti-t)(yi-y)=(-3)×(-1.4)+(-2)×(-1)+(-1)×(-0.7)+0×0.1+1×0.5+2×0.9+3×1.6=14,eq\f(\i\su(i=1(ti-t)(yi-y),∑7,i=1,7,)(ti-t)2)=eq\f(14,28)=0.5,eq\o(a,\s\up6(^))=y-eq\o(b,\s\up6(^))t=4.3-0.5×4=2.3,所

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论