2027年高考数学一轮复习(创新设计)第3节 成对数据的统计分析_第1页
2027年高考数学一轮复习(创新设计)第3节 成对数据的统计分析_第2页
2027年高考数学一轮复习(创新设计)第3节 成对数据的统计分析_第3页
2027年高考数学一轮复习(创新设计)第3节 成对数据的统计分析_第4页
2027年高考数学一轮复习(创新设计)第3节 成对数据的统计分析_第5页
已阅读5页,还剩15页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第3节成对数据的统计分析课标要求1.了解样本相关系数的统计含义.2.了解一元线性回归模型和2×2列联表,会运用这些方法解决简单的实际问题.1.变量的相关关系(1)相关关系:若两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系;(2)相关关系的分类:正相交和负相关;(3)线性相关:如果两个变量的取值呈现正相关或负相关,而且散点落在一条直线附近,就称这两个变量线性相关.2.样本相关系数对于变量x和变量y,设经过随机抽样获得的成对样本数据为(x1,y1),(x2,y2),…,(xn,yn),若x与y存在线性相关关系,可用样本相关系数r定量分析它们的相关程度的强弱.(1)样本相关系数r=n∑(2)样本相关系数r的性质①当r>0时,称成对样本数据正相关;当r<0时,称成对样本数据负相关;当r=0时,称成对样本数据间没有线性相关关系;②样本相关系数r的取值范围为[-1,1].当|r|越接近1时,成对样本数据的线性相关程度越强;当|r|越接近0时,成对样本数据的线性相关程度越弱.3.一元线性回归模型(1)经验回归方程为y=bx+a,其中a=(2)通过求Q=n∑i=1(yi-bxi-a4.判断回归模型的拟合效果由成对样本数据(xi,yi)(i=1,2,…,n)按照最小二乘法得到经验回归方程y=bx+a,其中y叫做观测值,y叫做预测值,残差e=y-y.相对于样本点(xi,yi)的随机误差ei=yi-yi=yi-(bx(1)残差分析法①作残差图:作图时纵坐标为残差,横坐标可以选为样本编号,或xi数据,或yi数据,这样作出的图形称为残差图;②残差分析:(ⅰ)定型分析:残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高,经验回归方程的预报精度越高.(ⅱ)定量分析:利用残差平方和,残差平方和越小,模型的拟合效果越好.(2)决定系数(R2)法:R2=1-n∑i=1(yi−y5.列联表与独立性检验(1)关于分类变量X和Y的抽样数据的2×2列联表XY合计Y=0Y=1X=0aba+bX=1cdc+d合计a+cb+dn=a+b+c+d记n=a+b+c+d,则随机变量χ2=n((2)独立性检验基于小概率值α的检验规则是:当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;当χ2<xα时,我们没有充分证据推断H0不成立,可以认为X和Y独立.下表给出了χ2独立性检验中几个常用的小概率值和相应的临界值α0.10.050.010.0050.001xα2.7063.8416.6357.87910.8281.求解经验回归方程的关键是确定回归系数a,b,应充分利用回归直线过样本点的中心(2.根据χ2的值可以判断两个分类变量有关的可信程度,若χ2越大,则两个分类变量有关的把握越大.3.回归分析和独立性检验都是基于成对样本观测数据进行估计或推断,得出的结论都可能犯错误.1.思考辨析(在括号内打“√”或“×”)(1)散点图是判断两个变量相关关系的一种重要方法和手段.()(2)经验回归直线y=bx+a至少经过(x1,y1),(x2,y2),…,(xn,y(3)样本相关系数的绝对值越接近1,成对样本数据的线性相关程度越强.()(4)事件X,Y关系越密切,则由观测数据计算得到的χ2的值越小.()答案(1)√(2)×(3)√(4)×解析(2)y=bx+a必过样本点中心(x,(4)χ2的值越大,相关性越强,关系越密切.2.(人教B选修二P121T3原题)已知变量x和y满足关系y=-0.1x+1,变量y与z正相关.下列结论中正确的是()A.x与y负相关,x与z负相关B.x与y正相关,x与z正相关C.x与y正相关,x与z负相关D.x与y负相关,x与z正相关答案A解析因为-0.1<0,所以x与y负相关,又因为变量y与z正相关,所以x与z负相关.3.(苏教选修二P169T1改编)某小吃店的日盈利y(单位:百元)与当天平均气温x(单位:℃)之间有如下数据:x/℃-2-1012y/百元54221甲、乙、丙3位同学对上述数据进行了分析,发现y与x之间具有线性相关关系,下列回归方程正确的是()A.y=-x+2.8 B.y=-x+3C.y=-1.2x+2.6 D.y=x-0.8答案A解析计算得x=y=回归直线必过(0,2.8),故只有A项满足.4.(人教A选修三P139T3改编)根据分类变量x与y的观测数据,计算得到χ2=3.974.依据α=0.05的独立性检验,结论为x与y(填独立、不独立),这个结论犯错误的概率不超过.

附:α0.0500.0100.001xα3.8416.63510.828答案不独立0.05解析因为3.974>3.841,所以假设不成立,即认为x,y不独立,这个结论犯错误的概率不超过0.05.考点一成对数据的相关性例1(1)(2026·西安质检)如图所示的散点图中,两个变量的相关关系为正相关的是()(2)在一组样本数据(x1,y1),(x2,y2),…,(xn,yn)(n≥2,x1,x2,…,xn不全相等)的散点图中,若所有样本点(xi,yi)(i=1,2,…,n)都在直线y=-12xA.-1 B.0C.-12 答案(1)D(2)A解析(1)图象上升时,两变量为正相关,选项D符合题意.(2)因为样本点都在直线y=-12x+1上,呈现完全负相关,样本相关系数为感悟提升判定两个变量相关性的方法(1)画散点图:若点的分布从左下角到右上角,则两个变量正相关;若点的分布从左上角到右下角,则两个变量负相关.(2)样本相关系数:当r>0时,正相关;当r<0时,负相关;|r|越接近1,线性相关性越强.(3)经验回归方程:当b>0时,正相关;当b<0时,负相关.训练1(1)(2024·上海卷)已知沿海地区气温和海水表层温度相关,且样本相关系数为正数,对此描述正确的是()A.沿海地区气温高,海水表层温度就高B.沿海地区气温高,海水表层温度就低C.随着沿海地区气温由低到高,海水表层温度呈上升趋势D.随着沿海地区气温由低到高,海水表层温度呈下降趋势(2)为了比较甲、乙、丙、丁四组数据的线性相关程度的强弱,小明分别计算了甲、乙、丙、丁四组数据的样本相关系数,其数值分别为-0.95,-0.87,0.76,0.92,则这四组数据中线性相关程度最强的是组数据.

答案(1)C(2)甲解析(1)因为沿海地区气温和海水表层温度相关,且样本相关系数为正数,所以随着沿海地区气温由低到高,海水表层温度呈上升趋势,故选C.(2)r绝对值越大,线性相关程度越强.相关系数与散点图的联系1.教材母题(1)(人教A选修三P101例2)有人收集了某城市居民年收入(所有居民在一年内收入的总和)与A商品销售额的10年数据,如表所示.第n年12345678910居民年收入/亿元32.231.132.935.837.138.039.043.044.646.0A商品销售额/万元25.030.034.037.039.041.042.044.048.051.0画出散点图,推断成对样本数据是否线性相关,并通过样本相关系数推断A商品销售额与居民年收入的相关程度和变化趋势的异同.(2)(湘教选修二P166T1)对四组数据进行统计,获得以下散点图(如图),将四组数据相应的相关系数进行比较,正确的有()A.r2<r4<0<r3<r1 B.r4<r2<0<r1<r3C.r4<r2<0<r3<r1 D.r2<r4<0<r1<r32.散点图与样本相关系数在反映两个随机变量之间的线性相关关系及相关程度时具有相同的作用:r的符号反映了相关关系的正负性,在散点图中则表现为上升或下降;|r|的大小反映了线性相关的强弱程度,在散点图中的表现为数据点集中于一条直线附近的程度.典例(2024·天津卷)下列图中,线性相关系数最大的是()答案A解析选项A中的散点有明显的从左下角到右上角沿直线分布的趋势,且散点集中在一条直线的附近,故选项A中的线性相关系数最大.考点二回归分析角度1线性回归分析例2(2026·新乡模拟)氮氧化物是一种常见的大气污染物,如图为我国2015年至2023年氮氧化物排放量(单位:万吨)的折线图,其中年份代码1~9分别对应年份2015~2023.已知9∑i=1yi≈12000,9∑i=1(yi(1)可否用一元线性回归模型拟合y与t的关系?请分别根据折线图和样本相关系数加以说明;(2)若根据所给数据建立经验回归方程y=-138t+2026,可否用此方程来预测2026年和2036年我国的氮氧化物排放量?请说明理由.附:样本相关系数r=n∑解(1)从折线图看,各点落在一条直线附近,因而可以用线性回归模型拟合y与t的关系,由题意知t=1样本相关系数r=9≈51800−5×故可以用线性回归模型拟合y与t的关系.(2)可以预测2026年的氮氧化物排放量,但不可以预测2036年的氮氧化物排放量.理由如下:①2026年与所给数据的年份较接近,因而可以认为短期内氮氧化物排放量将延续该趋势,故可以用此模型进行预测;②2036年与所给数据的年份相距过远,而影响氮氧化物排放量的因素有很多,这些因素在短期内可能保持不变,但从长期看很有可能会变化,因而用此模型预测可能是不准确的.角度2非线性回归分析例3“绿水青山是金山银山”的理念推动了新能源汽车产业的迅速发展.以下表格和散点图反映了近几年某新能源汽车的年销售量情况.年份20212022202320242025年份代码x12345某新能源汽车年销售量y/万辆1.55.917.732.955.6(1)请根据散点图判断,y=bx+a与y=cx2+d中哪一个更适宜作为年销售量y关于年份代码x的回归方程类型,并比较两个模型的残差平方和大小;(给出判断即可,不必说明理由)(2)根据(1)的判断结果及表中数据,建立y关于x的经验回归方程,并预测2027年该新能源汽车的年销售量.(精确到0.1)参考数据:y=22.72,5∑i=1(wi-w5∑i=1(wi-w)(yi-y)=851.2(其中wi解(1)根据散点图可知,y=cx2+d更适宜作为年销售量y关于年份代码x的回归方程类型,y=cx2+d比y=bx+a的残差平方和小.(2)令w=x2,则y=cw+易知w=11,c≈2.28,d=y-所以y=2.28w-2.36,所以y关于x的经验回归方程为y=2.28x2-2.36.令x=7,得y=109.36≈109.4.故预测2027年该新能源汽车的年销售量为109.4万辆.感悟提升1.求线性经验回归方程(1)当两个系数均未知时,可利用公式法求解;(2)当两个系数已知一个求另一个时,可利用经验回归直线过样本点的中心求解.2.非线性经验回归方程转化为线性经验回归方程的方法(1)若y=a+bx,设t=x,则y=a+bt;(2)若满足对数式:y=a+blnx,设t=lnx,则y=a+bt;(3)若满足指数式:y=c1ec2x,两边取对数得lny=lnc1+c2x,设z=lny,a=lnc1,b=c2,则z=a3.模型拟合效果的好坏可由残差平方和、残差图、决定系数R2等进行判断.训练2(1)(2026·山东三市诊断)已知变量x,y线性相关,其一组样本数据(xi,yi)(i=1,2,…,9)满足9∑i=1xi=33,用最小二乘法得到的经验回归方程为yA.0.1 B.0.2C.0.3 D.0.4(2)已知变量y关于变量x的非线性经验回归方程为y=blnxee3e4e6e7y12345若x=e10,则y的值大约为()A.4.94 B.5.74C.6.81 D.8.04答案(1)A(2)C解析(1)由题意得x=所以y=2x-1=2×113-1=19增加数据(-3,3)后,x'=33−310=3,y'=9设增加数据(-3,3)后的经验回归方程为y=2.1x+b,则6=2.1×3+b,得b=-0.3,所以修正后的经验回归方程为y=2.1x-0.3.当x=4时,y=2.1×4-0.3=8.1,故数据(4,8)的残差的绝对值为|8-8.1|=0.1.(2)由y=blnx+0.24,令t=ln则y=b由题意易得t=y=所以3=b×4.2+0.24,解得b≈0.657,所以y=0.657lnx+0.24,若x=e10,解得y=6.81.考点三独立性检验例4(2025·新高考Ⅰ卷)为研究某疾病与超声波检查结果的关系,从做过超声波检查的人群中随机调查了1000人,得到如下列联表:组别超声波检查结果合计正常不正常患该疾病20180200未患该疾病78020800合计8002001000(1)记超声波检查结果不正常者中患有该疾病的概率为p,求p的估计值;(2)根据小概率值α=0.001的独立性检验,分析超声波检查结果是否与患该疾病有关.附:χ2=n(α0.0500.0100.001xα3.8416.63510.828解(1)由题表可知,检查结果不正常者有200人,检查结果不正常者中患有该疾病的有180人,所以由样本估计总体得p=180200(2)零假设H0:超声波检查结果与是否患该疾病无关.χ2=1000×(20×20−180所以依据小概率值α=0.001的独立性检验,我们推断H0不成立,即认为超声波检查结果与是否患该疾病有关.感悟提升独立性检验的一般步骤(1)根据样本数据制成2×2列联表.(2)根据公式χ2=n((3)比较χ2与临界值的大小关系,作统计推断.训练3(1)为了研究性别与对乡村音乐态度(喜欢和不喜欢两种态度)的关系,运用2×2列联表进行独立性检验,经计算χ2=8.01,则“性别与喜欢乡村音乐有关系”这个推断犯错误的概率不超过(参考数据:x0.005=7.879,x0.001=10.828)()A.0.1% B.0.5%C.99.5% D.99.9%(2)(多选)(2026·济南模拟)为了验证牛的毛色(黑色、红色)和角(有角、无角)这两对相对性状是否相关,某学院进行了一次数据统计,并根据形成的2×2列联表,计算得到χ2≈2.727,根据小概率值为α的独立性检验,下列说法正确的是()附:α0.1000.0500.010xα2.7063.8416.635A.若α=0.100,则认为“毛色”和“角”无关B.若α=0.100,则认为“毛色”和“角”有关,此推断犯错误的概率不超过10%C.若α=0.010,则认为“毛色”和“角”无关D.若α=0.010,则认为“毛色”和“角”有关,此推断犯错误的概率不超过1%答案(1)B(2)BC解析(1)因为χ2=8.01>7.879=x0.005,所以“性别与喜欢乡村音乐有关系”这个推断犯错误的概率不超过0.5%.(2)零假设为H0:“毛色”和“角”之间无关联.因为χ2≈2.727>2.706,所以根据小概率值α=0.100的独立性检验,推断H0不成立,即认为“毛色”和“角”之间有关联,此推断犯错误的概率不超过10%,A错误;B正确.因为χ2≈2.727<6.635,所以根据小概率值α=0.010的独立性检验,没有充分证据推断H0不成立,因此可认为“毛色”和“角”之间无关联,C正确,D错误.一、单选题1.某机构为调查网游爱好者是否有性别差异,通过调研数据统计:在500名男生中有200名爱玩网游,在400名女生中有50名爱玩网游.若要确定网游爱好是否与性别有关时,用下列最适合的统计方法是()A.均值 B.方差C.独立性检验 D.回归分析答案C解析由题意可知,“爱玩网游”与“性别”是两类变量,其是否有关,应用独立性检验判断.2.(2023·天津卷)调查某种群花萼长度和花瓣长度,所得数据如图所示,其中相关系数r=0.8245,下列说法正确的是()A.花瓣长度和花萼长度没有相关性B.花瓣长度和花萼长度呈负相关C.花瓣长度和花萼长度呈正相关D.若从样本中抽取一部分,则这部分的相关系数一定是0.8245答案C解析因为相关系数r=0.8245>0.75,所以花瓣长度和花萼长度的相关性较强,并且呈正相关,所以A,B错误,C正确;因为相关系数与样本的数据有关,所以当样本发生变化时,相关系数也会发生变化,所以D错误.3.甲、乙、丙、丁四位同学各自对A,B两个变量的线性相关性做试验,并用回归分析方法分别求得样本相关系数r与残差平方和m,如下表:甲乙丙丁r0.820.780.690.85m106115124103则哪位同学的试验结果体现A,B两个变量有更强的线性相关性?()A.甲 B.乙C.丙 D.丁答案D解析r的绝对值越大,m越小,线性相关性越强.4.(2026·成都诊断)假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其2×2列联表如下:XY合计y1y2x1aba+bx2cdc+d合计a+cb+da+b+c+d对同一样本,以下数据能说明X与Y有关联关系可能性最大的一组为()A.a=9,b=3,c=2,d=1B.a=9,b=2,c=3,d=1C.a=2,b=3,c=1,d=9D.a=3,b=1,c=2,d=9答案D解析根据χ2的计算公式及a+b+c+d=15可得,当n相等时,|ad-bc|越小,说明X与Y之间的关系越弱;|ad-bc|越大,说明X与Y之间的关系越强,经过逐一验证,可知选D.5.某科研机构为了研究中年人秃发与患心脏病是否有关,随机调查了一些中年人的情况,具体数据如表:患心脏病无心脏病秃发20300不秃发5450根据表中数据得到χ2≈15.968,因为χ2>10.828,则断定中年人秃发与患心脏病有关系.那么这种判断出错的可能性为()A.0.001 B.0.05C.0.025 D.0.01答案A解析因为χ2>10.828=x0.001,因此判断出错的可能性为0.001,故选A.6.某兴趣小组研究光照时长x(h)和向日葵种子发芽数量y(颗)之间的关系,采集5组数据,作如图所示的散点图.若去掉D(10,2),则下列说法正确的是()A.相关系数r变小B.决定系数R2变小C.残差平方和变大D.解释变量x与预报变量y的相关性变强答案D解析可知点D偏离程度较大,去掉点D后,相关系数r变大,决定系数R2变大,残差平方和变小,解释变量x与预报变量y的相关性变强.故选D.7.设两个相关变量x和y分别满足表:x12345y128816若相关变量x和y可拟合为非线性经验回归方程y=2bx+a,则当x=6时,y的估计值为()附:对于一组数据(u1,v1),(u2,v2),…,(un,vn),其经验回归直线v=α+βa=v-A.33 B.37C.65 D.73答案B解析因为非线性经验回归方程为y=2bx+a,则有log2y=bx+a,令log2y=v,即v=b列出相关变量x,y,v关系如表:x12345y128816v01334所以5∑i=1xix=v=5∑所以b=所以a=v-所以v=x-45即log2y=x-45,即y因为1.155≈2,所以21当x=6时,y=26−45=2265二、多选题8.根据如图所示的等高堆积条形图,下列叙述正确的是()A.吸烟患肺病的频率约为0.2B.吸烟不患肺病的频率约为0.8C.不吸烟患肺病的频率小于0.05D.吸烟与患肺病无关系答案ABC解析从等高堆积条形图中可以明显地看出,吸烟患肺病的频率远远大于不吸烟患肺病的频率.所以吸烟与患肺病有关,D错误;由题图得,A,B,C都正确.9.(2026·武汉调研)某科技公司统计了一款APP最近5个月的下载量如表所示,若y与x线性相关,且经验回归方程为y=-0.6x+a,则()月份编号x12345下载量y/万次54.543.52.5A.y与x负相关B.a=5.6C.预测第6个月的下载量是2.1万次D.残差绝对值的最大值为0.2答案ACD解析因为y=-0.6x+a中x的系数-0.6<0,所以y与x负相关,A正确;因为(1+2+3+4+5)÷5=3,(5+4.5+4+3.5+2.5)÷5=3.9,所以将(3,3.9)代入y=-0.6x+a,得3.9=-0.6×3+a,a=5.7,B将x=6代入y=-0.6x+5.7,得y=2.1,所以预测第6个月的下载量是2.1万次,C正确;如表,由表可知残差绝对值的最大值为0.2,D正确.月份编号x12345下载量y/万次54.543.52.5下载量预测值z/万次5.14.53.93.32.7残差绝对值0.100.10.20.2三、填空题10.(2026·湖北起点考试)已知某种商品的广告费x(单位:万元)与销售额y(单位:万元)之间的对应数据如下表:x13457y1418304246根据表中数据得到y关于x的经验回归方程为y=6x+a,则当广告费为10万元时,预测销售额为万元.

答案66解析由题表可知,x=15×(1+3+4+5+7)=4,将(4,30)代入y=6x+a,得a=30-6×4=6,故y=6x+6.当x=10时,y=6×10+6=66,故预测销售额为66万元.11.已知x和y的散点图如图所示,在相关关系中,若用y=c1ec2x拟合时的决定系数为R12,用y=bx+a拟合时的决定系数为答案R解析由散点图知,用y=c1ecy=bx+a所以R12>R2212.下表是关于某设备的使用年限x(单位:年)和所支出的维修费用y(单位:万元)的统计表.x23456y3.44.25.15.56.8由表可得经验回归方程为y=0.81x+a,若规定:维修费用y不超过10万元,一旦大于10万元时,该设备必须报废.据此模型预测,该设备使用年限的最大值约为.

答案10解析由表格,得x=15×(2+3+4+5+6)=4,因为经验回归直线恒过点(x,所以5=0.81×4+a,解得a=1.76,所以经验回归方程为y=0.81x+1.76,由y≤10,得0.81x+1.76≤10,解得x≤82481由于x∈N*,所以据此模型预测,该设备使用年限的最大值约为10.四、解答题13.(2022·全国乙卷)某地经过多年的环境治理,已将荒山改造成了绿水青山.为估计一林区某种树木的总材积量,随机选取了10棵这种树木,测量每棵树的根部横截面积(单位:m2)和材积量(单位:m3),得到如下数据:样本号i12345678910总和根部横截面积xi0.040.060.040.080.080.050.050.070.070.060.6材积量yi0.250.400.220.540.510.340.360.460.420.403.9并计算得10∑i=1xi2=0.038,10∑(1)估计该林区这种树木平均一棵的根部横截面积与平均一棵的材积量;(2)求该林区这种树木的根部横截面积与材积量的样本相关系数(精确到0.01);(3)现测量了该林区所有这种树木的根部横截面积,并得到所有这种树木的根部横截面积总和为186m2.已知树木的材积量与其根部横截面积近似成正比.利用以上数据给出该林区这种树木的总材积量的估计值.附:相关系数r=n∑1.896≈1.377.解(1)样本中10棵这种树木的根部横截面积的平均值x=0.61

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论