2024年新高考数学一轮复习专题18 统计与成对数据的统计分析(解析版)_第1页
2024年新高考数学一轮复习专题18 统计与成对数据的统计分析(解析版)_第2页
2024年新高考数学一轮复习专题18 统计与成对数据的统计分析(解析版)_第3页
2024年新高考数学一轮复习专题18 统计与成对数据的统计分析(解析版)_第4页
2024年新高考数学一轮复习专题18 统计与成对数据的统计分析(解析版)_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

专题18统计与成对数据的统计分析

一、知识速览

1、抽样调查

知识点1随机抽样瞥2、简单随机抽样

13、分层抽样

1、频率分布直方图

统计与成对数知识点2用样本估计总体2、百分位数

据的统计分析3、样本的数字特征

1、两个变量的线性相关

知识点3寸数据的统计分析2、回归分析与回归方程

3、残差分析

4、独立性检验

二、考点速览

考点7总体集中趋势的估计

考点8总体离散程度的估计

考点9变量间的相关关系判断

考点10一元线性回归模型

考点11非线性回归分析

考点12列联表与独立性检验

知识旅理

知识点1随机抽样

1、抽样调查

(I)总体:统计中所考察对象的某一数值指标的全体构成的集合称为总体.

(2)个体:构成总体的每一个元素叫做个体.

(3)样本:从总体中抽取若干个个体进行考察,这若干个个体所构成的集合叫做总体的一个样本,样本

中个体的数目叫做样本容量.

2、简单随机抽样

(I)定义:〜般地,设一个总体含有N个个体,从中逐个不放回地抽取〃个个体作为样本(〃WN),如

果每次抽取时总体内的各个个体被抽到的机会都相等,就把这种抽样方法叫做简单随机抽样.这样抽取的

样本,叫做简单随机样本.

<2)两种常用的简单随机抽样方法

①抽签法:一般地,抽签法就是把总体中的N个个体编号,把号码写在号签上,将号签放在一个容器

中,搅拌均匀后,每次从中抽取一个号签,连续抽取〃次,就得到一个容量为〃的样本.适用于总体个数

较少的情况。

②随机数法:即利用随机数表、随机数骰子或计算机产生的随机数进行抽样.这里仅介绍随机数表

法.随机数表由数字0,1,2,…,9组成,,并且每个数字在表中各个位置出现的机会都是一样的.适用

于总体个数较多的情况,但是当总体容量很大时,需要的样本容量也很大时,利用随机数法抽取样本仍不

方便.

(3)简单随机抽样的特征(只有四个特点都满足的抽样才是简单随机抽样)

①有限性:简单随机抽样要求被抽取的样本的总体个数是有限的,便于通过样本对总体进行分析.

②逐一性:简单随机抽样是从总体中逐个地进行抽取,便于实践中操作.

③不放回性:简单随机抽样是一种不放回抽样,便于进行有关的分析和计算.

④等可能性:简单单随机抽样中各个个体被抽到的机会都相等,从而保证了抽样方法的公平.

3、分层抽样

(I)定义:一般地,在抽样时,将总体分成互不交叉的层,然后按照一定的比例,从各层独立地抽取一

定数量的个体,将各层取出的个体合在一起作为样本,这种抽样方法叫做分层抽样.

分层抽样适用于已知总体是由差异明显的几部分组成的.

(2)分层抽样问题类型及解题思路

①求某层应抽个体数最:按该层所占总体的比例计算.

②己知某层个体数量,求总体容量或反之求解:根据分层抽样就是按比例抽样,列比例式进行计算.

③分层抽样的计算应根据抽样比构造方程求解,其中“抽样比=黠黑=舞嚼答

【注意】分层抽样时,每层抽取的个体可以不一样多,但必须满足抽取〃,=〃•乂(/=1,2,.k)个个体

N

(其中i是层数,〃是抽取的样本容量,乂是第i层中个体的个数,N是总体容量).

知识点2用样本估计总体

1、频率分布直方图

(1)频率、频数、样本容量的计算方法

①|滞X组距=频率.

②样频篇数量=频率,帚频数=样本容量'样本容量X频率=频数.

③频率分布直方图中各个小方形的面积总和等于1.

(2)频率分布直方图中数字特征的计算

①最高的小长方形底边中点的横坐标即是众数.

②中位数左边和右边的小长方形的面积和是相等的.设中位数为x,利用x左(右)侧矩形面积之和

等于0.5,即可求出1.

③平均数是频率分布直方图的“重心”,等于频率分布直方图中每个小长方形的面积乘以小长方形底边

中点的横坐标之和,即有X=X|P[+演〃1++Xnpn,其中X”为每个小长方形底边的中点,P”为每个小长方

形的面积.

2、百分位数

(I)定义:一组数据的第〃百分位数是这样一个值,它使得这组数据中至少有的数据小于或等于这个

值,且至少有(100-〃)%的数据大于或等于这个值.

(2)计算一组〃个数据的的第〃百分位数的步骤

①按从小到大排列原始数据.

②计算j=.

③若,・不是整数而大于i的比邻整数则第〃百分位数为第/项数据;若i是整数,则第〃百分位数

为第i项与第i+1项数据的平均数.

(3)四分位数:我们之前学过的中位数,相当于是第50百分位数.在实际应用中,除了中位数外,常用

的分位数还有第25百分位数,第75百分位数.这三个分位数把一组由小到大排列后的数据分成四等份,

因比称为四分位数.

3、样本的数字特征

(I)众数、中位数、平均数

①众数:一组数据中出现次数最多的数叫众数,众数反应一组数据的多数水平.

②中位数:将一组数据按大小顺序依次排列,把处在最中间位置的一个数据(或最中间两个数据的平

均数)叫做这组数据的中位数,中位数反应一组数据的中间水平.

③平均数:〃个样本数据X",,…,%的平均数为7=%十七一…+X",反应一组数据的平均水平,公式

n

._

变形:

f=l

(2)标准差和方差

①标准差:标准差是样本数据到平均数的一种平均距离,一般用,表示.假设样本数据是4,々,…,工,

[表示这组数据的平均数,则标准差$=7)2+(居-7)2+…+(七一7)1.

Vn

②方差:方差就是标准差的平方,即S2=匕($一;)2+(花一;.)2+…+(七—,力.显然,在刻画样本数

n

据的分散程度上,方差与标准差是一样的.在解决实际问题时,多采用标准差.

【注意】标准差、方差描述了一组数据围绕平均数波动程度的天小.标准差、方差越大,则数据的离散程

度越大;标准差、方差越小,数据的离散程度越小.反之亦可由离散程度的大小推算标准差、方差的大小.

③平均数、方差的性质:如果数据八七....X”的平均数为"方差为一,那么

一组新数据X]+Z>,w+b,...xn+〃的平均数为x+/?,方差是d.

一新数据叫,3,……,ar”的平均数为ax,方差是/一.

一组新数据时+btax2+仇...,a+6的平均数为ax+b,方差是

知识点3成对数据的统计分析

1、两个变量的线性相关

(I)正相关:在散点图中,点散布在从左下角到右上角的区域,对于两个变量的这种相关关系,我们将

它称为正相关.

(2)负相关:在散点图中,点散布在从左上角到右下角的区域,两个变量的这种相关关系称为负相关.

(3)线性相关关系、回归直线:如果散点图中点的分布从整体上看大致在•条直线附近,就称这两个变

量之间具有线性相关关系,这条直线叫做回归直线.

2、回归分析与回归方程

(I)回归分析的定义:对具有相关关系的两个变量进行统计分析的一种常用方法.

(2)最小二乘法;使得样本数据的点到回归直线的距离的平方和最小的方法叫做最小二乘法.

(3)回归方程:对于一组具有线性相关关系的数据(汨,y),(刈,”),…,(心,力),其回归方程),二版+。

的求法为

〃__〃_

-x)(y-y)

b=J-----------------------------=-4----------------—

力a-%)2为

r-l«>l

a=y-bx

—i«—i«--

其中,x=—Yx.,y=—Vy,,(x,y)称为样本点的中心.

(3)相关系数

若相应于变量上的取值X,.,变量),的观测值为凹(1</<〃),

2^(xf.-A-)(.v.-y)

则变量x与),的相关系数r=「“

心沁一)冬凹—才

通常用,•来衡量工与),之间的线性关系的强弱,,•的范围为

①当,00时,表示两个变量正相关;当r<0时,表示两个变量负相关.

②卜|越接近1,表示两个变量的线性相关性越强;卜|越接近(),表示两个变量间几乎不存在线性相关

关系.当|r|=l时,所有数据点都在一条直线上.

③通常当|r|>0.75时,认为两个变量具有很强的线性相关关系.

3、残差分析

对于预报变量),,通过观测得到的数据称为观测值y,通过回归方程得到的称为预测值,观测值减去预

测值等于残差,自称为相应于点区,凹)的残差,即有自=£-立…

残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果以及判断原始数据中是否存

在可疑数据等,这方面工作称为残差分析.

(I)残差图:通过残差分析,残差点(七,4)比较均匀地落在水平的带状区域中,说明选用的模型比较合

适,其中这样的带状区域的宽度越窄,说明模型拟合精确度越高;反之,不合适.

(2)通过残差平方和。=£(),「$,,)2分析,如果残差平方和越小,则说明选用的模型的拟合效果越好;反

r-1

之,不合适.

力(X-力)2

(3)相关指数:用相关指数来刻画回归的效果,其计算公式是:R'1-二''.

£(兄-“

r=l

心越接近于1,说明残差的平方和越小,也表示回归的效果越好.

4、独立性检验

(I)分类变量:变量的不同“值,表示个体所属的不同类别,像这类变量称为分类变量.

(2)列联表:

①定义:列出的两个分类变量的频数表称为列联表.

②2x2列联表:假设有两个分类变量X和匕它们的可能取值分别为{k,M}和{》,"},其样本频数

列玦表(称为2x2列联表)为2x2列联表

总计

y2

Xaba+b

x2Cdc+d

总计a+cb+dn-a+b+c-\-d

⑶独立性检验:计算随机变量人…首蓝二帅以利用/的取值推断分类变量x和y是否独

立的方法称为/独立性检验.

a0.100.050.0100.0050.001

儿2.7063.8416.6357.87910.828

方法技巧

一、应用随机数法的两个关键点

I、确定以表中的哪个数(哪行哪列)为起点,以哪个方向为读数的方向;

2、读数时注意结合编号特点进行读取.若编号为两位数字,则两位两位地读取;若编号为三位数字,则

三位三位地读取,有超过总体号玛或出现重复号码的数字舍去,这样继续下去,直到获取整个样本.

【典例1】(2023•宁夏银川•银川一中校考一模)对50件样品进行编号01,02,……,50,在如下随机数

表中,指定从第2行第II列开始,从左往右抽取两个数字,抽取6个编号,则抽到的第6个编号是()

486285008938155698822776173903

536660891248395326163490263640

006207961329901923643865964526

A.48B.24C.26D.36

【答案】D

【辞析】自第2行第11列开始,第一个编号为48,

去除编号不在0150的号码和重复号码,依次抽取的6个编号为:48,39,26,16,34,36,

则抽到的第6个编号为36.故选:D.

【典例2】(2023上•上海•高三控江中学校考阶段练习)总体由编号为01、02、03、L、50的50个个体

组成,利用随机数表从中抽取5个个体,下面提供随机数表的第5行到第7行:

93124779573789184550399455739229

61116098496573509847303098373770

23104476914606792662206205229234

若从表中第6行第6列开始向右依次读取,则抽取的第3个个体的编号是.

【答案】03

【解析】由题意,结合随机数表法可知,从中抽取5个个体的编号依次为:()9、35、03、02、31,

故答案为:03.

二、解决分层抽样的常用公式

先筑定抽样比,然后把各层个体数乘以抽样比,即得各层要抽取的个体数.

一]、,”,样本容量各层样本容量

(I)拙样比一总体容量一各层个体总量;

(2)层1的容量:层2的容量:层3的容量=样本中层1的容量:样本中层2的容量:样本中层3的容

量,

【典例1】(2023上•湖北武汉•高三武钢三中校考阶段练习)某企业为了解员工身体健康情况,采用分层随

机抽样的方法从该企业的营销部门和研发部门抽取部分员工体检.已知该企业营销部门和研发部门的员工

人数之比是5:1,且被抽到参加体检的员工中,营销部门的人数比研发部门的人数多72,则参加体检的人

数是()

A.90B.96C.108D.144

【答案】C

【解析】设参加体检的人数有〃人,

则"=72,解得九二108,即参加体检的人数是1()8人.故选:C.

66

【典例2】(2023•山东潍坊・统考模拟预测)某高中学校共有学生3600人,为了解某次数学文化知识竞赛的

得分情况,采用分层抽样的方法从这3600名学生中抽取一个容量为48的样本,若从高一、高二、高三抽

取的人数组成一个以4为公差的等差数列,则该学校高三年级的学生人数为人.

【答案】1500

【解析】设从高二抽取的人数为x,则高一抽取的人数为4,高三抽取的人数为x+4.

所以3工=48,解得K=16,所以高三年级抽取了2()人,

山分层抽样的概念可知高三年级的学士人数为;3600x2^0=1500.

48

故答案为:1500.

三、频率分布直方图的计算

I、由频率分布直方图进行相关计算需掌握的2个关系式

频率

(I)布苏x组距=频率.

(2)祢频急数[=频率,此关系式的变形频为数就=样本容量,样本容量x频率=频数.

2、利用频率分布直方图估计样本的数字特征的方法

(I)中位数:在频率分布直方图中,中位数左边和右边的直方图的面积相等,由此可以估计中位数的值.

(2)平均数:平均数的估计值等于每个小矩形的面积乘以矩形底边中点横坐标之和.

(3)众数:最高的矩形的中点的横坐标.

【典例1】(2023上•贵州黔东南•高二天柱民族中学校联考阶段练习)(多选)某工厂为了了解一批产品的

质量,从中随机抽取了100件产品测最其长度,所得数据都在区间[5,40]中,其频率分布直方图如图所示,

B.估计产品长度的样本数据的70%分位数是27mm

C.估计产品长度的样本数据的众数是22.5mm

D.估计产品长度的样本数据的平均数是23mm

【答案】ABC

【蟀析】对选项A:(0.()1x3+0.02+0.()4+«+0.()6)x5=1,解得〃=0.05,正确;

对选项B:长度在25以下的比例为(0.01+0.01+0.04+0.06)x5=0.6,

长度在30以卜.的比例为(0.01+0.01+0.04+0.06+0.05)x5=0.85,

故70%分位数位于[25,30]内,设为x,则-y-x0.05x5+0.6=0.7,解得x=27,正确:

对选项C:产品长度的样本数据的众数是义产=22.5mm,正确;

对选项D:平均数为7.5x0.01x5+12.5x0.01x5++37.5x0.01x5=23.25,错误.故选:ABC.

【典例2】(2023上•云南昆明•高三校考阶段练习)(多选)在一次考试中,某地抽取一组样本,将学生的

考分按[040),[10,20),…,[90,100]分成10组,得到如下频率分布直方图:

根据频率分布直方图,则下列结论正确的是()

A.规定分数不低于60分为及格,则及格率为0.6

B.样本的中位数为60

C.以频率作为概率,每组数据区间中点作代表,估计该地此次考试的平均分为60分

D.规定此次考试80%的考生定为合格等级,则合格等级的学生最低分为40分

【答案】AD

【解析】分数在[60.100]的频率为:(2x0.016+0.020+0.008)x10=0.6,A1E确;

分数在[0,60)的频率为0.4,分数在口7。)的频率为0.56,

由60+0彳5-詈04=66.25,得样本的中位数为66.25,B错误;

().016

5x0.02+15x0.04+25x0.06+35x0.08+45x0.08=8.60,

55x0.12十65x0.16十75x0.2十85x0.16+95x0.08=53.20,而8.60十53.20=61.80.

所以估计该地此次考试的平均分为61.8分,C错误;

分数在[0,40)的频率为0.2,所以合格等级的学生最低为40分,D正确.故选:AD.

四、百分位数的计算

计算一组〃个数据的的第〃百分位数的步骤

①按从小到大排列原始数据.

②计算i=〃xp%.

③若i不是整数而大于i的比邻整数),则第〃百分位数为第/项数据;若i是整数,则第〃百分位数为第i

项与第,.+1项数据的平均数.

【典例1】(2023上•陕西榆林•高三子洲中学校考期中)某校高一年级18个班参加艺术节合唱比赛,通过

简单随机抽样,获得了1。个班的比赛得分如下:91,89,90,92,94,87,93,96,91,85,则这组数

据的80%分位数为()

A.92B.93C.92.5D.93.5

【答案】D

【解析】比赛得分按从小到大排列为85,87,89,90,91,91,92,93,94,96,10x80%=8,

93+94

所以这组数据的80%分位数为—^―=93.5.故选:D.

【典例2】(2023上•广东惠州•高三统考阶段练习)在一次篮球比赛中,某支球队共进行了8场比赛,得分

分别为:29,30,38,25,37,40,42,32,那么这组数据的第75百分位数为()

A.37.5B.38C.39D.40

【答案】C

【解析】数据按从小到大排序为25,29,30,32,37,38,40,52,

而8x75%=6,故第75百分位数为失丝二39,故选C

五、用样本的数字特征估计总体的数字特征

利用样本的数字特征解决优化决策问题的依据

(I)平均数反映了数据取值的平均水平;标准差、方差描述了一组数据围绕平均数波动的大小.标准差、

方差越大,数据的离散程度越大,越不稳定;标准差、方差越小,数据的离散程度越小,越稳定.

(2)用样本估计总体就是利用样本的数字特征来描述总体的数字特征.

【盥例I】(2023上.云南楚雄.高二统考期中)现有一组数据相,修,与,匕,%的平均数为口,若随机去

掉一个数%(/=1,2,3,4,5;后,余下的四个数的平均数为9,则下列说法正确的是()

A.余下四个数的极差比原来五个数的极差更小B.余下四个数的中位数比原来五个数的中位数更

C.余下四个数的最小值比原来五个数的最小值更大D.去掉的数一定是4

【答案】D

【解析】因为引,々,为,&,k的平均数为8,设去掉占后余下的四个数的平均数为9,

则%=(与+七+x3+x44-X5)-4X9=5X8-4X9=4,D卫确.

例如这5个数分别为3,4,4,4,25,则去掉4之后.极差依然不变为22,

中位数不变依然为4不变,,最小值不变依然为3,则C错误则可得A,B,C错误.故选:D.

【典例2】(2023•浙江金华•校联考模拟预测)有一组样本数据132,4,3,5,46,则()

A.这组样本数据的极差不小于4B.这组样本数据的平均数不小于4

C.这组样本数据的中位数不小于3D.这组样本数据的众数等于3

【答案】A

【解析】样本数据1,3,2M,3,5,4/中,

对J-A,显然这组样本数据的极差大于等「5-1=4,故A正确;

对于B,若。…0,则平均数为++故B错误;

84

对TC,若=(),则。,0』,2,3,3,4,5中位数为爹一2.5<3,故C错误;

对于D,若a=b=T,则LU,2,3,3,4,5众数为1,故D错误.故选:A

【典例3】(2023•全国•校联考模拟预测)已知样本数据4、42、/、%、%都为正数,其方差

s2=:(a;+W+G+d+d_80),则样本数据2%+3、2%+3、2%+3、2%+3、2%+3的平均数为.

【答案】11

【解析】根据题意,设样本数据为、%、6、%、%的平均数为了,

其方差/=:[(〃]一工)'+(%-了7+(%一57+(。4一丞)2+(«3■■元)[

22

=,(a;+a;+a;+a:+aj-2atx-2a^x-2a^x-la^x-2a5x+5x)=4(a;+ai+a;+a:+a;-5x),

55

又$2=一(a:+a;+a:+a;+a;-80),

则有5铲=80,解得了=4,

则样本数据2%十3、2%+3、血+3、2,+3、2%+3的平均数为27+3=11;

故答案为:II.

六、判断相关关系的2种方法

I、散点图法:如果所有的样本点都落在某一函数的曲线附近,变量之间就有相关关系.如果所有的样本

点都落在某一直线附近,变量之间就有线性相关关系;

2、相关系数法:利用相关系数判定,当M越趋近于1时,相关性越强

【典例1】(2023•浙江杭州•统考二模)某兴趣小组研究光照时长x(h)和向日葵种子发芽数最y(颗)之

间的关系,采集5组数据,作如图所示的散点图.若去掉。(10,2)后,下列说法正确的是()

.£(8,11)

8(2,6)

J-C(3,5)

:(1,4).7)(10,2)

Ox

A.相关系数r变小B.决定系数R2变小

C.残差平方和变大D.解释变量x与预报变量y的相关性变强

【答案】D

【解析】从图中可以看出0(10,2)较其他点,偏离直线远,故去掉0(1(),2)后,回归效果更好,

对于A,相关系数上|越接近于I,模型的拟合效果越好,

若去掉0(10,2)后,相关系数,•变大,故A错误;

对于B,决定系数方越接近于1,模型的拟合效果越好,

若去掉。(10,2)后,决定系数配变大,故B错误;

对于C,残差平方和越小,模型的拟合效果越好,若去掉。(1(),2)后,残差平方和变小,故C错

误;

对于D,若去掉。(10.2)后,解释变晨丫与预报变异),的相关性变强,且是正相关,他【)正确.

故选:D.

【典例2】(2023上•天津蓟州•高三校考开学考试)对两个变量肛》进行线性相关检验,得线性相关系数

10.8995,对两个变量〃,了进行线性相关检验,得线性相关系数弓=-().9568,则下列判断正确的是()

A.变量X与>正相关,变量〃与V负相关,变量X与),的线性相关性较强

B.变量X与y负相关,变量〃与,正相关,变量X与y的线性相关性较强

c.变量%与丁正相关.变量〃与口负相关,变量〃与丫的线性相关性较强

D.变量'与>负相关,变量〃与v正相关,变量〃与-的线性相关性较强

【答案】C

【解析】因为线性相关系数。=().8995>。,所以x,),正相关,

因为线性相关系数5=T).9568<0,所以〃,u负相关,

又因为用<|引,所以变量",v的线性相关性比x,5的线性相关性强,

故A、B、D错误,C正确.故选:C.

七、线性回归分析问题的类型及解题方法

1、求回归直线方程

①计算出x,y,Z&£孙•或Z(为一x)(y-),),Z(刘一x)2的值;

1=1;=I/=]j=1

②利用公式计算回归系数-合

③写出回归直线方程工=源+:

2、回归模型的拟合效果:利用相关系数r判断,当川越趋近于1时,两变量的线性相关性越强.

【典例1】(2023•江西景德镇•统考一模)对某位运动员近5次比赛成绩统计如下表:

C.得分),的方差为22.8D.预测第6次比赛成绩约为54

【答案】C

-1+2+3+4+5.-39+40+48+48+50

【解析】由表格数据,x=---------:---------=3,y=---------------:--------------

所以45=3x3+4=4=36,故y=3x+36,当x=6,贝ijy=54,A、D对;

1x[(39-45尸+(40-45)2+(48-45)2+(48-45尸+(50-45)2]=20.8,C错;

30

>0,B对.故选:C

-3)2•之(%-45)2

-3)2.2(凹-45-

1-12I

【典例2】(2023上•广东广州•高三广东广雅中学校考阶段练习)新冠肺炎疫情发生以来,中医药全面参与

疫情防控救治,做出了重要贡献.某中医药企业根据市场调研与模拟,得到研发投入x(亿元)与产品收益

y(亿元)的数据统计如下:

研发投入X(亿元)12345

产品收益了(亿元)3791011

(I)计算工,y的相关系数厂,并判断是否可以认为研发投入与产品收益具有较高的线性相关程度?(若

0.3<|r|<0.75,则线性相关程度一般,若“、。75,则线性相关程度较高)

(2)求出丁关于x的线性回归方程,并预测若想收益超过5()(亿元)则需研发投入至少多少亿元?(结果

保留一位小数)参考数据:Z(x-y)2=40,£>戊=139.

/=1

Z(i)(y-5)

附:相关系数公式:一__

£(占一可2-y)2

/=1

5)(K—方

回归直线方程的斜率力=『-----------,截距4=尸-加.

£(大-才

r=l

【答案】(1)r=0.95,线性相关程度较高;(2)回归直线方程为y=L9x+2.3;至少投资25.1亿元

-I+2+3+4+53+7+9+10+11

【解析】(Dx=----------------=3,y=-------Z------=oo,

55

5

2(毛—7)(>;—7)=(-2)x(-5)+(-1)x(—l)+0x1+1x2+2x3=19,

(-1)2+02+12+22=x/10,y.-y)2=痴=2而,

19

所以而云丽=°'9"S75,所以线性相关程度较高.

⑵由⑴得£(若一可(凹一为=19,寸为一斤=10,

/=1r=l

**1y

所以〃=历=1与,a=8-1.9x3=2.3,

所以),=1.9x+2.3,由),=L9x+2.3N50,5O~^3«25.1,

所以至少投资25.1亿元.

八、非线性回归分析的求法

(I)根据原始数据作出故点图;

(2)根据散点图选择恰当的拟合函数;

(3)作恰当变换,将其转化成线性函数,求线性回归方程;

(4)在(3)的基础上通过相应变换,即可得非线性回归方程.

【典例1】(2023上•重庆渝中•高三统考期中)当前,新一轮科技革命和产业变革蓬勃兴起,以区块链为代

表的新一代信息技术迅猛发展,现收集某地近6年区块链企业总数量相关数据,如卜.表:

年份201720182019202020212022

编号X123456

企业总数量)'(单位:百个)5078124121137352

(I)若用模型),=讹瓜拟合)'与1的关系,根据提供的数据,求出)'与x的经验回归方程;

(2)为了促进公司间的合作与发展,区块链联合总部决定进行一次信息化技术比赛,邀请甲、乙、丙三

家区块链公司参赛.比赛规则如下:①每场比赛有两个公司参加,并决出胜负;②每场比赛获胜的公司与

未参加此场比赛的公司进行下一场的比赛;③在比赛中,若有一个公司首先获胜两场,则木次比赛结束,

该公司获得此次信息化比赛的“优胜公司已知在每场比赛中,甲胜乙的概率为g,甲胜丙的概率为:,

3

乙在丙的概率为不若首场由甲乙比赛,求甲公司获得“优胜公司''的概率.

参考数据:£〃r=28.5,Z%%=106.05,其中,%=In%

r=1r=1

参考公式:对于一组数据G,y)(i=l,2,3,…,〃),其经验回归直浅$,=向-6的斜率和截距的最小二乘估计

分别为石=气---------,a=y-bx

力2

1-1

3

【答案】(I)y=e-49;(2)

【解析】(1)令〃=hiy=hiacbx=bx+Ina,

”+2+3+4+5+6=351圣

66

贝Vx.u.一必nxu仁5/一畸.5)

106.05-6x3.5x4.75

T=0.36,

349

Ina=4.75-0.36x3.5=3.49,所以.=e,

所以y=e349-e036x=e°w+3.49;

<2)设甲公司获得“优胜公司”为事件A,

//八11123112113

Wy^(A)=-x-+—X-X-X-+—x-x-x—=—,

―232352253210

3

所以甲公司获得“优胜公司”的概率为伍.

【典例2】(2023•广西南宁・南宁三中校考一模)数据显示中国车载音乐已步入快速发展期,随着车载音乐

的商业化模式进一步完善,市场将持续扩大,下表为2018—2022年中国车载音乐市场规模(单位:十亿

元),其中年份2018—2022对应的代码分别为1-5.

年份代码X12345

车载音乐市场规模y2.83.97.312.017.0

(|)由上表数据知,可用指数逐数模型拟合'与x的关系,请建立y关于x的回归方程;

(2)根据上述数据求得y关于X的回归方程后,预测2024年的中国车载音乐市场规模.

参考数据:

0.5240.472

V1.67

r-l

1.9433.821.71.626.84

其中匕=lny.,V=1^v..

3r-l

参考公式:对于一组数据(%,M),(〃2»),L,(与,匕)其回归直线y=a+的斜率和截距的最小二乘法

n__

Zuivi-nil-v

估计公式分别为夕二9-------=,

【答案】(1)),=1.7x16';<2)45.628(十亿元).

【辞析】(I)因为丁=。力1所以两边同时取自然对数,得ln),=ln〃+xlnb,

设y=Iny,所以1,=\na+xln/?,

设a=ln〃,0=lnb,WOv=a+fixt

因为i=g(l+2+3+4+5)=3

v=1.94,

33.82-5x3x1.94

所以方==0.472,

55—5x32

**AA**

a=v-/7x=1.94-0.472x3=0.524T所以a=Inq=().524,Q==0.472,

0472

所以a=e0524=i,7,^=e=L6>所以y=1.7xl.6'

(2)把2024年代码x=7代入方程,

7

Wy=1.7xL6=1.7x26.84=45.628(十亿元)

故预测2024年的中国车载音乐市场规模45.628(十亿元)

九、独立性检验的一般步骤

(I)根据样本数据制成2x2列联表.

n(cid-be)2

(2)根据公式/二计算.

(a+b)[c+d)[a+c)(b+d)

(3)比较/与临界值的大小关系,作统计推断.

【典例1】(2023上•江西抚州•高三校考期中)“一带一路”是促进各国共同发展,实现共同繁荣的合作共赢

之路.为了了解我国与某国在“一帝一路”合作中两国的贸易量情况,随机抽查了100天进口贸易量与出口贸

易量(单位:亿人民币/天)得下表:

进口

[0,50](50,100](100,150]

出口

[0,50]32184

(50,100]6812

(100,150]3710

“2n(ad-be)2,,

附:K=----------------------------------,n=a+b+c+d.

(a+b)(c+d)(a+c)(b+d)

2

P(K>k)0.0500.0100.001

k3.8416.63510.828

(I)估计事件“我国与该国贸易中,一天的进口贸易量与出口贸易量均不超过100亿人民币''的概率;

(2)根据所给数据,完成下面的2x2列联表:

进口

(100,150]

出口

[0,100]

(100,150]

(3)根据(2)中的列联表,判断是否有99%的把握认为“我国与该国贸易中一天的进口贸易量与出口贸易量

有关?

【答案】⑴(2)列联表见解析;

(3)有99%的把握认为我国与该国贸易中一天的进口贸易量与出口贸易量有关.

【解析】(1)由表中,在100天中,进口贸易与出口贸易均不超过100的大数为32+18+6+8=64,

用频率估计概率,可得所求概率为〃=偿=日.

(2)列出2x2列联表如下:

进口

[0,100](100,150]

出口

[0,100]6416

(100,150]1010

(3)由⑵W^=100X(64X10-16X10)^7484>6635

80x20x74x26

所以有99%的把握认为我国与该国贸易中一天的进口贸易量与出口贸易量有关.

【典例2】(2023上•四川成都•高三四川省成都列五中学校考阶段练习)最近,纪录片《美国工厂》引起中

美观众热议,大家都认识到,大力发展制造业,是国家强盛的基础,而产业工人的年龄老化成为阻碍美国

制造业发展的障碍,中国应未雨绸缪.某工厂有35周岁以上(含35周岁)工人300名,35周岁以下工人200

名,为研究工人的口平均生产量是否与年龄有关.现采用分层抽样的方法,从中抽取了100名工人,先统计

了他们某月的日平均生产件数,然后按工人年龄在“35周岁以上(含35周岁)”和“35周岁以下”分为两组,

在将两组工人的日平均生产件数分成5组:[50,60),[60,70),[70.80),|80,90),190,100)分别加以统计,得到如图

所示的频率分布直方图.

35岁以下组35岁收卜.制

(a+b)(c+d)(a+c)(b+d)'

P(K1>k)0.15OJO0.050.0250.0100.005O.(X)I

k2.0722.7063.8415.0246.6357.87910.828

(l)从样本中日平均生产件数不足60件的工人中随机抽取2人,求至少抽到一名“35周岁以下.组”工人的

概率.

(2)规定日平均生产件数不少于80件者为“生产能手”,请你根据已知条件完成2x2的列联表,并判断是

否有95%的把握认为“生产能手与工人所在的年龄组有关“?

生产能手非生产能手合计

35岁以下

35岁以上

合计

7

【答案】(1)—:(2)列联表见解析,有把握.

【蟀析】(I)由已知得,样本中有35周岁以上组工人60名,35周岁以下组工人40名,

所以,样本中日平均生产件数不足60件的工人中,

35周岁以上组工人有60x0.05=3(人),记为A,4,4;

35周岁以下组工人有40x0.05=2(人),记为—,

从中随机抽取2名工人,所有可能的结果共有10种:

(A,A2),(A,4),(A,AJ,(A,8J,(A,8)(A2,8J,

(4,4),(怎4),(怎4),(4,人),

至少有一名“35周岁以下组”工人的可能结果共有7种:

(44),熊鸣),(人,4),(A.R),⑸耳),⑸区),(昂不),

故所求的概率:尸=(7.

(2)由频率分布直方图可知,在抽取的100名工人中,

“35周岁以上组”中的生产能手60x0.5=30(人),

“35周岁以下组”中的生产能手40x0.25=10(人),

据此可得2x2列联表如下:

生产能手非生产能手合计

35岁以下103040

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论