数据采集与处理-复习思考题与答案-6-统计与概率基础_第1页
数据采集与处理-复习思考题与答案-6-统计与概率基础_第2页
数据采集与处理-复习思考题与答案-6-统计与概率基础_第3页
数据采集与处理-复习思考题与答案-6-统计与概率基础_第4页
全文预览已结束

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《数据采集与处理:基于Python》复习思考题、习题与答案

第六章统计与概率基础

1、DataFrame对象的describe函数,对于数值型数据,其描述性统计项一般

有哪些?而对千字符串或类别类型的数据,其描述性统计项有何不同?

答案:

DataFrame对象的describe函数,对于数值型数据,其描述性统计学一般包

括:样本个数count,均值mean,标准差std,最小值min,最大值max,百分

位数25%、50%和75%等;对于字符串或类别类型的数据,其描述性统计项包括

样本个数count、去除重复值个数unique、出现最多字符串top、频数freq

等。受限于字符串或类别的数据类型,其描述性统计没有均值、标准差等。

2、什么是均值、中值和众数?它们在描述数据总体特征方面有何优缺点?

答案:

1.均值,也称为平均数,是统计学中最常用的统计量,用来表明数据中各

观测值相对集中较多的中心位置,是用于反映现象总体的一般水平,或

分布的集中趋势。在统计中算术平均数常用于表示统计对象的一般水

平,它是描述数据集中位置的一个统计量。

2.中值又称中位数,是指将统计总体当中的各个变量值按大小顺序排列起

来,形成一个数列,处于变量数列中间位置的变量值就称为中位数。

3.众数(Mode)是指在统计分布上具有明显集中趋势点的数值,代表数据

的一般水平。也是一组数据中出现次数最多的数值,有时众数在一组数

中有好几个°

比较:

平均数非常明显的优点之一是,它能够利用所有数据的特征,而且计算容易。

另外,在数学上,平均数是使误差平方和达到最小的统计量,也就是说利用平

均数代表数据,可以使二次损失最小。因此,平均数在数学中是一个常用的统

计量。但是平均数也有不足之处,正是因为它利用了所有数据的信息,平均数

容易受极端数据的影响c

中位数和众数这两个统计量的特点都是能够避免吸端数据,但缺点是没有完全

利用数据所反映出来的信息。由于各个统计量有各自的特征,所以需要我们根

据实际问题来选择合适的统计量。

3、协方差与相关性有何关系?试比较两者的计算公式

答案:

协方差和相关性都用来度量两个变量一起变化的程度。

协方差(Covariance)在概率论和统计学中用于衡量两个变量的总体误差。如

果两个变量的变化趋势一致,也就是说如果其中一个大于自身的期望值,另外

一个也大于自身的期望值,那么两个变量之间的协方差就是正值。如果两个变

量的变化趋势相反,即其中一个大于自身的期望值,另外一个却小于自身的期

望值,那么两个变量之间的协方差就是负值。

相关性,是指两个变量的美联程度。一般地,从散点图上可以观察到两个变量

有以下三种关系之一:两变量正相关、负相关、不相关。如果一个变量高的值

对应于另一个变量高的值,相似地,低的值对应低的值,那么这两个变量正相

关。反之,如果一个变量高的值对应于另一个变量低的值,那么这两个变量负

相关。如果两个变量间没有关系,即一个变量的变化对另一变量没有明显影

响,那么这两个变量不相关。

下面分别是协方差和相关性公式,从公式可以看出,相关性是两个变量的协方

差除以各自变量的标准差:

CW〉)=;£:=]a♦-%)(»-即)

cot)(X.Y)

corr(x,y)=

4、什么是中心极限定理?举例说明

答案:

中心极限定理,是指概率论中讨论随机变量序列部分和分布渐近于正态分布的

一类定理。这组定理是数理统计学和误差分析的理论基础,指出了大量随机变

量近似服从正态分布的条件。例如;在自然界与土产中,一些现象受到许多相

互独立的随机因素的影响,如果每个因素所产生的影响都很微小时,总的影响

可以看作是服从正态分布的。最早的中心极限定理是讨论重点,伯努利试验

中,事件A出现的次数渐近于正态分布的问题。

5、什么是伯努利分布和二项分布,两者有何联系?

答案:

伯努利分布是以JacobBernoulli命名的,它是一个随机变量的概率分布,其

中成功(值为1)的概套为p,并且失败(值为0)的概率q=y-p.

而带有参数n和p的二项分布是n个伯努利随机变量汇总结果的离散概率分布。

解析:

6、什么是泊松分布?举例说明。

答案:

泊松分布是一种统计与概率学里常见到的离散机率分布(discrete

probabilitydistribution)0泊松分布是以18—19世纪的法国数学家西莫

恩•德尼•泊松(Simeon-DenisPoisson)命名的,他在1838年时发表,主要

用于估计某个时间段某事件发生的概率。

例子:航空公司预定票处单位时间内接听电话的概率

7、什么是概率质量函数和概率密度函数,分别用于哪类变量的概率分布?

答案:

概率质量函数(probabi1itymassfunction,简写为pmf)是离散随机变量在

各特定取值上的概率。

连续型随机变量的概率密度函数(在不至于混淆时可以简称为密度函数)是一

个描述这个随机变量的输出值,在某个确定的取值点附近的可能性的函数。而

随机变量的取值落在某个区域之内的概率则为概率密度函数在这个区域上的积

分。

概率质量函数和概率密度函数不同之处在于:概率质量函数是对离散随机变量

定义的,本身代表该值的概率;概率密度函数是对连续随机变量定义的,本身

不是概率,只有对连续随机变量的概率密度函数在某区间内进行积分后才是概

8、什么是偏度与峰度,有何作用?

答案:

偏度(skewness),是统计数据分布偏斜方向和程度的度量,是统计数据分布

非对称程度的数字特征。偏度(Skewness)亦称偏态、偏态系数。

峰度(peakedness;kurtosis)又称峰态系数。表征概率密度分布曲线在平均值

处峰值高低的特征数。峰度反映了峰部的尖度。样本的峰度是和正态分布相比

较而言统计量,如果峰度大于3,峰的形状比较父,比正态分布峰要陡峭。反

之亦然。

9、Python都有哪些模块和方法,提供了基本的随机离散变量和连续变量数据

样本生成和概率分布函数?

答案:

scipy模块有部分提供,如s

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论