版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
课程负责人:陈清华分布分析任务实施【数据挖掘应用】课程碳排放数据分析知识与能力目标会结合groupby()、cut()对碳排放数据进行分布分析会区分分组分析与分布分析的异同会选择使用适当的图表表达数据会使用Seaborn可视化包展现数据对碳排放数据进行分布分析主要内容任务工单引导问题任务评价标准任务解决方案代码解析tpf.xlsx教学难点分布分析法又称直方图法,是将搜集到的数据进行分组整理,绘制成频数分布直方图。本项目tpf.xlsx文件碳排放数据中,分组依据可以是年份、行业、能源等。任务概述
任务描述:现需基于获得的数据,我们可使用cut()对数据进行分组,再通过groupby()对分组的数据进行聚合统计010010011001101010100100110110100101110101000100001011011101001010101101010011010010numyearitemRawCoalCleanedCoal...Scope1Total11997Farming,Forestry,AnimalHusbandry,FisheryandWaterConservancy30.897729120.416359042
74.3789848421997CoalMiningandDressing32.958534775.252869261
44.3459333231997PetroleumandNaturalGasExtraction5.2746735910.000619491
36.9702250641997FerrousMetalsMiningandDressing0.8354291580.002890957
3.81144775537889任务工单数据源tpf.xlsx显示结果
任务要求任务概述按年份按原媒
占比(1)什么是分布分析?分布分析和分组分析有何区别?(2)Pandas包中的cut()主要用来做什么?包含哪些参数?(3)Pandas包中的groupby()如何利用cut()得到的分组结果进行统计?(4)Seaborn包主要用来做什么?Matplotlib以及Seaborn包中什么方法可以用来绘制直方图?(5)如何使用distplot()编码绘制频数分布直方图?主要参数有哪些?”
问题引导:任务概述
任务评价:任务概述评价内容评价要点分值分数评定自我评价1.任务实施按年份分布分析2分能对年份进行正确分组得1分,能基于分组结果正确统计碳排放数据得1分
按原煤排放占比分布分析4分能正确求得原煤占比得2分,能对占比进行正确分组得1分,能基于分组结果正确统计碳排放数据得1分
2.结果展现数据可视化显示3分能展现重点分析对象得1分,能展现不同占比分析结果得2分
3.任务总结依据任务实施情况总结结论1分总结内容切中本任务的重点要点得1分
合计10分
第1行:按year列分组并且算出他们的平均值第2行:把之前从表格中取出得df_detail_year列重置索引df_detail_year=df_detail.groupby(['year']).mean()df_detail_year=pd.DataFrame(df_detail_year).reset_index()year_groups=pd.cut(df_detail_year['year'],bins=[1995,2000,2005,2010,2015,2020])第3行:每五年为一组任务解决方案步骤一:按年份实现天然气平均碳排放分布分析。NaturalGas_year=df_detail_year.groupby(year_groups)['NaturalGas'].mean()第4行:按时期分组,求出平均值任务解决方案数据显示第6行:显示数据NaturalGas_year.head()第5行:重置索引NaturalGas_year=pd.DataFrame(NaturalGas_year).reset_index()步骤一:按年份实现天然气平均碳排放分布分析。任务解决方案NaturalGas_year.plot(x='year',y='NaturalGas',kind='bar',figsize=(6,6),width=1,label='NaturalGas')步骤二:为更晰地展现分析结果,我们使用柱状图表达数据plt.xlabel('Period’)plt.ylabel('CO2/Mt')第7行:创建一个大小为(6,6)的柱状图,宽为1,x轴为year列,y轴为‘NaturalGas‘列,图例是'NaturalGas'第1行:以year列进行分组并计算出他们的总数第2行:重置索引df_detail_sum=df_detail.groupby(['year']).sum()df_detail_sum=pd.DataFrame(df_detail_sum).reset_index()df_detail_sum['RawCoalPercent']=df_detail_sum['RawCoal']*100/df_detail_sum['Scope1Total']任务解决方案第4行:每数据集中特征进行分组,对50%-70%的数据进行细分percent_groups=pd.cut(df_detail_sum['RawCoalPercent'],bins=[0,40,50,55,60,65,70,100])步骤三:按原煤碳排放占比进行分组,实现占比计数分布分析第3行:占比百分比任务解决方案percentRawCoal=df_detail_sum.groupby(percent_groups)['year'].count()第6行:显示数据数据显示percentRawCoal.head()步骤三:按原煤碳排放占比进行分组,实现占比计数分布分析第1行:导入seaborn包,命名为snsimportseabornassns任务解决方案第3行:x轴命名为‘CO2/%’sns.distplot(df_detail_sum['RawCoalPercent'],
bins=[0,40,50,55,60,65,70,100])plt.xlabel('CO2/%')步骤五:为更晰地展现分析结果,使用Seaborn中distplot()来汇制分布图以表达数据任务解决方案
练一练:按行业分析碳排放量分布,分析天然气平均碳排放量在各行业的分布情况。(1)统计各行业年平均碳排放情况df_detail_item=df_detail.groupby(['item']).mean()df_detail_item=pd.DataFrame(df_detail_item).reset_index()(2)统计天然气平均碳排放量在不同行业的分布情况gas_groups=pd.cut(df_detail_item['NaturalGas'],bins=[0,1,2,4,6,8])naturalGas=df_detail_item.groupby(gas_groups)['year'].count()任务解决方案(3)可视化显示天然气平均碳排放量分布情况sns.distplot(df_detail_it
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 穿经工冲突解决能力考核试卷含答案
- 轴承零件制造工安全文明水平考核试卷含答案
- 科研助理工作技能评优考核试卷含答案
- 中药炮炙工岗中安全规程考核试卷含答案
- 戏鞋工安全防护评优考核试卷含答案
- 鱼糜制作工岗前责任意识考核试卷含答案
- 生物农药生产工操作知识模拟考核试卷含答案
- 信号设备制造钳工创新方法知识考核试卷含答案
- 2026年山东医疗卫生事业单位招聘(医学影像技术)备考试题库资料含答案
- 2026年事业单位社会科学专技B类综合应用能力高分模拟试卷
- 老年人白内障课件
- 酒店总经理转正述职报告
- 2026中国移动校园招聘备考考试题库附答案解析
- 2025年陪诊师考试题库(附答案)
- 三一研发项目管理办法
- 运营商反诈知识培训课件
- 北大印章管理办法
- 前列腺癌护理个案查房
- 患者自行拔出尿管护理不良事件
- 高三化学一轮复习-配合物 课件
- 2024江苏南京证券校园招聘129人高频500题难、易错点模拟试题附带答案详解
评论
0/150
提交评论