版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
,引用模块,函数/属性名,实例,说明
,importpandasaspd,,,
,1)pandas数据结构,,,
,,Series(),"obj1=Series([4,7,5,3],index=['d','b','a','c'])#创建带索引的Series
states=['California','Ohio','Oregon']#使用字典创建Series
obj3=Series(sdata,index=states)",创建Series
,,Series(),,
,,DataFrame(),"frame2=([[1,2,3,],[4,5,6]],index=['x','y'],columns=['a','b','c'])",创建DataFrame
,基于索引名选取,obj[col],,选取某列
,,obj[colList],"students[['height','weight']]",选取某几列
,,"obj.loc[index,col]",,选取某行某列
,,"obj.loc[indexList,colList]",,选取多行多列
,基于位置序号选取,"obj.iloc[iloc,cloc]",,选取某行某列
,,"obj.iloc[ilocList,clocList]",,选取多行多列
,,"obj.iloc[a:b,c:d]","students.iloc[1:,0:2]","选取a~(b-1)行,c~(d-1)列"
,条件筛选,"obj.loc[condition,colList]","students.loc[students['height']>=168,['height','weight']]",使用索引构造条件表达式,选取满足条件的行
,,"obj.iloc[condition,clocList]",,使用位置序号构造条件表达式,选取满足条件的行
,,obj[colname]=list,"students['expense']=[1500,1600,1200]",添加新列
,,"obj.drop(collist,axis,inplace,...)","students.drop(1,axis=0)
students.drop('expense',axis=1)",删除某几列
,2)数据文件读写,,,
,,pd.read_csv(),pd.read_csv('1111.csv'),"读取CSV文件数据(带分隔符的数据,默认为逗号)"
,,object.to_csv(),"ts=Series(np.arange(7),index=dates)
ts.to_csv('ch06/tseries.csv')",将DataFrame或Series中的数据写到一个以逗号分隔的文件中
,,pd.read_excel(),"pd.read_excal('a.xlsx','Group1')",从excel文件的指定表单中读取数据
,参数,sep,sep=‘,’,字符串,每行各数据之间的分隔符
,,header,header=None,文件中第一行不是列索引,默认第一行为列索引
,,index_col,index_col=0,用作行索引的列序号
,,names,names=['学号',‘成绩’],列表,定义列索引,如果不使用文件中第一行为列索引
,,skiprows,"pd.read_csv('ch06/ex4.csv',skiprows=[0,2,3])#跳过文件的第一行、第三行和第四行",跳过文件中的某些行
,,na_values,"pd.read_csv('ch06/ex5.csv',na_values=['NULL'])",可以接受一组用于表示缺失值的字符串
,,nrows,"pd.read_csv('ch06/ex6.csv',nrows=5)#nrows=5表示读取前5行",逐行读取文本文件
,,delimiter,"reader=csv.reader(f,delimiter='|')","用于分隔字段的单字符字符串。默认','"
,3)数据清洗,,,
,,dataframe.dropna(),data1.dropna(thresh=3)#thresh代表保留几个有效值,滤除缺失数据
,,"dataframe.fillna(value,method,inplace,...)","df1.fillna(0)
stu.fillna({'年龄':20,'体重':stu['体重'].mean()})
method='ffill'method='bfill'",填充缺失数据
,,dataframe.drop_duplicates(),df1.drop_duplicates(),去除重复数据
,,dataframe.isnull(),stu.isnull(),检测每个元素值是否是NaN
,,dataframe.any(),stu.isnull().any(),按行或列检测是否有值为Flase
,4)数据规整化,,,
,,pd.concat(),"pd.concat([s1,s2,s3])#默认情况下,concat按照行叠加",轴向连接函数,沿着指定轴将多个对象堆叠到一起
,,pd.merge(),"pd.merge(newstu,card,how='left',left_on='学号',right_on='ID')",按照给定列连接两张表中数据
,,dataframe.sort_values(),"stu.sort_values(by='成绩',ascending=False)",按照给定列排序
,,dataframe.rank(),"stu['成绩'].rank(method='min',ascending=False)",按照指定轴给出每个数据排名
,5)统计分析,,,
,,sr.value_counts(),,Series各取值出现的频数
,,sr.unique(),,Series出现的值
,,sr.describe(),"stu[['身高','体重','成绩']].describe()",返回基本统计量和分位数
,,sr1.corr(sr2),stu['身高'].corr(stu['体重']),sr1与sr2的相关系数
,,df.corr(),"stu[['身高','体重','成绩']].corr()",df各列的相关系数
,,df.count(),,统计每列数据个数
,,df.max()、df.min(),,最大值和最小值
,,df.idxmax()、df.idxmin(),,最大值、最小值对应的索引
,,df.sum(),,按行或列求和
,,df.mean()、df.median(),stu['成绩'].mean(),计算均值、中位数
,,df.qantile(),"tu['月生活费'].quantile([.25,.75])",计算给定的四分位数
,,df.var()、df.std(),,计算方差、标准差
,,df.mode(),,计算众数
,,df.cumsum(),,从0开始向前累加各元素
,,df.cov(),"stu[['身高','体重','成绩']].corr()",计算协方差矩阵
,,"pd.crosstab(df[col1],df[col2])","pd.crosstab(stu['性别'],stu['月生活费'])",pandas函数,交叉表,计算分组的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年广西河池市环江县洛阳镇红阳社区工作人员考试模拟试题及答案
- 《未成年人保护法》知识竞赛试题及答案
- 数据分析经理数据洞察考核表
- 协调物流运输计划商洽(6篇)
- 幼儿园伙食管理细则
- 幼儿园变质食品处置细则
- 幼儿园安全应急物资管理责任书
- 学校“万师访万家”活动工作方案
- 学校精细化管理实施方案编辑
- 团结友爱共创和谐班级小学主题班对课件
- 2025年江苏省无锡市梁溪区侨谊教育集团小升初数学招生试卷(含答案解析)
- 行政人事自我介绍
- 博雷顿产品介绍
- 四川水电集团招聘岗位综合能力测试客观题题库
- 支气管哮喘急性发作的紧急救护技巧
- 2026年光伏产业集团财务总监面试题及答案解析
- 煤矿职业病危害培训课件
- 2025年南充市农业科学院第二批引进高层次人才公开考核公开招聘笔试历年典型考题(历年真题考点)解题思路附带答案详解
- 【耳鼻喉9版】绪论和耳科学第七章 中耳炎性疾病
- 创伤性肾破裂的护理课件
- 安装断桥窗合同范本
评论
0/150
提交评论