版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
项目四
商业数据的预处理目录01执行数据清洗02实施数据运算03其他预处理技术商业数据的预处理学习目标01知识目标•理解数据清洗在数据分析流程中的关键作用和重要性;•掌握数据清洗的概念,了解数据清洗的内容。布鲁姆层级:记忆·理解02技能目标•能够使用Excel、PowerBI、Python、AI等工具进行数据清洗;•能够根据需求灵活选择并应用各种数据处理操作;•能够设计高效的数据预处理流程,提高数据处理的效率和准确性。布鲁姆层级:应用·分析03素质目标•培养严谨的数据处理态度,重视数据的准确性和分析结果;•增强问题解决能力,客观分析并选择合适方法解决数据问题;•提升团队协作能力,学会与团队成员有效沟通,共同解决数据问题。素养导向:严谨·协作商业数据的预处理导入案例案例你是一名新加入“智汇分析”数据咨询公司的数据分析实习生,正站在职业生涯的起点,准备迎接新的挑战。公司最近承接了一个重要项目:为一家大型零售商提供销售数据分析服务。这家零售商期望通过深入的数据洞察,优化库存管理,提升销售业绩,从而在激烈的市场竞争中保持领先。然而,当你着手数据分析工作时,却发现原始数据存在诸多问题,如数据格式不统一、存在错误数据,以及部分数据缺失或需要进一步计算。这些问题严重影响了数据分析的准确性和可靠性,也让你深刻认识到:数据预处理是数据分析工作中至关重要、无法绕过的基础环节。任务一执行数据清洗执行数据清洗数据清洗的概念概念数据清洗是数据预处理的核心环节,指识别并纠正原始数据集中存在的错误、不一致、不完整或不相关部分的过程。其目的是提高数据质量,确保数据的准确性、完整性和一致性。数据清洗的质量直接影响到后续分析的准确性和有效性。执行数据清洗数据清洗的四项内容01删除重复数据技术故障、人为失误或系统集成会产生完全相同或高度相似的记录。通过算法或工具系统比对、识别并删除重复行,保证数据唯一性。02补充缺失数据记录错误、设备故障或传输中断会造成数据缺失。按数据特征用均值填充、插值法、前后值填充或参考其他数据源进行补充。03纠正错误数据数据集中可能有内容错误、格式不规范或逻辑矛盾。修正拼写、统一日期与数字格式、识别并处理数值异常,提升数据准确性与一致性。04数据格式化把数据转成适合分析的类型:日期字符串转日期型、分类数据编码为数值、标准化归一化消除量纲影响,保证一致性与可比性。删重复→唯一·补缺失→完整·纠错误→准确·格式化→可比任务二实施数据运算实施数据运算算术运算:五类函数SUM求和函数=SUM(数据区域)对指定区域数值求和,用于计算总销售额、总成本等汇总指标。1,581,900元AVERAGE平均值函数=AVERAGE(区域)计算区域数值的算术平均,用于客单价、平均成本等指标。8,794元/单COUNT计数函数=COUNT(区域)统计区域中数值单元格数量,用于订单量、客户数等计数。180笔MAX最大值函数=MAX(区域)返回区域最大数值,用于峰值订单、最高销售额等分析。17,632元MIN最小值函数=MIN(区域)返回区域最小数值,用于最低客单价、保底销售额等分析。视数据而定案例数据:共180笔订单,总销售额1,581,900元,平均每单8,794元,最大单笔17,632元(示意数据)实施数据运算逻辑运算:AND/OR/NOTAND与同时满足全部条件例:年龄>25且消费>1000→精确锁定高价值年轻客群Excel:=AND(条件1,条件2)集合运算:取交集A∩B适用:多条件精准筛选,缩小范围OR或满足任一条件即可例:微信支付或支付宝支付→圈出所有线上移动支付用户Excel:=OR(条件1,条件2)集合运算:取并集A∪B适用:多条件扩大筛选,覆盖更广NOT非排除不满足条件的数据例:排除已退款订单→只保留有效成交订单Excel:=NOT(条件)集合运算:取补集¬A适用:排除异常数据,净化样本三者组合可构造复杂筛选条件:AND缩范围·OR扩覆盖·NOT除异常,精准圈出分析所需数据子集任务三其他预处理技术其他预处理技术其他常用预处理操作转置行列互换:将宽表转为长表,或长表还原为宽表,适配不同分析视角。Table.Transpose透视与逆透视透视聚合汇总生成交叉表;逆透视将宽表还原为明细行,灵活切换。Pivot/Unpivot添加索引列为每行数据添加从0或1开始的唯一序号,便于追踪、排序和关联。AddIndex添加条件列按IF等逻辑规则基于现有列生成新分类列,如金额分级、区域标签。AddConditional追加合并查询追加:纵向堆叠同结构表;合并:按关键字横向关联多表,整合数据。Append/MergePowerQuery核心操作:转置重塑结构·透视聚合汇总·索引追踪行号·条件列衍生分类·追加合并整合多表其他预处理技术四种工具完成同一任务Excel入门友好:用函数(SUM/IF/VLOOKUP)和数据透视表完成清洗与运算,适合中小数据集快速上手。适用:小数据·快速分析PowerBI可视化强:清洗后直接拖拽生成商业仪表盘,边清洗边看效果,适合汇报型分析。适用:可视化·汇报展示Python灵活强大:用pandas库编写脚本,适合复杂规则、大数据量与可重复的自动化清洗流程。适用:大数据·自动化AI工具智能辅助:用自然语言描述需求,AI自动识别脏数据、推荐清洗规则,降低上手门槛。适用:零代码·智能辅助任务实施四个实战任务01数据清洗删重复值、补缺失值、处理错误数据、字段类型转换。用Excel、PowerBI、Python、AI四种工具完成。02数据运算用SUM/AVERAGE/COUNT/MAX/MIN五函数计算销售额,PowerBI度量值与卡片图展示。03逻辑运算用AND/OR自定义列筛选多条件订单,Excel与PowerBI双工具实操。04其他预处理PowerQuery五项操作:转置、透视逆透视、索引列、条件列、追加合并。实战一·数据清洗Excel·删除重复值1删除重复行打开1-数据清洗.xlsx,选中全部数据列,点数据→删除重复值。对话框中全选后确定,系统提示找到3个重复项,自动删除并保留唯一行。图4-1单击"删除重复值"按钮图4-3删除重复值实战一·数据清洗Excel·处理错误数据2补充缺失数据根据定位条件,查询是否有数据缺失。选择数据,执行“开始”→“查找与选择”→“定位条件”命令。在弹出的“定位条件”对话框里选择“空值”图4-4执行“定位条件”图4-5选择“空值”实战一·数据清洗Excel·补充缺失值2补充缺失数据选查找与选择→定位条件→空值,定位到2处缺失(转化率、加购率)。用公式转化率=支付人数/访客数计算填补。图4-7缺失值填补图4-6缺失值实战一·数据清洗Excel·处理错误数据3处理错误数据选开始→排序和筛选→筛选,逐列查看最大最小值。发现访客数最小为6,远低于其他数据,判断为异常值,标红后整行删除。图4-9通过筛选界面排查异常值图4-11标记异常值(2)实战一·数据清洗Excel·数据格式化4数据格式化日期列右键→设置单元格格式→日期;商品ID列转文本;比率指标转百分比,保留2位小数。图4-13设置单元格格式(1)图4-15设置单元格格式(3)实战一·数据清洗PowerBI·删重复与查空值1删除重复数据PowerBI获取数据→Excel工作簿→导入Sheet1→转换数据。Ctrl+A选中→删除重复项;点转化率筛选按钮查看null空值。图4-17导航器界面图4-19查看空值实战一·数据清洗PowerBI·自定义列补缺失2补充缺失数据点添加列→自定义列,输入公式转化率=支付人数/访客数,确定后生成无空值的正确转化率新列。图4-20添加自定义列图4-22"正确的转化率"数据列实战一·数据清洗PowerBI·数据类型转换3数据格式化转换选项卡点数据类型下拉,商品ID被自动识别为整数,改为文本类型,完成格式清洗。图4-23查看数据类型图4-24将"商品ID"数据类型更改为"文本"实战一·数据清洗Python·删除重复与补充缺失1删除重复数据可以使用pandas库的drop_duplicates函数来删除重复数据。该函数能够基于指定的列识别并删除重复的行。在商品销售数据表中,通常假设每行数据(即每一天的每种商品数据)都是唯一的,因此可以基于所有列来删除重复数据。importpandasaspd#加载数据df=pd.read_excel('商品销售数据-净数据.xlsx')#删除重复数据df_drop_duplicates=df.drop_duplicates()#保存清洗后的数据df_drop_duplicates.to_excel('商品销售数据-清洗后.xlsx',index=False)实战一·数据清洗Python·删除重复与补充缺失2补充缺失数据在处理缺失数据时,首先需要识别哪些字段存在缺失值,然后根据具体情况选择合适的填补策略,通常使用均值、中位数、众数或特定值来填补缺失值。假设使用均值填补销量和销售额的缺失值,而对其他字段则直接删除含有缺失值的行。importpandasaspd#检查缺失值missing_values=df.isnull().sum()print(missing_values)#填补销量和销售额的缺失值df['销量'].fillna(df['销量'].mean(),inplace=True)df['销售额(元)'].fillna(df['销售额(元)'].mean(),inplace=True)#删除其他含有缺失值的行df_filled=df.dropna()#保存清洗后的数据df_filled.to_excel('商品销售数据-清洗后-填补缺失.xlsx',index=False)实战一·数据清洗Python·纠正错误与格式化3处理错误数据错误数据通常需要根据业务逻辑和常识来判断。在此情况下,可以假设销量和销售额必须为正数,而转化率应在0到1的范围内。对于不符合这些条件的数据,可以选择修正或删除相关记录。#纠正错误数据defcorrect_data(row):ifrow['销量']<0:row['销量']=0ifrow['销售额(元)']<0:row['销售额(元)']=0ifrow['转化率']<0orrow['转化率']>1:row['转化率']=0#这里选择将记录修正为0,也可以选择删除记录returnrowdf_corrected=df.apply(correct_data,axis=1)#保存清洗后的数据df_corrected.to_excel('商品销售数据-清洗后-纠正错误.xlsx',index=False)实战一·数据清洗Python·纠正错误与格式化4数据格式化数据格式化通常涉及日期格式的统一以及数值型数据的格式转换等内容。在此情况下,假设日期字段已经是正确的格式,但需要确认销量和销售额是否为整数型数据,并在必要时将其转换为整数型数据。#数据格式化df['销量']=df['销量'].astype(int)df['销售额(元)']=df['销售额(元)'].astype(int)#保存清洗后的数据df_formatted.to_excel('商品销售数据-清洗后-格式化.xlsx',index=False)实战一·数据清洗使用AI进行数据清洗4使用AI进行数据清洗在数据清洗环节,AI正逐步展现出其强大的辅助能力。与仅依赖固定规则的传统处理方式相比,AI能够通过模式识别与智能算法,以更高的效率、更强的适应性和更智能的方式完成数据清洗任务。请对商品销售数据进行基础清洗。删除重复值:删除完全重复的行(所有列值均相同)转换数据格式:将“转化率”“收藏率”“加购率”等字段统一转换为百分比格式(如将0.0624转换为6.24%),并保留2位小数。检查异常值:若“访客数”为0但“支付人数”大于0,标记为异常;若“转化率”大于1(即超过100%),标记为异常。检查商品名称:检查并统一商品名称。检查关键字段空值:标记“销售额”“销量”等关键数值为空的行。请输出清洗后的表格,并简要说明处理结果实战二·数据运算Excel·SUM1SUM函数M2输入=SUM(数据区域)得2024年6月销售额合计1,581,900;图4-26SUM求和结果1581900实战二·数据运算Excel·AVERAGE2AVERAGE函数M2输入=AVERAGE(区域)得平均销售额8,794。图4-27AVERAGE均值8794实战二·数据运算Excel·COUNT3COUNT函数用=COUNT(区域)统计订单数180笔;图4-28使用COUNT函数计数实战二·数据运算Excel·MAX4MAX函数用=MAX(区域)求最高单日销售额17,632元。图4-29使用MAX函数求最大值实战二·数据运算PowerBI·销售额合计度量值1对数据求和数据视图→表工具→新建度量值,输入销售额合计=SUM(销售明细[销售额]),报表视图选卡片图拖入字段,显示1581900。图4-31输入公式图4-35销售额合计计算结果(1)实战二·数据运算PowerBI·均值2均值与计数创建平均销售额=AVERAGE(...)得8794;图4-37新建度量值"平均销售额"图4-39新建度量值"订单数量"实战二·数据运算PowerBI·均值与单数度量值3计数创建订单数量=COUNTROWS(...)得180,均用卡片图展示。图4-37新建度量值"平均销售额"图4-39新建度量值"订单数量"实战二·数据运算PowerBI·单笔最大销售额4最大值或最小值创建单笔最大销售额=MAX(...),卡片图显示17632。PowerBI中度量值基于列计算,区别于Excel逐格公式。图4-41新建度量值"最高销售额"图4-42显示最高销售额计算结果实战二·数据运算Python·NumPy统计运算1使用python进行算术运算通过NumPy库,可以轻松实现数据集的统计运算,包括总和、平均值、最大值、最小值、标准差(StandardDeviation)等关键指标的计算。对于一个数据集,可以使用NumPy库的sum函数计算总和,mean函数计算平均值,max函数和min函数分别获取最大值和最小值,std函数计算标准差,Python代码如下。importnumpyasnpimportpandasaspd#创建数据集data=[10,20,30,40,50]#使用NumPy库进行统计运算print("总和:",np.sum(data))#输出:150print("平均值:",np.mean(data))#输出:30.0print("最大值:",np.max(data))#输出:50print("最小值:",np.min(data))#输出:10print("标准差:",np.std(data))#输出:14.142...#使用pandas库进行统计运算df=pd.DataFrame({'values':data})print("pandas总和:",df['values'].sum())#输出:150print("pandas平均值:",df['values'].mean())#输出:30.0实战三·逻辑运算使用Excel进行与运算1与运算找收藏率和加购率都大于15%的订单。Excel用=AND(收藏率>15%,加购率>15%);图4-43使用Excel进行与运算实战三·逻辑运算使用PowerBI进行与运算1与运算在PowerBI添加自定义列输入AND条件,生成True/False标记列。图4-45生成的新数据列实战三·逻辑运算使用PowerBI逻辑运算·OR或2或运算在PowerQuery添加自定义列,用OR条件:收藏率>15%或加购率>15%,任一满足即标记。对比AND理解二者差异。图4-46添加自定义列"收藏率或加购率大于15%"图4-47生成的新数据列实战三·逻辑运算Python·逻辑运算与筛选1AND/OR条件筛选用&(AND)和|(OR)组合布尔条件,配合pandas布尔索引直接筛选符合条件的行,等价于Excel的AND/OR函数。importnumpyasnpimportpandasaspd#定义变量a=Trueb=Falsec=10d=20#与运算print("aandb的结果是:",aandb)#False,因为a和b中有一个为Falseprint("aandc的结果是:",aandc)#10,因为a和c都为真,返回最后一个真值#或运算print("aorb的结果是:",aorb)#True,因为a为Trueprint("borc的结果是:",borc)#10,因为b为False,返回c的值#非运算print("nota的结果是:",nota)#False,因为a为Trueprint("notb的结果是:",notb)#True,因为b为False#综合示例print("aandborc的结果是:",aandborc)#10,先计算aandb得到False,再与c进行或运算print("not(aandb)的结果是:",not(aandb))#True,先计算aandb得到False,再取反实战四·其他预处理Power
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 保险业务创新与发展考试题库
- 鹊桥仙(教学课件)-高中语文
- 招投标法考试试题及答案2026
- 2026年中央空调维修工中级制冷行业考核题库及答案
- 执业兽医资格考试水生动物类真题题库及答案
- 2026体育健康知识竞赛题库及参考答案
- 新型冠状病毒核酸检测培训考试试题附答案
- 2026年护理学手外科试题(附答案)
- 2026年机械安全考试题目及答案
- 2026年监理从业人员继续教育考核题库(含参考答案)
- 2026年国能源招聘笔试真题及答案
- 2026年新疆中考语文真题及答案解析
- GB/T 24134-2026橡胶和塑料软管静态条件下耐臭氧性能的评价
- 简析量子定位技术及应用前景
- 2026年中医内科医师高频面试题包含详细解答
- AQ3026-2026《化工企业设备检修作业安全规范》解读
- 2026年全国两会解读:基层治理能力提升
- 装配错装漏装考核制度
- 感染性心内膜炎课件
- 2025年绿色农业农业资源保护与利用研究报告
- 安全风险管控“六项机制”监理实施细则(水利工程)
评论
0/150
提交评论