版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
《Python商务数据分析与应用》AI实训指导手册第1页配套教材·AIGC版·微课版《Python商务数据分析与应用》AI实训指导手册10大项目·20个入门级实训·Python+DeepSeek双引擎驱动配套教材陈佳、田晓丽、李光旭、谭慧敏编著《Python商务数据分析与应用》(AIGC版微课版),人民邮电出版社实训总数20个(教材10章,每章2个实训)建议学时每实训2学时,共40学时(可按方向选做12个)难度定位零基础入门,Python+AI双工具,边学边做核心工具Python(JupyterNotebook)、DeepSeek、NumPy、pandas、Matplotlib内容时效案例与数据更新至2026年,紧贴电商、社交、直播、短视频四大场景使用说明:带✎标记的记录栏请在电脑上直接填写;灰底框内的提示词可直接复制到DeepSeek或Python环境中使用。
一、使用说明给老师·每个实训建议2学时,20个实训共40学时,可按专业方向选做12个。·每个实训已配好百分制评价量表,可直接用于平时成绩评定。·"拓展挑战"可作为分层教学任务,给学有余力的学生加练。·教材原有章末实训可作课前导入,本手册作为课中实操主线。·前3章(Python基础)可视学生基础选做;第4-10章为商务数据分析核心内容。给学生·每个实训4步,跟着做就行,提示词可以直接复制使用。·看到✎记录栏就写下来,那是你作业的一部分。·AI给的代码一定要自己跑一遍。不跑的代码,老师一眼就看得出。·DeepSeek生成的算法代码需在Python环境中二次验证与适配调试。·所有关键数据、案例信息,发布前必须自己核实。工具准备·课前安装Python3.10+(推荐Anaconda),配置JupyterNotebook环境。·注册DeepSeek(),免费额度足够课堂使用。·安装所需库:pipinstallnumpypandasmatplotlibscikit-learn。·下载教材配套数据集(UserBehavior.csv、raw_sample.csv等),放在固定目录。·免费额度有限,先想清楚再提问,避免浪费。
二、AI工具速查表工具最擅长入口费用一句话说明DeepSeek代码生成/分析/建模免费逻辑强,能写Python代码、建模型、做数据分析。本手册默认主力AI工具。Python编程/数据分析本地安装免费数据分析核心工具,配合NumPy、pandas、Matplotlib进行数据处理与可视化。JupyterNotebook交互式编程Anaconda自带免费边写代码边看结果,数据分析标配环境。推荐VSCode中打开。NumPy数值计算pipinstall免费强大的多维数组对象,擅长科学计算和矩阵运算。pandas数据处理pipinstall免费灵活高效的数据结构,读写CSV/Excel、数据清洗、分组聚合首选工具。Matplotlib数据可视化pipinstall免费折线图、柱状图、饼图、散点图、热力图,让数据"看得见"。scikit-learn机器学习pipinstall免费k-means聚类、随机森林、决策树等算法库,第6-10章核心依赖。Kimi长文档阅读免费额度擅长读长材料、整理资料,适合做行业研究和数据背景调研。豆包文案/日常免费中文语感好,适合写数据分析报告的文字部分。WPSAI表格/文档WPS内免费额度写公式、做图表,配合Python导出的数据做汇报材料。
三、提示词「点菜五问」法同样一个AI,有人用起来像神器,有人用起来像百度。差别就在会不会"点菜"。五问为什么重要举例1.你是谁(角色)先给AI一个身份,它才知道用什么语气、什么专业度回答。"你是一位有5年经验的电商数据分析师"2.做什么(任务)动词要具体:不是"帮我分析数据",而是"用pandas读取CSV并计算每日UV"。"请用pandas读取sales.csv,按日期分组计算日均销售额"3.给谁用(受众)说清使用者是谁,AI才知道代码注释写到什么程度、结论用什么表达。"我是Python零基础的大一学生,代码请加详细注释"4.有啥讲究(约束)约束是提示词的灵魂。给数据路径、给库版本、给输出格式。"用matplotlib画折线图,横轴为日期,纵轴为销售额,图表要有标题和图例"5.要啥格式(输出)指明格式,结果才能直接用。"输出完整Python代码+3条关键结论,用Markdown格式"对比:同样的事,两种问法✗普通问法:帮我分析一下销售数据。→结果:一堆"数据驱动决策"的套话,一段代码都跑不起来。✓五问问法:你是有5年经验的电商数据分析师(角色),请用pandas读取UserBehavior.csv(任务),我是Python零基础的大一学生(受众),数据在当前目录、用matplotlib画图、代码要加注释(约束),输出完整Python代码+3条关键结论(格式)。→结果:能直接在Jupyter里跑的代码+能写进报告的结论。
四、合规红线(必读)红线具体要求AI生成内容必须标识《人工智能生成合成内容标识办法》自2025年9月1日施行。AI生成的代码、分析报告、图表需按规定添加标识。不得恶意删除、篡改、伪造、隐匿标识。数据隐私保护使用用户行为数据集进行分析时,不得泄露个人隐私信息(姓名、手机号、地址等)。脱敏后再使用,遵守《中华人民共和国个人信息保护法》。禁止数据造假不得编造、篡改分析结果。数据可视化不得利用误导性坐标轴、截断轴等方式夸大或歪曲事实。AI会编数据,发布前必须核实DeepSeek生成代码时可能使用不存在的函数或参数。所有代码必须在Python环境中实际运行验证,确保代码可靠性。注意版权与知识产权不要在分析报告中直接搬运他人图表、数据结论;引用公开数据集需注明来源;教材配套数据集仅限教学使用。学术诚信不得直接提交AI生成的完整代码或报告作为作业。必须理解代码逻辑、修改关键参数、用自己的语言撰写结论。
第1章Python基础知识打好地基:Python入门与数据结构|从"不会写代码"到"能跑第一段Python程序"。先用AI把概念吃透,再动手写代码。实训1-1从零开始:让DeepSeek当你的Python私教建议学时:2学时难度:入门使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:1-1【实训情境】开学第一周,老师说"这学期要用Python做商务数据分析"。你打开电脑,连Python装在哪都不知道。别慌——先让AI当你的私教,10分钟讲明白Python到底是啥、能干啥,再亲手跑出第一段代码。【学习目标】□能说出Python的三大特点(简洁、开源、跨平台)和其在商务数据分析中的优势□能区分列表、元组、字典、集合四种数据结构,并说出各自适用场景□在JupyterNotebook中运行第一段Python代码,理解代码执行的基本逻辑【成果交付】□一页纸《Python数据结构速查卡》(含四种结构的特点、增删改查语法)□在JupyterNotebook中运行的2段代码截图(列表操作、字典操作)【操作步骤】步骤1:让AI用大白话讲Python基础做什么:打开DeepSeek(),把下面这段提示词复制进去发送。注意:不要只问"什么是Python",那样AI只会给你一段百科式的废话。▍提示词(可直接复制到AI工具)你是我的Python入门教练。请用大学一年级学生能理解的通俗语言,向我介绍以下内容:1.Python是什么?为什么数据分析要用它而不是Excel?(不超过3句话)2.Python的四大数据结构:列表、元组、字典、集合,分别用"装东西"的生活类比解释(比如列表像书架、字典像通讯录)3.每种数据结构给一个商务场景的例子(如:用列表存商品名称、用字典存商品详情)4.新手最容易搞混的1个概念最后用表格汇总四种数据结构的特点。提示:如果某一项内容不清楚,可以继续提问:"第2条没看懂,能用超市购物车举例子吗?"——追问是AI对话最重要的能力。✎把AI输出的表格截图或复制到下方,圈出你觉得最有用的2种数据结构。步骤2:动手跑第一段Python代码做什么:打开JupyterNotebook(或VSCode中的Jupyter),新建一个Notebook,把下面的代码敲进去运行。注意:不要复制粘贴,建议手动输入代码,以熟悉代码结构和基本语法。▍提示词(可直接复制到AI工具)#=====在JupyterNotebook中运行以下代码=====#1.创建一个商品列表products=["iPhone16","华为Mate70","小米15","OPPOFindX8"]print("商品列表:",products)#2.给列表添加一个商品products.append("vivoX100")print("添加后:",products)#3.删除一个商品products.remove("小米15")print("删除后:",products)#4.列表长度(商品数量)print("商品总数:",len(products))提示:如果报错NameError,说明你把products拼错了——Python区分大小写。把报错信息直接贴给DeepSeek,它能帮你定位问题。✎把运行结果截图贴在记录栏,并写下:列表的append()是____(添加/删除)操作。步骤3:用字典管理商品详情做什么:列表只存了名字,但商品有价格、库存、分类等信息——这时候就需要字典了。用键值对把商品信息组织起来。▍提示词(可直接复制到AI工具)#=====用字典管理一个商品的完整信息=====#创建一个商品字典product={"name":"iPhone16","price":5999,"stock":150,"category":"手机数码"}#访问商品价格print("商品名称:",product["name"])print("商品价格:",product["price"],"元")#修改价格(打个折)product["price"]=5499print("折后价格:",product["price"],"元")#添加新字段product["discount"]="9折"print("完整商品信息:",product)提示:字典用花括号{},列表用方括号[],元组用圆括号()——理解不同括号的使用场景,并请AI协助总结记忆方法。✎写下你的理解:字典和列表最大的区别是____。步骤4:用AI检验你的学习成果做什么:学完基础概念后,反过来让AI考你。通过问答可以检验知识的掌握情况,无法回答的内容应作为后续复习的重点。▍提示词(可直接复制到AI工具)请你扮演Python考官,问我5道关于Python数据结构的选择题或填空题,难度是大学入门级。每道题等我回答后再公布答案和解析。要求:1.题目要贴近商务数据分析的实际场景(如商品管理、订单处理)2.覆盖列表、元组、字典、集合四种数据结构3.每题答完给1句"这个知识点在第X章会用到"的提示提示:答错后应继续分析原因——追问"为什么选B不选A",理解比做对更重要。✎记录你的答题情况:5题中答对____题,最需要复习的知识点是____。【避坑指南】⚠避免只阅读不实践。Python是工具,工具只有用了才会。哪怕代码只有3行,也要自己敲一遍。⚠AI生成的代码可能用了不存在的函数或参数,因此所有代码必须在Jupyter中实际运行验证。⚠不要整段复制AI的代码当作业,老师一眼就能看出来,能够理解代码逻辑,并根据任务要求独立修改和验证才是真本事。⚠Python对缩进有严格要求(4个空格),复制代码时注意保持缩进一致,否则会报IndentationError。【评价量表】评价维度评价标准分值速查卡完整度四种数据结构齐全,特点描述准确,有生活类比30代码运行3段代码均在Jupyter中成功运行,截图清晰30理解深度能用自己的话解释列表与字典的区别,答题正确率60%以上25实训记录记录栏填写完整、字迹/排版清晰15合计自评____分互评____分教师评分____分100【拓展挑战】用列表和字典组合,创建一个包含3个商品信息的"迷你商品库",实现"按名称查找商品并打印价格"的功能。用DeepSeek辅助但代码自己写。实训1-2数据结构实战:用列表、字典和函数搭建一个小型商品管理系统建议学时:2学时难度:入门使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:1-2【实训情境】学校创业园的"校园小铺"需要管理10多种商品。老板(你的同学)说:"能否开发一个具备商品查询、添加和价格修改功能的程序?"这节课就用Python的列表、字典、函数和异常处理,做一个能用的迷你商品管理系统。【学习目标】□能综合运用列表、字典和函数,实现数据的增删改查□理解函数的参数传递和变量的作用域□掌握try-except异常处理,让程序在遇到错误时不崩溃【成果交付】□一个在Jupyter中能运行的小型商品管理系统(含增删改查4个函数)□至少3次操作记录的运行截图(查商品、改价格、异常处理)【操作步骤】步骤1:用列表和字典搭好数据底座做什么:在使用AI前,先明确商品信息及数据结构设计,再编写代码。▍提示词(可直接复制到AI工具)#=====搭建商品库的数据结构=====#用列表存储多个商品字典products=[{"id":1,"name":"笔记本","price":15.0,"stock":50},{"id":2,"name":"签字笔","price":5.0,"stock":200},{"id":3,"name":"文件夹","price":8.0,"stock":80}]#打印所有商品forpinproducts:print(f"编号:{p['id']}名称:{p['name']}价格:{p['price']}元库存:{p['stock']}")提示:f-string(格式化字符串)是Python3.6+的功能,用f""包裹,变量用{}嵌入。比用+拼接字符串方便得多。✎把运行结果贴在记录栏。想想:如果要存100个商品,这样写合理吗?步骤2:写函数实现"查商品"做什么:把"查商品"封装成函数。函数的好处是:写一次,到处用。▍提示词(可直接复制到AI工具)#=====查商品函数=====defsearch_product(product_list,keyword):"""按名称关键字搜索商品"""results=[]forpinproduct_list:ifkeywordinp["name"]:results.append(p)returnresults#测试:搜"笔"found=search_product(products,"笔")print(f"搜索'笔'找到{len(found)}个商品:")forpinfound:print(f"{p['name']}-{p['price']}元")提示:函数名用小写+下划线(如search_product),这是Python的命名规范。让AI检查你的命名是否规范。✎记录函数的三个要素:函数名____、参数____、返回值____。步骤3:加异常处理——让程序"不崩溃"做什么:用户可能输错商品编号,程序不能直接崩。用try-except捕获异常,给出友好提示。▍提示词(可直接复制到AI工具)#=====带异常处理的修改价格函数=====defupdate_price(product_list,product_id,new_price):"""按编号修改商品价格,带异常处理"""try:new_price=float(new_price)ifnew_price<0:return"价格不能为负数"forpinproduct_list:ifp["id"]==product_id:old_price=p["price"]p["price"]=new_pricereturnf"{p['name']}价格从{old_price}改为{new_price}元"returnf"未找到编号为{product_id}的商品"exceptValueError:return"请输入有效的数字"#测试正常情况print(update_price(products,1,12.0))#测试异常情况print(update_price(products,99,10.0))print(update_price(products,1,"abc"))提示:异常处理是Python的"安全气囊"。try里面放可能出错的代码,except里面放出错后的处理。这比让程序直接崩溃专业得多。✎记录三种测试结果,并写下:异常处理让你觉得最实用的场景是____。步骤4:让DeepSeek帮你加新功能做什么:现在系统有了查和改,还需实现“添加商品”和“删除商品”功能。让AI帮你写这两个函数,但你要理解每一行代码。▍提示词(可直接复制到AI工具)我已经写好了以下商品管理系统的两个函数(search_product和update_price),请你帮我再写两个函数:1.add_product(product_list,name,price,stock):添加新商品,自动分配编号2.delete_product(product_list,product_id):按编号删除商品要求:-代码风格和已有函数保持一致-都带异常处理-加详细中文注释-给出测试代码已有代码结构:products是一个列表,每个元素是字典,含id/name/price/stock四个键。提示:AI给的代码一定要在Jupyter中跑一遍。如果报错,把完整报错信息贴给AI,让它修复。改过的代码才真正属于你。✎把最终运行成功的4个函数代码和测试截图贴在记录栏。写下你觉得最有成就感的1个功能。【避坑指南】⚠函数的参数不要太多。超过5个参数说明你的函数职责太重了,该拆分。⚠全局变量和局部变量不要搞混。函数内部修改全局变量需要用global声明,但新手最好避免这种写法。⚠异常处理不是万能药。不要用try-except把所有错误都"吞掉",那样调试时根本找不到问题。⚠AI生成的函数可能命名不规范或参数顺序不合理。拿到代码后先读一遍再跑。【评价量表】评价维度评价标准分值系统完整度增删改查4个函数齐全,均能正常运行35异常处理对非法输入有友好提示,程序不崩溃25代码质量函数命名规范、有注释、逻辑清晰25实训记录运行截图完整、记录栏填写清晰15合计自评____分互评____分教师评分____分100【拓展挑战】给商品管理系统加一个"统计"功能:计算总库存价值(所有商品price×stock之和),并用f-string格式化输出。用DeepSeek辅助但代码自己写。第2章Python基础模块工具箱:math、random、datetime、re|Python自带的四大模块,帮你处理数值、随机、时间和文本。每个模块配一个商务场景练手。实训2-1数学计算与随机数:用math和random模拟一个促销抽奖活动建议学时:2学时难度:入门使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:2-1【实训情境】校园小铺要做期末促销,老板说:"满50元抽奖一次,奖品有笔记本、签字笔、文件夹。"怎么用Python算折扣、生成随机抽奖结果?这节课用math模块算利润、用random模块模拟抽奖。【学习目标】□能使用math模块进行基本的数学计算(取整、绝对值、幂运算)□能使用random模块生成随机数、随机选择和随机抽样□理解随机数在商务场景中的应用(抽奖、抽样调查)【成果交付】□一段完整的促销抽奖Python代码(含折扣计算+随机抽奖)□3次抽奖模拟结果的截图【操作步骤】步骤1:用math模块算折扣和利润做什么:先搞定"钱"的问题。用math模块的ceil(向上取整)、floor(向下取整)来处理折扣后的价格。▍提示词(可直接复制到AI工具)我是Python初学者。请用math模块写一段代码:1.原价88元的商品打8.5折,用math.ceil和math.floor分别计算折后价(观察差异)2.计算10件商品的总成本和总售价,用math.fsum精确求和3.用math.pow计算1.08的5次方(模拟年增长8%的5年后规模)要求:每行加中文注释,输出结果用print格式化。提示:为什么用math.fsum而不是sum?因为浮点数累加有精度误差,fsum更精确。让AI解释这个原理。✎记录math.ceil(74.8)和math.floor(74.8)的结果分别是____和____。步骤2:用random模块做抽奖做什么:折扣搞定了,该抽奖了。用random.choice从奖品列表中随机选一个奖品,用random.randint生成订单号。▍提示词(可直接复制到AI工具)#=====促销抽奖系统=====importrandom#奖品列表(含概率权重)prizes=[("特等奖:校园小铺100元代金券",1),#权重1("一等奖:签字笔一套",5),#权重5("二等奖:文件夹一个",10),#权重10("参与奖:谢谢参与",84)#权重84]#加权随机抽奖prize_names=[p[0]forpinprizes]weights=[p[1]forpinprizes]result=random.choices(prize_names,weights=weights,k=1)[0]print(f"抽奖结果:{result}")#生成随机订单号order_id=f"ORD{random.randint(100000,999999)}"print(f"订单号:{order_id}")#模拟抽奖10次,看分布results=[random.choices(prize_names,weights=weights,k=1)[0]for_inrange(10)]fori,rinenumerate(results):print(f"第{i+1}次:{r}")提示:random.choices(带s)是加权随机选择,random.choice(不带s)是等概率选择。促销抽奖有概率差异,要用choices。✎运行3次抽奖代码,记录每次结果。想想:10次抽奖里中了几个特等奖?和理论概率一致吗?步骤3:用datetime处理促销时间做什么:促销有开始时间和结束时间,用datetime模块计算活动持续天数、倒计时。▍提示词(可直接复制到AI工具)请用datetime模块写一段代码:1.设定促销开始时间为2026年11月1日10:00,结束时间为2026年11月11日23:592.计算促销持续多少天多少小时3.获取当前时间,计算距离促销结束还有多长时间(倒计时)4.用strftime把时间格式改为"2026-11-1123:59"的形式输出要求:加中文注释,结果用print格式化输出。提示:datetime是Python处理时间的核心模块。strftime是"stringformattime"(把时间格式化成字符串),strptime是"stringparsetime"(把字符串解析成时间)。✎记录促销持续天数为____天____小时。strftime和strptime的区别是____。步骤4:让DeepSeek帮你升级系统做什么:现在你的抽奖系统有了折扣计算、随机抽奖、时间处理。让AI帮你加一个"用户验证"功能——只有消费满50元的用户才能抽奖。▍提示词(可直接复制到AI工具)我已经写好了一个促销抽奖系统,包含math折扣计算、random加权抽奖、datetime倒计时三个功能。现在请帮我加一个功能:用户验证模块:-输入用户消费金额-如果金额>=50元,调用抽奖函数,返回抽奖结果-如果金额<50元,提示"消费满50元可参与抽奖"-记录每次抽奖的订单号、时间、结果到一个列表中-最后可以打印抽奖日志要求:带异常处理、加注释、提供测试代码。提示:把已有的代码贴给AI,让它在此基础上扩展,而不是让它从头重写。这样能保持代码风格一致。✎贴上最终完整代码和运行截图。写下这个系统你最想加的1个功能。【避坑指南】⚠random模块的随机数是"伪随机"。需要真正随机时用random.seed()设种子,否则每次结果不同。⚠math.pi和math.e是常量,不是函数。不要写成math.pi()。⚠datetime对象不能直接相减后用int()取天数,要用.days属性。⚠AI可能用random.sample做抽奖——但sample是无放回抽样,抽奖应该用choices(有放回)。【评价量表】评价维度评价标准分值功能完整度折扣计算、随机抽奖、时间处理三个功能齐全35代码质量使用了math/random/datetime的正确函数,注释清晰30运行正确3次抽奖模拟结果截图完整,无报错20实训记录记录栏填写完整、关键概念理解正确15合计自评____分互评____分教师评分____分100【拓展挑战】用random模块生成50个[0,1)的随机浮点数,用math模块计算它们的均值、中位数和标准差。把结果和NumPy的np.mean/np.median/np.std对比,看看差异。实训2-2时间与文本处理:用datetime和re管理一份订单流水建议学时:2学时难度:入门使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:2-2【实训情境】校园小铺的订单越来越多了,老板发来一份流水:"ORD20261101-001,2026-11-0110:30:25,张三,手机号138xxxx,消费88元"。这种半结构化的文本,怎么用Python提取出订单号、时间、姓名、金额?这节课用re正则表达式来搞定。【学习目标】□能使用re模块进行文本匹配、提取和替换□能使用datetime模块解析时间字符串并进行时间运算□能综合运用re和datetime处理半结构化的订单数据【成果交付】□一段能从订单文本中提取关键信息的Python代码□提取结果的截图(至少5条订单解析成功)【操作步骤】步骤1:用re提取订单中的金额和手机号做什么:正则表达式是文本处理的"瑞士军刀",先用它从一段订单文本中提取金额和手机号。▍提示词(可直接复制到AI工具)#=====用re提取订单信息=====importre#一条订单流水文本order_text="ORD20261101-001,2026-11-0110:30:25,张三,手机消费88.5元"#提取手机号(11位数字,1开头)phone=re.search(r'1[3-9]\d{9}',order_text)print("手机号:",phone.group()ifphoneelse"未找到")#提取金额(数字+小数点+数字)amount=re.search(r'\d+\.?\d+',order_text.split("消费")[1])print("消费金额:",amount.group()ifamountelse"未找到")#提取订单号order_id=re.search(r'ORD\d{8}-\d{3}',order_text)print("订单号:",order_id.group()iforder_idelse"未找到")提示:正则表达式看起来像天书,但本质就是"模式匹配"。\d匹配数字,{9}表示匹配9次,[]表示可选范围。让AI帮你逐行解释每个符号的含义。✎写下你对正则表达式的理解:\d表示____,{9}表示____,[3-9]表示____。步骤2:用datetime解析订单时间做什么:提取出时间字符串后,用datetime把它变成"时间对象",才能做时间运算。▍提示词(可直接复制到AI工具)请用datetime模块写一段代码:1.从订单文本"2026-11-0110:30:25"中解析出时间对象2.计算这条订单是星期几3.假设现在有多条订单时间,找出最早的订单和最晚的订单4.计算第一条订单和最后一条订单之间的时间差(天数和小时)要求:用strptime解析时间,加注释,提供5条模拟订单数据。提示:strptime的格式符:%Y年、%m月、%d日、%H时、%M分、%S秒。记不住没关系,用的时候查就行——或者直接问AI。✎记录第一条订单是星期____。时间差为____天____小时。步骤3:批量处理——解析10条订单流水做什么:一条一条解析不够用。写一个循环,批量解析10条订单,提取订单号、时间、姓名、手机号、金额,存到列表里。▍提示词(可直接复制到AI工具)#=====批量解析订单流水=====importrefromdatetimeimportdatetime#10条模拟订单流水orders=["ORD20261101-001,2026-11-0110:30:25,张三,手机消费88.5元","ORD20261101-002,2026-11-0114:20:10,李四,手机消费45.0元","ORD20261101-003,2026-11-0116:45:33,王五,手机消费120.8元",#...补充到10条]parsed_orders=[]forlineinorders:order_id=re.search(r'ORD\d{8}-\d{3}',line)time_str=re.search(r'\d{4}-\d{2}-\d{2}\d{2}:\d{2}:\d{2}',line)name=re.search(r',[\u4e00-\u9fa5]{2,3},手机号',line)phone=re.search(r'1[3-9]\d{9}',line)amount=re.search(r'\d+\.?\d+元',line)iforder_idandtime_strandphoneandamount:parsed_orders.append({"order_id":order_id.group(),"time":datetime.strptime(time_str.group(),"%Y-%m-%d%H:%M:%S"),"name":name.group().strip(",手机号"),"phone":phone.group(),"amount":float(amount.group().replace("元",""))})#打印解析结果foroinparsed_orders:print(f"{o['order_id']}|{o['time']}|{o['name']}|{o['phone']}|{o['amount']}元")print(f"\n共解析{len(parsed_orders)}条订单")提示:[\u4e00-\u9fa5]是匹配中文字符的正则范围。让AI解释Unicode编码和中文字符的关系。✎把解析结果截图贴在记录栏。写下:10条订单总消费金额是____元。步骤4:让DeepSeek帮你生成日报做什么:解析完数据后,让AI帮你写一个"日报生成器"——自动统计当天订单数、总金额、平均金额,并格式化输出。▍提示词(可直接复制到AI工具)我已经用re和datetime解析出了10条订单数据,存在parsed_orders列表中,每个元素是一个字典,含order_id/time/name/phone/amount五个键。请帮我写一个函数generate_daily_report(orders),输出:1.订单总数2.总消费金额3.平均订单金额(保留2位小数)4.最高单笔消费和最低单笔消费5.消费最高的用户姓名6.按时间段(上午/下午/晚上)统计订单数要求:用math模块做数值处理,用datetime判断时间段,输出格式化的日报文本。提示:把已有代码和数据结构贴给AI,它才能给出能直接用的函数。信息越完整,AI的代码越准确。✎贴上日报输出截图。写下你觉得这个"日报生成器"还能加什么功能。【避坑指南】⚠正则表达式不要写得太复杂。先写简单的,测通了再加条件。能用字符串方法(split/replace)解决的,不要硬用正则。⚠re.search返回Match对象,不是字符串。要用.group()提取匹配到的文本,否则print出来是<re.Matchobject>。⚠datetime.strptime的格式符必须和实际时间字符串完全匹配,否则会报ValueError。⚠AI生成的正则可能用了不支持的语法。Python的re模块不支持某些高级正则特性(如递归匹配),跑一遍验证。【评价量表】评价维度评价标准分值正则准确度手机号、金额、订单号提取正确率90%以上30时间处理时间解析正确,时间差计算无误25批量处理10条订单批量解析成功,日报输出完整30实训记录记录栏填写完整、关键概念理解正确15合计自评____分互评____分教师评分____分100【拓展挑战】给日报生成器加一个"异常订单检测"功能:找出消费金额超过平均值2倍的订单,标记为"大额订单",并在日报中单独列出。用DeepSeek辅助。第3章Python常用库三大神器:NumPy+pandas+Matplotlib|数据分析的三件套。NumPy管计算、pandas管数据、Matplotlib管画图。从读CSV到画图表,一条龙走通。实训3-1用NumPy和pandas读取销售数据并做基础统计建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:3-1【实训情境】老板给了你一份UserBehavior.csv文件,里面有几十万条用户行为数据(用户ID、商品ID、类目ID、行为类型、时间戳)。怎么用Python快速完成数据读取、清洗、基础统计分析?这节课我们用pandas读取CSV,用NumPy做数组运算,走出数据分析第一步。【学习目标】□能使用pandas的read_csv读取数据文件,使用head/info/describe查看数据概况□能使用NumPy创建数组并进行基本的数学运算和统计□理解DataFrame的基本结构和数据选择方法【成果交付】□一段完整的数据读取与基础统计代码□一份数据概况报告(行数、列数、数据类型、基本统计量)【操作步骤】步骤1:用pandas读取CSV并查看数据结构做什么:先不急着分析,先"看一眼"数据。pandashead、info和describe是常用的数据探索方法。▍提示词(可直接复制到AI工具)请用pandas写一段代码:1.读取UserBehavior.csv文件(假设在当前目录)2.用head()查看前10行3.用info()查看数据类型和缺失情况4.用describe()查看数值列的统计摘要5.用shape查看数据有多少行多少列6.用columns查看列名要求:每步加注释,输出结果用print分隔标注。提示:如果文件太大读取慢,可以先用df=pd.read_csv('文件路径',nrows=1000)只读前1000行试试。让AI帮你优化读取速度。✎记录数据概况:共____行____列,列名分别是____。步骤2:用NumPy做数组运算做什么:使用pandas读取数据后,进一步使用NumPy对其中的数值列进行运算。NumPy的数组运算比Python原生列表快得多。▍提示词(可直接复制到AI工具)#=====NumPy数组运算=====importnumpyasnpimportpandasaspd#假设已读取数据到df#提取某一列转为NumPy数组#amounts=df['amount'].values#如果有金额列#创建模拟数据演示NumPy运算prices=np.array([29.9,39.9,49.9,59.9,69.9])quantities=np.array([100,80,60,40,20])#逐元素乘法(单价×数量=总额)total=prices*quantitiesprint("每种商品总额:",total)#统计print("总销售额:",np.sum(total))print("平均单价:",np.mean(prices))print("价格标准差:",np.std(prices))print("最高单价:",np.max(prices))print("最低单价:",np.min(prices))#条件筛选expensive=prices[prices>40]print("40元以上的商品:",expensive)#排序sorted_prices=np.sort(prices)print("排序后:",sorted_prices)提示:NumPy的核心是"逐元素运算"——两个数组直接相乘,不需要写循环。这是NumPy比Python列表快的关键原因。✎写下NumPy和Python列表做乘法的区别:NumPy是____运算,列表需要____。步骤3:用pandas做数据筛选和分组做什么:在真实数据分析中,你需要按条件筛选数据、按维度分组统计。pandas的loc/条件筛选和groupby是核心技能。▍提示词(可直接复制到AI工具)请用pandas写一段代码,基于UserBehavior数据集:1.筛选出行为类型为"购买"的记录2.按用户ID分组,统计每个用户的购买次数3.找出购买次数最多的前5名用户4.按行为类型分组,统计每种行为的数量5.按日期(从时间戳中提取)分组,统计每天的活跃用户数要求:用value_counts()、groupby()、sort_values()等方法,加注释。提示:groupby是pandas最强大的功能之一。记住口诀:"先分组,再聚合"——df.groupby('列名')['目标列'].聚合函数()。✎记录购买次数最多的用户ID是____,购买次数是____。步骤4:让DeepSeek帮你做数据清洗做什么:真实数据总有缺失值和重复值。让AI帮你写一段数据清洗代码——检查缺失值、删除重复值、处理异常值。▍提示词(可直接复制到AI工具)我已经用pandas读取了UserBehavior.csv到变量df中,列名为['user_id','item_id','category_id','behavior_type','timestamp']。请帮我写一段数据清洗代码:1.检查每列的缺失值数量,用isnull().sum()2.删除缺失值所在的行3.检查并删除重复行4.检查behavior_type列的唯一值,确认是否只有pv/fav/cart/buy四种5.将timestamp列转换为datetime类型6.清洗前后数据量对比要求:每步打印结果,加注释。提示:数据清洗是数据分析最耗时的环节(约占60%-80%时间)。数据清洗质量会直接影响后续分析结果的可靠性。AI可以帮你写模板代码,但清洗策略仍需结合数据特征和分析目的进行人工判断。✎记录清洗前____行,清洗后____行,删除了____行。【避坑指南】⚠read_csv读取大文件时可能内存不足。用nrows参数先试读,或用chunksize分块读取。⚠NumPy数组要求所有元素同类型。如果列表里有字符串和数字混在一起,NumPy会全部转成字符串。⚠pandas的loc和iloc容易搞混:loc用标签(列名),iloc用位置(数字索引)。⚠AI可能用了你数据集里不存在的列名。拿到代码后先df.columns看看实际列名再跑。【评价量表】评价维度评价标准分值数据读取CSV成功读取,head/info/describe输出完整30运算正确NumPy数组运算和统计计算结果正确25数据清洗缺失值和重复值处理正确,清洗逻辑合理30实训记录数据概况报告要素齐全、记录栏填写完整15合计自评____分互评____分教师评分____分100【拓展挑战】用pandas的groupby+agg组合,计算每个用户的购买总金额、购买次数、最近一次购买时间,输出一个用户消费概览表。提示:可以用agg({'列名':['sum','count','max']})。实训3-2用Matplotlib把数据"画"出来:销售趋势可视化建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:3-2【实训情境】业务人员需要通过图表直观了解销售数据及其变化趋势。这节课用Matplotlib把pandas处理好的数据画成折线图、柱状图、饼图和散点图,让数据一目了然。【学习目标】□能使用Matplotlib绘制折线图、柱状图、饼图和散点图□能为图表添加标题、坐标轴标签、图例等元素□能根据数据特征选择合适的图表类型【成果交付】□4种图表的代码和截图(折线图、柱状图、饼图、散点图)□一段用AI解读图表的分析文字(100字以内)【操作步骤】步骤1:画一张折线图——每日销售趋势做什么:折线图最适合展示"随时间变化"的数据。先画一张每日销售趋势图。▍提示词(可直接复制到AI工具)请用matplotlib写一段代码:1.创建模拟的每日销售数据(7天)2.用plt.plot()画折线图3.添加标题"每日销售趋势"、X轴标签"日期"、Y轴标签"销售额(元)"4.设置图表大小为(10,6)5.在每个数据点上标注具体数值6.保存图片为daily_sales.png要求:用中文标题(需要设置中文字体),加注释。提示:Matplotlib默认不支持中文。需要加plt.rcParams['font.sans-serif']=['SimHei']或'MicrosoftYaHei'。让AI帮你处理中文显示问题。✎把折线图截图贴在记录栏。写下:销售额最高的是第____天。步骤2:画柱状图和饼图——商品分布做什么:柱状图比大小、饼图比占比。用这两种图展示不同商品类目的销售占比。▍提示词(可直接复制到AI工具)#=====柱状图+饼图=====importmatplotlib.pyplotaspltplt.rcParams['font.sans-serif']=['MicrosoftYaHei']plt.rcParams['axes.unicode_minus']=False#商品类目和销售额categories=['数码','服饰','食品','美妆','家居']sales=[15000,8000,12000,6000,5000]#柱状图plt.figure(figsize=(8,5))plt.bar(categories,sales,color=['#FF6B6B','#4ECDC4','#45B7D1','#96CEB4','#FFEAA7'])plt.title('各类目销售额对比')plt.xlabel('商品类目')plt.ylabel('销售额(元)')fori,vinenumerate(sales):plt.text(i,v+200,str(v),ha='center')plt.tight_layout()plt.savefig('bar_chart.png',dpi=150)plt.show()#饼图plt.figure(figsize=(8,6))plt.pie(sales,labels=categories,autopct='%1.1f%%',startangle=90)plt.title('各类目销售占比')plt.tight_layout()plt.savefig('pie_chart.png',dpi=150)plt.show()提示:plt.tight_layout()能自动调整图表布局,防止标签被截断。养成好习惯,每个图都加上。✎贴上柱状图和饼图截图。写下:销售额占比最大的是____类目,占____%。步骤3:画散点图——价格与销量的关系做什么:散点图能直观反映两个变量之间的关系。画一张商品价格vs销量的散点图,看看有没有相关性。▍提示词(可直接复制到AI工具)请用matplotlib写一段代码:1.创建20个商品的价格和销量数据2.用plt.scatter()画散点图3.添加标题"商品价格与销量关系"、X轴"价格(元)"、Y轴"销量"4.用不同颜色区分高价位和低价位商品(>50元和<=50元)5.添加图例6.保存为scatter.png要求:加注释,图表美观。提示:散点图能看出变量之间的趋势——向上倾斜说明正相关,向下倾斜说明负相关,散乱说明无关。后面第6章会学到更精确的相关性分析方法。✎贴上散点图截图。写下:从图中看,价格和销量是____相关(正/负/无)。步骤4:让AI帮你解读图表做什么:图表绘制完成后,还需要结合数据进行解释和验证。把图表截图发给DeepSeek,让它帮你解读——但它的结论你要自己判断对不对。▍提示词(可直接复制到AI工具)我刚画了4张图(折线图、柱状图、饼图、散点图),展示的是校园小铺一周的销售数据。请你帮我:1.总结每张图的关键发现(每张图1-2句话)2.指出图表中是否有异常值或值得关注的点3.给出3条可操作的经营建议4.如果要深入分析,下一步该看什么数据数据背景:校园小铺,目标用户是大学生,本周做了满减促销。提示:AI解读图表时可能"过度解读"——把普通的波动误判为"显著趋势"。你要对照实际数据验证它的结论。如果结论和数据对不上,以数据为准。✎贴上AI的解读和你的修改意见。写下你最有价值的一条发现。【避坑指南】⚠Matplotlib中文乱码是最常见的问题。必须在代码开头设置font.sans-serif。⚠plt.show()和plt.savefig()的顺序:先save再show,否则保存的是空白图。⚠不要用饼图展示太多类别(超过7个)。类别多时用横向柱状图更清晰。⚠AI可能用了seaborn或plotly画图——这些库很好但不是本章内容。坚持用matplotlib练手。【评价量表】评价维度评价标准分值图表完整度4种图表齐全,均有标题、标签、数据标注35代码质量代码规范、注释清晰、中文显示正常25解读能力能根据图表说出关键发现,有个人判断25实训记录截图完整、记录栏填写清晰15合计自评____分互评____分教师评分____分100【拓展挑战】用subplots把4张图画在一张大图里(2×2布局),作为"一周销售周报"的整体看板。给整个看板加一个大标题。用DeepSeek辅助布局调整。第4章商务数据分析方法与指标方法论:四类分析方法+六大指标体系|分析数据不是"看数字",而是"用方法、看指标、出结论"。先用AI把方法论吃透,再用pandas算指标。实训4-1用AI拆解四类数据分析方法:做一张"方法选择卡"建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、WPSAI/WPS表格实训编号:4-1【实训情境】老板说"我要你分析一下这个月的销售数据"。分析?怎么分析?用描述性分析还是预测性分析?这节课先用AI把四种数据分析方法搞明白,做一张"什么场景用什么方法"的选择卡,以后分析不再盲目。【学习目标】□能说出描述性分析、探索性分析、预测性分析、优化性分析四种方法的含义和适用场景□能为每种方法找到一个商务数据分析的真实应用场景□能根据具体问题判断应该使用哪种分析方法【成果交付】□一页纸《数据分析方法选择卡》(含四种方法的定义、场景、工具、输出)□3个场景分析:给定一个商务问题,判断用什么方法、为什么【操作步骤】步骤1:让AI讲清楚四种分析方法做什么:打开DeepSeek,让AI用大白话解释四种分析方法。注意:不要只问"什么是描述性分析",要给AI角色和格式要求。▍提示词(可直接复制到AI工具)你是我的商务数据分析导师。请用大一学生能听懂的大白话,介绍四种商务数据分析方法:1.描述性分析(发生了什么)2.探索性分析(为什么发生)3.预测性分析(未来会怎样)4.优化性分析(怎么做更好)对每种方法,请按以下格式输出:-一句话解释(不超过30字)-一个生活类比(比如"描述性分析就像体检报告")-一个电商场景的真实案例-常用工具或算法-新手最容易踩的1个坑最后用表格汇总。提示:四种方法不是非此即彼,而是递进关系:先描述→再探索→再预测→最后优化。让AI帮你画一张"分析进阶路径图"。✎把AI输出的表格截图或复制到下方,圈出你觉得最实用的2种方法。步骤2:给每种方法匹配一个真实场景做什么:课本上的概念要落地。让AI帮你把四种方法和真实的电商场景对应起来——什么场景用什么方法。▍提示词(可直接复制到AI工具)请为以下四种分析方法,各找2个2025-2026年中国电商平台的真实案例(淘宝、京东、拼多多、抖音电商均可):1.描述性分析:如"双11各品类GMV排行"2.探索性分析:如"为什么某商品退货率突然升高"3.预测性分析:如"预测下周直播间GMV"4.优化性分析:如"优化库存补货周期降低成本"对每个案例,请说明:-分析了什么问题-用了什么数据-得出了什么结论-这个结论能怎么用如果某些案例找不到真实公开信息,请诚实说明,不要编造。提示:重点检查AI有没有编造案例。凡是它给的数据,你都要在新闻或平台公告里搜一遍验证。✎填表:分析方法/案例描述/数据来源/是否验证。步骤3:做一张"方法选择卡"做什么:信息只有被压缩才能被记住。让AI帮你把上面的内容精简成一张能贴在笔记本上的选择卡。▍提示词(可直接复制到AI工具)请把上面的内容压缩成一张A4纸能打印完的《数据分析方法选择卡》。要求:-每种方法只保留:名称、一句话定义、适用场景、常用工具-按"难度从低到高"排序(描述→探索→预测→优化)-加一列"需要的数据"(如:历史交易数据、用户行为日志)-加一列"输出物"(如:统计报表、相关性热力图、预测模型)-再帮我编一句口诀,把四种方法串起来方便记忆-输出用Markdown表格提示:选择卡的核心是"遇到什么问题→用什么方法"。你可以把它当成以后做分析的"决策树"。✎把选择卡和口诀抄写在这里。步骤4:对号入座:分析三个场景该用什么方法做什么:最后一步是知识连回实际。给你三个商务场景,判断该用什么分析方法,为什么。▍提示词(可直接复制到AI工具)请给我3个商务数据分析的场景,让我判断应该用哪种分析方法(描述性/探索性/预测性/优化性)。每题等我回答后再给解析。要求:1.场景要贴近电商、社交平台或直播带货2.难度递进:第一题答案明显,第二题有多种方法组合,第三题需要深入思考3.每题答完给1句"这个场景在第X章会深入学"的提示提示:很多真实场景需要组合使用多种方法。比如"为什么退货率升高"先做描述性统计看趋势,再做探索性分析找原因,最后做预测性分析看会不会持续。✎写下3题的答案和你的理由,以及AI的解析是否改变了你的想法。【避坑指南】⚠不要把四种方法割裂使用。真实分析往往从描述性开始,逐步过渡到预测性和优化性。⚠AI可能给你较复杂的算法(如XGBoost、LightGBM)。入门阶段先掌握基础方法,复杂算法后面章节再学。⚠方法选择不是越高级越好。简单的描述性统计就能解决的问题,不需要使用机器学习。⚠"探索性分析"和"描述性分析"容易混淆:描述性是"总结已知",探索性是"发现未知"。【评价量表】评价维度评价标准分值方法理解四种方法的定义和适用场景描述准确30案例真实案例经过验证、标注来源,无虚构30选择卡质量选择卡要素齐全、口诀好记、格式清晰25场景判断3个场景判断正确2个以上,理由合理15合计自评____分互评____分教师评分____分100【拓展挑战】选一个你熟悉的电商平台(如淘宝或抖音电商),找出它同时使用了四种分析方法的1个功能(如"猜你喜欢"推荐系统),分析每种方法在其中起什么作用,呈现为200字的分析报告。实训4-2流量与转化指标实操:用pandas计算PV/UV/转化率建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:4-2【实训情境】老板问你:"我们店铺这周流量怎么样?转化率是多少?"你打开UserBehavior数据集,几十万条记录,怎么用pandas快速算出PV、UV、转化率这些关键指标?这节课动手算。【学习目标】□理解PV、UV、转化率、用户行为指标的含义和计算方法□能使用pandas计算流量指标和转化指标□能用Matplotlib可视化关键指标【成果交付】□一段完整的指标计算代码(PV/UV/转化率/留存率)□一页纸指标分析报告(含图表和3条结论)【操作步骤】步骤1:先搞懂关键指标的含义做什么:别急着写代码。先用AI把PV、UV、转化率这些指标搞明白,不然后面全是数字游戏。▍提示词(可直接复制到AI工具)你是商务数据分析导师。请用大白话解释以下6个关键指标:1.PV(页面浏览量)2.UV(独立访客数)3.转化率(购买转化率、加购转化率)4.用户行为指标(点击、收藏、加购、购买)5.留存率(次日留存、7日留存)6.客单价对每个指标:-一句话定义-计算公式-一个电商场景的例子-这个指标高好还是低好最后用表格汇总,并指出哪些指标之间有关联。提示:PV和UV的区别是新手必考点:PV算的是"次"(一个人看了3次算3),UV算的是"人"(一个人看了3次算1)。✎写下PV和UV的区别____,转化率的公式是____。步骤2:用pandas计算PV和UV做什么:概念清楚了,该写代码了。用pandas读取UserBehavior数据集,计算PV和UV。▍提示词(可直接复制到AI工具)请用pandas写一段代码,基于UserBehavior数据集(列名:user_id,item_id,category_id,behavior_type,timestamp):1.计算PV(总页面浏览量=所有行为记录数)2.计算UV(独立访客数=去重后的user_id数量)3.计算人均PV(PV/UV)4.按behavior_type分组统计各行为数量5.计算购买转化率(购买用户数/UV)6.计算加购转化率(加购用户数/UV)要求:加注释,结果用print格式化输出。提示:购买转化率的计算有两种方式:按行为次数算(购买次数/总行为次数)和按人数算(购买人数/总人数)。通常用后者更准确。让AI解释为什么。✎记录PV=____,UV=____,购买转化率=____%。步骤3:计算留存率做什么:留存率是衡量用户粘性的核心指标。用pandas按日期分组,计算次日留存和7日留存。▍提示词(可直接复制到AI工具)请用pandas写一段代码,基于UserBehavior数据集计算留存率:1.从timestamp中提取日期2.找出每天的活跃用户集合3.计算次日留存率:第N+1天还在活跃的用户数/第N天的活跃用户数4.计算7日留存率5.输出每日留存率表格参考代码思路:-df['date']=pd.to_datetime(df['timestamp'],unit='s').dt.date-daily_users=df.groupby('date')['user_id'].apply(set)-用集合交集计算留存要求:加注释,输出前7天的留存率。提示:留存率计算用集合(set)的交集最方便:set_A&set_B就是两天都在的用户。pandas的apply(set)可以把每列变成集合。✎记录次日留存率约为____%,7日留存率约为____%。步骤4:可视化指标+AI解读做什么:把算出来的指标画成图表,然后让AI帮你写一份简短的指标分析报告。▍提示词(可直接复制到AI工具)我已经用pandas计算了以下指标:PV、UV、人均PV、各行为类型数量、购买转化率、加购转化率、次日留存率、7日留存率。请帮我:1.写一段matplotlib代码,画出:(a)各行为类型数量柱状图;(b)每日活跃用户数折线图;(c)留存率折线图2.基于这些数据,写一份200字以内的指标分析报告,包括:总体情况、关键发现、2条建议数据背景:某电商平台的用户行为数据,时间跨度约1个月。提示:指标分析报告的结构:先说"是什么"(总体情况),再说"发现了什么"(关键发现),最后说"怎么办"(建议)。这是数据分析报告的万能结构。✎贴上图表截图和分析报告。写下你认为最有价值的1条建议。【避坑指南】⚠PV不等于点击量。如果一条行为记录代表一次页面浏览,PV就是总记录数;如果行为包括点击、收藏、加购等,需要区分。⚠留存率计算时要注意日期对齐。第N天的次日留存=第N天和第N+1天都活跃的用户/第N天活跃的用户。⚠转化率的分母要用UV(去重人数),不要用总行为次数。否则转化率会被高频浏览用户拉低。⚠AI可能直接给你留存率的"标准答案"——但留存率和行业、平台、时间段强相关,没有标准答案。以你的数据为准。【评价量表】评价维度评价标准分值指标理解6个关键指标含义和公式描述正确25代码正确PV/UV/转化率/留存率计算无误35可视化3张图表清晰美观,有标题和标签25分析报告报告结构完整、有数据支撑、建议可操作15合计自评____分互评____分教师评分____分100【拓展挑战】用pandas计算"漏斗转化率":浏览→加购→收藏→购买每个环节的转化率,并用Matplotlib画一个漏斗图(提示:用横向柱状图模拟),用DeepSeek辅助。第5章用户行为洞察与分析看懂用户:漏斗模型+RFM分层+行为预测|数据分析的终极目的是"懂用户"。用漏斗模型看转化、用RFM给用户分层、用AI做行为预测。实训5-1用户行为数据清洗与漏斗转化分析建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:5-1【实训情境】电商平台给了你一份UserBehavior.csv(约100万条用户行为数据),老板问:"用户从浏览到购买,每一步流失了多少人?"这就是漏斗转化分析——这节课用pandas+DeepSeek来搞定。【学习目标】□能对大规模用户行为数据进行清洗和预处理□能使用漏斗模型分析用户从浏览到购买的转化路径□能计算各环节转化率和整体转化率,找出流失最大的环节【成果交付】□一份用户行为数据清洗报告(缺失值、异常值处理)□一张漏斗转化分析图+各环节转化率表格□3条改进建议(基于数据,不是空话)【操作步骤】步骤1:数据清洗——把"脏数据"洗干净做什么:UserBehavior数据集有近百万条记录,先做数据清洗。检查缺失值、异常值、重复行,确保分析结果可靠。▍提示词(可直接复制到AI工具)请帮我写一段pandas代码,对UserBehavior.csv进行数据清洗:1.读取数据(列名:user_id,item_id,category_id,behavior_type,timestamp)2.检查缺失值:isnull().sum(),删除缺失行3.检查重复行:duplicated().sum(),删除重复行4.检查behavior_type的唯一值,确认只有pv/fav/cart/buy5.将timestamp转为datetime(pd.to_datetime(timestamp,unit='s'))6.提取日期和小时列7.检查时间范围,确认数据覆盖多少天8.打印清洗前后的数据量对比要求:加注释,每步打印结果。提示:数据清洗是数据分析的地基。地基不稳,上面的分析全是空中楼阁。清洗思路:先看缺什么→再删什么→最后转格式。✎记录清洗前_
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 养老机构医务室诊疗登记记录表
- 自然保护地勘界成果现场核验规程
- 常见危急值临床意义及护理措施
- 《鲁迅的翻译思想》课件
- T/UNP 229-2024再生炭黑
- 《标准品和校准品》课件
- 《新补写句子》课件
- T/CES 369-2025柔性直流输电直流电容器用金属化薄膜电气性能与评价方法
- 2026年度后勤保障部年度履职情况报告课件
- 《煤矿自救互救》课件
- 2026年国企招聘笔试试题及答案
- 醋酸正丁酯安全技术说明书
- 商铺带租约出售三方协议书7篇
- 临床药学治疗药物监测专家讲座
- 煤矿安全知识考试复习题库(附答案)
- HDU高依赖病房应急处置手册
- 2026中国药师协会执业药师继续教育答案
- 危重症患者的并发症预防与护理
- 2025年新时代文明实践员考试真题及答案
- 小儿房间隔缺损诊疗指南(2025年版)
- 2026年口腔科四手操作技术培训手册
评论
0/150
提交评论