版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
《Python商务数据分析与应用》AI实训指导手册第1页配套教材·AIGC版·微课版《Python商务数据分析与应用》AI实训指导手册10大项目·20个入门级实训·Python+DeepSeek双引擎驱动配套教材陈佳、田晓丽、李光旭、谭慧敏编著《Python商务数据分析与应用》(AIGC版微课版),人民邮电出版社实训总数20个(教材10章,每章2个实训)建议学时每实训2学时,共40学时(可按方向选做12个)难度定位零基础入门,Python+AI双工具,边学边做核心工具Python(JupyterNotebook)、DeepSeek、NumPy、pandas、Matplotlib内容时效案例与数据更新至2026年,紧贴电商、社交、直播、短视频四大场景使用说明:带✎标记的记录栏请在电脑上直接填写;灰底框内的提示词可直接复制到DeepSeek或Python环境中使用。
第6章数字广告投放及效果分析广告效果:相关性分析+k-means聚类|广告投放不是"投了就有效"。用相关性分析找"什么因素影响点击率",用k-means把用户分群做精准投放。实训6-1广告数据探索:相关性分析与可视化建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:6-1【实训情境】广告主投了钱,问你"我的广告到底有没有效?什么因素影响点击率?"你手上有raw_sample.csv(广告曝光样本)、ad_feature.csv(广告特征)、user_profile.csv(用户画像)三个数据集。这节课用pandas合并数据、算相关性、画热力图。【学习目标】□能使用pandas合并多个数据集(merge)□能计算变量之间的相关系数并绘制热力图□能解读相关性分析结果,找出影响广告效果的关键因素【成果交付】□一段完整的数据合并+相关性分析代码□一张相关性热力图+3条关键发现【操作步骤】步骤1:理解广告数据——三个表长什么样做什么:先用AI把三个数据集的结构搞清楚,再动手。别上来就merge,搞不好列名对不上。▍提示词(可直接复制到AI工具)我在做数字广告效果分析,有三个CSV文件:1.raw_sample.csv:广告曝光日志(用户ID、广告ID、时间、是否点击)2.ad_feature.csv:广告特征(广告ID、创意类型、出价等)3.user_profile.csv:用户画像(用户ID、年龄、性别、消费能力等)请你:1.解释这三个表之间的关系(用哪个列做关联键)2.合并三个表的推荐步骤(先合并哪两个?用什么类型的merge?)3.合并后可能出现的问题(重复列、数据膨胀、缺失值)4.合并后应该检查什么用大白话解释,假设我是Python初学者。提示:数据合并(merge)就像SQL的JOIN:on参数指定关联键,how参数决定保留哪些行。inner只保留匹配的,left保留左表全部。让AI帮你画一张合并逻辑图。✎写下三个表的关联键是____,推荐合并顺序是____。步骤2:数据合并与清洗做什么:理解了数据结构后,用pandas把三个表合并成一个,然后清洗。▍提示词(可直接复制到AI工具)请用pandas写一段代码:1.读取raw_sample.csv、ad_feature.csv、user_profile.csv三个文件2.用merge合并:先合并raw_sample和ad_feature(on='ad_id'),再合并user_profile(on='user_id')3.检查合并后的数据量和缺失值4.删除缺失值5.检查并删除重复行6.将非数值列做标签编码(LabelEncoder)7.打印合并后的数据概况(shape、columns、describe)要求:加注释,每步打印结果。如果数据量太大,用nrows限制读取行数。提示:merge后数据量可能暴增(一对多关系导致笛卡尔积)。合并后可以使用shape获得行数是否合理,不合理说明合并键选错了。✎记录合并后共____行____列。步骤3:计算相关系数——什么影响点击率做什么:数据合并好了,现在算变量之间的相关性。找出"哪些因素和广告点击率相关性最强"。▍提示词(可直接复制到AI工具)请用pandas和numpy写一段代码:1.对合并后的数据计算相关系数矩阵(df.corr())2.提取"是否点击"列与其他列的相关系数,按绝对值排序3.找出与点击率相关性最强的前5个因素4.用matplotlib画相关系数热力图(imshow或seaborn.heatmap)5.解读结果:哪些因素正向影响点击率?哪些负向影响?要求:加注释,热力图要有颜色条和标签。提示:相关系数范围是[-1,1]:接近1强正相关,接近-1强负相关,接近0基本无关。但相关性不等于因果性——让AI解释这个区别。✎记录与点击率相关性最强的3个因素:1.____2.____3.____。步骤4:用DeepSeek做深度分析做什么:教材在第6章引入了DeepSeek做数据相关性分析。让AI帮你解读热力图,给出广告优化建议。▍提示词(可直接复制到AI工具)我已用pandas计算了广告数据的相关系数矩阵,画了热力图。发现与点击率相关性最强的因素包括:广告创意类型、用户年龄、出价水平等。请你:1.解释为什么这些因素与点击率相关性最强2.基于相关性结果,给出3条广告优化建议(具体到"调什么参数")3.指出相关性分析的局限性——哪些重要因素可能被遗漏了4.如果要进一步验证因果关系,下一步该做什么实验背景:某电商平台的信息流广告,目标用户是18-35岁的年轻消费者。提示:AI可能给出过于理论的建议(如"优化算法模型")。你要追问到具体操作层面:"具体调什么?调到多少?"改过的建议才属于你。✎贴上AI的分析和你的修改意见。写下你认为最关键的1条优化建议。【避坑指南】⚠merge时注意关联键的数据类型。如果一边是int64另一边是object,merge会报错或匹配失败。⚠相关系数只衡量线性关系。非线性关系(如U型关系)不会被corr捕捉到,需要画散点图辅助判断。⚠热力图的颜色映射要选对。RdYlBu(红黄蓝)是常用色图:红=正、蓝=负、黄=无。⚠AI可能直接给出"点击率公式"——但不同平台的点击率定义不同。以你的数据列含义为准。【评价量表】评价维度评价标准分值数据合并三表合并正确,数据量合理30相关性分析相关系数计算正确,排序合理30可视化热力图清晰,有颜色条和标签25分析解读3条发现基于数据、建议可操作15合计自评____分互评____分教师评分____分100【拓展挑战】用DeepSeek生成代码:对广告数据做"分组相关性分析"——按用户年龄段分组,分别计算各组的点击率相关因素,对比不同年龄段的广告效果差异。实训6-2用k-means给用户分群:广告精准投放建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)、scikit-learn实训编号:6-2【实训情境】广告主说"我不想对所有用户投一样的内容,能不能把用户分几个群体,每个群体投不同的广告?"这就是k-means聚类——让算法自动找出用户群体。这节课用DeepSeek生成代码、scikit-learn运行k-means。【学习目标】□理解k-means聚类算法的原理和适用场景□能使用scikit-learn的KMeans进行用户聚类□能用轮廓系数评估聚类效果并选择最佳K值【成果交付】□一段完整的k-means聚类代码(含数据标准化、聚类、评估)□聚类结果可视化图+4类用户画像描述【操作步骤】步骤1:理解k-means——用AI讲清楚做什么:k-means是无监督学习的经典算法。先用AI把它的原理搞明白——什么是K、什么是质心、怎么迭代。▍提示词(可直接复制到AI工具)你是机器学习入门教练。请用大一学生能听懂的大白话解释k-means聚类算法:1.什么是聚类?和无监督学习是什么关系?2.k-means的K是什么意思?怎么选K值?3.算法步骤(用"分座位"的类比解释)4.什么是质心(centroid)?5.什么是轮廓系数(silhouettescore)?怎么用它评估聚类效果?6.k-means在广告投放中的应用场景7.新手最容易踩的1个坑最后用表格汇总关键概念。提示:K值的选择是k-means最关键的超参数。常用的方法:肘部法则(ElbowMethod)和轮廓系数法。让AI帮你画一张"K值选择决策图"。✎写下K的含义是____,轮廓系数范围是____到____。步骤2:特征工程——选哪些特征做聚类做什么:聚类前要选好特征。用上一步合并好的广告数据,选取合适的特征进行标准化。▍提示词(可直接复制到AI工具)请用pandas和sklearn写一段代码,做k-means聚类前的特征工程:1.从合并后的广告数据中选取聚类特征:用户年龄、消费能力、点击率、广告偏好类型2.处理缺失值(填充或删除)3.非数值列做标签编码(LabelEncoder)4.用StandardScaler做标准化(k-means对量纲敏感)5.输出处理后的特征矩阵shape和前5行参考代码:fromsklearn.preprocessingimportStandardScaler,LabelEncoderfeatures=df[['age','consumption_ability','click_rate','ad_type']]#编码+标准化要求:加注释,输出处理后的数据概况。提示:标准化(StandardScaler)让所有特征均值为0、标准差为1。不做标准化的话,数值范围大的特征会主导聚类结果。这是新手最常见的坑。✎记录选取了____个特征,标准化后特征矩阵的shape是____。步骤3:用DeepSeek跑k-means聚类做什么:教材在第6章引入了基于DeepSeek的k-means聚类。让AI帮你生成完整的聚类代码,包括选K值和可视化。▍提示词(可直接复制到AI工具)请帮我写一段完整的k-means聚类代码:1.用sklearn.cluster.KMeans对标准化后的特征做聚类2.K值从2到8分别跑,计算每个K的轮廓系数3.画"肘部图"(KvsSSE)和"轮廓系数图"(Kvssilhouette_score)4.选择最佳K值5.用最佳K值重新聚类,给每个用户打标签6.用matplotlib画聚类散点图(取前2个主成分降维可视化)7.输出每个簇的样本数量和特征均值要求:加注释,每步打印结果。代码要能直接在Jupyter中运行。提示:DeepSeek生成的代码可能在Python环境中报错——如sklearn版本差异、函数参数变化等。把报错信息完整贴回去让AI修复。这就是教材强调的"二次验证与适配调试"。✎记录最佳K值是____,轮廓系数是____。4个簇的人数分别是____。步骤4:解读聚类结果——给每个群体"画像"做什么:聚类完了不是结束——要能说出每个群体"是什么样的人"。用DeepSeek帮你解读每个簇的特征。▍提示词(可直接复制到AI工具)我用k-means将广告用户分为了4个群体。每个群体的特征均值如下(请根据实际数据替换):簇0:年龄25岁、消费能力中、点击率8%、偏好视频广告簇1:年龄35岁、消费能力高、点击率5%、偏好图文广告簇2:年龄22岁、消费能力低、点击率12%、偏好视频广告簇3:年龄40岁、消费能力高、点击率3%、偏好搜索广告请帮我:1.为每个群体起一个"画像名称"(如"年轻高互动族")2.分析每个群体的广告投放价值(高/中/低)3.给每个群体推荐1种广告内容和投放策略4.指出哪个群体最值得加大投放,为什么要求:建议要具体到"投什么内容、什么时段、什么平台"。提示:聚类结果的解读比聚类本身更重要。算法只是工具,能不能把数据变成"可执行的商业策略"才是你的价值。✎贴上4类用户画像和投放建议。写下你最想投放的群体和原因。【避坑指南】⚠k-means对初始质心敏感,不同运行可能得到不同结果。用random_state=42固定随机种子保证可复现。⚠K值不是越大越好。K太大会过拟合,每个样本自成一类;K太小会欠拟合,群体差异不明显。⚠k-means只能处理数值型特征。类别型特征需要先编码(LabelEncoder或OneHotEncoder)。⚠AI画的散点图可能用了3D可视化——入门阶段用2D(PCA降维到2个主成分)更直观。【评价量表】评价维度评价标准分值特征工程特征选择合理、标准化正确25聚类代码k-means运行成功,K值选择有依据30评估可视化肘部图和轮廓系数图完整,散点图清晰25画像解读4类用户画像清晰,投放建议具体可操作20合计自评____分互评____分教师评分____分100【拓展挑战】用DeepSeek生成代码:对k-means聚类结果做"稳定性检验"——改变random_state跑5次,对比每次聚类结果的一致性。如果某类用户每次都出现,说明这个群体是"真实"的。第7章电子商务平台商务活动分析电商实战:数据预处理+转化漏斗+精准推荐|电商分析三板斧:把数据洗干净、把转化算清楚、把推荐做精准。实训7-1电商商品数据预处理与销售转化分析建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:7-1【实训情境】电商平台给了你一份商品数据集,里面有商品ID、类目、价格、销量、评价数等字段。数据有不少问题——缺失值、异常值、格式不统一。老板说"先把数据弄干净,再算算转化率"。这节课动手做。【学习目标】□能对电商商品数据做完整的预处理(缺失值、异常值、标准化)□能使用漏斗模型分析电商平台的销售转化率□能计算关键电商指标并找出转化瓶颈【成果交付】□一段完整的数据预处理代码□一份销售转化分析报告(含漏斗图和3条优化建议)【操作步骤】步骤1:数据预处理——把数据洗干净做什么:电商数据通常存在缺失值、异常值和格式不一致等质量问题。先做缺失值处理、异常值检测和数据标准化。▍提示词(可直接复制到AI工具)请用pandas写一段代码,对电商商品数据集做预处理:1.读取数据,查看shape、info、describe2.检查缺失值:isnull().sum(),对数值列用中位数填充,分类列用众数填充3.检测异常值:用IQR方法(Q1-1.5*IQR~Q3+1.5*IQR),找出价格和销量中的异常值4.异常值处理:用clip方法截断到合理范围5.数据标准化:对数值列用MinMaxScaler归一化到[0,1]6.类别列做标签编码7.打印处理前后的统计摘要对比要求:加注释,每步打印结果。提示:IQR异常值检测法:Q1=25分位数,Q3=75分位数,IQR=Q3-Q1。低于Q1-1.5*IQR或高于Q3+1.5*IQR的都是异常值。让AI帮你画一张异常值分布图。✎记录处理前缺失值共____个,异常值共____个,处理后剩余____行。步骤2:销售转化漏斗分析做什么:电商转化的典型路径是:曝光→点击→加购→收藏→购买。用pandas计算每个环节的人数和转化率。▍提示词(可直接复制到AI工具)请用pandas写一段代码,对UserBehavior数据集做电商销售转化漏斗分析:1.筛选各行为类型的用户集合:pv_users,cart_users,fav_users,buy_users2.计算漏斗各层人数:-曝光用户数=pv用户数-加购用户数=cart用户数-收藏用户数=fav用户数-购买用户数=buy用户数3.计算各环节转化率:-曝光→加购=cart_users/pv_users-加购→购买=buy_users/cart_users-整体转化率=buy_users/pv_users4.找出"流失最大"的环节5.用matplotlib画漏斗图(横向柱状图,标注人数和转化率)要求:加注释,转化率保留2位小数。提示:电商行业的整体转化率通常在1%-5%之间。如果你的计算结果远超或远低于这个范围,检查是否有逻辑错误。✎记录整体转化率是____%,流失最大的环节是____。步骤3:关键指标计算——GMV/客单价/复购率做什么:除了转化率,电商还有几个核心指标。用pandas算出GMV、客单价、复购率。▍提示词(可直接复制到AI工具)请用pandas写一段代码,计算以下电商核心指标:1.GMV(成交总额):如果有金额列,直接sum;如果没有,用购买商品数×假设均价2.客单价:GMV/购买用户数3.复购率:购买2次及以上的用户数/总购买用户数4.日均GMV:按日期分组求和取均值5.品类贡献度:按商品类目分组计算GMV占比6.TOP5热销商品(按购买次数排序)要求:加注释,结果用print格式化输出。用matplotlib画品类GMV占比饼图。提示:GMV和实际销售额不同:GMV是下单金额,实际销售额要扣除退款退货。分析时要说明你算的是哪个。✎记录GMV=____,客单价=____元,复购率=____%。步骤4:用DeepSeek写分析报告做什么:指标计算完成后,应结合数据结果形成分析结论。让AI帮你把数字变成有商业洞察的报告。▍提示词(可直接复制到AI工具)我已经用pandas分析了电商平台用户行为数据,得到以下结果:-整体转化率:约2%-流失最大环节:曝光→加购(约95%流失)-客单价:约80元-复购率:约15%-最热销品类:手机数码请帮我写一份300字以内的销售转化分析报告,包括:1.总体情况概述(1-2句话)2.关键发现(3条,每条用数据支撑)3.优化建议(2条,具体到"做什么")背景:某校园电商平台,用户主要是大学生,近期在做促销活动。提示:分析报告的黄金法则:先说数字→再说原因→最后说建议。每条建议必须对应一个数据发现,不能空谈。✎贴上分析报告。写下你觉得最关键的1条优化建议。【避坑指南】⚠数据预处理不是"一刀切"。不同列的缺失值用不同策略填充——数值列用中位数,分类列用众数,时间列用前后值填充。⚠异常值不一定要删除。有些"异常值"是真实的大额订单,删除会丢失重要信息。先画分布图看看再决定。⚠GMV计算时要注意单位。如果金额列以分为单位,记得除以100转成元。⚠AI可能用你没有的数据列计算GMV。先检查数据集里到底有哪些列,再让AI写代码。【评价量表】评价维度评价标准分值预处理缺失值、异常值处理逻辑合理,标准化正确30转化分析漏斗各层转化率计算正确,流失环节定位准确30指标计算GMV/客单价/复购率计算无误,可视化清晰25分析报告报告结构完整、数据支撑充分、建议可操作15合计自评____分互评____分教师评分____分100【拓展挑战】用DeepSeek生成代码:做"品类转化对比分析"——按商品类目分组,分别计算各品类的转化率和客单价,找出"转化率高但客单价低"和"转化率低但客单价高"的品类,给出差异化运营建议。实训7-2商品精准推荐:协同过滤入门建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)、scikit-learn实训编号:7-2【实训情境】老板看了你的转化分析,说"用户买了手机就不买壳吗?能不能给买手机的人推荐手机壳?"这就是推荐系统——协同过滤。教材在第7章引入了基于DeepSeek的商品精准推荐。这节课动手实现一个简单版。【学习目标】□理解协同过滤推荐算法的基本原理(用户基vs物品基)□能使用DeepSeek生成推荐算法代码并在Python中验证□能评估推荐结果的质量并给出业务建议【成果交付】□一段协同过滤推荐代码(含数据准备、模型、推荐结果)□给3个用户的推荐列表+推荐理由【操作步骤】步骤1:理解推荐系统——用AI讲清楚做什么:推荐系统是电商的核心。先用AI把"协同过滤"的原理搞明白——什么是用户基、什么是物品基。▍提示词(可直接复制到AI工具)你是推荐系统入门教练。请使用适合大学一年级学生理解的通俗语言解释:1.什么是推荐系统?为什么电商离不开它?2.什么是协同过滤(CollaborativeFiltering)?3.用户基协同过滤(User-basedCF):"找到和你口味相似的人,推荐他们买过的东西"4.物品基协同过滤(Item-basedCF):"买了A的人也买了B,所以给买A的人推荐B"5.两种方法的优缺点和适用场景6.冷启动问题是什么?怎么解决?对每种方法用一个生活类比,最后用表格对比。提示:协同过滤的核心是"相似性"——用户相似或物品相似。相似度的计算方法有余弦相似度、皮尔逊相关系数等。入门阶段先理解概念,代码后面让AI写。✎写下用户基CF的核心思想是____,物品基CF的核心思想是____。步骤2:构建用户-商品交互矩阵做什么:协同过滤的输入是"用户-商品矩阵"。用pandas从UserBehavior数据集中构建这个矩阵。▍提示词(可直接复制到AI工具)请用pandas写一段代码,构建用户-商品交互矩阵:1.读取UserBehavior数据集2.筛选购买行为(behavior_type=='buy')3.用pivot_table构建"用户×商品"矩阵:行是user_id,列是item_id,值是购买次数4.矩阵中0表示未购买,1表示购买过5.查看矩阵的稀疏度(非零元素占比)6.找出被购买次数最多的TOP10商品7.找出购买商品种类最多的TOP10用户要求:加注释,如果用户量太大可随机抽样1000个用户。提示:用户-商品矩阵通常非常稀疏(99%以上是0)。稀疏度越高,推荐越难。让AI解释"稀疏度"对推荐效果的影响。✎记录矩阵大小是____×____,稀疏度是____%。步骤3:用DeepSeek实现物品基协同过滤做什么:教材在第7章引入了基于DeepSeek的商品精准推荐。让AI帮你写一段物品基CF代码——计算商品之间的相似度,给用户推荐。▍提示词(可直接复制到AI工具)请帮我写一段物品基协同过滤推荐代码:输入:用户-商品购买矩阵(user_item_matrix,pandasDataFrame,行是user_id,列是item_id,值是0/1)步骤:1.计算商品之间的余弦相似度(cosine_similarity)2.对指定用户,找出他买过的商品3.用相似度矩阵,推荐和他买过的商品最相似的TOP5商品4.推荐结果排除已购买的商品5.打印推荐结果:商品ID+相似度分数参考代码框架:fromsklearn.metrics.pairwiseimportcosine_similarityitem_sim=cosine_similarity(user_item_matrix.T)item_sim_df=pd.DataFrame(item_sim,index=user_item_matrix.columns,columns=user_item_matrix.columns)defrecommend(user_id,matrix,sim_df,top_n=5):purchased=matrix.loc[user_id]purchased_items=purchased[purchased>0].indexscores=sim_df[purchased_items].mean(axis=1)scores=scores[~scores.index.isin(purchased_items)]returnscores.sort_values(ascending=False).head(top_n)要求:加注释,代码能在Jupyter中直接运行。提示:DeepSeek生成的代码可能在Python中报错——如矩阵维度不匹配、索引类型不对。把完整报错信息贴回去让AI修复。这就是教材反复强调的"二次验证"。✎记录给用户____推荐的TOP5商品ID和相似度分数。步骤4:评估推荐效果做什么:推荐结果生成后,需要对其有效性进行评估。用DeepSeek帮你设计评估方案。▍提示词(可直接复制到AI工具)我已经用物品基协同过滤实现了商品推荐。现在请帮我:1.设计一个简单的评估方案:把数据按时间分成训练集和测试集(80:20),用训练集算相似度,在测试集上评估推荐准确率2.计算以下指标:-Precision@5:推荐的前5个商品中,用户实际购买的比例-Recall@5:用户实际购买的商品中,被推荐出来的比例3.分析推荐结果的问题:有没有推荐了不相关的商品?为什么?4.给出2条改进建议要求:写Python代码实现评估,加注释。提示:推荐系统评估是进阶内容,入门阶段理解Precision和Recall的含义就够了。关键是能够判断推荐结果是否具有合理性——有时候数据比指标更能说明问题。✎记录Precision@5=____%,Recall@5=____%。写下推荐结果中你觉得最合理的一个。【避坑指南】⚠协同过滤有冷启动问题——新用户没有行为数据,无法推荐。入门阶段先不管这个,实际业务中需要用热门商品兜底。⚠用户-商品矩阵太大时内存会爆。用scipy.sparse稀疏矩阵存储,或抽样处理。⚠余弦相似度计算时要注意:有购买行为记为1,没有记为0——不要用原始购买次数,否则高频商品会主导相似度。⚠AI可能推荐了用户已经买过的商品——记得在推荐结果中排除已购商品。【评价量表】评价维度评价标准分值原理理解能说出用户基和物品基CF的区别和适用场景25代码实现交互矩阵构建正确,相似度计算无误35推荐质量推荐结果合理,排除了已购商品25评估分析能计算Precision/Recall,有改进建议15合计自评____分互评____分教师评分____分100【拓展挑战】用DeepSeek生成代码:实现"用户基协同过滤",对比用户基和物品基两种方法的推荐结果差异。对同一个用户,两种方法推荐的商品有几款重合?第8章社交平台商务活动分析社交电商:用户画像+行为预测|社交平台卖的不是商品,是内容和人设。用RFM构建用户画像、用随机森林预测用户购买行为。实训8-1小红书用户画像构建:RFM在社交平台的应用建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:8-1【实训情境】小红书博主问:"我的粉丝到底是什么样的人?哪些粉丝最可能转化?"社交平台的用户画像和电商不同——不只看购买,还要看互动。这节课用RFM模型的变体,给社交平台用户构建画像。【学习目标】□理解社交平台用户行为与电商平台用户行为的差异□能使用RFM模型变体对社交平台用户做画像分析□能可视化用户画像并用AI生成洞察【成果交付】□一段用户画像构建代码(含RFM变体计算)□一页纸用户画像报告(含图表+3类核心用户描述)【操作步骤】步骤1:理解社交平台数据做什么:社交平台数据比电商复杂——有点赞、评论、收藏、分享、购买等多种行为。先搞懂数据结构。▍提示词(可直接复制到AI工具)你是社交电商数据分析导师。请解释:1.社交平台(如小红书)用户行为有哪些?(浏览、点赞、评论、收藏、分享、购买)2.社交平台的RFM模型和电商有什么不同?-R:最近一次互动(不一定是购买)-F:互动频率(点赞+评论+收藏+分享次数)-M:消费金额或互动深度3.社交平台用户画像的关键维度有哪些?4.为什么社交电商比传统电商更依赖内容质量?5.新手做社交平台数据分析最容易忽略什么?用表格汇总社交平台vs电商平台的RFM差异。提示:社交平台的核心是"互动"——点赞和评论比浏览更能反映用户兴趣。让AI帮你设计一个"互动深度评分"模型。✎写下社交平台RFM和电商RFM的最大区别是____。步骤2:用pandas计算社交RFM做什么:理解了概念,用pandas对小红书数据集计算RFM变体。▍提示词(可直接复制到AI工具)请用pandas写一段代码,对社交平台用户数据集做RFM画像分析:假设数据集包含:user_id,behavior_type(view/like/comment/fav/share/buy),timestamp,content_id1.筛选各行为类型,统计每种行为的用户数和次数2.计算RFM变体:-R:用户最近一次互动距今天数-F:用户总互动次数(like+comment+fav+share+buy)-M:互动深度分(评论=3分,收藏=2分,点赞=1分,分享=2分,购买=5分,加总)3.用均值作为阈值,将R/F/M分为高/低4.组合出4类核心用户5.统计每类用户数量6.用matplotlib画分层饼图要求:加注释,输出前10行和统计结果。提示:社交平台的M值用"互动深度评分"代替金额——不同行为权重不同。让AI帮你调整权重,看看分层结果怎么变化。✎记录4类用户数量,占比最大的类型是____。步骤3:用户画像可视化做什么:光看数字不够直观。用Matplotlib画出用户画像的雷达图和分布图。▍提示词(可直接复制到AI工具)请用matplotlib写一段代码,对社交平台RFM分层结果做可视化:1.画4类核心用户的RFM均值雷达图(4个维度:R,F,M,互动深度)2.画各行为类型数量柱状图3.画用户活跃度分布直方图(每日互动次数)4.画内容类型×用户类型的热力图(哪类用户偏好哪类内容)参考代码:-雷达图用plt.polar或自定义实现-每张图加标题和标签要求:中文显示正常,图表美观。提示:雷达图能同时展示多个维度,特别适合做用户画像。让AI帮你调整雷达图的角度和标签。✎贴上雷达图截图。写下"重要价值用户"的画像特征。步骤4:用AI生成用户洞察做什么:图画完了,让DeepSeek帮你把图表变成可执行的用户洞察和运营建议。▍提示词(可直接复制到AI工具)我已对小红书用户数据做了RFM分层和可视化。以下是关键发现:-重要价值用户(R高F高M高)占比约10%-重要发展用户(R高F低M高)占比约25%-用户最常做的互动是点赞,最少的是分享-评论行为与购买行为相关性最高请帮我:1.为每类核心用户写一段100字以内的画像描述2.针对"重要发展用户"给出3条提升互动频率的策略3.分析为什么"评论与购买相关性最高",给出1条利用这个发现的运营建议4.指出画像分析的局限性——还有什么数据没有纳入?背景:小红书博主,粉丝5万,主推美妆和穿搭内容。提示:用户画像的价值不在于"描述用户是什么样",而在于"根据画像做什么"。让AI帮你把画像变成"运营动作清单"。✎贴上AI的用户洞察。写下你最想执行的1条运营策略。【避坑指南】⚠社交平台的行为类型比电商多。不要把所有行为混在一起算——不同行为对购买意愿的影响不同。⚠R值在社交平台要重新定义。不是"最近购买时间",而是"最近互动时间"——活跃度比购买频率更重要。⚠雷达图维度不要超过6个。太多维度会让图形杂乱看不清。⚠AI可能用了数据集中没有的数据字段。先确认数据集的实际列名再写代码。【评价量表】评价维度评价标准分值概念理解能说出社交平台RFM和电商RFM的区别25代码实现RFM计算正确,分层逻辑合理30可视化雷达图和分布图清晰美观25用户洞察画像描述准确,运营建议可操作20合计自评____分互评____分教师评分____分100【拓展挑战】用DeepSeek生成代码:对用户行为做"序列分析"——找出用户从"浏览→点赞→评论→购买"的常见路径,计算每条路径的转化率。和第5章的漏斗分析对比,社交平台的漏斗和电商有什么不同?实训8-2用户购买行为预测:随机森林模型实战建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)、scikit-learn实训编号:8-2【实训情境】老板问:"哪些用户下个月会购买?我好提前给他们推广告。"这就是购买行为预测——用历史行为数据预测未来购买。教材在第8章引入了基于DeepSeek的用户行为预测。这节课用随机森林模型来实现。【学习目标】□理解随机森林模型的基本原理和适用场景□能使用DeepSeek生成预测模型代码并在Python中验证□能评估模型效果并解读特征重要性【成果交付】□一段完整的预测模型代码(含数据准备、训练、评估)□特征重要性排序图+模型评估报告【操作步骤】步骤1:理解随机森林——用AI讲清楚做什么:随机森林是集成学习的代表算法。先用AI把它的原理搞明白——什么是决策树、什么是集成、什么是"森林"。▍提示词(可直接复制到AI工具)你是机器学习入门教练。请用大白话解释:1.什么是决策树?用"20问游戏"类比解释2.什么是随机森林?为什么"三个臭皮匠顶个诸葛亮"?3.随机森林的两个"随机"是什么?(随机抽样+随机选特征)4.随机森林的优点:为什么不容易过拟合?5.什么是特征重要性?怎么用它做业务分析?6.随机森林在用户购买预测中的应用场景7.分类问题和回归问题的区别用表格汇总关键概念。提示:决策树就像"20问游戏"——通过一系列是/否问题来分类。随机森林就是"100棵树投票"——每棵树给一个预测,少数服从多数。✎写下随机森林的两个"随机"是____和____。步骤2:数据准备与特征工程做什么:预测模型的质量取决于特征工程。从用户行为数据中提取特征,构建训练集。▍提示词(可直接复制到AI工具)请用pandas写一段代码,为用户购买行为预测做特征工程:1.读取用户行为数据(UserBehavior或小红书数据集)2.按用户分组,提取以下特征:-最近7天浏览次数-最近7天加购次数-最近7天收藏次数-最近30天购买次数-注册天数-平均每日活跃时长3.构建标签:未来7天内是否购买(0/1)4.处理缺失值和异常值5.非数值特征做编码6.用train_test_split分训练集和测试集(80:20)7.打印特征矩阵shape和标签分布要求:加注释,特征名称清晰。提示:特征工程是预测模型最关键的环节。好特征比好算法更重要。让AI帮你设计更多特征,如"最近一次购买距今天数""最常浏览的类目"等。✎记录共提取了____个特征,正样本占比____%。步骤3:用DeepSeek建随机森林模型做什么:教材在第8章引入了基于DeepSeek的用户行为预测。让AI生成完整的建模代码。▍提示词(可直接复制到AI工具)请帮我写一段随机森林分类模型代码:输入:训练集X_train,y_train(特征+标签:是否购买)步骤:1.用sklearn.ensemble.RandomForestClassifier训练模型2.设置参数:n_estimators=100,max_depth=10,random_state=423.在测试集上预测4.计算评估指标:-准确率(accuracy_score)-混淆矩阵(confusion_matrix)-精确率和召回率(precision_score,recall_score)-F1分数5.输出特征重要性排序(feature_importances_)6.用matplotlib画特征重要性柱状图7.用matplotlib画混淆矩阵热力图参考代码:fromsklearn.ensembleimportRandomForestClassifierfromsklearn.metricsimportaccuracy_score,confusion_matrix,classification_reportrf=RandomForestClassifier(n_estimators=100,max_depth=10,random_state=42)rf.fit(X_train,y_train)y_pred=rf.predict(X_test)要求:加注释,打印所有评估指标。提示:DeepSeek生成的代码可能在你的数据上报错——列名不匹配、数据类型不对等。把报错信息贴回去让AI修复。这就是"AI辅助+人工验证"的工作模式。✎记录模型准确率____%,精确率____%,召回率____%。步骤4:解读模型——什么因素影响购买做什么:模型不是黑箱——特征重要性告诉你"什么因素最影响购买决策"。用AI帮你解读。▍提示词(可直接复制到AI工具)我用随机森林模型预测了用户购买行为,特征重要性排序如下(请根据实际结果替换):1.最近7天浏览次数(重要性0.25)2.最近7天加购次数(重要性0.20)3.最近30天购买次数(重要性0.18)4.最近7天收藏次数(重要性0.12)5.注册天数(重要性0.10)模型准确率约75%,精确率约70%,召回率约65%。请帮我:1.解读特征重要性:哪些行为最能预测购买?为什么?2.评估模型效果:准确率75%够用吗?什么场景下需要更高?3.给出3条基于特征重要性的运营建议4.指出模型的局限性:哪些重要因素没有被纳入?5.如果要提升模型效果,下一步该怎么做?背景:社交电商平台,目标是预测用户未来7天是否会购买。提示:特征重要性不是因果关系。"浏览次数最重要"不意味着"浏览导致购买"——可能只是"有购买意愿的人浏览更多"。让AI解释这个区别。✎贴上AI的模型解读。写下你觉得最关键的1条运营建议。【避坑指南】⚠随机森林虽然不易过拟合,但max_depth太大或n_estimators太多仍会过拟合。用交叉验证选择参数。⚠如果正负样本比例严重不均衡(如95%是负样本),模型会偏向预测"不购买"。用class_weight='balanced'或SMOTE处理。⚠特征重要性只反映"模型学到了什么",不一定是"真实的因果关系"。业务理解比模型输出更重要。⚠AI可能用了你数据集没有的特征。拿到代码后检查特征名是否和你的数据匹配。【评价量表】评价维度评价标准分值原理理解能说出随机森林的原理和优势20特征工程特征提取合理,数据准备正确30建模评估模型训练成功,评估指标完整30模型解读特征重要性解读合理,建议可操作20合计自评____分互评____分教师评分____分100【拓展挑战】用DeepSeek生成代码:对比随机森林和逻辑回归两种模型的预测效果,画出ROC曲线对比图。分析哪个模型更适合这个场景并说明理由。第9章直播营销分析直播带货:数据指标+流失预测|直播是当下最火的带货方式。用数据算GMV、转化率、退货率,用DeepSeek预测客户流失。实训9-1直播数据指标分析:GMV/转化率/退货率建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:9-1【实训情境】你需要为直播团队开展运营复盘。主播说:"昨晚直播4小时,感觉卖得不错,但到底好不好?"你打开数据:在线人数、商品点击、下单、退款……几十个指标,怎么用Python快速算出核心指标、画出趋势图?【学习目标】□理解直播营销的核心数据指标(GMV、转化率、在线人数、退货率)□能使用pandas对直播数据做指标分析□能可视化直播数据趋势并给出复盘建议【成果交付】□一段直播数据指标分析代码□一页纸直播复盘报告(含关键指标+趋势图+3条建议)【操作步骤】步骤1:理解直播核心指标做什么:直播的指标体系比电商更复杂——有在线人数、停留时长、互动率等。先用AI搞清楚每个指标的含义。▍提示词(可直接复制到AI工具)你是直播电商数据分析导师。请用通俗语言解释以下直播核心指标:1.GMV(成交总额)vs实际销售额——有什么区别?2.在线人数vs累计观看人数——哪个更重要?3.平均停留时长——衡量什么?4.商品转化率——点击→下单→支付各环节的转化率5.退货率——高退货率说明什么问题?6.互动率(点赞+评论+分享/观看人数)7.UV价值(GMV/观看UV)8.GPM(千次曝光成交额)对每个指标:一句话定义+计算公式+好坏标准。最后用表格汇总,并标出"必看的5个指标"。提示:GMV是"看起来很美"的指标——不扣除退货。直播复盘一定要同时看GMV和实际销售额。让AI解释为什么有些团队只报GMV不报退货。✎写下GMV和实际销售额的区别是____,退货率的合理范围是____%。步骤2:用pandas计算直播核心指标做什么:概念清楚了,用pandas对直播数据做指标计算。▍提示词(可直接复制到AI工具)请用pandas写一段代码,对直播营销数据集做指标分析:假设数据集包含:timestamp,online_count,product_id,clicks,orders,payments,returns,amount1.计算GMV:sum(amount)2.计算实际销售额:sum(amount)-sum(returns_amount)3.计算退货率:退货金额/GMV4.计算商品转化率:payments/clicks(点击→支付转化率)5.计算平均在线人数:mean(online_count)6.计算峰值在线人数:max(online_count)7.计算UV价值:GMV/累计观看人数8.按时间段(每30分钟)分组,计算各时段GMV和在线人数9.找出GMV最高的TOP5商品要求:加注释,结果用print格式化输出。提示:直播数据通常按分钟或秒记录。用resample('30T')或groupby按时间段聚合,能看到直播间的"流量节奏"。✎记录GMV=____,退货率=____%,峰值在线=____人。步骤3:可视化直播趋势做什么:把直播过程画成图表——在线人数曲线、GMV累积曲线、商品销量排行。▍提示词(可直接复制到AI工具)请用matplotlib写一段代码,对直播数据做可视化:1.画在线人数变化折线图(横轴=时间,纵轴=在线人数),标注峰值点2.画GMV累积折线图(横轴=时间,纵轴=累计GMV)3.画TOP10商品销量柱状图4.画各时段转化率折线图5.在在线人数图上标注"上链接""抽奖""秒杀"等关键节点(如有)用subplots把1和2放在一张图里(双Y轴),方便对比在线人数和GMV的关系。要求:中文显示,图表美观,有标题和标签。提示:双Y轴图用ax1.twinx()创建第二个Y轴。左边画在线人数,右边画GMV——能看出"人多人少和卖多少的关系"。✎贴上趋势图截图。写下:在线人数峰值时GMV是否也最高?____步骤4:用AI写直播复盘报告做什么:数据算完了、图画完了,让DeepSeek帮你写一份复盘报告。▍提示词(可直接复制到AI工具)我已经分析了直播数据,得到以下结果:-直播时长4小时,平均在线800人,峰值2000人-GMV12万元,实际销售额9.6万元-退货率20%(行业平均约15%)-商品转化率3.5%(行业平均约2%)-TOP3商品贡献了60%的GMV-在线人数在开播1小时和倒数第3个链接时达到峰值请帮我写一份300字以内的直播复盘报告,包括:1.总体表现(1-2句)2.关键发现(3条,每条用数据支撑)3.优化建议(2条,明确下一次直播的具体改进措施)背景:校园美妆品牌直播,主播是大学生,首次直播。提示:复盘报告的核心是"下次改什么"。退货率20%高于行业平均——这是重点改进方向。让AI帮你分析退货率高的可能原因。✎贴上复盘报告。写下你最想改进的1项指标和你的行动计划。【避坑指南】⚠GMV不等于实际收入。退货率高的直播,仅观察GMV可能高估销售表现,必须同时考虑退货影响和实际销售额。。必须同时看GMV和实际销售额。⚠在线人数是"瞬时值"——不是累计观看人数。两个指标含义完全不同,不要搞混。⚠直播数据的timestamp可能是字符串格式。先用pd.to_datetime转换,否则resample会报错。⚠AI可能用你没有的数据字段(如"观看UV")。如果数据集没有这个字段,需要用累计在线人数的近似值代替。【评价量表】评价维度评价标准分值指标理解8个核心指标含义和公式描述正确25计算正确GMV/退货率/转化率等计算无误30可视化趋势图清晰,双Y轴图美观25复盘报告报告结构完整、数据支撑充分、建议可操作20合计自评____分互评____分教师评分____分100【拓展挑战】用DeepSeek生成代码:做"直播时段效率分析"——把直播分成8个时段(每30分钟),计算各时段的"人效"(GMV/平均在线人数),找出"人效最高"和"人效最低"的时段,分析原因。实训9-2客户流失预测:用DeepSeek建模建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)、scikit-learn实训编号:9-2【实训情境】直播团队积累了3个月的用户数据,老板问:"哪些老客户可能流失?我好提前给他们发优惠券。"教材在第9章引入了基于DeepSeek的客户流失预测。这节课用AI建模,"可能流失的客户"。【学习目标】□理解客户流失的定义和流失预测的业务价值□能使用DeepSeek生成流失预测模型代码并在Python中验证□能分析流失用户特征,制定挽留策略【成果交付】□一段客户流失预测代码(含特征工程、建模、评估)□一份流失用户特征分析报告+3条挽留策略【操作步骤】步骤1:理解客户流失做什么:什么叫"客户流失"?不同平台定义不同。先用AI搞清楚流失的定义和预测流失的业务价值。▍提示词(可直接复制到AI工具)你是客户关系管理(CRM)数据分析导师。请解释:1.什么是客户流失?电商平台和直播平台怎么定义"流失"?2.流失预测的业务价值:提前知道谁会流失,能做什么?3.流失用户的常见特征有哪些?(如:最近购买间隔变长、互动减少、投诉增加)4.流失预测属于什么类型的机器学习问题?(分类)5.除了随机森林,还有哪些算法适合做流失预测?(逻辑回归、XGBoost)6.流失预测的评估重点:精确率vs召回率,哪个更重要?用表格汇总关键概念。提示:流失预测中,召回率通常比精确率更重要——宁可"误杀"(把不流失的当流失),也不能"漏杀"(把真流失的漏掉)。让AI解释这个逻辑。✎写下客户流失的常见定义是____,评估流失模型时____率更重要。步骤2:数据探索与特征构建做什么:先看看数据长什么样,然后构建预测流失的特征。流失预测的特征工程比购买预测更复杂——要看用户行为的"变化趋势"。▍提示词(可直接复制到AI工具)请用pandas写一段代码,对直播用户数据做流失预测的特征工程:1.读取用户行为数据(含user_id,behavior_type,timestamp,amount等)2.定义流失标签:最近30天无任何互动行为的用户标记为"流失"(1),否则为"活跃"(0)3.提取以下特征:-最近购买距今天数(R)-30天内购买次数(F)-30天内消费总额(M)-30天内互动次数(点赞+评论+分享)-30天内观看直播次数-平均购买间隔天数-最近3个月购买次数变化趋势(递增/递减/平稳)4.检查正负样本比例5.用train_test_split分训练集和测试集6.打印特征概况和流失率要求:加注释,特征名清晰。提示:"变化趋势"特征是流失预测的关键——不只是看"现在做了多少",还要看"比以前多了还是少了"。让AI帮你设计更多趋势特征。✎记录总用户____人,流失用户____人,流失率____%。步骤3:用DeepSeek建流失预测模型做什么:教材在第9章引入了基于DeepSeek的客户流失预测。让AI生成完整的建模代码。▍提示词(可直接复制到AI工具)请帮我写一段客户流失预测代码:输入:X_train,X_test,y_train,y_test(特征+流失标签)步骤:1.用sklearn.ensemble.RandomForestClassifier建模2.设置class_weight='balanced'处理类别不均衡3.用GridSearchCV做简单的参数搜索(n_estimators:[50,100,200],max_depth:[5,10,15])4.用最佳模型在测试集上预测5.计算评估指标:准确率、精确率、召回率、F16.输出混淆矩阵和分类报告(classification_report)7.输出特征重要性排序8.用matplotlib画特征重要性柱状图和ROC曲线要求:加注释,打印所有结果。提示:GridSearchCV可能跑很慢。先用小参数集试,验证建模流程后再扩大搜索范围。让AI帮你估算运行时间。✎记录最佳模型参数:n_estimators=____,max_depth=____。召回率=____%。步骤4:分析流失用户特征+制定挽留策略做什么:模型建完了,要能用。用DeepSeek分析"流失用户有什么共同特征",制定挽留策略。▍提示词(可直接复制到AI工具)我用随机森林模型预测了客户流失,模型召回率约70%。特征重要性排序如下(请根据实际结果替换):1.最近购买距今天数(0.30)2.30天内互动次数(0.22)3.平均购买间隔天数(0.15)4.30天内购买次数(0.12)5.30天内观看直播次数(0.10)高流失风险用户的共同特征:-最近购买间隔>20天-30天互动次数<3次-购买间隔逐渐变长请帮我:1.分析每个重要特征与流失的关系(为什么重要)2.设计3条分层挽留策略:-高风险用户(最近购买间隔>30天):做什么?-中风险用户(最近购买间隔15-30天):做什么?-低风险用户(最近购买间隔<15天):做什么?3.每条策略的预算和预期效果4.指出模型召回率70%的局限性——还有30%的流失用户没被识别,怎么办?背景:直播电商团队,用户约1万人,月均流失率约8%。提示:挽留策略的核心是"在用户彻底流失前介入"。不同风险等级用不同力度的策略——高风险用重力度(如大额优惠券),低风险用轻力度(如推送提醒)。✎贴上AI的流失分析和挽留策略。写下你觉得最有创意的1条策略。【避坑指南】⚠流失的定义直接影响模型效果。30天不活跃vs60天不活跃,模型完全不同。先和业务方确认定义。⚠流失预测中类别不均衡很常见(90%活跃+10%流失)。用class_weight='balanced'或SMOTE处理,否则模型偏向预测"不流失"。⚠召回率比精确率重要——在业务成本允许的情况下,可优先提高流失用户召回率,同时控制误判成本。但也不要为了召回率而使精确率下降到缺乏业务可用性的水平。⚠AI可能用了你数据集没有的特征。先确认特征名称和你的数据匹配再跑代码。【评价量表】评价维度评价标准分值概念理解能解释流失定义和预测价值,知道召回率更重要20特征工程特征构建合理,趋势特征设计到位30建模评估模型训练成功,参数搜索和评估完整30挽留策略3条策略分层合理,预算和预期效果清晰20合计自评____分互评____分教师评分____分100【拓展挑战】用DeepSeek生成代码:做"流失预警仪表盘"——对每个用户计算流失概率分数(0-100),按分数从高到低排序,输出TOP50高风险用户名单和他们的特征数据,可以直接交给运营团队。第10章短视频营销分析短视频带货:特征提取+效果预测|短视频是流量的新入口。用数据提取商品特征、用决策树预测推广效果。实训10-1短视频商品数据特征提取与可视化建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)实训编号:10-1【实训情境】你帮一个短视频带货团队分析数据。老板问:"什么样的短视频更容易带出货?"你打开数据集:视频时长、点赞、评论、分享、商品价格、销量……怎么用Python提取关键特征、画出"什么样的视频带货好"?【学习目标】□理解短视频营销数据的特征维度□能使用pandas对短视频数据做特征提取和转换□能可视化短视频数据分布并发现规律【成果交付】□一段特征提取与可视化代码□一页纸"短视频带货规律"分析报告(含图表+3条发现)【操作步骤】步骤1:理解短视频营销数据做什么:短视频数据有哪些字段?每个字段衡量什么?先用AI搞清楚数据结构。▍提示词(可直接复制到AI工具)你是短视频营销数据分析导师。请解释:1.短视频营销数据通常包含哪些维度?-视频特征:时长、类型、是否含商品链接-互动数据:播放量、点赞、评论、分享、收藏-商品数据:商品价格、类目、销量、转化率-用户特征:粉丝量、达人等级、垂直领域2.短视频带货的核心指标有哪些?(GPM、转化率、ROI)3.短视频营销和直播营销的数据有什么区别?4.短视频的"完播率"为什么重要?5.5W模式(Who/What/Where/When/Why)在短视频营销中怎么应用?用表格汇总关键指标。提示:短视频和直播的最大区别:直播是"实时互动",短视频是"内容沉淀"。短视频的数据更偏内容质量(完播率、互动率),直播更偏实时转化。✎写下短视频和直播数据最大的区别是____。步骤2:特征提取与转换做什么:用pandas对短视频数据做特征提取——包括品类特征数值化、衍生特征计算。▍提示词(可直接复制到AI工具)请用pandas写一段代码,对短视频营销数据做特征提取:假设数据集包含:video_id,duration,views,likes,comments,shares,favorites,product_id,product_price,product_category,sales,conversion_rate1.计算衍生特征:-互动率=(likes+comments+shares+favorites)/views-完播率(如果有完播数据)-点赞率=likes/views-评论率=comments/views-分享率=shares/views2.品类特征数值化:用LabelEncoder将product_category转为数值3.将duration分桶:短视频(<30s)、中视频(30-60s)、长视频(>60s)4.计算"带货效率"=sales/views(每千次播放带来的销量)5.检查各特征的统计摘要和分布6.用matplotlib画各特征分布直方图要求:加注释,输出特征概况。提示:特征衍生是数据分析的"创造性"环节——从已有字段计算出更有商业含义的新字段。如"互动率"比单独看点赞数更能衡量内容质量。✎记录互动率均值是____%,带货效率均值是____。步骤3:可视化——发现带货规律做什么:用Matplotlib画出短视频数据的分布和关系,发现"什么样的视频带货好"。▍提示词(可直接复制到AI工具)请用matplotlib写一段代码,对短视频数据做可视化分析:1.画视频时长分布饼图(短/中/长)2.画互动率vs转化率散点图(按品类着色)3.画各品类平均带货效率柱状图4.画播放量vs销量散点图(看看有没有线性关系)5.画TOP10视频的互动数据柱状图6.用subplots把1-4放在一张大图里要求:中文显示,图表美观,有标题和标签。提示:散点图能发现"规律"——如果互动率和转化率呈正相关,说明"内容越好卖得越多"。让AI帮你计算相关系数验证。✎贴上可视化截图。写下你发现的最有价值的1条规律。步骤4:用AI解读规律+给优化建议做什么:图画完了,让DeepSeek帮你把图表变成可执行的优化建议。▍提示词(可直接复制到AI工具)我分析了短视频带货数据,发现以下规律:-30秒以内的短视频平均带货效率最高-互动率与转化率呈正相关(相关系数约0.65)-美妆类和食品类视频带货效果最好-播放量与销量没有显著线性关系(播放高不等于卖得多)-分享率高的视频,带货效率也高请帮我:1.解读每条发现背后的原因2.给出3条短视频优化建议(具体到"拍什么、怎么拍、拍多长")3.指出分析的局限性——还有什么因素没纳入?4.如果要进一步优化,下一步该分析什么数据背景:校园品牌短视频带货团队,每周发3-5条短视频,主打美妆产品。提示:"播放量高不等于卖得多"是短视频带货的核心发现——内容质量和商品匹配度比流量更重要。让AI帮你分析什么样的内容能同时获得高播放和高转化。✎贴上AI的分析和建议。写下你最想尝试的1条优化建议。【避坑指南】⚠互动率=互动数/播放量。如果播放量是0(视频刚发布),互动率会报错。用try-except或加条件判断处理。⚠品类特征数值化时,LabelEncoder的数字没有大小关系(如"美妆"=0,"食品"=1不代表美妆<食品)。如果模型把它当连续变量,需要用OneHotEncoder。⚠视频时长分桶的边界不是固定的。30秒、60秒是经验值,不同平台可能不同。⚠AI可能用了你没有的字段(如"完播率")。如果数据集没有,可以用"平均观看时长/视频时长"近似。【评价量表】评价维度评价标准分值特征提取衍生特征计算正确,品类特征数值化合理30可视化4张以上图表清晰,有标题和标签30规律发现3条发现基于数据、有逻辑支撑25优化建议建议具体到"拍什么、怎么拍",可操作15合计自评____分互评____分教师评分____分100【拓展挑战】用DeepSeek生成代码:做"短视频内容聚类分析"——用k-means把视频按特征(时长、互动率、转化率、品类)聚成3-4类,给每类视频起名(如"爆款型""长尾型""种草型"),并分析每类视频的带货特点。实训10-2商品推广效果预测:决策树模型实战建议学时:2学时难度:进阶使用工具:DeepSeek(免费)、Python(JupyterNotebook)、scikit-learn实训编号:10-2【实训情境】短视频团队老板问:"我发一条新视频,能卖多少?能不能提前预测?"教材在第10章引入了基于DeepSeek的商品推广分析及预测。这节课用决策树模型来预测短视频的推广效果。【学习目标】□理解决策树模型的基本原理和可解释性优势□能使用DeepSeek生成决策树预测代码并在Python中验证□能可视化决策树并解读规则,给出
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年事业单位招聘公安干警岗位专业知识冲刺押题
- 登革热防控方案(2025年版)
- 2026年居民健康档案管理规范试题及答案
- T/CI 1218-2025铝制飞翼式空冷换热器管束
- T/CHBAS 4-2022石甘薯1号标准化栽培技术规程
- T/CFA 0310021-2023铸造企业规范条件
- T/NAHIEM 167-2026消化内镜中心建设与设备配置标准
- 2025年江苏省宜兴市高二历史下册期末考试模拟卷含答案【完整版】
- 2026年河南省偃师市高考历史自测卷含完整答案(名校卷)
- T/ICIA 0028-2024输电线路杆塔倾斜高精度在线监测装置技术规范
- 网络传播法规(自考14339)复习题库(含答案)
- 测量部安全管理制度
- 广东肇庆市怀集县(2020-2024年)事业单位招聘工作人员笔试真题及入职考生经验(A类综合知识)
- 项目式学习实施心得体会
- 2024年卫生部手术分级目录四级手术部分
- 临床护理教学管理规范
- DB22T 2200-2014 社区脑卒中高危人群筛查与防治规范
- 门店协议合同范例
- 汽油发动机电控燃油喷射系统认识与检修
- 双人心肺复苏术操作评分标准
- 《人体损伤致残程度分级》
评论
0/150
提交评论