Python财务数据分析与应用(微课版)- 教案 第6章 财务数据挖掘_第1页
Python财务数据分析与应用(微课版)- 教案 第6章 财务数据挖掘_第2页
Python财务数据分析与应用(微课版)- 教案 第6章 财务数据挖掘_第3页
Python财务数据分析与应用(微课版)- 教案 第6章 财务数据挖掘_第4页
Python财务数据分析与应用(微课版)- 教案 第6章 财务数据挖掘_第5页
已阅读5页,还剩1页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

课次/学时:第1次课/2学时

本次课题目(内容):

线性回归模型原理与财务预测实战(一元/多元线性回归)

学习目标:理解一元/多元线性回归数学模型及参数意义(斜率/截距)。掌握回归模型评估指标(R方/MAPE)的业务解读方法。运用LinearRegression完成上市公司营收预测建模全流程。教学重点、难点:重点:最小二乘法原理、train_test_split数据集划分、metrics.r2_score评估。难点:多重共线性识别(如资产总计/负债合计高度相关)、MAPE误差解读(<10%为优秀)。

教学资源:

上市公司营收数据集(营业成本/资产总计等11字段)、JupyterNotebook代码模板、特征相关性热力图案例。

课堂教学创新点:财务诊断视角:解读回归系数(如"营业成本系数1.22→每投入1元成本创收1.22元营收")。陷阱预警:演示未标准化数据导致系数失真(资产总计系数-9636的误导性)。

教学过程设计:原理剖析(30分钟)一元回归公式推导:最小二乘法动画演示:误差平方和最小化过程关键指标解读:R方=0.99→模型解释99%波动MAPE=0.21→平均预测误差21%一元回归实战(40分钟)数据可视化:plt.scatter绘制营业成本-营收散点图(图6-1)模型训练与诊断:Pythonlm=LinearRegression()

lm.fit(X_train,y_train)#X=营业成本

print('斜率:',lm.coef_[0])#输出1.2248业务结论:成本与营收强线性相关(R方>0.99)多元回归进阶(30分钟)特征工程陷阱:展示未标准化时资产总计系数失真(-9636)解决方案:Pythonscaler=StandardScaler()#数据标准化

X_scaled=scaler.fit_transform(X)优化后结果:营业成本系数1.076(业务合理)课程总结与答疑:

强调财务建模铁律:先验证特征相关性(热力图),再标准化数据,最后解读系数经济含义。

教学反思:

课次/学时:第2次课/2学时

本次课题目(内容):

逻辑回归原理及信用风险预测实战

学习目标:理解Sigmoid函数与概率映射机制掌握混淆矩阵指标(准确率/召回率)在风控场景的应用。完成个人信用风险预测模型(特征:收入/负债/历史逾期等)。教学重点、难点:重点:LogisticRegression模型训练、predict_proba()概率输出、classification_report评估。难点:召回率与精确率的权衡(风控侧重召回率→减少漏判高风险客户)。教学资源:

个人信用数据集(20个特征/5万样本)、阈值调整动态可视化工具。

课堂教学创新点:银行业务还原:设定不同阈值(0.3/0.5/0.7)演示通过率与坏账率变化。伦理讨论:分组辩论"是否应拒绝40%逾期概率的低收入群体"。教学过程设计:原理精讲(25分钟)Sigmoid函数演示:1/(1+e^(-z))将线性输出映射为[0,1]概率决策边界:概率>0.5判定为违约(可调整)风控核心指标:召回率=抓出坏人/全部坏人→避免漏判(目标>85%)精确率=真坏人/判为坏人→减少误伤模型开发(35分钟)特征工程:独热编码处理职业类型,标准化连续变量训练与评估:Pythonfromsklearn.linear_modelimportLogisticRegression

lr=LogisticRegression()

lr.fit(X_train,y_train)

print(classification_report(y_test,lr.predict(X_test)))输出示例:召回率0.88→每100个坏人识别出88个阈值调优实战(30分钟)业务场景模拟:阈值=0.3:召回率92%→坏账少但拒绝大量好客户阈值=0.7:召回率65%→坏账多但客户体验好代码实现:Pythony_proba=lr.predict_proba(X_test)[:,1]#违约概率

y_pred=(y_proba>0.4).astype(int)#调整阈值课程总结与答疑:

强调逻辑回归本质是分类模型,财务场景中需按业务目标(风控/营销)动态调整阈值。

教学反思:

课次/学时:第3次课/2学时

本次课题目(内容):

K均值聚类原理与企业盈利能力分级实战

学习目标:掌握K均值算法流程(初始化→分配→更新→迭代)。运用肘部法则(KElbowVisualizer)确定最佳K值。完成上市公司盈利能力聚类分级(ROE/净利率/营收增速)。教学重点、难点:重点:轮廓系数解读(>0.5说明聚类合理)、聚类中心业务标签定义。难点:特征权重分配(如ROE比营收增速更重要)、高维数据降维(PCA)。教学资源:

上市公司财务指标数据集(3年ROE/净利率/营收增速)、聚类结果雷达图模板。

课堂教学创新点:投资策略生成:定义聚类中心为"现金牛/成长型/风险型"企业可视化创新:用雷达图对比三类企业盈利特征(图10-3)教学过程设计:算法解析(30分钟)K均值动画演示:质点移动与样本重分配过程关键概念:肘部法则:寻找SSE下降拐点(K=3处斜率突变)轮廓系数:计算样本与同类/异类距离比(公式演示)盈利能力聚类(40分钟)数据预处理:Pythonfromsklearn.preprocessingimportStandardScaler

scaler=StandardScaler()

X_scaled=scaler.fit_transform(df[['ROE','净利率','营收增速']])确定K值:Pythonfromyellowbrick.clusterimportKElbowVisualizer

visualizer=KElbowVisualizer(KMeans(),k=(2,10))

visualizer.fit(X_scaled)#显示肘点K=3业务解读聚类中心:类别ROE净利率增速标签022.3%15.8%5.2%现金牛18.1%3.4%32.7%成长型2-3.2%-1.5%-8.4%风险型报

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论