版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
机器学习
项目5
逻辑回归算法实战15.1.1逻辑回归算法的基本原理25.1.2逻辑回归模型的参数选择目录CONTENTS015.1.1逻辑回归算法的基本原理逻辑回归算法的基本原理一、算法概述逻辑回归(LogisticRegression)又称逻辑斯谬回归,是一种经典的分类算法。尽管线性回归和逻辑回归的名称中都包含“回归”一词,但它们的应用场景不同:•线性回归模型用于解决回归问题(预测连续数值)•逻辑回归模型用于解决分类问题(预测离散类别)例如:根据空气湿度、风速和光照强度等因素:•回归问题:预测未来的降雨量(单位为mm)•分类问题:判断是否下雨(是或否)逻辑回归算法巧妙地以“回归”之名行“分类”之实,在概率映射与线性决策之间架起了桥梁。回归模型与分类模型的区别回归任务:寻找一条能够尽可能贴合所有数据点分布趋势的线(拟合曲线),预测连续的数值输出。分类任务:寻找一条“决策边界”,将不同类别的数据点尽可能清晰地分隔开来,预测离散类别。
(a)回归
(b)分类图5-1
回归与分类的区别逻辑回归的核心思想二、核心思想线性决策边界在特征空间中寻找一条
线性决策边界(直线或超平面),
将不同类别的数据点尽可能
清晰地区分开来。概率拟合逻辑回归本质上是一种基于
概率的拟合方法,通过拟合
方式确定分类边界,使边界
匹配数据分布规律。优化算法通过最大似然估计和梯度下降
等优化算法寻找最优参数,
使预测概率与真实类别的差异
最小。逻辑回归模型可以视为一种概率估计模型,将线性回归的预测值经过Sigmoid函数转换为概率值,从而实现从回归到分类的转换。Sigmoid函数介绍三、Sigmoid函数在二分类问题中,如果直接使用线性回归来预测目标变量y,则预测结果可能并不会严格是0或1。逻辑回归引入了一个归一化函数,将y的预测值映射到(0,1)区间。这个函数被称为逻辑函数(logisticfunction),也称为Sigmoid函数。公式:g(z)=1/(1+e^(-z))当z趋近无穷大时,g(z)趋近1;当z趋近无穷小时,g(z)趋近0。1表示正向类别,0表示负向类别。图5-2
Sigmoid函数的图像Sigmoid函数图像分析函数特性分析:•Sigmoid函数把(-∞,+∞)的值映射到(0,1)•函数在z=0时取值0.5,是分类阈值•函数关于z原点对称•导数g'(z)=g(z)(1-g(z))•输出值>0.5则分类为1类(正类)•输出值<0.5则分类为0类(负类)•输出值越靠1,属于正类的概率越大•输出值越靠0,属于负类的概率越大Sigmoid函数的图像逻辑回归模型的工作流程流程说明:1.数据准备:收集并预处理原始特征数据X2.特征加权求和:计算z=w·x+b,其中w为权重系数,b为截距3.Sigmoid映射:将z输入Sigmoid函数,得到概率值P(y=1|X)=g(z)4.概率输出:输出介于0和1之间的概率值5.分类决策:以阈值0.5为界,判定样本类别逻辑回归的优缺点优点•计算代价低,易于理解和实现•训练速度较快,适合大规模数据集•存储资源占用较少•可解释性强,系数反映特征贡献•输出为概率值,直观易懂•对小样本表现稳健•适合二分类和多分类任务•不需要特征缩放(数据标准化后)缺点•容易欠拟合,对非线性关系建模能力有限•特征表达能力不足时表现较差•复杂分类任务中性能不如非线性模型•对特征之间的多重共线性敏感•需要手动设置超参数•对缺失值数据较为敏感•决策边界为线性,处理复杂边界困难•不适合高维度稀疏数据025.1.2逻辑回归模型的参数选择逻辑回归模型的参数选择一、模型参数与超参数模型参数(权重系数)•由模型在训练过程中自动学习得到•反映各特征对预测结果的贡献程度•通过梯度下降等优化算法确定•目标:使模型预测概率与真实类别的差异最小•包括:特征权重w和截距b•训练完成后自动确定,无需手动设置超参数(调控旋钮)•在模型训练前由研究人员手动设定•用于控制训练过程与模型行为•直接影响模型的复杂度、收敛速度与泛化能力•常见超参数:正则化强度、学习率、迭代次数•同“调控旋钮”一样调节模型表现•合理设置是构建高性能模型的关键过拟合与欠拟合过拟合(Overfitting)模型在训练集上表现很好,但在测试集上表现差,泛化能力不足。当特征过多或存在多重共线性时容易发生。欠拟合(Underfitting)模型无法充分拟合数据的分布规律,在训练集和测试集上都表现不佳。当特征关系高度非线性或特征表达能力不足时容易发生。正则化技术核心思想:在损失函数中引入惩罚项,约束模型参数的大小,迫使模型更简单、平滑,防止过拟合。超参数C的作用C值调节谱:从小到大C值较小•惩罚强度λ较大•对模型复杂度的约束力强•模型更简单•过于简单可能导致欠拟合•正则化效果较强•模型泛化能力较强C值较大•惩罚强度λ较小•模型受的约束较小•模型可以更复杂•过于复杂可能导致过拟合•正则化效果较弱•模型泛化能力较弱参数选择策略与注意事项参数描述常用取值影响penalty正则化方法'L1'/'L2'影响损失函数优化C正则化系数的倒数浮点型,默认1.0值越小正则化越强solver优化算法'lbfgs'/'liblinear'影响收敛速度和内存max_iter最大迭代次数整型,默认100优化算法运行上限class_weight类别权重'balanced'/None样本类别比例调节fit_intercept是否拟合截距True/False是否添加截距项注意事项:(1)解决过拟合首选L2正则化;仍过拟合则考虑L1正则化;特征多时可用L1做特征选择。(2)penalty控制正则项形式,C控制正则项强度;两者需协同调整。(3)'liblinear'和'lbfgs'适用于小数据集;'sag'和'saga'适用于大数据集(收敛更快)。(4)多分类问题:multi_class='ovr'时可选全部4种solver;'multinomial'时不能用'liblinear'。参数选择总结模型参数与超参数的区别•模型参数:由模型在训练过程中自动学习,反映特征对预测的贡献程度•超参数:训练前手动设定,控制训练过程与模型行为,如“调控旋钮”正则化的作用•在损失函数中引入惩罚项,约束模型参数大小,防止过拟合•L1正则化:产
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年河南南阳市辅警结构化面试真题
- 2025年生态环境综合执法岗《尾矿库监管执法》题库附答案
- 2026年广西林业集团招聘试题及答案
- 2026年甘肃药业投资集团招聘试题及答案
- 2026年抖音电商达人考试试题及答案
- 妇科儿科医院考试试题及答案
- 2026年英语老师口语考试试题及答案
- 医院儿科上半年总结
- 医院工会-工作总结
- 招商营运人员考试试题及答案
- 2026小学四年级语文学科学业质量评价方案
- 危险化学品重大危险源企业安全隐患排查重点课件
- 2026年泌尿外科老年患者泌尿护理要点
- 2026海南省生态环境监测中心公开招聘事业编制人员10人笔试备考题库及答案详解
- 龋病的健康宣教
- TCECS 273-2024 组合楼板技术规程
- 2026年工会劳动法律监督题库及答案
- 人教版二年级全册《体育与健康》全套课件
- GJB3243A-2021电子元器件表面安装要求
- 海湾-gst-qkp01控制器说明书fas ver
- 油田化学剂现状及其发展趋势课件
评论
0/150
提交评论