《Python机器学习:原理与实践(第3版)》课件 -第1-7章 机器学习概述-数据预测建模:支持向量机_第1页
《Python机器学习:原理与实践(第3版)》课件 -第1-7章 机器学习概述-数据预测建模:支持向量机_第2页
《Python机器学习:原理与实践(第3版)》课件 -第1-7章 机器学习概述-数据预测建模:支持向量机_第3页
《Python机器学习:原理与实践(第3版)》课件 -第1-7章 机器学习概述-数据预测建模:支持向量机_第4页
《Python机器学习:原理与实践(第3版)》课件 -第1-7章 机器学习概述-数据预测建模:支持向量机_第5页
已阅读5页,还剩162页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第1章机器学习概述人工智能中的机器学习

机器学习中的大数据机器学习的主要任务符号主义人工智能:基于“一切都可规则化编码”的基本信念:通过硬编码,依指定规则自动完成相应的处理任务例:依据BMI判断肥胖棋类对弈程序专家系统(没有常识的专家系统是没有意义的)符号主义人工智能(弱人工智能)很难解决没有明确规则定义的问题(诸如语言翻译、语音识别、图像分类等)不能仅依据BMI对肥胖进行判断人工智能中的机器学习

诞生于20世纪50年代的人工智能(ArtificialIntelligence,AI),因旨在实现人脑部分思维的计算机模拟,完成人类智力任务的自动化实现通用人工智能:会听(语音识别和机器翻译等)、会看(文字识别和图像识别等)、会说(语音合成和人机对话等)、会学习(知识表示和机器学习等)、会思考(逻辑推理和人机对弈)和会行动(机器人和自动驾驶等)的能力人工智能的研究经历了从符号主义人工智能(symbolicAI)、机器学习(MachineLearning)、深度学习(DeepLearning)的不同发展阶段第1章机器学习概述人工智能中的机器学习

第1章机器学习概述人工智能的研究经历了从符号主义人工智能(symbolicAI),到机器学习(MachineLearning)到深度学习(DeepLearning)的不同发展阶段。符号主义人工智能:基于“一切都可规则化编码”的基本信念机器学习概念的提出源于“人工智能之父”阿兰·图灵的图灵测试:“思考的机器”是可能的机器学习目的:教计算机借助某些算法完成任务相对于经典的程序设计范式,机器学习是一种新的编程范式人工智能中的机器学习

实现新的编程范式的核心任务发现隐藏在“数据”和“答案”中的“规则”理论可行性:1763年贝叶斯提出的贝叶斯定理存在一种能够从历史经验,即数据集中的“数据”和“答案”中,学习两者之间关联性“规则”的数学方法将“数据”和“答案”视为一种广义数据,借助数学方法学习“规则”的本质是基于数据的建模从机器学习到深度学习从数据中学习“数据表示”强调基于训练数据,通过众多连续的神经网络层,过滤和提取数据中的服务于预测的重要特征相对于拥有众多层的深度学习,机器学习有时也被称为浅层学习(ShallowLearning)第1章机器学习概述机器学习中的大数据机器学习的对象:数据集合,简称数据集(也称样本集)结构化数据示例:结构化数据一般以由多个行和列组成的二维表形式组织数据集中的一行通常称为一个样本观测数据集中的一列通常称为一个变量(特征)依各变量的取值类型可将变量细分为:数值型、顺序型和类别型三类,后两类统称为分类型补充:不同视角下的数据集合经典统计中的样本;基于样本对总体特征或关系进行推断机器学习中的数据集,一般不具有随机样本的典型特征第1章机器学习概述机器学习中的大数据

半结构化数据:既包括定长的变量也包括部分非定长的变量,且各样本观测并非都由共同的变量属性构成非结构化数据的JSON(JavaScriptObjectNotation)格式示例:第1章机器学习概述非结构化数据:文本、图像、音频和视频数据非结构化数据中的图象数据采用行列点阵方式处理图像数据,类似于计算机汉字的字形码点阵设计思路非结构化数据中的文本数据文本处理和组织的最基本步骤和方式第1章机器学习概述文本分词,即将一条文本(也称文本序列)分割成单个的“词语”或“标记”将词语进行重新编码为一个或多个整型数,称为词语向量化。有很多词语向量化的方法,如独热编码(one-hotencoding)、TF-IDF法、词嵌入(wordembedding)等将向量化后的文本数据整理成结构化数据的组织形式机器学习的主要任务

数据预测:基于已有数据集,归纳出输入变量和输出变量之间的数量关系回归预测和分类预测(二分类预测和多分类预测)目的:在数量关系具有普适性和未来不变的假设下,可用于对新数据输出变量取值的预测发现对输出变量产生重要影响的输入变量例如:空气质量数据的分析补充:方法特点:经典统计一般为验证式分析;机器学习的归纳式分析特点(从统计的模型驱动到机器学习的数据驱动)统计方法有严格的数理支撑;机器学习探索式的试验发现第1章机器学习概述数据聚类发现数据中可能存在的小类,并通过小类刻画和揭示数据的内在组织结构聚类结果:给每个样本观测指派一个属于哪个小类的标签,称为聚类解。聚类解将保存在一个新生成的分类型变量中例如:数据聚类和数据预测中的分类有联系更有区别联系:都是给每个样本观测指派一个类标签区别:数据预测中的变量有输入变量和输出变量之分,且输出变量类标签的真实值已知数据聚类中的所有变量均为聚类变量,且小类标签即聚类解的真实值未知第1章机器学习概述机器学习的主要任务

补充:其他方面关联分析:寻找到事物之间的联系规律,发现它们之间的关联性模式诊断:模式(Pattern)是一个数据集合,由分散于数据集中的极少量的零星数据组成。模式通常具有其他众多数据所没有的某种局部的、非随机的、非常规的特殊结构或相关性。模式诊断就是要从不同角度采用不同方法发现数据中可能存在的模式第1章机器学习概述第2章Python机器学习基础Python:机器学习的首选工具Python的集成开发环境:AnacondaPython第三方包的引用NumPy使用示例Pandas使用示例NumPy和Pandas的综合应用Matplotlib的综合应用Seaborn的综合应用Python:机器学习的首选工具

Python是一款面向对象的解释型计算机语言。开源、代码可读性强,可实现高效开发等是Python的重要特征面向对象的程序设计(ObjectOrientedProgramming,OOP)是相对面向过程的程序设计而言的OOP采用“封装”的思想,将具有一定独立性和通用性的处理过程和变量(数据),封装在“对象”中变量称为对象的“属性”,变量值对应属性值(有具体变量值的对象称为“对象实例”)处理过程称为对象的“方法”多个具有内在联系的对象可进一步封装在“类”中Python在机器学习领域获得广泛使用的原因:简明易用,严谨专业良好的开发社区生态丰富的第三方程序包NumPyPandasSciPyMatplotlibSeabornScikit-learn(skLearn)第2章Python机器学习基础Python的集成开发环境:Anaconda

Anaconda:兼容Linux、Windows和MacOSX.环境,支持Python2.X和Python3.X,且可方便快捷完成机器学习和数据科学任务的开源IDE通常将Anaconda可视为Python的发行版Anaconda®Anaconda的官方下载地址为:/第2章Python机器学习基础Python的集成开发环境:Anaconda

AnacondaPrompt的使用第2章Python机器学习基础Python的集成开发环境:Anaconda

Spyder的使用:

Python程序的扩展名为.py第2章Python机器学习基础JupyterNotebook的使用:

1984年提出的文字表达化编程形式的具体体现是一个基于网页的交互式笔记本;扩展名为.ipynb的JSON格式文件第2章Python机器学习基础Python第三方包的引用第三方包以模块(Moduel,文件扩展名为.py)方式,将可实现各种功能的程序代码(变量、函数)“打包”在一起包由多个相关模块组成,一般以文件目录的形式组织(目录名为包名)引用第三方包中的模块的基本函数:import函数import

包名或模块名:导入指定包或模块import

包名.模块名:导入指定包中的指定模块from

模块名

import函数名:导入指定模块中的指定函数from

模块名

import

函数名1,函数名2,…:导入指定模块中的若干个指定函数from

模块名

import*:导入指定模块中的所有函数可增加:as别名importnumpyasnp,表示导入numpy并指定别名为np指定别名可以有效避免不同模块有相同函数名的问题之后可在自己编写的Python程序直接调用已导入模块中的函数,通过代码重用(重复使用)的方式快速实现某种特定功能第2章Python机器学习基础

列表:Python重要的数据组织形式,NumPy数组数据的重要来源NumPy数组中元素应有相同的数据类型,列表可以不同Chapter2-1.ipynb第2章Python机器学习基础NumPy(NumericalPython)使用示例:最常用的

Python

包。特点:第二,拥有丰富的数学运算和统计函数指定种子的目的是确保每次运行代码时生成的随机数可以再现。否则,每次运行代码生成的随机数会不相同random.randn()生成服从均值为0标准差为1的标准正态分布的随机数Chapter2-1.ipynb第2章Python机器学习基础NumPy(NumericalPython)使用示例:最常用的

Python

包。特点:第二,拥有丰富的数学运算和统计函数random.normal()函数生成2行5列的2维数组,数组元素服从均值为5标准差为1的正态分布利用floor函数得到距各数组元素最近的最大整数eye(5)函数生成5行5列的单位阵YChapter2-1.ipynb第2章Python机器学习基础Pandas(Pythondataanalysis)使用示例:提供了快速便捷组织和处理结构化数据的数据结构和大量功能丰富的函数。特点:基于NumPy构建:序列(Series):对应1维数组数据框(DataFrame):对应2维表格型数据结构,也称数据框为序列的容器Pandas数据框是存储机器学习数据集的常用形式Pandas的索引Chapter2-2.ipynb第2章Python机器学习基础Pandas的数据框Chapter2-2.ipynb第2章Python机器学习基础Pandas的数据加工处理Chapter2-2.ipynb第2章Python机器学习基础NumPy和Pandas的综合应用:空气质量监测数据的预处理和基本分析数据预处理Chapter2-3.ipynb第2章Python机器学习基础基本分析NumPy和Pandas的综合应用:空气质量监测数据的预处理和基本分析Chapter2-3.ipynb第2章Python机器学习基础派生虚拟自变量NumPy和Pandas的综合应用:空气质量监测数据的预处理和基本分析Chapter2-3.ipynb第2章Python机器学习基础抽取数据子集NumPy和Pandas的综合应用:空气质量监测数据的预处理和基本分析Chapter2-3.ipynb第2章Python机器学习基础AQI的时序变化特点Matplotlib的综合应用:空气质量监测数据的图形化展示Chapter2-4.ipynb第2章Python机器学习基础AQI的分布特征及相关性分析Matplotlib的综合应用:空气质量监测数据的图形化展示Chapter2-4.ipynb第2章Python机器学习基础探究各年PM2.5的统计分布特征Seaborn的综合应用:空气质量监测数据的图形化展示Chapter2-4.ipynb第2章Python机器学习基础探究各年PM2.5的统计分布特征Seaborn的综合应用:空气质量监测数据的图形化展示Chapter2-4.ipynb第2章Python机器学习基础探究不同空气质量等级下PM2.5的统计分布特征Seaborn的综合应用:空气质量监测数据的图形化展示Chapter2-4.ipynb第2章Python机器学习基础探究AQI和各种污染物浓度之间的相关性Seaborn的综合应用:空气质量监测数据的图形化展示Chapter2-4.ipynb第2章Python机器学习基础第3章数据预测中的关键问题线性回归预测模型线性分类预测模型从线性预测模型到非线性预测模型预测模型的参数估计预测模型的性能评估和选择导言

数据预测,简而言之就是基于已有数据集,归纳出输入变量和输出变量之间的数量关系。基于这种数量关系,实现:发现对输出变量产生重要影响的输入变量在数量关系具有普适性和未来不变的假设下,对新数据输出变量取值的预测细分:对数值型输出变量的预测称为回归预测--回归预测模型对分类型输出变量的预测称为分类预测--分类预测模型数据预测涉及的关键问题第一,预测模型基础第二,预测模型的参数估计方法第三,预测模型的性能评估和选择第3章数据预测中的关键问题线性回归预测模型

线性回归预测模型的数学形式及其含义线性回归预测模型用于预测的回归方程应明确模型系数的实际含义应明确预测模型与回归方程的联系

第3章数据预测中的关键问题线性回归预测模型

第3章数据预测中的关键问题线性回归预测模型

第3章数据预测中的关键问题残差线性回归预测模型

线性回归预测模型的Python应用实践:PM2.5浓度预测建立一元线性回归模型Chapter3-1.ipynb第3章数据预测中的关键问题线性回归预测模型

线性回归预测模型的Python应用实践:PM2.5浓度预测建立多元线性回归模型Chapter3-1.ipynb第3章数据预测中的关键问题启示与探究:可通过增加模型的复杂度减少模型的预测误差

增加模型复杂度可以有效降低模型的预测误差,但当复杂度达到一定程度后再继续增加就不再有意义了Chapter3-2.ipynb第3章数据预测中的关键问题再看一般线性回归模型对响应概率建模,称为:一般线性概率模型一般线性概率模型的不足:无法保证模型给出的概率值限制在0-1范围内线性概率模型反映了概率与自变量取值之间的线性而非一般经验上的非线性关系例:收入和购买某奢侈品的概率线性分类预测模型

第3章数据预测中的关键问题二项Logistic回归:0/1二分类预测模型

线性分类预测模型

第3章数据预测中的关键问题

补充:二项Logistic回归中模型系数的含义:

优势(odds)优势比(OddsRatio)因为:项Logistic回归模型中:于是:

输入变量变化一个单位引起响应概率比(相对风险)近似为exp(β)接近0时

第3章数据预测中的关键问题

线性分类预测模型第3章数据预测中的关键问题二项Logistic回归的拓展:多分类的Softmax回归线性分类预测模型第3章数据预测中的关键问题Softmax回归因称为Softmax函数而得名为确保:,需对概率进行归一化处理:线性分类预测模型

线性分类模型的几何理解二分类预测建模的目的,就是找到一条能够将不同形状或颜色的样本观测点有效分开的分类线,即分类边界分类直线分类平面第3章数据预测中的关键问题线性分类预测模型

二分类预测模型中的评价指标混淆矩阵注意:总错判率会受数据不平衡性的影响TPR(真正率)TNR1-TNR=FPR(假正率)第3章数据预测中的关键问题

查全率也称召回率(Recall)第3章数据预测中的关键问题

第3章数据预测中的关键问题

第3章数据预测中的关键问题线性分类预测模型的Python应用实践:空气质量等级预测建立简单二分类预测模型数据预处理建立二项Logistic回归模型

chapter3-3.ipynb

第3章数据预测中的关键问题线性分类预测模型的Python应用实践:空气质量等级预测建立简单二分类预测模型第3章数据预测中的关键问题绘制二项Logistic回归模型的分类边界计算分类模型的评价指标chapter3-3.ipynb建立较复杂的二项Logistic回归模型计算模型的混淆矩阵,总正确率,F1得分评价模型:采用二分类模型评价的图形化方式:ROC曲线和PR曲线评价模型预测精度优于简单模型第3章数据预测中的关键问题线性分类预测模型的Python应用实践:空气质量等级预测建立较复杂的二分类预测模型预测模型的图形化评价工具

ROC曲线:接受者操作特征(receiveroperatingcharacteristic,ROC)曲线,是机器学习中常用的二分类预测模型图形化评价的重要工具ROC曲线的纵坐标为TPR,横坐标为FPR绘图步骤:按预测概率降序排序取分位点上的概率值作为判断1/0的概率阈值计算TPR和FPR,点连线曲线越远离对角线越好ROC曲线下的面积:AUC(areaunderthecurve)值AUC越大越好PR曲线,与ROC曲线同理绘制第3章数据预测中的关键问题第3章数据预测中的关键问题线性分类预测模型的Python应用实践:空气质量等级预测建立较复杂的二分类预测模型第3章数据预测中的关键问题线性分类预测模型的Python应用实践:空气质量等级预测建立较复杂的多分类预测模型提高预测精度从直线到曲线,从平面到曲面

从线性预测模型到非线性预测模型

解决非线性回归和非线性分类问题:从直线到曲线,从平面到曲面第3章数据预测中的关键问题

预测模型的参数估计

总损失:第3章数据预测中的关键问题平方损失函数是关于模型未知参数的函数

预测模型的参数估计

其中:第3章数据预测中的关键问题

预测模型的参数估计

第3章数据预测中的关键问题预测模型未知参数的估计策略通过各种策略,在由全部模型参数解构成的解空间(solutionspace)中,找到一组使损失函数值达到最小的解预测模型的参数估计第3章数据预测中的关键问题预测模型未知参数的估计策略参数的最小二乘估计损失函数L是模型参数的非负二次函数

第3章数据预测中的关键问题思考:如何理解这个曲面?损失函数如何找到曲面取最小时的点(C点)?需一定的优化搜索策略如梯度下降法

参数估计的梯度下降法:通过迭代,利用关于L曲率的局部信息,引导在L曲面上进行局部搜索

问:如何能够减少迭代次数?

预测模型的性能评估和选择

涉及两个问题:第一,如何估计预测模型未来的预测性能?两个重要概念训练误差:指预测模型对训练集中各样本观测输出变量的实际值与预测值不一致程度的数值化度量。泛化误差:是预测模型对新数据集进行预测时,给出的预测值和实际值不一致程度的数值化度量。预测误差测度模型在未来新数据集上的预测性能。泛化误差值较低,说明模型具有一般预测场景下的普适性和推广性,认为模型有较高的泛化能力训练误差和泛化误差的不同预测建模时可直接计算出预测模型的训练误差泛化误差是未知的,无法直接计算得到,只能给出泛化误差的估计值第二,当前这个复杂度较高的“理想”的模型,其预测性能真的理想?不一定第3章数据预测中的关键问题训练误差、测试误差和泛化误差的估计训练集(trainingset)和训练误差训练集T:用于估计预测模型参数(也称训练预测模型)的数据集,其中的样本观测称为“袋内观测”训练误差如何降低训练误差模型复杂度样本量第3章数据预测中的关键问题预测模型的性能评估和选择在恰当的训练样本量下,增加模型的复杂度会带来训练误差的降低模型复杂度确定的条件下,训练误差会随样本量增加而下降

第3章数据预测中的关键问题预测模型的性能评估和选择旁置法:将整个数据集随机划分为两个部分留一法:用N-1个样本观测作为训练集训练模型,用剩余的一个样本观测作为测试集计算模型的测试误差K折交叉验证:首先将数据集随机近似等分为不相交的K份,称为K折;然后,令其中的K-1份为训练集训练模型,剩余的1份为测试集计算测试误差数据集的划分策略:将所得数据集划分为训练集和测试集第3章数据预测中的关键问题预测模型的性能评估和选择Python模拟和启示:理解测试误差利用旁置法划分数据集并探究随模型复杂度增加,训练误差和测试误差的变化趋势和形态chapter3-2-1.ipynb第3章数据预测中的关键问题Python模拟和启示:理解测试误差数据集划分策略和测试误差计算的Python实现chapter3-2-1.ipynb第3章数据预测中的关键问题预测模型的过拟合问题模型过拟合:在以训练误差最小原则下可能出现的,预测模型远远偏离输入变量和输出变量的真实关系,从而在新数据集上有较大预测误差的现象预测性能良好的模型,通常是复杂度适中、训练误差在可接受的范围内且测试误差较低,即泛化能力较强的模型如何判断过拟合预测模型的训练误差较小但测试误差较大,是模型过拟和的重要表现之一测试误差变化的U字形曲线右侧拐点后对应的模型都是过拟合模型模型欠拟合:模型在训练集和测试集上均有较大的预测误差第3章数据预测中的关键问题预测模型的稳健性:权衡偏差和方差预测模型中的“佼佼者”是复杂度适中的模型适中复杂度不仅避免了过拟合问题,确保了较高的泛化能力,同时也决定了模型在预测中的高稳健性稳健性也称鲁棒性(robustness)第3章数据预测中的关键问题预测模型的性能评估和选择

预测模型的偏差和方差

第3章数据预测中的关键问题预测模型的性能评估和选择预测模型的偏差和方差预测模型的偏差-方差分解:

第3章数据预测中的关键问题预测模型的性能评估和选择

简单模型具有高偏差和低方差,模型的预测稳健性高复杂模型具有低偏差和高方差,模型的预测稳健性低。因为复杂模型的特点是“紧随数据点”,训练集的微小变化都可能使模型参数的估计结果产生较大波动,使得预测值有较大不同(高方差),模型鲁棒性较差第3章数据预测中的关键问题预测模型的性能评估和选择第4章数据预测:贝叶斯分类器贝叶斯概率和贝叶斯法则朴素贝叶斯分类器贝叶斯分类器在文本分析中的应用贝叶斯概率和贝叶斯法则

第4章数据预测建模:贝叶斯分类器

先验概率数据似然后验概率

如何直观解决这个问题?大部分顾客购买吗?购买顾客中的特征是怎样的?

第4章数据预测建模:贝叶斯分类器贝叶斯分类器例如:对性别等于1、年龄段为A的顾客是否购买进行预测

假定对于给定的购买行为,性别和年龄段条件独立:朴素贝叶斯分类器

第4章数据预测建模:贝叶斯分类器

第4章数据预测建模:贝叶斯分类器Python模拟和启示:认识朴素贝叶斯分类器的分类边界chapter4-2.ipynb贝叶斯正确预测的点:实心圆;错误的点:+颜色表示不同类别第4章数据预测建模:贝叶斯分类器Python应用实践:空气质量等级预测chapter4-3.ipynb第4章数据预测建模:贝叶斯分类器贝叶斯分类器的应用:法律裁判文书中的案情要素分类以“中国裁判文书网”公开的有关婚姻家庭领域的2665条裁判文书为例,基于文书句子文本和每个句子对应的要素标签(多分类),探索朴素贝叶斯分类器在文本分类中的应用Python文本数据的预处理:文本分词和词的向量化分词:将句子分割成若干个词,该过程称为分词结巴(jieba)是使用较为普遍的Python中文分词组件之一朴素贝叶斯分类器在文本分类中的应用

chapter4-4.ipynb第4章数据预测建模:贝叶斯分类器

第4章数据预测建模:贝叶斯分类器词的向量化TfidfVectorizer可指定停用词和最大特征词数30个特征词(词频高)30个特征词的IDFX:以适合稀疏矩阵表示的方式输出X转为二维数组后:chapter4-4.ipynb第4章数据预测建模:贝叶斯分类器Python文本描述性分析:词云图和文本相似性chapter4-4.ipynb第4章数据预测建模:贝叶斯分类器Python文本分析综合应用:裁判文书的要素提取文本和文本标签的组织:通常采用JSON格式组织文本和对应的文本分类标签。JSON(JavaScript

Object

Notation)

是一种典型的便于数据共享的格式文本,在Python中与字典结构相对应Python字典:由键和值构成例如:{"labels":[],"sentence":"原告林某某诉称:我与被告经人介绍建立恋爱关系,于1995年在菏泽市民政局办理结婚登记手续。"}JSON格式的文本文件:具体步骤:读入JSON格式的裁判文书数据,并以Python的字典组织数据对裁判文书进行分词处理,计算TF-IDF值确定特征词作为输入变量利用旁置法按7:3的比例划分训练集和测试集基于训练集,利用朴素贝叶斯分类器建立多要素标签的预测模型计算训练误差和测试误差,并对比预测模型对不同要素标签的预测情况第4章数据预测建模:贝叶斯分类器Python文本分析综合应用:裁判文书的要素提取chapter4-4.ipynb第4章数据预测建模:贝叶斯分类器第5章数据预测建模:近邻分析近邻分析:K-近邻法回归预测中的K-近邻法分类预测中的K-近邻法基于观测相似性的加权K-近邻法近邻分析:K-近邻法

第5章数据预测建模:近邻分析

“近朱者赤,近墨者黑”

第5章数据预测建模:近邻分析

近邻分析:K-近邻法

第5章数据预测建模:近邻分析回归预测中的K-近邻法Python模拟和启示:参数K和K-近邻法的回归线Chapter5-1-1.ipynb基于K-近邻建立回归预测模型可以实现非线性回归预测1-近邻模型的复杂度最高,随参数K的增大,模型复杂度逐渐降低,训练误差逐渐增高尽管参数K较小的高复杂度模型,其训练误差小但预测方差较大且可能出现过拟合;而参数K较大的低复杂度模型,虽然其预测方差较小但训练误差较大且可能是欠拟合的第5章数据预测建模:近邻分析回归预测中的K-近邻法Python模拟和启示:参数K和K-近邻法的回归面Chapter5-1-1.ipynb思考:K的作用?选择一个合理的参数K对回归预测建模是非常重要的K-近邻法中的参数K是一个人为可调的参数,称为模型的超参数。模型的超参数(hyperparameter)是训练模型前由开发者手动设定的参数,会对模型的预测性能以及训练速度等产生重要影响。超参数的最优取值无法基于训练集自动调整得到,需借助一些调优策略确定第5章数据预测建模:近邻分析回归预测中的K-近邻法Python模拟和启示:参数K和K-近邻法的回归面选择一个合理的参数K对回归预测建模是非常重要的K-近邻法中的参数K是一个人为可调的参数,称为模型的超参数模型的超参数(hyperparameter)是训练模型前由开发者手动设定的参数,会对模型的预测性能以及训练速度等产生重要影响超参数的最优取值无法基于训练集自动调整得到,需借助一些调优策略确定第5章数据预测建模:近邻分析分类预测中的K-近邻法

第5章数据预测建模:近邻分析Python模拟和启示:参数K和分类边界随着参数K由小增大,分类边界越来越趋于规则和平滑,边界不再“紧随数据点”,模型复杂度由高到低,训练误差由小到大K-近邻法的分类预测模型复杂度更高(K较小时),更适合解决非线性分类问题Chapter5-1.ipynb第5章数据预测建模:近邻分析K-近邻法与Logistic回归模型、朴素贝叶斯分类器的对比:K-近邻法的模型复杂度更高(K较小时),更适合解决非线性分类问题K-近邻法是一种基于局部的学习

贝叶斯正确预测的点:实心圆;错误的点:+颜色表示不同类别第5章数据预测建模:近邻分析基于观测相似性的加权K-近邻法

第5章数据预测建模:近邻分析

第5章数据预测建模:近邻分析

基于观测相似性的加权K-近邻法第5章数据预测建模:近邻分析Python模拟和启示:认识加权K-近邻法的分类边界这里加权K-近邻法,预测效果与普通1-近邻法持平,较为理想能够有效克服1-近邻法方差大、鲁棒性低的不足Chapter5-3.ipynb第5章数据预测建模:近邻分析

第5章数据预测建模:近邻分析基于观测相似性的加权K-近邻法空气质量等级的预测:超参数K的调优数据集的重新划分:训练集;验证集;测试集验证集用于确定模型的超参数;验证集上的误差称为验证误差K-近邻分析中的超参数K应取验证误差最小下的K第5章数据预测建模:近邻分析K-近邻法的Python应用实践Chapter5-4.ipynb第5章数据预测建模:近邻分析空气质量等级的预测:超参数K的调优第6章数据预测建模:决策树决策树的基本概念回归预测中的决策树分类预测中的决策树决策树的生长和剪枝经典决策树算法:CART决策树的Python应用实践决策树的基本概念

决策树:得名于其分析结果的展示方式类似一棵倒置的树,分为:分类树:分类预测;回归树:回归预测概念:树节点和树分枝:最大树深度:是树根到树叶的最大层数,通常作为决策树模型复杂度的一种度量每个父节点下均仅有两个子节点的决策树称为2叉树,否则为多叉树根据节点所在层,节点由上至下分为根节点、中间节点和叶节点第6章数据预测建模:决策树决策树是数据反复分组的图形化体现决策树是推理规则的图形化展示决策树中每个节点都应一条推理规则推理规则通过逻辑判断的形式反映输入变量和输出变量之间的取值规律决策树的预测决策树基于叶节点的推理规则实现对新数据的分类预测或回归预测

决策树的深层含义

第6章数据预测建模:决策树回归预测中的决策树

决策树的回归面这些小平面的平滑连接将形成一个不规则的曲面,该曲面就是决策树给出的用于回归预测的回归曲面

第6章数据预测建模:决策树Python模拟和启示:树深度对回归面的影响树深度起到了平衡模型复杂度和误差的作用决策树的树深度越大,得到的小平面就越多。这些小平面的平滑连接将形成一个起伏极不规则的回归曲面,可有效解决非线性回归预测问题如何确定空间划分的先后顺序和位置是决策树(回归树)算法的核心Chapter6-1.ipynb第6章数据预测建模:决策树分类预测中的决策树

决策树的分类边界

第6章数据预测建模:决策树Python模拟和启示:树深度对分类边界的影响树深度起到了平衡模型复杂度和误差的作用决策树的树深度越大,相邻的矩形区域就越多。这些矩形区域边界(直线)的平滑连接将形成一个极不规则的分类边界(曲线),可有效解决非线性分类预测问题如何确定空间划分的先后顺序和位置是决策树(分类树)算法的核心Chapter6-2.ipynb第6章数据预测建模:决策树Python模拟和启示:树深度对分类边界的影响--非线性分类边界第6章数据预测建模:决策树决策树的生长:确定数据分组的基本原则;确定决策树继续生长的条件确定数据分组的基本原则使每次分组所得的两个组内的输出变量取值的异质性尽量低依据该原则从众多输入变量中选择一个当前的“最佳”分组变量和组限值回归树:每一步空间划分时应同时兼顾由此形成的两个区域决策树的生长和剪枝努力使两区域包含的观测点,其输出变量的取值差异尽量小,异质性尽量低低异质性下的回归预测误差小,也即由此得到的两个区域是离差平方和(或MSE)最小下的两个区域:依该原则从众多输入变量中选择一个当前的“最佳”分组变量和组限值

第6章数据预测建模:决策树决策树的生长:确定数据分组的基本原则;确定决策树继续生长的条件确定数据分组的基本原则使每次分组所得的两个组内的输出变量取值的异质性尽量低依据该原则从众多输入变量中选择一个当前的“最佳”分组变量和组限值分类树:每一步空间划分时应同时兼顾由此形成的两个区域决策树的生长和剪枝努力使两区域包含的样本观测点尽量“纯正”,异质性(Impurity)低低异质性下,其分类预测错判率低,推理规则的置信度高依该原则从众多输入变量中选择一个当前的“最佳”分组变量和组限值第6章数据预测建模:决策树决策树的生长:确定数据分组的基本原则;确定决策树继续生长的条件确定决策树继续生长的条件通常有最大树深度、最小样本量、最小异质性下降值三个预设参数可事先指定决策树的最大树深度,到达指定深度后就不再继续生长。可事先指定节点的最小样本量。节点样本量不应低于最小值,否则相应节点将不能继续分枝可事先指定相邻节点中输出变量异质性下降的最小值。异质性下降不应低于最小值,否则相应节点将不能继续分枝一般将通过预设参数值限制树生长的策略,称为对决策树做预修剪(pre-pruning)决策树的生长和剪枝第6章数据预测建模:决策树决策树的剪枝:对所得的决策树,按照从叶节点向根节点的方向,逐层剪掉某些节点分枝的过程。相对于预剪枝,这里的剪枝也称为后剪枝(post-pruning)决策树的生长和剪枝树深度和误差之间的关系第6章数据预测建模:决策树CART:ClassificationAndRegressionTree,分类回归树分类回归树CART为2叉树,包括分类树和回归树从算法效率角度考虑,树生长过程采用贪心算法,确定当前“最佳”分组变量和组限值,并通过自顶向下的递归二分策略实现空间区域的划分贪心算法是一种不断寻找当前局部最优解的算法相对上图而言,下图是一种迭代二分策略CART的分类树和回归树研究的输出变量类型不同,树生长中测度输出变量异质性的指标不同经典决策树算法:分类回归树第6章数据预测建模:决策树CART中回归树的异质性度量方差输出变量的异质性下降:方差的减少依方差下降最大为原则,从众多输入变量中选择一个当前的“最佳”分组变量和组限值

CART的生长第6章数据预测建模:决策树CART中分类树的异质性度量基尼(Gini)系数:输出变量的异质性下降:基尼系数的减少依基尼系数下降最大为原则,从众多输入变量中选择一个当前的“最佳”分组变量和组限值熵和熵的下降:

第6章数据预测建模:决策树CART中分类树的异质性度量基尼系数还是熵CART的生长Chapter6-3.ipynb第6章数据预测建模:决策树

CART的后剪枝

第6章数据预测建模:决策树

CART的剪枝第6章数据预测建模:决策树

第6章数据预测建模:决策树

CART的剪枝

第6章数据预测建模:决策树空气质量等级的分类预测:超参数调优决策树的Python应用第6章数据预测建模:决策树Chapter6-4.ipynb空气质量等级的分类预测:各个超参数的网格搜索策略网格搜索策略:一种暴力穷举的超参数调优方法首先指定各个超参数的取值范围,然后在给定的超参数空间内穷举每一种可能的参数组合,最终选出使模型性能最佳的一个组合作为最优参数组合网格搜索策略的计算成本较高第6章数据预测建模:决策树Chapter6-4.ipynbChapter6-4.ipynb空气质量等级的分类预测:各个超参数的随机搜索策略随机搜索策略:一种在超参数空间中随机选择超参数组合的方法不穷举所有的参数组合,因而无法保证能够找到最优组合,但通过随机选择组合能够在较短时间内探索较大的超参数空间第6章数据预测建模:决策树Chapter6-4.ipynb

Chapter6-4-1.ipynb第6章数据预测建模:决策树

药物适用性研究:变量重要性的探讨因需探究主要影响因素,可限制树的生长Chapter6-5.ipynb第6章数据预测建模:决策树药物适用性研究:推理规则的输出及决策树的可视化

Chapter6-5.ipynb第6章数据预测建模:决策树第7章数据预测建模:支持向量机支持向量分类概述完全线性可分下的支持向量分类广义线性可分下的支持向量分类线性不可分下的支持向量分类Python应用实践导言

第7章数据预测建模:支持向量机支持向量机(SupportVectorMachine,SVM)是在统计学习理论(StatisticalLearningTheory,SLT)基础上发展起来的一种机器学习方法(1992年由Boser,Guyon和Vapnik提出)在解决小样本、非线性和高维的分类预测和回归预测问题上有许多优势支持向量机分为支持向量分类机和支持向量回归机讨论的问题涉及:第一、支持向量分类概述第二、完全线性可分下的支持向量分类第三、广义线性可分下的支持向量分类第四、线性不可分下的支持向量分类支持向量分类概述

第7章数据预测建模:支持向量机支持向量分类的基本思路如果两类样本观测点能够被超平面有效分开,则可能会找到多个这样的超平面支持向量分类算法确定的分类超平面:是具有最大边界的超平面,是距两类别的边缘观测点最远的超平面支持向量分类概述

固定迭代次数下,不同初始参数的神经网络给出分类边界应采用哪个超平面进行预测呢?第7章数据预测建模:支持向量机支持向量分类的基本思路支持向量分类中的超平面:具有最大边界的超平面,是距两类别的边缘观测点最远的超平面最大边界超平面的意义:有较高的预测置信度最大边界超平面仅取决于两类边缘上的观测点:这些样本观测称为支持向量,预测具有很强的鲁棒性

第7章数据预测建模:支持向量机支持向量分类概述

支持向量分类的基本思路支持向量分类的三种情况线性可分样本:样本观测点可被超平面线性分开的情况完全线性可分样本无法完全线性可分(广义线性可分)线性不可分样本第7章数据预测建模:支持向量机完全线性可分下的支持向量分类

以二维空间为例:首先,分别将两类的最外围的样本观测点连线形成两个多边形,应是关于两类样本点集的凸包(ConvexHull),最小凸多边形(各自类的样本观测点均在多边形内或边上)然后,以一类的凸包边界为基准线,找到另一类凸包边界上的点,过该点做基准线的平行线,得到一对平行线可以有多条这样的基准线和对应的平行线,应找到:相距最远,且能正确划分两类的一对平行线最大边界超平面(线):平行于该对平行线、位于该对平行线的中间位置上第7章数据预测建模:支持向量机

完全线性可分下的支持向量分类

第7章数据预测建模:支持向量机

完全线性可分下的支持向量分类

第7章数据预测建模:支持向量机

完全线性可分下的支持向量分类

第7章数据预测建模:支持向量机

完全线性可分下的支持向量分类:理想

Python模拟与启示:认识支持向量Chapter7-2.ipynb第7章数据预测建模:支持向量机广义线性可分下的超平面:采用适当的宽松策略,允许部分样本观测点进入“禁区”:广义线性或线性软间隔支持向量分类广义线性可分下的支持向量分类

第7章数据预测建模:支持向量机

广义线性可分下的支持向量分类第7章数据预测建模:支持向量机Python模拟与启示:认识误差惩罚参数C广义线性可分下的超平面

Chapter7-3.ipynb第7章数据预测建模:支持向量机

广义线性可分下的支持向量分类

只能要求两项之和最小第7章

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论