人工智能基础及应用(工科通识版)课件 第3章 机器学习概论_第1页
人工智能基础及应用(工科通识版)课件 第3章 机器学习概论_第2页
人工智能基础及应用(工科通识版)课件 第3章 机器学习概论_第3页
人工智能基础及应用(工科通识版)课件 第3章 机器学习概论_第4页
人工智能基础及应用(工科通识版)课件 第3章 机器学习概论_第5页
已阅读5页,还剩28页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

机器学习概论第三章机器学习是人工智能的一个分支。人工智能的研究历史有着一条从以“推理”为重点,到以“知识”为重点,再到以“学习”为重点的自然、清晰的脉络。显然,机器学习是实现人工智能的一个途径,即以机器学习为手段解决人工智能中的问题。简单的说,机器学习是一门从数据中研究算法的科学学科。是根据已有的数据,进行算法的选择,并基于算法和数据结构构建模型,最终对未来进行预测。通过数据一个模型——>预测未知属性。本章将向读者介绍机器学习基本概念、机器学习三要素和核心、机器学习开发流程、常见机器学习算法、机器学习的发展及分类、机器学习中常用的术语解析。本章主要知识点:机器学习三要素和核心机器学习开发流程机器学习的发展及分类机器学习中常用的术语解析目录01机器学习简介02机器学习的发展史和分类03机器学习常用术语04Sklearn机器学习简介什么是机器学习机器学习在近30多年已发展为一门多领域交叉学科,涉及概率论、统计学、逼近论、凸分析(英语:Convexanalysis)、计算复杂性理论等多门学科。机器学习理论主要是设计和分析一些让计算机可以自动“学习”的算法。机器学习算法是一类从数据中自动分析获得规律,并利用规律对未知数据进行预测的算法。因为学习算法中涉及了大量的统计学理论,机器学习与推断统计学联系尤为密切,也被称为统计学习理论。算法设计方面,机器学习理论关注可以实现的,行之有效的学习算法。很多推论问题属于无程序可循难度,所以部分的机器学习研究是开发容易处理的近似算法。机器学习已广泛应用于数据挖掘、计算机视觉、自然语言处理、生物特征识别、搜索引擎、医学诊断、检测信用卡欺诈、证券市场分析、DNA序列测序、语音和手写识别、战略游戏和机器人等领域。机器学习三要素和核心按照统计机器学习的观点,任何一个机器学习方法都是由模型(model)、策略(strategy)和算法(algorithm)三个要素构成的,具体可理解为机器学习模型在一定的优化策略下使用相应求解算法来达到最优目标的过程。机器学习三要素和核心机器学习的第一个要素是模型。机器学习中的模型就是要学习的决策函数或者条件概率分布,一般用假设空间(hypothesisspace)F来描述所有可能的决策函数或条件概率分布。机器学习的第二个要素是策略。简单来说,就是在假设空间的众多模型中,机器学习需要按照什么标准选择最优模型。对于给定模型,模型输出f(X)和真实输出Y之间的误差可以用一个损失函数(lossfunction),也就是L(Y,F(X))来度量。机器学习的第三个要素是算法。这里的算法有别于所谓的“机器学习算法”,在没有特别说明的情况下,“机器学习算法”实际上指的是模型。当一个机器学习问题的模型、策略和算法都确定了,相应的机器学习方法也就确定了,因而这三者也叫“机器学习三要素”。机器学习开发流程机器学习开发流程需求分析旨在明确项目的航向与目标,为项目的顺畅推进铺设蓝图,设定里程碑。1机器学习项目的核心命脉在于数据。在数据充盈的领域,如电商、O2O、直播及短视频界,企业常自备数据源。然而,于数据稀缺或隐私性强的行业,如医疗领域,数据获取则颇为艰难。数据之源多样:用户行为轨迹、业务数据、第三方数据(如爬虫采集)及公开数据集,皆为可用之材。2数据之旅需历经筛选、填补缺失、剔除异常、整合多源、汇总归纳等关卡。3数据之特征几何?类别繁多否?目标变量分布如何?自变量与目标变量间关系,是否需要以可视化手法呈现?各变量缺失值状况怎样?应对缺失之策何在?此等疑问,皆需借由探索性数据分析(EDA)与数据可视化之旅,逐一探寻答案。在此过程中,我们将揭开数据的神秘面纱,洞察其内在规律,为后续分析奠定坚实基础。4机器学习开发流程指标描述Scikit-learn函数Precision精确度fromsklearnmetricsimportprecision_scoreRecall召回率fromsklearnmetricsimportrecall_scoreF1F1指标fromsklearnmetricsimportf1_scoreConfusionmatrix混淆矩阵fromsklearnmetricsimportconfusion_matrixROCROC曲线fromsklearnmetricsimportrocAUCROC曲线下的面积fromsklearnmetricsimportauc建模调优与特征工程之间本身是个交互性的过程,在实际工作中我们可以一边进行调参,一边进行特征设计,交替进行,相互促进,共同改善模型表现。在调优过程中同时包括对模型的评估,即调优的模型是否更优秀。评估的指标主要有准确率、召回率、精确率、F值等。5机器学习开发流程经过一定的特征工程和模型调优之后,一般会有一个阶段性的最优模型结果,模型对应的关键性能指标都会达到最优状态。这时候需要通过一定的方式呈现模型,并对模型的业务含义进行解释。6给出一份分析报告不是一个机器学习项目的最终目的,将模型部署到生产环境并能切实产生收益才是机器学习的最终价值所在。716种经典机器学习算法算法训练方式线性回归监督学习逻辑回归监督学习线性判别分析监督学习决策树监督学习朴素贝叶斯监督学习K近邻监督学习学习向量量化监督学习支持向量机监督学习随机森林监督学习AdaBoost监督学习高斯混合模型非监督学习限制波尔兹曼机非监督学习K-means聚类非监督学习最大期望算法非监督学习主成分分析算法非监督学习机器学习发展史与分类机器学习的发展史机器学习的起源可以追溯到1949年赫布理论的诞生,赫布于1949年基于神经心理的提出了一种学习方式,该方法被称之为赫布学习理论。它在20世纪70年代层陷入了瓶颈期,而后大数据时代开始,机器学习也在大数据的支持下复兴,因此我们可以大致将它的理念和运作模式从大数据时代前后分为浅层学习和深度学习。1)浅层学习阶段1949年,DonaldHebb提出的赫布理论解释了学习过程中大脑神经元所发生的变化。赫布理论的诞生标志着机器学习领域迈出了第一步。1950年,阿兰·图灵创造了图灵测试来判定计算机是否智能。1952,IBM科学家亚瑟·塞缪尔开发了一个跳棋程序。1957年,罗森·布拉特基于神经感知科学背景提出了第二模型,非常的类似于今天的机器学习模型。3年后Widrow提出了Delta学习规则,也就是差量学习规则,即如今的最小二乘问题。1967年,最近邻算法(Thenearestneighboralgorithm)出现,使计算机可以进行简单的模式识别。在1969年,Minsky提出了异域问题,指出了感知器的本质缺陷——面对线性不可分问题时的无力。机器学习的发展史2)深度学习阶段伟博斯在1981年的神经网络反向传播(BP)算法中具体提出多层感知机模型。在1985-1986年,机器学习在海量数据的支持下攀上了新的高峰,神经网络研究人员(鲁梅尔哈特,辛顿,威廉姆斯-赫,尼尔森)相继提出了使用BP算法训练的多参数线性规划(MLP)的理念。昆兰于1986年提出了一种非常出名的机器学习算法,我们称之为“决策树”,更具体的说是ID3算法。1990年,Schapire最先构造出一种多项式级的算法,这就是最初的Boosting算法。1995年,Freund和schapire改进了Boosting算法,提出了AdaBoost(AdaptiveBoosting)算法。在2000年左右提出了带核函数的支持向量机后,SVM在许多以前由NN占据的任务中获得了更好的效果。神经网络研究领域领军者Hinton在2006年提出了神经网络DeepLearning算法,使神经网络的能力大大提高,向支持向量机发出挑战。2006年,机器学习领域的泰斗Hinton和他的学生Salakhutdinov在顶尖学术刊物《Scince》上发表了一篇文章,开启了深度学习在学术界和工业界的浪潮。机器学习的发展史当前统计学习领域最热门方法主要有deeplearning和SVM(supportvectormachine),它们是统计学习的代表方法。可以认为神经网络与支持向量机都源自于感知机。神经网络模型貌似能够实现更加艰难的任务,如目标识别、语音识别、自然语言处理等。但是,应该注意的是,这绝对不意味着其他机器学习方法的终结。尽管深度学习的成功案例迅速增长,但是对这些模型的训练成本是相当高的,调整外部参数也是很麻烦。同时,SVM的简单性促使其仍然最为广泛使用的机器学习方式。机器学习分类根据算法类型,机器学习可以分为四类,即监督学习(SupervisedLearning)、半监督学习(Semi-SupervisedLearning)、无监督学习(UnsupervisedLearning)、和强化学习(ReinforcementLearning)。机器学习分类监督学习(SupervisedLearning)监督学习使用标记过的数据进行训练。所谓标记过的数据,指的是包含已知输入和输出的原始数据。其中输入数据中的每个变量都称为一个特征(Feature)值,而输出数据则是针对这些输入数据的输出的期望值,也称标签(Label)值。主要解决两类问题,即回归(Regression)和分类(Classification)。常用的监督学习算法包括K邻近算法(K-NearestNeighbors,KNN)、线形回归(LinearRegression)、逻辑回归(LogisticRegression)、支持向量机(SupportVectorMachine,SVM)、朴素贝叶斯(NaiveBayes)、决策树(DecisionTree)、随机森林(RandomForest)、神经网络(NeuralNetwork)和卷积神经网络(ConvolutionalNeuralNetworks,CNN)等。机器学习分类半监督学习(Semi-SupervisedLearning)半监督学习与监督学习的应用场景相同,主要面向分类和回归。但半监督学习使用的原始数据只有一部分有标签。因为无标签数据的获取成本更低,在实际场景中,用户会倾向于使用少量的标签数据与大量的无标签数据进行训练。常用的半监督学习算法包括协同训练(Co-Training)和转导支持向量机(TransductiveSupportVectorMachine,TSVM)等。机器学习分类无监督学习(UnsupervisedLearning)与监督学习不同,无监督学习所使用的原始数据的输出部分没有标签,也就是说,在训练的时候并不知道期望的输出是什么。所以,无监督学习并不像监督学习那样预测输出结果,而是解决输入数据的聚类(Clustering)和特征关联(Correlation)问题,目标是通过训练来发现输入数据中存在的共性特征,或者发现特征值之间的关联关系。简单来说,无监督学习中,给定的数据集没有“正确答案”,所有的数据都是一样的。无监督学习的任务是从给定的数据集中,挖掘出潜在的结构。机器学习分类强化学习强化学习主要由智能体(Agent)、环境(Environment)、状态(State)、动作(Action)、奖励(Reward)组成。智能体执行了某个动作后,环境将会转换到一个新的状态,对于该新的状态环境会给出奖励信号(正奖励或者负奖励)。随后,智能体根据新的状态和环境反馈的奖励,按照一定的策略执行新的动作。上述过程为智能体和环境通过状态、动作、奖励进行交互的方式。强化学习的目标是学习最好的策略,通常用于机器人、自动驾驶、游戏和棋类等,最典型的场景就是打游戏。机器学习常用术语机器学习常用术语机器学习是一门专业性很强的技术,它大量地应用了数学、统计学上的知识,任何一门算法都会涉及到许多数学上的术语或者公式。在本教程写作的过程中也会涉及到很多数学公式,以及专业的术语,在这里我们先对常用的基本术语做一下简单讲解。1模型模型这一词语将会贯穿整个教程的始末,它是机器学习中的核心概念。你可以把它看做一个“魔法盒”,你向它许愿(输入数据),它就会帮你实现愿望(输出预测结果)。整个机器学习的过程都将围绕模型展开,训练出一个最优质的“魔法盒”,它可以尽量精准的实现你许的“愿望”,这就是机器学习的目标。2数据集数据集,从字面意思很容易理解,它表示一个承载数据的集合,数据集可划分为“训练集”和“测试集”,它们分别在机器学习的“训练阶段”和“预测输出阶段”起着重要的作用。机器学习常用术语3样本&特征样本指的是数据集中的数据,一条数据被称为“一个样本”,通常情况下,样本会包含多个特征值用来描述数据。4向量向量是机器学习的关键术语。向量在线性代数中有着严格的定义。向量也称欧几里得向量、几何向量、矢量,指具有大小和方向的量。向量的计算可采numpy来实现。5矩阵矩阵也是一个常用的数学术语,你可以把矩阵看成由向量组成的二维数组,数据集就是以二维矩阵的形式存储数据的。机器学习常用术语6假设函数&损失函数&优化方法假设函数(HypothesisFunction)可表述为y=f(x)其中x表示输入数据,而y表示输出的预测结果,而这个结果需要不断的优化才会达到预期的结果,否则会与实际值偏差较大。损失函数(LossFunction)又叫目标函数,简写为L(x),这里的x是假设函数得出的预测结果“y”,如果L(x)的返回值越大就表示预测结果与实际偏差越大,越小则证明预测值越来越“逼近”真实值,这才是机器学习最终的目的。“优化方法”可以理解为假设函数和损失函数之间的沟通桥梁。通过L(x)可以得知假设函数输出的预测结果与实际值的偏差值,当该值较大时就需要对其做出相应的调整,这个调整的过程叫做“参数优化”。机器学习常用术语7拟合&过拟合&欠拟合拟合”就是把平面坐标系中一系列散落的点,用一条光滑的曲线连接起来,因此拟合也被称为“曲线拟合”。机器学习常用术语过拟合(overfitting)与是机器学习模型训练过程中经常遇到的问题,所谓过拟合,通俗来讲就是模型的泛化能力较差,也就是过拟合的模型在训练样本中表现优越,但是在验证数据以及测试数据集中表现不佳。过拟合问题在机器学习中经常原道,主要是因为训练时样本过少,特征值过多导致的。机器学习常用术语欠拟合(underfitting)恰好与过拟合相反,它指的是“曲线”不能很好的“拟合”数据。在训练和测试阶段,欠拟合模型表现均较差,无法输出理想的预测结果。造成欠拟合的主要原因是由于没有选择好合适的特征值机器学习常用术语8激活函数(Activationfunction):一种函数(例如ReLU或Sigmoid),将前一层所有神经元激活值的加权和输入到一个非线性函数中,然后向下一层传递该函数的输出值(典型的非线性)。9反向传播(Backpropagation):神经网络中完成梯度下降的重要算法。首先,在前向传播的过程中计算每个节点的输出值。然后,在反向传播的过程中计算与每个参数对应的误差的偏导数。10基线(Baseline)被用为对比模型表

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论