版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
机器学习原理与应用毋建军、姜波、郭舒2025年1月第1章机器学习基础本章学习目标(知识要点)了解人工智能、机器学习及其关系;
熟悉机器学习中的基本问题及典型任务;了解机器学习在各领域的场景应用;
掌握机器学习开发环境的搭建;
熟悉机器学习常用库、机器学习框架、机器学习平台目录
机器学习简介
机器学习任务
搭建机器学习开发环境
机器学习常用库概述
机器学习框架概述1.11.21.31.41.5
机器学习开源平台1.6◎人工智能
◎机器学习机器学习简介1.11.人工智能阿兰•图灵提出机器学习、遗传算法、图灵测试等概念1.人工智能约翰·麦卡锡(JohnMcCarthy,1927-2011)1956:TheDartmouthConference(达茅斯会议)人工智能(ArtificialIntelligence,AI)1.人工智能人工智能基本任务知识表示搜索推理机器学习人工智能按智能程度划分弱人工智能强人工智能超人工智能1.人工智能人工智能研究的主要内容计算机视觉模式识别、图像处理、图像生成、人脸识别等;自然语言理解与交流文本理解及生成、摘要生成、语义理解、语音识别及合成等;认知与推理逻辑推理、自动推理、搜索、物理及社会常识等;机器人学智能控制与设计、运动规划、任务规划、博弈等;人工智能伦理社会伦理、伦理规范、伦理标准等;机器学习知识表示、知识获取、知识处理、统计建模、分析工具及计算方法等大语言模型GPT、BERT、GPT-4o、OpenAI-o1、DeepSeek-V3等2.机器学习机器学习(MachineLearning,ML)是研究计算机(机器)如何模拟和实现人的学习行为的一种技术。1997年,TomMitchell提出机器学习定义提出学习问题后,如果计算机程序对于任务T的性能度量P通过经验E得到了提高,则认为此程序对经验E进行了学习2.机器学习机器学习研究历程(五个学派)符号主义、联结主义、进化主义、贝叶斯派、Analogizers(类比主义)机器学习学派起源学科代表性算法代表性人物应用符号主义(Symbolists)逻辑学、哲学逆演绎算法(Inversededuction)TomMitchell、SteveMuggleton、RossQuinlan知识图谱联结主义(Connectionist)神经科学反向传播算法(Backpropagation)、深度学习(Deeplearning)YannLeCun、GeoffHinton、YoshuaBengio机器视觉、语音识别进化主义(Evolutionaries)进化生物学基因编程(Geneticprogramming)JohnKoda、JohnHolland、HodLipson海星机器人贝叶斯派(Bayesians)统计学概率推理(Probabilisticinference)DavidHeckerman、JudeaPearl、MichaelJordan反垃圾邮件、概率预测类比主义(Analogizer)心理学核机器(Kernelmachines)PeterHart、VladimirVapnik、DouglasHofstadter推荐系统2.机器学习机器学习基本流程输入数据,通过模型训练,预测结果。模型通常为函数2.机器学习机器学习分为有监督学习、半监督学习、弱监督学习、自监督学习、无监督学习、深度学习、强化学习、深度强化学习。2.机器学习机器学习整个流程问题的定义、收集数据、建立特征工程、模型的训练和测试、模型评估、
模型应用,然后再将应用的结果反馈到问题定义2.机器学习机器学习处理步骤1)定义问题:根据具体任务,定义学习问题2)收集数据:将收集的数据分成三组:训练数据、验证数据和测试数据3)特征工程:使用训练数据来构建使用相关特征4)模型训练:根据相关特征训练模型5)模型评估:使用验证数据评估训练的模型,测试数据检查被训练的模型的表现。6)模型应用:使用完全训练好的模型在新数据上做预测7)模型调优:根据模型应用中的问题,以及更多数据、不同的特征、
参数来提升算法的性能表现。目录
机器学习简介
机器学习任务
搭建机器学习开发环境
机器学习常用库概述
机器学习框架概述1.11.21.31.41.5
机器学习开源平台1.6◎机器学习问题
◎机器学习典型任务◎机器学习应用场景
机器学习任务1.21.2.1机器学习问题基本问题分类回归聚类降维网络分析等。前沿问题规模化学习参数空间自动配置学习最优拓扑结构搜索脑等。1.2.1机器学习问题1.回归(Regression)分类回归分析用于预测输入变量(自变量)和输出变量(因变量)之间的关系。常用回归算法线性模型、非线性模型、规则化、逐步回归、提升(boosted)和袋装(bagged)决策树、神经网络和自适应神经模糊学习1.2.1机器学习问题2.分类(Classification)从数据中学习一个分类决策函数或分类模型(分类器),对新的输入进行输出预测,输出变量取有限个离散值。二元分类问题输出范围只有两个可能的值多元分类问题输出范围有多个值时常用分类算法支持向量机(SVM)、提升(boosted)决策树和袋装(bagged)决策树、k-最近邻、朴素贝叶斯(NaïveBayes)、判别分析、逻辑回归和神经网络1.2.1机器学习问题3.聚类(Clustering)分析聚类即给定一组样本特征,通过发掘样本在N维空间的分布,分析样本间的距离,如哪些样本距离更近,哪些样本之间距离更远,来进行样本类别的划分。常用分类算法k-均值和k-中心点、分层聚类、模糊聚类、高斯混合模型、隐马尔可夫模型、自组织映射、减法聚类、单连接群集、预期最大化(EM)、非负矩阵分解、潜在狄利克雷分配(LDA)。1.2.1机器学习问题4.降维(DimensionalityReduction)通过降维方法去除冗余的特征,用更少的维数来表示特征降维可以加快训练的速度、筛选掉一些噪音和冗余特征会丢失一些信息,需要掌握平衡问题。1.2.1机器学习问题5.网络学习
网络学习是通过计算机学习网络的浅层、深层结构、网络节点表示、节点重要性及其作用等信息。常见的网络学习算法自组织映射、感知、反向传播、自动编码、Hopfield网络、玻尔兹曼机器、限制玻尔兹曼机器、Spiking神经网络等。1.2.2机器学习典型任务机器学习任务分类任务回归任务语音识别机器翻译机器阅读理解异常检测图机器学习1.2.3机器学习应用场景机器学习应用场景广告推荐用户画像营销票房预测新闻推荐……目录
机器学习简介
机器学习任务
搭建机器学习开发环境
机器学习常用库概述
机器学习框架概述1.11.21.31.41.5
机器学习开源平台1.6◎开发环境系统要求◎Windows10系统平台下搭建开发环境◎Linux系统平台下搭建开发环境机器学习开发环境1.31.3.1开发环境系统要求Windows10或Linux(如Ubuntu18.04)操作系统首先查看自己电脑显卡的型号。如显卡为NVIDIA系列,可选择安装GPU版本;否则,需装CPU版1.3.2
Windows10系统平台下搭建开发环境1.搭建Python开发平台1)安装Anaconda,Anaconda下载地址为:/distribution/,选择Windows下的python版本,
根据自己系统是64位,选择对应版本下载,(历史版本下载地址:/archive/)Anaconda下载界面1.3.2
Windows10系统平台下搭建开发环境1.搭建Python开发平台2)然后运行直接默认安装即可,安装中需要注意如图所示,勾选默认添加环境变量,将Anaconda环境配置到PATH环境变量中配置Anaconda环境1.3.2
Windows10系统平台下搭建开发环境1.搭建Python开发平台3)安装完成后,检测Anaconda环境是否安装成功(查看Anaconda版本号),打开windows下的cmd,输入命令:conda–version,如安装成功,则返回当前版本号1.3.2
Windows10系统平台下搭建开发环境1.搭建Python开发平台4)安装完成后,检测Anaconda环境是否安装成功(查看Anaconda版本号),打开windows下的cmd,输入命令:conda–version,如安装成功,则返回当前版本号1.3.2
Windows10系统平台下搭建开发环境1.搭建Python开发平台4)创建Opencv并安装python3.7,输入命令:condacreate--nameOpencvpython=3.71.3.2
Windows10系统平台下搭建开发环境1.搭建Python开发平台5)激活并进入环境,输入命令:condaactivateOpencv6)安装Opencv,输入命令:pipinstallopencv-python1.3.2
Windows10系统平台下搭建开发环境1.搭建Python开发平台7)进入python解释器:python8)测试python环境:print(‘helloworld!’)输出:helloworld!1.3.2
Windows10系统平台下搭建开发环境2.搭建OpenCV开发平台1)激活并进入环境:condaactivateOpencv2)安装OpenCV环境:pipinstallopencv-python3)测试OpenCV环境,进入python解释器输入:importcv2不报错则为正常1.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台1)安装TensorFlow-CPU:打开windows的cmd命令行,创建环境tf-cpu并安装python3.7,输入命令:condacreate--nametf-cpupython=3.72)激活并进入环境,输入命令:condaactivatetf-cpu1.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台3)安装Tensorflow-cpu,输入命令:pipinstalltensorflow==1.13.14)安装numpy1.16.0,输入命令:pipinstallnumpy==1.16.05)测试Tensorflow-cpu安装环境,进入python解释器,输入测试代码importtensorflowastfhello=tf.constant('Hello,Tensorflow!')sess=tf.Session()print(sess.run(hello)输出结果如下b'Hello,Tensorflow!'1.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台6)安装Tensorflow-gpu,查看自己电脑显卡的型号。如果显卡是NVIDIA系列的,继续下面步骤;如果显卡不是NVIDIA系列的,直接装CPU版即可。右键点击此电脑->管理->设备管理器->显示适配器,就可以查看自己电脑显卡的型号1.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台7)打开英伟达官网/cuda-gpus查看自己的显卡型号算力以及是否支持GPU加速,如果计算能力≥3.5,可以装GPU版1.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台8)打开网址:/cuda-toolkit-archive,选择local版本下载和安装CUDAToolkit10.01.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台9)安装CUDA,运行下载好的安装包选择OK解压1.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台10)在兼容性检测和同意许可协议后,选择精简安装1.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台11)安装完成后,重启即可,系统会自动添加环境变量。验证是否安装成功,在win+R中输入:powershell,输入命令:nvcc-V1.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台12)下载安装cuDNN,在网址:/rdp/cudnn-archive中选择forCUDA10.013)将cuDNN解压出来的三个文件夹:bin、include和lib,复制到C:\ProgramFiles\NVIDIAGPUComputingToolkit\CUDA10目录下并重启系统1.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台14)Tensorflow-gpu的安装,与步骤1至2相同,创建并激活进入环境tf-gpu输入代码15)安装Tensorflow-gpu,输入命令:pipinstalltensorflow-gpu==1.13.1condacreate--nametf-gpupython=3.7condaactivatetf-gpu1.3.2
Windows10系统平台下搭建开发环境3.搭建TensorFlow开发平台16)安装numpy1.16.0,输入命令:pipinstallnumpy==1.16.017)测试Tensorflow-GPU环境,进入python解释器输入测试代码如下所示,输出True即安装成功importtensorflowastfa=tf.test.is_built_with_cuda()b=tf.test.is_gpu_available(cuda_only=False,min_cuda_compute_capability=None)print(a)print(b)1.3.2
Windows10系统平台下搭建开发环境4.搭建Pytorch开发平台1)打开Pytorch官网/,GPU安装方式如图1-31所示,CUDA选项选择None即为CPU版本2)Pytorch的安装,创建并激活进入环境torch,输入命令如下:
condacreate--nametorchpython=3.7condaactivatetorch1.3.2
Windows10系统平台下搭建开发环境4.搭建Pytorch开发平台3)输入上图中RunthisCommand框中的指令安装Pytorch-gpu2)测试安装是否成功,进入python解释器,输入如下代码:
importtorchprint("cudaisavailable{}".format(torch.cuda.is_available()))print("torchversion{}".format(torch.__version__))1.3.3
Linux系统平台下搭建开发环境1.搭建Pytorch开发平台1)安装Anaconda,同上一样在Anaconda官网地址:/distribution/,选择linuxpython版本,然后根据操作系统下载对应的版本1.3.3
Linux系统平台下搭建开发环境1.搭建Pytorch开发平台2)进入Anaconda目录,执行命令:bashAnaconda3-2019.10-Linux-x86_64.sh3)按照提示操作,成功安装1.3.3
Linux系统平台下搭建开发环境1.搭建Pytorch开发平台4)验证Anaconda是否安装成功,在终端窗口中,输入命令:conda-V,输出Anaconda版本号5)安装Python环境,在终端窗口输入:condacreate–namepython3.7python==3.71.3.3
Linux系统平台下搭建开发环境1.搭建Pytorch开发平台6)激活并进入环境,在终端窗口输入:condaactivatepython3.77)测试Python环境,首先进入python解释器,在终端窗口输入:python,输入测试代码如下print(‘helloworld!’)
输出结果:helloworld1.3.3
Linux系统平台下搭建开发环境2.搭建OpenCV开发平台1)激活并进入Python环境,安装Opencv环境在终端输入代码如下condaactivatepython3.7pipinstallopencv-python1.3.3
Linux系统平台下搭建开发环境2.搭建OpenCV开发平台2)测试Opencv环境,进入Python解释器,在终端窗口输入:importcv2不报错即为安装成功1.3.3
Linux系统平台下搭建开发环境3.搭建Tensorflow开发平台1)安装创建Tensorflow-cpu环境,在终端窗口输入:condacreate–nametf-cpupython==3.72)激活Tensorflow-cpu环境,在终端窗口输入:condaactivatetf-cpu1.3.3
Linux系统平台下搭建开发环境3.搭建Tensorflow开发平台3)安装Tensorflow-cpu,在终端窗口输入:pipinstalltensorflow==1.13.14)安装numpy1.16.0,输入命令:pipinstallnumpy==1.16.01.3.3
Linux系统平台下搭建开发环境3.搭建Tensorflow开发平台5)测试Tensorflow-cpu环境,进入python解释器,输入测试代码如下importtensorflowastfhello=tf.constant('Hello,Tensorflow!')sess=tf.Session()print(sess.run(hello)输出结果如下b'Hello,Tensorflow!’6)Tensorflow-gpu的安装,查看自己电脑显卡的型号。如果显卡是NVIDIA系列的,继续下面步骤;如果显卡不是NVIDIA系列的,直接装CPU版即可1.3.3
Linux系统平台下搭建开发环境3.搭建Tensorflow开发平台7)与步骤1至2相同,创建并激活进入环境tf-gpu输入代码如下condacreate--nametf-gpupython=3.7condaactivatetf-gpu8)安装Tensorflow-gpu,在终端输入:cundainstalltensorflow-gpu==1.13.11.3.3
Linux系统平台下搭建开发环境3.搭建Tensorflow开发平台9)安装numpy1.16.0,输入命令:pipinstallnumpy==1.16.010)测试Tensorflow-gpu环境,进入python解释器输入测试代码如下,结果都返回True即为安装成功importtensorflowastfa=tf.test.is_built_with_cuda()b=tf.test.is_gpu_available(cuda_only=False,min_cuda_compute_capability=None)print(a)print(b)1.3.3
Linux系统平台下搭建开发环境4.搭建PyTorch开发平台1)进入PyTorch官网/,GPU安装方式如图1-48所示,CUDA选项选择None即为CPU版本1.3.3
Linux系统平台下搭建开发环境4.搭建PyTorch开发平台2)PyTorch的安装,创建并激活进入环境torch输入代码如下condacreate--nametorchpython=3.7condaactivatetorch3)输入图中RunthisCommand框中的命令,安装PyTorch-gpu1.3.3
Linux系统平台下搭建开发环境4.搭建PyTorch开发平台4)测试是否安装成功,进入python解释器,输入如下代码importtorchprint("cudaisavailable{}".format(torch.cuda.is_available()))print("torchversion{}".format(torch.__version__))目录
机器学习简介
机器学习任务
搭建机器学习开发环境
机器学习常用库概述
机器学习框架概述1.11.21.31.41.5
机器学习开源平台1.6◎库简介
◎库安装及集成机器学习常用库概述1.41.4.1库简介库简介Python机器学习中库Numpy、Scipy、Scikit-learn、Theano、TensorFlow、Keras、PyTorch、Pandas、Matplotlib还有Gensim、milk、Octave、mahout、pyml、NLTK、libsvm等库。1.TheanoTheanos是一个可以让用户定义、优化、有效评价数学表示的Python包,是一个通用的符号计算框架。优点是显式的利用了GPU,使得数据计算比CPU更快,使用图结构下的符号计算架构、对RNN支持很好。缺点是依赖于Numpy,偏底层、调试困难、编译时间长、缺乏预训练模型。当前最新的版本为Theano1.0.4。1.4.1库简介2.Scikit-learnScikit-learn是一个在2007年由数据科学家DavidCournapeau发起,基于NumPy和SciPy等包的支持的Python语言的机器学习开源工具包。它通过NumPy、SciPy和Matplotlib等Python数值计算的库,实现有监督和无监督的机器学习。在分类、回归、聚类、降维、预处理等方面,应用于数据挖掘、数据分析等领域,是简单高效的数据挖掘和数据分析工具。当前最新的版本是Scikit-learn0.22.2。3.Statsmodels在Python中,statsmodels是统计建模分析的核心工具包,其包括了几乎所有常见的各种回归模型、非参数模型和估计、时间序列分析和建模以及空间面板模型等最新的版本是statsmodelsv0.11.1。1.4.1库简介4.GensimGensim是一个开源的第三方Python工具包,用于从原始的非结构化的文本中,无监督地学习到文本隐层的主题向量表达,其支持TF-IDF、LSA、LDA、word2vec等主题模型算法,通常用于抽取文档的语义主题。Gensim的输入是原始的、无结构的数字文本(纯文本),在内置的算法支持下,通过计算训练语料中的统计共现模式自动发现文档的语义结构。5.KerasKeras是基于Theano的一个深度学习框架,也是一个高度模块化的神经网络API库,提供了一种更容易表达神经网络的机制。Keras主要包括14个模块包,如Models、Layers、Initializations、Activations、Objectives、Optimizers、Preprocessing、metrics等模块。另外,Keras还提供了一些用于编译模型,处理数据集,图形可视化等的最佳工具。Keras运行在TensorFlow,CNTK,或Theano之上,支持CPU和GPU运行。最新的版本为Keras2.3.1。1.4.1库简介6.DMTKDMTK由一个服务于分布式机器学习的框架和一组分布式机器学习算法构成,是一个将机器学习算法应用在大数据上的强大工具包;支持在超大规模数据上灵活稳定地训练大规模机器学习模型。DMTK的框架包含参数化的服务器和客户端SDK。DMTK是设计用于分布式机器学习的平台。深度学习不是DMTK的重点,DMTK中发布的算法主要是非深度学习算法。7.CNTKCNTK是微软认知工具集(MicrosoftCognitiveToolkit,CNTK),是用于商业级分布式深度学习的开源工具包。它通过有向图将神经网络描述为一系列计算步骤。CNTK允许用户轻松实现和组合流行的模型类型,例如前馈DNN,卷积神经网络(CNN)和递归神经网络(RNN/LSTM)。CNTK通过跨多个GPU和服务器的自动微分和并行化实现随机梯度下降(SGD,错误反向传播)学习。CNTK也是第一个支持开放神经网络交换ONNX格式的深度学习工具包,这是一种用于框架互操作性和共享优化的开源共享模型表示。ONNX由Microsoft共同开发,并得到许多其他人的支持,允许开发人员在CNTK,Caffe2,MXNet和PyTorch等框架之间移动模型。1.4.2库安装及集成1.Theano安装1)在Anaconda中创建并进入环境,注意python版本要≤3.6(参考1.4搭建机器学习开发环境)输入命令:condacreate--nameMLpython==3.62)安装Theano输入命令:condainstallTheano3)安装Theano环境所依赖组件condainstallmkl-servicepipinstallnoseypipinstallparameterized4)测试Theano安装环境,进入python解释器输入代码如下代码importtheanotheano.test()1.4.2库安装及集成2.Scikit-learn安装1)在Anaconda中创建并进入环境,注意python版本要≤3.6(参考1.4搭建机器学习开发环境)输入:condacreate--nameMLpython==3.62)安装Scikit-learn,输入命令:condainstallscikit-learn3)测试Scikit-learn安装环境,进入python解释器,输入代码如下fromsklearnimportdatasetsiris=datasets.load_iris()digits=datasets.load_digits()print(digits.data)目录
机器学习简介
机器学习任务
搭建机器学习开发环境
机器学习常用库概述
机器学习框架概述1.11.21.31.41.5
机器学习开源平台1.6机器学习框架概述 1.51.5机器学习框架概述常用的机器学习框架CaffeTensorflowMXNetPytorchApacheMahoutApacheSingaMlibH2O1.5机器学习框架概述1.Caffe框架Caffe(ConvolutionArchitectureForFeatureExtraction)是一个兼具表达性、速度和思维模块化的深度学习框架,出现于2013年,设计初衷是应用于计算机视觉。其内核是用C++编写的,Caffe支持多种类型的深度学习架构,支持CNN、RCNN、LSTM、全连接神经网络设计,以及基于GPU和CPU的加速计算内核库。此外,Caffe有Python和Matlab相关接口。2017年4月,Facebook发布Caffe2,增加递归神经网络等新功能。2018年3月底,Caffe2并入PyTorch。Caffe具有完全开源、模块化、表示和实现分离、GPU加速、Python和MATLAB结合等特点。下载链接:/BVLC/caffe/资源链接:/1.5机器学习框架概述2.TensorFlowTensorFlow是由Google设计开发的开源的机器学习框架,以Python语言为基础,主要用于机器学习和深度学习应用,其特点包含可以方便的用张量来定义、优化、计算数学形式化表达,支持深度神经网络、机器学习算法,适用于不同数据集的高性能数值计算。TensorFlow可以跨平台在Linux、Windows、Mac系统下运行,也可以在移动终端下运行,用户可以轻松地将计算工作部署到多种平台(CPU、GPU、TPU)上进行分布式计算,也可以部署到设备,如桌面设备、服务器集群、移动设备、边缘设备等。TensorFlow模块包含TensorBoard、Datasets、TensorflowHub、Serving、ModelOptimization、Probability、TensorFlowFederated、MLIR、NeuralStructuredLearing、XLA、TensorFlowGraphics、SIGAddons、SIGIO当前版本为TensorFlow2中文链接:/?hl=zh-cn安装链接:/install?hl=zh-cn1.5机器学习框架概述3.MXNetMXNet是一个轻量级的深度学习框架(亚马逊AWS选择支持),支持Python,R,Julia,Scala,Go,Javascript等,支持多语言接口和多GPU。MXNet尝试将声明式编程与命令式编程两种模式无缝的结合,在命令式编程上MXNet提供张量运算,而声明式编程中MXNet支持符号表达式。MXNetPython库包含NDArray、Symbol、KVStore,NDArray提供矩阵和张量计算,Symbol定义神经网络,提供自动微分,KVStore使得数据在多GPU和多个机器间同步。当前的版本为MXNet1.9链接:/versions/1.9.1/源代码链接:/repos/asf#mxnet1.5机器学习框架概述4.PytorchPyTorch前身起源于1990年产生的Torch,其底层与Torch框架一样,是应用于机器学习的优化的张量库,支持GPU和CPU。PyTorch除了基本的torchPythonAPI库之外,还有处理音频、文本、视觉等库,如torchaudio、torchitext、torchvision、torchElastic等。2018年4月Facebook宣布Caffe2将正式将代码并入了PyTorch。PyTorch在数据加载API、构建神经网络等方面具有明显优势。当前的版本为PyTorch2.6官方链接:/1.5机器学习框架概述5.ApacheMahoutApacheMahout是ApacheSoftwareFoundation(ASF)开发的一个全新的开源项目,提供一些可扩展的机器学习领域经典算法的实现。Mahout包括聚类、分类、推荐过滤、频繁子项挖掘等。同时,Mahout通过ApacheHadoop库可以扩展到云端。Mahout已经包含TasteCF,支持k-Means、模糊k-Means、Canopy、Dirichlet、Mean-Shift、Matrix和矢量库等在集群上的分布式运行。当前的版本为ApacheMahout14.1官方链接:/1.5机器学习框架概述6.ApacheSingaSINGA项目始于2014年,由新加坡国立大学数据库系统实验室联合浙江大学和网易共同开发完成,是一个开源的分布式、可扩展的深度学习平台,它可以在机器集群上训练大规模的机器学习模型,尤其是深度学习模型。2019年10月,SINGA项目成为Apache软件基金会(ApacheSoftwareFoundation,ASF)顶级项目。其包含硬件层、支撑层、接口层、Python应用层。SINGA通过代码模块化来支持不同类型的深度学习模型,不同的训练(优化)算法和底层硬件设备。另外,SINGA同时支持ONNX、DLaaS(DeepLearningasaService)等。当前的版本为SINGA4.3官方链接:/Github链接:/apache/singa1.5机器学习框架概述7.MLlibMLlib是最早由AMPLab、UC伯克利发起的Spark子项目常用机器学习库。MLlib已经Java、Scala和Python语言,支持通用的机器学习算法,如分类、回归、聚类、协同过滤(ALS)、降维(SVD、PCA)、特征提取与转换、优化(随机梯度下降、L-BFGS)等。它在Spark中可以实现GraphX+MLIib、Streaming+MLIib、SparkSQL+MLIib等组合应用。官方链接:/mllib/文档链接:/docs/latest/ml-guide.html1.5机器学习框架概述8.H2OH2O是由Oxdata于2014年推出的一个独立开源机器学习平台,主要功能是为app提供快速的机器学习引擎。H2O支持大量的无监督式和监督式机器学习算法,可以通过对R与Python进行引入包的方式进行模型的开发,提供可视化的UI界面建模工具,以及模型的快速部署、自动化建模和自动化参数调优。另外,H2O提供了许多集成,如H2O+TensorFlow+MXNet+Caffe、H2O+Spark等。H2O4GPU是H2O开发的基于GPU机器学习加速的工具包。其最新稳定的版本是1.8LTS。H2O也提供了一个RESTAPI,用于通过HTTP上的JSON从外部程序或脚本访问所有软件的功能。H2O核心代码使用Java编写,数据和模型通过分布式Key/Value存储在各个集群节点的内存中。H2O的算法使用Map/Reduce框架实现,并使用了JavaFork/Join框架来实现多线程。官方链接:https://h2o.ai/platform/ai-cloud/make/h2o/目录
机器学习简介
机器学习任务
搭建机器学习开发环境
机器学习常用库概述
机器学习框架概述1.11.21.31.41.5
机器学习开源平台1.6机器学习开源平台 1.61.6机器学习开源平台机器学习开源平台PaddlePaddlePhotonMLX-DeepLearningAngelAWS1.6机器学习开源平台1.PaddlePaddlePaddlePaddle(ParallelDistributedDeepLearning,并行分布式深度学习),又称飞桨,是百度发起的开源深度学习平台,支持大规模稀疏参数训练场景、千亿规模参数、数百个节点的高效并行训练,同时支持动态图和静态图,具有易用,高效,灵活和可伸缩等特点。飞桨支持本地和云端两种开发和部署模式,其组件使用场景如图官方中文链接:/Github链接:/PaddlePaddle/Paddle1.6机器学习开源平台2.PhotonMLPhotonML是LinkedIn公司开发的应用于ApacheSpark的机器学习库。PhotonML支持大规模回归、L1、L2和elastic-net正则化的线性回归、逻辑回归和泊松回归。提供可选择的模型诊断,创建表格来帮助诊断模型和拟合的优化问题,实现了实验性质的广义混合效应模型。PhotonML把典型的机器学习系统分为三个阶段部分,第一阶段部分是数据准备,包含在线数据的ETL,即数据抽取(Extract)、转换(Transform)、加载(Load),以及创建标签、加入特征;第二阶段部分是采样数据,分为训练数据集、测试数据集,通过特征计算,训练Photon机器学习模型,选取最优评分模型,在测试数据集验证;第三部分是最优模型在线部署,进行A/B测试,验证效果,具体流程如下图Github链接:/linkedin/photon-ml1.6机器学习开源平台3.X-DeepLearningX-DeepLearning(简称XDL)是由阿里发起的面向高维稀疏数据场景(如广告、推荐、搜索等)深度优化框架,其主要特性有:针对大batch/低并发场景的性能优化;存储及通信优化,参数无需人工干预自动全局分配,请求合并,彻底消除ps的计算/存储/通信热点;完整的流式训练,包括特征准入,特征淘汰,模型增量导出,特征counting统计等。XDL专注解决搜索广
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026事业单位工勤技能-山西-山西食品检验工一级(高级技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-山西-山西收银员一级(高级技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-山东-山东铸造工四级(中级工)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-天津-天津房管员四级(中级工)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-四川-四川热力运行工二级(技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-吉林-吉林舞台技术工一级(高级技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-云南-云南舞台技术工二级(技师)历年参考题库含答案详解3套试卷
- 成都棕北悦湖2026初一入学数学分班考试真题含答案
- 2026年四川省南充中小学教师招聘考试真题及答案
- 2026年四川德阳市社区工作者考试试题解析及答案
- 2026 高考化学试题评析及教学启示河南卷
- 烟囱加固专项施工方案(3篇)
- 2025年绵阳育才中学初一入学数学分班考试真题含答案
- 2026年内蒙古赤峰市中小学教师招聘考试试题解析及答案
- 老师批改作业8种方法
- 南昌市房屋市政工程生产安全重大事故隐患排查整治指导手册
- 先天性低纤维蛋白原血症诊疗指南(2025版)
- 护理科研的步骤与方法
- 2026 年广西公需科目(人工智能国家战略与政策通识 + 广西发展新机遇)高频题库及解析
- 加强知识产权保护 推动创新发展课件
- 2026年电力调度员模拟考试题库及答案详解【夺冠】
评论
0/150
提交评论