Spark大数据算法平台课件_第1页
Spark大数据算法平台课件_第2页
Spark大数据算法平台课件_第3页
Spark大数据算法平台课件_第4页
Spark大数据算法平台课件_第5页
已阅读5页,还剩28页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、Spark大数据算法平台第1页,共33页。目录背景介绍算法平台的功能算法平台的架构和实现 算法平台的应用算法平台未来的方向第2页,共33页。平台缘起大背景:随着携程的业务发展,各个BU的机器学习的应用越来越多,训练 的数据集也越来越大,单机的模型训练方式很难满足实际的需要,所以越 来越多的同学会考虑使用Spark进行训练直接使用Spark进行模型训练的难点(特别是对于非工程背景的数据科学 家):入门时间较长环境设置麻烦程序调试困难关注太多细节独立开发,经验,代码无法分享第3页,共33页。平台基本目标服务工程经验较少的数据科学家无需编程,模块拖拽完成模型训练处理流程的构建执行过程可视化方便地数据

2、探索功能覆盖机器学习应用的整个生命周期覆盖模型训练,导出,线上服务整个机器学习应用的生命周期 系统开放,高度可定制简便地模块定制,分享(适合工程能力强的资深用户)第4页,共33页。目录背景介绍算法平台的功能算法平台的架构和实现 算法平台的应用算法平台未来的方向第5页,共33页。平台功能简介整个平台由以下4个功能模块构成:模型训练创建模型训练流程(Pipeline)运行和调试模型训练流程数据探索模块定制(高级)训练结果导出线上服务的开发支持第6页,共33页。机器学习Sample Case使用协同过滤算法进行电影推荐(Data from Ne5lex)1.训练数据(用户对于电影的评分数据)分流(训

3、练集 / 测试级 7:3)模型训练模型检验第7页,共33页。模型训练 流程创建1. 点击相应模块,拖拽构成整个训练的流程第8页,共33页。模型训练 流程创建2. 填写相关模块的参数第9页,共33页。模型训练 模块详解模块分为两种类型:Transformer 输入是1或多个DataFrame,输出是1或多个DataFrameModel Trainer - 输入是1或多个DataFrame,输出是一个Model特殊模块 Model Transformer 输入1个模型, 1或多个DataFrame,输出 1或多个DataFrame第10页,共33页。模型训练 - 训练模型的运行和调试第11页,共3

4、3页。模型训练 - Scala和Python自定义模块第12页,共33页。模型训练 - 数据预览对于每个模块输出的DataFrame,我们都提供了数据预览和用户自定义SQL(SparkSQL)查询的功能第13页,共33页。模型训练 - 数据探索数据绘图:集成Pandas,matplotlib第14页,共33页。模块定制模块代码:一段普通的Spark的代 码参数使用特殊的占位符参数信息自动识别为配 置项* 如果模块需要保存,则 相关逻辑必须封装为 spark.ml包中Transformer 和EsImator的形式第15页,共33页。训练结果的导出导出的训练模型会保存在HDFS相关的路径下第16

5、页,共33页。训练结果的导出查看已经保存的模型第17页,共33页。线上服务开发的支持提供Jar包,用户只要在maven中 添加依赖,就能够使用相关的 API开发步骤:初始化将输入数据转化为DataFrameLoad起已经保存的Transformer和Model按照顺序调用Transform和predict方法第18页,共33页。目录背景介绍算法平台的功能算法平台的架构和实现 算法平台的应用算法平台未来的方向第19页,共33页。总体架构YARN ClusterWeb ServerZeppelin ThriW Serverstartcreate SparkContextstartrunSpark-

6、ReplSparkIMain interpret第20页,共33页。总体架构2每个训练任务(称为pipeline)会单独起一个Zeppelin的ThriW Server初始化(Lazy):Web Server调用Marathon(Mesos)的Res5ul API启动Zepplin ThriW ServerZepplin ThriW Server会在YARN集群中创建一个常驻的Spark任务 执行:Web Server中集成了Zeppelin Client,我们先将Pipeline和Module映射成为Zeppelin的Note和Paragraph,然后就会被提交到Zeppelin的ThriW

7、 Server执 行Zeppelin的ThriW Server使用Spark-Repl(Spark的交互界面就是使用这个实 现的),将scala的代码编译后提交到常驻在YARN集群的Spark任务中执行第21页,共33页。执行引擎 - Docker负责Zeppelin ThriW Server的生命周期的管理执行引擎MarathonMesosHM 2Hive / Spark / Hadoop EnvHost MachineContainer1Container2Web ServerAPIAPI第22页,共33页。执行引擎 - ZeppelinWeb ServerZeppelin ClientZ

8、eppelinThriWServerRemoteInterpreterServerNotebookThriW ServerSparkSQL InterpreterSpark IMainSpark InterpreterPySpark Interpreter将CML Studio的pipeline和module转换为zeppelin的Note和paragraph第23页,共33页。技术选型的考虑选择Docker和Zeppelin的原因:Mesos提供了方便的资源管理的功能Marathon提供了简便的应用管理的功能Zeppelin则提供了一个Spark交互执行的引擎由于人力资源的原因,使我们选择使

9、用开源产品或是在开源项目的基础上 进行2次开发整体加速了项目的进展在二次开发的过程中锻炼了团队的技术能力第24页,共33页。经验分享不断的打磨产品目前的产品形态经过了几个不同版本的演化产品的易用性和稳定性是它的生命,关注使用细节Example1 最初版本每个模块的结果都会落地,每个模块的输入输 出都是需要用户手动填写的Example2 批量结果导出的功能在最初的版本中不存在,只提供用 户手动导出单个模块的训练结果的功能Example 3 数据探索的功能是根据用户的需求加入的第25页,共33页。技术经验和踩过的坑技术经验分享(具体技术点)Python代码模块的加入:将Input的Datafram

10、e注册成为临时表Spark资源的释放:Zeppelin的后端获取到当前Zeppelin ThriW Server的状 态,如果状态超过一定时间为NO_OP,则关闭它XGBoost模块加入过程中的经验hcps:/dmlc/xgboost/issues/1276nWorkers的值不能大于可用的核数,否则会出现Hang住不动的情况hcps:/dmlc/xgboost/issues/1284第26页,共33页。目录背景介绍算法平台的功能算法平台的架构和实现 算法平台的应用算法平台未来的方向第27页,共33页。机票 - 产品智能推荐用户在携程上购买机票后, 携程会给他们推荐一些机票 的附加产品我们根据

11、用户历史的购买行为的 信息用户画像的信息航班本身的信息来预测用户购买这些产品的 概率,从而来决定是否默认 帮用户勾选上某些产品第28页,共33页。根据天气(主要)航班的信息其他信息来预测需要的客服人员的 数量(每周一次)根据预测的客服的需求量 进行客服的自动排班机票 - 客服话务量预测第29页,共33页。度假 - 刷单行为的识别 1度假平台上零售、代理产品的刷单比较猖獗,据估计非自营刷单占到订单 整体的30%左右。这些刷单产生了严重的负面影响,亟待清理。端全5分好评评论无图评论均来自PC 点评时间均在工作时间C都有总有差评评论带图评论APP、P 点评时间分散典典型型刷刷单单全5分好评评论均来自PC端评论无图点评时间均在工作时间正正常常产产品品总有差评评论APP、PC都有评论带图点评时间分散第30页,共33页。度假 - 刷单行为的识别 2携程外网基础数据规则系统机器学习人工正例人工负 例刷单惩罚平台申诉渠道恢复销 量点评在刷单识别项目开展初期,通过总 结业务经验、对各维度数据进行统 计分析,拟定了一系列规则来识别 刷单,取得的一定的进展将繁复的人工规则设定、阈值调节 工作转化为新特征的整理,并通过 各个渠道积累正例和反例通过分类(主要使用XgBoost)的

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论