工业数字化人才培养基地大数据实时处理工作室项目需求_第1页
工业数字化人才培养基地大数据实时处理工作室项目需求_第2页
工业数字化人才培养基地大数据实时处理工作室项目需求_第3页
工业数字化人才培养基地大数据实时处理工作室项目需求_第4页
工业数字化人才培养基地大数据实时处理工作室项目需求_第5页
已阅读5页,还剩21页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

工业数字化人才培养基地大数据实时处理工作室项目需求一、货物清单明细序号货物名称(标的名称)数量单位1大数据流计算实训平台1套2大数据流计算实训应用案例4套3大数据流计算实训运行硬件平台4套4实时数据采集传感器5台5大数据云实训平台1套6基于Spark的离线数据分析实训库1套7数据仓库实训库1套8数据挖掘与机器学习实训库1套9大数据平台搭建运维实训库1套10管理节点设备1台11计算节点设备4台二、技术要求序号货物名称技术要求1大数据流计算实训平台1.1新建工作空间,点击新建工作空间可以创建新的工作空间,并绑定所选的集群;1.2删除工作空间:删除所选的工作空间;1.3重命名:重命名所选的工作空间;1.4查看计算资源:查看当前工作空间绑定的集群信息1.5进入工作空间:进入当前的工作空间到作业管理界面;1.6支持FlinkSQL开发,支持通过上传自定义JAR包开发;1.7涵盖SQL/Java/Scala语言;1.8内置统一元数据管理,支持元数据参数的变量管理;1.9智能感知外部数据连接系统,自动生成数据源和数据汇的建表语句;1.10支持用户自定义各类型函数,包括UDF、UDTF和UDAF;1.11提供内置connector,与公有云主流数据产品(包括但不限于云数据仓库、消息队列、数据库、搜索引擎、对象存储)无缝集成;并且可以按需自定义Connector对接各类外部数据系统,具备对用户自定义开发的Connector的管理能力;1.12SQL在线语法检查,SQL在线调试,且调试过程中不影响生产环境;1.13支持Flink内核多版本架构,通过SQL/JAR作业可同时支持多个Flink版本;1.14支持WebIDE和云API两种开发调试,云API可提供WebIDE开发需具备的功能接口,通过云API可实现业务平台与流计算平台的对接;1.15以Task粒度定义动态指标,并以维度聚合(sum、max、min、avg)的方式定义从上下游系统到集群作业的健康运行相关的监控指标,对作业进行全方位监控告警;1.16展示作业JobManager/TaskManager/Task粒度指标,以及容器POD精确的CPU/内存指标;1.17租户独占网络空间、计算资源和存储资源,保证租户间的物理隔离;1.18支持FlinkonK8s的弹性调度;1.19支持增加数据处理节点,进行水平扩展;1.20数据类型:支持VARCHAR、BYTE、BOOLEAN、INT、BIGINT、FLOAT、DOUBLE、DECIMAL、DATE、TIMESTAMP等常用数据类型;1.21支持计算资源新建集群,已有集群列表,详情查看等;1.22支持程序包管理、外部依赖(如配置文件、依赖库等)的管理和动态分发;1.23对JobManager和TaskManager以及算子并行度配置;1.24支持作业和资源历史版本管理,方便进行业务升级开发;1.25支持状态数据的管理,具备容错机制,能够恢复状态数据,且不影响作业性能;支持作业自动恢复能力;1.26支持TCP/IP、UDP、HTTP、MQTT等传输协议;接入的流数据支持JSON、String格式;1.27支持将各类数据源(Redis、HBase、Hive、MPP、MySQL等)作为维表、输出表;支持从消息队列接入数据,如Kafka等;1.28支持设置时间相关字段的格式,支持消息处理时间;1.29支持数据量超出流计算系统处理能力的情况下,能采用措施保证流计算系统正常运行(不会崩溃或丢失数据),措施包括并不限于:限流、缓冲、自然反压;1.30流计算空间需支持4种预设角色:1)超级管理员:通过主账号指定,享有除主账号外的最高权限,超级管理员账号在用地不同地域间共享;

2)空间管理员:通过主账号指定或者超级管理员账号指定,可以在空间内增加删除空间成员;

3)开发者:在成员管理模块可由空间管理员/超级管理员/主账号添加到空间,可以在空间内基础作业;

4)预览者:在成员管理模块可由空间管理员/超级管理员/主账号添加到空间,只享有查看的权限;1.31支持查看作业概览、集群概览等;通过概览,可直观查看当前空间的作业情况(作业的类型数量,作业运行停止数量以及作业异常的数量),查看空间绑定集群的详情等;1.32作业开发:提供SQL、JAR、Python、ETL四种开发方式,支持版本管理、配置作业参数、在线调试、细粒度资源等功能;SQL作业提供插入模板、调试、语法检查、格式化等功能;1.33元数据/库表管理:元数据是用户在流计算作业中引用的库表;用户可在元数据中管理已有的库表,在SQL作业开发中快速引用元数据;1.34全局变量管理:支持用户在SQL作业中的库表管理使用变量;SQL作业的临时表和元数据表都可以通过表变量替换对使用了的变量进行替换;1.35运维监控:支持对于正在运行(或者曾经成功运行过)的流计算作业进行监控,提供通过流计算控制台和云可观测平台查看两种方式;1.36作业调优:提供自动调优功能,支持调整作业并行度和资源配置,全局优化作业,解决作业吞吐量不足、作业繁忙以及资源浪费等各种性能调优问题;1.37日志查询:支持用户在作业详情的日志页面中查看作业的日志信息,包括启动日志和运行日志;1.38支持流表join和流流join;1.39支持固定窗口,支持滑动窗口,支持会话窗口;支持按不同时间进行窗口切分,例如事件时间、处理时间;支持窗口函数;1.40支持多种时间定义,如事件时间、处理时间,支持时区设置;1.41支持作业有状态升级,例如作业配置变更,版本升级等;1.42支持多种数据分发策略,例如hash模式、RoundRobin轮询模式及自定义模式;2大数据流计算实训应用案例2.1提供至少4套大数据实时计算平台实操案例,案例材料包括:案例介绍、操作任务分解以及操作步骤等,指导大数据处理平台及大数据开发治理平台教学过程;2.2实时天气预警系统;实时收集和分析气象传感器效据,例如温度、湿度、风速、降水量和气压变化,以及雷达和卫星图像数据以便提前预警暴风雨、洪水等天气事件;2.3实时电商推荐系统;利用流计算技术来实现实时推荐系统;通过收集用户行为数据(浏览、购买历史等),实时计算用户偏好和行为模式,并实时推送个性化推荐,提升用户体验和销售转化率;2.4电信用户分析系统实时分析用户的通信行为效据,包括通话时长、通话频率、上网习惯等;基于这些数据,运营商可以实时了解用户的需求和偏好,从而提供个性化的服务和推荐,例如套餐推荐、优惠活动推送等,提升用户满意度和留存率;2.5物流实时数仓系统通过数据处理技术,实时收集、处理和分析物流相关数据的仓库系统;这种系统能够实时监控和管理物流运输过程中的各种信息,包括货物位置、运输状态、交通状况、货运成本等,以帮助优化物流运作和提升效率;3大数据流计算实训运行硬件平台3.1具有进程管理功能,可查看进程名称、进程对应CPU使用率、进程ID,调整进程CPU优先级,配置不少于2颗CPU,单颗CPU不少于24核,主频不低于2.1GHz;3.2具有内存管理功能,可查看物理内存总容量,已用容量大小,已用容量占比,交换页容量使用情况,配置内存不少于384G;3.3具有磁盘管理功能,可查看分区总容量,分区格式类型,已用空间大小,剩余空间大小,已用空间占比,配置不少于2块480GSSD存储,4块3.84TSSD存储;3.4具有网络管理功能,可以查看网络已接收与已发送的数据总大小,支持以图形化的方式配置IPv4地址和DNS地址;3.5提供不少于2个10GE网卡;3.6支持raid1/10/5等raid阵列,不低于2GB缓存;3.7220VAC/240HVDC交直流兼容电源,功率不低于于1300W*2;4实时数据采集传感器4.1采用七要素一体式传感器,可对风速、风向、温度、湿度、大气压力、光照、光学雨量等气象要素进行实时观测;可实现户外气象参数24小时连续在线监测,通过数字量通讯接口将多项参数输出给用户;支持对风速、风向、空气温度、湿度、大气压力、光照、光学雨量等多要素数据进行实时采集:1)风速:测量原理超声波,0~70m/s(±0.1m/s);2)风向:测量原理超声波,0~360°(±1°);3)空气温度:测量原理二极管结电压法,-40℃~85℃(±0.3℃);4)空气湿度:测量原理电容式,0~100%RH(±2%RH);5)大气压力:测量原理压阻式,300hPa~1100hPa(±0.02hPa);6)光照测量范围不低于157286LUX(<±3%);7)光学雨量测量不低于4mm/min(≤±4%);8)支持GPRS、RJ45、以太网、4-20ma、Lora透传、4G透传、蓝牙、485转USB等多种传输方式;4.2具有顶盖隐藏式超声波探头;4.3支持发射连续变频超声波信号,通过测量相对相位来检测风速风向;4.4数据存储:不少于50万条;4.5功耗:不超过1.75W4.6锂电池:可拆卸锂电池包,容量12000maH,但电池续航时间≥50h,带电量显示功能;4.7总重量:≤5kg;4.8具有铝合金支架,可伸缩;5大数据云实训平台5.1基于Docker容器编排管理引擎,运用云原生和容器技术构建教学实训环境,支持快速创建实训环境,实现了每个学生的实训环境互相隔离、实训过程互不干扰,教师可以一键操作即可创建一套全新的实训环境供学生实训;5.1.1平台以Docker容器云引擎为基础,对计算资源进行轻量级虚拟化,支持硬件资源无缝扩展,运用容器编排管理工具对Docker容器实训环境进行有效组织编排,以百分比和内存为颗粒维度进行切分,满足多人的实时并行算力需求;5.1.2平台通过基于GB/T25000.51-2016:《系统与软件工程系统与软件质量要求和评价(SQuaRE)第51部分:就绪可用软件产品(RUSP)的质量要求和测试细则》的测试;5.2系统支持包括管理员、教师、学生三种角色;管理员负责系统配置维护、镜像环境维护等工作;教师负责课程维护、实训任务维护、实践项目维护等教学工作;学生参与并完成课程实训、实践项目;5.3管理员功能:1)用户管理:可对系统用户进行相关操作,支持学校管理员添加教师、学生用户,对教师用户支持设置姓名、工号、手机号、邮箱地址、籍贯、民族、荣誉称号、入职时间、出生日期、所属院系、职称、性别、家庭住址等信息;2)班级管理:可对班级进行相关操作,支持按照学院、专业、年级、班级的层级结构创建学校组织架构;3)专业管理:可对专业进行相关操作,支持按照学院、专业、年级、班级的层级结构创建学校组织架构;4)IP池设置:可后台查看系统设置的网段中,具体IP地址是否被使用的状态;5)镜像环境:可维护镜像环境,通过从本地镜像仓库同步等方式新建镜像,可对镜像环境执行编辑和查看操作;6)环境配置:可维护镜像启动所需的CPU、内存、磁盘空间等配置信息;7)字典管理:包括技能标签、竞赛字典、证书字典、岗位字典;可自主创建技能标签、竞赛字典、证书字典、岗位字典等,编辑相关内容,为技能标签功能、能力画像功能创建基础数据;8)讨论区管理:可管理系统内讨论区的发帖进行管理;9)资源监控:包括实训资源监控、项目资源监控、测评资源监控、教师资源监控;可监控正在进行的环境状态、使用人数、占用资源、容器数量等信息;具体形式以图形的形式展示资源使用情况,包含应用服务器与计算节点的CPU、内存、硬盘,支持根据用户信息、课程名称、实验类型、开启时间等进行实验环境资源运行状态的查询;10)服务器配置:可配置计算节点服务器相关信息;11)角色管理:可对角色进行相关操作;12)系统设置:可自定义系统相关展示信息;13)日志管理:可查看系统操作及登录日志;5.4教师功能:采用课程、实训的模式进行教学管理,维护实训、课程等基础数据,生成容器环境并进行管理,对学生/小组提交作业进行个人评分;5.4.1实训管理:1)可复制或新建一门实训,支持维护实训数据,选择实训所用镜像,编辑相应的实训内容;2)要求提供包括云桌面、低代码开发、交互式编程三类实训环境;3)低代码可视化分析实训需要支持拖曳式的数图映射模式,学生仅需要拖曳数据字段即可生成相关图形及可视化场景的建立,提供10余种等数据准备功能、50余种图形组件;支持上卷、下钻、联动、链接、保留、排除等不少于6种图形交互方式;支持R/Python/JS脚本功能等图形展示效果扩展功能;提供word报告生成模式,支持用户通过在word中插入平台的数据指标、图形报表、函数计算规则等,并支持word模板的上传与下载;低代码数据挖掘实训环境支持整个建模流程设计基于拖拽式布局、连线式流程编排和指导式流程配置,学生可以通过简单拖拽、配置的方式快速完成挖掘分析流程构建;提供不少于20种行、列、高级节点的数据预处理算子;提供分类、聚类、回归、关联、时间序列、综合评价、推荐等7大类不少于50种机器学习算法;提供不少于5种自动学习算法;提供不少于10种文本分析算法;提供不少于30种工业信号分析算法,包括信号输入、信号预处理、信号特征工程、信号变换、谱分析、信号滤波及信号输出等信号分析算法类别;4)提供不少于4种扩展编程算法,支持用户编制SQL\R\Python\Java等脚本语言实现个性化的算法扩展;5)支持学生及教师全方位观察建模过程及模型结果,包括数据输入、设置角色、Arima(时间序列算法)、时间序列评估等节点,均可以在平台的洞察中查看中间结果;支持洞察报告预览功能及将洞察内容导出到WORD;5.4.2课程管理:可维护课程数据,配置课程与实训、课程与班级之间的关联关系;通过课堂创建维护课程与班级的关联关系,并支持课堂实训分组,支持采用闯关的实验模式进行课程实践,支持自定义实验课程关卡分值,可按照均分比例、关卡难易度自动分配实践课程内的各关卡对应分值,同时也支持教师手动输入各关卡分值;支持一键发布全部添加至课堂内的课程;5.4.3监控管理:可维护课程启用后按照实训所用镜像生成的容器环境,可监控、挂起或结束整班环境,也可访问、启动、停止、重置或重启单独学生的实训环境;具体要求:可查看课程进度,包括课程起止实验,课程内包含的实验、实训、实战数量和已经发布学习的内容数量;支持学校管理员对平台内教师申请公开发布的实验课程进行审批并填写审批意见;支持学校管理员对平台内的实验课程按照课程所属方向分类进行管理,支持对平台内已公开的课程进行下架;支持学校管理员对平台内容实验课程进行更改配置,包括更改存储空间、内存限制、CPU限制等信息,并支持查看对于课程的版本记录;5.4.4实训报告:可维护实训报告数据,可查阅实训报告、附件等,并编辑实训成绩;支持自定义实训项目作业要求,教师可自行设置是否需要提交项目作业、实验报告;支持教师对课堂内实训项目作业进行统一查看,至少提供建模流程、可视化页面、pdf、JupyterNotebook四种形式作业的在线预览以及pdf下载;支持教师可对学生项目作业进行主观评分,支持教师对已评分的项目作业进行评分及评语修改,支持教师将完成度高的项目作业评选为优秀作业;5.4.5实践项目:采用项目化教学模式进行教学管理,维护项目、阶段等基础数据,生成容器环境并进行管理,对小组提交物进行阶段及个人评分;5.4.6项目管理:可维护项目数据,指定项目信息,编辑项目阶段,选择班级和学生组成小组;具体要求平台提供项目实战库,按行业打造不同类型的项目实战,可复制或新建一门项目应用至课堂中;支持维护项目数据,显性化展示实战数据,展示数据基础信息(大小、量级、类型等),同时展示部分样例数据;支持指定项目信息,编辑项目阶段,支持项目实战各阶段进行任务定制、目标说明和视频可见展示预览;支持分阶段实训任务和分阶段多项目实战两种模式;可查看项目进度,查看学生提交作业情况;支持学校管理员对平台内教师申请公开发布的项目课程进行审批并填写审批意见;5.4.7项目监控:可维护项目对应的环境配置,对具体环境资源进行启动、挂起、收回等控制,也可进入该环境对单一容器执行启动、停止、重置或重启;5.4.8测评中心:采用理论或实操测评模式进行教学管理,维护题库、测评等基础数据,生成理论测评试卷、实操测评试卷、实操测评容器环境并进行管理,对理论测评自动评分成绩进行测看,对实操测评进行评分;5.4.9题库管理:可维护测评题目,设置题目所属的技能标签题型、难度、选项,答案等参数;提供并系统预置工业大数据配套题库≥300道习题;支持按照大数据技术、人工智能、数据库、编程语言、计算机技术、Web开发等方向进行筛选查询;支持按照数据采集、数据存储与管理、数据分析处理、数据可视化、机器学习、深度学习、自然语言处理、语音识别、集成学习、SQLServer、MongoDB、MySQL、Java、Python、操作系统、数据结构与算法JavaScript、HTML、CSS、Vue等分类进行筛选查询;支持按照初级、中级、高级等难易度进行筛选查询;5.4.10测评模板:可维护测评模板,设置题量、分值、时长、难度,涉及的技能标签和分类占比等参数;具体支持根据试卷创建考核、试卷复制,支持试卷在线预览与Word格式试卷导出,导出试卷自动排版,包含试卷名称、题目数量、分数、难易度、方向分类等信息,导出试卷支持自定义编辑;5.4.11测评管理:可依据选择的测评模板进行生成测评,设置测评所属分类、测评时间和测评应用的班级等参数;支持选题组卷与模版组卷两种模式,模版组卷支持进行试题范围选择、试题来源选择,使用内置试卷模版进行组卷;5.4.12测评监控:可配置测评对应的环境,对具体测评环境资源进行启动、挂起、收回等操作,也可进入该环境对单一容器执行启动、停止、重置或重启;具体要求:在课堂考试,支持教师通过试卷创建考试并发送至课堂,以课堂为单位进行在线考试,支持教师在线评阅试卷,对学生主观题目进行评分;5.4.13测评成绩:可查看测评理论测评成绩结果,包括个人得分和答题记录,也可对实操的测评试卷进行打分;提供成绩统计列表,可以查看平均分、最高分、最低分、及格率、平均答题时长及完成情况等数据,并以柱状图和饼状图展示成绩分布,支持教师自定义分数段,个性化定制成绩分布统计图;5.4.14技能标签配置:设置不同教学模式下技能标签,为平台功能的生成提供支撑;技能标签列表:可查看各技能标签在课程实训、项目阶段、测评题目中的权重数据;课程实训标签:可维护课程实训中的技能标签,设置难度系数等参数;项目阶段标签:可维护项目阶段中的技能标签,设置难度系数等参数;测评题目标签:可维护测评题目中的技能标签,设置难度系数等参数;5.4.15讨论区:可对话题或成果展示进行发帖,对已发布的帖子进行点赞或留言;支持将完成较好的作业评选为优秀作业进行共享;5.4.16教学成果:可查看学生个人能力模型,可与具体的岗位、竞赛、证书相对比,查看能力匹配程度;具体要求:能力模型由每一个学生本课程学习成绩单、课程排名、学习总时长、完成课程数量、优秀作业数量、课程平均得分等综合组成;5.4.17个人实验环境:可选择镜像环境进行个人容器环境的启动、挂起、收回等操作;1)大数据方向要求至少提供如下镜像环境:Hadoop,Hbase,Hive,Spark,Flink,Storm,Zookeeper,Kafka;2)Python要求至少提供如下镜像环境:Python3,需包含:numpy,scikit-learn,pandas,matplotlib,scipy,sklearn,scrapy,pytorch等;3)数据库方向要求至少提供如下镜像环境:Mysql5.7,Mysql8,mongodb,sqlserver等;Web开发方向要求至少提供如下镜像环境:Java,vue等;4)JAVA程序设计方向要求至少提供如下镜像环境:Java+maven+ant等;5)数据采集预处理方向要求至少提供如下镜像环境:Python、JAVA爬虫相关镜像等;6)需支持多种环境之间可以相互组合,教师可根据自身教学需求进行选择,如MySQL+Python、Java+Hive+Hadoop等,组建个性化实验环境;5.5学生功能:5.5.1实训:以学生身份进行课程实训,查看包括但不限于任务说明、教学实训、任务参考信息,对实训环境进行包括但不限于访问、重置、重启操作,在线编辑实训报告,上传实训附件、下载实训附件;支持在线提交代码进行评测,学生在线提交评测后,系统会对学生编写的代码的准确性进行自动化评测,实时获取评测结果;5.5.2项目:以小组身份进行项目教学;1)项目信息:可预览所参与的项目,查看项目阶段、任务、成果文档、成员、实验环境,可查看本人所负责的任务及小组成员的任务分布;2)阶段任务:可查看当前项目下所有阶段及任务,根据权限区分进行相应操作;3)成果文档:可查看项目中本人或组员上传的阶段文档及任务文档;4)成员:可查看项目下本小组组员各阶段成绩及项目总成绩;5)实验环境:可对实训环境进行访问、重置、重启等操作,实验内容基于浏览器的B/S模式,学生机器无需安装任何软件即可开始实验;5.5.3测评:以个人身份进行理论测评或实操测评;1)理论测评:规定时间内进行答题,自动评分查看测评成绩及结果;2)实操测评:规定时间内进行答题,可对实训环境进行访问、重置、重启等操作,可在线编辑测评报告,上传/下载测评附件;5.5.4个人中心:可查看个人教学相关记录及个人能力模型;1)个人资料:可维护个人基础信息;2)实训记录:可查看课程实训练习记录,并针对记录进行继续练习或再次练习;3)项目记录:可查看项目练习记录,并针对记录进行继续练习或再次练习;4)测评记录:可查看个人测评练习记录,并查看测评记录的详情信息;5)能力匹配:可查看个人能力模型,并对目标的岗位、证书或竞赛进行对比,查看相应的能力匹配度;能力模型由课程学习记录及相关课程成绩单组成;6基于Spark的离线数据分析实训库6.1基于真实大数据项目任务转化,所有内容均直接使用项目研发过程资料作为素材,能够引导学生从零开始完成基于Spark的离线大数据分析的研发工作,匹配真实企业工作流程,离线大数据分析相关实训任务以真实业务为背景,包含RDD的创建、分区、读取数据、保存数据、计算每个顾客的消费次数、获取备注中出现频率最高的三个词、计算每个国家的用户数量、计算每个配件的销售总额、计算各品牌的销售总额、查询包含指定词汇的商品信息、计算不同的退回标记的订单中每个运输途径的订单总额、使用累加器计算每个用户的消费额、使用广播变量获取订单状态为F的订单总数、控制台打印表、市油站(销售额)排序等实训任务;6.2实训任务包含如下资源:(1)任务场景知识讲义,可指导教师进行任务场景讲授;(2)任务前置知识储备讲义,可指导教师进行任务的前置基础理论知识讲授;(3)任务数据源、开发工具包、任务说明、任务指导、任务源代码、任务教学视频,提供教学大纲、实验指导手册,可指导学生完成基于Spark的大数据离线分析相关实训任务,对接产业真实技术技能需求;6.3知识技能点涵盖RDD弹性数据集、创建、分区、SparkCore数据读取和保存、常用的转换算子、行动算子、依赖关系查看、序列化、持久化、累加器、广播变量、DataFrame、DataSet、SparkSQL数据读取和保存等,Spark简介、安装、运行架构、RDD的设计与运行原理、部署模式、RDD编程、键值对RDD、数据读写、SparkSQL、SparkStreaming、StructuredStreaming和SparkMLlib等不少于31个实训任务;7数据仓库实训库7.1基于真实大数据数据仓库项目转化,所有内容均直接使用项目研发过程资料作为素材,能够引导学生从零开始完成一个数据仓库构建的研发工作,匹配真实企业工作流程,数据仓库项目化实训包以真实数据仓库建设需求为背景,包含但不限于如MySQL离线数据采集、维表更新、事实表更新、每人每天下单数量和下单总金额、每人每月下单数量和下单总金额、连续两个月下单并且下单金额保持增长的用户、每个国家的平均消费额和所有国家平均消费额的比较分析、一年中每个国家用户个人消费总额中位数、基于BI工具的离线数据分析、基于Azkaban的任务调度、基于Flume和Kafka的实时数据采集、实时数据清洗与聚合、下单用户数的消费额TOP5、每分钟下单数量、每小时消费额、每小时消费额中位数国家TOP5等不少于16个实训任务;7.2实训任务包含如下资源:7.2.1包含如下资源:历史数据集或数据生成器、任务说明、任务分析、任务实现;包含:阶段任务、实训清单、阶段目标、数据集、实训手册;数据集要求不少于5个业务相关数据集,其中1个数据集不低于20个维度,总体数据量不少于20000条;7.2.2实训源代码,基于数据仓库的数据清洗、处理、分析源代码,可指导学生完成数据仓库建设相关实训任务,对接产业真实技术技能需求;7.3提供的项目背景类资源包含项目背景、需求分析、解决方案、数据分析、数据模型、数据流转图等,可指导学生全方位了解项目需求及目标结果;7.4数据管理能力,支持按照组织机构、人员角色或组进行数据集权限的授权分配;支持数据行级和列级的权限控制,行级权限支持静态规则和动态规则配置,列级权限支持禁止查看列、列数据脱敏功能;7.5数据仓库包含的知识技能点如下:(1)数据集成与任务调度:Flume数据采集工具、Kafka分布式消息队列、Azkaban任务调度、Kettle数据抽取、Kettle调度;(2)数据清洗:Spark分布式计算框架、Flink实时计算框架、Hive分布式SQL计算引擎、Kettle数据加载和转换;(3)构建ODS层(数据准备层/近源层):Hive分布式SQL计算引擎;(4)构建DWD层(数据明细层):Hive分布式SQL计算引擎;(5)构建DWS层(数据汇总层):Hive分布式SQL计算引擎;(6)构建ADS层(应用服务层):Hive分布式SQL计算引擎;(7)数据分析:Spark分布式计算框架、Flink实时计算框架、Hive分布式SQL计算引擎;(8)数据可视化:数据可视化BI工具使用;8数据挖掘与机器学习实训库8.1数据挖掘与机器学习项目化实训库功能:训练数据挖掘和机器学习相关技术的基础知识和应用技能,具体包含但不限于如下内容:8.1.1主流机器学习算法的分类、特点和应用场景,如监督学习、无监督学习、半监督学习、强化学习等,数据预处理、特征工程、模型评估和选择等方法;8.1.2使用相关的数据挖掘和机器学习库,如scikit-learn、PyTorch、TensorFlow等;8.1.3常见的机器学习算法的使用,如逻辑回归、线性判别分析、多分类学习、线性回归、决策树、kNN算法、支持向量机、朴素贝叶斯分类器、神经网络、随机森林算法、Adaboost、k-means、DBSCAN、AGNES、高斯混合聚类、聚类性能评估指标、PCA、多维缩放等不少于38个实训任务,指导学生如何进行数据降维、特征选择、特征缩放等数据预处理工作,如何使用训练数据对模型进行训练,并调优模型以提高性能;8.1.4使用测试数据对训练好的模型进行评估,计算准确率、精确率、召回率、F1值等指标,分析模型的性能瓶颈和改进方向,如过拟合、欠拟合等问题的处理;8.1.5实训任务资源包含任务场景知识讲义及教师演示的代码及说明、任务前置知识储备讲义及教师演示的代码及说明、数据集、开发工具包及相应工程模板、任务说明、任务指导、任务源代码、任务教学视频等,可指导教师和学生有序开展项目化实训;提供教学大纲、实验指导手册、至少6个教学视频、6个教学方案、6个思政内容、1套试卷等,可指导教师和学生有序开展项目化实训;9大数据平台搭建运维实

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论