项目9数据挖掘_第1页
项目9数据挖掘_第2页
项目9数据挖掘_第3页
项目9数据挖掘_第4页
项目9数据挖掘_第5页
已阅读5页,还剩27页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

数据挖掘项目九IntroductiontoArtificialIntelligence人工智能导论CONTENTS01项目概述02思政聚焦0304项目相关知识05项目任务06项目小结与展望思维导图07项目重难点01项目概述数据挖掘则是机器学习中的一个重要分支,即从大量的数据中挖掘出有价值、关键的信息来帮助决策。从商业的角度上看,数据挖掘其实是一类深层次的数据分析方法。数据分析本身已经有很多年的历史,只不过在过去数据收集和分析的目的是用于科学研究,另外,由于当时计算能力的限制,对大数据量进行分析的复杂数据分析方法受到很大限制。数据挖掘技术介绍02思维导图项目介绍03项目重难点业务理解与数据采集。数据预处理(最关键的基石)。核心挖掘任务模式评估与知识表示项目重难点项目重点数据层面的挑战:“巧妇难为无米之炊”技术与算法层面的挑战:“工欲善其事,必先利其器”业务与伦理层面的挑战:“行百里者半九十”项目难点04思政聚焦人工智能时代,数据挖掘广泛应用于电商、出行、金融、资讯等各大领域,依托海量用户数据实现精准推送、智能定价与个性化服务,极大提升了数字服务的便捷性与智能化水平。但数据驱动的技术红利,必须建立在合法合规的基础之上,数据挖掘从业者需时刻恪守法律法规,坚守行业伦理与从业底线。当下部分平台滥用数据挖掘技术,触碰法律红线,滋生诸多乱象。部分在线旅游平台利用用户消费数据实行大数据杀熟,对老用户设置差异化高价,违反《个人信息保护法》中自动化决策不得设置不合理差别待遇的规定。部分金融平台依托用户地域、浏览习惯等无关数据构建画像,随意下调用户授信额度,形成算法歧视与数据偏见。同时,不少APP超范围申请权限,违规收集用户位置、通讯录、影像元数据等信息,违背数据最小化采集原则,涉嫌过度收集个人信息。技术本身具备中立性,但技术使用者必须心怀敬畏、坚守底线,需树立法治思维,严守《数据安全法》《个人信息保护法》相关规定。摒弃功利化技术思维,坚持合法采集、合规使用、规范流转数据,以严谨的职业操守筑牢数据安全防线,守住人工智能行业的从业底线。课程思政:数据有度挖掘有界:人工智能的数据从业底线05项目相关知识数据挖掘的基本步骤

a)数据挖掘的基本步骤

数据挖掘常用方法神经网络算法010203040506决策树算法遗传算法关联规则算法相关回归模型聚类算法07分类算法数据挖掘重要算法--神经网络神经网络算法神经网络技术起源于上世纪五六十年代,拥有输入层、隐藏层以及输出层。图10-15显示了基本了神经网络结构。由基本的神经网络可以组合、变换得到各种各样更加复杂的深度网络,比如卷积神经网络、循环神经网络、深度信念网络、生成对抗网络等等数据挖掘重要算法--决策树基于整幅人决策树算法决策树算法起源于E.B.Hunt等人于1966年发表的论文“experimentsinInduction”,改论文详细介绍了决策树的构建、应用的全过程。之后,(罗斯.昆兰)等人提出了ID3决策树算法,使得决策树算法的相关研究进入高潮,并由此衍生出C4.5、CART等相关决策树算法。顾名思义,决策树就是一棵树,一颗决策树包含一个根节点、若干个内部结点和若干个叶结点06

项目任务1、任务描述某班有30名学生,学校想要通过分析学生的数学、语文、英语成绩,了解学生的学习情况,发现潜在规律,并为教学改进提供数据支持。任务1:学生成绩分析2、任务实现--技术分析学生成绩分析的流程如下。(1)数据准备通过相关代码生成数据,利用Pandas库对生成的数据进行封装(2)数据处理与分析获取相应的数据集之后,接下来就是对数据进行处理和分析,主要包括数据预览和统计、成绩等级划分以及找出特殊学生群体、成绩相关性分析。①数据预览和统计,完成数据的探索。②成绩等级划分以及找出特殊学生群体。③成绩相关性分析2、任务实现步骤1:数据准备 图9-16所示为数据集中的数据,主要的属性字段包括学号、姓名、数学、语文、英语等。2、任务实现步骤2:数据预处理图9-17所示为各个科目的平均分、最高分及最低分。图9-18所示为3个科目各等级学生的人数,包括优秀、良好、中等、及格和不及格。2、任务实现

从图9-19中可以看到优秀学生、需要帮助的学生以及偏科学生的信息;从图9-20中可以看到不同科目之间的相关性。2、任务实现实验总结整体表现:语文平均分最高(80分),数学波动最大。大部分学生成绩集中在70~90分之间。优秀学生:发现7名各科都在85分以上的全优生示例:学生12,数学90,语文90,英语90,平均分90。3.需要关注的学生:发现5名有科目不及格的学生示例:学生2,数学55,语文68,英语50,需要数学和英语辅导。4.偏科现象:发现1名偏科严重的学生示例:学生22,数学52,语文74,英语72,最大分差22分。5.相关性分析:英语和语文相关性最强(r=0.954)。1、任务描述某在线电影平台拥有大量用户评分数据,平台希望通过对电影评分数据的分析,深入了解用户偏好,优化电影推荐系统,并为内容采购提供数据支持。任务2:电影评分分析2、任务实现--技术分析本任务涉及的工具包括Python的工具库NumPy、Pandas、Seaborn,具体介绍如下。(1)NumPy库NumPy是Python的一个扩展库,支持数组与矩阵运算,此外也针对数组运算提供了大量的数学函数。(2)Pandas库Pandas是一个强大的分析结构化数据的工具集。它的使用基础是NumPy。它用于数据挖掘和数据分析,同时也提供数据清洗功能。(3)Seaborn库Seaborn库在Matplotlib库的基础上进行了进一步封装,方便直接传入参数。2、任务实现--数据准备与数据预处理2、任务实现--数据分析2、任务实现--数据分析2、任务实现--实验总结1.评分最高:《第二十条》9.3分。2.最热门:《红海行动》有150万人评分,参与评分人数最多。3.类型表现:剧情类电影平均评分最高(9.2分)。动画类和剧情类电影参与评分最多(各3部)。科幻类电影整体表现均衡。

4.发现规律:高评分电影不一定评分人数最多,但好电影通常既有高评分也有较多观众评价。07项目小结与展望

在本章节我们主要介绍了数据挖掘定义、应用背景、基本步骤、经典算法以及两个数据挖掘的案例。通过本章的学习,同学们应该从这几个方面去把握和理解,尤其是两个案例的学习,需要按照本章的实验步骤一步一步去完成,最后得到一个完整结果展示出来。项目小结

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论