机器学习基础与应用 课件 第二章 数据预处理_第1页
机器学习基础与应用 课件 第二章 数据预处理_第2页
机器学习基础与应用 课件 第二章 数据预处理_第3页
机器学习基础与应用 课件 第二章 数据预处理_第4页
机器学习基础与应用 课件 第二章 数据预处理_第5页
已阅读5页,还剩14页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第二章数据预处理目

录数据的定义与类别数据预处理技术数据标准化技术数据编码技术01020304数据的定义与类别01数据的定义与类别数据是指对客观事件进行记录并可以鉴别的符号,是对客观事物的性质、状态以及相互关系等进行记载的物理符号或物理符号的组合,它是一种可识别的、抽象的符号。01数据的定义我今天买了12瓶饮料“12瓶”实际上指的是对“饮料”这一个客观事物状态进行记录的一个符号数据的定义与类别数据指的不仅是狭义上的数字,还可以是具有一定意义的文字、字母、数字符号的组合等。生活中常见的图像、视频、音频、文本等都属于数据。数据也是客观事物的属性、数量、位置及其相互关系的抽象表示。01数据的定义数据的定义与类别在计算机科学与技术的领域中,数据是指一切能够输入计算机且能被计算机程序处理的符号总称。数据是指可用于输入计算机并进行处理的数字、字母、符号和各种模拟量。这些数据在计算机系统中都以二进制的信号单元0、1表示,所以通常需要将如文本、图像等非数值型的数据转换成数值型。01数据的定义数据的定义与类别数据分类在收集、处理和应用数据过程中非常重要。根据不同的数据类别进行分类可以更好地组织、管理、分析和应用数据。01数据的类别按照字段分类按照数据结构类型分类常见的数据分类方式数据的定义与类别01数据的类别按照字段分类用于描述性的字段,如个人姓名、家庭住址、文章等。这一类的数据是非量化的一个值,即该数据不可以直接运用在运算中。例如“芒种,是夏季的第三个节气。”这一段文字就是一种文本类数据文本类数据用于描述事件发生的时间,如“2023年1月1日”文本可以转换成为时间类数据“2023/1/1”,该数据是可以直接进行运算的。时间类数据用于描述量化属性或用于编码的一种数据,如交易金额、额度、商品数量、积分数、客户评分等都属于量化属性,是日常计算指标的核心字段。数值类数据数据的定义与类别01数据的类别按照数据结构类型分类指由统一的结构来进行逻辑表示和存储的数据。这类数据遵守相同的数据格式与数据长度规范,可以通过关系型数据库进行存储和管理。结构化数据指没有预定义数据模型、数据结构不完整或者不规则,不可以直接用数据库逻辑来表现的一种数据。在日常生活中常见的图像、文本、音频、视频等均属于非结构化数据。非结构化数据指介于结构化与非结构化数据之间的一种数据,是一种包含相关标记,以相关标记对字段进行分层分隔语义元素的一类数据,半结构化数据也被称为自描述结构。半结构化数据数据预处理技术02数据预处理技术数据和特征决定机器学习的上限,模型和算法只是逼近该上限,凸显出数据预处理的必要性。在实际业务中,从各种渠道获取的初始数据大多是“脏”数据。02“脏”数据定义:对实际业务无意义、格式非法、编码不规范、业务逻辑模糊的数据。成因:数据重复录入、共同处理等不规范操作而产生的混乱、无效数据。特点:低质量的数据,存在着一系列问题。影响:导致输出不正确,甚至误导性的结果。类型:错误数据、重复数据、缺失数据等问题解决办法:数据预处理。数据预处理技术02指不为空的属性值错误。如异常值(某个产品价格为1到100元,统计中出现200元的值);格式错误(某种格式的数据被记为另一种格式,如将文字录成日期格式)错误数据1指同一条数据在数据集中多次出现,如数据表中存在两条甚至多条如[姓名:A,座位号:01]的数据。重复数据2指数据表中属性值缺失或者是包含无效值。成因:系统问题、人为问题等。缺失数据3原始数据存在的问题数据预处理技术数据预处理指的是在数据集用于模型训练前,使用一定的方法对数据进行处理,以便把数据变换成适用于机器学习模型训练的格式或形式,常用的数据预处理方法有删除法、插补法等。02删除法指将含有错误值、重复值或者缺失值的记录直接进行删除,在删除过程中通常直接删除存在问题的某一行或某一列数据。插补法是用于处理缺失数据和错误数据的一种常用方法,该方法常常使用数据中的均值、中位数或众数填充或替换空值、错误部分数据。数据标准化技术03数据标准化技术定义:数据标准化指通过数学变换方式,将原始数据按照一定的比例进行转换,使之落入小的特定区间内(如0~1或-1~1)。目的:消除不同变量之间性质、量纲、数量级等特征属性的差异,将其转化为一个无量纲的相对数值(标准化数值),使各指标的数值都处于同一个数量级上,便于不同单位或数量级的指标进行综合分析和比较。常见方法:min-max标准化、z-score标准化。03数据标准化技术03min-max标准化z-score标准化也称为最小-最大标准化,是对原始数据的线性变换。该标准化可以将数据值映射到[0,1]。计算公式:新数据=(原数据-最小值)/(最大值-最小值)。是基于原始数据的均值和标准差对数据进行标准化的方法。处理后的数据符合标准正态分布(即均值为0,标准差为1)。计算公式:新数据=(原数据-均值)/标准差。数据编码技术04数据编码技术数据编码指的是将一个字符串类型的数据转换成数值类型。常见的数据编码技术有标签编码和独热编码。04标签编码(labelencoding)指用标签进行编码,将原始特征值编码为自定义的数字标签完成量化编码过程。如:有红、黄、蓝三种类别的颜色,可以编码为红=1、黄=2、蓝=3。0102标签编码独热编码(one-hot编码)用于将离散的分类标签转换为

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论