人工智能通识课件 第2章 数据采集与数据标注_第1页
人工智能通识课件 第2章 数据采集与数据标注_第2页
人工智能通识课件 第2章 数据采集与数据标注_第3页
人工智能通识课件 第2章 数据采集与数据标注_第4页
人工智能通识课件 第2章 数据采集与数据标注_第5页
已阅读5页,还剩46页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

选用《信息技术课程标准(2021年版)》新型活页式教材我们毕业啦其实是答辩的标题地方第2章数据采集与数据标注课前答题1。。。。。2。。。。。3。。。。。4。。。。。教学重点:1.数据采集、数据标注的基本概念。2.数据采集、数据标注的发展历程与未来展望。3.Kaggle房价数据获取与处理实验。4.酒店评论的情感倾向标注实验。人工智能浪潮下的数据采集与数据标注0302数据采集和处理2.10302数据采集概念数据采集是指从各种来源系统地获取信息的过程,其目的是为了构建数据集以支持后续地数据分析和模型训练。0302数据采集的类型01传感器数据传感器数据是通过各种物理传感器获取的实时数据,能够监测和记录环境的变化。02网络数据网络数据是通过网络抓取或API接口获取的各种信息,用于社交媒体分析、市场研究和用户行为分析。03数据库提取数据库提取是从已有数据库中提取数据的过程,常用于需要分析历史数据或使用结构化数据的项目。04手动输入手动输入数据是通过问卷调查、实验记录和访谈等方式收集的数据。适用于特定领域的小规模研究。0302数据采集的过程确定目标01选择数据源02数据搜集03数据存储04数据验证05030201

确定目标清晰界定待解问题,明确数据在其中的关键作用,确保数据收集与分析有的放矢。精确设定所需数据的类型、数量及质量标准,确保数据满足模型训练与分析的严格需求。数据需求问题定义030202

选择数据源传感器当目标聚焦于实时监控环境变化时,选择传感器作为数据源,能够实时、准确地获取环境参数,为分析提供可靠依据。网络对于分析公众舆论或用户行为等任务,网络数据源(如社交媒体)能提供海量、实时的数据,是获取此类数据的理想选择。现有数据库在需要使用历史数据进行分析时,从已有数据库中提取数据是一种高效的方法,能迅速获取所需历史数据。030203

数据搜集工具选择确保数据收集工具与数据来源相匹配,以实现高效、准确的数据采集,为数据分析提供可靠基础。采集方法在数据采集过程中,运用专业方法确保数据准确性。对手动输入的数据,需确保输入规范、一致,以减少人为错误。030204

数据存储在数据存储过程中,选择合适的数据格式至关重要,以确保数据的易读性和兼容性,为后续处理分析奠定坚实基础。数据格式根据数据类型(如结构化、半结构化、非结构化)和应用需求,需选择合适的数据库管理系统,以满足数据存储和查询的需求。数据库选择030205

数据验证数据验证是确保数据质量的关键,在收集存储后需对数据进行清洗,处理缺失值、重复值和异常值,提升数据质量。数据清洗为确保数据准确性,需进行严格的一致性检查。验证不同数据源和数据点间是否一致,避免数据来源差异引发的错误。一致性检查02数据采集的发展历程01规则和符号推理02转向数据驱动的方法03海量数据和自动化采集04跨领域的数据采集与融合05未来发展0201早期阶段-规则和符号推理人工智能的起步可以追溯到20世纪50年代,当时的AI研究主要集中在基于规则的符号推理和专家系统上,数据采集的方式相对简单且基础,并不突出。早期AI的局限当时的数据采集技术和方法还很原始,但这一阶段为后来的AI技术奠定了理论基础,尤其是在知识表示和符号推理方面的探索。原始数据采集0202转向数据驱动的方法规则推理的局限数据驱动的学习方法在处理复杂和动态环境时展现出巨大潜力,推动AI研究转向数据驱动的方法。数据驱动的学习和机器学习方法的兴起,标志着AI研究逐步进入“数据时代”,数据采集的作用日益凸显。数据驱动的优势机器学习方法的兴起01020403AI研究的数据时代随着研究的深入,AI界逐渐认识到基于规则推理的专家系统存在局限性,特别是在处理复杂和动态环境时。决策树、神经网络、支持向量机等机器学习方法逐渐取代传统的符号推理方法,成为AI研究的主流。0203海量数据和自动化采集复杂和多样化的数据类型AI开始处理更加复杂和多样化的数据类型,深度学习算法能够自动提取数据中的高级特征,提高AI的性能。深度学习的突破随着互联网、云计算和计算能力的快速发展,深度学习在人工智能中取得了突破性进展,成为AI发展的关键。数据采集的方式和技术数据采集的方式和技术发生了深刻变革,大数据技术应运而生,极大地推动了AI模型的训练和优化。0204跨领域的数据采集与融合随着人工智能应用领域的不断扩展,AI系统需要融合来自不同领域和传感器的多模态数据。多模态数据采集与应用数据采集逐渐迈向跨领域、跨模态的整合,尤其在自动驾驶、智慧城市、智能医疗等领域。跨领域的数据采集与融合AI系统通过融合来自多个传感器的数据,如摄像头、激光雷达、GPS、温度传感器、心电图等。AI系统的数据融合能力0205

未来发展随着数据量的激增和数据采集范围的扩展,数据隐私和安全问题逐渐成为AI发展中的重要挑战。数据隐私与安全的挑战为了应对数据隐私和安全问题,差分隐私技术、联邦学习、加密技术等被提出,在不泄露个人隐私的情况下利用数据进行模型训练和优化。隐私保护技术0302数据标注2.20302数据标注概念数据标注是指在原始数据上添加标签或注释的过程。该过程通过人为或半自动化的方式,将数据进行分类、标记或注释,使得模型能够理解并处理这些数据。0302分类标注最常见的数据标注形式,指为每个数据实例分配一个类别标签,适用于图像分类、文本情感分析和垃圾邮件检测等任务。回归标注序列标注用于为数据点分配数值标签,适用于连续变量预测的任务,如房价预测和天气预报,通过精确数值描述输出结果。适用于时间序列或文本数据,为序列中的每个元素进行标注,如命名实体识别、语音识别和基因序列分析等。数据标注的类型0302边界框标注在图像中为特定对象绘制边界框,帮助模型识别对象的位置信息。广泛应用于物体检测任务中,如自动驾驶、安防监控、零售等领域。语义分割关键点标注与边界框标注不同,为图像中的每个像素分配类别标签它适用于需要精准识别每个像素的任务,如医学影像处理、自动驾驶。标注图像或视频中的关键点位置信息,如人脸识别中的眼睛、嘴巴等点。广泛应用于姿态识别、动作捕捉等领域。数据标注的类型0302关系标注不仅需要对个体对象进行标注,还需要标注不同对象之间的关系。如知识图谱构建任务中标注实体之间的关联。数据标注的类型0302数据标注的过程定义标注规范标注审核与质检数据存储与管理持续优化与反馈数据标注执行选择标注工具制定详细的标注指南和标准,确保不同标注员在标注过程中保持一致性。根据任务类型选择合适的标注工具,不同工具具有各自的功能,支持标签管理、自动标注、团队协作等。由专业标注员或使用自动化工具对数据进行标注,需要经过培训,理解标注规范,并确保标注的准确性和一致性。完成标注后,通过多轮审核确保标注结果的质量,在人工审核中,可能会引入多标注员交叉验证以减少主观偏差。标注完成的数据应以结构化的格式存储,同时,需要确保数据的安全性和便于后续模型训练和分析的管理流程。在模型训练或部署过程中,数据标注可能需要持续更新和优化,通过反馈机制,不断改进标注质量。02数据标注的发展历程早期阶段计算机辅助标注与半自动化(1950s-2000s)(2000s-2010s)(2010s-2020s)众包标注与大规模数据集(2020s至今)自动化标注与深度学习驱动未来发展0301

早期阶段人工标注的局限性人工标注的效率较低,且容易受到人为偏差的影响,因此随着技术的发展,数据标注的需求逐渐扩大,人工标注的方式逐渐显得力不从心。早期标注方式在20世纪50年代至90年代,人工智能研究还处于初步探索阶段,数据标注的方式非常基础,主要依赖人工输入和专家知识。标注方式的基础性由于当时的计算机硬件和软件都非常有限,数据集的规模相对较小,且主要集中在符号推理和规则学习等领域。030202

计算机辅助标注与半自动化随着计算机硬件和网络技术的飞速发展,标注工具和平台的出现大大提高了标注的效率。标注工具与平台半自动化的标注方式,不仅节省了大量的时间和劳动力成本,也在一定程度上减少了人为标注误差。半自动化标注这一时期的数据标注仍然依赖大量的人工参与,且对于一些复杂的标注任务,机器辅助标注的准确性仍然不高。依赖人工参与030203

众包标注与大规模数据集众包标注是指通过互联网平台将标注任务分发给广泛的网络用户,利用大众的力量高效地完成数据标注。通过众包标注,数据采集的速度和规模得到了极大的提升,尤其是在图像识别、语音识别等领域。众包标注也面临一些挑战,特别是标注质量的控制,如何确保每个标注结果的准确性和一致性。许多众包平台会采取质量审查机制,通过设置多个标注员进行交叉验证,确保标注质量。众包标注数据采集质量控制质量审查0204自动化标注与深度学习驱动随着深度学习的突破,自动化标注技术逐渐成熟,AI系统能够对数据进行初步标注并逐步提高标注的精确度。自动化标注的进步自动标注在速度上大大超越人工标注,在一些特定任务上,准确性也能达到与人工标注相当的水平。完全自动标注还存在技术瓶颈和挑战,但在标注效率和应用范围上的潜力巨大,展现出巨大的发展前景。标注速度与精度自动标注技术仍然依赖于大规模的标注数据集进行训练,对于某些复杂或细粒度的任务,仍然需要人工干预和后期修正。标注数据集的依赖01020403技术瓶颈和挑战030205未来发展智能标注时代AI技术飞跃,数据标注迈向智能化、自动化,深度学习、迁移学习等技术加速标注效率与精度提升。多模态标注未来多模态数据普及,数据标注跨越单一模态,实现文本、图像、语音等多形式融合与标注,拓宽应用边界。0302应用实践2.30302任务一:Kaggle房价数据获取与处理0302理解Kaggle平台学习数据观察分析了解分类特征编码的方法,以及如何将分类变量转换为数值型特征以供模型使用。了解分类特征编码学习特征归一化的方法,以及如何应用多项式和交互特征来增强模型的预测能力。学习特征归一化掌握数据标准化的概念和过程,以及其在机器学习中的重要性。掌握数据标准化理解Kaggle平台的功能和使用方法,包括数据集的浏览和下载。学习如何观察和分析数据,识别并处理异常值和缺失值。任务目标0302Kaggle平台是一个致力于数据科学与机器学习竞赛的在线社区,为数据科学领域的研究者及机器学习的爱好者提供了一个展示其专业技能、解决实际问题并参与奖项角逐的场所。Kaggle平台介绍在预览或下载数据之前,您必须先注册账户,随后进行登录,只有登录后,才能访问数据集、下载数据、参与竞赛等,所以登录是使用Kaggle平台的必要步骤。注册登录Kaggle任务实现登录Kaggle平台0302任务实现下载数据筛选和排序数据您可以通过不同的筛选和排序功能,快速找到您所需要的数据集,数据集的详细描述将为您提供关于数据集的背景信息、数据采集方法、数据处理过程以及数据集的应用场景等重要信息。检索房价数据集通过在搜索框内输入“Houseprice”,您可以检索到与房价相关的数据集,并在左侧对数据集进行筛选,包括按时间、大小以及数据文件类型等条件来筛选符合需求的数据集。浏览数据集点击“Dataset”标签页,您将能够访问并浏览数据集,在这个标签页中,您可以详细查看数据集相关的信息,包括数据集的名称、来源、数据类型、数据量大小以及数据集的具体描述。01020303任务实现下载数据查看数据集信息选择“FeatureEngineeringforHousePrices”数据集,点击“Datasource”链接,访问“房价预测”数据集页面,登录后,请选择“Data”选项卡,查看数据集的基本信息。下载数据集在选项卡中找到“DownloadAll”按钮,以下载包含所有数据的压缩包,该压缩包内含一个名为“train.csv”的文件,这是接下来需要处理的数据集,使用Excel打开“train.csv”文件浏览数据。03任务实现观察数据处理大数据集鉴于原始数据集的规模庞大,建议创建一个新的house.xlsx文件,并将前8行数据复制过去,以便后续处理,这样做可以提高数据处理效率,并避免对完整数据集进行不必要的操作。观察数据内容观察数据文件内容,尽管ID字段有助于我们识别各个样本(即每行数据),但它并不包含对后续模型训练有价值的信息,因此可以考虑移除该列,以简化数据集并减少不必要的计算。0302任务实现异常值处理四分位数定义四分位数是将数据集分为四等分的特定数值,第一四分位数(Q1)代表25%数据小于此值,第三四分位数(Q3)代表75%数据小于此值。四分位数间距四分位数间距(IQR)是第三四分位数与第一四分位数之差,反映数据集中间50%的分布区间,其计算公式为IQR=Q3-Q1。异常值识别在“LotArea”列中,通过计算四分位数间距(IQR)识别异常值;排序后数据集显示,14115和14260超出正常范围,被识别为异常值。02任务实现缺失值处理缺失值定义缺失值指数据集中未记录或无法获取的观测值,常见于数据处理,且可能对机器学习模型效能产生负面影响。缺失值处理方法平均值填充法处理缺失值的方法包括删除法、预测法和填充法;删除法虽简单但易减少数据量,预测法适用于缺失值比例不高情况,填充法则适用于大规模数据集。我们采用平均值填充法处理缺失值,将缺失值视为0,计算得出平均值约等于65,因此将“NA”标记替换为65以填充缺失值。0302任务实现特征处理对数据进行标准化处理,使其均值为0,标准差为1;包括计算平均数、标准差,并转换数据点为标准化数据。数据标准化处理将标准化后的数据进一步调整至-1至1的范围,通过识别最小值和最大值,计算差额并除以总差额得到最终数值。调整数据范围至-1至1构建非线性特征组合,如房屋面积与卧室数量的平方项,以捕捉特征间的复杂非线性关系。创建多项式特征0302任务实现特征处理交互特征构建特征组合,如房屋面积与建造年份的乘积,以揭示特征间的相互作用,如面积大且建造早的房产价格可能较低。分类特征编码为了确保机器学习模型能够有效地处理分类变量,将分类变量通过独热编码、标签编码或二进制编码等方法转换为数值型特征。0302任务二:酒店评论的情感倾向标注0302任务目标数据标注与情感分析数据结构与情感识别掌握文本标注的准确方法,能够根据文本的实际内容,进行恰当的情感标注。文本标注和情感标注学习情感分析的基本概念,了解情感极性的分类标准,如积极、消极、中性的划分。情感分析基础概念掌握数据清洗的基本技巧,特别是有效去除重复数据的方法,为情感分析提供干净、准确的数据集。数据清洗与预处理理解数据标注在情感分析中的关键作用,通过精准标注情感倾向,助力构建智能情感分析系统。学会查看和分析包含评论数据的结构化文件,能够准确识别评论中的主题、情感及观点。0302任务实现标注准备在着手数据标注任务之前,首要步骤是打开那些需要细致处

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论