版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第4章
人工智能开发与工具
[知识目标]1.了解人工智能开发所需的核心编程语言及其特点,掌握常用的AI编程语言(如Python)的基本语法和应用。2.掌握TensorFlow、PyTorch、PaddlePaddle等主流框架的安装及基础应用。3.了解AI开发中常用的数据集与资源,掌握如何选择和使用适合项目的数据集。4.了解AI项目的开发流程,包括从需求分析到模型部署的各个环节。
[能力目标]1.够独立安装和配置常用的AI编程语言及开发框架,并解决基本的环境配置问题。2.能够根据项目需求选择合适的数据集并进行初步处理,为后续的AI模型开发做准备。3.能够根据AI项目开发流程进行有效的任务规划,完成从数据准备到初步模型验证的基本验证任务。4.能够在实践中运用所学的AI开发知识,分析和解决实际问题。
[职业素养目标]1.培养学生应树立创新意识和社会责任感,关注人工智能技术的最新发展,积极思考如何将人工智能应用于解决社会问题,推动技术创新与社会进步相结合,确保技术向善服务人类。2.培养学生应具备人工智能伦理与道德意识,认识到人工智能技术可能带来的隐私泄露、数据滥用等问题,在开发和应用过程中始终遵守职业道德,确保人工智能的开发与应用符合伦理规范,推动技术的健康发展。3.培养学生应增强全球视野和国家认同感,了解人工智能技术在全球科技竞争中的重要地位,关注国家对人工智能的政策支持与发展战略,增强自豪感和责任感,为推动国家科技创新和国际竞争力作出贡献。
4.1常用AI编程语言在人工智能(AI)领域,编程语言的挑选显得尤为关键,它直接关联到研发效率以及项目的最终成就。面对人工智能领域中对大量数据加工、模型培育及算法实施的需求,合适的编程语言成为不可或缺的要素。当前,以Python与R语言为首的编程工具,在人工智能的开发中占据主流地位。这两种语言各具特点,分别适用于不同的开发场合。4.1常用AI编程语言014.1常用AI编程语言4.1.1Python与人工智能1.简洁灵活,生态强大Python凭借清晰的语法和丰富的库(如NumPy、TensorFlow),成为AI开发的核心工具,大幅降低学习与开发门槛。2.易用高效,跨平台支持其直观的代码结构和跨平台特性(Windows/macOS/Linux)让开发者能快速实现算法并部署应用。3.社区活跃,功能全面海量第三方库(如OpenCV、spaCy)覆盖数据处理、机器学习、深度学习等场景,满足AI全流程需求。4.1常用AI编程语言4.1.2R语言与人工智能1.专业统计,精准分析R语言内置丰富的统计函数,从基础描述统计到复杂多变量分析,为数据科学提供可靠支持。2.卓越可视化,洞察数据基础图形系统与ggplot2库结合,可创建高度定制化的图表,直观展现数据规律与关联。3.海量扩展包,覆盖全面CRAN资源库提供数千专业包,支持传统统计分析到现代机器学习任务,满足各类研究需求。4.2AI开发框架024.2AI开发框架
在智能技术的研发过程中,选取合适的开发框架对于模型架构的搭建及其训练速度具有不容忽视的作用。这些框架提供了众多便捷的工具与接口,极大地简化了编程过程中算法的落实和数据操作的复杂性,从而让研发者能够更集中精力于模型架构的设计与性能的提升。现阶段,TensorFlow与PyTorch这两种框架在人工智能领域内备受青睐。二者均拥有独特的优势,能够满足各异的应用场合及研发者不同的需求。4.2AI开发框架4.2.1TensorFlowTensorFlow是一个由谷歌开发的开源工具,旨在帮助用户构建和训练机器学习和深度学习模型。它允许你创建复杂的数学模型,通过分析大量数据来完成各种任务,如识别图片中的物体或翻译语言。4.2AI开发框架4.2.1TensorFlow
TensorFlow的优势1.灵活易用,调试高效TensorFlow提供直观的操作流程,支持逐步调试,使模型开发更清晰、错误修正更便捷。2.模块化设计,扩展性强从基础回归到复杂神经网络,TensorFlow支持多种模型定制,适配图像、文本等各类数据任务。3.活跃社区,资源丰富全球开发者社区提供海量教程、案例和实时支持,GitHub等平台持续更新前沿技术动态。4.跨平台部署,应用广泛训练模型可轻松部署至云端、移动端及浏览器,实现灵活高效的工业级应用。4.2AI开发框架Python版本选择与Anaconda安装本文将以Python3.10为例进行说明,具体步骤如下。首先打开网页浏览器,前往Anaconda官方网站,如图4-3所示。接着在页面右上角单击“FreeDownload”按钮,将跳转到对应的下载页面,随后在页面的右侧填写自己的邮箱地址,待填写好邮箱地址后单击“Submit”按钮就会跳转到Anaconda的下载页面,如图4-4所示。最后根据自己电脑的系统类型(Windows或Mac或Linux)选择相应的安装程序。4.2AI开发框架Python版本选择与Anaconda安装运行Anaconda安装程序。首先双击下载的安装文件启动安装程序并单击Next按钮,如图4-5所示。4.2AI开发框架Python版本选择与Anaconda安装接着在LicenseAgreement页面中单击IAgree按钮并进入下一步,如图所示。4.2AI开发框架Python版本选择与Anaconda安装在AdvancedInstallationOptions界面,需对三处选项框进行选中操作。首项选中表示安装过程中将在桌面生成该软件的快速访问图标。此项一旦选中则表示安装向导便会自动设置相关的环境变量,确保Anaconda的命令行接口得以在系统全局范围内被调用。至于第三项的选择,则是授权Anaconda成为其他应用默认的Python执行环境。一切选项设定完毕,便可单击Install按钮,启动安装过程,具体界面展示如图所示。4.2AI开发框架虚拟环境构建首先,在Windows10操作系统中,选择“开始”菜单,搜索AnacondaPrompt,然后单击打开。AnacondaPrompt是一个命令行工具,专门用于Anaconda的环境管理和包管理,如图所示。4.2AI开发框架虚拟环境构建接着在AnacondaPrompt中输入以下命令创建一个新的虚拟环境。将环境命名为“tf24_env”,并指定Python版本为3.10。condacreate--nametf24_envpython=3.10这条命令会创建一个Python版本为3.10的名为“tf24_env”的虚拟环境,同时指定在某个特定的路径上,安装结果如图所示。4.2AI开发框架虚拟环境构建最后使用以下命令激活刚刚创建的虚拟环境。condaactivatetf24_env激活虚拟环境后,你的命令行提示符将会显示虚拟环境的名称(例tf24_env),表示你现在处于该环境中,如图所示。4.2AI开发框架安装numpy和pandas在搭建好的虚拟环境之下,对numpy与pandas这两大Python模块进行安装,可以作为一个检验环境配置是否到位的有效手段,以下将详述其步骤。第一步确保虚拟环境处于激活状态,然后输入以下命令安装numpy。pipinstallnumpy==1.22.0-i/pypi/simple/第二步输入以下命令安装pandas。pipinstallpandas==1.3.5-i/pypi/simple/4.2AI开发框架安装numpy和pandas第三步首先需在命令提示符界面输入Python指令并执行,以此方式进入Python的交互式界面。继而,在该交互式环境中,代码如例4-1代码样例,进行相应的代码输入。【例4-1】验证numpy与pandasimportnumpyasnpprint(np.__version__)importpandasaspdprint(pd.__version__)若运行成功并返回正确结果,则表示numpy和pandas安装成功,如图所示。4.2AI开发框架搭建TensorFlow(CPU)环境搭建在部署TensorFlow之前,首先确保Anaconda已妥善安装,并在此基础上构建了一个以Python3.10为运行核心的独立虚拟环境。在该特定虚拟环境下,本小节将阐述安装TensorFlow2.10.0的CPU版本,并对安装的正确性进行验证等内容。(1)重新激活虚拟环境,在命令提示符窗口(CMD)输入“condaactivatetf24_env”命令并按回车键,如图所示。4.2AI开发框架搭建TensorFlow(CPU)环境搭建(2)在激活的虚拟环境中输入以下命令。pipinstalltensorflow==2.10.0-i/pypi/simple/命令的含义是指导pip工具安装特定版本的TensorFlow。在这一操作过程中,pip将负责获取并部署TensorFlow2.10.0及其必需的依赖库,具体的安装流程可通过图4-4进行观察。在安装的期间,控制台界面将展示下载的进度条以及相关包的安装详情。整个安装环节通常需时数分钟,其时长受制于计算机的网络连接速度和硬件配置,但无须过分忧虑,直至屏幕出现“Successfullyinstalled”等字样,即可确认安装已圆满完成,如图4-14所示。4.2AI开发框架搭建TensorFlow(CPU)环境搭建(3)为确保TensorFlow得以准确安装,须执行一项基础验证程序。首先,在命令行界面中输入Python指令后,轻按回车键以进入互动模式,随后便可以在此环境中输入下列Python脚本代码。importtensorflowastf#打印TensorFlow的版本号print(tf.__version__)这段代码会导入TensorFlow库,并打印出当前安装的TensorFlow版本号。如果输出结果是2.10.0,这表示成功安装正确的TensorFlow(CPU)版本,如图所示。4.2AI开发框架搭建TensorFlow(CPU)环境搭建(3)为确保TensorFlow得以准确安装,须执行一项基础验证程序。首先,在命令行界面中输入Python指令后,轻按回车键以进入互动模式,随后便可以在此环境中输入下列Python脚本代码。importtensorflowastf#打印TensorFlow的版本号print(tf.__version__)这段代码会导入TensorFlow库,并打印出当前安装的TensorFlow版本号。如果输出结果是2.10.0,这表示成功安装正确的TensorFlow(CPU)版本,如图所示。4.2AI开发框架4.2.2PyTorchFacebook推出的PyTorch,作为一款开源的深度学习平台,已在数据科学与人工智能界获得了广泛的认可。该框架的独特之处在于其对动态计算图的支持,允许用户在程序执行过程中灵活地构建和调整计算图,其便捷程度不亚于编写普通程序。这种动态性极大地提升了编程与调试的直观性和易理解性。4.2AI开发框架4.2.2PyTorchPyTorch的优势1.动态计算图PyTorch采用动态图机制,支持运行时修改模型结构,提供更直观的调试体验,特别适合研究型任务。2.Python式编程其API设计完全遵循Python风格,代码简洁易读,让开发者能快速上手并专注于模型创新而非框架学习。3.活跃开发者生态拥有丰富的教程资源和活跃社区支持,从官方文档到开源项目,为各类用户提供全面学习支持。4.原生GPU加速内置CUDA支持,可无缝切换CPU/GPU计算,显著提升大规模模型训练和推理效率。4.2AI开发框架4.2.2PyTorch创建pytorch_env的虚拟环境首先打开“AnacondaPrompt”输入如下命令以创建一个名为pytorch_env的虚拟环境,并指定Python版本为3.8。condacreate--prefixC:\Users\jqs102\anaconda3\envs\pytorch_envpython=3.10在输入指定命令之后,命令提示符便启动了Python3.10及其基础扩展包的下载与安装流程。在构建虚拟环境的阶段,用户会被提示确认安装,此时只需输入“y”并按下回车键,安装进程便得以延续。完成这一确认步骤之后,一个全新的虚拟环境便宣告诞生,如图所示。4.2AI开发框架4.2.2PyTorch创建pytorch_env的虚拟环境接着,虚拟环境创建完成后,输入以下命令来激活虚拟环境。condaactivatepytorch_env激活后,命令行界面的提示字符将变为(pytorch_env),这表示着此刻正位于特定的虚拟环境之内。在此环境下执行的一切命令及所安装的软件包,均独立于系统的其他部分,这一机制有效保障了项目运行的独立性和依赖包版本的一致性。4.2AI开发框架4.2.2PyTorch安装PyTorch首先,需前往PyTorch的官方下载区,挑选与需求相匹配的版本;在本例中选取是CUDA11.1与PyTorch1.10.0,该版本兼容Python3.10。选定之后,网站会展示相应的安装文件名,例如torch-1.10.0+cu111-cp38-cp38m-win_amd64.whl,如图4-31所示。随后,利用网络浏览器将该安装包下载至您的设备硬盘。下载事宜妥善后,务必记录下文件的保存位置,这将便于后续的安装过程中进行准确的路径调用。4.2AI开发框架4.2.2PyTorch安装PyTorch接着定位到下载的.whl文件所在的目录,执行以下命令进行安装。cdC:\pytorchpipinstalltorch-1.10.0+cu111-cp38-cp38-win_amd64.whl在执行完毕指定的命令之后,pip工具将自主地对所指定的包及其必需的依赖项进行解析,并顺利完成安装过程。采用此种方法进行安装,不仅大幅缩短了因网络下载而消耗的时间,同时也确保了安装包的完整无缺,如图所示。4.2AI开发框架4.2.2PyTorch验证安装在完成PyTorch及相关库的安装后,在命令行中输入Python命令进入Python解释器并输入以下代码进行验证,代码如下所示。检查PyTorch版本、CUDA状况importtorchprint(torch.__version__)print(torch.cuda.is_available())这段代码用于检查PyTorch版本号并检查CUDA是否可用,如图4-33所示,输出的版本号应与所下载的文件一致,则表明PyTorch安装成功,然后第三行代码的输出结果为True,则表示PyTorch能够正确
检测到系统中的CUDA支持,可以使用GPU进行加速计算。4.2AI开发框架4.2.3PaddlePaddle(飞浆)百度推出的飞桨(PaddlePaddle)是一款深度学习框架,其特色在于开源且易于上手,致力于为用户提供高效率和灵活性兼备的深度学习解决策略。该平台在国内人工智能界占据领先地位,覆盖了模型训练、调试以及部署等全方位流程,其应用范围广泛,涵盖了诸如计算机视觉、语言处理、语音识别以及推荐系统等多个重要领域。4.2AI开发框架4.2.3PaddlePaddle(飞浆)PaddlePaddle组件PaddleHub:提供丰富的预训练模型库,支持CV/NLP/语音等多领域任务。PaddleServing:面向生产环境的高性能推理服务框架,支持多模态模型部署,满足大规模服务需求。PaddleLite:轻量级移动端推理引擎,适配Android/iOS/嵌入式设备,实现边缘计算场景高效部署。PaddleSlim:模型压缩工具包,提供剪枝/量化/蒸馏等技术,优化模型效率与资源消耗。PaddleGAN:生成对抗网络工具集,集成经典GAN模型,支持图像生成/增强/修复等创意应用。PaddleNLP:自然语言处理工具库,包含预训练模型与NLP任务全流程工具,加速文本处理应用开发。4.2AI开发框架4.2.3PaddlePaddle(飞浆)Paddle安装(1)获取PaddlePaddleGPU版本信息,从官网上面分别选择计算平台为cuda11.2版本,芯片厂商为英伟达,安装方式为pip模式,操作系统为windows,飞桨版本为2.6即可,如图4-36所示。4.2AI开发框架4.2.3PaddlePaddle(飞浆)Paddle安装(2)安装PaddlePaddleGPU版本,首先新建一个全新的虚拟环境,然后复制图中安装信息的命令到命令提示符中执行安装,等待安装完成即可,命令如例4-3所示。【例4-3】安装Paddle命令python-mpipinstallpaddlepaddle-gpu==2.6.2.post112-i/packages/stable/cu112/4.2AI开发框架4.2.3PaddlePaddle(飞浆)Paddle安装(3)安装完成后,可以通过以下代码验证安装是否成功,具体命令如例4-4所示。【例4-4】打开命令提示符cmd,输入以下命令,检查Paddle运行情况importpaddlepaddle.utils.run_check()展示的图表结果表明,未观察到任何错误提示,这表明Paddle的安装过程已经顺利完成,无须担忧。因此,可以安心地开展深度学习的相关开发工作。4.3数据集与资源034.3数据集与资源在人工智能(AI)与机器学习(ML)领域,数据扮演着至关重要的角色,是其模型构建的基石。缺乏优质、多元及丰富的数据集合,将严重阻碍AI项目的顺利实施。本节内容旨在阐述数据集的基本概念,梳理常见的公开数据集渠道,探讨数据集的储存与维护方法,介绍数据处理领域的常用工具与技术,并分析数据集的分析与评估策略。4.3数据集与资源4.3.1数据集基础知识数据集组成数据集包含特征(输入属性)和标签(输出结果),是模型训练的基础。数据划分通常分为训练集(70%)、验证集(15%)和测试集(15%),分别用于模型训练、调参和最终评估。数据质量关键需进行清洗、去噪、填充缺失值等处理,确保模型学习有效信息,避免噪声干扰。4.3数据集与资源4.3.2常见数据集资源ImageNet1400万标注图像,图像分类/检测的基准数据集,推动深度学习发展。Kaggle开放竞赛平台,提供金融/医疗/NLP等领域数据集,配套实际业务问题。4.3数据集与资源4.3.2常见数据集资源MNIST6万手写数字样本,入门级图像分类标准测试集。CIFAR系列CIFAR-10/100包含小尺寸彩色图像,用于小样本学习和CNN研究。4.3数据集与资源4.3.2常见数据集资源COCO33万图像+150万标注,支持目标检测/分割/描述等多模态任务。OpenAIGym强化学习标准环境库,涵盖控制/机器人等训练场景。LJSpeech24小时语音数据集,支持语音合成与识别研究。WikiText-1031.03亿词维基百科文本,用于语言建模与生成任务。4.3数据集与资源4.3.3数据集存储与管理存储方式选择本地存储:适合小型数据集,快速访问云端存储:弹性扩展,适合大规模数据分布式系统:HDFS等方案处理超大规模数据管理关键要素版本控制:使用DVC/GitLFS跟踪数据变更权限管理:精细化控制访问权限,保护敏感数据元数据管理:完善标注和文档,确保可追溯性4.3数据集与资源4.3.4数据处理工具与技术1.数据清洗缺失值处理:删除记录/均值填充/K近邻插补,确保数据完整性重复数据剔除:使用Pandas的drop_duplicates()高效去除冗余记录格式标准化:统一日期/文本格式,清理特殊字符与多余空格数值缩放:标准化(均值0标准差1)或归一化(0-1范围)特征值分类变量编码:独热编码(One-Hot)或标签编码(LabelEncoding)转换4.3数据集与资源4.3.4数据处理工具与技术1.数据清洗以泰坦尼克号乘客数据集为例运行drop_duplicates函数。打开命令提示符cmd,进入虚拟环境tf24_cpu,安装pandas库,具体命令如下所示。activatetf24_cpupipinstallpandas进入目录“D:\code_post\pythonProject2\教材”中,运行drop_duplicates_example.py文件,出现“PassengerIdSurvived”等字段的运行效果则表示文件运行成功,如图所示。4.3数据集与资源4.3.4数据处理工具与技术2.特征工程特征选择通过相关性分析/PCA等方法筛选关键特征,降低维度,防止过拟合特征提取图像:CNN自动提取视觉特征文本:Word2Vec/BERT等词嵌入技术特征组合创造新特征(如比值/差值等),挖掘更深层次数据关系4.3数据集与资源4.3.4数据处理工具与技术3.数据增强文本数据增强:可以通过同义词替换、句子重组等方法生成新的文本样本。音频数据增强:可以通过改变音频的音量、速度或添加噪声等方法生成新的音频样本。图像数据增强:通过旋转、翻转、裁剪、颜色变换等方法生成新的图像样本,从而提高模型的泛化能力,例如杯子的形状保持不变,但样式(包括颜色、纹理和对比度)是随机的,如图所示。4.3数据集与资源4.3.4数据处理工具与技术4.KNIME工具KNIME(KonstanzInformationMiner)是一款开源的数据分析、集成和可视化工具,广泛应用于数据清洗、分析、挖掘和可视化等任务。KNIME提供了图形化的工作流界面,用户可以通过拖放节点的方式构建数据分析流程,且无须编写代码。该工具适用于从初学者到专家的各类用户,能够高效地处理各种数据分析需求。4.3数据集与资源4.3.4数据处理工具与技术4.KNIME工具KNIME核心特点1.可视化工作流设计:拖拽式节点操作、直观构建数据处理流程2.多源数据支持:兼容Excel/CSV/数据库、灵活接入各类数据源3.机器学习集成:内置分类/回归/聚类算法、完整数据挖掘功能4.丰富可视化工具:快速生成数据图表、交互式结果展示4.3数据集与资源4.3.4数据处理工具与技术4.KNIME工具KNIME工作流设计1KNIME的工作流由多个节点组成,每个节点代表一个操作或处理步骤,节点间通过连接线传递数据,以下是KNIME工作流的示意图,如图所示。4.3数据集与资源4.3.4数据处理工具与技术4.KNIME工具KNIME工作流设计数据I/O节点:支持CSV/Excel/数据库等格式读写、实现多源数据无缝对接数据预处理节点:缺失值填补/数据清洗/标准化处理、数据集成与格式转换机器学习节点:分类/回归/聚类完整算法支持、模型训练与评估一体化可视化节点:自动生成柱状图/散点图等、交互式分析结果展示4.3数据集与资源4.3.4数据处理工具与技术4.KNIME工具KNIME工作流设计数据I/O节点:支持CSV/Excel/数据库等格式读写、实现多源数据无缝对接数据预处理节点:缺失值填补/数据清洗/标准化处理、数据集成与格式转换机器学习节点:分类/回归/聚类完整算法支持、模型训练与评估一体化可视化节点:自动生成柱状图/散点图等、交互式分析结果展示4.3数据集与资源4.3.5数据集分析与评估在对数据进行深入探究的过程中,分析并评价数据集的质量显得尤为关键。在这一过程中可以洞察数据的分布模式、特性以及潜在缺陷,这些洞察力对于指导后续模型的构建与精进具有不可估量的价值。进一步地,对数据集进行全面的评估,重点在于确认其是否具备充分的全面性与代表性,以保障数据集能够准确无误地映射出实际问题的本质。4.3数据集与资源4.3.5数据集分析与评估1.数据统计与可视化描述性统计:计算均值、标准差等指标,揭示数据集中趋势和离散程度。推断性统计:通过假设检验等方法,从样本数据推断总体特征。数据可视化:用Matplotlib/Seaborn等工具生成直方图、散点图,直观展示数据规律。2.数据评估全面性:检查数据集是否覆盖问题域所有场景(如识别任务中的全部类别)。代表性:验证数据分布是否符合真实情况(如不同光照、角度的样本覆盖)。4.4AI项目开发流程044.4AI项目开发流程在探索人工智能领域的项目构建的时候,必须严格遵循一套细致入微的开发流程,以确保项目自需求调研起始至顺利部署终的过程流畅进行。本部分内容将借助TensorFlow2.4.0版本的案例,深入阐释人工智能项目从孕育到成熟的全套工序,覆盖了需求解析、数据的汇集与初步加工、模型筛选及训练环节、模型的效果评定与精细化调整、实施部署与系统集成,以及成效分析暨报告撰写,如图所示。该流程不仅融入了丰富的理论知识,亦结合了实践操作,旨在助力读者深刻领悟并掌握人工智能项目开发中的核心环节。4.4AI项目开发流程4.4.1需求分析在人工智能项目的初步探索中,需求分析扮演着举足轻重的角色,它不仅是项目启动的基石,也是全程开发中不可或缺的关键环节。在此环节中必须清晰地界定出项目的宗旨、界限以及预期的成效。基于TensorFlow2.4.0来构建图像分类模型为例,需求分析的过程涵盖了确立待解难题(如对某些图像类别的分类)、掌握项目背景(如行业内的实际应用情况)、识别目标受众(如终端用户群体),以及设定项目成功的准则(如达到特定的分类精确度)。例如,若目标为开发能够自动辨识医疗影像中肿瘤的模型,此阶段需深入探究医疗领域的背景知识、现行的诊断技术以及模型的具体使用情境。此外,与医生、数据科学家等关键利益相关者的密切交流,亦是确保项目目标清晰、需求明确的关键步骤。4.4AI项目开发流程4.4.2数据收集与预处理在AI项目中,数据的搜集及其初步加工扮演着奠定模型训练成效的基石角色。模型表现优劣,与数据本身的品质及处理手段密不可分。鉴于此,深入洞察数据搜集与预处理的具体实施流程,对于打造一个高效的AI框架显得尤为关键。本部分旨在深入阐释数据准备的全程,助力读者领悟到如何将数据妥善地筹备妥当,以迎接模型训练及评估的各个环节。4.4AI项目开发流程4.4.2数据收集与预处理为阐述数据搜集的具体步骤,本研究选取了Kaggle平台上的“泰坦尼克号乘客数据集”作为案例分析。该数据集收录了众多乘客的详细资料,其目的在于推断这些乘客在泰坦尼克号悲剧中能否逃生。其数据架构清晰且易于理解,非常适宜用作分类问题的研究样本。该数据集的主要构成字段,可以参见表中所列。字段含义字段含义PassengerId乘客IDPclass船舱等级Name乘客姓名Sex性别Age年龄SibSp兄弟姐妹/配偶数量Parch父母/子女数量Ticket票号Fare票价Embarked登船港口(C,Q,S)Survived是否幸存(0=No,1=Yes)
4.4AI项目开发流程4.4.2数据收集与预处理1.获取数据集从Kaggle网站下载数据集,可以通过登录Kaggle账户,找到所需的公开数据集,并单击下载按钮将数据集文件(通常为.zip格式)保存到本地。下载后,将其解压并加载到Python中进行进一步处理,下载界面如图左所示,等待下载完成,数据集的数据字段如右图所示。4.4AI项目开发流程4.4.2数据收集与预处理2.数据预处理数据预处理是将原始数据转换为适合模型输入的格式的过程。这个过程包括数据清洗、数据转换、特征工程和数据增强等步骤,以下将详细介绍每个步骤,在运行以下每个步骤之前都必须要打开命令提示符cmd,接着进入虚拟环境tf24_cpu,然后进入目录“D:\code_post\pythonProject2\教材\泰坦尼克号数据”。4.4AI项目开发流程4.4.2数据收集与预处理2.数据预处理(1)数据清洗的目的是处理缺失值、异常值和重复数据。具体情况可以运行文件step_1_data_cleaning.py,若运行成功,则会生成一个新的csv文件titanic_cleaned.csv,如图所示。4.4AI项目开发流程4.4.2数据收集与预处理2.数据预处理(2)数据格式化是将数据转换为模型需要的格式。再运行文件step_2_data_formatting.py成功后则会生成titanic_formatted.csv,如图所示。4.4AI项目开发流程4
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年六盘水市六枝特区工会人员招聘考试参考试题及答案详解
- 河北省建设工程施工合同范本
- 2026年贵港市港北区政务服务中心(窗口人员)招聘考试备考试题及答案详解
- 2026年黄山市徽州区政务服务中心(窗口人员)招聘考试参考题库及答案详解
- 2026年慈溪市应急管理局公开招聘编外工作人员1人考试参考题库及答案详解
- 2026年四川省资阳市政务服务中心(窗口人员)招聘笔试模拟试题及答案详解
- 2026年贵州省贵阳市工会人员招聘考试参考试题及答案详解
- 2026浙江中通文博服务有限公司招聘莲都电信业务项目部智家工程师4人考试模拟试题及答案详解
- 2026辽宁锦州北镇市第二人民医院公开招聘专业技术人员笔试参考题库及答案详解
- 2026年伊春市乌马河区医疗系统事业编人员招聘笔试参考题库及答案详解
- 更年期综合征职业压力调节方案
- 2026届北京理工大附中分校物理九年级第一学期期末质量跟踪监视试题含解析
- 雨课堂在线学堂《创业管理四季歌:艺术思维与技术行动》单元考核测试答案
- 房顶建筑改造方案设计说明
- 2025年春季中国商飞公司校园招聘和年度社会招聘考前自测高频考点模拟试题及答案详解(名校卷)
- 行车便道施工方案
- 营销策划 -好望水品牌手册 东方草本植物饮料品牌 从自然中汲取创新灵感 从植物中探索美好力量
- 2025年镇江护士考试题库
- T/CSBME 077-2023一次性使用支气管堵塞器
- 2025年高考作文素材积累之现实批判:“异化”
- 农村建房包工包料施工合同
评论
0/150
提交评论