《人工智能通识教程》高职全套教学课件_第1页
《人工智能通识教程》高职全套教学课件_第2页
《人工智能通识教程》高职全套教学课件_第3页
《人工智能通识教程》高职全套教学课件_第4页
《人工智能通识教程》高职全套教学课件_第5页
已阅读5页,还剩379页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第1章人工智能的概念与发展《人工智能通识课程)(第1版)》全套可编辑PPT课件第1章人工智能的概念与发展第2章人工智能关键算法第3章人工智能常用技术第4章AIGC技术第5章人工智能行业应用学习目标/Target

掌握人工智能的本质内涵、核心研究目标与三大学派的思想分野。梳理人工智能从孕育、起伏到爆发的全球发展脉络,以及中国从起步到创新的特色化历程。深入理解数据、算法、算力作为AI发展三大引擎的内涵、作用机理与协同关系。把握人工智能在模型演进、应用拓展、社会治理等方面的发展趋势与核心挑战。章节概述/Summary

本模块旨在系统阐释人工智能的基本概念、核心思想与发展脉络,构建学生对这一前沿领域的整体认知框架。内容涵盖人工智能的起源与多维度定义、演进过程中的三大学派与核心技术引擎,以及从全球视野到中国实践的发展历程。通过剖析数据、算法、算力的协同作用,并结合对当前趋势、伦理挑战与治理框架的探讨,引导学生理解人工智能不仅是技术革命的驱动力,更是引发社会深刻变革、需承担伦理责任的关键领域。本模块注重知识体系的完整性与思想性,为后续深入学习具体技术奠定坚实的理论基础。目录/Contents1.11.2基本概念人工智能发展的三大引擎1.3人工智能发展趋势与挑战基本概念1.11.1.1人工智能起源

人工智能的诞生并非一蹴而就,它深深植根于人类对自身智能的追问与模仿,并随着现代科学理论的突破和计算工具的发明而最终成形。1.古代的思想源流与机械梦想

自古希腊时期亚里士多德的形式逻辑为后来的符号推理埋下了伏笔。中国先秦时期的《墨子》中记载的机械装置与逻辑论述,同样闪烁着早期自动化与理性思维的光辉。文艺复兴后,帕斯卡、莱布尼茨等思想家梦想着通过一种“通用符号”和“理性演算”来规范化所有思维过程,被视为人工智能符号主义学派的哲学源头。1.1.1人工智能起源2.近代的理论奠基图灵于1936年提出了“图灵机”这一抽象计算模型,从理论上证明了通用计算机的可能性。1950年,他在论文《计算机器与智能》中提出了著名的“图灵测试”,为判断机器是否具有智能提供了一个可操作的哲学框架。几乎同时,维纳创立了“控制论”,研究生物与机器中控制与通信的普遍规律,强调反馈机制的重要性,这为后来的行为主义学派奠定了基础。香农的信息论则为知识的量化表示与处理提供了数学工具。1.1.1人工智能起源3.学科的正式确立1956年夏,约翰·麦卡锡、马文·明斯基、克劳德·香农、纳撒尼尔·罗切斯特等学者在美国达特茅斯学院发起了一场为期两个月的研讨会。

在这次会议上,“人工智能”作为一个明确的学科领域被正式提出并界定。会议的目标是探索如何让机器模拟学习的各个方面或智能的任何其他特征,并尝试制造出能够使用语言、形成抽象概念的机器。

尽管当时的目标充满乐观甚至天真的色彩,但达特茅斯会议汇聚了早期研究者,设定了核心议题,被公认为人工智能学科诞生的标志性事件。1.1.2人工智能定义

人工智能是一个内涵丰富且不断演进的领域,不同学科背景的学者从其自身视角出发,给出了多种定义。1.学科交叉视角

人工智能是计算机科学、数学(尤其是统计学与优化理论)、控制论、神经科学、心理学、语言学、哲学等多学科深度交叉融合的产物。它不仅仅是一门工程技术,更是一个探索智能本质的科学领域。1.1.2人工智能定义2.研究目标视角

从目标上看,人工智能旨在探究智能的本质,并在此基础上创造能够模拟、延伸乃至扩展人类智能的智能体(IntelligentAgent)。这里的“智能”涵盖了一系列认知能力:

(1)感知智能:如视觉、听觉,对应计算机视觉、语音识别。

(2)认知智能:包括学习(机器学习)、推理(知识表示与推理)、规划(自动规划)、语言理解(自然语言处理)。

(3)创造智能:生成新的、有意义的内容或解决方案,如AIGC(人工智能生成内容)。1.1.2人工智能定义3.技术实现视角

作为一类使能技术,人工智能指用于实现上述智能行为的一系列方法、模型与系统。其核心在于使机器能够:

(1)从环境(数据)中感知信息。

(2)通过学习获取知识或技能。

(3)运用知识进行推理、决策以解决复杂问题。

(4)适应环境变化并持续优化。

一个较为综合的技术性定义是:人工智能是研究、设计能够从环境中感知信息,并自主采取行动以实现特定目标的智能体的理论与方法。1.1.3人工智能发展的三大学派在人工智能的发展长河中,先后形成了三种主导性的研究范式,分别是符号主义、连接主义和行为主义。它们代表了不同的哲学基础、技术路径和对智能本质的理解。人工智能的三大学派示意图1.1.3人工智能发展的三大学派1.符号主义

符号主义强调知识的形式化表示、存储与推理规则的重要性,通过精确算法和规则模拟人类智能行为,以实现具有高度可解释性和可控性的智能系统。

符号主义基于逻辑与规则的推理,计算机通过预设规则进行推理和决策。基于规则的推理1.1.3人工智能发展的三大学派符号主义主要特点如下:

(1)核心理念:智能的本质是符号处理和逻辑演算。通过将知识形式化为符号和规则,并运用逻辑推理机制,即可实现智能行为。

(2)技术特征:强调知识的显式表示(如谓词逻辑、框架、语义网络)和基于规则的推理(如演绎、归纳)。追求系统的可解释性与可控性。

(3)贡献与局限:引领了AI研究的第一次浪潮,催生了专家系统、定理证明器等早期成果。但其依赖于完备的知识库与精确的规则,难以处理不确定性问题与海量常识知识,且缺乏自主学习能力,导致了其在面对复杂真实世界时的瓶颈。

1.1.3人工智能发展的三大学派2.连接主义

连接主义起源于对人脑神经网络的模仿,它认为智能的产生不依赖于严格的逻辑推理,而是源于大量简单单元之间的相互连接于协同作用。

连接主义的核心模型是人工神经网络(artificialneuralnetwork,ANN),它是对人脑神经网络的简化模拟,由输入层、隐藏层和输出层组成。每层由多个神经元构成,神经元之间通过权重连接,权重决定信号传递的强弱。人工神经网络结构图1.1.3人工智能发展的三大学派连接主义的主要特点如下:

(1)核心理念:智能源于大量简单处理单元(神经元)通过连接构成的网络中的并行分布式处理与学习。智能是网络结构在数据驱动下自适应调整的“涌现”属性。

(2)技术特征:以人工神经网络为核心模型,通过调整神经元间的连接权重从数据中学习统计规律。擅长处理图像、语音、文本等非结构化数据,具有强大的模式识别能力。

(3)贡献与局限:尤其是深度学习革命,推动了人工智能在感知领域的突破性进展。然而,其通常需要海量标注数据和强大算力,且模型决策过程如同“黑箱”,可解释性差,存在算法偏见风险。

1.1.3人工智能发展的三大学派3.行为主义

行为主义起源于对动物行为学的研究,他通过感知与环境交互,通过行动与反馈不断学习和适应,即智能是通过“行动”实现的,也就是行为主义为智能体(Agent)提供了行为范式。行为主义认为智能体核心能力在于感知环境、做出行动,并通过反馈不断优化自己的行为。行为主义的主要特点如下:

(1)核心理念:智能并非静态的知识或固定的网络结构,而是在智能体与环境的动态交互中,通过“感知-行动-反馈”循环不断进化而成的适应能力。

(2)技术特征:以强化学习为代表。智能体通过试错探索环境,根据获得的奖励或惩罚信号来调整策略,以追求长期累积回报的最大化。

(3)贡献与局限:在机器人控制、游戏AI、自动驾驶等动态决策领域表现出色。但其训练过程往往效率低、成本高,且策略的安全性与鲁棒性验证挑战巨大。1.1.3人工智能发展的三大学派连接主义的主要特点如下:

(1)核心理念:智能源于大量简单处理单元(神经元)通过连接构成的网络中的并行分布式处理与学习。智能是网络结构在数据驱动下自适应调整的“涌现”属性。

(2)技术特征:以人工神经网络为核心模型,通过调整神经元间的连接权重从数据中学习统计规律。擅长处理图像、语音、文本等非结构化数据,具有强大的模式识别能力。

(3)贡献与局限:尤其是深度学习革命,推动了人工智能在感知领域的突破性进展。然而,其通常需要海量标注数据和强大算力,且模型决策过程如同“黑箱”,可解释性差,存在算法偏见风险。

1.1.4人工智能发展历程1.全球发展脉络(1)萌芽与黄金期(1950s-1960s):达特茅斯会议后,研究者对实现通用AI充满信心,出现了第一款棋类程序、聊天机器人ELIZA和具备初步感知规划能力的机器人Shakey。(2)知识工程与第一次寒冬(1970s):研究焦点转向基于规则的专家系统。尽管在特定领域(如医疗诊断MYCIN)取得商业成功,但“知识获取瓶颈”和计算局限导致预期落空,投入锐减。(3)复兴与多元化(1980s-1990s):随着个人电脑普及和反向传播算法的重新发现,连接主义开始复苏。IBM“深蓝”击败国际象棋世界冠军,展示了机器在规则明确领域的强大算力。机器学习逐渐成为主流。(4)数据驱动与深度学习革命(2000s至今):互联网大数据、GPU并行计算与深度学习算法的突破(如2012年的AlexNet,)形成合力。2016年的AlphaGo攻克围棋,2017年的Transformer架构催生大语言模型,AI进入以大语言模型为标志的爆发期,技术渗透到社会经济的每个角落。1.1.4人工智能发展历程2.中国发展里程碑(1)艰难起步与早期探索(1970s-1980s):1978年全国科学大会召开,“科学的春天”到来,为包括AI在内的科技研究创造了条件。改革开放后,在汉字识别、机器翻译等领域开始研究。吴文俊的几何定理机器证明获国际认可。1986年,“863计划”将智能计算机系统列为重点,AI正式进入国家科技视野。(2)技术积累与产业跟进(1990s-2010s):2003年,北京大学等高校率先设立“智能科学与技术”本科专业,人才培养体系逐步建立。许多企业开始深耕垂直领域:百度于2006年成立深度学习研究院(IDL),早期布局AI;科大讯飞在语音合成与识别领域持续深耕,2006年首次获得BlizzardChallenge冠军;2010年代,腾讯推出新闻写作机器人、优图实验室;百度推出对话机器人“度秘”、布局自动驾驶;阿里成立数据科学与技术研究院。中科院计算所于2016年研制出国际先进的AI芯片“寒武纪1号”。1.1.4人工智能发展历程2.中国发展里程碑(3)国家战略引领与全面加速(2017年至今):人工智能连续多年被写入《政府工作报告》。2017年,国务院发布《新一代人工智能发展规划》,确立了“三步走”战略目标。教育部积极推进人工智能学科建设与人才培养;人社部发布“人工智能工程技术人员”、“人工智能训练师”等新职业,规范人才发展路径。人工智能被明确列为新型基础设施的核心之一,加速与实体经济融合。学术界研究水平跻身世界前列,产业界在计算机视觉、语音识别等应用领域达到国际先进水平。(4)创新突破与生态繁荣(当前):以DeepSeek(深度求索)为代表的中国团队推出有影响力的开源大语言模型。商汤、百度、阿里、腾讯、字节跳动(豆包)、月之暗面(Kimi)等公司纷纷推出各具特色的大模型产品,在语言、视觉、多模态等领域形成活跃的创新生态。在AI芯片(如华为昇腾、寒武纪)、自动驾驶、机器人(具身智能)等硬件与系统层面持续取得进展。AI技术正深入金融、医疗、制造、交通、城市治理等千行百业,推动数字化转型与智能化升级。人工智能发展的三大引擎1.21.2.1数据

数据是智能的燃料与基石,是AI模型学习和进化的“养料”,其规模、质量与多样性从根本上决定了智能系统的能力上限。1.核心价值高质量数据是训练高性能模型的先决条件。2.处理流程从原始数据到可用训练集,需经历采集、清洗、标注、特征工程等一系列复杂工序。3.核心挑战与对策

(1)隐私与安全

(2)偏见与公平

(3)合规性1.2.2算法

算法是智能的“大脑”与灵魂,是人工智能的“思想蓝图”。它定义了如何从数据中提取模式、进行推理并做出决策。算法的创新是AI能力进步的直接体现。1.主要学习范式(1)监督学习:利用标注数据学习输入到输出的映射,解决分类、回归等预测问题。(2)无监督学习:从无标签数据中发现内在结构或分布,用于聚类、降维、异常检测。(3)强化学习:智能体通过与环境的试错交互,根据奖励信号学习最优行动策略。1.2.2算法

2.深度学习的核心架构(1)卷积神经网络:专为处理图像等网格数据设计,具有局部连接和权值共享特性。(2)循环神经网络及其变体:专为处理序列数据(文本、语音)设计,具有短期记忆功能。(3)Transformer:基于自注意力机制,彻底改变了自然语言处理领域,并成为大语言模型的基石。3.前沿方向(1)效率提升:设计更轻量、更高效的网络架构与训练方法。(2)能力拓展:探索具备因果推理、常识理解和跨模态融合能力的模型。(3)可信AI:发展可解释AI、提升模型鲁棒性、确保算法公平性。1.2.3算力

算力是智能的“肌肉”与动力,为复杂算法的运行和海量数据的处理提供物理基础,是将智能“想法”转化为现实能力的硬支撑。1.硬件演进路径

从通用CPU到并行GPU,再到TPU、NPU、ASIC等芯片,计算能效比不断提升。2.计算范式扩展

(1)云计算:提供弹性、集中的超强算力,用于大模型训练和复杂计算。

(2)边缘计算:将计算下沉至数据产生的终端或近端,满足实时性、低延迟和隐私保护需求。云边协同成为主流架构。3.可持续性挑战

大模型的训练与推理消耗巨量电力,产生显著的碳足迹。发展“绿色AI”,通过芯片工艺改进、算法优化和使用清洁能源来降低能耗,已成为行业共识。人工智能发展趋势与挑战1.21.3.1发展趋势1.模型演进的两极分化

一方面,基础大模型持续向更大规模、更强通用能力演进,成为AI新型基础设施。另一方面,模型小型化与高效部署技术(如剪枝、量化、蒸馏)快速发展,推动AI在资源受限的终端设备上落地。2.从感知到认知与行动的跨越

研究重点正从感知智能(“看、听、读”)向认知智能(“理解、推理、决策”)和具身智能(通过机器人等载体与物理世界交互)拓展。3.交叉融合与科学新范式“AIforScience”正在生物制药(如AlphaFold)、材料发现、气候模拟等领域引发科研范式变革。AI与各垂直行业的深度融合催生大量创新应用。4.开源开放与生态构建

开源框架、模型与数据集极大降低了创新门槛,围绕核心平台形成了繁荣的开发者与产业生态。1.3.2数据安全与相关法律法规

人工智能的深度应用使得数据安全与合规成为不可逾越的红线,全球范围内相关法律监管体系正在快速完善。1.中国的法律框架“三驾马车”

(1)《网络安全法》。

(2)《数据安全法》。

(3)《个人信息保护法》。2.核心原则

包括目的明确与最小必要、用户知情同意、数据安全防护、违规问责等。企业需在技术、管理、流程上全面落实合规要求。3.新挑战

大模型训练数据的版权与隐私问题、AI生成内容的监管与问责、跨境数据流动的合规性等,仍是亟待解决的前沿议题。1.3.4道德与伦理1.核心伦理议题

(1)公平与偏见:防止算法固化或放大社会歧视。

(2)透明与可解释:在关键领域确保AI决策过程可理解、可追溯。

(3)责任与问责:明确AI系统造成损害时的责任主体。

(4)隐私与自主:防止技术滥用侵蚀个人隐私与自主权。(5)长期安全与价值对齐:确保强大AI系统的终极目标与人类整体利益一致。2.构建负责任的人工智能

(1)将伦理考量内嵌于技术研发全流程(“伦理设计”)。

(2)建立跨学科、多元主体参与的伦理审查与治理机制。

(3)发展可解释AI、公平性评估等技术工具,赋能伦理治理。

(4)积极参与并推动形成全球性的AI伦理准则与治理框架。本章小结本章小结

本章系统阐述了人工智能的基本概念、发展脉络与核心要素。人工智能诞生于1956年达特茅斯会议,其发展过程中形成了符号主义、连接主义和行为主义三大学派,分别从逻辑推理、神经网络和环境交互等不同路径探索智能本质。全球AI历经萌芽、寒冬、复兴直至深度学习革命,当前以大语言模型为标志进入爆发期;中国AI从艰难起步到国家战略引领,正加速构建创新生态。数据、算法、算力构成驱动AI发展的三大引擎,共同支撑起现代智能系统。与此同时,AI的深度应用也带来了数据安全、算法偏见、伦理责任等严峻挑战。理解这些基本概念与发展逻辑,是迈向人工智能通识认知的重要基石。第2章人工智能关键算法《人工智能通识课程)(第1版)》学习目标/Target掌握人工智能关键算法的核心内涵,理解机器学习与深度学习的关系,以及各类学习范式(有监督、无监督、半监督、强化学习)的思想分野与适用场景。梳理机器学习主要任务与常用算法,系统掌握深度学习的基本原理、神经网络基础,以及CNN、RNN、生成模型等典型架构的核心机制与应用价值。深入理解深度学习中卷积神经网络、循环神经网络、生成模型等关键技术的原理、结构特点、优势局限,并能够运用PyTorch等框架搭建简单模型完成图像分类等实践任务。把握人工智能关键算法在实际行业应用中的作用,结合中国AI发展实践,培育科技伦理意识与文化自信,坚定沿着中国特色人工智能创新道路前行的信念。章节概述/Summary本模块聚焦人工智能的“核心引擎”——机器学习主流算法与深度学习模型架构。通过“原理-实例-场景”三位一体的方式,系统阐释有监督学习、无监督学习、半监督学习、强化学习四大范式,以及深度学习中CNN、RNN、生成模型等典型神经网络架构的核心思想与实现机制。目录/Contents2.12.2机器学习深度学习机器学习2.1本节概述

机器学习是人工智能领域的核心技术,使计算机系统能够从数据中自动获取规律,完成预测、分类、决策等任务。与传统依赖人工编写规则的程序不同,机器学习强调数据驱动,让系统在持续学习和反馈中逐步提升性能,已广泛应用于智能推荐、语音识别、图像分析、金融风控等领域。本节主要内容包括以下三个部分:(1)机器学习定义与主要任务:介绍机器学习的核心思想、三要素(数据、算法、模型)、与传统编程的区别,以及四大主要任务(分类、预测、聚类、决策)。(2)机器学习的四种学习方式:分别讲解有监督学习、无监督学习、半监督学习和强化学习的核心原理与应用场景(3)动手实践:通过两个实践项目(学生学习行为预测和K-means学生行为聚类)体验机器学习的完整工作流程。2.1.1机器学习定义核心思想机器学习研究如何使计算机在缺乏明确规则指令的情况下,依托数据和经验不断改进自身性能。通过历史数据分析,让计算机自动发现隐含规律,对未知数据作出判断或预测。三要素数据:机器的"学习材料"算法:机器的"学习方法"模型:学习后形成的"知识结果"与人工编程的区别面对数据规模大、影响因素多、变化频繁的问题,机器学习通过学习大量样本自主形成判断能力,展现出独特优势。机器学习并不意味着计算机具备人类意义上的"理解"或"思考"能力,其学习过程本质上仍是基于数学模型和数据统计规律的计算过程。2.1.2机器学习主要任务🏷️分类任务根据已有特征将对象划分到预定义类别。例:垃圾邮件识别、学生学习状态分级(良好/一般/需关注)。📈预测任务对未来结果或未知数值进行估计,输出连续数值或趋势。例:期末成绩预测、股票走势预测。🔍聚类任务不依赖事先标签,根据数据相似性自动分组。例:用户消费群体划分、学生学习类型聚类。🤖决策任务在特定环境下选择最合适的行动方案。例:智能推荐系统内容推送、设备运行策略决策。2.1.3有监督学习及常用算法有监督学习利用"带有正确结果标注的数据"进行训练,机器可将预测结果与真实结果对比,根据差异不断调整参数。可理解为"带答案的练习",主要用于分类和预测两大类问题,是机器学习中最成熟、最常见的学习方式。1线性回归结构最简单,用于连续数值预测。假设输入与结果存在线性关系,学习最合适的"直线"实现估计。例:房价预测、成绩区间预测。2逻辑回归虽名"回归",实用于二分类问题,输出属于某类别的概率。例:判断是否通过考核、申请是否审核通过。3决策树基于规则判断,以"如果……那么……"形式逐层分支,结构直观、逻辑清晰,适合教学示例和业务决策分析。4支持向量机(SVM)寻找最大程度区分不同类别的分界线,在样本较少、特征区分度高时表现稳定,常用于文本分类与模式识别。2.1.4无监督学习及常用算法核心特点无监督学习在没有明确结果标注的前提下对数据进行分析和建模,训练数据只提供输入信息。机器需主动发现数据中潜在的结构、规律或异常模式,可理解为"没有标准答案的探索过程"。典型应用用户行为分析:发现不同用户群体的行为模式设备运行监测:通过异常检测及时发现潜在风险数据探索阶段:快速把握数据分布与相似性特征K-means聚类将数据划分为若干类别,使同类数据特征尽可能相似,不同类别差异尽可能明显。常用于用户分群、市场分析。层次聚类通过逐层合并或拆分完成聚类,以树状结构展示,无需事先指定类别数,可解释性高。主成分分析(PCA)提取最具代表性的主要成分,在保留原始信息前提下降低数据维度,常用于数据预处理与可视化。2.1.5半监督学习及常用算法半监督学习的训练数据中只有一部分样本带有标注,其余大量数据无正确答案。机器既利用少量"有答案"数据引导学习,又结合未标注数据的整体结构信息,在标注成本较低时获得较好效果。自训练方法先用少量已标注数据初步训练,再由模型对未标注数据预测,筛选高置信度样本重新加入训练集,多轮迭代扩大训练规模。协同训练方法利用多个模型或多个特征视角共同学习,不同模型在各自视角下相互提供高置信度预测结果,降低单一模型偏差风险。基于图的方法将样本视为图中节点,通过相似度构建连接边,利用"相似样本具有相似标签"假设,将标注信息沿图结构传播至未标注样本。2.1.6强化学习及其常用算法核心思想强化学习通过"试错"和"反馈"机制学习,智能体在与环境交互中根据行为获得奖励或惩罚,以此调整行为策略。关注的不是单次判断是否准确,而是"在连续决策中如何获得最大整体收益"。典型应用游戏智能、机器人控制、自动驾驶、路径规划等动态决策场景。1Q-learning通过更新"行为价值函数"评估长期收益,结构清晰、概念直观,常作为强化学习入门算法。2SARSA算法与Q-learning相似,但更新时关注当前实际采取的行为路径,表现出更平稳保守的学习特性。3策略梯度方法直接优化行为策略参数,使智能体更可能采取高收益行为,在动作空间大或决策复杂场景中优势明显。动手实践1:学生学习行为预测决策树分类PYTHONSCIKIT-LEARN

本实践以真实教学场景为背景,利用决策树分类算法完成从数据读取、模型训练到结果评估的完整流程,理解"特征→标签→模型→预测"的基本逻辑。01环境初始化打开Supervised_Student_Behavior_Classification.ipynb,导入numpy、pandas、scikit-learn等库。02数据读取与探索查看数据集规模,理解各字段含义,观察标签分布,建立对数据的直观认识。03特征构造与数据划分构造特征矩阵X与标签y,将数据划分为训练集与测试集。04模型训练与评估训练决策树模型,通过准确率、分类报告和混淆矩阵分析预测效果。05模型解释与结果导出分析特征重要性,理解决策依据,导出含真实标签与预测标签的CSV文件。拓展任务:①将三分类调整为二分类(风险/非风险学生);②修改决策树深度参数,比较不同复杂度下预测效果变化,理解过拟合与欠拟合。动手实践2:K-means学生行为聚类

本实验以学生学习行为数据为对象,在无先验标签条件下,通过分析学习时长、作业完成率、测验参与频率等多维特征,利用K-means算法自动发现学生群体的潜在结构。01数据导入与理解打开KMeans_Student_Behavior_Practice.ipynb,读取study_behavior_200.csv,执行info()与describe()理解字段含义。02特征选择与标准化选取数值型行为特征,剔除student_id,使用StandardScaler将数据转换为均值0、方差1的标准分布。03确定聚类数K采用肘部法和轮廓系数法比较不同K值效果,结合业务场景判断合理聚类数。04模型训练与评估训练KMeans模型,统计各类别人数分布与特征均值,构建"低参与型/中等稳定型/高投入型"等行为画像。05可视化与结果导出利用PCA降维至二维,绘制聚类散点图直观展示分布,导出含聚类标签的CSV文件。拓展任务:①分别设置K=3和K=5,观察聚类结果变化;②删除"讨论区发帖次数"特征重新聚类,比较不同特征对结果的影响。K-MEANS聚类无标签数据行为画像深度学习2.22.2.1深度学习定义

定义:深度学习(DeepLearning,DL)是一种让计算机从大量数据中自动学习如何完成特定任务的人工智能技术。核心思想:模拟人脑神经网络,由多层人工神经元构成,逐层加工提炼原始数据,提取抽象特征以完成识别、分类、预测、生成等复杂任务。深度学习的定义2.2.1深度学习定义最大优势:端到端学习,无需人工手动设计特征传统方法示例:如特征工程,识别猫需工程师手动编写“尖耳朵”“胡须”等规则深度学习:只需提供大量带标签图片,模型自动发现关键模式显著提升图像识别、语音合成、机器翻译等复杂任务的性能深度学习的核心优势2.2.1深度学习定义成功依赖三大条件:海量训练数据、高性能计算硬件(GPU)、精心设计的网络结构典型应用:深度学习的成功条件与应用自动驾驶环境感知智能手机面部解锁语音助手指令理解医疗影像病灶自动标注2.2.2深度学习与机器学习的关系两者的内在联系两者的核心关系机器学习的定义与应用深度学习的特点与优劣深度学习与机器学习之间并非对立关系,而是一种继承与拓展的内在联系。机器学习是人工智能重要分支,指计算机靠数据自动提性能,含多种算法,在多类场景仍有重要作用。深度学习是机器学习的特殊路径,以多层神经网络学习非线性映射,优在能力强适配好,劣在耗资源易存偏见。2.2.2深度学习与机器学习的关系深度学习的核心跃升深度学习与机器学习的关系传统机器学习的局限深度学习的核心优势可以说,深度学习是机器学习的一个子集,但它在方法论和应用能力上带来了显著跃升。传统机器学习需人工特征工程,耗时费力、依赖先验知识,难处理高维非结构化数据。深度学习靠多层网络自动完成特征提取与任务预测联合优化,凭自动化抽象能力在多领域获突破。2.2.2深度学习与机器学习的关系两者的互补共存两者互补共存二者的核心关系对学习者的意义深度学习未完全取代传统机器学习,二者互补共存,在不同场景各展所长。机器学习提供通用学习框架,深度学习是特定条件下对该框架的深化与强化,二者服务不同层次问题需求。掌握传统机器学习基础原理是理解深度学习的前提,了解深度学习进展有助于把握AI技术前沿方向。2.2.3神经网络基础神经网络基本概念:神经网络是深度学习基石,灵感源于人脑神经元,由多层节点互联处理输入数据。神经网络层级结构:神经网络含输入层、隐藏层、输出层,各层神经元经加权求和、激活函数转换传递信号,多层网络可捕捉复杂模式。神经网络基础2.2.3神经网络基础前向传播:数据从输入层逐层传递到输出层反向传播:计算预测误差,逐层调整网络权重通过大量迭代,网络逐渐学会从数据中提取关键特征!神经网络的训练过程2.2.3神经网络基础单个神经元能力有限多层结构使网络具备强大表达能力,可逼近任意复杂函数类比:简单音符通过复杂连接组成恢弘交响曲神经网络的核心魅力2.2.4卷积神经网络卷积神经网络概述:卷积神经网络是适配网格结构数据的深度神经网络,靠卷积操作提升能力,推动计算机视觉发展。专为处理网格结构数据(如图像、视频)设计核心优势:利用空间局部性和平移不变性,减少参数量,提高效率卷积神经网络(CNN)2.2.4卷积神经网络卷积操作:小型卷积核在图像上滑动,提取局部特征(边缘、纹理等)参数共享:同一卷积核在整张图像上使用,增强位置鲁棒性池化层:下采样,保留显著特征,降低计算量CNN的核心操作—卷积与池化卷积核(kernel)为3×3、步长(stride)为1、填充(padding)为1的二维卷积卷积计算最大池化操作2.2.4卷积神经网络底层卷积层:检测边缘、颜色等简单特征中层:组合形成部件(如眼睛、轮子)高层:整合为完整语义对象(如人脸、汽车)CNN的层次化特征提取CNN的发展与代表模型2012年AlexNet获突破性胜利后,卷积神经网络成图像任务标准架构;ResNet

模型通过残差连接解决深层网络梯度消失问题;广泛应用于:智能手机拍照优化、医疗影像分析、自动驾驶感知;虽Transformer等新架构表现出色,卷积神经网络仍因高效、稳定、可解释性强,是深度学习工具箱不可或缺的重要部分。2.2.5循环神经网络循环神经网络定义:循环神经网络是处理序列数据的深度学习模型,带“记忆”机制,适配有时间/上下文关联的数据。工作原理类比:循环神经网络模拟人类结合上下文理解语义的能力,通过循环连接捕捉序列依赖关系。循环神经网络(RNN)专为处理序列数据(如文本、语音、时间序列)设计!2.2.5循环神经网络主要问题:长序列训练中标准循环神经网络易梯度消失改进模型:LSTM(长短期记忆网络)GRU(门控循环单元)通过门机制选择性记忆或遗忘信息,有效捕捉长距离依赖RNN面临的问题与改进自然语言处理:机器翻译、情感分析、文本生成其他领域:语音识别、股价预测、心电图辅助诊断优势:在资源受限或实时性要求高的场景仍有重要价值RNN的典型应用2.2.6生成模型核心目标:学习真实数据的内在分布,生成相似但全新的样本从“判断是什么”转向“可能是什么样子”,实现从感知到创造的跃升生成模型2.2.6生成模型变分自编码器(VAE):VAE是概率建模生成模型,经编码-解码重构数据,训练稳定但生成结果偏模糊、细节不足。经典生成模型—VAE2.2.6生成模型生成对抗网络(GAN):GAN含生成器(伪造数据)、判别器(辨真假),经对抗训练可生成高分辨率逼真图像。经典生成模型—GAN2.2.6生成模型扩散模型:源自物理扩散过程,训练稳定、生成质量高,通过逐步添加噪声再去除噪声来生成图像等数据。新兴生成模型—扩散模型2.2.6生成模型图像合成、视频生成文本创作、代码生成3D、AR、VR创作药物分子设计、艺术创作代表技术:GPT系列(自回归生成)生成模型的应用场景价值与挑战思考生成模型拓AI边界、具技术价值,却存真实性、版权等挑战,需规范治理,亦启对智能本质的思考。动手实践3:天气图像分类引导学习者使用PyTorch框架构建一个简单的卷积神经网络模型,完成对天气图像的分类任务。该任务的目标是根据输入的彩色图片判断其对应的天气状况,例如晴天、多云、下雨或日出等。为了便于训练和验证,数据集被组织为多个子文件夹,如下图所示,每个文件夹对应一种天气类别,如“cloudy”“rain”“shine”“sunrise”,每张图片都代表某一特定天气场景的视觉表现。通过这一动手实践,学习者不仅能够掌握从数据准备、模型搭建到训练评估的完整流程,还能直观感受到深度学习在真实世界图像识别问题中的应用价值。整个过程将结合代码实现与结果分析,帮助学生建立从理论到实践的桥梁,提升解决实际问题的能力。1.实践背景动手实践3:天气图像分类理解卷积神经网络的基本组成(卷积层、池化层、全连接层)及其在图像特征提取中的作用;掌握使用PyTorch加载图像数据集、定义自定义CNN模型、配置损失函数与优化器的方法;能够完成端到端的模型训练、验证与性能评估,并分析训练过程中准确率与损失的变化趋势。2.实践目标软件环境:Python3.8及以上版本;硬件要求:支持CUDA的GPU(可选,若无则使用CPU训练);依赖库安装命令:pipinstallscikit-learnpandasnumpyjieba;数据集:公开天气图像数据集。3.实践准备动手实践3:天气图像分类(1)环境配置与库导入:安装所需库,导入torch、torchvision、PIL、pathlib等模块,并检测是否可用GPU加速。(2)数据集加载与预处理:(3)划分训练集与测试集:按8:2比例随机分割数据集,并创建DataLoader实现批量加载与打乱。(4)定义卷积神经网络模型:构建包含两组“卷积+批归一化+ReLU”块、两次最大池化、以及一个全连接输出层的自定义CNN。(5)配置训练组件:选择交叉熵损失函数(CrossEntropyLoss)和SGD优化器(学习率设为1e-4)。4.实践步骤动手实践3:天气图像分类(6)编写训练与测试函数:封装训练循环(含前向传播、反向传播、参数更新)和测试循环(仅前向推理),返回准确率与损失。(7)执行训练并记录结果:运行50个epoch,每轮输出训练/测试准确率与损失,并保存指标用于后续可视化。(8)结果分析:观察训练曲线,判断模型是否收敛、是否存在过拟合,并尝试解释不同天气类别的识别难度。4.实践步骤动手实践3:天气图像分类本实践代码基于PyTorch框架,完整实现了天气图像分类任务的全流程:从数据加载、预处理、模型定义(含卷积层、批归一化与全连接层),到训练循环、测试评估及结果可视化。模型通过50轮训练,在四类天气图像(cloudy、rain、shine、sunrise)上实现了端到端的分类,并通过准确率与损失曲线直观反映学习过程。5.实践代码6.实验结果本章小结本章小结本章主要学习了机器学习与深度学习定义、两者之间的关系,学习了机器学习的主要任务,无监督学习、有监督学习、半监督学习和强化学习及其常用算法,同时学习了深度学习中深度神经网络。第3章人工智能常用技术《人工智能通识课程)(第1版)》学习目标/Target

了解计算机视觉的4个层次、常见任务,掌握图像分类、物体检测、图像分割、目标跟踪。掌握自然语言处理相关技术和应用,掌握文本关键词提取和文本情感分析动手实践。知识图谱的定义、知识图谱的生命周期、知识图谱的表示方法。了解智能语音技术、语音降噪与增强的定义、语音唤醒的定义和流程、智能语音技术的几种常见任务。学习目标/Target

智能机器人的定义熟悉智能机器人的分类、熟悉智能机器人的关键性技术章节概述/Summary

在人工智能领域中,计算机视觉模拟了人类“看”的能力,自然语言处理模拟了人类“读”的能力,语音识别模拟了人类“听”的能力,语音合成模拟了人类“说”的能力,机器人模拟了人类“动”的能力。本模块聚焦人工智能领域五大常用技术,旨在为学习者构建系统、全面的技术知识框架。模块以计算机视觉、自然语言处理、知识图谱、智能语音、智能机器人五大技术为核心脉络,每个技术板块均遵循“理论铺垫—核心解析—应用落地—实践强化”的逻辑展开。从各常用技术的概述入手,明确其定义与核心价值,再深入剖析技术的层次、组成、任务、表示方法或分类等关键维度,进而拓展典型应用场景,展现技术的实际落地价值。同时,配套动手实践内容,实现理论与实操的深度结合。目录/Contents3.13.2知识图谱技术3.3计算机视觉技术自然语言处理技术目录/Contents3.43.5智能语音技术智能机器人技术计算机视觉技术3.13.1计算机视觉技术

计算机视觉是人工智能领域的核心研究方向之一,旨在让计算机具备类似人类视觉系统的感知、理解与分析能力。其本质是通过摄像头等图像采集设备获取图像或视频数据,借助算法对数据进行处理、特征提取与解读,最终实现对真实世界场景的精准认知。与人类视觉依靠大脑处理视觉信息类似,计算机视觉以图像处理、模式识别、机器学习等技术为支撑,突破了人类视觉在范围、精度、效率等方面的局限。作为连接计算机与物理世界的重要桥梁,计算机视觉广泛赋能各行业数字化转型,是实现智能制造、智能交通、智慧医疗等应用的关键技术基础,也是人工智能技术落地应用的核心支撑之一。3.1.1计算机视觉的4个层次计算机视觉作为人工智能模拟人类视觉感知能力的核心技术,其完整的处理流程可划分为四个紧密衔接的层次。这四个层次循序渐进、相互配合,构成了一套完整的视觉信息处理体系,共同支撑计算机实现类人“看”的功能,具体框架如图3-1所示。图3-1计算机视觉的四个层次1.图像数字化在人工智能领域,图像数字化是计算机视觉技术中计算机“看见”世界的基础前提,指借助以摄像设备为代表的图像传感器,将现实世界中静态或动态的各类景物所承载的光信号,转化为计算机可识别、处理的数字信号,并形成由像素点组成的数字图像的过程。其中,像素是图像数字化后的最小不可分割单位,每个像素都具备明确的位置坐标与专属色彩数值,其颜色和位置共同决定了最终呈现的图像样貌。例如分辨率为640×480的图像,便是由307200个像素点构成,如图3-2所示,图片中的“光”字用像素表示如图片右部分“光”字所示。这一过程相当于为计算机搭建了“视觉感知入口”,将物理世界的视觉信息转化为数字形式,为后续计算机对图像的进一步分析、处理与理解奠定核心基础。

3.1.1计算机视觉的4个层次3.1.1计算机视觉的4个层次图3-2像素2.图像处理图像处理是计算机视觉技术的核心环节,指对数字化后的图像进行分析、加工与优化,以满足后续处理需求或达成特定目标的技术。这一过程类似为照片“美颜修图”,通过一系列技术操作让图像更清晰、更适配后续分析,如同人们整理照片提升观感一般。(1)图像增强。针对质量欠佳的图像,通过去雾、提升对比度、无损放大、拉伸恢复等优化手段重建优质图像,如图3-3所示。

3.1.1计算机视觉的4个层次图3-3图像增强2.图像处理(2)图像复原。借助退化过程的先验知识,还原被损坏或退化图像的原始样貌。图像增强和复原都是以改善图像视觉效果、提升图像质量为核心目的,如图3-4所示,左半部分图为复原前图片,右半部分图为复原后的图片。(3)图像压缩。也称图像编码,通过有损或无损的方式,以较少比特表示原始像素矩阵,从而节省图像传输与处理时间,降低存储器占用容量。3.1.1计算机视觉的4个层次图3-4图像复原效果图3.图像分析图像分析是计算机视觉技术中衔接图像处理与图像理解的关键环节,是对人类“看图识物”能力的模拟。它特指在人工智能技术支持下,从预处理后的图像中提取轮廓、颜色、纹理等关键特征,将原本以像素矩阵描述的数字化图像,通过多步骤转化为简单、非图像的符号或数字描述,进而获取图像中目标相关语义信息的技术过程。图像分析为后续深层理解图像奠定基础。其典型应用场景广泛,例如图像特征提取可精准捕捉物体的边缘轮廓、纹理细节等关键信息;图像分类能判断图像中目标所属类别(如区分猫、桌子等);物体检测可定位图像中目标的位置并识别类别;图像描述则能生成契合图像内容的文字表述,全面支撑计算机对图像的深度解读。

3.1.1计算机视觉的4个层次4.计算机视觉应用相当于让计算机“根据图像信息做决策”,是计算机视觉技术实现落地价值的核心步骤。它依托前文图像分析所提取的关键特征与语义信息,驱动计算机完成特定的实际任务,让“看见”的视觉感知转化为切实可行的行动。就像人类看到红灯会主动停下、看到障碍物会及时避让一样,计算机可基于视觉分析结果,精准执行人脸识别打卡、自动驾驶汽车规避障碍物、智能监控识别异常行为等具体操作,真正让视觉技术产生实际应用价值,赋能各类场景的智能化升级。3.1.1计算机视觉的4个层次计算机视觉中有4大类任务,分别为分类、定位、检测和分割,如图3-5所示。

3.1.2计算机视觉的4大任务图3-5计算机视觉中4大类任务分类核心解决“是什么?”的问题。例如,面对一张动物图像,判断其是猫还是狗;或是识别一张风景照属于“森林”“海滩”还是“城市”类别。定位解决的是“在哪里?”的问题,即定位出特定目标的位置。无需判断目标类别,仅精准确定图像中特定目标的位置范围。例如,在包含水杯的图像中,用矩形框标出水杯所在的区域。检测解决“是什么?在哪里?”的问题,既需识别目标类别,又要定位其位置,是分类与定位的结合。例如,在商场监控画面中,框出每个行人的位置并标注“行人”类别;或是在水果篮图像中,分别圈出苹果、橙子并对应标注类别。分割解决“每一个像素属于哪个目标物或场景”的问题。如同精细涂色分区,逐像素划分目标边界,实现像素级精准区分。例如,在人像照片处理中,将人物轮廓内的所有像素与背景像素彻底分离;或是在交通场景图像中,分别划分出车辆、道路、行人的像素区域。

3.1.2计算机视觉的4大任务分类核心解决“是什么?”的问题。例如,面对一张动物图像,判断其是猫还是狗;或是识别一张风景照属于“森林”“海滩”还是“城市”类别。定位解决的是“在哪里?”的问题,即定位出特定目标的位置。无需判断目标类别,仅精准确定图像中特定目标的位置范围。例如,在包含水杯的图像中,用矩形框标出水杯所在的区域。检测解决“是什么?在哪里?”的问题,既需识别目标类别,又要定位其位置,是分类与定位的结合。例如,在商场监控画面中,框出每个行人的位置并标注“行人”类别;或是在水果篮图像中,分别圈出苹果、橙子并对应标注类别。分割解决“每一个像素属于哪个目标物或场景”的问题。如同精细涂色分区,逐像素划分目标边界,实现像素级精准区分。例如,在人像照片处理中,将人物轮廓内的所有像素与背景像素彻底分离;或是在交通场景图像中,分别划分出车辆、道路、行人的像素区域。

3.1.2计算机视觉的4大任务1.图像分类图像分类是计算机视觉领域的核心基础任务,核心是依据图像承载的语义信息,对不同类别图像进行精准区分,明确单张图像或图像中主要目标所属的类别。作为物体检测、图像分割、行为分析等高层视觉任务的技术基石,其应用贯穿计算机视觉诸多场景。单标签的图像分类问题可以分为跨物种语义级别图像分类,子类细粒度图像分类,

以及实例级图像分类3大类别。(1)跨物种语义级别图像分类,在不同物种的宏观层次上实现类别区分,聚焦差异显著的不同类对象识别。例如,在动物图像数据集中区分猫与狗、老虎与狮子,或是在日常场景中识别“汽车”与“自行车”这类不同物种或大类的对象。比较常见的包括猫狗分类等,如图3-6所示。3.1.3计算机视觉的常见任务图3-6猫狗分类(2)子类细粒度图像分类,针对同一大类下的细分品类进行识别,需捕捉同类对象的细微特征差异。例如,在“鸟类”大类中区分麻雀、鸽子、雄鹰等不同品种;在“花卉”大类中辨别玫瑰、牡丹、郁金香;或是在“犬类”中区分哈士奇、金毛、泰迪等不同犬种。如图3-7所示。3.1.3计算机视觉的常见任务图3-7花卉分类(3)实例级图像分类,核心是区分同一类别下的不同个体,而非仅识别物种类别或子类。最典型的应用是人脸识别,通过提取个体面部的独特特征,实现身份鉴定,进而支撑智能人脸考勤、小区人脸门禁过闸、手机人脸解锁等实际场景任务,如图3-8所示。3.1.3计算机视觉的常见任务图3-7花卉分类2.物体检测物体检测与图像分类的核心区别在于,它不仅要解决“是什么”的分类问题,还需攻克“在哪里”的定位问题,是计算机视觉中兼具识别与定位能力的基础核心任务。

给定一张图像(可包含单个或多个目标、复杂背景),物体检测技术需完成双重任务:一是识别图像中包含的各类物体类别(如猫、狗、行人、车辆等);二是精准定位每个物体在图像中的具体位置,并通过外接矩形框清晰标注其边界范围,直观呈现目标的空间分布,如图3-9所示。3.1.3计算机视觉的常见任务图3-9猫和狗物体检测3.图像分割图像分割是计算机视觉领域的核心研究方向,也是实现图像语义深度理解的关键环节,更是衔接图像处理与图像分析的重要桥梁。其核心是按照像素级精度,将图像划分为若干个具有独特视觉特性(如颜色、纹理、语义)的特定区域,通过对每个像素进行分类打标签,精准提取感兴趣的目标,明确目标与背景及目标间的边界,让计算机实现对图像内容的精细化解读。根据图像分割的粒度级别,一般可以将图像分割的类型划分为语义分割和实例分割。接下来进一步讲解语义分割和实例分割。3.1.3计算机视觉的常见任务(1).语义分割语义分割核心是区分像素的“类别属性”,对图像中每一个像素进行类别标记,同一类别的像素会被赋予相同标签,不区分同类别的不同个体。例如,在城市道路场景图像中,将所有车辆像素标记为红色、行人像素标记为绿色、道路像素标记为灰色、天空像素标记为蓝色;或是在农田图像中,把小麦区域像素、杂草区域像素、土壤区域像素分别用不同颜色标签区分,清晰呈现各类场景元素的分布范围。如图3-10图中1绿色区域部分像素表示树木,2红色区域部分像素表示车辆,3灰色区域部分像素表示道路等。从图3-10种可以看出,语义分割将图像中的每一个像素都进行了分割和标注。3.1.3计算机视觉的常见任务图3-10语义分割效果(2)实例分割实例分割可看作物体检测与语义分割的融合技术,既具备语义分割的像素级精度,又能像目标检测一样区分同类别的不同个体。它会先定位并分割出感兴趣的目标,再对同一类别下的不同实例进行单独编号或标记。例如,在交通路口图像中,不仅能精准分割出每一辆汽车的完整轮廓(而非简单的矩形框),还会为每一辆汽车分配唯一编号,区分“汽车1”“汽车2”等不同实例;或是在羊群图像中,单独分割出每一只羊的像素区域,实现个体级别的精准区分。如图3-11图所示,实例分割将图像中的每一个目标(汽车)进行分割和编号。3.1.3计算机视觉的常见任务图3-11实例分割效果(4).目标跟踪目标跟踪是计算机视觉领域的核心基础任务,融合了图像处理、机器学习、最优化等多领域理论与算法,既是高层级图像理解(如目标行为识别)的重要前提,也具备极高的理论研究价值与广泛的实际应用场景。其核心是利用视频或图像序列的上下文信息,对目标的外观特征与运动规律进行建模,持续预测目标的运动状态并精准标定其位置,实现对目标的动态追踪。广义上,目标跟踪可分为单目标跟踪和多目标跟踪两类,二者在适用场景与技术要求上有所区别,具体如下:单目标跟踪:不限制目标类别,无需提前知晓目标相关信息,可对任意类物体进行动态追踪。例如,在安防监控中锁定某一可疑人员,持续跟踪其在画面中的移动轨迹;或是在野生动物观测中,跟随单个羚羊的活动路线,记录其行为模式。多目标跟踪:通常限定在已知目标类别的场景中,需同时追踪多个目标并区分个体身份。例如,在城市道路监控中,同步跟踪画面中所有车辆的位置、速度与行驶方向,助力交通流量统计与违规行为抓拍;或是在商场监控场景中,实时追踪多个行人的移动路径,分析客流分布与行走规律。3.1.3计算机视觉的常见任务(5).其他任务计算机视觉的应用边界不断拓展,除分类、检测、分割、跟踪四大核心任务外,还涵盖诸多面向特定场景的细分任务,这些任务聚焦更具体的视觉信息处理需求,广泛赋能各类智能化场景,具体如下:

(1)场景文字识别(OCR):核心是从复杂场景图像中精准提取文字信息并转化为可编辑的文字序列,即便面对图像背景杂乱、分辨率低、字体风格多样、文字分布不规则等挑战,仍能实现高效识别。例如,发票识别可自动提取发票上的金额、开票日期、销售方信息等关键内容,助力财务自动化记账;身份证识别能快速读取姓名、身份证号、住址等信息,应用于酒店入住登记、政务服务自助办理;车牌识别可实时捕捉道路车辆号牌文字,支撑交通违章抓拍、停车场自动计费等场景。(2)图像生成:基于深度学习等技术,根据输入的指令、样本图像或特征信息,自主生成全新的图像内容,兼具创造性与实用性。例如,手写体生成可模拟特定人的书写风格生成文字图像,应用于个性化笔记生成、书法模仿练习;动漫头像生成能根据用户上传的照片或设定的风格参数,生成独一无二的动漫风格头像;图像修复可填补老照片的破损区域、去除图像中的水印或杂物,还原图像完整面貌;AI绘画则能依据文字描述生成极具想象力的艺术画作。3.1.3计算机视觉的常见任务(5).其他任务(3)人体姿态估计:通过分析图像或视频帧,精准定位人体关键关节点(如头部、肩膀、手肘、膝盖等),并构建人体骨骼模型,实时捕捉人体的姿态变化与动作趋势。例如,老人摔倒防护检测系统可通过姿态估计识别“摔倒”这一异常姿态,及时触发警报通知家属或工作人员;驾驶员行为检测能监测驾驶员是否存在疲劳驾驶(如低头、闭眼)、分心驾驶(如手持手机、转头交谈)等危险行为,保障行车安全;健身动作指导可对比用户与标准健身姿态的差异,实时纠正不规范动作,助力科学健身。(4)视频内容理解:依托视频的时序信息与多帧图像关联特征,深度解析视频中的场景、目标、动作及事件逻辑,核心回答“视频中何时出现何种内容、发生何种事件”的问题。例如,自动驾驶系统通过理解道路视频中的车辆行驶状态、行人移动轨迹、交通信号灯变化等信息,为行车决策提供依据;直播视频内容审核可实时识别违规画面(如暴力、低俗内容)并快速拦截,净化网络环境;体育赛事视频分析能自动统计球员跑动距离、射门次数、传球成功率等数据,辅助教练制定战术;安防视频异常检测可识别闯入禁区、遗留可疑物品等危险事件,及时发出预警。3.1.3计算机视觉的常见任务(5).其他任务(5)图像检索:根据用户提供的查询条件(如一张样本图像、文字描述),从海量图像数据库中快速筛选出内容相似或相关的图像。例如,购物平台的“以图搜物”功能,用户上传商品图片即可找到同款或相似商品;文物保护领域可通过图像检索对比不同时期的文物照片,辅助判断文物是否存在破损或修复痕迹;学术研究中,研究者可上传实验图像,检索相关领域的同类研究成果,提高文献调研效率。(6)3D重建:利用2D图像或视频序列,结合相机参数、几何原理等信息,构建目标或场景3D模型,还原其空间结构与立体形态。例如,建筑领域可通过拍摄建筑外立面图像,重建建筑3D模型,用于设计方案优化、工程量核算;文物数字化可对珍贵文物进行3D重建,实现虚拟展示与永久保存;AR/VR场景中,通过3D重建还原真实环境,提升虚拟交互的沉浸感,如AR导航中构建的实景3D道路模型。3.1.3计算机视觉的常见任务计算机视觉在实际生产生活中的应用案例非常多,以下简单介绍几个典型应用。1.智能AI体育评分在体育赛事与训练场景中,计算机视觉结合深度学习技术构建的AI评分与分析系统,成为兼具“AI教练”与“AI裁判”功能的核心工具。该系统通过高清摄像头捕捉运动员的动作姿态、肢体摆动幅度、滑行速度、轨迹路线等关键视觉信息,经算法精准分析后,实现量化评估与技术诊断。例如在2022年北京冬奥会中,该技术已成功应用于跳台滑雪、U型场地技巧、速度滑冰等多个项目。一方面,在训练中为运动员提供精准的动作反馈,帮助其快速发现技术短板,提升科学化训练水平;另一方面,在比赛中辅助人类裁判进行客观评分,减少主观误差,保障赛事公平性。此外,在日常体育训练中,如体操、跳水等项目的动作规范检测、跑步运动的姿态矫正等场景,该技术也能通过实时分析肢体关节运动轨迹,为教练和运动员提供数据支撑,助力运动水平提升。3.1.4计算机视觉的典型应用2.农产品品质智能分级农产品品质智能分级是计算机视觉赋能农业产业化的重要场景,主要应用于果蔬、禽蛋等农产品的产后加工环节。通过高速相机拍摄传送带上的农产品,系统利用图像分类、图像分割技术,精准提取农产品的大小、颜色、形状、表面缺陷(如斑点、破损)等视觉特征,再通过算法与预设标准对比,自动将农产品划分为特级、一级、二级等不同等级。例如,在柑橘加工车间,该系统可每秒处理数十个柑橘,快速区分果皮光滑无瑕疵的特级果、轻微斑点的一级果与破损果,替代传统人工分级的低效与主观误差,如图3-12所示。3.1.4计算机视觉的典型应用图3-12农产品品质智能分级3.自动驾驶计算机视觉在自动驾驶中扮演“眼睛”和“大脑”的双重角色。通过车载摄像头、激光雷达等传感器,系统实时采集道路图像数据,经预处理去除噪声后,利用目标检测算法识别行人、车辆、交通信号灯等关键对象,通过图像分割精确划分车道线与可行驶区域,结合深度学习模型预测目标运动轨迹,最终辅助决策系统实现车道保持、自动避障等功能。例如在遇到红灯时,摄像头捕捉信号灯图像,算法快速定位红色灯源并判断状态,触发刹车指令;面对突发横穿马路的行人,目标检测框实时锁定行人位置,分割算法测算安全距离,0.5秒内完成从“看见”到“停车”的闭环控制,大幅降低人为驾驶失误风险。如图3-13所示。3.1.4计算机视觉的典型应用图3-13计算机视觉在自动驾驶中的运用1.实践背景本案例通过调用百度智能云平台中的图像识别体验功能,实现动物的识别。2.实践准备(1)注册百度AI开放平台账号,并进行个人认证。(2)准备好识别的动物图片。3.实践步骤(1)进入百度开放平台AI体验中心,选择图像识别-动物识别,如图3-14和图3-15所示。动手实践4:动物识别图3-14进入百度开放平台AI体验中心图3-15选择图像识别-动物识别

1.实践背景本案例通过调用百度智能云平台中的图像识别体验功能,实现动物的识别。2.实践准备(1)注册百度AI开放平台账号,并进行个人认证。(2)准备好识别的动物图片。3.实践步骤(1)进入百度开放平台AI体验中心,选择图像识别-动物识别,如图3-14和图3-15所示。动手实践4:动物识别图3-14进入百度开放平台AI体验中心图3-15选择图像识别-动物识别

(2)本地上传要识别的动物图片,点击检测按钮,查看识别结果,如图3-16和图3-17所示。动手实践4:动物识别图3-16选择本地文件图3-17进行识别1.实践背景案例通过使用百度AI开放平台实现图像识。需在平台注册账号后进行操作。本案例通过调用百度智能云平台中的图像识别API功能,实现果蔬识别。2.实践准备(1)注册百度AI开放平台账号,并进行个人认证。(2)准备好识别的果蔬图片。命名为test_fruit.jpg,放在与后面步骤中建立的Pyhton文件在同一个目录下。(3)安装Python3.8以上版本和Pycharm,在命令行或在Pycharm控制台中输入以下命令安装依赖:pipinstallrequestsbase64动手实践5:果蔬识别(1)登录平台后,进入控制台,点击“产品导览”,选择图像识别,如图3-18所示。(2)点击“应用列表”,进入应用列表页,如图3-19所示。动手实践5:果蔬识别图3-18选择图像识别图3-19应用列表(3)新建一个应用,应用名称为“果蔬识别”,如图3-20所示。(4)创建应用后,在应用列表中可以看到APIKey和SecretKey,这2个信息在调用API服务时会用到,如图3-21所示。动手实践5:果蔬识别图3-20新建应用名称为“果蔬识别”图3-21应用APIKey和SecretKey(5)打开Pycharm,新建一个工程,在工程中新建一个Python文件,命名为fruit.python,程序编写步骤与说明如下:1)前期配置:导入requests、base64依赖库,配置并定义百度AI的API_KEY、SECRET_KEY鉴权密钥,需替换为用户自身密钥。2)鉴权获取令牌:定义get_access_token函数,指定鉴权接口地址并构建含授权信息的请求参数,发送GET请求后解析JSON结果提取access_token,增加网络、令牌获取失败的异常处理,成功返回令牌,失败打印信息并返回None。3)果蔬识别核心:定义识别函数,接收图片路径和令牌,先读取图片做Base64编码并处理文件读取异常;再配置识别接口和请求参数,发送POST请求解析结果,校验错误码、提取识别列表,遍历输出果蔬名称和置信度,增加接口请求异常处理。4)主程序执行:定义程序入口,指定待识别图片路径,调用鉴权函数获令牌,失败则退出,成功则传入路径和令牌调用识别函数执行识别。

动手实践5:果蔬识别(6)运行查看识别结果。如图3-22所示。动手实践5:果蔬识别图3-22果蔬识别结果1.实践背景案例通过使用百度AI开放平台实现图像识。需在平台注册账号后进行操作。本案例通过调用百度智能云平台中的文字识别API功能,实现身份证图像识别。2.实践准备(1)注册百度AI开放平台账号,并进行个人认证。(2)准备身份证正面相片。命名为shenfen.jpg,图片文件要放在与后面步骤中建立的Pyhton文件在同一个目录下。(3)在命令行或在Pycharm控制台中输入以下命令安装所用到的依赖库:pipinstallrequestsbase64动手实践6:身份证识别3.实践步骤(1)登录平台后,进入控制台,点击“产品导览”,选择文字识别,如图3-23所示。(2)点击“应用列表”,进入应用列表页。新建一个应用,应用名称为“文字识别”,如图3-24所示。动手实践6:身份证识别图3-23选择文字识别图3-24新建应用(3)创建应用后,可以看到APIKey和SecretKey,这2个信息在调用API服务时会用到,如图3-25所示。(4)打开Pycharm,新建一个工程,在工程中新建一个Python文件,命名为OCR.python,程序框架如下:

1)环境与密钥配置:导入requests、base64库,定义百度AI的API_KEY和SECRET_KEY密钥。2)鉴权获取令牌:定义get_access_token函数,向百度鉴权接口发送GET请求,传入授权参数,解析返回结果提取access_token,做异常处理。3)身份证识别核心:定义id_card_ocr函数,先读取本地图片并做base64编码,再配置身份证OCR接口参数,发送POST请求,解析返回结果,提取并打印姓名、身份证号等身份证字段,处理各类异常。4)主程序执行:指定身份证图片路径,调用鉴权函数获取令牌,令牌获取失败则退出,成功则调用识别函数完成识别。(5)点击运行程序,查看运行结果。如图3-26所示。动手实践6:身份证识别动手实践6:身份证识别图3-25APIKey和SecretKey图3-26身份证相片识别结果自然语言处理技术3.23.2自然语言处理技术

自然语言处理(NaturalLanguageProces

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论