版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第1章人工智能概述1.1什么是人工智能1.1.1认识人工智能人工智能是研究使计算机来模拟人的某些思维过程和智能行为(如学习、推理、思考、规划等)的学科,主要包括计算机实现智能的原理、制造类似于人脑智能的计算机,使计算机能实现更高层次的应用。在1950年,被称为“计算机之父”的阿兰·图灵提出了一个举世瞩目的想法——图灵测试。按照图灵的设想:如果一台机器能够与人类开展对话而不能被辨别出机器身份,那么这台机器就具有智能。而就在这一年,图灵还大胆预言了真正具备智能机器的可行性。图灵测试人工智能概念的提出后,发展出了符号主义、联结主义(神经网络),相继取得了一批令人瞩目的研究成果,如机器定理证明、跳棋程序、人机对话等,掀起人工智能发展的第一个高潮。人工智能是引领新一轮科技革命和产业变革的战略性技术,具有溢出带动性很强的“头雁”效应,是培育和发展新质生产力的重要引擎。
人工智能的浪潮已至,未来已来。人工智能技术创新扩散速度之快超乎想象,其对社会就业结构、生产方式和经济格局产生的影响远超预期。持续深入推进“人工智能+”行动,深耕应用场景,赋能千行百业,驱动经济社会智能蝶变,是时代赋予我们的重大机遇,也是加快塑造我国发展新优势新动能的必由之路。人工智能研究的主要学派1)符号主义符号主义(Symbolism)是一种基于逻辑推理的智能模拟方法,又称为逻辑主义(Logicism)、心理学派(Psychlogism)或计算机学派(Computerism),其原理主要为物理符号系统假设和有限合理性原理,长期以来,符号主义一直在人工智能中处于主导地位。2)连接主义连接主义(Connectionism)又称为仿生学派(ionicsism)或生理学派(Physiologism)。是一种基于神经网络及网络间的连接机制与学习算法的智能模拟方法。其原理主要为神经网络和神经网络间的连接机制和学习算法。3)行为主义行为主义又称进化主义(Evolutionism)或控制论学派(Cyberneticsism),是一种基于“感知——行动”的行为智能模拟方法。行为主义最早来源于20世纪初的一个心理学流派,认为行为是有机体用以适应环境变化的各种身体反应的组合,它的理论目标在于预见和控制行为。1.2人工智能的核心因素1.2.1算法算法是一组解决问题的规则,是计算机科学中的基础概念。人工智能算法是一种特殊的算法,它可以用来解决复杂的问题。以智能推荐算法为例,该算法的本质是从一个聚合内容池里面给当前用户匹配出最感兴趣的内容,而在这个内容池里,每天有几十上百万的内容,主要依据3种要素:内容、用户以及用户对内容的感兴趣程度。1.2.2算力算力是指计算机或其他计算设备在一定时间内可以处理的数据量或完成的计算任务的数量。算力通常被用来描述计算机或其他计算设备的性能,它是衡量一台计算设备处理能力的重要指标。在人工智能技术当中,算力是算法和数据的基础设施,它支撑着算法和数据,进而影响人工智能的发展。算力的大小代表了数据处理能力的强弱。1.2.3数据人工智能系统的核心是训练的框架加上数据。在实际的工程应用中我们发现,人工智能系统落地效果的好坏只有20%取决于算法,80%取决于数据的质量。可以说数据是人工智能的“原油”。值得注意的是:以数据为中心的人工智能是在近年来所提出的一个新名词。过去传统的人工智能是以模型为中心的,在这样的过程中大家更关注如何设计并训练更好的模型。但随着开源框架不断落地之后,大家开始关注数据能够带来的提升。1.3人工智能的发展趋势智能家居:人工智能在智能家居领域的应用场景正在不断扩展,如语音控制、智能音响、智能灯具等。未来,智能家居可能会向多模态智能技术的方向发展,结合多种感知模态,如语音、图像、视频、传感器等,以提供更加智能和个性化的服务。自动驾驶:自动驾驶汽车已经成为人工智能的一个重要应用场景,其发展趋势可能会包括更高级别的自动驾驶、车路协同、以及更加智能的交通系统。可穿戴设备:可穿戴设备如智能手表、智能眼镜等已经成为人们日常生活的一部分。未来,可穿戴设备可能会与医疗健康、健身、娱乐等领域更加深入地结合,提供更加个性化的服务。聊天机器人:聊天机器人也称为虚拟助手,它们可以理解用户所说的话,并回答问题。未来,聊天机器人可能会变得更加智能,能够理解更复杂的语言和情境,同时也会向更加多样化的方向发展,如虚拟导游、虚拟销售等。人工智能辅助医疗:人工智能在医疗领域的应用包括疾病诊断、预测、治疗等方面。未来,人工智能可能会在医疗健康领域发挥更大的作用,如药物研发、个性化治疗等。人工智能辅助决策:人工智能可以辅助企业和政府做出更好的决策。未来,这种应用场景可能会变得更加普遍,如市场预测、投资决策等。游戏娱乐:电子游戏是人工智能的一个重要应用场景。未来,随着游戏技术的不断进步,游戏可能会变得更加智能化和真实,同时也会向更加多样化的方向发展,如虚拟现实游戏、社交游戏等。语音识别:语音识别技术已经广泛应用于各种领域,如智能音箱、语音助手等。未来,随着技术的不断进步,语音识别可能会变得更加准确和智能,同时也会向更加多样化的语种和场景扩展。推荐系统:推荐系统已经广泛应用于各种互联网服务中,如电影、音乐、购物网站等。未来,推荐系统可能会变得更加智能化和个性化,能够更好地满足用户的需求。机器学习:机器学习是人工智能的核心技术之一,其应用范围非常广泛。未来,随着算法和硬件的不断进步,机器学习的应用场景可能会进一步扩展,如自然语言处理、图像处理等。1.4人工智能常用语言人工智能开发中常用的语言多种多样,每种语言都有其独特的优势和适用场景。目前来看Python以简洁易读的语法使其成为初学者的理想选择。Python的语句很特别,它没有像其他很多语言那样把要执行的语句用成对的{}花括号包起来,而是把语句向右边缩进了,这就是Python的风格,它是靠缩进语句来表示要执行的语句的。
需要注意的是:选择哪种语言取决于具体的项目需求和个人偏好。例如,如果你正在从事数据科学研究或想要快速构建原型,那么Python可能是最好的选择;若你的工作涉及到高度优化的算法实现,则可能需要考虑使用C++。谢谢
第2章专家系统2.1认识专家系统2.1.1专家系统概述专家系统是一种计算机程序(系统),旨在模拟人类专家在某一特定领域的知识和推理过程。它可以用来解决那些通常需要人类专家才能解决的问题,如医疗诊断、农业生产、金融分析等。20世纪60年代初,研究者们尝试通过逻辑学和符号操作来模拟人类的心理活动,并开发了能够进行定理证明和逻辑推理的通用求解程序。通用求解程序不仅可以证明定理,还可以进行逻辑推理。如基于逻辑的推理过程如下:IF所有哺乳动物都有脊椎AND狗是哺乳动物THEN狗有脊椎为了有效解决问题,系统不仅需要具备强大的推理能力,还需要拥有丰富的专业知识。这种认识促进了“知识工程”这一新领域的形成。知识工程专注于如何有效地获取、表示和利用某一领域的专业知识来构建智能系统。这也标志着AI研究从“通用推理”向“知识驱动”的转变。
知识工程与专家系统知识工程是指通过系统化的方法,从人类专家那里获取专业知识,并将其形式化、结构化,最终编码到计算机系统中,以支持智能决策和问题求解的过程。专家系统是一个或一组能够在某些特定领域,应用大量的专家知识和推理方法解决复杂实际问题的计算机系统。
作为人工智能的一个重要分支,专家系统按其发展过程大致经历了多个阶段专家系统的发展并非线性“初创→成熟→发展”,而是经历了爆发→瓶颈→融合的螺旋式演进。当前其核心思想已深度嵌入新一代AI系统,而非独立存在。
一个合格的专家系统需具备三大要素:
(1)领域专家级知识:包含专业领域的事实、规则与启发式经验。专家系统的“智能”来源于其知识库,而知识库的质量直接决定了系统的性能。
(2)模拟专家思维:通过推理机制再现人类专家的逻辑判断过程。一个成熟的专家系统通常支持多种推理方式,以应对不同类型的复杂问题。
(3)达到专家级水准:决策质量需与真实专家相当。专家系统的最终目标是在特定领域内,替代或辅助人类专家进行高效、准确、可靠的决策。因此,它的决策质量必须达到或接近真实专家水平。
值得注意的是:随着AI技术的发展,专家系统的评估标准也在不断演进,现代系统更注重以下几点:用户体验(UserExperience):是否易于操作、是否支持自然语言交互。可扩展性(Scalability):能否适应更大规模的知识库和更复杂的推理。自学习能力(Self-learningAbility):是否能通过数据自动更新知识。安全性与隐私保护:是否符合数据保护法规(如GDPR)。
5.1.3智能优化方法智能优化方法概述这类新颖的优化算法往往借鉴了人类解决复杂问题的技巧以及生物体的本能,通过模拟或揭示某些自然现象或过程而得到发展,能够将复杂的求解过程简单化,从而表现出智能的特征,因此被称为智能优化方法。这类算法均从任意一个初始解出发,按照某种机制,以一定的概率在整个求解空间中搜索最优解,由于它们可以把搜索空间扩展到整个问题空间,因而具有全局优化性能。因此,智能优化方法以其具有全局的、并行高效的、通用性强、无需问题特殊信息等优点,为解决复杂问题提供了新的思路和手段专家系统的基本结构包括6部分,即知识库,知识获取机构,推理机,综合数据库/工作记忆,人机接口,解释机构知识库主要用于存储领域内专家提供的专业知识,包括事实,可操作与规则等。建立知识库时,需要解决两个重要问题,即知识表示方法的选择和知识获取。现代系统在知识库维护上采用的方法,常常是采用专家系统与机器学习等技术的融合。
知识获取机构是专家系统中用于协助知识工程师从领域专家或其它知识源中提取、整理、结构化并最终编码为计算机可识别形式的知识的一组工具和机制。它不仅是一个技术组件,也代表了一套支持知识获取过程的系统性方法和工具集合。
推理机是专家系统中实现基于知识推理的部件,也是基于知识的推理在计算机中的具体实现机制。它模拟人类专家的思维过程,通过规则匹配、冲突消解、规则执行等步骤,从已知事实出发,逐步推导出新的结论,最终解决当前问题。
推理机通常支持两种主要的推理方式:正向推理与反向推理。正向推理从已知事实出发,逐步应用规则,推导出新结论;反向推理从目标出发,寻找支持目标的前提条件。正向推理如下所示。已知:患者发烧、白细胞升高规则:IF发烧AND白细胞升高THEN感染推理结果:患者可能感染反向推理如下所示。目标:是否是链球菌感染?规则:IF细菌为革兰氏阳性AND染色形态为球菌THEN是链球菌推理过程:需要确认细菌是否为革兰氏阳性、是否为球菌
综合数据库(也称为工作内存或全局数据库)是专家系统中用于存储当前问题求解过程中所有相关信息的动态数据库。主要用于存放初始事实,问题描述和系统运行过程中得到的中间结果和最终结果等信息,是推理机工作必不可少的部分,同时它还记录了推理过程中的有关信息,为解释机构回答用户咨询提供依据。
人机接口是专家系统中用于实现人与系统之间信息交互的界面,它由软件程序和硬件设备组成,主要负责将用户的外部输入转换为系统可理解的内部表示形式,并将系统的内部输出转化为用户可理解的外部表现形式。MYCIN系统是一个用于感染性疾病诊断的专家系统,其人机接口具有以下主要特点。输入方式:医生通过问答形式输入患者信息(如症状、实验室结果);输出方式:系统输出诊断结果、病原体判断、推荐药物;解释功能:医生可询问“为什么推荐这种药物?”系统通过解释机构给出基于规则的依据;界面形式:早期为命令行界面,后期发展为图形界面;用户角色:支持医生(用户)、医学专家(知识验证者)、知识工程师(维护者)。MYCIN系统中的人机接口交互示例如下。系统:请问患者的体温是多少?医生:38.5℃系统:白细胞计数是多少?医生:15,000/mm³系统:根据现有信息,可能为链球菌感染,建议使用青霉素。
解释机构是专家系统中用于向用户解释系统推理过程和结论依据的组件,是专家系统中提升透明性、可理解性与用户信任度的重要组成部分。它通过追踪推理路径、提取相关规则、生成自然语言描述,使用户能够理解“为什么系统会得出这样的结论”。
MYCIN系统是由美国斯坦福大学研制的医学专家系统,它的功能是帮助内科医生诊断血液感染患者所感染的细菌种类并给出治疗方案。
模块功能知识库存储约600条医学规则,描述症状、病原体、药物之间的关系综合数据库存储用户输入的患者信息、中间推理结果和最终结论知识获取模块用于从医学专家处提取知识并结构化为规则咨询模块使用正向推理机制匹配规则,得出诊断结论和治疗建议解释模块向用户解释推理过程和结论依据(如Why、How)2.2专家系统的行业应用2.2.1医学专家系统医学专家系统是人工智能在医学领域最早、最成功的应用之一,也是专家系统研究与实践的重要分支。医学专家系统的常见功能功能描述症状输入用户输入症状(如发烧、咳嗽等)疾病匹配系统根据症状匹配可能的疾病治疗建议系统输出初步治疗建议解释机制解释“为什么得出这个结论”可扩展性支持新增疾病和症状规则医学专家系统的核心是定义知识库,规则如下。rules=[{"premises":["发烧","咳嗽"],"conclusion":"流感","cf":0.7},{"premises":["胸痛","呼吸急促"],"conclusion":"心脏病","cf":0.8},{"premises":["腹痛","恶心","呕吐"],"conclusion":"胃炎","cf":0.75}]
当用户输入:发烧咳嗽时,系统可得出以下结论:可能的疾病及可信度:-流感(CF=0.7)
解释:因为症状发烧咳嗽符合该疾病的诊断标准。2.2.2农业专家系统农业专家系统(AgriculturalExpertSystem)是指基于人工智能技术,特别是专家系统技术,模拟农业专家的知识与推理能力,在特定农业领域(如作物种植、病虫害防治、土壤管理、灌溉施肥等)中为用户提供智能决策支持的计算机系统。目前农业专家系统常用于智慧农业中。智慧农业是人类通过综合应用包括计算机和移动终端、云计算、互联网、物联网、大数据等现代信息通信技术,使农业大系统的数据能够自动、精准、高效地被感知、提取并加工为信息,借助于机器学习等人工智能技术快速形成决策,实施控制,从而实现优质高效、节能环保、生态安全的现代化农业生产目标。5.2.3金融专家系统金融专家系统是人工智能的一个重要分支,具体来说,它属于专家系统在金融领域的应用。其核心目标是模拟人类金融专家(如投资顾问、信贷分析师、风险管理师、交易员等)的决策过程和专业知识,为复杂的金融问题提供智能化的分析、判断和建议。尽管近年来机器学习和深度学习在金融领域应用日益广泛,但专家系统因其规则清晰、可解释性强、易于嵌入业务流程等特点,在许多场景中仍然扮演着重要角色,或与现代AI技术结合使用。1)信贷审批与风险管理银行和金融机构广泛使用专家系统(或融合专家规则的系统)来自动化处理贷款申请。例如,系统根据预设规则评估申请人的信用风险。例如:“如果(IF)申请人FICO信用评分低于600
且
负债收入比(DTI)高于40%,那么(THEN)拒绝贷款申请或要求更高利率。”银行使用专家系统可以快速处理大量申请,确保审批标准的一致性,降低人为偏见和操作风险。2)投资顾问与资产配置银行和金融机构中广泛使用的智能投顾平台的核心逻辑就包含了专家系统的规则。例如,根据用户的风险偏好问卷(如保守、稳健、激进)、投资目标、年龄、收入等信息,系统应用预设的投资组合配置规则(如“激进型投资者:70%股票,20%债券,10%另类投资”),并结合市场数据进行初步资产配置建议。此外,系统也可以根据市场条件变化(如股债性价比)触发再平衡建议。金融专家系统能够为银行和金融机构提供低成本、标准化的理财建议,覆盖长尾客户。谢谢
第3章机器学习3.1机器学习概述3.1.1认识机器学习机器学习作为一门多领域交叉学科,该领域的主要研究对象是人工智能,专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构,使之不断改善自身的性能。机器学习,通俗地讲就是让机器来实现学习的过程,让机器拥有学习的能力,从而改善系统自身的性能。在机器学习中,首先要输入大量数据,并根据需要来训练模型,再对训练后的模型进行应用,以判断其算法的准确性。
1)数据集数据集是模型训练的基础,其质量和规模直接影响模型的性能。2)模型训练模型训练是利用数据集来调整模型参数,使其能够学习数据中的模式和规律的过程。用户需要根据任务需求选择合适的模型,如线性回归、决策树、支持向量机、神经网络(CNN、RNN、Transformer等)。机器学习的主要学习范式
1)监督学习
监督学习是机器学习中的一种方法,可以由训练数据中学到或建立一个学习模型(LearningModel),并依此模型推测新的实例。训练数据是由输入物件(通常是向量)和预期输出所组成的。函数的输出可以是一个连续的值,该连续的值被称为回归分析,或者是预测的一个分类标签,该分类标签被称作分类。
图3-2所示为监督学习的数据集。例如,当要训练机器识别“狗”的图片时,需要先用大量狗的图片进行训练,再将预测结果与期望结果进行比对,从而判断该模型的好坏。2)无监督学习
无监督学习的训练样本的标记信息是未知的,目标是通过对无标记训练样本的学习来揭示数据的内在性质及规律。无监督学习表示机器从无标记的数据中探索并推断出潜在的联系。常见的无监督学习有聚类(Clustering)和降维(DimensionalityReduction)两种。
无监督学习常常被用于数据挖掘,用于在大量无标签数据中寻找信息。它的训练数据是无标签的,训练目标是能对观察值进行分类或者区分等。3)半监督学习
半监督学习突破了传统方法只考虑一种样本类型的局限,综合利用有标签与无标签样本,是在监督学习和无监督学习的基础上进行的研究。
半监督学习包括半监督聚类、半监督分类、半监督降维和半监督回归4种学习场景。常见的半监督分类代表算法包括生成式方法、半监督支持向量机、半监督图算法和基于分歧的半监督方法这4种算法。
4)强化学习
强化学习(ReinforcementLearning,RL)又称再励学习、评价学习或增强学习,是机器学习的范式和方法论之一,用于描述和解决智能体在与环境的交互过程中,通过学习策略以达成回报最大化或实现特定目标的问题。
强化学习通常使用马尔可夫决策过程(MarkovDecisionProcess,MDP)来建模。马尔可夫决策过程以数学的形式来描述智能体在与环境交互的过程中学到一个目标的过程,是马尔可夫奖励过程(MRP)的扩展,它引入了“动作”这一外界的影响因素,使得智能体能够主动选择行为,从而影响状态转移和奖励,如图3-3所示5)迁移学习
迁移学习是运用已存有的知识对不同但相关领域的问题进行求解的一种新的机器学习方法,迁移学习的核心思想是利用已有的模型或知识,减少在目标任务中对大规模标注数据的依赖,提高学习效率和模型性能。6)联邦学习
联邦学习(FederatedLearning,FL)是一种新兴的分布式机器学习(将机器学习任务分解为多个子任务,并在多个计算节点上并行执行,以提高训练效率、加速模型收敛并支持更大规模的数据处理)方法,旨在解决数据隐私保护和数据孤岛问题。
3.1.2机器学习的发展机器学习综合应用了心理学、生物学和神经生理学以及数学、自动化和计算机科学,并形成了机器学习理论基础,同时结合各种学习方法取长补短,形成了集成学习系统。此外,机器学习与人工智能各种基础问题的统一观点正在形成,各种学习方法的应用范围不断扩大,并出现了商业化的机器学习产品,还积极开展了大量与机器学习有关的学术活动。随着技术的进步和社会需求的增长,机器学习正逐渐成为推动各行各业创新发展的关键技术之一。未来,我们可以期待看到更多基于机器学习的创新产品和服务出现,为人们的生活带来更多便利和可能性。3.2机器学习算法3.2.1分类算法分类是一种重要的数据挖掘技术。分类的目的是根据数据集的特点构造一个分类函数或分类模型(也常常称作分类器),该模型能把未知类别的样本映射到给定类别中的某一个。
分类算法的目标变量是分类离散型的(例如,是否逾期、是否垃圾邮件等)。一般而言,具体的分类算法包括:决策树、贝叶斯判别、支持向量机、神经网络、模糊分类等。
分类算法的常见应用如下:(1)判断电子邮件是否为垃圾邮件。(2)判断在线交易是否存在潜在风险。(3)判断肿瘤为良性还是恶性。(4)判断房价的涨跌。3.2.1分类算法决策树算法决策树算法是应用最广的归纳推理算法之一。它是一种逼近离散值函数的方法,对噪声数据有很好的鲁棒性且能够学习析取表达式,决策树学习方法会搜索一个完整表示的假设空间,从而避免受限于假设空间的不足。3.2.1分类算法支持向量机算法
支持向量机(SVM,SupportVectorMachine)是一种支持线性分类和非线性分类的二元分类算法。支持向量机可以简单地描述为对样本数据进行分类,真正是对决策函数进行求解。首先,要找到分类问题中的最大分类间隔,然后确定最优分类超平面,并将分类问题转化为二次规划问题进行求解。图3-5显示了需要进行划分的两类数据,图3-6使用SVM划分了超平面从而完美的将这两类数据分开。3.2.1分类算法KNN算法KNN算法也叫作K最近邻算法,是数据挖掘分类技术中最简单的方法之一。所谓K最近邻,就是k个最近的邻居的意思,说的是每个样本都可以用它最接近的k个邻居来代表。图3-7显示了KNN算法的实现。图中绿色的点就是要预测的那个点,假设K=3,那么KNN算法就会找到与它距离最近的三个点(这里用圆圈把它圈起来了),看看哪种类别多一些,比如这个图是红色三角形多一些,因此新来的绿色点就归类到红色三角一类中去了。3.2.1分类算法朴素贝叶斯算法朴素贝叶斯是最常用的一种贝叶斯算法,它是基于贝叶斯公式建立的,朴素贝叶斯计算公式如下所示:朴素贝叶斯公式的“朴素”二字是基于一种假定“所有的特征都是独立的”,只有满足了这个假定才能使用朴素贝叶斯算法。朴素贝叶斯模型原理可以概率为:当一个样本有可能属于多个类别的时候,人们简单地选择其中概率最大的那个。朴素贝叶斯算法在文本分类中的应用尤为广泛,包括垃圾邮件过滤、新闻分类等。3.2.1分类算法逻辑回归算法逻辑回归是一种典型的非线性回归,逻辑回归的目标是发现特征与特定结果的可能性之间的联系,它主要用于预测某个事件发生的概率。逻辑回归的过程如下:面对一个回归或者分类问题,建立代价函数,然后通过优化方法迭代求解出最优的模型参数,最后测试验证这个求解模型的好坏。图3-9显示了逻辑回归的示意图。可以看到Sigmoid函数是一个s形的曲线,它的取值在[0,1]区间,在远离0的地方,函数的值会很快接近0或者1,它的这个特性对于解决二分类问题十分重要。3.2.1分类算法随机森林算法
虽然决策树是常见的分类算法,但它们容易出现偏差和过度拟合等问题。然而,当多棵决策树在随机森林算法中形成一个整体时,它们会预测更准确的结果,尤其是当各个树彼此不相关时。而随机森林(RandomForest,RF)采用集成学习的思想,通过构建多个弱分类器(即决策树),并综合它们的结果来提升整体性能。图3-10显示了随机森林,图中Finalresult表示随机森林将多个决策树的输出组合起来以得出一个结果。3.2.2回归算法回归算法是处理多变量间相关关系的一种数学方法。相关关系不同于函数关系,后者反映了变量间的严格依存性,而前者则表现出一定程度的波动性或随机性,对自变量的每一个取值,因变量可以有多个数值与之相对应。3.2.2回归算法线性回归线性回归就是将输入项分别乘以一些常量,再将结果相加得到输出。线性回归包括一元线性回归和多元线性回归。线性回归分析中如果仅有一个自变量与一个因变量,且其关系大致上可用一条直线表示,则称之为简单线性回归分析。多元线性回归分析是简单线性回归分析的推广,指的是多个因变量对多个自变量的回归分析,其中最常用的是只限于一个因变量但有多个自变量的情况,也称多重回归分析。3.2.3聚类算法聚类算法的目标是将数据集合分成若干簇,使得同一簇内的数据点相似度尽可能大,而不同簇间的数据点相似度尽可能小。聚类能在未知模式识别问题中,从一堆没有标签的数据中找到其中的关联关系。聚类在数据分析中扮演着重要角色,有助于深入了解问题域的内在结构和模式。这种分析有时被称为模式发现或知识发现,可以帮助我们洞察数据中隐藏的模式和关联。
图3-12显示了聚类算法的应用,图中的数据被划分为了3类(3个簇)。K-Means算法K-Means算法也叫作K均值聚类算法,它是最著名的基于划分的聚类算法,其简洁和效率高的特点使得它成为所有聚类算法中最为广泛使用的算法。其步骤是随机选取K个对象作为初始的聚类中心,并计算每个对象与各个种子聚类中心之间的距离,把每个对象分配给距离它最近的聚类中心。谱聚类算法谱聚类是一种基于图论的聚类方法,其将带权无向图划分为两个或两个以上最优子图,子图内部相似且间距离较远以实现聚类,其本质是将聚类问题转化为图的最优划分问题,是一种点对聚类算法。图3-13显示了谱聚类。谱聚类试图通过优化图的划分来实现聚类目的,使得不同簇(子图)间的连接尽可能少(边权重和尽可能低,图中以虚线表示),而簇内部的数据点之间连接尽可能多(边权重和尽可能高,图中以实线表示)。这种方法尤其适合处理非凸形状的数据分布。DBSCAN(密度聚类)算法
密度聚类算法是一种基于密度概念的聚类方法,它将具有足够高密度的区域划分为簇,并能在噪声中发现任意形状的簇。与基于距离的聚类算法不同,密度聚类算法不依赖于距离度量,而是通过寻找数据空间中的高密度区域来实现聚类。
密度聚类算法的一个典型代表是DBSCAN(DensityBasedSpatialClusteringofApplicationswithNoise),它通过两个参数:邻域半径(eps)和最小点数(MinPts)来定义一个点的邻域内至少需要有多少个点才能构成一个高密度区域。DBSCAN能够识别并处理噪声点,即那些不属于任何簇的点。3.3机器学习的案例3.3.1工业领域
流程工业大数据建模
流程工业也称过程工业,是指基于通过物理变化/
或化学变化进行生产的行业。典型的流程工业包括石油、化工、冶金、造纸、医药、食品等行业。常见的流程工业系统模型为具有高度非线性的代数、微分方程混合组成的数学模型,并且在模型中包含大量的过程参数和高维状态变量,且高度交联、耦合。因此现代流程工业具有操作可调、工艺灵活、产品多样、控制系统化等诸多特点。3.3.1工业领域工业互联网设备故障诊断预测性维护
随着现代自动化技术水平的不断提高,工业设备制造和工程系统的复杂性大大增加,系统的可靠性与安全性变得尤为重要。
在剩余寿命预测中,选择合适的机器学习算法至关重要。这些算法需要能够处理时序数据、捕捉设备退化的模式,并准确预测设备的剩余使用寿命。如常见的支持向量回归算法(SupportVectorRegression,SVR),SVR是支持向量机(SVM)的一种变体,用于解决回归问题。它试图找到一个超平面,使得训练样本到该超平面的距离尽可能小。
图3-15显示了数控车床寿命预测模型,该模型设备部件为主轴,设备名称为数控车床,通过建立模型来预测其寿命,并通过可视化图表来显示。3.3.2农业领域
作物健康监测与病虫害预测
在传统农业中,作物健康监测和病虫害检测主要依赖于人工巡查或经验判断,这种方法不仅耗时费力,而且难以及时发现潜在问题,导致病虫害扩散,造成经济损失。随着技术的发展,特别是遥感技术和机器学习的应用,使得自动化的作物健康监测成为可能。一个基本的作物健康分类模型运行结果如下。Accuracy:0.85ClassificationReport:precisionrecallf1-scoresupport
00.820.880.8514510.880.830.85155
avg/total0.850.850.85300
该模型使用逻辑回归来处理一个二分类问题。在实际应用中,用户可以将x和y替换为真实的作物健康监测数据,比如通过无人机拍摄的多光谱图像数据或其他传感器收集的数据。Accuracy:0.85表示模型在测试数据上的分类准确率为85%。3.3.2农业领域
精准农业与变量施肥
精准农业是指利用现代信息技术对农田进行精细管理,以达到提高产量、减少浪费和保护环境的目的。它依赖于大量的数据收集和分析,包括土壤类型、气象条件、作物生长状况等信息。变量施肥是一种根据田间不同区域的具体情况调整施肥量的技术。传统的统一施肥方式往往忽略了田间的变异性,导致某些区域过量施肥或不足施肥,影响作物健康并造成环境污染。变量施肥则可以根据每个区域的实际需求施加适量的肥料,从而提高肥料利用率,降低成本,并减少环境污染。
机器学习在精准农业与变量施肥中的应用不仅能够提高资源利用效率,还能显著提升作物产量和质量。通过合理选择和应用机器学习算法,可以实现更加科学和智能化的农业管理。谢谢
第4章深度学习4.1深度学习概述4.1.1认识深度学习深度学习通过学习算例数据的内在规律和表示,使计算机能够像人一样有分析能力,为人工智能质的飞跃打开突破口。深度学习架构由多层非线性运算单元组成,每个较低层的输出作为更高层的输入,可以从大量输入数据中学习有效的特征表示,学习到的高阶表示中包含输入数据的许多结构信息,能够用于分类、回归和信息检索等数据分析和挖掘的特定问题中。图4-1显示了神经网络,神经网络主要由相互连接的神经元(图中的圆圈)组成。在生物中神经元是一种特殊的细胞,有很多的树突结构,通常还有一根很长的轴突,轴突边缘有突触。神经元的突触会和其它神经元的树突连接在一起,从而形成庞大的生物神经网络。神经网络是一种由大量的节点(或称神经元)相互连接构成的运算模型。人工神经网络是为获得某个特定问题的解,根据生物神经网络机理,按照控制工程的思路及数学描述方法,建立相应的数学模型并采用适当的算法,而有针对性地确定数学模型参数的技术。如图4-2所示是一个最简单的单个神经元的网络模型,它只包含一个神经元。一个多层神经网络结构如图4-3所示。其中神经网络被分成三个层次:输入层、隐藏层和输出层,人们一般把输入层称为第0层。具体来说,输入层是第0层,第一个隐藏层是第1层,第二个隐藏层是第2层,输出层是第3层。神经网络的学习也称为训练,指的是通过神经网络所在环境的刺激作用调整神经网络的自由参数,使神经网络以一种新的方式对外部环境做出反应的一个过程。深度学习与传统机器学习系统的不同之处在于,它能够在分析大型数据集时进行自我学习和改进,因此能应用在许多不同的领域。激活函数(ActivationFunctions)对于人工神经网络模型以及卷积神经网络模型去学习理解非常复杂和非线性的函数来说具有十分重要的作用。激活函数的非线性增加了神经网络模型的非线性,使得神经网络具有了更实际的意义。SigmoidTanhReLU
目前,深度学习在各种任务中都表现出了惊人的表现,无论是文本、时间序列还是计算机视觉。大数据。当前大部分的深度学习模型是有监督学习,依赖于数据的有效标注。例如,要做一个高性能的物体检测模型,通常需要使用上万甚至是几十万的标注数据。GPU。当前深度学习如此火热的一个很重要的原因就是硬件的发展,尤其是GPU为深度学习模型的快速训练提供了可能。模型。在大数据与GPU的强有力支撑下,无数研究学者的奇思妙想,催生出了一系列优秀的深度学习模型,并且在学习任务的精度、速度等指标上取得了显著的进步。4.2深度学习的原理和技术4.2.1感知机感知机被称为深度学习领域最为基础的模型。虽然感知机是最为基础的模型,但是它在深度学习的领域中有着举足轻重的地位,它是神经网络和支持向量机学习的基础。感知器是一种数学的模型,它可以看作是在模仿生物的神经元,有多个输入,一个激活函数和一个输出。一个感知器的输出可以连接到其它感知器的输入上,这样就实现了最基础的人工神经网络。感知器激活函数设计的初衷,也是在模仿神经元的激活状态。4.2.1感知机图4-8是一个接收两个输入信号的感知机,x1、x2是输入信号,y是输出信号,w1、w2是权重。图中的矩形框称为“神经元”或者“节点”。输入信号被送往神经元时,会被分别乘以固定的权重(w1x1、w2x2),感知器的每一个输入都和权重相乘,然后再把所有乘完后的结果加在一起,也就是相乘后再求和,求和的结果会作为激活函数的输入,而这个激活函数的输出会作为整个感知器的输出。4.2.1感知机一般来讲,感知机原理的优点在于其简单、易于实现,并且可以处理大量的数据。然而,感知机也存在一些缺点,例如对于非线性数据的分类效果不佳,需要使用更加复杂的算法进行处理。此外,感知机也容易受到噪声数据的影响,需要进行数据清洗和预处理。图4-10显示了使用感知机来划分二维平面。4.2.2卷积神经网络卷积神经网络(ConvolutionalNeuralNetwork,CNN)顾名思义是在神经网络的基础上加入了卷积运算(卷积是测量两个函数重叠程度的积分),通过卷积核(卷积核是一个二维矩阵,它与原始数据进行逐个元素的乘积运算,并将结果相加得到一个新的数值。神经网络中的卷积,就是利用一个卷积核在输入图像矩阵上滑动,如图4-11所示。图中的字母就代表着图像中的像素值,灰色矩阵就是卷积核。具体操作就是,将卷积核与在图像矩阵中所覆盖的区域对应位置相乘再相加,最后的蓝色矩阵就是这次卷积的结果。图4-11表示输入数据是一个维度为4*3的二维数组,卷积核是一个维度为2*2的二维数组。4.2.2卷积神经网络卷积神经网络作为一个深度学习架构被提出时,它的最初诉求是降低对图像数据预处理的要求,以避免烦琐的特征工程。CNN由输入层、输出层以及多个隐藏层组成,隐藏层可分为卷积层、池化层、ReLU层和全连接层,其中卷积层与池化层相配合可组成多个卷积组,逐层提取特征。4.2.2卷积神经网络1)卷积层整个卷积层的卷积过程是,首先选择某一规格大小的卷积核,其中卷积核的数量由输出图像的通道数量决定;然后将卷积核按照从左往右,从上到下的顺序在二维数字图像上进行扫描,分别将卷积核上的数值与二维图像上对应位置的像素值进行相乘求和;最后将计算得到的结果作为卷积后相应位置的像素值,这样就得到了卷积后的输出图像。4.2.2卷积神经网络2)池化层池化层又称为下采样层,主要是通过对卷积形成的图像特征进行特征统计,这种统计方式不仅可以降低特征的维度,而且还可以降低网络模型过拟合的风险。图4-15显示了池化层,在该图中池化层的输入单元数量为6,池的宽度为3、步幅为2,池化层的输出单元数量为2。4.2.2卷积神经网络3)全连接层图像经过卷积操作后,其关键特征被提取出来,全连接层的作用就是将图像的特征进行组合拼接,最后通过计算得到图像被预测为某一类的概率。在实际使用过程中,全连接层一般处于整个卷积神经网络后端,其计算过程可以转化为卷积核为1×1的卷积过程。全连接层在深度学习中起到了至关重要的作用,它不仅可以用于特征提取和表示学习,还可以用于模型的输出预测。4.2.2卷积神经网络卷积神经网络的特性卷积神经网络具有局部感知这一鲜明的特性。在使用计算机进行图像处理时,往往会将图像用向量的形式来表达,当计算机输入一个1000像素*1000像素的图像时,计算机可以将其转换表示为一个1000*1000的向量。将这个图像输入至网络中,假设隐藏层的神经元数目与输入层的神经元数目一样时,那么输入层到隐藏层的连接将会达到1012,参数太多,计算量十分巨大,神经网络将会出现很难训练的情况。所以为了能够高效的使用神经网络进行图像处理,必须减少参数,而卷积神经网络的局部感知特性就能很好的解决这一问题。卷积神经网络另外一个鲜明的特性就是权值共享,也叫做参数共享,指在一个模型的多个函数中使用相同的参数。4.2.2卷积神经网络常用的卷积神经网络1)Lenet
Lenet是一系列网络的合称,包括Lenet1-Lenet5,由YannLeCun等人在1990年中提出来的,被认为是最早的卷积神经网络(CNN),为后续CNN的发展奠定了基础。2)VGGVGG有两种结构,分别是VGG16和VGG19,两者并没有本质上的区别,只是网络深度不一样。VGG网络由卷积层模块后接全连接层模块构成。3)GoogleNetGoogLeNet是Google团队于2014年提出的一种卷积神经网络模型,其设计目标是在保持较低的参数量和计算复杂度的同时提高模型的表达能力和分类准确性。4)ResNetResNet(残差网络)是由KaimingHe等人于2015年提出的一种深度卷积神经网络模型,它在解决深层网络中梯度消失和网络退化问题上取得了重要突破。5)DenseNetDenseNet(稠密连接网络)是由GaoHuang等人于2016年提出的一种深度卷积神经网络模型,它通过密集连接(denseconnection)的方式将每一层的特征图与所有后续层的特征图连接在一起,从而有效地促进信息流动和特征重用。4.2.3网络架构自编码器自编码器是一类在半监督学习和非监督学习中使用的人工神经网络,其功能是通过将输入信息作为学习目标,对输入信息进行表征学习(representationlearning)。自编码器主要由两部分构成:编码器(Encoder)和解码器(Decoder),如图4-19所示。4.2.3网络架构Encoder-Decoder架构Encoder-Decoder架构是一种深度学习模型结构,广泛应用于自然语言处理(NLP)、图像处理、语音识别等领域。Encoder:编码器,对于输入的序列<x1,x2,x3…xn>进行编码,使其转化为一个语义编码C,这个C中就储存了序列<x1,x2,x3…xn>的信息。Decoder:解码器,根据输入的语义编码C,然后将其解码成序列数据。文本处理领域的Encoder-Decoder框架可以这么直观地去理解:可以把它看作适合处理由一个句子(或篇章)生成另外一个句子(或篇章)的通用处理模型。4.2.4生成对抗网络生成对抗网络(GenerativeAdversarialNetwork,
GAN)独特的对抗性思想使得它在众多生成网络模型中脱颖而出,被广泛应用于计算机视觉、机器学习和语音处理等领域。生成对抗网络模型如图4-22所示,该模型主要包含一个生成模型和一个判别模型。生成对抗网络主要解决的问题是如何从训练样本中学习出新样本,其中判别模型用于判断输入样本是真实数据还是训练生成的样本数据。4.2.4生成对抗网络生成对抗网络GAN的网络结构由生成网络和判别网络共同构成。生成网络G接收随机变量z,生成假样本数据G(z)。生成网络的目的是尽量使得生成的样本和真实样本一样。判别网络D的输入由两部分组成,分别是真实数据x和生成器生成的数据G(x),其输出通常是一个概率值,表示D认定输入是真实分布的概率,若输入来自真实数据,则输出1,否则输出0。同时判别网络的输出会反馈给G,用于指导G的训练。4.2.4生成对抗网络常用的生成神经网络包括但不限于如下所述3种生成神经网络:1)CGAN条件生成对抗网络(ConditionalGAN,CGAN)在原始GAN的基础上增加了约束条件,控制了GAN过于自由的问题,使网络朝着既定的方向生成样本。2)DCGCN深度卷积生成对抗网络(DeepConvolutionalGAN,DCGAN)的提出对GAN的发展有着极大的推动作用,它将卷积神经网络CNN和GAN结合起来,使得生成的图片质量和多样性得到了保证。3)CycleGAN循环一致性生成对抗网络(Cycle-ConsistentGenerativeAdversarialNetworks,CycleGAN),CycleGAN可以让两个域的图片互相转化并且不需要成对的图片作为训练数据。4.2.5自注意力机制自注意力机制(Self-Attention),有时也称为内部注意力机制,是一种在深度学习模型中应用的机制,尤其在处理序列数据时显得非常有效。注意力机制的最初灵感来源于人类的视觉,即当人用眼睛观察东西的时候,会首先快速扫描全局图像,然后再捕捉需要重点关注的目标区域,将视觉重点聚焦在这个目标区域。例如,当人们看到图4-24时,会下意识把注意力集中到熊猫身上,而忽略图中的其它信息。4.2.5自注意力机制图4-25显示了引入了注意力机制的Encoder-Decoder框架。图中不再只有一个单一的语义编码C,而是有多个C1,C2,C3这样的编码。因此当人们在预测Y1时,可能Y1的注意力是放在C1上,那就用C1作为语义编码,当预测Y2时,Y2的注意力集中在C2上,那就用C2作为语义编码,以此类推,就模拟了人类的注意力机制。4.2.5自注意力机制注意力机制的术语查询(Query):指的是查询的范围,自主提示,即主观意识的特征向量。键(Key):指的是被比对的项,非自主提示,即物体的突出特征信息向量。值(Value):则是代表物体本身的特征向量,通常和Key成对出现。注意力机制是通过Query与Key的注意力汇聚(给定一个Query,计算Query与Key的相关性,然后根据Query与Key的相关性去找到最合适的Value)实现对Value的注意力权重分配,生成最终的输出结果。4.2.5自注意力机制注意力机制的本质是通过“查询”来生成一组能够重新作用于原图的权值。(1)根据Query和Key计算两者之间的相关性或相似性(常见方法点积、余弦相似度,MLP网络),得到注意力得分。(2)对注意力得分进行缩放,再采用softmax函数(一种归一化函数),一方面可以进行归一化,将原始计算分值整理成所有元素权重之和为1的概率分布;另一方面也可以通过softmax的内在机制更加突出重要元素的权重。(3)根据权重系数对Value值进行加权求和,得到AttentionValue。4.2.5注意力机制自注意力机制自注意力机制是一种用于深度学习的重要技术,能够根据输入的不同部分自动分配注意力权重,进而实现对不同特征的加权处理。通过自注意力机制,模型可以根据输入序列的内部关系调整权重,从而更好地抓住序列中的重要信息。自注意力机制不再局限于编码器-解码器结构中编码器和解码器之间的注意力计算,而是将注意力应用到输入序列的各个位置之间,从而捕捉序列内部的相关性。自注意力机制公式如下。谢谢第5章优化算法5.1认识优化算法5.1.1最优化理论基础最优化(Optimization)是应用数学的重要研究领域,它是研究在给定约束之下如何寻求某些因素,以使某一或某些指标达到最优的一些学科的总称。最优化问题(OptimizationProblem)问题可定义为:在给定约束之下,从问题的诸多可能解中,寻求使某一或某些指标达到最优的解。若使用数学语言来描述,即在给定的集合上求解某个目标函数的极值(极小化或极大化)问题。对最优化问题进行数学建模通常需要如下三大要素:(1)决策变量和参数(2)约束条件(3)目标函数5.1.3智能优化方法智能优化方法概述这类新颖的优化算法往往借鉴了人类解决复杂问题的技巧以及生物体的本能,通过模拟或揭示某些自然现象或过程而得到发展,能够将复杂的求解过程简单化,从而表现出智能的特征,因此被称为智能优化方法。这类算法均从任意一个初始解出发,按照某种机制,以一定的概率在整个求解空间中搜索最优解,由于它们可以把搜索空间扩展到整个问题空间,因而具有全局优化性能。因此,智能优化方法以其具有全局的、并行高效的、通用性强、无需问题特殊信息等优点,为解决复杂问题提供了新的思路和手段5.1.2传统优化方法2.典型的智能优化方法遗传算法、模拟退火算法、禁忌搜索算法、蚁群优化算法、粒子群优化算法、捕食搜索算法、细菌觅食算法、蜂群算法、布谷鸟搜索算法......3.典型智能优化方法的特点(1)不以达到某个最优条件或找到理论上的精确最优解为目标,而是更看重计算的速度和效率。(2)对目标函数和约束函数的要求比较宽松。(3)算法的基本思想都是来自某种自然规律的模仿,具有人工智能的特点。(4)多数算法含有一个多个体的种群,寻优过程实际上就是种群的进化过程。(5)这些算法的理论工作相对比较薄弱,一般来说都不能保证收敛到最优解,甚至不能保证求到可行解。5.2梯度下降算法5.2.1梯度下降算法的基本思想梯度下降法(GradientDescent)是一种求解无约束优化问题的迭代算法,该算法的核心思想非常直观,即通过不断地沿着该函数梯度(gradient)的反方向更新参数,从而找到一个函数的局部最小值。1.场景假设:梯度下降法的基本思想可以类比为一个人下山的过程。2.梯度下降下山的过程5.2.2导数与梯度导数与梯度(1)单变量的求导。(2)多变量的求导。2.梯度的数学解释梯度寻求局部最低点的迭代数学公式:5.2.3梯度下降法的实现步骤5.2.4梯度下降算法举例1.单变量函数2.多变量函数5.2.5梯度下降算法的不足和改进梯度下降算法的不足第一,学习率的设置困境。第二,局部最优与鞍点的陷阱。第三,数据规模适配难题。2.梯度下降法的改进(1)全梯度下降算法是最基础的形式,也常被称为“批量梯度下降”。(2)随机梯度下降算法是为解决全梯度下降的效率问题而生,它的核心改进是用单个样本的梯度代替全局梯度。(3)小批量梯度下降算法是前两种算法的折中方案,它结合了两者的优势,避免了各自的缺陷。小批量梯度下降是应用最广泛的优化算法之一,成为平衡训练效率与收敛稳定性的首选方案.5.3遗传算法5.3.1遗传算法概述遗传算法最早源于JohnH.Holland和他的团队研究的元胞自动机,Holland于1975年出版的专著AdaptationinNaturalandArtificialSystems被认为是遗传算法研究的开始。5.3.2编码二进制编码法:每个染色体用一串由0和1组成的二进制串来表示。优点:编、解码操作比较简单,遗传算法中的一些运算,比如交叉和变异等很容易实现,缺点:在求解高维优化问题时,二进制编码长度非常长,会降低算法的搜索效率,在执行遗传操作后有时还需要对结果进行校正,还有许多问题不太适合直接用这种方法编码。2.值编码法每个染色体就是一组值,值可以是和问题相关的任何内容,可以是实数、字符或者一些复杂的对象。染色体A:[1.2345,3.3278,0.3456,1.1122,0.7788]。染色体B:[AFBEDCAEBGDCBAAFG]染色体C:[(Left),(Back),(Left),(Forward),(Forward)]。5.3.2编码3.排列编码法每个染色体是一串数字的排列,代表着一个解的次序,比如:染色体1:152468793。染色体2:258673149。4.树编码法染色体直接表示树形结构,常用于优化问题如数学表达式或决策树的进化.5.3.3交叉和变异基因交叉,又称为基因重组,就是把两个父辈染色体的部分结构加以替换,生成新的个体的操作。交叉操作还可以分为无性交叉、有性交叉、多亲交叉三种。无性交叉是指子代由一个父辈染色体产生,有性交叉是指子代由两个父辈产生,多亲交叉指子代由两个以上父辈产生。单点交叉2.两点/多点交叉3.均匀交叉:每个基因位都以一定的概率进行交换,生成新的子代个体4.运算交叉
5.3.4选择选择操作,也称为复制,其核心功能是从当前种群中筛选出具备优质基因的染色体作为父代,为后续交叉重组提供遗传物质基础。是通过“适应度”指标量化呈现,即每个个体的适应度值直接反映其对问题求解环境的适配能力,适应度越高的个体,在选择操作中被选中作为父代的概率越大,5.3.4选择按照适者生存的基本原则,需要让适应度值高的个体被选中的机会更大,根据适应度值来确定个体被选中的概率。选择的策略很多,比如轮盘赌选择、玻尔兹曼选择、排序选择、联赛选择、稳态选择等。5.3.5参数设定5.3.6遗传算法举例利用遗传算法,求解区间[0,30]上函数y=x^3的最大值。接下来给出详细的过程:1.问题分析与参数设定5.3.6遗传算法举例2.完整的迭代过程遗传算法通过“初始化种群→计算适应度→选择(复制)→交叉→变异”的循环迭代优化种群,每代操作均围绕“淘汰劣解、保留优解、生成新解”展开,3.终止条件验证(1)终止条件满足第五代种群中出现有效编码11110,对应x=30,且x=30是区间[0,30]的上限,函数y=x^3在该点取得理论最大值,故迭代终止。(2)解码与最优值计算二进制编码11110转换为十进制:1×2^4+1×2^3+1×2^2+1×2^1+0×2^0=16+8+4+2+0=30;最大值:将x=30代入目标函数,得y=30^3=27000。谢谢第6章计算机视觉6.1认识计算机视觉6.1.1计算机视觉的定义计算机视觉(ComputerVision,CV)是一门研究如何让计算机达到人类那样“看”的学科。更准确点说,它是利用摄像机和电脑代替人眼使得计算机拥有类似于人类的那种对目标进行分割、分类、识别、跟踪、判别决策的功能。它以人工智能、自动控制机器人、信号处理、机器学习、物理学、图像处理、数学、成像技术和神经生物学等为基础。6.1.2人类视觉与计算机视觉的比较两者的“硬件”结构和进化目标的不同:(1)人类视觉是亿万年进化形成的生存导向型系统,追求对环境的高效理解和快速反应;(2)计算机视觉则是为特定任务设计的工具型系统,通过数据驱动不断逼近人类的视觉能力,但始终缺乏人类视觉背后的“意识”和“常识体系”。6.1.3计算机视觉与机器视觉的比较两者是“基础研究”与“工程应用”的互补延伸:(1)机器视觉侧重工业场景下的工程化应用,是计算机视觉技术在工业场景的具体化、实用化落地,其技术迭代依赖于计算机视觉在算法如深度学习模型、算力上的突破;(2)而计算机视觉更偏向人工智能领域的基础性研究,则通过机器视觉的工业实践,不断验证技术的实用性,反哺自身技术体系的完善,共同推动视觉技术从实验室走向产业场,成为各行业智能化转型的重要支撑。6.1.4计算机视觉的发展简史计算机视觉作为人工智能领域探索机器“看懂世界”的重要分支:始于20世纪60年代:拉里・罗伯茨奠定领域基础,“夏季视觉项目”揭示视觉任务复杂性,此阶段聚焦边缘检测与基础图像处理;80年代迎来理论突破,大卫・马尔的“视觉计算理论”提供系统性框架,相关学者推动三维物体表示与学科学术体系建设,研究以规则驱动为主;90年代至21世纪初,统计学习方法主导发展,各类数据集与特征描述子提升算法性能,ImageNet数据集为深度学习革命铺垫;2012年“深度学习元年”后,AlexNet开启深度学习在该领域的应用,YOLO、MaskR-CNN等推动任务升级;2020年后,VisionTransformer打破CNN垄断,生成式模型实现图像“创造”,如今计算机视觉已实现从规则驱动到数据驱动、从单一任务到多模态融合的技术跃迁,落地于自动驾驶等复杂应用场景。6.1.5计算机视觉与人工智能的关系计算机视觉与人工智能存在密不可分、相互驱动的深度关联:二者既为明确的从属关系(计算机视觉是人工智能聚焦“视觉感知与理解”的重要分支),又形成强烈协同效应。人工智能为计算机视觉提供底层方法论与技术框架,机器学习尤其是深度学习技术推动计算机视觉实现跨越式发展;计算机视觉则为人工智能落地提供核心场景与数据支撑,验证其实用价值并倒逼其向通用、可靠方向突破二者融合构成智能系统“感知-认知-决策”闭环的核心。未来,随着多模态智能、具身智能发展,二者融合将更深入,持续相互支撑、成就彼此,重塑人类与智能机器共存的未来图景。6.2计算机视觉主要内容6.2.1图像获取与表示数字图像基础
图像的获取与表示是计算机视觉的起点:图像获取依托相机、扫描仪等设备,原理类似人眼,通过镜头收集光线、传感器转换电信号、模数转换生成数字信号,最终形成数字图像;这些数字图像在计算机中以像素网格呈现,每个像素的位置由横纵坐标确定,其值记录对应位置的颜色或亮度。2.灰度图像与彩色图像黑白(灰度)图像的每个像素由1个字节的亮度值表示,数值范围为0(黑色)到255(白色),中间值对应不同明暗程度;彩色图像最常用RGB空间(以红、绿、蓝三基色混合显色,每个像素用三个0-255的数字表征),另一种常用的HSV空间更贴合人类描述颜色的习惯,包含色调、饱和度、明度三个维度,照片编辑中调整亮度、饱和度等操作,本质就是修改HSV空间的像素值。6.2.2图像预处理滤波与去噪图像预处理中的滤波与去噪是解决原始图像干扰问题的核心环节,原始图像会因设备、光线等因素产生噪声(杂点、条纹等无意义随机像素),模糊细节甚至掩盖重要特征;滤波则利用像素空间关联性,通过对像素邻域滑动窗口的计算替换异常噪声像素,常见的均值、中值、高斯滤波各有适用场景与特点;滤波与去噪作为计算机视觉处理的重要第一步,能让后续特征提取、目标识别更准确可靠,为各类图像分析奠定基础。2.边缘检测与特征增强图像中的边缘是物体轮廓线与不同区域分界线,蕴含形状信息,边缘检测旨在让电脑勾勒这些关键线条,其思路是寻找亮度或颜色剧变处,Sobel、Canny算子为常用方法;特征增强用于突出图像有用信息,可通过提高对比度、增强纹理等实现,边缘检测属于特殊的特征增强;二者对计算机视觉至关重要,能助力物体形状判断与后续识别检测(如扫描文档时的裁剪与文字清晰化),为相关分析提供支持。
3.图像的归一化图像归一化的本质是将不同来源的像素数值统一到固定尺度区间(如0到1、−1到1),常用最小—最大归一化、零均值归一化两种方法,其不改变图像视觉内容,却能提升算法稳定性与效率,是计算机视觉的基础性操作;而图像预处理各步骤(去噪、边缘检测、特征增强、归一化)环环相扣,将原始图像转化为标准化高质量数据,为后续物体识别、图像分割等高级视觉任务的准确高效开展奠定基础。以上这些预处理步骤环环相扣:先除噪让图像干净,再描边确定物体范围,最后增强特征突出重点,再统一规格方便处理。将“不规整”的原始图像转化为“标准化、高质量”的输入数据,经过这些预处理,计算机才能高效识别“这是猫”“那是汽车”。
6.2.3特征提取与描述
图像的特征提取是从原始数据中提取有意义的信息,以便用于后续的分析和识别。
特征描述是对提取出的特征进行进一步的加工和表示,以便更好地进行分类和匹配。在图像识别中,特征描述可能会将线条、边缘等特征组合成更高级的描述符
1.传统的特征提取算法传统特征提取算法的核心是人工定义特征提取规则(高度依赖领域专家知识),区别于深度学习的自动特征学习,其特征分为全局特征和局部特征两大类:全局特征对图像全部或多个区域像素信息建模(如颜色直方图、傅立叶频谱等),粒度较粗,适用于场景分类、大规模图像检索等高效且无需精细分类的任务;局部特征提取局部区域精细信息,2000年后十年得到充分发展,研究人员设计出数百种,多以建模边缘、梯度、纹理等为目标,典型的尺度不变特征变换方法(SIFT)、加速稳健特征方法(SURF)、方向梯度直方图方法(HOG)、局部二值模式方法(LBP)、Gabor滤波器、密集不变特征描述符方法(DAISY)、二进制稳健独立基本特征方法(BRIEF)、加速分割测试特征方法(FAST)、二进制稳健不变可扩展关键点方法(BRISK)等。6.2.3特征提取与描述2.基于深度神经网络的自动特征学习深度学习兴起后的自动特征学习以数据驱动、深度神经网络(尤其是CNN)为核心,无需人工干预特征定义与提取,通过多层网络从海量标注数据自主学习不同层级视觉特征(底层基础特征、中层局部部件特征、高层语义级特征),借助反向传播优化参数,泛化能力强且能应对复杂场景,广泛应用于各类图像识别任务,但依赖大量标注数据与高性能计算资源,特征可解释性低;传统特征提取则是人工定义规则、依赖专家知识,灵活性不足;二者分别代表计算机视觉从人工经验主导到数据与模型主导的技术跨越,各有所长,共同助力计算机理解图像。6.2.4目标检测与识别目标检测与识别是计算机视觉的关键技术,核心是让计算机从图像或视频中精准定位目标位置(目标检测,以矩形框标注,关注“在哪里”)并识别目标类别(目标识别,关注“是什么”),二者实际应用中紧密结合,如智能交通、安防监控领域均依赖该技术;深度学习的发展大幅提升其精度与效率,为计算机视觉的广泛应用奠定基础。1.单阶段检测目标检测中的单阶段检测方法简单高效,YOLO和SSD是其著名代表:YOLO核心是将整幅图像输入网络后一次性完成物体定位与识别,通过划分小格子实现检测,速度极快,适用于自动驾驶等实时场景;SSD基于多尺度检测,借助多个卷积层检测不同大小物体,对大小不一的目标识别效果好;二者简化检测流程,兼具速度与精度,为安防监控、智能交通、机器人视觉等领域提供有力支持。
2.两阶段检测目标检测中的两阶段检测方法以R-CNN系列为代表,其核心是分两步完成任务:第一阶段从图像中生成形状、大小各异的“候选区域”(可能包含物体的区域)第二阶段利用卷积神经网络(CNN)分析每个候选区域,判断其中是否存在物体及物体具体类别,如同先通过粗筛选出疑似目标区域,再用精细工具确认。R-CNN的流程:①输入图像后,使用无监督算法提取约2000个物体的可能位置,即候选区域;②将所有候选区域缩放至相同大小,输入卷积神经网络提取特征;③用支持向量机(SupportVectorMachine,SVM)对每个区域的特征进行分类。
6.2.5图像分割图像分割是计算机视觉中的一个重要任务,它的目标是将图像划分为若干个有意义的区域,以便更好地理解和分析图像内容。1.语义分割语义分割是一种图像分割方法,目标是为图像中每个像素分配特定类别,既识别物体又确定其每个像素位置;其关键特征是关注“类别”而非“个体”,不区分同类别下的不同实例;例如,如果有两辆车在同一张图像中,语义分割会将它们的所有像素都标记为“车辆”,而不会区分这两辆车是不同的个体。
该方法适用于场景理解、地图生成等任务,能提供图像各区域的语义信息。2.实例分割与全景分割实例分割和全景分割是语义分割的扩展,前者在语义分割识别物体类别的基础上,进一步区分同类别中的不同个体;后者结合语义分割与实例分割,既能识别类别、区分同类别个体,还能划分物体与背景区域;图像分割技术从语义分割到实例分割再到全景分割,对图像内容的解析能力逐步提升,助力计算机更精细地理解图像信息。
6.2.5图像分割
3.基于全卷积网络的图像分割全卷积网络(FCN)是
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 《烟花爆竹工程竣工验收规范》AQ4127-2026
- 小型蓄水工程考核细则
- 物业小区公共照明管理制度
- 检验科医疗器械质量控制管理制度
- 机关单位生育保险管理制度
- 教师工作效率低下问题清单及整改措施
- 旅游厅旅游景区流量管控工作手册(标准版)
- 物业收费标准与收费管理手册
- 招商引资策略与项目评估手册
- 《风机水泵变频节能改造指导手册》
- 潍坊高密市人民医院招聘考试真题2025
- 2025年甘肃人力资源服务股份有限公司面向社会招聘浙能集团甘肃有限公司古浪黄花滩新能源项目制工作人员笔试历年参考题库附带答案详解
- 2026年企业所得税汇算清缴新政与纳税调整
- 2025年中级会计职称中级会计实务考试真题及答案
- 证券投资基金销售业务信息管理平台管理规定全文
- 健康体检随访工作制度范本
- 2026年中级注册安全工程师《其他安全实务》考前冲刺训练试卷及参考答案详解(综合卷)
- 水利水电工程单元工程施工质量检验表与验收表(SLT631.7-2025)
- 商贸公司工作制度大全
- (2025年)NICE指南:老年人和50岁及以上高危人群跌倒的评估和预防(NG.249)解读
- 2025-2026学年北京市顺义区九年级(上)期末英语试卷
评论
0/150
提交评论