版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能概述1.人工智能的定义2.人工智能的起源和发展历程3.人工智能的应用领域4.人工智能对社会的影响5.人工智能的未来目录Contents人工智能的定义01夜间“开启睡眠模式”后,灯光渐暗、电视关闭,空调切换至睡眠温风;电器进入低能耗状态,同时启动安防监控,保障夜间安全。睡眠模式守护用户说“播放喜欢的电影”,AI自动筛选偏好影片并播放;若用户反馈光线过亮,窗帘同步闭合,打造私人影院级视听环境。观影体验优化用户语音要求“调低空调温度”,AI立即响应并精准调节室温;通过传感器实时感知体感需求,实现空调、加湿器等设备的自动联动。环境智能控制归家时,AI管家通过语音指令自动触发灯光系统,调节至温馨亮度;无需手动操作,灯光随场景需求智能切换,营造舒适放松氛围。灯光与氛围调节生活场景中的AI:智能家居案例人工智能的定义什么是人工智能(artificialintelligence,简称AI)?人工智能是计算机科学的一个重要分支,是指研究、开发用于模拟、延伸和扩展人类智能的理论、方法和技术的一门新兴的技术科学。它的目标是通过计算机程序实现使机器能够模拟人类的多种智能,如感知、理解、推理、决策、学习和交互等多个方面。人工智能是制造智能机器的科学与工程。
——约翰-麦卡锡,“人工智能”概念的提出者人工智能就是研究如何使计算机做过去只有人才能做的智能工作。”
——麻省理工学院帕特里克·温斯顿无统一定义,可简单认为是用计算机来模拟人类智能行为(动脑子--感知、推理、记忆等)的科学。人工智能的定义AI就是机器人?误区:AI有时只是一个程序,比如AlphaGo;机器人也未必都智能。
阿尔法狗(AlphaGo)阿尔法机器狗非智能刀削面机器人人工智能的定义AI就是编程?误区:人工智能需要编程,编程不等于人工智能。计算机语言有很多种作家需要写字。会写字不等于是作家人工智能的起源与发展历程02人工智能的起源和发展历程艾伦-图灵,英国伟大的天才数学家。1936年,24岁的图灵发表划时代的论文《论可计算数及其在判定问题上的应用》,提出后人称为“图灵机”的通用计算模型,为现代计算的诞生准好了理论基础。因这一伟大贡献,被称为计算机科学之父。人工智能的起源和发展历程1948年,图灵发表了一篇题为《智能机器》的报告,并探讨了若干方法,提出了利用计算机来模拟人类智能的思想,为人工智能的诞生奠定了理论基础人工智能之父。人工智能的起源和发展历程1950年,图灵发表《计算机器与智能》,提出了后来被称为“图灵测试”的假想实验。图灵测试:1950年,阿兰·图灵在论文《计算机器与智能》中提出“图灵测试”,通过对话式情境让测试者无法区分回答来自人类或机器。若30%以上回答被误认为人类,则判定机器通过测试,为AI研究奠定理论基础。人工智能的起源和发展历程1956年,约翰•麦卡锡等学者在美国达特茅斯学院召开讨论会,探讨实现智能机器的方法,史称达特茅斯会议。本次会议首次提出“人工智能”概念,会议目标包括开发学习程序、解决抽象问题等,标志AI作为独立学科正式诞生(本次会议与会者有多名科学家后来获得了诺贝尔奖和图灵奖)。人工智能的起源和发展历程通过明确的规则推理决策。如医学诊断系统:含由专家制定的规则,基于患者症状、体检结果等初步诊断,辅助医生诊断。代表成果:王浩用9分钟完成《数学原理》450条定理证明。依赖数据统计与专家知识编码,像经验丰富的顾问,能据过去案例提供建议,但学习能力有限(IBM-深蓝)。代表成果:医疗/地质等领域的专家系统能够通过不断从数据中自主学习优化,并通过实践来提升自己的能力和智慧(chatGPT、文心一言、DeepSeek等)。AI发展的三个阶段:基于规则的智能、基于经验的智能、基于学习的智能。人工智能的起源和发展历程中国AI现状中国大模型在技术创新与用户体验上持续突破,未来将在国内国际双循环中发挥关键作用,推动AI与实体经济深度融合。未来潜力:全球影响力提升零售领域:客流统计、无人便利店、智能供应链;医疗领域:医学影像辅助诊断(如AI分析视网膜扫描图准确率94%)、药物研发加速;教育领域:AI学习平板定制个性化学习计划。应用场景:多领域深度渗透中国涌现文心一言、通义千问、讯飞星火等国际级大模型。如讯飞星火在语言理解、代码生成等能力全面超越GPT-4Turbo;DeepSeek通过知识蒸馏框架,推理速度提升40%,训练能耗降低35%。大模型技术:本土化创新领先人工智能的应用领域03人工智能的应用领域自动驾驶和智能交通:利用传感器、雷达、摄像头等设备收集环境信息,结合视觉计算和AI算法进行决策和控制,实现车辆的自主驾驶,并通过AI技术优化交通信号灯控制、道路方向干道选择等,提高交通效率和安全性。借助高端芯片计算和算法,无人驾驶系统比人类能更快预测行车状况,也能更快速对危机做出反应。理论上,最领先无人驾驶技术已超过真人驾驶水平。人工智能的应用领域智能医疗:将人工智能技术,如机器学习、自然语言处理、计算机视觉等,深度融合到医疗保健的各个环节,包括疾病诊断、治疗方案制定、医疗影像分析、药物研发和健康管理等,以提高医疗效率,并有效改善患者的医疗体验和健康结果。案例:谷歌子公司DeepMind与英国摩尔菲尔兹眼科医院和伦敦大学学院眼科研究所合作研究,发现利用AI分析视网膜扫描图在诊断青光眼、老年黄斑变性和糖尿病视网膜病变等眼疾上,准确率达94%,超越了该医院的8名临床专家。人工智能的应用领域智能安防是对安全防护进行智能化管理和控制的系统,结合了物联网、人工智能、云计算等先进技术,其中智能识别技术是实现其功能的关键技术。通过AI算法,除了进行人脸比对和车牌识别外,系统还能够自动识别徘徊、奔跑、聚集等异常行为,提高预警精度;利用大数据分析技术,能够对历史监控数据进行深度挖掘,发现潜在的安全隐患。案例:未报警有人来灭火。“我煮花生的锅糊了,你们咋知道的?”北京市通州区水仙园社区的关奶奶对微型消防站队员说。通过调取智能烟雾报警器后台数据,得知在当日10时49分,楼内安装的报警器就已经开始报警,物业通过接到报警器拨打的电话提示得知该楼层发生火灾。人工智能的应用领域智能安防之人脸识别:让机器从众多人脸中找出目标人脸,或判断两张人脸是否为同一个人。人脸识别在安防、金融、公开安全领域有广泛应用。人工智能的应用领域智能家居:通过AI技术可控制各种设备,如空调、电视等,实现从单一功能到全面智能化转变。例如,智能冰箱可记录食材库存,根据家庭成员口味推荐健康菜谱;智能洗衣机能自动识别衣物材质和污渍程度,选择洗涤程序;智能空调则能自动调节室内温度。通过语音控制,一句话就能打开电视、播放音乐、查询天气等,提高了生活效率和更好体验。此外还有扫地机器人、智能机器人等智能家电。人工智能的应用领域智能制造是指利用信息技术、自动化技术、人工智能等先进技术,对制造业的生产和管理过程进行全面优化和智能化改造。它旨在提高生产效率、降低成本、提升产品质量和灵活性,以满足市场快速变化的需求。案例:某知名制造业巨头构建的智能制造生态体系。借助高精度工业机器人精准地完成零部件组装(精度和速度远超人工)、物料搬运等重复性体力劳动。生产流程中布满了各类传感器,每个环节的数据都会被实时采集,像设备的温度、转速等。将海量数据汇聚到一起,运用大数据分析技术进行挖掘。例如提前预测设备是否可能出现故障等。人工智能的应用领域农业智能化:是指利用物联网、大数据、人工智能等现代科技手段,对农业生产过程进行精细化管理和智能化控制,提高农业生产效率、减少资源浪费、保护生态环境,提升农产品的质量和安全性。案例:北京市小汤山现代农业科技示范园通过传感器和无人机监测土壤湿度、温度和作物生长情况,实现精准灌溉和施肥,减少资源浪费;温室内安装自动化系统,利用气候数据智能调节温度、湿度和光照,创造最佳的生长环境;并且实施无人化农业,减少劳动力成本,提高作业效率。无人机用于农药喷洒人工智能的应用领域教育个性化:是指根据每个学生的兴趣、能力和进度等,提供定制化的教学方案和资源,以满足其独特的学习需求。打破了传统“一刀切”的教育模式,让每位学生都能在适合自己的环境中最大化地发挥潜能,从而提高学习效率、激发学习兴趣、促进全面发展。案例:网易有道学习平板系统通过AI分析学生在使用平板进行学习时各个科目的作答情况、学习时长、浏览偏好等数据,打造个性化的学习桌面,把学生最需要巩固和提升的科目、知识点优先呈现出来。虚实融合的全息课堂示意图人工智能的应用领域能源与环保的智能化管理:利用现代信息技术如物联网、大数据和人工智能等,对能源和环保进行实时监控、分析和优化,提高能源利用效率,还能有效减少环境污染。智能电网通过实时监控和数据分析,优化电力分配,减少能源损耗;通过智能化管理,用户可实时监测能源消耗,采取节能措施。智能化管理的应用主要有污染监测与预警和废物管理等。例如利用传感器和数据分析技术,实时监测环境质量,发出污染预警等。能源领域环保领域人工智能对社会的影响04AI通过数据驱动决策,推动制造业向智能化转型。如某制造业巨头构建智能制造生态,通过互联网平台分析设备数据,实现预防性维护,保障生产连续性。产业转型:智能化驱动升级AI控制的设备在电子芯片制造中,能将组件精准放置于电路板,误差控制在极小范围,有效提升产品良品率,推动电子产业向精密化发展。电子芯片:高精度组装与质量保障AI驱动的工业机器人可24小时不间断执行焊接、喷漆等重复性任务,精度远超人工,显著提升生产效率。制造业:机器人24小时高效作业人工智能对社会的影响经济与产业人工智能对社会的影响教育与文化教育的改革与创新,使得教育更具针对性与灵活性,学生可以根据自身特点进行学习,从而提高学习效率和兴趣。智能娱乐系统能根据用户喜好推荐电影、音乐等娱乐内容,提升用户体验;在艺术创作方面,AI可自动生成诗歌、绘画等,为创作提供了新的可能性和灵感来源。0102需制定法律法规规范AI使用,防止滥用与歧视;同时推动全球合作,制定国际标准,确保技术为人类福祉服务。政策监管:技术健康发展的保障AI生成的虚假新闻可扰乱社会秩序,引发公众恐慌。如伪造的突发事件报道,可能误导舆论,需通过政策监管遏制技术滥用。AI假新闻:社会秩序的潜在威胁算法设计若隐含偏见,可导致某些场景的歧视扩大。如某招聘系统因训练数据偏差,可能对特定群体产生不公平筛选,加剧社会不平等。算法歧视:社会偏见的扩大风险AI技术若被滥用,可能威胁公民隐私权与个人信息权。如智能安防系统收集的监控数据,若管理不当可泄露用户隐私。数据隐私:技术滥用的安全隐患人工智能对社会的影响伦理与法律人工智能的未来05自动驾驶技术通过传感器与算法优化交通效率,如物流配送中AI可规划最优路线,降低成本;未来或实现车路协同,实时调整信号灯与车流,减少拥堵,事故率预计下降30%以上。智能交通:高效管理与安全升级教育个性化通过AI分析学生学习数据(如作答情况、偏好)定制学习路径,例如网易有道学习平板可优先呈现薄弱知识点,英语学习模块根据词汇量与发音水平规划专属课程,未来或实现全息课堂中异地实验操作与全球名师资源调用。教育学习:深度适配与个性化AI在疾病诊断领域的突破体现在精准化分析,例如谷歌DeepMind的视网膜扫描诊断系统,对青光眼等眼疾的准确率达94%,超越8名临床专家;未来AI或能结合基因数据与病史,实现更早、更精准的癌症等复杂疾病预警。医疗诊断:精准化与效率提升人工智能的未来技术突破方向(部分)人工智能的未来挑战与应对01当前AI模型(如深度学习)存在“黑箱”问题,决策过程难以追溯,可能导致误判(如医疗诊断错误);需开发可解释性算法,确保技术决策逻辑清晰可验证。技术挑战:算法透明度与可解释性02算法歧视(如招聘或信贷中的偏见)与数据隐私泄露(如用户健康、学习数据滥用)是主要伦理风险;需建立数据使用规范,确保AI决策公平,同时严格保护个人信息。伦理挑战:公平性与隐私保护03AI发展需全球协作制定技术标准(如自动驾驶安全规范)与伦理准则(如数据跨境流动规则);例如欧盟《人工智能法案》与中国《生成式人工智能服务管理暂行办法》的经验共享,可推动国际共识形成。全球合作:标准制定与协同治理谢谢第2章
机器学习人工智能通识基础1.机器学习基本概念2.机器学习与人工智能的关系3.机器学习的主要分支4.机器学习项目实施指南目录Contents机器学习基本概念01导航软件的进化从最短路线到智能规划机器学习初体验0102机器学习让计算机从数据中学会决策,如电商推荐商品、医疗辅助诊断,改变了传统依赖死板规则的模式。导航系统从单纯依据最短路线到能分析交通数据和用户习惯,预测拥堵,动态规划路线,这背后是机器学习技术的支撑。机器学习定义0201现实应用举例电商推荐:分析你的浏览/购买记录,推荐你喜欢的商品;医疗诊断:通过学习大量病例数据,辅助医生识别疾病。从数据中学习是一种通过数据让机器“学会”规律的技术。它不需要人工明确指令,而是通过一系列的概念和步骤,使机器能自动地分析、预测和决策。数据、模型和算法数据的作用算法的价值数据是学习素材,决定模型能“看到”多少信息。没有数据,机器无法学习。算法是学习策略,决定模型如何从数据中学习。算法是模型如何学习的“路线图”。模型是思维框架,提炼数据中的规律。模型是对规律的数学表达,用于预测结果。模型的功能一个学生刚开始学习分辨“猫”和“狗”,他需要看到成百上千张“猫”和“狗”的图片,才能识别出它们的不同特征。如果一个学生想学习数学加法,老师可能会给他一个公式“a+b=c”。这个公式帮助他理解如何将两个数字相加。一个水果分拣员通过观察水果的颜色和形状来判断其种类,他先看颜色,红色可能是苹果;接着看形状,圆形的可能是苹果,长条的可能是香蕉。数据:机器学习的眼睛数据形式多样,包括数字、文本、图像、视频等。垃圾邮件分类器需分析大量邮件,识别出“广告语、多链接”等特征。0102数据为机器提供了“学习素材”,是机器学习的源泉。数据越丰富、越准确,模型学到的知识就越全面,因此数据是机器学习中最核心的资源。数据的形式数据的重要性模型:机器的大脑模型是对规律的数学表达,用于预测结果。房价预测模型可根据面积、地段等因素输出价格。模型的定义比喻:学生学加法公式“a+b=c”,机器模型同样依赖公式进行推理。模型的作用算法:学习的策略01算法的定义算法是模型如何学习的“路线图”。水果识别=决策树(颜色→形状→分类)。02算法的影响比喻:学生解题方法不同,算法决定学习路径。特征:决定成败的关键信息特征是数据中最有用的部分,是模型识别规律的“线索”。预测电影票房要考虑导演、演员、上映档期等。特征的定义比喻:评估比赛结果要看球员状态、天气、对手。特征的重要性训练:从反复试错中学会预测训练是模型“学习规律”的过程,通过不断尝试减少预测误差。AI学骑车,一开始总摔倒,不断调整后才能掌握平衡。训练的含义比喻:学生做题—>错题分析—>改正提升。训练的方法泛化:是否真正“学懂了”?01泛化是模型应对新数据的能力,是评估是否“学到本质”的标准。学生考试题型稍变就不会做=模型过拟合。02泛化的定义比喻:死记硬背不能应付灵活题,模型要“理解而不是背答案”。泛化的重要性测试与验证:实战检验模型效果测试的目的测试阶段检验模型是否能处理新数据。厨师学习做菜,最终还是看顾客是否满意。验证的作用比喻:模拟考试检验是否真正掌握知识点。损失函数:模型的错题本损失函数的作用损失函数衡量预测值与真实值之间的误差。学生做题错了,老师指出错误位置=机器的“评分标准”。损失函数的类型常见类型:均方误差(MSE)、交叉熵等。超参数调优:调好“火候”才能烘焙成功超参数是在训练前设定的,会影响模型表现。学习率太高→模型跳跃、震荡。超参数的定义比喻:烘焙时温度/时间设错,结果会糊或夹生。调优的方法正则化:防止死记硬背的“提醒器”正则化的功能正则化用于防止模型过拟合,通过惩罚复杂度来增强泛化。学生不能只记一道题的答案,而要学解题方法。正则化的应用比喻:画家不能死临摹,要掌握通用技法才能创作新作品。机器学习与人工智能的关系02AI的智能来源,从“学习”开始人工智能(AI)正逐渐走进我们的生活。你用的音乐App、导航App、语音助手背后,都有AI的身影。它们为什么越来越懂你?——靠的是机器学习(MachineLearning)!机器学习是AI的大脑AI=感知+决策+推理ML=AI自主学习与优化的基础AI类型传统规则使用机器学习导航手动设定路径学习路况做预测音乐推荐固定分类用户行为分析三种AI“人格”,让智能更真实思考一下假如你是智能冰箱,你会学什么?学习主人的饮食习惯(牛奶几天喝完?鸡蛋多久用完?)主动提醒:下次采购前发出通知,甚至生成购物清单!机器学习如何让AI“从小孩变超人”给AI宠物设计“学习清单”如果你拥有一个AI宠物机器人,它需要学会哪些技能?记住你喜欢什么时候散步判断你开心/生气的语气预测天气并提醒穿衣机器学习的主要分支03你知道AI的“学习门派”吗?一位顾客进入超市,他的购物路径、购买偏好、与货架的交互都在被AI记录。如何预测他要买什么?如何决定货品摆放?靠的不是一种算法,而是五种学习策略的协作。五大主流学习方式一览看懂未来——监督学习的本领💳一笔信用卡交易在秒级内被拒绝,是AI系统识别为可能的“欺诈交易”
📊系统依据历史标注数据,学习“特征→标签”的关系,实现精准判断无监督学习:揭示隐藏模式👤每位顾客都有独特的购物习惯,但平台如何发掘潜力客户?
🏷️这些顾客没有“标签”,没法直接分类……
👉无监督学习出场!通过分析购物数据,平台可以:自动将顾客划分为“高价值客户”“潜力客户”“普通客户”发现新产品组合、优化推荐系统提升转化率和客户满意度聚类:像帮学生分组,不告诉你哪个是好学生,但从表现中自动看出“学习风格相似”的同学归为一组降维:像整理旅行行李,从100样东西里挑出最重要的10件打包出发!强化学习:决策的智者半监督与自监督学习:标签稀缺的解决方案多种学习方式如何协同?现代城市的交通管理,需要更聪明的系统来预测拥堵、优化红绿灯、识别异常情况。单一学习方式难以全面解决问题,五大学习分支协同工作,助力城市畅行!机器学习项目实施指南04项目背景你刚结束一节漫长的高等数学课,饥肠辘辘地走向食堂,结果却发现长龙排到门口——每个人都在等待一份热腾腾的饭菜。这不仅让你的胃倍感煎熬,也让整个食堂效率低下。有没有一种方法,能够提前预测高峰时段,让食堂窗口根据预测合理分配资源,减少学生排队时间?
机器学习七部曲定义问题收集和处理数据选择算法构建模型训练模型评估模型部署模型并持续优化机器学习七部曲——定义问题1.预测目标(输出)需要预测每天的高峰时段(如某一时间段食堂需要的最大窗口数)2.输入数据(特征)影响食堂高峰时段的因素,比如学生课程表、天气状况、食堂菜品受欢迎程度和时间信息等3.核心问题通过分析这些数据特征,找到隐藏的规律,让模型能够预测每一天的高峰时段和排队人数机器学习七部曲——收集和处理数据在食堂排队预测中,需要收集哪些数据?机器学习七部曲——收集和处理数据需要做哪些方面的预处理?4312确保数据质量的关键步骤。获取数据后,可能会发现缺失值、异常值或格式混乱的情况。数据检查特征工程不同特征的数据范围可能存在较大差距,为了避免某些特征对模型产生过大影响,需要将数据调整到相同的量级。数据标准化将数据分为训练集和测试集是模型训练的重要一步。数据分割数据预处理提炼出对模型更有用的信息。机器学习七部曲——选择算法选择机器学习算法就像一场“选美大赛”,你需要从众多候选者中挑选出最适合解决问题的“冠军”。根据食堂排队预测的需求,可以得出以下结论:
如果数据简单且对解释性要求高,选择线性回归小姐。
如果需要清晰的逻辑决策并适配复杂数据,选择决策树先生。
如果追求高精度和稳健性,随机森林小姐是最佳选择。
如果数据维度高且允许较长训练时间,可以考虑支持向量机先生。机器学习七部曲——构建模型模型构建的过程是将选定的算法具体化,并将其应用于实际数据中的步骤。将通过分析输入特征(如时间、天气、课程安排等)与预测目标(如排队人数)之间的线性关系来进行构建。会结合多个决策树,每棵树根据不同的数据子集和特征进行独立训练。构建一个树状结构。树的每一个节点都代表一个特征(如时间段、天气等),每个分支对应不同的条件判断,而最终的叶子节点则给出预测结果。通过在高维空间中构造一个超平面来分隔不同类别的数据。机器学习七部曲——训练模型训练集:包含大部分的历史数据(例如,过去几周的数据)。用于训练模型,让模型学习哪些特征(比如时间段或菜单吸引力)会导致高峰时段。测试集:包含一小部分未参与训练的数据(例如,上周的数据)。用于检验模型的性能,看看它是否能够准确预测这些数据中的排队人数。1.准备训练数据机器学习七部曲——训练模型2.模型学习设置目标目标函数是模型的指南针,用来衡量预测效果,比如用均方误差(MSE)计算预测值与实际值的差距。模型通过减少误差,逐步提升预测能力。目标可以定义为预测每天每个时段的排队人数,可以通过收集以下数据来实现这个目标:时间段(如早、中、晚餐时间)天气(晴天、雨天可能影响排队人数)课程表(某些课后排队人数较多)历史排队人数(时间段内的平均排队人数)机器学习七部曲——训练模型2.模型学习防止过拟合和欠拟合机器学习七部曲——训练模型2.模型学习调节超参数超参数是模型训练前需要设定的参数(与模型参数不同,后者由数据学习得到)。学习率:控制梯度下降步长。如果太大,可能导致训练震荡;太小则收敛过慢。正则化强度:决定模型对过拟合的抑制力度。模型复杂度参数(如神经网络的层数、树模型的最大深度)。调节超参数的常用方法:网格搜索:尝试所有可能的参数组合。随机搜索:随机采样一部分参数组合进行评估。贝叶斯优化:根据历史超参数组合的表现智能选择新的组合。机器学习七部曲——训练模型3.循环训练模型输入数据模型初次预测对比真实值调整参数机器学习七部曲——评估模型
食堂管理员已经训练好了一位“神算子模型”,它会基于课程表、天气和历史数据预测每天的排队高峰。但管理员心中有疑问:“它预测得准不准?如果12:30高峰人数预测错了怎么办?”“这个模型真的能让食堂更高效吗?”选择评估指标评估过程分析评估结果输入测试数据,如某天的课程表、天气和菜单信息,让模型预测排队人数(例如预测12:30会有200人排队)。然后将预测值与实际值对比,计算差异,例如实际值为220人,则误差为20人。最后,通过评估指标(如均方误差、平均绝对误差和决定系数)全面衡量模型的表现,得出整体评估结果。机器学习七部曲——部署及优化模型明确部署目标选择部署平台设计友好的用户界面测试和优化模型部署建立监控系统优化模型——让神算子学会新技能反馈闭环——管理员的智慧支持谢谢观看人工智能通识基础第3章
神经网络与深度学习人工智能通识基础1.神经网络基础2.深度学习的诞生3.深度学习的技术分支目录Contents神经网络基础01大脑中的神经网络我们的大脑是由超过1千亿个神经元组成的,这些神经元都是同质的,而且功能很简单,但当大量神经元连接在一起时,就可以完成很复杂的功能。特别重要的是,神经元之间的连接是可学习的,我们就是通过这种能力,慢慢学会了各种技能。小开关大脑中的神经网络大脑里的神经网络可以理解为一个庞大的“信息高速公路系统”,神经元通过这些道路相互连接,传递信息。就像一座城市里各种道路把不同地方连接起来,让信息(信号)可以在各个地方之间快速流动。神经网络如何让我们思考和做决定?当我们在思考或做某件事时,成千上万的神经元在这个神经网络中互相发送信号。比如,你看到一只猫,大脑的视觉神经元先接收到图像信息,然后通过一连串的神经网络传递到负责“识别”的部分,最终得出“这是只猫”的结论。这个过程就像是信息在一个大网络中被传递、处理和最终输出答案的过程。神经网络研究历史脉络科学家受到人脑工作的启发,设计出了人工神经网络。在人工神经网络里,计算机模拟了神经元和神经网络的工作原理。每个人工“神经元”可以接收信息、做简单计算,然后将结果传递给下一个“神经元”。这些人工神经网络通过大量的数据训练,逐步学会如何识别图像、声音或其他复杂任务,类似于我们大脑如何通过经验逐渐学会某些事情。什么是人工神经网络模拟生物神经元连接结构包含“输入层—隐藏层—输出层”结构每个节点就是一个“类神经元”输入层输出层隐藏层水果识别器怎么学会“认水果”?情境:输入特征:颜色、形状、大小输出结果:苹果or香蕉输入(特征)→神经网络处理→输出(分类结果)神经网络的基本原理手写数字识别机器是如何通过多层神经网络识别手写数字的呢?以识别数字“8”为例,我们可以将整个过程分为以下几个步骤:1.输入层:接收图像像素信息手写数字的图片通常被划分成一个个小格子,每个格子对应一个像素点。每个像素的灰度值(例如黑、灰或白)被转换为一个数字输入给神经网络,作为网络处理的起点。2.第一层隐藏层:提取基础特征这一层负责从原始像素中识别出简单的视觉元素,比如边缘、直线、弧形等。这些特征就像是数字构成的“零件”。以数字“8”为例,网络可能会在这一层识别出两个相对独立的圆形轮廓。3.第二层隐藏层:组合局部结构这层会进一步整合前一层提取到的基本图形,将多个线条、弧形组合成更复杂的区域结构。例如,网络可能将两个圆形特征组合,识别为数字“8”特有的上下圆形结构。4.第三层隐藏层:形成抽象表示并匹配类别在这一层,网络会根据前面提取到的复杂特征形成更高层的模式表示,并将其映射到对应的数字类别。比如,它通过训练学习到:“两个垂直排列的圆形,很可能表示数字8”。5.输出层:给出最终判断最后,输出层会根据第三层生成的表示,输出对每个数字的预测概率(如
0到9)。系统会选择概率最高的结果作为最终识别结果,例如判断“这是数字8”。深度学习的诞生02从“层层神经”到“智能觉醒”人工设计特征费时费力,效果不稳定图像、语音、文本等高维数据难以处理一般来说,在参数量相同的前提下,层数更多的神经网络具有更强的学习能力。通常称包含两个隐藏层以上的神经网络为深度神经网络。基于多层结构的机器学习方法一般称为深度学习。虽然任何一种多层结构都可以用于深度学习,到目前为止,深度神经网络依然是应用最广泛的深度学习模型。深度学习VS传统机器学习深度神经网络之所以如此强大,一个很重要的原因在于它可以通过层次性处理逐渐提取抽象特征。维度传统机器学习深度学习特征处理依赖人工经验提取自动从原始数据中学习模型结构浅层(1-2层)多层(10层以上)能力范围适合结构化小数据擅长处理图像/语音等高维大数据示例算法决策树、SVM、KNNCNN、RNN、Transformer深度学习的强大,源于其强大的特征抽象能力与参数表达力深度学习成功的三大推手大数据:海量数据提供足够训练样本计算能力:GPU等硬件突破推动模型训练算法进步:如Dropout、BatchNorm、Adam等技术提升模型泛化案例:智能垃圾分类系统1.项目目标:设计深度学习的模型,能够实现智能垃圾分类系统,该系统通过识别垃圾的种类,自动将垃圾分配到正确的回收区域。2.项目步骤:1)输入层:垃圾图像数据输入的是垃圾的照片,这些图像经过预处理,调整大小(如128×128像素)并归一化处理,转化为深度学习模型可以处理的数字格式。2)隐藏层:逐层提取垃圾特征(1)第一层隐藏层:提取基本形状和纹理特征,例如,识别图像中圆形轮廓(可能是罐子)或矩形轮廓(可能是纸箱)。(2)第二层隐藏层:捕捉材质特征,分析垃圾的材质特性,如塑料表面的光滑纹理、金属的反光、纸张的纹路等。(3)第三层隐藏层:组合多维信息,将形状、材质等特征组合起来,区分不同类型的垃圾。例如,金属饮料罐和塑料瓶可能有相似的形状,但材质特性不同。3)输出层:分类结果输出层根据隐藏层提取的特征,给出垃圾的分类结果,例如“这是一个塑料瓶”“这是一个金属罐”等。深度学习的技术分支03你知道“看图写文案”的AI是怎么实现的吗?电商平台上传一张产品图,AI自动生成广告语:
“清新百搭白T恤,夏日出行好伴侣!”视频平台的AI能自动加字幕,甚至预测你爱看的内容。这些背后的核心:不同分支的深度学习模型深度学习技术分支全景图方法适合任务应用领域CNN空间数据(图像)图像识别、医学影像、安防监控RNN序列建模(时间、文本)语音识别、文本生成、金融预测GAN生成任务虚拟人脸、图像修复、AI绘画Autoencoder特征压缩、重建降噪、异常检测、编码学习Transformer自然语言处理、序列建模机器翻译、对话系统、搜索排序GNN图结构数据社交网络分析、知识图谱、推荐系统DRL决策与控制任务游戏智能、机器人控制、智能调度卷积神经网络CNN让机器“看图识物”的核心工具原理简介:使用“卷积核”自动提取图片特征类比解释:像放大镜扫描图片,抓住边缘、颜色、形状等信息网络结构:输入层→卷积层→池化层→全连接层→输出层人脸识别(如支付宝刷脸支付)医学影像辅助诊断(如肺部CT筛查)自动驾驶中的路标识别应用案例你手机相册里的‘人物识别’是靠CNN吗?你怎么看它的准确性?卷积神经网络CNN案例:分析卫星图像1.项目目标:分析和设计使用CNN进行卫星图像分析的过程。2.项目步骤:1)输入图像:图像包含建筑物、道路、植被和水体等地貌信息,作为CNN的输入数据。2)卷积操作:滤波器识别出建筑物的方形轮廓、道路的连续直线特征,以及植被区域的松散纹理特征。3)池化层:将建筑物边缘的直线特征压缩为更小的表示,忽略水体和阴影等无关信息,如:图像尺寸从512×512缩小到128×1284)多层卷积与池化:(1)第一层识别简单边缘,初步区分建筑物和道路。(2)第二层识别建筑物的矩形结构和屋顶形状。(3)第三层分辨建筑物与周围植被或其他地貌的差异。5)全连接层:综合建筑物特征,分类像素区域为“建筑物”、“道路”、“植被”或“水体”。6)输出结果:标注后的图像,建筑物区域标红色,道路标黄色,植被标绿色,水体标蓝色。序列的编织者:循环神经网络(RNN)AI如何“理解”时间与顺序?原理简介:节点之间具有“记忆连接”,前一个状态会影响下一个决策比喻说明:像人读一句话,后面词的理解依赖前面的内容局限:普通RNN难以长时记忆,发展出LSTM与GRU结构应用案例智能语音助手(如Siri听你讲整句话)股价预测(依赖历史走势)文字生成(自动写诗、写评论)试想你写一封信,哪种AI能帮你续写得像人写的?序列的编织者:循环神经网络(RNN)案例:预测每日用电量1.项目目标:分析和设计使用RNN预测每日用电量的过程。2.项目步骤:1)输入数据:模型接收过去一周的每日用电量数据作为输入,例如:[30,35,40,38,42,45,43](单位:千瓦时),每个数值代表一天的总用电量。这些数据构成了一个时间序列,输入到RNN中进行逐步处理。2)隐藏状态更新:在模型处理到第5天的数据(42千瓦时)时,会根据当前输入(第5天的用电量)与第4天计算得到的隐藏状态共同生成新的隐藏状态,从而在内部表示中保留了从第1天到第5天的时间依赖特征。这个隐藏状态承载了序列历史信息,用于后续的预测任务。3)输出预测:以第5天的隐藏状态为基础,模型预测第6天的用电量,并输出45千瓦时作为结果。在此示例中,预测值与实际值(45千瓦时)一致,说明模型能够较好地捕捉近期用电趋势。请注意,该预测过程为示例,实际训练初期可能存在较大误差。4)权重更新:如果模型在第7天预测的用电量为41千瓦时,而实际值为43千瓦时,则会通过误差计算,使用**反向传播通过时间(BPTT)**算法将误差信息反向传播回模型,调整网络的权重参数,从而提升未来预测的准确性。5)完成任务:在经过训练和调整后,模型可用于预测接下来的几天用电量。例如,预测第8~10天的结果为:[44,46,45](单位:千瓦时)。这些预测结果可为电网运营提供依据,优化电力调度计划,避免供电不足或资源浪费。攻防博弈的艺术:对抗神经网络(GAN)AI也能“以假乱真”?应用案例原理结构:两个网络对抗学习生成器(Generator):努力制造“假图像”判别器(Discriminator):努力识破“假货”对抗结果:最终生成器越来越强,能生成逼真内容AI人像生成(如AI换脸)老照片修复、黑白上色动漫风格转换GAN能生成‘假新闻’视频,你怎么看这种技术风险?攻防博弈的艺术:对抗神经网络(GAN)案例:转换图片风格1.项目目标:分析和设计使用对抗神经网络(GAN)将普通照片转换为手绘风格的人物肖像的过程。2.项目步骤:1)模型构建:搭建一个图像转换模型,包含生成器和判别器两部分。生成器接受普通照片作为输入,输出具有手绘风格的图像;判别器接收真实的手绘图像与生成器生成的图像,并判断输入图像是否为真实作品。该模型可基于条件GAN构建。2)生成初始图像:训练初期,生成器输出的图像通常较为模糊,可能仅具有大致轮廓,缺乏五官细节、笔触特征或阴影结构。此时,判别器能够轻松识别其为非真实图像。3)判别器学习:判别器不断学习识别生成图像中的不自然之处,如五官比例异常、阴影错位、笔触不连贯等,从而更准确地区分真实手绘图像与生成图像。4)生成器优化:在判别器反馈的引导下,生成器逐步优化其输出图像的细节表现,学习手绘风格中的关键元素,如柔和的线条、富有表现力的阴影和艺术化的背景处理,使生成图像更接近真实手绘效果。5)对抗训练:通过持续的对抗训练,生成器不断提升图像的真实性,判别器则持续强化其判别能力。二者在博弈中共同进步,使得生成图像愈加逼真,判别器也越来越难以判断图像真伪。6)训练完成:当生成器生成的图像在风格、细节和构图等方面已接近真实手绘图像,并能“欺骗”判别器时,可认为模型训练达到预期目标。此时,系统能够将输入的普通照片转换为风格独特、细节丰富的手绘风格肖像图像。数据维度的压缩大师:自编码器(Autoencoder)AI如何“自动压缩信息”?应用案例核心机制:编码-解码结构模拟人类提炼摘要的过程,先压缩重要特征,再重构原始数据。与传统压缩方法不同:能自动学习最优特征表示,适用于复杂数据。结构组成:编码器(Encoder):压缩数据解码器(Decoder):重建数据潜在空间表示(latentspace)图像降噪(还原模糊图片)数据可视化(高维→低维)异常检测(重建误差大=异常)数据维度的压缩大师:自编码器(Autoencoder)案例:修复照片1.项目目标:分析和设计使用Autoencoder修复图片的过程。2.项目步骤:1)输入图片:输入为一张128×128像素的家庭合影图像,拍摄于生日场景,存在轻微模糊与局部亮度不均问题,作为模型修复对象。2)编码过程:编码器通过神经网络将图像压缩为一个256维的潜在特征向量,从中提取颜色分布、轮廓结构与背景纹理等关键视觉信息,去除冗余数据。3)潜在表示:该256维特征向量是图像的低维表达,保留了最具代表性的结构信息,如人物姿态、物体轮廓与场景构图,作为后续解码的基础。4)解码过程:解码器利用潜在向量重建出128×128像素图像,通过神经网络逐步恢复图像细节,修复模糊区域与光照偏差,使输出图像更自然清晰。5)损失函数:训练过程中通过计算原始图像与重建图像之间的重建误差(如均方误差MSE)来评估模型性能。模型不断优化参数,降低损失值,提高图像修复质量。语言的解码者:TransformerAI如何“聚焦重点内容”?应用案例核心机制:注意力机制(Attention)模拟人类在阅读时“聚焦关键词”的方式与CNN/RNN不同:可并行处理长序列,速度快、效果好结构组成:Encoder-Decoder(编码器-解码器)、多头注意力、多层堆叠ChatGPT背后的大脑机器翻译图像描述生成语言的解码者:Transformer案例:修复照片1.项目目标:分析和设计使用Autoencoder修复图片的过程。2.项目步骤:1)输入图片:输入为一张128×128像素的家庭合影图像,拍摄于生日场景,存在轻微模糊与局部亮度不均问题,作为模型修复对象。2)编码过程:编码器通过神经网络将图像压缩为一个256维的潜在特征向量,从中提取颜色分布、轮廓结构与背景纹理等关键视觉信息,去除冗余数据。3)潜在表示:该256维特征向量是图像的低维表达,保留了最具代表性的结构信息,如人物姿态、物体轮廓与场景构图,作为后续解码的基础。4)解码过程:解码器利用潜在向量重建出128×128像素图像,通过神经网络逐步恢复图像细节,修复模糊区域与光照偏差,使输出图像更自然清晰。5)损失函数:训练过程中通过计算原始图像与重建图像之间的重建误差(如均方误差MSE)来评估模型性能。模型不断优化参数,降低损失值,提高图像修复质量。结构的解析者:图神经网络(GNN)AI如何“聚焦重点内容”?应用案例核心机制:图结构传播与聚合模拟人类“关系脑图”的构建方式,在复杂关系图中建模信息传播。区别于普通神经网络:支持非欧式数据结构(如社交关系图)结构组成:邻接节点信息聚合多层消息传播节点嵌入更新社交推荐(找“潜在好友”)知识图谱推理(如人物-事件关联)分子结构分析(药物研发)结构的解析者:图神经网络(GNN)案例:识别关键用户1.项目目标:分析和设计使用GNN识别高影响力的关键用户的过程。2.项目步骤:1)图的表示:节点表示用户,边表示用户之间的好友关系,例如A用户与B用户互相关注构成一条边。2)节点特征初始化:每个节点初始特征向量表示用户属性,如活跃度或发帖频率。A用户初始特征向量为:[发帖频率:5次/天,点赞数:100,评论数:50]。3)信息传播:A用户从好友B和C用户学习到高互动性,更新自身特征。4)特征聚合:A用户的聚合特征更新为:[发帖频率:5.5次/天,点赞数:150,评论数:80]。5)图嵌入:A用户的嵌入向量为:[0.8,0.6,0.7],概括了活跃度和好友互动特性。6)节点预测:A用户的影响力得分为0.85,高于其他用户,被识别为高影响力的关键用户。决策的最优策略:深度强化学习AI如何“边做边学”?应用案例游戏智能体(如打败围棋冠军的AlphaGo)自动驾驶行为决策智能电网/调度优化核心机制:试错+奖励反馈
智能体在环境中通过“试错”不断优化行为策略。区别于监督学习:
无标签→完全靠环境反馈来学习结构组成:状态(State)动作(Action)奖励(Reward)策略(Policy)优化决策的最优策略:深度强化学习案例:自动驾驶1.项目目标:分析和设计使用DRL进行自动驾驶的过程。2.项目步骤1)定义环境和智能体:自动驾驶系统中,环境包括道路、车辆、交通标志等,智能体是自动驾驶算法,依赖传感器感知状态。2)表示状态:摄像头和传感器采集数据,如车速、车道线位置,将这些信息转化为特征输入深度网络。3)选择动作:自动驾驶系统在当前状态下选择“加速”、“减速”或“转向”等动作,比如检测前方障碍物后选择减速。4)执行动作并获得反馈:成功避开障碍物,系统得到奖励;偏离车道,系统受到惩罚。5)更新策略:系统因减速过晚偏离车道,更新参数以提高对车距和车速的判断能力,优化下一次的决策过程。6)重复训练:系统在模拟环境中训练,在不同路况(急转弯、拥堵路段)中反复调整策略,学会安全有效地驾驶。谢谢观看人工智能通识基础计算机视觉人工智能通识基础1.计算机视觉概述2.基于深度学习的计算机视觉3.数字图像4.图像处理技术5.计算机视觉应用6.开源技术与工具目录Contents计算机视觉概述01计算机视觉与人工智能的关系计算机视觉作为人工智能的关键分支,赋予AI系统
“看”
与理解视觉世界的能力,是实现高级智能行为的核心环节,如自动驾驶汽车依靠计算机视觉识别路况与障碍物。计算机视觉是人工智能的重要组成部分01人工智能为计算机视觉输送深度学习、神经网络等算法与模型。例如在图像识别任务中,借助这些算法从海量图像数据学习模式,实现精准识别。人工智能为计算机视觉提供支持02计算机视觉的进步反哺人工智能,视觉理解是智能系统与世界交互的重要方式。如智能机器人通过计算机视觉感知环境,推动人工智能在机器人领域的发展。计算机视觉推动人工智能发展03计算机视觉的定义与研究领域计算机视觉的发展历程基于深度学习的
计算机视觉02深度学习在计算机视觉中的应用深度学习的兴起2006年深度学习技术兴起,2012年AlexNet在ImageNet挑战赛取得巨大成功,开启其在计算机视觉领域广泛应用。此前计算机视觉多为浅层学习,需人工设计特征提取器,限制模型普适性,而深度学习可自动学习特征,推动了该领域发展。图像识别的突破深度学习大幅提升图像识别准确率。如在安防监控中,能快速准确识别监控画面中的人物、车辆等目标,助力安保人员及时发现异常情况,相较于传统方法,识别精度从60%提升至90%以上。目标检测的突破在自动驾驶领域,深度学习的目标检测算法可实时检测路面上的行人、车辆、交通标志等,为车辆决策系统提供关键信息。例如特斯拉汽车依靠此技术,能在复杂路况下准确检测目标,保障行车安全。图像分割的突破医学影像分析中,深度学习的图像分割技术可精准识别病变区域。如对脑部MRI图像分割,能清晰区分肿瘤与正常组织,辅助医生更准确诊断病情,提高诊断效率和准确性。核心模型:CNN、RNN和ViT卷积神经网络(CNN)原理:通过卷积层、池化层和全连接层组合,自动学习图像层次化特征表示。特点:局部感知和权值共享,减少参数数量,提高计算效率。应用场景:广泛用于图像分类、目标检测和图像分割等任务,如在人脸识别系统中表现出色。循环神经网络(RNN)原理:具有记忆功能,能处理时间序列数据,通过隐藏层传递信息。特点:适合处理具有时间依赖性的数据。应用场景:常用于视频分析,如动作识别、视频内容理解,可分析视频中目标物体的运动和状态变化。视觉变换器(ViT)原理:基于Transformer架构,将图像分割成小块视为序列数据输入,通过自注意力机制捕捉全局和局部信息。特点:在处理长序列数据和捕捉全局信息上有优势。应用场景:在图像分类任务中表现优异,也用于目标检测、图像分割等视觉任务。数字图像03图像的数字化过程图像数字化的步骤图像数字化需先通过图像采集设备,如摄像头、扫描仪等捕捉真实世界图像。以摄像头为例,光线进入镜头后,图像传感器将光信号转化为模拟电信号,随后图像采集卡把模拟信号转换为计算机能处理的数字信号,完成图像从模拟到数字的转变。以手机拍照为例当用手机拍照时,手机相机内的传感器捕捉光线,将其转变为代表像素颜色和亮度的电信号。相机内部处理器进一步把这些电信号处理成数字数据,形成数字图像,我们便能在手机相册中查看。常见数字图像类型灰度图像灰度图像每个像素点值常用8位二进制数表示,范围是0-255。0代表纯黑色,255代表纯白色,数值变化体现不同灰度,常用于凸显图像明暗对比,如老照片风格处理。二值图像二值图像是特殊灰度图像,仅含黑白两色,一般0为黑,1为白。其数据量小、处理速度快,像文档中的黑白文字图像常用二值图像表示。RGB彩色图像RGB彩色图像通过红色(Red)、绿色(Green)、蓝色(Blue)三种颜色组合表示色彩。每个像素点有三个值分别对应这三种颜色,每种颜色用8位二进制数(0-255)表示强度,可组合出16777216种颜色,日常彩色照片多为RGB图像。不可见光图像及应用医疗领域在医疗中,X射线成像可穿透人体组织形成图像,帮助医生检测骨折、肺部疾病等;CT机拍摄的CT片也是利用X射线,能提供更详细的人体内部结构信息,辅助疾病诊断。军事领域军事上,红外夜视仪利用红外线成像,让士兵在夜间或低光照环境下看清目标,进行侦察、巡逻等任务,提升作战能力。工业领域工业中,利用不可见光图像可检测产品内部缺陷。如利用X射线检测金属部件内部裂缝,确保产品质量,提高生产安全性。自动驾驶领域自动驾驶车辆配备的红外传感器,通过感知红外线形成图像,在夜间或恶劣天气下检测道路上的行人、车辆等物体,辅助车辆决策,保障行驶安全。图像处理技术04图像处理与计算机视觉的关系类比关系可将图像处理比作拍照后的修图,如裁剪、调色、去噪等操作;而计算机视觉类似欣赏照片的人,能识别照片中的物体、场景等。图像处理为计算机视觉准备优质素材,计算机视觉在其基础上深入理解图像内涵。依赖互补关系图像处理为计算机视觉提供经过优化的图像数据,使计算机视觉能更好地进行分析;计算机视觉则基于图像处理的结果,实现对图像内容的高层次理解,两者紧密相连,共同构成完整的图像分析体系。技术促进关系图像处理技术的提升,如更先进的滤波算法,为计算机视觉提供更强大支持;计算机视觉技术的创新,如对复杂场景识别的需求,推动图像处理技术不断发展,以满足更高要求。图像采集图像采集过程图像采集是将现实世界的图像转化为计算机可处理数字格式的过程。类似用相机拍照,先通过镜头搜索目标,调整参数如焦距、光圈,再按下快门捕捉光信号,转化为可存储处理的图像数据。精灵标注助手使用方法使用精灵标注助手时,先新建项目,选择标注类型并导入数据文件;然后在可视化界面进行标注,完成后手动保存;最后可导出PascalVOC、JSON等标准数据集格式。精灵标注助手获取途径可从官网或主流下载平台获取Windows/Linux版本;Mac用户可通过MacStore搜索“colabeler”下载。图像预处理01图像预处理的必要性采集的图像常因设备和环境因素出现噪声、几何形变等问题,影响后续分析,所以需预处理,如去除噪声、提高对比度,为后续处理提供更好图像。02对比度矫正技术-直方图均衡化直方图均衡化通过重新分配像素亮度级别,让亮的更亮,暗的更暗,提高图像对比度。例如使原本灰蒙蒙的阴天照片细节更清晰。03去噪技术-椒盐噪声与中值滤波椒盐噪声像照片上的胡椒粉和盐粒,中值滤波通过取窗口内像素强度中位数替代中心像素强度,有效去除椒盐噪声,恢复图像清晰度。04去噪技术-高斯噪声与高斯滤波高斯噪声类似照片上的薄雾,高斯滤波对窗口内像素加权平均抑制噪声,但会使图像模糊,在去除噪声同时需权衡图像模糊程度。图像分割图像分割的概念图像分割是将图像划分为不同区域或对象,使每个区域具有特定语义或特征,如将一张风景照中的天空、树木、建筑等分开。图像分割的技术原理通常涉及图像预处理,去除噪声等;特征提取,如边缘、纹理等;像素分类,依据特征判断像素归属;区域合并,修正不合理分割,得到准确结果。在医学影像分析中的应用在医学影像分析中,图像分割可识别和定位病变区域,如肺部CT扫描中准确识别肺结节、肺血管,辅助医生诊断疾病。在自动驾驶系统中的应用自动驾驶系统中,图像分割技术分割道路图像中的道路、车辆、行人等元素,帮助系统理解环境,做出驾驶决策。计算机视觉应用05目标识别目标分类与识别的概念目标分类是将图像中的目标分配到预定义类别,涉及特征提取与分类器训练。目标识别则是确定图像中是否存在特定目标,包含检测与验证步骤。手机相册人物识别应用案例智能手机借助人工智能算法分析照片人物面部特征,与面部数据库比对,实现人物识别,自动打标签,方便相册管理与检索。目标分类与识别的关系目标分类是目标识别的子过程,目标识别需先检测再分类,两者都依赖图像特征提取和深度学习模型,但目标识别更复杂,需兼顾检测与分类任务。实际应用领域目标识别和分类广泛应用于人脸和指纹识别、地形勘察、B超图像识别、智能家居监测等领域,助力身份验证、地质研究、医疗诊断和家居智能化。场景文字识别01与传统OCR技术的对比传统OCR主要针对纸上打印字符,将其转换为文本。场景文字识别专注自然环境下的文字识别,受光照、角度、遮挡等影响,识别难度更大。02停车场车牌自动识别案例停车场入口摄像头捕捉车牌图像,管理系统运用场景文字识别算法,处理车牌颜色、亮度等变化,准确识别车牌号码,实现自动计费与车辆管理。03技术流程差异传统OCR技术流程含图像预处理、版面划分等;深度学习OCR技术流程包括输入图像、深度学习文字区域检测等。场景文字识别技术更复杂,需应对自然场景的多样性与可变性。04应用领域场景文字识别在智能交通(如车牌、交通标志识别)、零售业(商品标签识别)、移动应用(图像文本提取)等领域发挥重要作用,提升各行业效率。目标测量01目标测量的概念目标测量指运用计算机视觉技术量化和确定图像中目标物体的几何属性,从二维图像数据提取三维世界信息。02可量化的几何属性可量化的几何属性包括尺寸测量(如长度、宽度、高度)、形状测量(识别和重建轮廓或表面形状)、位置测量(确定在图像和空间中的位置)、姿态测量(确定方向和倾斜角度)、运动测量(分析速度和加速度)。03医学影像中的应用在医学影像分析中,计算机视觉算法分析CT图像,识别肺部及病灶区域,分割后计算病灶尺寸,为医生诊断提供关键信息。04在工业自动化和自动驾驶中的应用在工业自动化中,用于危险或人工视觉难满足要求的场合进行精密测量;在自动驾驶中,实现车辆对周围环境速度和距离的精确测量,保障行车安全。目标跟踪目标跟踪的概念目标跟踪是在视频序列中实时识别和定位特定目标,持续监测目标在视频中的位置和状态。目标跟踪的类型目标跟踪分为单目标跟踪,适用于简单场景;多目标跟踪,需解决目标间相互干扰和遮挡问题,适用于复杂场景。体育比赛运动员跟踪应用案例大型足球比赛运用目标跟踪技术,识别并跟踪运动员,收集跑动距离、速度、射门次数等数据,为教练战术安排和观众观赛提供支持。应用领域目标跟踪在视频监控(如可疑人员轨迹重建)、自动驾驶(获取目标状态信息)、体育赛事转播(提供精彩视角和分析)、人机智能交互(根据人体动作反馈)等领域有广泛应用。开源技术与工具06计算机视觉的开源先锋:OpenCVOpenCV的定义OpenCV是一个开源的计算机视觉和机器学习软件库,自发布后在计算机视觉领域备受欢迎,广泛应用于学术、工业、商业等多领域。应用领域在学术研究中助力算法验证与模型开发;工业开发里用于产品检测、机器人视觉等;商业应用可实现安防监控、智能交通等功能。图像处理功能提供滤波、边缘检测等多种算法用于图像预处理、增强与去噪;还有SIFT、SURF等特征提取算法,用于图像匹配与物体识别。图像分割功能具备阈值分割、区域生长等算法,能将图像划分为不同区域,便于后续处理分析,如医学影像中分割器官组织。计算机视觉的开源先锋:OpenCV机器学习与深度学习功能集成SVM、决策树等算法用于图像分类、行为分析;通过集成TensorFlow等框架,可完成复杂图像理解任务。优点开源跨平台,开发者可免费获取修改代码,方便多系统部署;功能强大,涵盖众多领域算法,节省开发精力;易于学习,文档示例丰富,支持多语言。缺点深度学习集成复杂,构建训练复杂模型功能灵活性不足,模型转换易遇兼容问题;对复杂场景适应性有限,极端条件下传统算法易失效;更新速度较慢,新技术集成滞后。实时目标检测的革新者:YOLO自动驾驶领域能实时检测路面行人、车辆、交通标志等,为自动驾驶车辆决策系统提供关键信息,保障行车安全。视频监控领域可快速检测视频中的人、车辆等物体,实现特定区域实时安全监控,如商场、街道的安防监控。机器人视觉领域助力机器人实时检测环境物体,实现导航、目标抓取等操作,如工业机器人对零件的抓取。医疗图像分析领域可检测病灶或器官,辅助医生诊断治疗,如在肺部X光片中检测结节。实时目标检测的革新者:YOLO无人机应用领域实时检测周边环境物体,助力无人机完成导航和避障任务,如测绘无人机飞行时躲避障碍物。检测速度快仅需对图像进行一次前向传播,就能同步预测边界框与类别概率,满足实时性要求高的场景。准确率出色尤其在后续版本中,对多种类别物体的识别愈发精准,能有效识别不同目标。多对象检测能力可同时检测多个对象,区别于单对象检测方法,应用范围更广,如人群场景中的多目标检测。谢谢观看人工智能通识基础自然语言处理人工智能通识基础1.自然语言处理概述2.自然语言处理的原理3.自然语言处理的方法4.自然语言处理应用5.语言模型目录Contents自然语言处理概述011.1自然语言处理概念自然语言处理(NaturalLanguageProcessing,NLP)是计算机科学领域以及人工智能领域的一个重要的研究方向。自然语言处理指的是利用电子计算机等工具对人类特有的语言信息(包括口语信息和文字信息)进行自动的计算处理,是机器语言和人类语言沟通的桥梁,可以用于实现人机交流的目的。1.2自然语言处理发展历史自然语言处理的原理02案例导入假如你正在开车,不方便用手操作手机,于是你对手机说:“嘿,Siri,明天北京的天气怎么样?”那么手机是如何理解你的语音指令,并给出准确的天气信息的呢?这就涉及到了自然语言处理技术。语音助手首先需要将你的语音信号转换成文字,然后通过自然语言处理技术理解这些文字的语义,识别出你想要查询的是“明天北京的天气”,最后再从数据库中获取相关信息并以语音的形式回答你。这个过程展示了自然语言处理在语音交互中的重要作用,接下来我们将详细讲解自然语言处理的相关知识。2.1自然语言处理的三个层面自然语言处理中的句子级别的分析技术,可以大致分为词法分析、句法分析、语义分析三个层面。2.1词法分析第一层面的词法分析,主要包括汉语分词和词性标注、命名实体识别三部分。和英文等语言不同,汉语之间没有明显的空格标记,文本中的句子以字串的形式出现。因此,汉语自然语言处理的首要工作就是要将输入的字串切分为单独的词语,然后就可以在此基础上进行其他分析,这一步骤称为分词(WordSegmentation)。例句:新时代,我们要有新作为,为实现中华民族伟大复兴的中国梦而努力。分词后词法单元序列:["新","时代",",","我们","要","有","新","作为",",","为","实现","中华","民族","伟大","复兴","的","中国","梦","而","努力","。"]。2.1词法分析除了分词,词性标注也属于词法分析的一部分。给定一个分好词的句子,词性标注的目的在于为每一个词赋予一个词性,这里的词性指名词、单词、形容词、副词等,这个过程称为词性标注(Part-Of-Speechtagging,POStagging)。例句:一带一路不仅带来了经济合作的机会,还促进了文化交流。词性标注结果:一带一路/专有名词不仅/副词带来/动词了/助词经济/名词合作/动词的/助词机会/名词,/标点符号还/副词促进/动词了/助词文化/名词交流/动词。/标点符号2.1词法分析在词性标注后,通常还会进行命名实体识别(NamedEntitiesRecognition,NER),其目的在于识别语料中人名、地名、组织机构名等命名实体。文本内容:在一个遥远的星球——蓝月星上,2045年7月23日,探险家艾琳在蔚蓝学院的礼堂内,向一群充满好奇的少年们讲述着她的星际旅行故事。她描述了如何在星辰湾与智慧生物“光语者”进行友好交流,并展示了从那里带回的奇异宝石。一个月后,8月30日,艾琳带领这群少年乘坐“星际追梦者”号飞船,前往位于蓝月星另一端的迷雾森林,寻找传说中的时间之泉。在这次探险中,他们不仅与蓝月星的自然保护组织“绿野联盟”紧密合作,还意外地得到了古老文明“月影族”遗留的技术援助。这段经历不仅让少年们对宇宙有了更深的认识,也让他们明白了团结与勇气的价值。实体类信息提取:人名:艾琳地名:蓝月星、蔚蓝学院、星辰湾、迷雾森林日期:2045年7月23日、8月30日机构名:绿野联盟、月影族、星际追梦者号2.2句法分析第二个层面的句法分析,指对输入的文本句子进行分析,最终得到句子的句法结构的处理过程。对句法结构进行分析,一方面是语言理解的自身需求,句法分析是语言理解的重要一环,另一方面也为其它自然语言处理任务提供支持。根据句法结构的表示形式不同,最常见的句法分析任务可以分为以下两种:2.2句法分析(1)短语结构句法分析,该任务也被称作成分句法分析(ConstituentSyntacticParsing),作用是识别出句子中的短语结构以及短语之间的层次句法关系;2.2句法分析(2)依存句法分析(DependencySyntacticParsing),作用是识别句子中词汇与词汇之间的相互依存关系;2.3语义分析自然语言处理的第三个层面是语义分析(SemanticParsing)。语义分析的最终目的是理解句子表达的真实语义。语义分析涵盖了多个层面,包括语义依存分析、语义角色标注、指代消解、上下文推理、语义文本相似度、情感分析等,以更深层次地理解语言表达。2.3语义分析语义依存分析旨在分析句子中各个语言单位之间基于事实或逻辑的语义关联,并将这些语义关联以依存结构的形式呈现出来。语义依存分析的目标是跨越句子表层的句法结构束缚,直接获取深层的语义信息。2.3语义分析语义角色标注旨在分析句子中谓词(通常是动词)与论元(如施事、受事、时间、地点等)之间的关系,并对这些关系进行标注。简单来说,它是对句子中的谓语以及谓语的各个论元进行标注的过程,目的是揭示句子中的深层语义信息。2.3语义分析指代消解,涉及确定文本中两个对象之间的关系,即定义一个对象指代上下文中另一个对象的条件。在语言学中,把一个语言单位指向另一个与之存在特殊语义关联的语言单位的过程称为指代,前者称为指代语,后者称为先行词。2.3语义分析语义文本相似度是指在对两个或多个文本进行比较时,基于文本中的词汇、短语和句子的语义关系计算它们之间的相似程度来衡量其语义上的一致性或相似性。自然语言处理的方法033.1基于规则的方法基于规则的自然语言处理方法的主要思想是通过词汇、形式文法等制定的规则引入语言学知识,从而完成相应的自然语言处理任务。这些规则主要依赖于语言学家的知识和手工构建,包括语法规则、模板匹配以及文本转换等,用于指导系统如何理解和生成自然语言。3.2基于机器学习的方法在自然语言处理领域,基于机器学习的算法多数倾向于采用有监督分类方法,它们巧妙地将复杂的自然语言处理任务简化为一系列分类问题。这一转化过程的核心在于,针对特定任务构建出精准的特征表示体系,并且搜集并整理出规模庞大的已标注语料库。借助这些精心准备的数据,模型得以进行深入的训练与学习,从而实现对自然语言的有效理解和处理。3.3基于大模型的方法NLP大模型是指通过大规模预训练和自监督学习技术构建的深度学习模型,旨在提高计算机对自然语言的理解和生成能力。这类模型通常具有数以亿计的参数,能够处理复杂的语言任务。其起源可以追溯到2017年,Google发布了Transformer模型,该模型为后续的NLP大模型发展奠定了基础。自然语言处理应用044.1机器翻译机器翻译是利用计算机技术实现从一种自然语言到另一种自然语言的自动翻译过程。早在20世纪40年代,人们就开始尝试使用计算机进行语言翻译。4.1.1基于规则的机器翻译基于规则的机器翻译依赖于语言学家制定规则,这些规则通常包括词汇、语法和语义等方面的知识,用于将源语言文本转换为目标语言文本。刚开始学习英语和中文之间的翻译的时候。需要学习大量的词汇和语法规则,才能准确地将一种语言的句子转换成另一种语言。为了翻译“今天天气很好”这句话,学习中文到英文的基本词汇对应关系,比如“今天”对应"today",“天气”对应"weather",“好”对应"nice"。掌握了一些基本的语法规则,比如中文的时间状语通常放在句首,形容词短语放在名词之前,这些词汇组合起来,得到英文翻译:"Today,theweatherissonice."4.1.2基于统计的机器翻译统计机器翻译则是通过分析大量的双语文本数据,通过概率统计方法学习语言之间的转换规则,从而实现自动翻译。基于统计的方法学习同
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年郴州市汝城县三年级数学第二学期期末达标检测试题(含答案)
- 基础审计练习题及答案解析
- 2026主任医师(正高)-耳鼻咽喉科学(正高)027历年题库含答案详解
- 2025年辽阳县数学四年级下学期期末教学质量检测试题含解析
- 颈部解剖实战试题及详尽答案
- 中南大学无机化学试卷及答案
- 电工转正试题及答案解析
- 2026年建筑管理《工程造价》真题及答案解析
- 2025年家长学校比武笔试真题及答案
- 2026年C++开发招聘题目及答案
- 歼20科普教学课件
- 2025年企业合规师中级考试真题试卷(含答案)
- 10千伏配电电杆标准化设计方案(2023版)
- 子虚赋课件教学课件
- 《经济思想史》课件(共四篇)
- 2025初中英语思维导图
- 水利水电工程移民信息管理系统技术导则
- (完整版)水电、风电效益测算分析表
- 盒马鲜生述职升职报告
- 剑桥英语三年级下册单词表
- 公共营养师基础知识
评论
0/150
提交评论