大学人工智能通识基础 课件 模块1、2:初识人工智能、人工智能如何看懂世界_第1页
大学人工智能通识基础 课件 模块1、2:初识人工智能、人工智能如何看懂世界_第2页
大学人工智能通识基础 课件 模块1、2:初识人工智能、人工智能如何看懂世界_第3页
大学人工智能通识基础 课件 模块1、2:初识人工智能、人工智能如何看懂世界_第4页
大学人工智能通识基础 课件 模块1、2:初识人工智能、人工智能如何看懂世界_第5页
已阅读5页,还剩110页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

人工智能通识课目录人工智能的发展历程主题一人工智能的相关知识主题二人工智能的常见应用场景主题三人工智能的未来发展趋势主题四人工智能的挑战与争议主题五发展历程相关知识人工智能的发展历程主题一(一)人工智能的概念(二)人工智能发展史(三)中国人工智能发展(一)人工智能的概念人工智能是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新技术学科。人工智能是计算机学科的一个分支,它通过算法和系统赋予机器“智能”,使其具备学习、推理、感知、规划、决策甚至创造的能力,从而完成通常需要人类智力才能完成的任务。何为智能:认知,识别,推理,解决问题,学习等内在而天然的才能(二)人工智能发展史初创时期(20世纪30-50年代)1950年,艾伦·麦席恩·图灵发表了一篇划时代的论文,这也为他正式获得了“人工智能之父”这一桂冠。图灵提出了一个测试方法,这个方法就是通常说的“图灵测试”。测试的具体形式采取问与答的模式,观察者通过打字机与两个被测试对象(一人类一机器)通话,观察者不断提出问题,通过被测试对象的回答来辨别其是人还是机器,如果机器使30%以上的观察者对其身份产生了误判,那么这个机器就可以被认定为具备智能。图灵测试为人工智能的概念与方向做出了进一步的解释与分析,也为人工智能做出了基本的标准。为纪念图灵对计算机科学和人工智能领域的贡献,美国计算机协会(ACM)于1966年设立了计算机奖项“A.M.图灵奖(ACM

A.MTuringAward”。(二)人工智能发展史人工智能发展史中里程碑式会议--在美国达特茅斯学院召开的达特茅斯会议,又名达特茅斯夏季人工智能研究计划。达特茅斯会议的主题是“用机器来模仿人类学习以及其他方面的智能”。在这个会议上人工智能(ArtificialIntelligence)这一概念被正式使用和广泛接受,由此1956年被普遍称为人工智能元年。初创时期(20世纪30-50年代)(二)人工智能发展史专家系统(解决特定领域问题的智能系统)形成阶段(20世纪50-80年代)----符号主义模式识别(第一个机器学习程序)Dendral–化学分析系统(二)人工智能发展史发展阶段(20世纪80-90年代)--标志性事件北京时间1997年5月12日凌晨4点50分,国际象棋世界冠军卡斯帕罗夫对“深蓝”的人机大战落下帷幕,“深蓝”以3.5:2.5的总比分战胜卡斯帕罗夫,这一事件标志着人工智能在特定任务上超越了人类。

超级计算机“深蓝”正在下棋的卡斯帕罗夫(二)人工智能发展史平稳发展期(20世纪90年代—2011年)四足机器人:波士顿机械狗人工智能程序Waston在智力问答中击败人类(二)人工智能发展史走向新的繁荣(2012年-至今)AlphaGo战胜围棋世界冠军李世石2016年,Google人工智能AlphaGo与围棋世界冠军李世石的人机大战落下了帷幕。在经过长达5个小时的搏杀后,最终李世石与AlphaGo比分定格在1:4,以李世石认输结束。这一次的人机对弈让人工智能正式被世人所熟知更新后的AlphaGo(Zero)(二)人工智能发展史走向新的繁荣(2012年-至今)2022年OpenAI推出人工智能聊天机器人程序ChatGPT,引发世界关注2025年中国自主研发的DeepSeek-V3在开源模型中位列榜首,与世界上最先进的闭源模型不分伯仲。(三)中国人工智能发展“东数西算”工程北斗卫星大疆无人机物流机器人智慧交通系统deepseek目录人工智能的发展历程主题一人工智能的相关知识主题二人工智能的常见应用场景主题三人工智能的未来发展趋势主题四人工智能的挑战与争议主题五相关内容(一)人工智能的学派(二)人工智能的技术(三)人工智能的形态(四)人工智能的体系相关知识人工智能的相关知识主题二(一)人工智能的学派符号主义---机器拟人心---心智派连接主义---机器拟人脑---结构派行为主义---机器拟人身---行动派人工智能三大学派(一)人工智能的学派学派比较方法学习模式优势不足符号主义用规则教与人类逻辑推理相似,解释性强难以构建完备的知识规则库连接主义用数据学直接从数据中学以深度学习为例:依赖于数据、解释性不强行为主义感知-行动智能取决于感知和行为,取决于对外界复杂环境的适应;重视结果,实用侧重于应用技术,理论基础薄弱数据→知识→能力,能力增强是最终目标三种学习方法的综合利用值得关注!(二)人工智能的技术技术分类人工智能方法众多,但当前落地应用的人工智能主流技术主要是机器学习(特别是基于神经网络的深度学习)人工智能专家系统进化计算机器学习模糊逻辑知识表示......统计学习神经网络概率图......技术方法人工智能监督学习无监督学习半监督学习强化学习训练(学习方式)(二)人工智能的技术机器学习广义的机器学习:通过计算机程序从观测数据(样本)中寻找规律(模型),并利用学习到的规律(模型)对末知数据进行预测,包含神经网络、深度学习等。传统机器学习:除深度学习之外的机器学习,需要人工进行特征工程。机器学习主要研究如何使计算机从给定的数据中学习规律,即从观测数据(样本)中寻找规律,并利用学习到的规律(模型)对未知或无法观测的数据进行预测。(二)人工智能的技术机器学习的分类监督学习:从带标签(标注)的训练样本中建立一个模式(模型),并依此模式推测新的数据标签的算法,并分为回归、分类两种任务。无监督学习:在学习时并不知道其分类结果,其目的是去对原始资料进行分类,以便了解资料内部结构算法。半监督学习:利用少量标注样本和大量未标注样本进行机器学习,利用数据分布上的模型假设,建立学习器对未标签样本进行标签。强化学习:强化学习的学习方式是在获得样例过程中进行探索性学习,在获得样例之后根据环境反馈的奖赏和状态更新自己的模型,利用更新后的模型来指导下一步的行动,下一步的行动获得奖赏反馈之后再更新模型。(三)人工智能的形态人工智能的三种形态人类智能水平(四)人工智能的体系人工智能的技术框架技术名称开发公司特点适用场景TensorFlowGoogle支持深度学习、机器学习、强化学习等多种任务;强大的分布式计算能力,适合大规模数据和训练;提供高层API(如Keras)和低层API(如TensorFlowCore),灵活性高;丰富的社区支持和文档资源。大规模深度学习模型训练与推理、生产环境的部署与服务。PyTorchFacebook强大的动态计算图支持,易于调试;与Python集成紧密,支持原生的Python数据结构(如NumPy);具有深度学习和计算机视觉领域的领先优势。快速原型开发和学术研究;深度学习,特别是计算机视觉、自然语言处理等领域。Keras社区专注于传统机器学习任务,如分类、回归、聚类等;提供了大量的机器学习算法和工具,涵盖了数据预处理、模型选择、评估等方面。传统机器学习任务,如线性回归、决策树、KNN、SVM等;数据处理、模型选择、模型评估。(四)人工智能的体系人工智能的技术框架:国产深度学习框架框架名称开发组织PaddlePaddle(飞桨)百度MindSpore华为MegEngine(天元)旷世Jittor(计图)清华大学…………解决基础技术的“卡脖子”问题。2017年,国务院《新一代人工智能发展规划》等关于AI顶层规划的政策中都着重提及,除了加大应用层技术落地,更希望业界和学界深入AI底层技术研发......目录人工智能的发展历程主题一人工智能的相关知识主题二人工智能的常见应用场景主题三人工智能的未来发展趋势主题四人工智能的挑战与争议主题五课堂思考思考:随着人工智能理论和技术的日益成熟,人工智能与传统行业的融合不断加深,人工智能技术的快速发展正在深刻改变各行各业的运作方式。人工智能应用领域包括计算机视觉、智能语音、自然语言处理、自动驾驶等,促进了社会发展和经济增长,提高了人们日常生活水平。请列举出你每天接触的人工智能?应用场景相关知识人工智能的常见应用场景主题三(一)计算机视觉(三)智能语音(四)自然语言处理(五)自动驾驶(六)AIGC技术(二)推荐系统(一)计算机视觉图像识别技术图像识别技术是利用计算机对图像进行处理、分析和理解,以识别不同模式的目标和对象的技术,核心任务是让计算机能够从图像中提取有意义的信息,并进行有针对性的分析和处理。(一)计算机视觉图像识别技术智能交通监控:通过对交通流量监测摄像头获取的图像进行分析,识别车辆的类型、数量、行驶速度、拥堵情况等,为交通管理部门提供数据支持,以便进行交通信号控制、路况疏导等决策。对于违规车辆通过识别车牌号码进行车辆识别与追踪,便于交通管理和违法查处。(一)计算机视觉图像识别技术智能分类与检索:在搜索引擎和相册管理应用中,用户可以通过上传图片或输入关键词来搜索相关的图像,图像识别技术能够对海量的图像数据进行自动分类和标注,提高图像搜索的准确性和效率。(一)计算机视觉图像识别技术作物生长监测:通过无人机或地面摄像头获取农田图像,计算机视觉算法分析作物的生长状况,如作物的株高、叶面积、病虫害情况等,为精准农业提供数据支持,帮助农民合理进行灌溉、施肥和病虫害防治。人脸识别技术人脸采集人脸检测预处理特征提取特征比对识别决策(一)计算机视觉人脸识别技术(FaceRecognition)是指通过计算机程序对人脸图像进行处理,从中提取人脸的特征,并将其与存储在数据库中的人脸特征进行比较,以确定人物身份的技术。(二)推荐系统推荐系统作为一种信息过滤工具,能根据用户的行为、偏好等数据,为用户提供个性化的推荐内容。能够更精准地满足用户的个性化需求,同时在隐私保护和安全性方面也将取得更大的突破。电子商务根据用户的浏览历史、购买记录、收藏偏好等,为用户推荐可能感兴趣的商品。基于商品之间的关联性,为用户推荐可以搭配使用的商品。社交媒体根据用户的社交关系、兴趣爱好、行为数据等,为用户推荐可能认识的人或有共同兴趣的用户。根据用户关注的账号、点赞、评论、分享等行为,为用户推荐相关的文章、视频、图片等内容。娱乐资讯依据用户的视频观看历史、音乐播放历史、收藏偏好、搜索记录等,为用户推荐相关的视频和音乐等。根据用户浏览新闻的类别、关键词、热点事件等行为数据,为用户推荐感兴趣的新闻和资讯内容。教育学习根据学生的学习阶段、学科偏好、学习进度等,推荐相应的教材、辅导书、在线课程、学习视频等学习资料。针对不同用户的职业规划、兴趣爱好等,推荐相关的培训课程、在线学习课程等。(三)智能语音智能语音技术智能语音技术以语音的主要特征为基础,将声音信号转为文字供计算机处理,排除冗余信息,提取关键信息,并与语音知识库进行匹配,得到文字问答结果后,将文本语言转化为声波,使终端具备“能听会说”的能力,实现声音信息在人机间的交互。(三)智能语音常用场景通过智能客服系统,用户可以通过语音与机器人进行自然对话,解决一些常见的问题或者需求。智能客服通过语音指令控制智能家居设备,实现智能化家居生活,提升生活便利性。智能语音系统可学习用户习惯,自动调整设备状态。智能家居教育类智能语音产品可以根据学生的问题,提供准确的答案和解释。可以为学生提供语音朗读、口语评测等学习辅助功能。智能教育(四)自然语言处理自然语言处理常用场景计算机能够把一种语言翻译成另一种语言。机器翻译的难点在于不同语言之间的语法、词汇、文化等差异,需要计算机能够准确地理解原文的含义,并用目标语言合理地表达出来。比如谷歌翻译、百度翻译等,能快速准确地翻译多种语言的文本。计算机能够从给定的文本中,提取出最核心的信息,生成一个简短的摘要。文本摘要有两种方法:抽取式和生成式。抽取式就是从原文中直接选取一些重要的句子作为摘要,生成式就是根据原文的内容重新生成一些句子作为摘要。计算机能够回答用户以自然语言提出的问题。三种类型:检索式、抽取式和生成式。检索式就是从预先建立好的知识库中查找与问题相关的答案;抽取式就是从给定的文本中抽取出与问题相关的片段作为答案;生成式就是根据问题和相关信息生成一个新的答案。机器翻译文本摘要问答系统(五)自动驾驶自动驾驶是汽车工程与人工智能等多领域交叉融合的前沿技术,指车辆通过车身布置的传感器,对周围环境进行感知并做出控制决策,从而实现自动驾驶。自动驾驶技术百度Apollo的L4级自动驾驶测试里程已超过1亿公里,并在2024年加速推进车内无人自动驾驶的规模化应用。特斯拉在2024年发布了FSD(全自动驾驶)V12版本,引入全新的端到端神经网络架构,实现了从感知到车辆控制的全面自动化。技术成熟度提升2024年,多个城市出台法规支持自动驾驶汽车的商业化应用,如北京和武汉分别于4月和3月实施相关条例,为L3级及以上自动驾驶汽车提供了制度规范。政策支持不仅推动了自动驾驶技术的规范化,还促进了车路协同基础设施的建设。政策支持与法规完善2024年,自动驾驶出租车和公交车的试点在多个城市落地,如北京、广州、武汉等,标志着自动驾驶技术从测试阶段迈向了规模应用。商业化应用加速(五)自动驾驶自动驾驶汽车通过摄像头、雷达等传感器,实时感知路况,识别行人、车辆等障碍物,感知准确率超95%。通过深度学习算法,优化感知模型,提升复杂环境下的感知能力。环境感知根据感知结果,自动驾驶系统实时做出决策,如加速、减速、变道,决策准确率超90%。通过模拟训练,优化决策模型,提升应对突发状况的能力。行为决策自动驾驶系统根据路况和目标位置,实时规划最优行驶轨迹,提升行驶效率和安全性。通过高精度地图和实时数据,优化轨迹规划,确保行驶顺畅。轨迹规划自动驾驶技术(六)AIGC技术AIGC(AIGeneratedContent,人工智能生成内容)是一种基于人工智能技术,通过生成对抗网络(GAN)、大型预训练模型等方法,对已有数据进行学习和模式识别,从而生成相关内容的技术。AIGC可以根据用户输入的关键词或要求自动地生成内容,无须人工编辑AIGC可以利用深度学习和强化学习等技术,不断地学习和优化内容生成策略AIGC可以自动生成各种类型的内容,例如文章、视频、图片、音乐、代码等,这样可以满足不同用户的不同需求AIGC可以利用机器学习和深度学习等技术,不断地更新和改进内容生成的模型和算法随着自然语言生成技术和AI模型的不断发展,AIGC逐渐受到大家的关注,目前已经可以自动生成图片、文字、音频、视频、3D模型和代码等。(六)AIGC技术AIGC应用:代码生成AIGC可以作为自动化代码生成和重构的工具,能够通过对现有代码库进行学习和分析,生成符合特定需求的代码,并对现有代码进行重构及优化。(六)AIGC技术AIGC应用:AIGC工具自动生成PPT输入提示词:帮我自动生成一份关于人工智能的应用场景及案例分析的PPT(六)AIGC技术常见的AIGC大模型工具目录人工智能的发展历程主题一人工智能的相关知识主题二人工智能的常见应用场景主题三人工智能的未来发展趋势主题四人工智能的挑战与争议主题五相关知识相关知识人工智能的未来发展趋势主题四(一)人工智能的技术突破(二)人工智能的应用拓展(三)人工智能的社会与政策(一)人工智能的技术突破量子计算与人工智能结合取得更多成果,利用量子计算的超强算力,使人工智能算法在处理复杂问题、大规模数据分析和优化等方面实现质的飞跃。例如在药物研发的分子结构模拟等领域,量子AI的发展为解决传统计算难以处理的复杂问题提供了新途径,推动了人工智能在更多领域的应用。量子AI进步多模态预训练大模型可处理文本、图像、音频、视频等多模态数据,实现精准感知和理解。如智能驾驶中对道路环境多维度信息的综合处理,提升安全性。以商汤的“日日新”融合大模型为例,其在图文推理、语言等各方面达到业内最优水平,展现了强大的多模态信息处理能力,为复杂任务提供更精准的解决方案。多模态预训练大模型发展小模型凭借高效、精准、低计算成本和能耗的优势,在特定任务和本地化场景中应用广泛,可针对重复性高的任务提供更具性价比的解决方案,与大模型形成互补。例如微软的Phi模型,参数量仅为140亿,却在数学竞赛、自然语言处理等多个基准测试中表现出色,甚至超越了参数量更大的Llama3.370B及OpenAI的GPT-4oMini。小模型崛起020301(二)人工智能的应用拓展智能体普及AI智能体从“增强知识”向“增强执行”转变AI智能体具备更强的自主决策与任务执行能力,将广泛应用于办公、客服、工业生产等领域,成为人们的智能助手,提升工作和生活效率。例如在办公场景中,智能体可以自动安排会议、整理文件和生成报告,提高工作效率;在客服领域,智能体能够实时解答客户问题,提供个性化的服务体验。智能体在多领域的应用智能体在工业生产中可实现自动化流程控制和质量检测,提高生产效率和产品质量;在家庭服务中,智能体能够控制智能家居设备,提供便捷的生活服务。在教育领域,智能体可以根据学生的学习进度和特点,提供个性化的学习计划和辅导,提升学习效果。智能体的未来发展随着技术的不断进步,智能体将具备更强的自然语言理解和生成能力,能够更好地与人类进行交互和协作。未来智能体将更加智能化和人性化,能够自主学习和适应不同的环境和任务,提供更加高效和便捷的服务。(三)人工智能的社会与政策立法与监管完善随着人工智能的广泛应用,各国加快人工智能立法和监管步伐,在数据隐私、算法偏见、安全责任等方面制定更详细、严格的法规和标准。例如欧盟的《人工智能法案》对人工智能系统的开发和使用提出了明确的规范,保障了公众的权益。各国加快人工智能立法和监管步伐各国在人工智能立法和监管方面加强国际合作,共同应对人工智能带来的全球性挑战。例如,国际组织和各国政府之间开展对话和协商,制定统一的人工智能治理框架和标准,促进人工智能的健康发展。立法与监管的国际合作完善的立法和监管体系将为人工智能的发展提供明确的法律依据和规范,促进人工智能的健康发展。同时,合理的立法和监管也将保障人工智能的安全、可靠和公平使用,保护消费者的权益和社会公共利益。立法与监管对人工智能发展的影响(三)人工智能的社会与政策开源创新活跃目录人工智能的发展历程主题一人工智能的相关知识主题二人工智能的常见应用场景主题三人工智能的未来发展趋势主题四人工智能的挑战与争议主题五相关知识相关知识人工智能的挑战与争议主题五(一)人工智能应用存在哪些挑战?(二)人工智能应用是否存在争议?(三)如何规范使用人工智能?引言“科学技术都是一把双刃剑”。伴随着人工智能技术的成熟和广泛应用,人与机器之间的矛盾凸显,人工智能的伦理问题引起了社会和各行各业的日益关注。人类对待AI出现了不同观点,其在科幻电影甚至传统媒体中均有体现。就业结构变化人工智能技术的发展和应用导致一些传统的、重复性高的工作岗位被自动化系统和机器人所替代,如制造业中的流水线工人、客服中心的接线员等。岗位替代与创造:新岗位的数量和对劳动力技能的要求与被替代岗位之间存在不匹配,导致部分劳动力面临失业或转行的压力。技能需求转变:随着人工智能在各个行业的渗透,对劳动力的技能要求发生了显著变化,需要具备更高的数字技能、数据分析能力、创新能力和跨学科知识的人才。010203(一)人工智能应用存在哪些挑战社会公平性影响数字鸿沟数字鸿沟加剧:进一步拉大了社会差距,例如,在一些偏远农村地区,网络覆盖不足,居民缺乏智能手机和电脑等设备,无法使用基于人工智能的在线教育、医疗和金融服务。算法偏见算法偏见与歧视:人工智能算法是基于大量的数据进行训练和学习的,如果数据本身存在偏见,那么算法可能会延续和放大这些偏见,导致在招聘、信贷、司法等领域出现不公平的决策。(一)人工智能应用存在哪些挑战(二)人工智能应用是否存在争议?电车难题是伦理学中一个经典的思想实验,描述一辆失控的电车即将撞上五个人,而你可以拉动杠杆使电车转向,撞死另一个人以拯救那五个人。这个难题引发了关于道德选择的激烈讨论,是基于结果主义还是义务论来做出决策。人工智能系统需评估不同决策可能带来的后果,如自动驾驶汽车撞上行人或转向撞上其他障碍物,对不同个体和群体的伤害程度、影响范围等都是考量因素。电车难题(二)人工智能应用是否存在争议?数据污染以化学材料研发为例,如测量仪器未校准精准,使得材料的关键属性数据,像熔点、硬度等出现偏差,输入模型后,模型就会学习到错误的材料特征与性能关联。那么在实际验证时性能将会远低于预期,导致科研资源的浪费。如果模型会被误导,在分析材料结构与性能关系时得出错误结论,使得论文的学术观点站不住脚。在人工智能论文写作领域中,给出关键字让人工智能进行写作,如果AI爬虫若算法不精、筛选有漏洞,就会抓到低质量论文。如深度学习研究,探索新型神经网络架构优化策略时,网络中“学术垃圾”多,像部分论文实验草率、数据采集不严谨、分析错误,被爬虫抓取后,人工智能依此给出的架构改进、性能预测结果偏差大,导致写作质量低。01科学研究02论文写作(二)人工智能应用是否存在争议?自主武器是否该被使用在传统战争中,人类士兵在做出攻击决策时,可能会有一定的时间来考虑目标的性质、可能的附带伤害等伦理因素,而自主武器系统可能在瞬间做出决策,没有足够的时间进行全面的伦理评估。例如,一个自主导弹防御系统在面对来袭导弹时,可能需要在极短的时间内决定是否拦截以及拦截的方式,而无法像人类指挥官那样充分考虑拦截可能对周边地区造成的影响。(三)如何规范使用人工智能电气与电子工程师协会(IEEE)发布《人工智能设计的伦理准则》,聚焦算法公平、数据责任、透明度等,倡导开发透明可解释算法,规范数据生命周期管理。国际商用机器公司(IBM)推出《信任与透明度原则》,强调向用户说明AI决策逻辑,保障数据隐私,推动企业AI应用合规,为技术人员提供实操指引。这些行业指南为全球技术人员和企业提供了伦理规范的参考,促进了人工智能技术的健康发展和广泛应用。人工智能规范准则人工智能规范准则包括:公平公正、透明可解释、隐私保护、安全可靠、责任划分。人工智能的伦理问题仍需人类的统一意见和行动,需要政府统一制定政策并推进执行。2017年7月,中国国务院发布《新一代人工智能发展规划》,关于人工智能伦理和法律制定了三步走的战略目标:到2020年,部分领域的人工智能伦理规范和政策法规初步建立;到2025年,初步建立人工智能法律法规、伦理规范和政策体系;到2030年,建成更加完善的人工智能法律法规、伦理规范和政策体系。针对人工智能伦理问题的相关解决途径(三)如何规范使用人工智能THANKS人工智能通识课模块二:

人工智能如何看懂世界目录第4章:计算机视觉基础理论与应用一第5章:图像表示与处理技术基础二第6章:图像识别与目标检测技术三第7章:生成式人工智能图像生成技术四.生成式AI与图像生成(AIGC)定义·任务·发展历程图像数学表示·预处理·CNN架构行业案例·目标检测

生成式AIo授课目标(一)理解计算机视觉的基本概念和原理(二)掌握卷积神经网络(CNN)的基础知识(三)了解图像识别和物体检测的技术(四)了解生成式人工智能(AIGC)在图像生成中的应用第4章

计算机视觉基础理论与应用计算机视觉(ComputerVision,CV)

是人工智能的一个分支,旨在使计算机能够从图像或视频中“理解”和“解释”视觉信息。结合图像处理、模式识别、机器学习等技术,模拟人类的视觉系统,使计算机能够识别、分析和理解视觉数据。4.2----计算机视觉应用领域医疗交通安防工业核心应用领域每组选择一个行业讨论AI视觉解决了什么痛点?农业零售家居娱乐4.2----计算机视觉应用领域医疗影像:AI医生的"第二双眼睛"肺结节检出率78%→92%+14%诊断时间缩短50%+效率提升核心技术•图像分割:精准识别器官与病变区域•病灶检测:自动标记异常组织位置•影像配准:多模态数据融合分析案例商汤科技肝脏CT智能分析系统基于深度学习的肝脏CT影像分析系统,可自动识别肝脏病变区域,辅助医生进行精准诊断,已在国内多家三甲医院投入使用。伦理讨论AI诊断出错,责任归谁?当AI辅助诊断出现误诊或漏诊时,责任应由医生、AI开发者还是医疗机构承担?如何建立合理的责任界定机制?4.2----计算机视觉应用领域智能安防与工业质检智能安防人脸识别:机场、车站、小区应用行为分析:奔跑、闯入、斗殴检测效果数据:安全事件发生率↓35%破案率↑40%隐私讨论人脸识别与个人隐私的边界在哪里?工业质检检测精度:0.1mm,效率提升50%以上应用场景:电子元件、汽车零部件、印刷品案例:手机玻璃盖板缺陷检测系统检测精度0.1mm效率提升↑50%+4.2----计算机视觉应用领域智慧农业与新零售智慧农业作物病虫害识别准确率92.5%传统方法准确率:65-75%应用场景杂草识别果实采摘生长监测讨论AI如何助力乡村振兴?新零售与智能家居无人超市商品识别+自动结算虚拟试衣实时体型捕捉与服装叠加智能家居手势识别、人脸门锁、异常行为检测体验分享你使用过哪些AI视觉产品?4.3----典型案例深度剖析案例解析:医疗与交通系统案例1医疗影像辅助诊断系统系统架构预处理肺实质分割结节检测良恶性判断核心技术U-Net分割FasterR-CNN检测CNN分类性能数据检出率92.3%微小结节检出率85.2%案例2智能交通监控管理系统系统架构高清摄像头边缘计算云平台核心算法YOLOv8车辆检测强化学习信号优化效果数据拥堵指数↓18.5%事故率↓27.6%

图4-9医疗影像辅助诊断系统结构示意图在医疗影像辅助诊断系统中,用于实现‘肺实质分割’任务的核心网络结构是?FasterR-CNNAYOLOv8BU-NetCMobileNetD提交单选题1分4.3----典型案例深度剖析案例解析:工业与农业系统案例3工业表面缺陷检测系统硬件配置:线阵相机+多角度光源+伺服传送检测能力:0.05mm划痕识别,99.2%准确率价值:在线100%检测,替代人工目检案例4智慧农业病虫害检测系统系统架构:APP采集云端分析专家咨询核心模型:MobileNet轻量化网络性能:92.5%准确率,3秒响应图

4

-

1

1

机器视觉表面缺陷检测系统组成及原理图4-12一种智能虫情监测系统流程示意图第5章:图像表示与处理技术基础69视觉

人类从外界获得的信息绝大部分是由视觉获取的。视觉信息量大,人类对视觉信息的利用率高,视觉功能很重要视觉--人类观察世界和认知世界的重要手段给计算机、机器人或其他智能机器赋予人类视觉功能,是人类多年以来的梦想--机器视觉5.1图像的数学表示方法像素与分辨率像素:图像的最小单位,包含颜色/亮度信息分辨率:宽度×高度如1920×1080=207万像素位深度:8位(256级)vs16位(65536级)灰度与RGB灰度图像:二维矩阵M[i][j],取值0-255RGB颜色空间:三通道矩阵,光学三原色加法混合颜色示例:红(255,0,0)绿(0,255,0)蓝(255,255,0)HSV颜色空间H(色调):0°-360°S(饱和度):0%-100%V(亮度):0%-100%优势:颜色、饱和度、亮度分离

5

-

1

图像的数学表示5.2图像预处理关键技术预处理的定位:计算机视觉任务基础步骤核心目标:优化图像质量、消除干扰、标准化输入,提升后续任务准确率与效率医学影像增强X光病灶细节,提升微小病变检出率工业检测消除传感器噪声,提高缺陷识别精度5.2.1几何变换(空间形态校正+数据增强)技术类型核心用途关键算法步骤缩放统一输入尺寸、适配显示1.确定目标尺寸与宽高比规则2.选择插值算法(双线性/最近邻)3.逐像素计算新值输出裁剪提取感兴趣区域、去除冗余背景1.确定裁剪规则(中心/随机/智能ROI)2.定位裁剪边界3.提取目标区域像素矩阵旋转/翻转校正倾斜、数据增强1.确定旋转角度/翻转方向2.计算变换矩阵映射新像素坐标3.扩展画布并填充空白区域仿射/透视变换校正畸变、图像拼接1.选取至少3组(仿射)/4组(透视)对应特征点2.计算变换矩阵3.逐像素执行变换输出仿射变换=对一张图片“平移、旋转、缩放、斜切”,但永远保持:平行线还是平行,直线还是直线5.2.2图像增强(提升视觉质量、突出特征)技术类型核心用途关键算法步骤直方图均衡化增强对比度1.计算图像灰度直方图2.计算灰度累积分布函数(CDF)3.归一化CDF并映射到0-255灰度区间输出*自适应版本:分块均衡后双线性插值消除块效应伽马校正校正非线性亮度失真1.确定伽马系数γ(γ<1提亮,γ>1压暗)2.对每个像素执行公式O=I^γ变换3.归一化像素值到0-255区间锐化(USM)增强边缘与细节1.对原图执行高斯模糊得到模糊图像2.原图减模糊图像得到高频边缘分量3.高频分量乘以增益系数叠加到原图输出5.2.3-4噪声去除+颜色空间转换噪声去除核心技术及步骤技术类型适配噪声类型关键算法步骤中值滤波椒盐噪声1.选定滤波窗口大小2.遍历像素,取邻域灰度中值替换原值双边滤波通用场景(保边去噪)1.设定空间距离与灰度相似度权重阈值2.计算邻域加权均值3.替换原像素值小波变换去噪通用场景(细节保留度高)1.小波分解为多尺度子带2.高频子带阈值处理3.小波逆变换重建图像颜色空间转换核心技术RGB转灰度按公式Gray=0.299×R+0.587×G+0.114×B合并三通道。RGB转HSV分离色调、饱和度、亮度,适配颜色分割场景。RGB转YCbCr分离亮度与色度分量,适配压缩传输场景。5.2.5形态学操作+典型预处理流水线形态学操作核心技术操作类型核心用途关键算法步骤腐蚀消除小噪声点、断开细小连接1.选定结构核(如3×3矩形核)2.取核覆盖区域的最小灰度值替换膨胀填补空洞、连接断裂区域1.选定结构核2.取核覆盖区域的最大灰度值替换开/闭运算组合操作降噪/补洞开运算:先腐蚀后膨胀(降噪保形)闭运算:先膨胀后腐蚀(补洞保形)典型预处理流水线(图像分类场景)缩放统一图像尺寸到224×224数据增强随机裁剪+随机翻转+颜色抖动标准化像素值归一化到模型要求区间演示:搜索图像增强演示视频

计算机视觉的定义是?让计算机通过图像或视频理解视觉信息仅用于医学影像分析的技术生成虚拟现实的工具

一种音频处理技术ABCD提交单选题1分图像的基本组成单位是?向量像素声波字符ABCD提交单选题1分视频的本质是?单一静态图像连续图像帧的时序组合音频信号

文本数据ABCD提交单选题1分以下哪种图像类型每个像素值仅为0或1?灰度图像彩色图像二值图像动态图像ABCD提交单选题1分RGB转灰度公式Gray=0.299R+0.587G+0.114B中,系数0.587对应G通道,其物理依据主要是:绿色在RGB色彩模型中数值范围最大A人眼视网膜中视锥细胞对绿光最敏感,亮度感知贡献最高BG通道在数字图像中噪声最少,信噪比最高C该系数由图像压缩标准(如JPEG)强制规定D提交单选题1分图像增强的常用方法包括?灰度变换和直方图均衡化图像放大和缩小删除部分像素

增加图像噪声ABCD提交单选题1分图像平滑处理的目的是?增强图像对比度去除噪声改善质量放大图像尺寸生成动态效果ABCD提交单选题1分5.3卷积神经网络(CNN)基本原理卷积神经网络(ConvolutionalNeuralNetwork,缩写CNN)是神经网络的一种特殊类型。除了包含输入层、隐藏层和输出层外,隐藏层中还包含了卷积层、池化层等特殊结构,这些特殊层的存在使得CNN能够更有效地处理具有空间或时间结构的数据大脑神经元神经网络5.3卷积神经网络(CNN)基本原理人工神经网络:输出层人工神经网络中的单个神经元人工神经网络5.3卷积神经网络(CNN)基本结构5.3卷积神经网络(CNN)基本原理---层级构成核心原理CNNvs全连接网络局部连接:每个神经元仅与局部区域连接,大幅减少参数量权值共享:同一特征图共享卷积核参数,实现平移不变性核心组件●

卷积层:提取局部特征,生成特征图●

池化层:降维压缩,增强鲁棒性●

全连接层:整合特征,完成分类决策生物启发Hubel&Wiesel的猫视觉皮层研究发现:视觉系统通过层级结构处理信息简单细胞→复杂细胞→超复杂细胞,启发了CNN的层级特征提取架构架构图示输入层卷积层激活层池化层全连接输出层[卷积→激活→池化]×N可重复堆叠原始图像特征图压缩特征抽象特征分类结果高层中层底层底层特征边缘、纹理、颜色中层特征部件、形状、结构高层特征语义、概念、对象/video/BV1AL4y1b7er/?spm_id_from=333.337.search-card.all.click&vd_source=ab4dd9e54a3376d03adc7261ff398fd05.3卷积神经网络(CNN)基本原理---输入层它是网络的第一层,没有可学习参数(权重、偏置),只负责接收并传递数据。神经元数量=输入数据的维度(比如227×227×3的图像,输入层神经元数就是227×227×3=154,587)。代表的是高度×宽度×通道数作用:把原始数据(图像、文本、数值)转换成网络能处理的数值形式,并传递给下一层。如:图像分类→输入层是像素值(227×227×3的RGB图像)文本分类→输入层是词向量(每个词对应一个向量)房价预测→输入层是房屋特征(面积、房间数、地段等)5.3卷积神经网络(CNN)基本原理---卷积层卷积是卷积核在输入数据上滑动,对局部区域进行加权求和并生成特征映射的过程,本质是”特征检测器”,是特征提取的数学操作。5.3卷积神经网络(CNN)基本原理---池化层作用是对卷积层输出的特征图进行下采样(降维压缩),在减少参数量和计算量的同时,增强特征的鲁棒性(对小幅度平移、缩放不敏感最大池化(MaxPooling)平均池化(AveragePooling)5.3卷积神经网络(CNN)基本原理---激活+全连接层是神经网络中负责特征整合与输出映射的核心层,其核心是通过线性变换(权重矩阵乘法+偏置)+非线性激活,将输入的一维特征向量映射为符合任务需求的输出向量。5.3卷积神经网络(CNN)基本原理---输出层它是网络的最后一层,有可学习参数(权重、偏置),负责把特征映射为任务结果。神经元数量=任务的输出维度(比如1000分类→1000个神经元;回归→1个神经元)如:图像分类→输出层是1000个类别的概率(ImageNet)二分类→输出层是2个概率(猫的概率、狗的概率)房价预测→输出层是1个数值(预测的房价)CNN为什么适合处理图像?两个核心设计局部感受野局部区域聚焦灵感来源:生物视觉系统,每个神经元只响应输入图像的一小块局部区域作用:不用同时处理整张图的所有像素,专注提取局部特征(边缘、纹理→部件→整体物体)人眼看东西,每次只聚焦一小块区域权值共享同一卷积核滑动核心机制:同一个卷积核(特征检测器)在图像滑动时共享相同的权重参数参数对比:全连接1.5亿参数

vs

3×3卷积核27个参数

(大幅减少参数,降低过拟合风险)同一个"边缘检测器",在整张图的所有位置都能用

5.3卷积神经网络(CNN)基本原理

5.4经典架构发展简史,每个模型记住一个核心特点1998年2012年2014年2015年LeNet-51998发布时间:1998年CNN的开山之作,首次实现手写数字识别,奠定了「卷积+池化+全连接」的基础框架AlexNet2012发布时间:2012年深度学习革命引爆点,ImageNet竞赛冠军,首次证明深层CNN的性能远超传统方法VGGNet2014发布时间:2014年结构最规整的模型,全部用3×3小卷积核堆叠,参数少、特征提取能力强,是迁移学习的首选ResNet2015发布时间:2015年解决深层网络"学不动"的问题,引入残差连接,让网络可以训练到上百层甚至上千层

CNN训练就像学生上课学习:从准备到学知识CNN训练流程类比:学生上课学习1准备教材、习题集、考卷收集标注好的图像数据,对应"教材内容"划分为三部分:•训练集(课后练习题)•验证集(模考题)•测试集(期末考试卷)预处理:统一尺寸、归一化、数据增强,对应"整理格式、多做变式题"2给学生发空白笔记本,填初始知识给模型的权重参数设置小的随机初始值进阶技巧:用预训练模型做初始化(迁移学习)相当于先学通用知识,再学特定领域知识3批改作业的打分规则衡量模型预测结果和真实答案的差距常用损失函数:•分类任务:交叉熵损失•回归任务:均方误差损失

CNN训练就像学生上课学习:从做题到改进继续类比:学生上课学习步骤4:前向传播学生做习题,给出自己的答案输入图像从输入层开始,逐层经过卷积、激活、池化、全连接,最后得到预测结果步骤5:反向传播对照答案找错题,分析错误原因从损失值出发,用链式法则从后往前计算每个参数对最终错误的"贡献度"(梯度),知道每个参数调大还是调小能降低错误步骤6:参数更新根据错题调整自己的知识体系优化器根据梯度调整参数值,常用的Adam、SGD就像不同的"学习方法"反复迭代几千到几万次,直到模型在验证集上的表现不再提升在CNN训练流程的教育类比中,'验证集'最贴切对应以下哪一项?教材正文内容,用于系统学习基础知识A课后习题,用于巩固课堂所学知识B模拟考试题,用于阶段性检验学习效果并调整复习策略C期末考试卷,用于最终评定学生综合能力D提交单选题1分

CNN总结与我们身边的应用核心总结●

结论1:CNN是专为图像等网格数据设计的深度学习模型,核心优势是自动提取分层特征,参数少、效率高●

结论2:核心结构:输入层→卷积层→激活层→池化层→全连接层→输出层●

结论3:训练核心:通过数据→前向传播算结果→反向传播找错误→更新参数,反复迭代优化常见应用场景日常类人脸识别解锁拍照AI修图图片搜索行业类自动驾驶的环境感知医学影像的病灶自动识别工业缺陷自动检测安防视频的异常行为识别讨论如果要用CNN做一个猫狗分类器,你会怎么设计流程?"你认出照片里的是猫还是狗什么是图像识别?判断图像中目标的类别,解决「是什么」的问题技术路线对比传统方法核心逻辑预处理→专家手工设计特征→分类器分类类比老师先教你「猫有尖耳朵、长胡须」的规则,你按规则判断优劣势优势:可解释性强、计算量小劣势:依赖专家经验、复杂场景准确率低深度学习方法核心逻辑数据准备→CNN自动学习层次化特征→端到端输出类比给你看10万张猫和狗的照片,你自己总结出猫和狗的特点优劣势优势:无需人工设计特征、复杂场景准确率高劣势:需要大量标注数据、计算资源要求高

第6章图像识别

第6章图像识别--CNN是如何识别出来狗的?

图像识别完整流程与核心挑战通用7步流程1图像采集:获取原始图像→你用眼睛看到物体2预处理:灰度化、降噪、几何校正→把模糊的东西看清楚、摆正角度3特征提取:手工提特征/CNN自动提特征→你找目标的特点4特征降维:去除冗余信息→你忽略无关的背景5分类决策:判断类别→你根据特点判断「这是猫」6后处理:过滤错误结果→你发现认错了及时纠正7结果输出:输出类别和置信度→你说出「这是猫,90%把握」核心技术挑战光照/姿态变化、遮挡、背景干扰光线暗、目标歪了、被挡住了、背景太乱类内差异大/类间相似同一种东西长得不一样,不同东西长得像小样本/实时性要求没多少练习素材就考试,还要一秒钟给出答案图像识别完案例--车牌识别

目标检测:不仅知道「是什么」,还知道「在哪里」什么是目标检测?同时完成分类(是什么)和定位(在哪里),输出目标类别和边界框通俗类比在班级合照里,找到所有同学的位置,还能叫出每个人的名字

主流目标检测算法对比与选型两阶段代表:R-CNN系列R-CNN两阶段开山之作,速度慢(50s/张)FasterR-CNN引入RPN网络,精度高,精度优先场景首选CascadeR-CNN级联多阶段精修,小目标、困难样本效果更好单阶段代表YOLO系列单阶段开山之作,YOLOv8速度100FPS,工业界实时检测首选SSD多尺度特征检测,小目标效果好RetinaNet提出焦点损失,单阶段精度首次追平两阶段新兴方向Transformer类(DETR)端到端目标检测,摒弃锚框和NMS后处理无锚框检测器结构更简洁,减少超参数调优发展趋势未来发展方向,精度与速度持续优化选型规则场景类型推荐算法适用说明精度优先FasterR-CNN/CascadeR-CNN医学影像、精密工业检测等对检测精度要求极高的场景速度优先YOLO系列自动驾驶、视频监控、移动端等对实时性要求高的场景FastR-CNN

性能评估指标与优化策略精确率识别出的目标里真正对的比例适合对误检敏感场景(门禁人脸识别)召回率所有真实目标里被找出来的比例适合对漏检敏感场景(安检违禁品检测)mAP平均精度综合所有类别的精度目标检测核心精度指标FPS每秒处理帧数衡量速度数据层面数据增强半监督/自监督学习难例挖掘给学生更多更好的习题模型层面轻量化设计特征融合知识蒸馏给学生更好的学习方法部署层面量化剪枝硬件加速把厚教材压缩成知识点手册图像识别和目标检测是计算机视觉的核心技术,已广泛应用在自动驾驶、工业检测、安防、医疗影像等领域,是AI落地最成熟的方向之一。在目标检测任务中,若某系统在安检违禁品检测场景下要求尽可能不遗漏任何真实违禁物品,则应优先优化哪一指标?精确率(Precision),因其反映识别结果中真实正例的比例A召回率(Recall),因其反映所有真实正例中被成功检出的比例BmAP,因其是综合所有IoU阈值和类别的平均精度CFPS,因其衡量模型推理速度D提交单选题1分

第7章生成式AI图像技术什么是生成式AI图像技术?通俗类比

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论