版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
自然语言处理让机器“读懂”并“言说”人类语言本章学习目标01知识层面追溯NLP技术的发展脉络,系统掌握词向量构建、文本相似度计算、预训练语言模型等核心技术的底层原理,建立扎实的理论认知基础。02能力层面深入理解自然语言理解(NLU)与生成(NLG)的核心任务,熟悉文本分类、情感分析、智能创作等典型应用场景,具备将理论转化为实践的能力。03素养层面在技术探索中培养辩证思维,强化人工智能应用的伦理责任意识,树立“技术向善”的核心理念,在追求技术创新的同时兼顾人文关怀与社会价值。目标导向:以知识为基,以能力为本,以素养为魂,全面提升对NLP技术的认知与应用水平。目录CONTENTS01NLP概述探索自然语言处理的定义与起源,梳理其从规则到深度学习的发展脉络,解析核心任务与应用场景,建立对NLP的整体认知框架。02NLP基础技术深入解析词向量表示、文本相似度计算等底层技术,了解主流预训练语言模型的原理与机制,夯实NLP技术的理论基础与实践能力。03自然语言理解(NLU)聚焦让机器“读懂”语言的技术体系,从文本分类、命名实体识别到情感分析与意图识别,掌握语义理解的核心应用与落地实践。04自然语言生成(NLG)解析让机器“创作”语言的能力进阶,从传统模板填充到基于大模型的智能生成,领略AI在内容创作、对话交互中的无限可能。01.NLP概述:定义与学科交叉性核心定义自然语言处理(NLP)是一门融合计算机科学、人工智能、语言学与数学的前沿交叉学科。它聚焦于研究机器如何模拟人类语言机制,实现对自然语言的获取、分析、理解与智能生成,其终极目标是打破人机交互的语言壁垒,构建流畅、自然且高效的人机沟通桥梁。理论根基:语言学为机器处理语言提供核心理论依据,涵盖句法结构、语义分析、语用规则等,是NLP实现精准语言解析与理解的基础前提。技术载体:计算机科学提供数据处理、算法设计与算力支撑,通过高效的算法模型与高性能计算,实现海量文本数据的存储、清洗、训练与推理。应用目标:人工智能作为AI的核心分支与关键实践载体,NLP赋予机器“理解与表达”的认知能力,是实现通用人工智能(AGI)不可或缺的关键环节。NLP的两大核心任务:NLU与NLG01自然语言理解(NLU)核心:赋予机器“听懂”与“读懂”的能力不仅是识别文字符号,更要解析文本背后的真实意图、情感倾向和上下文逻辑,将非结构化的自然语言转化为机器可理解的结构化信息。🔍形象类比:就像人类的“阅读理解”与“聆听会意”02自然语言生成(NLG)核心:赋予机器“言说”与“创作”的能力基于数据逻辑生成符合人类语言习惯的文本内容,覆盖智能对话、文案写作、内容摘要等场景,实现从机器逻辑到自然表达的转化。✍️形象类比:就像人类的“口语表达”与“文字创作”💡相辅相成的闭环:NLU是NLP的“感知输入端”,负责理解人类意图;NLG是“表达输出端”,负责生成机器反馈。二者缺一不可,共同构成了人机自然交互的完整图景。02.NLP基础技术:词向量表示01传统离散表示核心思路:将词语视为孤立的原子单位,通过简单的人工编码(如索引)映射为高维、稀疏的离散向量,强调“存在与否”。特点:原理简单、即插即用,无需训练成本;但无法表达语义关联,维度随词汇量指数级增长。
典型方法:独热编码(One-Hot)、词袋模型(BoW)。02现代稠密表示核心思路:基于大规模语料库进行机器学习训练,将词语转化为低维、连续的实数向量,强调“语义相似度”。特点:能捕捉词语间的语义关联和上下文信息,计算效率高;但依赖大量高质量文本数据进行训练。
典型方法:Word2Vec、GloVe、FastText。核心目标:从“符号”到“空间”的跨越
让计算机理解语言的核心在于:使语义相近的词在向量空间中拥有更近的几何距离,从而赋予词语数学上的“相似度”度量能力。文本相似度计算:量化语义关联余弦相似度逻辑:计算两个向量夹角的余弦值,夹角越小,相似度越高。核心:不关注数值大小,只关注向量的“方向”是否一致。应用:信息检索、文章去重、推荐系统的内容匹配。欧氏距离逻辑:计算向量在多维空间中的直线距离,距离越短越相似。核心:关注向量数值本身的绝对差异,反映“数值量级”。场景:短文本相似度对比、数据聚类分析、异常值检测。核心量化目标通过算法输出一个0到1之间的数值,精准量化两段文本在语义层面的相似程度。数值越接近1,代表语义重合度越高;越接近0,则代表语义差异越大,从而实现对文本关联度的标准化度量。自然语言模型(NLM):让计算机理解上下文自然语言模型(NLM)通过学习海量文本数据构建概率分布模型,赋予计算机理解语境、推演语义与生成连贯文本的能力,是实现人机自然交互的核心技术基石。01上下文理解基于语境精准区分多义词汇,消除语义歧义,让机器读懂文字背后的真实含义,而非单纯的字符匹配。💡案例:轻松区分“吃苹果”是水果,而“苹果手机”是数码品牌,精准理解语境差异。02语义预测基于文本序列的概率分布,智能预判后续词汇或语句走向,让内容生成更贴合语境与逻辑。💡案例:输入“我每天晨跑后喝一杯”,可自动预测出“牛奶”“咖啡”等合理接续词。03文本生成根据给定的指令或主题,自主构建语法正确、逻辑连贯且符合场景需求的完整文本内容。💡案例:智能输入法的联想输入、AI写作助手生成文案,均是文本生成能力的日常应用。03.自然语言理解(NLU):核心要素NLU侧重“理解”,核心是让计算机突破表层文字,真正“读懂”语言的语义内涵、上下文语境和内在逻辑,精准捕捉文字背后的用户意图与情感倾向,是实现人机自然交互的关键技术基石。01语义理解理解词语、短语和句子的基本含义与语法结构,构建计算机的基础“词汇库”与“语法规则”。这是NLU的底层基础,确保机器能识别语言的字面信息,为进一步分析提供支撑。02语境理解结合上下文消除歧义,精准把握语言在不同场景下的真实含义。例如区分“带本笔记本记录灵感”与“带台笔记本办公”中“笔记本”的差异,让机器理解语言的场景化表达。03意图识别透过表面文字,精准捕捉用户的真实诉求与潜在目的。比如用户询问“图书馆开门了吗”,其核心意图并非简单的“是与否”,而是查询具体的开放时间与闭馆安排,实现需求的精准匹配。NLU典型应用:文本分类核心定义:按照预设的类别体系,将文本自动划分至对应类别,本质是为文本内容精准“贴标签”,实现信息的自动化归类与管理,是自然语言理解(NLU)在信息处理中的基础应用。校园通知分类自动识别通知意图,将考试安排归为“教务通知”、奖学金公告归为“学生资助”等,帮助师生快速检索关键信息,大幅提升校园信息流转与处理效率。邮件智能分拣基于文本特征精准区分垃圾邮件与正常邮件,自动拦截骚扰信息,并将邮件归类至“工作”“社交”等专属文件夹,有效净化收件箱,提升办公沟通效率。新闻主题聚类对海量新闻内容自动聚类,精准划分至“政治”“经济”“体育”等板块,助力媒体平台实现内容的智能化分发与个性化推荐,优化用户的新闻阅读体验。NLU典型应用:情感分析核心定义:利用自然语言理解技术自动识别文本中的情感倾向(积极、消极、中性),赋予计算机“读懂”人类情绪的能力,将非结构化的主观评价转化为可量化、可分析的情感数据资产。校园食堂评价分析智能解析学生对菜品口味、服务效率及就餐环境的反馈,自动归类“好评”与“差评”。帮助后勤部门快速定位卫生、价格或品类问题,针对性地优化餐饮服务,提升师生满意度。电商评论智能解析为海量商品评论自动生成情感标签,并提炼高频优缺点(如“电池耐用”“包装破损”)。既帮助商家洞察用户需求、改进产品细节,也为消费者提供直观的购物决策参考。全网舆情实时监控实时追踪社交媒体、新闻评论及论坛中的公众情绪走向,快速识别并预警负面舆情风险。助力企业或机构及时掌握舆论动态,高效制定公关策略与危机应对方案。04.自然语言生成(NLG):技术路径01基于模板的生成核心原理:采用“填空题”模式,将结构化数据直接填入人工预定义的文本模板,生成符合固定格式的标准化文案。核心优势:技术实现简单,开发成本低;生成内容语法准确、格式统一,适用于财报、通知等对规范性要求高的场景。主要局限:灵活性差,难以适配非标准化信息;生成内容高度同质化,缺乏个性化与创造性,表达较为生硬。02基于神经网络的生成核心原理:利用深度学习模型(如Transformer),通过海量语料训练学习语言规律,实现端到端的自主文本生成。核心优势:生成文本自然流畅,贴近人类表达;具备极强的创造力与多样性,能灵活应对开放、复杂的内容需求。主要局限:依赖海量数据与高额算力,成本昂贵;模型可能产生与事实不符的“幻觉”,内容的准确性与可控性需额外优化。💡总结:基于模板的方法胜在“稳定可控”,适合标准化场景;神经网络模型胜在“自然灵活”,适合创造性场景。在实际应用中,两者常结合使用,以平衡效率、质量与成本。NLG前沿应用:AI创作艺术品▲AI模仿鲁迅文风,对“熬夜玩手机”现象的独特评论创作任务:复刻经典文风指令AI以鲁迅的文字风格,针对“年轻人熬夜玩手机”这一现代现象撰写评论,不仅要求词汇句式的模仿,更需还原其独特的批判性视角。技术内核:从形似到神似模型通过学习鲁迅作品,调整词汇概率分布以高频使用“大抵”“罢”等特色虚词,并模仿其“由小见大”的批判逻辑与冷峻的叙事语调。价值反思:创造力与幻觉并存证明了AI对复杂文风的捕捉与再创作能力,同时也暴露了“AI幻觉”问题,如不合逻辑地引用经典名句,揭示了模型在逻辑严谨性上的局限。NLG前沿应用:电影评论深度解读01传统情感分析的局限传统模型仅能输出“正面/负面”的二元标签,无法解释评价背后的深层原因,难以捕捉影评中细腻的情绪差异与具体槽点,信息价值有限。02NLG生成式深度洞察大语言模型聚合全网影评,自动生成结构化分析报告。不仅区分正向(温暖治愈、反套路)与负向(节奏拖沓、角色争议)情感,更还原观众的真实感知逻辑。03双向赋能的决策价值为片方精准定位口碑争议点,提供创作优化建议;为观众提供超越简单评分的深度参考,实现从“看分数”到“懂评价”的决策升级。图示:AI生成的《挽救计划》多维情感分析报告
直观拆解了影片的正向亮点与负向争议点,实现深度洞察。NLG实用工具:机器翻译、文本摘要、对话系统01智能文本摘要基于NLG技术的智能压缩,将长篇文档凝练为逻辑清晰、重点突出的摘要。精准提取核心观点与关键结论,剔除冗余信息,让信息获取效率倍增,广泛适用于文档速读、知识归档与信息整理场景。02高质量机器翻译不仅是语言的转换,更是文化的传递。实现“信、达、雅”的专业级翻译,如将“Finger-lickinggood”巧妙译为“吮指回味,乐在其中”,兼顾语境与情感色彩,打破跨语言交流的壁垒。03智能对话与服务系统打造7×24小时智能客服,自然回复用户咨询(如物流查询),支持多语言实时交互。同时赋能人工坐席,智能推荐回复话术并自动生成通话摘要,大幅提升服务效率与用户满意度。总结:核心概念汇总01/NLP自然语言处理研究机器理解和生成人类语言的交叉学科,融合了语言学、计算机科学与人工智能技术。核心价值:打破人机交互的语言壁垒,实现智能化的自然沟通。02/词向量(WordEmbedding)将离散的词语转换为连续的低维稠密数值向量,从而量化词语的语义信息。核心价值:让计算机能够计算语义相似度,是深度学习处理文本的基础。03/NLU自然语言理解专注于让机器解析语言的深层含义,包括意图识别、实体抽取和情感分析等。核心价值:赋予机器“读懂”人类语言的能力,是智能问答的关键环节。04/NLG自然语言生成将结构化数据、知识图谱或潜在意图转化为流畅、符合语法规则的自然语言文本。核心价值:赋予机器“言说”与“创作”的能力,广泛应用于内容创作、报告生成和对话系统。05/Encoder-Decoder架构一种经典的序列到序列(Seq2Seq)深度学习模型架构,由编码器负责理解输入序列,解码器负责生成输出序列。核心价值:实现了端到端的高质量序列转换,是机器翻译、语音识别和智能对话生成的核心技术基石。计算机视觉ComputerVision--让机器看懂世界涵盖:图像分类|图像分割|图像生成|目标检测学习目标与育人目标人工智能与信息科学基础(第3版)·第9章计算机视觉学习目标(1)了解图像的本质与原理,理解数字图像的矩阵表示(2)理解计算机视觉的发展历程,掌握三个阶段的划分(3)掌握图像分割的基本概念与主要方法(4)熟悉图像生成技术的发展脉络与技术原理(5)探讨AI艺术创作中的版权归属与伦理问题(6)掌握目标检测的核心思路与技术流程(7)结合本专业说明计算机视觉的跨学科应用场景(8)培养辩证思维,理解技术的哲学与社会影响育人目标(1)科技赋能人文关怀理解CV在文化遗产保护、古籍修复等领域的应用,培养用科技服务人文的使命感(2)艺术创新与文化传承探讨AI艺术创作与文化传承的关系,理解技术创新与传统文化的融合之道(3)哲学思辨与批判认知思考技术发展的哲学意义,培养对AI伦理、版权归属等问题的批判性思维计算机视觉不仅提升生产效率,更是建设智慧社会、守护人类安全的重要支撑9.1计算机视觉概述与图像分类计算机视觉概述人工智能与信息科学基础(第3版)·第9章计算机视觉定义:让机器「看懂」世界计算机视觉(ComputerVision,CV)是研究如何让计算机从图像和视频中获取高级理解的一门科学。核心目标:使计算机拥有类似人类的视觉感知能力——从「看得见」到「看得懂」。深度学习突破:近十年来,深度学习让CV从需要人工定义特征的手工艺活,变成了能够自动学习特征的数据驱动科学。三层理解:从像素到语义看得见(底层):采集像素、边缘检测看得清(中层):纹理分析、形状识别看得懂(高层):语义理解、场景认知例如:不仅识别出图像中有一个人、有一辆车,还要理解这个人正在走向那辆车——需要从像素到语义的完整理解链条。深度学习带来的质变传统CV:研究人员为每个识别任务手工设计特征提取算法(如SIFT、HOG)——耗时费力,泛化能力差。深度学习CV:卷积神经网络(CNN)通过观看海量标注图片,自动学会从低级边缘到中级结构再到高级语义的特征层次——准确率远超传统方法。2012年AlexNet在ImageNet竞赛中的突破性胜利,标志着计算机视觉正式进入深度学习时代。9.1计算机视觉概述与图像分类图像的本质——数字矩阵人工智能与信息科学基础(第3版)·第9章计算机视觉像素(Pixel)图像的最小组成单位每个像素是一个数字,代表该点的颜色信息1920x1080=约207万个像素点每个像素由红(R)、绿(G)、蓝(B)三个分量组成每个分量取值0~255(8位),共约1677万种颜色RGB三通道示意一张彩色图片=R通道矩阵+G通道矩阵+B通道矩阵R通道:记录红色强度G通道:记录绿色强度B通道:记录蓝色强度三个矩阵的对应位置叠加,就构成了我们看到的丰富色彩。在计算机视觉的世界里,我们不是在看一张图,而是在读一个巨大的数字矩阵。计算机视觉的使命,就是从这些冰冷的数字中,解读出温暖的意义。计算机视觉=从数字矩阵中提取语义信息9.1计算机视觉概述与图像分类图像分类——任务定义人工智能与信息科学基础(第3版)·第9章计算机视觉任务定义图像分类(ImageClassification)是计算机视觉的入门课。目标:判断一张图片的主要内容属于什么类别,并给出一个准确的标签。输入:一张图片输出:类别标签+置信度分数示例:输入:一张动物的照片输出:猫(置信度:98.3%)狗(置信度:1.2%)其他(置信度:0.5%)置信度(ConfidenceScore)模型不只是输出一个类别,而是输出所有可能类别的概率分布。置信度表示模型对自己判断的把握程度:-98%:非常确定是猫-65%:可能是猫,但不太确定-35%:几乎是在乱猜实际应用中通常设置阈值(如90%),低于阈值标记为不确定,交给人工判断。这体现了AI的诚实——知道自己的局限。图像分类是计算机视觉最基础但也是最重要的任务——目标检测、图像分割等更复杂的任务都建立在分类能力之上。9.1计算机视觉概述与图像分类机器学习过程对比人工智能与信息科学基础(第3版)·第9章计算机视觉传统方法:特征工程输入图像
人工定义特征提取(SIFT/HOG等)
特征向量
分类器(SVM/决策树等)
输出类别局限:依赖专家经验,泛化能力差深度学习方法:自动学习输入图像(海量标注数据)
低层学习:边缘、纹理、颜色块
中层学习:眼睛、鼻子、耳朵等局部结构
高层学习:整体的「猫」概念
输出:猫(置信度98%)优势:无需人工设计特征,模型自己学会CNN三层次类比:低层像学笔画部首,中层像学偏旁部首组合,高层像学会完整汉字9.1计算机视觉概述与图像分类计算机视觉「三级跳」人工智能与信息科学基础(第3版)·第9章计算机视觉传统方法时代1960s-2000s核心思想:人工设计特征,手动定义边缘、角点、颜色直方图局限性:依赖专家经验,对光照、角度变化鲁棒性差突破:SIFT、HOG等手工特征算法机器学习时代2000s-2012核心思想:使用SVM等模型,结合人工特征进行分类局限性:特征提取仍需人工设计,系统瓶颈在于特征突破:大规模数据集(ImageNet)出现深度学习时代2012至今核心思想:端到端自动学习,从原始像素到语义输出局限性:需要海量数据和计算资源,黑箱可解释性挑战突破:AlexNet->ResNet->ViT,准确率超越人类9.1计算机视觉概述与图像分类图像分类跨界应用(上)——艺术流派鉴定人工智能与信息科学基础(第3版)·第9章计算机视觉艺术的「指纹」——计算机视觉如何鉴定画作?色彩分析不同画家有其标志性的配色偏好:梵高:高饱和度的黄色和蓝色莫奈:柔和的粉彩色系毕加索蓝色时期:大量使用蓝色调AI通过色彩直方图量化识别色彩DNA。笔触是画家的签名:梵高:短促、旋转、有力的厚涂修拉:细小的点彩笔触CNN可学习笔触纹理特征。构图分析与应用价值构图分析从整体布局进行风格判定:伦勃朗式布光:人物从暗背景中浮现中国山水画的散点透视vs西方焦点透视留白比例和位置特征应用价值:发现画风转变节点、辅助鉴定争议作品归属、为艺术史研究提供量化证据。从凭经验鉴定到数据驱动甄别——艺术研究的方法论正在更新。9.1计算机视觉概述与图像分类图像分类跨界应用(下)人工智能与信息科学基础(第3版)·第9章计算机视觉古籍文献自动分类研究古籍需要翻阅大量文献,数字化后仍需要大量人工分类。图像分类可以:自动识别不同字体(篆书、隶书、楷书、行书)区分写本、刻本、拓片等不同载体类型根据版面风格自动归类到史部、子部、集部等大大提升了图书馆和档案馆的数字化效率,让研究人员从繁琐的分类工作中解放出来。体育动作模式识别在体育训练中,准确的动作是预防伤病和提高成绩的关键:体操/跳水:识别运动员的关键帧(起跳、空中姿态、入水),与标准模型比对,给出量化评分举重/力量训练:实时判断动作是否标准提供可视化反馈——红色标注改进部位,让训练更科学。更多应用场景:CV技术的全行业渗透传统应用:手机相册自动分类、工业产品缺陷识别、医疗影像初筛、社交媒体内容审核。跨学科创新:文学插图风格分类、考古文物断代、音乐乐谱识别、舞蹈动作记录与分析、民族服饰图案归类。图像分类作为CV的基础任务,其应用已渗透到各行各业,并不断在人文社科领域开辟新的研究路径。9.2图像分割图像分割——像素级理解人工智能与信息科学基础(第3版)·第9章计算机视觉定义:每个像素贴标签图像分割(ImageSegmentation)是比图像分类更精细的任务。如果说图像分类是给整张图片一个标签,那么图像分割就是给图片中的每一个像素都贴上一个标签。这是对图像内容的像素级理解——精细程度堪称计算机视觉的显微镜。对比维度语义分割(Semantic)实例分割(Instance)目标识别图中所有同类物体为一个整体区分同一类别的每一个不同个体类比把所有人涂红色,所有车涂蓝色第一个人涂红色,第二个人涂蓝色应用自动驾驶场景感知、医学影像器官识别机器人抓取、精确计数、个体追踪全景分割(PanopticSegmentation)=语义分割+实例分割——既识别场景中所有东西,也区分每个物体。9.2图像分割图像分割的原理——从边界到区域人工智能与信息科学基础(第3版)·第9章计算机视觉从「魔棒」工具理解分割用过Photoshop的魔棒工具吗?点击天空,自动选中所有蓝色区域——这就是图像分割的简化版。但在CV中,分割模型要学习的远不止颜色相似性:-像素与周围邻域的关系-物体与背景之间的语义边界-即使颜色相近的不同物体也要区分核心任务:精准找到物体与背景的分界线。分割的本质:像素归属判断图像分类模型回答:这张图里有人。图像分割模型则拿着一把精确的剪刀:-沿着人的轮廓一刀一刀剪下来-把人从背景中完美分离-每个像素都获得一个归属判断结果不是「这张图里有人」,而是「这些像素属于人,那些像素属于背景」。这远比分类更精细和困难。语义分割为图像中的每一个像素赋予语义标签——这是计算机视觉从「整体理解」迈向「精细理解」的关键一步。9.2图像分割图像分割跨界应用(上)——文化遗产数字化修复人工智能与信息科学基础(第3版)·第9章计算机视觉自动识别病害对于历史悠久的壁画和油画,时间的痕迹不可避免:裂缝检测:精确分割出壁画上的裂缝走向和宽度霉斑识别:自动区分霉菌污染区域与原始颜料颜料脱落:标记出缺失区域,计算面积和位置系统帮助文物保护专家快速定位问题区域——从凭经验判断到数据驱动决策。虚拟修复流程Step1:分割病害区域(裂缝、霉斑、脱落)Step2:分离受损区域,保护完好的原始部分Step3:使用图像生成技术智能填补缺失区域Step4:专家审核虚拟修复效果Step5:在真实环境中进行物理修复优势:修复方案可预览、可比较、可回溯——修缮工作先在数字世界演练。技术赋能文化保护——敦煌壁画、意大利壁画、埃及神庙……计算机视觉正在为全人类的文化遗产保驾护航。9.2图像分割图像分割跨界应用(中)——舞台艺术智能舞美人工智能与信息科学基础(第3版)·第9章计算机视觉实时人景分离在戏剧、舞蹈等舞台表演中,图像分割实现了前所未有的互动式舞美效果:系统实时分割舞台上的表演者将表演者与背景画面精确分离只在表演者周围投射动态光影效果实现「人光合一」的视觉体验观众仿佛置身于魔幻的视觉世界——光追随舞者移动,背景随剧情变幻。虚拟特效叠加通过精确分割表演者的身体轮廓:实时为演员叠加虚拟服饰、特效妆容替换背景而不影响前景表演者在直播或录制中直接添加特效极大丰富舞台艺术的表现力人景分离技术让舞台设计从物理搭建走向数字合成——一台演出可实现多种完全不同的视觉效果。从春节联欢晚会的AR特效到沉浸式戏剧的数字舞美——图像分割让艺术与技术完美融合。9.2图像分割图像分割跨界应用(下)——地理信息系统人工智能与信息科学基础(第3版)·第9章计算机视觉土地利用分类通过分析卫星或无人机拍摄的遥感影像,图像分割可以:精确分割城市、农田、森林、水域的边界监测城市扩张趋势——钢筋水泥的面积变化评估森林砍伐和荒漠化程度为城市规划、灾害评估提供精准数据从太空看地球——每一个像素都对应地面上的真实区域。考古遗迹发现遥感影像上的细微异常可能隐藏着未发现的历史遗迹:分割出古代城墙、道路、农田的轮廓识别地表植被的异常生长模式在密林中发现玛雅金字塔的方形轮廓帮助考古学家发现不为人知的历史遗址从卫星图像中发现消失的文明——图像分割已成为考古学家的「天眼」。GIS与人文地理研究的新范式图像分割为传统人文地理和社会科学研究提供了全新量化工具:城市扩张模式对比、历史地图数字化对比、环境正义研究(绿化覆盖率与社会经济指标的相关性分析)。分割技术让地理研究从定性描述走向定量分析。9.2图像分割图像分割在人文社科中的新视角人工智能与信息科学基础(第3版)·第9章计算机视觉历史照片量化分析分割出照片中的人物、建筑、服饰等元素。通过批量分析特定历史时期的照片,研究当时的服饰风格、建筑形态和社会阶层分布——用量化方法发现历史规律。例如:通过分析晚清老照片中人物的着装和站位,可量化研究社会等级结构和礼仪规范。社交媒体图像研究分割社交媒体图片中的场景元素,帮助社会学家分析不同群体、不同地区的生活方式和文化习惯。例如:不同城市美食照片中的食物种类和呈现方式差异映射地域文化特征。旅游照片中自然景观vs人造景观的比例折射当代人的旅游偏好与审美倾向。文学插图分析对文学作品的插图进行分割,帮助研究者对比插图中人物与背景的比例关系、画面布局的演变,探讨插图如何对文学作品进行视觉诠释。这种将传统定性分析与现代定量分析相结合的方法,为文学研究打开了新的维度。9.3图像生成图像生成——从模仿到创造人工智能与信息科学基础(第3版)·第9章计算机视觉核心转变:观察者变成创作者图像生成(ImageGeneration)是计算机视觉中最具创造性和颠覆性的分支。如果说前两节技术都是让机器看懂已有图像,那么图像生成就是让机器创造全新的图像。用户从被动的观察者一跃成为主动的创作者——不需要画笔,不需要相机,只需要一个想法和一段文字描述。技术演进三阶段1.风格迁移(StyleTransfer)内容+风格=新图片2.生成对抗网络(GAN)生成器vs判别器的博弈3.扩散模型(DiffusionModel)当前最先进技术先加噪再学去噪从模仿到创造的进化论风格迁移:本质上是模仿与融合——将已有图片的风格和内容重新组合。GAN:开始展现创造力——生成器能够创造出以假乱真的全新图像。扩散模型:创造力达到新高——用户只需输入文字描述,AI就能创造出从未存在过的画面。「文生图」将人类的语言想象力直接转化为视觉现实9.3图像生成风格迁移(StyleTransfer)人工智能与信息科学基础(第3版)·第9章计算机视觉核心思想:内容+风格=新图片风格迁移是图像生成技术的早期突破。公式:内容图像+风格图像=新图像内容图像:提供「画什么」(如城市照片)风格图像:提供「怎么画」(如梵高的星空)输出:以梵高风格绘制的城市照片本质是高级的模仿与融合——将两张已有图片的内容和风格进行分离与重组。模仿与融合的艺术风格迁移不仅是技术,更是新的艺术创作方式:让普通照片穿上世界名画的外衣将中国传统水墨风格应用到现代建筑摄影将敦煌壁画的配色风格迁移到当代插画这种跨时空的视觉对话,让传统艺术在当代焕发生机。风格变成了可以借用和融合的数字资产——让每个人都可以拥有自己的「星空」。9.3图像生成生成对抗网络(GAN)人工智能与信息科学基础(第3版)·第9章计算机视觉博弈对抗的核心思想GAN由两个互相博弈的神经网络组成:生成器(Generator):从随机噪声出发,试图伪造逼真图像目标:骗过判别器判别器(Discriminator):试图区分真图和生成器造的假图目标:抓住骗子两者不断对抗、共同进步——就像伪造者和鉴定专家的猫鼠游戏。最终判别器训练到极限也无法分辨真假。GAN的里程碑意义GAN的出现是图像生成领域的里程碑:首次让AI主动创造而非被动分析生成的人脸已达到以假乱真的程度催生了大量创意应用:-老照片修复和上色-动漫角色自动生成-虚拟试衣-Deepfake(也带来伦理挑战)生成和判别的对抗训练范式影响深远。GAN训练过程(简化示意)随机噪声->生成器->假图->判别器->真或假的判断真实图片(训练数据)->反馈循环:判别器的判断误差->反向传播->更新生成器和判别器参数->两者能力同步提升9.3图像生成扩散模型(DiffusionModel)人工智能与信息科学基础(第3版)·第9章计算机视觉目前最先进的技术扩散模型是Midjourney、StableDiffusion、DALL-E等AI绘画工具背后的核心技术。基本原理——先学会破坏,再学会修复:1.前向过程(加噪):给一张清晰图片逐步添加随机噪声重复N步,最终变成完全随机噪声2.反向过程(去噪):学习如何从噪声中一步一步恢复给定文字描述作为指引方向三大主流工具Midjourney:以艺术性和美学质量著称通过Discord交互,使用简单StableDiffusion:完全开源可本地运行,社区生态丰富DALL-E:OpenAI出品,理解力强对复杂文本描述执行能力优秀三者代表了「文生图」技术的最高水平。扩散模型=从噪声中蒸馏出有序图像——如同雕塑家从石头中去除多余部分。去噪生成过程纯噪声->[去噪步骤1]->[去噪步骤2]->...->[去噪步骤N]->清晰图像每一步都根据文字描述(如「一只穿着宇航服的橘猫在太空站喝咖啡」)来决定去掉什么噪声、保留什么结构。文字描述通过文本编码器转化为向量,在整个去噪过程中指导图像生成方向。9.3图像生成AI艺术的版权争议人工智能与信息科学基础(第3版)·第9章计算机视觉版权归属:谁才是作者?AI生成的作品,版权属于谁?-输入指令的用户?——想法是创作的起点-AI模型的开发者?——模型是创作的工具-AI本身?——法律不承认AI为权利主体目前主流观点倾向于用户拥有版权。但这一问题在各国法律中仍在激烈争论。随着AI越来越自主,答案可能会改变。原创性之问:AI通过学习人类作品后创作——算原创还是高级模仿?AI没有自我意识,其创作是训练数据分布的采样。艺术新方向当AI可以轻松生成精美图像时:艺术的价值是否会被重新定义?艺术家将不只是「造图者」,更是「创意导演」。「画得好」不再是壁垒,「想得好」才是核心竞争力。最重要的能力:构思独特的创意、设计精妙的指令、对AI输出进行策展和判断。这不仅是技术问题,更是哲学、法律和艺术交汇的核心命题。培养批判性思维——在AI时代,最稀缺的是独立思考、做出价值判断的能力。9.3图像生成AI与人文创新人工智能与信息科学基础(第3版)·第9章计算机视觉AIx中华优秀传统文化图像生成技术为传统文化的传承与创新提供了全新可能:历史场景复原:根据《清明上河图》的文字描述,生成宋代街市的生动画面非遗纹样创新:学习青铜器、陶瓷上的传统纹样,生成符合当代审美的新设计诗词可视化:将「大漠孤烟直,长河落日圆」转化为视觉画面传统服饰再现:根据文献记载复原古代服饰的样式和色彩古韵新生——让传统文化以年轻人喜爱的视觉形式活起来。科技成为文化创新引擎AI不是要取代人类艺术家,而是成为创意的催化剂:艺术家:快速将脑海概念转化为视觉草稿舞台设计:根据剧本主题生成舞台效果方案时装设计:输入「赛博朋克x唐装」生成创意建筑可视化:根据典籍描述复原古代建筑AI负责快速试错,人类负责最终判断——技术降低了创意实现成本,让更多人参与文化创造。科技赋能文化自信——用现代技术讲述中国故事。让敦煌壁画中的飞天舞起来,让《山海经》中的神兽走出来——AI正在成为连接古今的桥梁,在传承中华优秀传统文化中发挥不可替代的作用。9.3图像生成哲学思辨——机器是否有「灵光」?人工智能与信息科学基础(第3版)·第9章计算机视觉本雅明的「灵光」概念德国哲学家瓦尔特·本雅明(WalterBenjamin)在《机械复制时代的艺术作品》中提出:传统艺术作品拥有一种「灵光」(Aura)——-独一无二的存在性-在特定时空中的此时此地感-与观者之间不可替代的精神联系机械复制(摄影、印刷)消解了这种灵光。那么AI生成呢?——它连原作的概念都取消了。AI时代的灵光之问AI生成的作品,有「灵光」吗?正方:没有。AI作品可无限复制,没有原作概念,缺少人类创作者的情感投射和生命体验。反方:有。当用户输入一个独特的、带有个人记忆的指令时(如「画一幅我记忆中祖母的老厨房」),生成结果承载了用户的情感——灵光在指令中。这没有标准答案,重要的是思考的过程。培养批判性思维:在智能浪潮中保持清醒在AI时代,最稀缺的不是会用工具的人,而是能独立思考的人:不盲从算法推荐,不迷信AI输出,保持对技术的清醒认知——技术能做什么不等于技术应该做什么。最重要的不是答案,而是提出正确问题的能力——这才是教育的真谛。9.4目标检测目标检测——是什么?在哪里?人工智能与信息科学基础(第3版)·第9章计算机视觉定义与核心输出目标检测(ObjectDetection)同时回答两个问题:1.图像中有什么?(分类)2.它们在哪里?(定位)核心输出:边界框(BoundingBox)模型不仅要识别出图像中所有感兴趣物体(人、车、红绿灯……),还要用矩形框将每个物体精确框选出来,标明其在图像中的具体位置。对比维度图像分类目标检测核心目标识别图片中主要有什么识别所有物体并标注位置输出一个标签(如猫)多个标签+多个边界框复杂度较低,只需关注整体较高,同时处理分类和定位应用相册分类、内容审核自动驾驶、安防监控、工业质检分类+定位=检测——目标检测是计算机视觉从认知走向行动的关键技术。9.4目标检测目标检测原理——三步流程人工智能与信息科学基础(第3版)·第9章计算机视觉1扫描——生成候选框早期方法:用不同大小的窗口对图片进行地毯式扫描,生成成千上万个候选区域。现代方法:预设锚框(AnchorBox),在关键位置投放模板,快速生成更精准的候选框。就像侦探拿着各种大小的取景框在图片上寻找可疑目标。2预测——分类+微调对每个候选框进行两项预测:-内容分类:框里是什么?(人?车?背景?)-位置微调:框的位置和大小需要如何调整才能更精确?如果模型不太确定,它会微调框的位置和大小,使其更贴合物体的实际边界。3筛选——非极大值抑制(NMS)同一物体可能被多个重叠框选中。NMS的作用:-在重叠框中只保留置信度最高的那个-抑制与其重叠度过高的其他框-确保每个物体最终只对应一个最准确的框一个物体一个框——检测结果简洁清晰。9
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 器官移植病人的心理特点与心理护理
- 中医妇产科学:经行乳房胀痛
- 运动康复师的职业技能
- 心理教育与心理护理
- 线上蛋制品加工质量管理体系协议
- JJF(苏) 321-2026 转矩标定器校准规范
- 桥梁桩基防水施工工艺
- 2026安全培训试题带答案
- 中药注射液临床使用基本原则
- 涂布机项目可行性研究报告
- 服装企业裁剪车间及缝纫车间防火台账
- 常用办公设备使用与维护(第2版)713
- 2026年全国普通话水平测试10套真题(含答案及评分要点)
- 糖尿病视网膜病变手术的时机选择与并发症
- 2026年考试题清算结算业务流程与规范
- 《听赏 歌唱祖国》课件
- 中建四局《高洁净芯片厂房项目技术要点交流汇报》(可编辑)
- 辽宁冶金职业技术学院《应急管理与危机干预》2025-2026学年第一学期期末试卷
- T-SATCM 0005-2025 针灸治疗糖尿病周围神经病变专家共识
- 生产安全事故应急救援预案演练计划
- 《煤矿安全生产化标准化管理体系基本要求及评分方法》采掘部分
评论
0/150
提交评论