人工智能通识导论(理论篇)课件 第5章-让机器读懂世界:自然语言处理_第1页
人工智能通识导论(理论篇)课件 第5章-让机器读懂世界:自然语言处理_第2页
人工智能通识导论(理论篇)课件 第5章-让机器读懂世界:自然语言处理_第3页
人工智能通识导论(理论篇)课件 第5章-让机器读懂世界:自然语言处理_第4页
人工智能通识导论(理论篇)课件 第5章-让机器读懂世界:自然语言处理_第5页
已阅读5页,还剩22页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第5章让机器读懂世界自然语言处理1目录Introduction0101自然语言处理概述0303案例应用:古诗词情感分析0202自然语言处理技术什么是NLP自然语言处理概述ChatGPT-4o实时视频通话什么是NLP自然语言处理概述ChatGPT视频解方程什么是NLP自然语言处理概述定义:使计算机能理解、处理、生成人类语言的技术目标:实现自然的人机交互示例:智能音箱理解复杂指令、搜索引擎理解查询意图NLP的核心任务:文本解析自然语言处理概述拆分句子结构中文句子分词结果英文句子分割结果“他吃苹果”他/吃/苹果“Heeatsapples”He/eats/apples“我们参观了故宫博物院”我们/参观/了/故宫博物院“WevisitedthePalaceMuseum”We/visited/the/Palace/MuseumNLP的核心任务:情感分析自然语言处理概述判断文本情绪示例:“这家餐厅服务太差了!”→负面;“中了彩票”→超级积极NLP的核心任务:机器翻译自然语言处理概述跨语言转换示例,翻译“雨后春笋”早期翻译:bambooshootsafterrain现代翻译:emergeinlargenumbersNLP的核心任务:文本生成自然语言处理概述创作内容示例:写一首关于秋天的诗写一段故事开头生成一段能运行的代码NLP的发展历程自然语言处理概述阶段1-基于规则的方法方法:关键词匹配、正则表达式、模糊匹配问题:规则复杂且矛盾无法处理多义词和上下文计算复杂度高NLP的发展历程自然语言处理概述阶段2-基于统计的方法核心思想:从数据中学习概率模型,“概率越高,句子越合理”示例:“我吃苹果”比“苹果吃我”概率高代表方法:TF-IDF:词重要性评估BOW:词袋模型(词语在词表中的出现频率但忽略顺序)LDA:主题模型(无监督聚类,文档词语组合属于哪个主题)优点:可解释性强、适合简单任务缺点:忽略词序、无法处理语义变化NLP的发展历程自然语言处理概述阶段3–深度学习方法词向量与词嵌入:Word2Vec(2013)、GloVe(2014),解决静态词向量局限。(无法反映词语的多义性)序列建模:从RNN/LSTM到Transformer(2017,自注意力机制,并行处理优势)。预训练模型:BERT(双向Transformer编码器、双向理解)、GPT(文本生成),实现“一次训练,多任务复用”。典型应用场景自然语言处理概述智能语音助手:问答、播放音乐、方言交互。多语言翻译:跨国沟通、旅行辅助。文本摘要:新闻精简、信息高效获取。文本分类:新闻分栏(政治、经济等)、内容管理。文本生成:新闻稿、诗歌创作、代码生成。情感分析:产品评论分析、市场洞察。舆情分析:政策反馈、企业危机公关。智能客服:电商咨询、24小时服务。智能问答:搜索引擎精准回答(如“太阳系最大行星”)。智能推荐:电商商品、资讯个性化推荐。发展与展望自然语言处理概述多模态融合:文本+图像+声音(智能助手看图识物、医疗多信息诊断)。低资源语言处理:保护濒危语言(构建语料库、跨语言迁移学习)。人机交互更自然:虚拟朋友、个性化教育/心理辅导。语义与情感分析深化:理解隐喻、反讽、复杂情感混合。跨领域/跨语言应用:模型领域自适应、低资源语言翻译。模型可解释性与可靠性:医疗、司法等领域决策透明化。与其他技术融合:NLP+计算机视觉(智能安防)、物联网(智能家居控制)等。文本预处理自然语言处理技术清洗:处理特殊字符、统一大小写、删除重复字符(见“表5-2清洗示例”)。分词:中文:结巴分词(如“我喜欢吃苹果”→“我/喜欢/吃/苹果”)。英文:NLTK库(如分割“IloveNLP”)。去停用词:移除无实义词汇(如“的”、“a”,示例:“我喜欢在公园里跑步”→“喜欢公园跑步”)。词干提取与词形还原:词干提取:“running”→“run”词形还原:“better”→“good”词向量自然语言处理技术定义:将单词映射为多维向量,语义相近词距离近。国王(0.2,0.8)王后(0.2,0.6)男人(0.6,0.7)女人(0.6,0.5)词向量技术:BoW自然语言处理技术词袋模型(BagofWords,BoW)将文本表示为一个单词频率向量,但忽略了单词的顺序。词表={苹果,香蕉,草莓,橘子,葡萄,西瓜}文本原始文本词频向量A苹果香蕉草莓苹果[2,1,1,0,0,0]B香蕉橘子草莓[0,1,1,1,0,0]C橘子葡萄西瓜[0,0,0,1,1,1]D苹果葡萄[1,0,0,0,1,0]E西瓜香蕉[0,1,0,0,0,1]词向量技术:TF-IDF自然语言处理技术词重要性评分通过计算单词在文档中的频率(TF)和在整个文档集合中的逆文档频率(IDF)来确定单词的重要性。TF(t,d)=词语

t

在当前文档

d

中出现的次数/文档

d

的总词数例如,在一篇包含100个词的文档中,“人工智能”这个词出现了10次,则TF("人工智能",d)=10/100=0.1IDF(t)=log(文档总篇数/包含词语t的文档篇数)假设我们有一个由1000篇文档组成的集合,在这些文档中有100篇包含了词语“人工智能”。则

IDF("人工智能")=log(1000/100)=log(10)=1TF-IDF值就是TF和IDF的乘积,则“人工智能”在该文档中的TF-IDF值为0.1*1=0.1词向量技术:词嵌入自然语言处理技术将文本数据中的单词转换为数值向量,这些向量位于一个多维空间中,并且被设计成能够捕捉单词之间的语义相似性和关系。理想情况下,在这个向量空间中,语义上相关的词汇会彼此靠近。Word2

Vec:通过观察词语出现的上下文来理解每个词的意思CBOW:根据周围的词语预测当前的目标词Skip-gram:使用中心词来预测其周围的词GloVe:不同于Word2Vec专注于局部上下文窗口的方法,GloVe结合了全局统计信息和局部上下文的优势。语言模型:预测与生成的基石自然语言处理技术定义:预测下一个词的概率(如“今天天气”→“真好”)。类型:N-Gram:统计词频(2-Gram看前1词,3-Gram看前2词,局限:数据稀疏)。神经网络模型:RNN:串行处理,易遗忘长距离信息。LSTM:门控机制(遗忘门、输入门、输出门),记忆关键信息。GRU:简化版LSTM,效率更高。Transformer:自注意力机制,并行处理,适合长文本(如翻译、写文章)。语法和句法分析自然语言处理技术语法分析基础:语言的“交通规则”(如“主谓宾”结构)。依存关系分析:词语间直接语法依赖(示例:“我非常喜欢吃苹果”中“喜欢”为核心,“我”“非常”“吃苹果”依附于它)。短语结构分析:分解为嵌套短语(如“我”→NP,“非常”→AdvP)。应用:机器翻译语法合法性、信息抽取实体定位。语义分析自然语言处理技术

命名实体识别(NER):识别人名、地名等(方法:BiLSTM-CRF,应用:知识图谱构建)。

情感分析:判断情感倾向(方法:词典、机器学习、BERT,应用:舆情监控)。

意图识别:解析用户需求(如“预订机票”,方法:RNN/Transformer,应用:对话系统)。综合应用:钓鱼邮件检测(结合NER、情感分析、意图识别)。语言生成自然语言处理技术方法:基于模板:填充固定句式(如新闻摘要模板,优点:简单可控)。基于规则:人工语法规则(适合法律文书,局限:维护成本高)。基于神经网络:编码器-解码器、Transformer(GPT),生成自然文本(应用:对话系统、新闻写作)。方法类型优点局限性适用场景基于模板简单高效,可控性强灵活性低,

语义单一天气预报、邮件模板基于规则语法严谨,适合专业领域规则维护成本高法律文书、技术文档基于神经网络自然度高,适应复杂语境需大量数据,生成可控性弱对话系统、新闻写作、创作辅助古诗词情感分析案例应用1数据准备与预处理数据集:《唐诗三百首》(诗句+情感标签,见“表5-6情感分类示例”)。预处理步骤:清洗:去标点、注释示例:“春风得意马蹄疾,一日看尽长安花。”→“春风得意马蹄疾一日看尽长安花”。分词:古汉语分词如“黄沙百战穿金甲”→“黄沙/百战/穿/金甲”。去停用词:移除“之”“乎”等示例:“念天地之悠悠”→“念/天地/悠悠”。古诗词情感分析案例应用2特征表示与模型构建词向量化:构建词表(见“表5-7词表片段示例”)。Embedding层:词语映射为128维向量(见“表5-8词向量示例”)。RNN模型结构:输入层:诗句索引序列。嵌入层:转换为词向量。RNN层:传递上下文信息,取最后隐藏状态。全连接层:输出情感概率(如“豪迈”类概率0.8)。古诗词情感分析案例应用3模型训练与预测

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论