版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
时间:2020-9-8理解单元——自然语言处理第13章NLP应用场景NLP常见任务TF-IDF算法NLP基础理解13.113.213.313.413.1NLP基础理解语言是人类区别于其他动物的本质特征。自然语言处理(NLP,NaturalLanguageProcessing)也是人工智能的一个重要、甚至核心的部分。NLP是一门融语言学、语音学、计算机科学、数学于一体的科学。实现人机间自然语言通信意味着要使计算机既能理解自然语言文本的意义,也能以自然语言文本来表达给定的意图、思想等。前者称为自然语言理解,后者称为自然语言生成。自然语言处理大体包括了自然语言理解和自然语言生成两个部分。什么是自然语言处理?1NLP认知过程2NLP三个层次313.1NLP基础理解自然语言处理(NLP)是指机器理解并解释人类写作、说话方式的能力。NLP的目标是让计算机/机器在理解语言上像人类一样智能。最终目标是弥补人类交流(自然语言)和计算机理解(机器语言)之间的差距。什么是自然语言处理?1(1)自然语言理解(NLU)NLU是要理解给定文本的含义。文本内每个单词的特性与结构需要被理解。接下来,通过使用词汇和语法规则,理解每个单词的含义。NLP认知过程2(2)自然语言生成(NLG)NLG是从结构化数据中以可读地方式自动生成文本的过程。难以处理是自然语言生成的主要问题。句法学:给定文本的哪部分是语法正确的。语义学:给定文本的含义是什么?语用学:文本的目的是什么?NLP三个层次313.2TF-IDF算法TF-IDF(termfrequency–inversedocumentfrequency)是一种用于信息检索与数据挖掘的常用加权技术。TF-IDF的主要思想是:如果某个词或短语在一篇文章中出现的频率TF高,并且在其他文章中很少出现,则认为此词或者短语具有很好的类别区分能力,适合用来分类。TF-IDF算法的优点是简单快速,结果比较符合实际情况。缺点是,单纯以"词频"衡量一个词的重要性,不够全面,有时重要的词可能出现次数并不多。分词1词编码211.3NLP常见任务自动文摘3实体及实体关系识别4文本分类5由于中文不像英文那样词与词之间用空格隔开,计算机无法区分一个文本有哪些词,所以要进行分词。目前分词常用的方法有两种:基于规则:Heuristic(启发式)、关键字表基于机器学习/统计方法:HMM(隐马尔科夫模型)、CRF(条件随机场)分词1把词转换成计算机能理解的方式,即词编码。现在普遍是将词表示为词向量,来作为机器学习的输入和表示空间。词编码2One-hot表示一个词用一个维度表示bagofword将所有词的向量直接加和作为一个文档的向量Bi-gram和N-gram(语言模型)考虑了词的顺序,用词组合表示一个词的向量分布式表示word2vec,表示一个共现矩阵向量自动文摘是指在原始文本中自动摘要出关键的文本或知识。为什么需要自动文摘?有两个主要的原因:(1)信息过载,我们需要在大量的文本中抽出最有用、最有价值的文本;(2)人工摘要的成本非常高。目前自动文摘有两种解决思路:第一种是extractive(抽取式),从原始文本中找到一些关键的句子,组成一篇摘要;第二种是abstractive(摘要式),计算机先理解原始文本的内容,再用自己的意思将其表达出来。自动文摘3实体识别是指在一个文本中,识别出具体特定类别的实体,例如人名、地名、数值、专有名词等。它在信息检索、自动问答、知识图谱等领域运用的比较多。实体识别的目的就是告诉计算机这个词是属于某类实体,有助于识别出用户意图。实体及实体关系识别4文本分类是自然语言处理的一个基本任务,试图推断出给定的文本(句子、文档等)的标签或标签集合,其应用非常广泛,比如:垃圾过滤,新闻分类,词性标注等等。此外,NLP常见的任务还有:主题识别、机器翻译、文本生成、情感分析、关键字提取、文本相似度等。文本分类513.4NLP应用场景聊天机器人13.4.1机器翻译13.4.2垃圾邮件过滤13.4.3信息提取13.4.4情感分析13.4.5自动问答13.4.6个性化推荐13.4.7聊天机器人的重要性1聊天机器人的工作机制213.4.1聊天机器人自动文摘3实体及实体关系识别4文本分类5机器翻译基本原理1机器翻译发展历程213.4.2机器翻译机器翻译是人工智能的终极目标之一,面临如下国际公认的挑战。挑战一,译文选择。在翻译一个句子的时候,会面临很多选词的问题,因为语言中一词多义的现象比较普遍。第二个挑战,是词语顺序的调整。由于文化及语言发展上的差异,我们在表述的时候,有时候先说这样一个成份,后面说另外一个成份,但是,在另外一种语言中,这些语言成分的顺序可能是完全相反的。机器翻译基本原理1基于规则的翻译,翻译知识来自人类专家。大约到了上世纪九十年代出现了基于统计的方法,我们称之为统计机器翻译。神经网络翻译近年来迅速崛起。相比统计机器翻译而言,神经网络翻译从模型上来说相对简单,它主要包含两个部分,一个是编码器,一个是解码器。机器翻译发展历程213.4.3垃圾邮件过滤
自然语言处理通过分析邮件中的文本内容,能够相对准确地判断邮件是否为垃圾邮件。目前,贝叶斯(Bayesian)垃圾邮件过滤是备受关注的技术之一,它通过学习大量的垃圾邮件和非垃圾邮件,收集邮件中的特征词生成垃圾词库和非垃圾词库,然后根据这些词库的统计频数计算邮件属于垃圾邮件的概率,以此来进行判定。13.4.4信息提取
信息提取(IE)的目标是将文本信息转化为结构化信息,起初用于定位自然语言文档中的特定信息,属于自然语言处理的一个子领域。随着网页文本信息的急剧增长,越来越多的人投入到信息提取(IE)领域的研究。13.4.5情感分析
文本情感分析:又称意见挖掘、倾向性分析等。简单而言,是对带有情感色彩的主观性文本进行分析、处理、归纳和推理的过程。13.4.6自动问答
自动问答是指利用计算机自动回答用户所提出的问题以满足用户知识需求的任务,在回答用户问题时,首先要正确理解用户所提出的问题,抽取其中关键的信息,在已有的语料库或者知识库中进行检索、匹配,将获取的答案反馈给用户。2011年,又是IBM,这次是人类的常识智力问答,在综艺竞答类节目《危险边缘》中,IBM的沃森系统与真人一起抢答竞猜,虽然沃森的语言理解能力也闹出了一些小笑话,但凭借其
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 生产线调试合同
- 核岛主设备采购供应协议
- 吹奏乐器制作工保密模拟考核试卷含答案
- 耐火材料模具工岗前实操知识考核试卷含答案
- 蔬菜栽培工创新应用强化考核试卷含答案
- 露天采矿挖掘机司机操作水平强化考核试卷含答案
- 野生动物保护员岗前激励考核试卷含答案
- 眼镜验光师班组安全强化考核试卷含答案
- 卷板机操作工岗位质量监控考核试卷含答案
- 应急通信管理员岗中实践综合考核试卷含答案
- 2026秋小学英语人教版(PEP)六年级上册教学计划
- 医院关于不合理医疗检查专项治理自查自查自纠总结
- 2026人教版四年级数学上册第四单元第3课《速度、时间和路程》课件
- 2026年贵州省纪委监委公开遴选公务员笔试试题及答案解析
- 2026年《中华人民共和国妇女权益保障法》知识竞赛题库(含答案)
- 2026-2030中国植物源角鲨烯市场竞争现状及未来发展策略分析研究报告
- 2026年秋教科版(新教材)小学科学四年级上册(全册)分层作业及答案(附目录p107)
- 急救校园建设方案范文
- 2026年东风汽车校招人才测评题库
- 肿瘤异质性精准干预方案
- 2026年初中历史统编教材培训总结与教学启示
评论
0/150
提交评论