自然语言处理 课件全套 张勇 项目1-12 初识自然语言处理- 系统_第1页
自然语言处理 课件全套 张勇 项目1-12 初识自然语言处理- 系统_第2页
自然语言处理 课件全套 张勇 项目1-12 初识自然语言处理- 系统_第3页
自然语言处理 课件全套 张勇 项目1-12 初识自然语言处理- 系统_第4页
自然语言处理 课件全套 张勇 项目1-12 初识自然语言处理- 系统_第5页
已阅读5页,还剩143页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

自然语言处理项目1初识自然语言处理

MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304人工智能基础概述什么是人工智能人工智能(ArtificialIntelligence),英文缩写为AI,它是计算机科学的一个分支,是一门新的技术学科。人工智能研究到底什么是智能,希望可以生产出模仿人类智能的机器,这种机器能够以人类智能相似的方式对事物做出反应。科学家正在探索通过一定的理论、技术和方法,使计算机模拟和扩展人类的智能。目前的一些热门技术,如机器人、语言识别、图像识别、自然语言处理、专家系统等都是人工智能的研究领域人工智能的目的就是让机器能够像人一样思考,然而,这并不是一件容易的事,以计算机科学一己之力,无法完成如此艰巨复杂的任务。时至今日,人工智能已经发展成为一门交叉科学,它涉及到计算机科学、脑科学、认知科学、心理学、语言学、逻辑学甚至哲学。010203whatisArtificialIntelligence?人工智能发展历程人工智能的主要流派符号主义、连接主义和行为主义三大人工智能学派。符号主义(Symbolicism),又称为逻辑主义、心理学派或计算机学派。符号主义学派认为人工智能的研究方法应为功能模拟方法连接主义(Connectionism),又称为仿生学派或生理学派,其原理主要为神经网络及神经网络间的连接机制与学习算法。行为主义(Actionism)又称进化主义或控制论学派,其原理为控制论及感知—动作型控制系统。01020304自然语言处理概述自然语言处理概述利用计算机为工具对人类特有的书面形式和口头形式的自然语言的信息进行各种类型处理和加工的技术。自然语言处理的基本问题形态学问题,研究词的构成规律,涉及到分词问题。语法学问题,研究句子的语法规律。语义学问题,研究句子的含义,如何由词的含义推演出整个句子的含义。语用学问题,研究句子在不同的上下文环境中的含义。语音学问题,研究声音和文字之间的对应关系。自然语言处理的基本研究方法理性主义方法经验主义方法神经网络方法自然语言处理发展历程NLP自然语言处理的基本流程:语料获取、语料预处理、文本向量化、模型构建、模型训练、模型评价及模型线上应用构成。自然语言处理行业应用机器翻译、信息检索、自动文摘、问答系统、信息抽取、文档分类、语音识别、信息过滤、推荐系统、聊天机器人等。感谢欣赏自然语言处理项目1初识自然语言处理

MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304语料库的学习与使用什么是语料库在自然语言处理中,大多数情况下都是采用统计的方法,也就是采用机器学习的方法解决问题。机器学习需要大规模的数据作为驱动,在自然语言处理技术中,驱动机器学习的大规模数据,我们称之为语料库。在自然语言处理中,语料库起到的是语言数据库或知识库的作用,无论是全文检索、文本分类还是机器翻译,在处理过程中都要大量访问语言数据库和知识库。语言数据库中含有语言模型训练参数,这是机器学习必不可少的数据,知识库中包含词法、语法相关规则、词汇语义、语言常识、世界常识等知识,也是自然语言处理必不可少的数据支撑。010203国外语料库的建设Brown语料库:世界上第一个计算机可读的语料库,它搜集的语料来自1961年美国英语出版物上的文本,共500篇,每篇大约2000个单词,合计100万单词。TLF语料库(TremordelaLangueFrancaise),法国国家科学研究中心与美国芝加哥大学联合建成的法语语料库,包括2000书面法语文本,1.5亿词。BNC

英国国家语料库:该语料库书面语与口语并存,词容量超过一亿,由4124篇代表广泛的现代英式英语文本构成。COCA

美国当代英语语料库:是目前最大的免费英语语料库,它由包含5.2亿词的文本构成,这些文本由口语、小说、流行杂志、报纸以及学术文章五种不同的文体构成01020304国内语料库的建设BCC语料库:BCC语料库是以汉语为主,兼有英语、西班牙语、法语、德语、土耳其语等语言的语料库,其中汉语语料规模约150亿字,涵盖了报刊、文学、微博、科技、综合和古汉语等多领域语料。CCL语料库:CCL语料库中包含现代汉语语料、古代汉语语料两类单语语料,涉及的文献时间从公元前11世纪到当代。人民日报标注语料库:该语料库是我国第一个大型的现代汉语标注语料库,以《人民日报》1998年的纯文本语料为基础,完成词语切分、词性标注、专有名词标注、语素子类标注、动词和形容词特殊用法标注、短语型标注等加工工作,现已扩充至3500万字的规模。TCT语料库:清华汉语树库(TshinghuaChineseTreebank,)从包含文学、学术、新闻、应用四大体裁的200万汉字平衡语料库中提取了100万汉字规模的语料文本,经过自动断句、句法分析后再进行人工校对,形成了有完整句法结构树的汉语句法树库语料。01020304语料库的种类与构建按内容构成和目的划分:异质的语料库、同质的语料库、系统的语料库、专用的语料库。按语言种类划分:单语的语料库、双语的或多语的语料库按语料加工程度划分:具有词性标注的语料库、句法结构信息标注的语料库(又称为树库)、语义信息标注的语料库。按语料结构划分:平衡语料库、平行语料库按语料选取时间划分:共时语料库、历时语料库01020304感谢欣赏自然语言处理项目2中文分词与关键词提取MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304基于词典的中文分词简单来说,中文分词是指将汉字序列按照一定规范、逐个切分为词序列的过程。例如:南京市长江大桥,分词结果:南京市/长江大桥。不同于中文分词,英文分词就简单许多,因为英文单词之间以空格隔开,所以进行分词时可以利用空格作为切分单位。而中文是以字为基本单位,不像英文那样依靠天然的空格作为分隔符,因此中文分词一直是中文信息处理中比较困难的问题并且是一个尚未完全有效解决的问题。中文分词的关键问题:歧义切分字段处理、未登录词的处理什么是中文分词基于词典的分词方法

正向最大匹配法01逆向最大匹配法02双向最大匹配法03基于词典的分词方法又叫机械分词方法,是目前使用最为广泛的一类按照一定的策略将待分析的字符串和一个已建立好的“大机器词典”中的词进行匹配的分词算法,若在词典中找到某个词条,则说明匹配成功,其优点在于识别速度快,方法简单,不过也存在严重依赖词典,无法很好的处理分词歧义和未登录词等问题。基于统计的中文分词N元文法模型如果认为一个词的出现仅仅与它左边的N-1个词有关,那么此时的语言模型就称为N元文法(N-gram)。当N=1时,出现在第i个位置的词wi与左边的词无关,也就是说独立于历史,称为一元文法(uni-gram)。当N=2时,出现在第i个位置的词wi与左边的一个词有关,称为二元文法(bi-gram)。此时,每个词的出现要受左边相邻词的约束,因此比起无约束的一元文法,二元文法的效果明显要好很多。当N=3时,出现在第i个位置的词wi与左边的两个词有关,称为三元文法(tri-gram)。此时,每个词的出现要受左边相邻两个词的约束,因此比起二元文法,三元文法的效果明显要好很多。很显然,N越大,语言模型越精确,效果越好,但是随之而来的问题就是句子概率的计算量过大。所以在实际使用时要权衡精度与计算量之间的平衡关系。隐马尔可夫模型隐马尔科夫模型与马尔科夫模型有密切的关系,是一个双重的随机过程,这里存在一个我们不知道的状态序列,只知道状态转移的概率,也就是说,模型的状态转换过程是不可观察的,但是状态之间转移的可能性是知道的。隐马尔可夫模型的组成:隐马尔可夫模型的组成主要由状态转移概率矩阵、观测状态生成矩阵、隐状态初识概率分布组成,主要解决观测序列概率、模型参数学习、解码问题隐马尔可夫模型的两个基本假设:隐马尔可夫模型的两个基本假设分别是齐次马尔科夫性假设与观测独立性假设。关键词提取关键词提取是自然语言处理中非常核心、非常基础的技术。关键词是一组词,它们能够代表文章的主要内容。当我们面对海量文档的时候,我们不可能阅读所有内容,通常我们只会去关注哪些我们感兴趣的文档。那么如何才能找到我们感兴趣的文档呢?如果把每篇文档的关键词都提取出来,我们就可以根据关键词快速选择我们需要的文档内容了。关键词提取算法主要还是机器学习算法,并且分为两大类,一类是有监督机器学习算法,另一类是无监督机器学习算法。什么是关键词提取基于统计特征的关键词提取算法(TF,TF-IDF词频-逆文档频次算法)基本思想是评估在一个文档集中某一个词对于某一份文档的重要程度。重要程度越高,越有可能是关键字。在基于统计特征的关键词提取算法中,需要准备一个语料库,语料库的覆盖程度决定了关键词提取算法的质量。TF-IDF算法:TF和IDF从两个方面衡量一个词在文档中的重要程度,单独使用都不全面,如果将两个方法结合起来,就会得到一个比较完美的结果,这就是TF-IDF算法,也就是将TF与IDF相乘,即TF-IDF=TF*IDF(相乘),TF-IDF与一个词在文档中的出现次数成正比,与该词在整个语料中的出现次数成反比。基于统计特征的关键词提取主题模型(TopicModel)属于隐含语义分析技术,目的是找出潜在的主题或分类。LDA模型概述:LDA是LatentDirichletAllocation的缩写,意思是潜在狄利克雷分布。LDA算法使用非常广泛,涉及检索、文本分类、主题词抽取等领域。基于主题模型的关键词提取基于词图模型的关键词提取算法基本思路是:首先构建语言网络图,然后对网络图进行分析,在网络图中寻找最重要的词,这些词就是文档的关键词。语言网络的形式主要有四种:共现网络图、语法网络图、语义网络图和其它网络图。TextRank算法:TextRank算法完全采用PageRank的思路,所不同的是将网页换成了词语,网页重要性排序变成了词语重要性排序,排在前面的词语当然就是关键词。现在的关键问题是如何为词语构建一张网络图。基于词图模型的关键词提取感谢欣赏自然语言处理项目12推荐系统MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304认识推荐系统什么是推荐系统推荐系统(RecommenderSystem)是一种在大数据时代背景下,为了解决信息过载问题,根据用户需求、兴趣等,使用计算机方法从海量数据中提取用户感兴趣的项目(如信息、服务、物品等),并将结果以个性化列表的形式推荐给用户的计算机方法。推荐系统根据用户历史行为信息来构建用户兴趣模型并向用户推荐其可能感兴趣的信息,被广泛用于个性化服务领域,在推荐者和寻求推荐者之间做出良好匹配的能力。一个推荐系统在进行推荐时有3个要素:用户、物品、推荐算法。推荐系统的分类非个性化推荐系统是基于热度、流行度等向用户推荐最受欢迎的项目,如近期最受欢迎的前10部电影、最畅销的书籍、最常购买的产品。个性化推荐系统的研究与应用越来越多,最早是由Malone等研究者于1987年提出,最初个性化推荐系统应用于电子商务中,通过分析其他用户的评价信息向当前用户进行推荐。个性化推荐系统主要分为基于关联规则的推荐系统、基于内容的推荐系统、协同过滤的推荐系统等。协同过滤的推荐系统又分为基于用户的协同过滤的推荐系统和基于任务的协同过滤的推荐系统。推荐系统可分为非个性化推荐系统(NonPersonalizedRecommendationSystem)与个性化推荐系统(PersonalizedRecommenderSystem)两大类推荐系统中的技术介绍基于规则的推荐算法属于基于知识推荐中的一种,通过将待推荐项目的属性与用户属行进行匹配进行推荐,或者是根据数据挖掘中的规则进行推荐,这些规则可以通过关联计算得到,也可以由领域的专家事先定义好。规则的形式一般都是IF-THEN语句,规则通过将用户的属性、购买历史记录和待推荐项匹配起来,获得推荐列表,因此这种算法要求用户的属性结构特征必须与规则中的属性完全一致才能够精准匹配,只有成功匹配出一系列的规则,才能完成推荐。基于规则的推荐系统基于内容的推荐算法的应用场景基于内容的推荐是使用用户的历史记录,将用户已经选择过的项目内容和用户提供的个人信息进行相似度计算,建立用户的档案,分析用户的兴趣所在。在基于内容的推荐中,计算对象的特征与用户兴趣的相似度是推荐系统的核心,一般采用特征加权的方法。这种方法建立用户档案的关键词向量,并计算每个关键词的权重,之后对新的对象进行计算评分。基于内容过滤推荐系统协同过滤推荐系统协同过滤是目前推荐系统中应用最为普遍的技术之一。协同过滤的基本思想是项目评分相似的用户的兴趣爱好也比较相似,通过相似用户对某一待推荐项目的评分来预测指定使用者对某一候选待推荐项目的评分。根据问题解决方式,可以将协同过滤分为基于领域近邻和基于模型等两类不同的算法领域近邻又可分为用户近邻和物品近邻,基于用户近邻被称为基于用户的协同过滤,是统计用户共同交互物品的数量定义用户之间的相似度,寻找用户的近邻,然后为用户推荐近邻喜欢的但此用户未交互过的物品。基于物品近邻,是统计两两物品被多少相同用户购买,以共同用户在购买俩物品的所有用户中的占比作为物品之间的相似度,寻找物品的近邻,然后为用户挑选历史交互物品的近邻作为推荐结果01020304基于深度学习的文本分类深度学习工具在使用深度学习方法的过程中,需要编写大量的代码,在这些代码中,有很多是具有共性的代码,任何一个使用深度学习方法的人都需要写这些代码,所以实际上有很多代码是重复代码。为了提高工作效率,有人将这些重复代码抽取出来,写成一个框架放到互联网上,供学习和研究者使用。随着时间的推移,一些性能优良的框架逐渐流行起来。比较主流的框架:TensorFlow、Keras、PaddlePaddle、PyTorch、Caffe循环神经网络(RecurrentNeuralNetwork,RNN)是最早运用到自然语言处理中的神经网络。RNN处理的输入数据为离散序列数据,并以离散序列的形式输出,在RNN内部通过结构设计捕捉输出与输入之间的关系特征LSTM是RNN的一种变体形式,在RNN原有的结构上引入了几道门:遗忘门、输入门和输出门。循环神经网络TextRNN模型TextRNN是专门用于处理文本数据的RNN,最典型的是处理文本的分类问题。前面说过,N对1的RNN特别适合处理文本分类问题,因此可以把N对1的RNN作为TextRNN的基本结构基于Attention机制的文本分类Encoder-Decoder结构Encoder-Decoder结构又称Seq2Seq模型。深度学习中SequencetoSequence(Seq2Seq)模型的目标是将一个序列转换成另一个序列。包括机器翻译(machinetranslate)、语音识别(speechrecognition)和时间序列预测(timeseriesforcasting)等任务都可以理解成是Seq2Seq任务。RNN(RecurrentNeuralNetworks)是深度学习中最基本的序列模型。Encoder与状态向量C构成一个N对1的RNN,状态向量C是Encoder的输出,可以看做是对N个输入向量的信息概括,或者说N个输入向量的信息被压缩到一个状态向量C中,而状态向量C又作为输入信息与Decoder构成一个1对M的RNN。Decoder的M个输出向量可以看做是对状态向量C逐步解码的结果。感谢欣赏自然语言处理项目3词性标注与命名实体识别

MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304词性标注什么是词性标注词性(part-of-speech,POS)是指词的语法分类,又称为词类。不同的语言都有基本的词性,在英语中有10种,包括名词、动词、形容词、数词、代词、副词、介词、连词、冠词、感叹词,汉语中有12种,比英语多了量词、助词和拟声词,少了冠词。词性标注就是把分词结果中的每一个词,标注出它的词性,也就是确定每一个词是名词、动词、形容词还是其它什么词性。词性标注对于自然语言处理来说非常重要。通过词性标注,我们可以发现和识别短语及句子的组合结构,归纳出组词造句的规则。词性标注,是重要的基础性工作,为后续的句法分析等进一步工作提供基础。分词、命名实体识别、词性标注并称汉语词法分析“三姐妹”。010203词性标注规范词性标注是在给定句子中,判定每个词的词性并加以标注的过程。词性标注需要有一定的标注规范,如将词分为名词、形容词、动词,然后用n、adj、v等来进行表示。一个中文句子中包含各种各样的词性,所有词性的集合叫做词性标注集。词性标注集中的词性用词性标签来表示,如用r表示代词,用ns表示地名,用v表示动词等等。词性标注算法2基于规则的词性标注方法:基于规则的词性标注方法,就是由人来制定规则,然后依据规则编写词性标注算法。3基于统计的词性标注方法:基于最大熵的词性标注基于统计最大概率输出词性基于HMM的词性标注1基于词典的词性标注方法:事先准备好一个词典,这个词典包含了词和词性信息,将分词结果逐一到词典中去查询词性,然后标注词性。命名实体识别命名实体识别概述命名实体识别(NamedEntityRecognition,NER)是各种自然语言处理任务中必不可少的一个预处理步骤。只要文本中出现人名、地名、组织机构名及各类学术专名等等,就必须使用命名实体识别技术。命名实体,是指文本中具有特别意义或指代性非常强的实体。通用的命名实体一般分为三大类和七小类。命名实体识别既要识别出实体的边界,又要识别出实体的类别,而中文中又缺少向英文中的各种大写字母、空格之类的提示信息,这使得中文命名实体识别更具挑战性。基于以上种种困难,在识别方法上,还是以基于统计方法为主,基于规则方法为辅。命名实体识别的工具LTP:哈工大社会计算与信息检索研究中心11年研发和推广的中文处理基础平台。LTP提供包括中文分词、词性标注、命名实体识别、依存句法分析、语义角色标注等自然语言处理技术。在国内外具有很大影响力。1HanLP是由一系列模型和算法组成的Java工具包。目标是普及自然语言处理在生产环境中的应用。它不仅支持分词,还提供了词法分析、句法分析、语义理解命名实体识别等完整的功能。2LAC:是百度自然语言处理部研发的一款联合的词法分析工具,实现中文分词、词性标注、专名识别等功能。3BosonNLP:实体识别引擎基于自主研发的结构化信息抽取算法,F1分数达到81%,相比于StanfordNER高出7个百分点。通过对行业语料的进一步学习,可以达到更高的准确率。4命名实体识别的方法基于规则和词典的方法:是早期使用的方法,该方法的核心思想是关注规则和词典。深度学习方法的核心思想是关注整体,并且能够避免大量的人工特征工程,经常采用的架构包括BiLSTM-CNN-CRF、IDCNN-CRF、CAN-NER、LatticeLSTM、BERT-BiLSTM-CRF等,识别效果良好。基于统计的方法把命名实体识别问题当作是序列的标注问题,当前标签的预测不仅与当前的输入特征有关,还与前面的标签预测有关,预测标签之间的相互依赖关系非常密切。010302感谢欣赏项目4文本信息抽取

MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304关系抽取什么是关系抽取关系抽取(RelationExtraction,RE)是就是从非结构化文本中提取实体之间的关系。是从自然语言文本中抽取实体及其之间关系的信息技术,是信息检索、智能问答、智能对话等人工智能应用的重要基础,一直受到业界的广泛关注。关系抽取是信息抽取领域的重要分支,是构建知识图谱的重要技术环节。构建知识图谱必须进行知识抽取,知识抽取包括三个要素:命名实体识别(NER)、实体关系抽取(RE)和属性抽取。而命名实体识别(NER)和实体关系抽取(RE)是知识抽取中非常重要的部分,也是自然语言处理的研究问题之一。命名实体识别任务是在一个句子中找出具有可描述意义的实体,而关系抽取则是对两个实体的关系进行抽取。命名实体识别是关系抽取的前提,关系抽取是建立在实体识别之后。010203whatisRelationExtraction?关系抽取算法:按照发展历程可以划分为三种类别:基于规则的关系抽取算法、基于机器学习的关系抽取算法、基于深度学习的关系抽取算法。其中机器学习又包括监督学习,无监督学习,半监督学习。深度学习主要是监督学习和远程监督学习。基于规则的关系抽取主要是通过人工定义一些抽取规则,从文章中抽取出实体-关系-实体三元组信息。其目标是找出尽可能多的拥有关系的实体对。bananaisafruit基于规则的关系抽取算法有监督学习的关系抽取半监督学习的关系抽取:基于半监督学习的关系抽取方法主要有Bootstrap算法和snowball算法。无监督学习的关系抽取无监督学习是对于没有标记的样本,学习算法直接对输入数据集进行建模,例如聚类基于机器学习的关系抽取算法随着深度学习以及词向量的发展,近年来大多的关系抽取模型都采用词向量做为关系抽取的主要特征,且均取得了很是好的效果。有监督的关系抽取方法:远程监督的关系抽取方法基于深度学习的关系抽取算法事件抽取什么是事件抽取事件(Event)指的是发生在某个特定的时间段、某个特定的地域范围内,由一个或者多个角色参与的一个或者多个动作组成的事件或者状态的改变。事件抽取是把含有事件信息的非结构化文本以结构化的形式呈现出来。命名实体识别、关系抽取、事件抽取是NLP中信息抽取的主要任务。ACE定义中的事件由事件触发词和描述事件结构的元素构成。事件触发词是能够触动事件发生的词,是决定事件类型最重要的特征词,决定了事件类别或子类别。元素用于填充事件模版,两者完整的描述了事件本身。010203whatisEventExtraction?EE事件抽取算法:事件抽取任务总体可以分为两大类:限定域事件抽取和开放域事件抽取。限定域事件抽取在进行抽取之前,预先定义好目标事件的类型及包含哪些具体的事件元素,通常会给出一定数量的标注数据。开放域事件抽取在进行事件识别之前,可能的事件类型以及事件的结构都是未知的,因此该任务通常没有标注数据。。限定域事件抽取算法限定域关系抽取是指系统所抽取的关系类别是预先定义好的,通过人工定义或者从现有知识图谱中自动获取。限定域事件抽取方法包括基于模式匹配的方法基于机器学习的方法两种。开放域事件抽取算法开放域事件抽取在进行事件识别之前,可能的事件类型以及事件的结构都是未知的,因此该任务通常没有标注数据,主要基于无监督的方法和分布假设理论。分布假设理论说明如果候选事件触发词或者候选事件元素具有相似的语境,那么这些候选事件触发词倾向于触发相同类型的事件,相应的候选事件元素倾向于扮演相同的事件元素。按照所用方法的不同,可分为基于内容特征的事件抽取方法和基于异常检测的事件抽取方法。自然语言处理项目5文本分类MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304文本向量化表示什么是文本向量化计算机拥有强大的信息处理能力,但是也有一个限制,就是只能处理用二进制数表示的数字信息。因此,当我们需要计算机处理声音信息、图像信息、文字信息时,第一步要做的就是信息的数字化。一旦将文本句子向量化,就可以让句子参与数学运算了。比如我们想知道两句话的相似度,只要计算一下这两句话的向量距离即可,距离短的自然相似度高,距离长的当然相似度低。文本离散表示词袋模型(BOW)是文本离散表示的另外一种方法,BOW用一个向量表示一句话,也可以表示一篇文章,同样是把文档看作是独立词的集合,不考虑词的关联和顺序,但是在BOW中加入了词频信息文本向量化分为离散表示和分布式表示两种,离散表示基于规则和词频,常用方法有词集模型和词袋模型(BOW)。词集模型先创建一个词典,词典中是所有要用到的词,然后每一个词用一个长向量表示,向量的长度就是词典的长度,每个词对应的向量中只有一个维度的数值为1,这个维度位置就是词在词典中的位置,其它维度的数值全部为0。这种向量表示称为独热表示(one-hotrepresentation)Word2Vec与Doc2Vec模型2013年,谷歌发表了Word2Vector工具,Word2Vector工具包括两个模型,一个叫跳字模型(Skip-Gram),另一个叫连续词袋模型(CBOW)。Word2Vec将每一个词表示为一个定长的向量,起到数据降维的作用,并且向量中数据稠密,解决了效率低下问题,特别是Word2Vec可以很好表达词与词之间的相似和类比关系。Doc2Vec是Word2Vec的拓展,通过Doc2Vec工具可以计算句子、文档之间的相似度,可以用于文本聚类和文本分类。Doc2Vec也有两个模型,与Word2Vec工具的两个模型对应,一个是分布记忆(Distributed

Memory,DM)模型,对应于Skip-Gram模型,另一个是分布式词袋(Distributed

BagofWords,DBOW)模型,对应于CBOW模型。基于机器学习的文本分类KNN模型KNN法又称K近邻法(K-nearestneighbor,K-NN),是一种最基本的分类方法。所谓K近邻法,意思就是K个相邻的邻居。如果我们要对一个新的实例进行分类,它的类别要根据它最近的几个邻居来确定。在KNN算法中,距离的计算方法主要有欧式距离、曼哈顿距离、Lp距离(闵可夫斯基距离)等。KNN法给定一个训练数据集,数据集中每一个实例都是向量,并且有自己所属的类别,对于一个新实例的特征向量,我们要确定它的类别,方法就是找出离这个新实例最近的K个邻居,看看邻居属于什么类别,如果K个邻居都属于同一个类别,那么新实例就确定为与邻居相同的类别。如果K个邻居分属于不同的类别,那么就通过投票法,将多数邻居所属的类别作为这个新实例的类别。因为有可能要通过投票法确定新实例的类别,所以K一般取奇数。sklearn中的朴素贝叶斯的分类器。朴素贝叶斯分类器是一种基于概率的分类器,实现简单,学习与预测的效率都很高,即便在今天深度学习盛行,它仍然有着强大的生命力。朴素贝叶斯法是基于贝叶斯定理与特征条件独立性假设的分类方法。其中特征条件独立性假设大大降低了实际问题的复杂性,简化了计算,这也是“朴素”二字的由来。朴素贝叶斯线性可分数据集支持向量机(supportvectormachines,SVM)是一种二分类器,从这一点看,支持向量机有点像感知机,但与感知机不同的是,感知机仅仅是要求找到能够分隔两个类别的超平面,而支持向量机要求找到能够分隔两个类别的最优超平面。间隔就是离分离超平面最近的正实例和负实例到分离超平面的距离之和,通过间隔最大化求得最优超平面。SVM模型基于深度学习的文本分类深度学习工具在使用深度学习方法的过程中,需要编写大量的代码,在这些代码中,有很多是具有共性的代码,任何一个使用深度学习方法的人都需要写这些代码,所以实际上有很多代码是重复代码。为了提高工作效率,有人将这些重复代码抽取出来,写成一个框架放到互联网上,供学习和研究者使用。随着时间的推移,一些性能优良的框架逐渐流行起来。比较主流的框架:TensorFlow、Keras、PaddlePaddle、PyTorch、Caffe循环神经网络(RecurrentNeuralNetwork,RNN)是最早运用到自然语言处理中的神经网络。RNN处理的输入数据为离散序列数据,并以离散序列的形式输出,在RNN内部通过结构设计捕捉输出与输入之间的关系特征LSTM是RNN的一种变体形式,在RNN原有的结构上引入了几道门:遗忘门、输入门和输出门。循环神经网络TextRNN模型TextRNN是专门用于处理文本数据的RNN,最典型的是处理文本的分类问题。前面说过,N对1的RNN特别适合处理文本分类问题,因此可以把N对1的RNN作为TextRNN的基本结构基于Attention机制的文本分类Encoder-Decoder结构Encoder-Decoder结构又称Seq2Seq模型。深度学习中SequencetoSequence(Seq2Seq)模型的目标是将一个序列转换成另一个序列。包括机器翻译(machinetranslate)、语音识别(speechrecognition)和时间序列预测(timeseriesforcasting)等任务都可以理解成是Seq2Seq任务。RNN(RecurrentNeuralNetworks)是深度学习中最基本的序列模型。Encoder与状态向量C构成一个N对1的RNN,状态向量C是Encoder的输出,可以看做是对N个输入向量的信息概括,或者说N个输入向量的信息被压缩到一个状态向量C中,而状态向量C又作为输入信息与Decoder构成一个1对M的RNN。Decoder的M个输出向量可以看做是对状态向量C逐步解码的结果。Attention机制又称为注意力机制,顾名思义,是一种能让模型对重要信息重点关注并充分学习吸收的技术。通俗的讲就是把注意力集中放在重要的点上,而忽略其他不重要的因素。注意力机制最早用在seq2seq模型上,2015年提出的Attention机制,对Seq2Seq模型进行了改进在Seq2Seq模型中,状态变量C实际上是Encoder的最后一个隐含层状态,其它隐含层状态全部被抛弃。在Attention机制中,Encoder中的所有隐含状态被保留,用于计算Decoder在每个隐含状态下的上下文状态Attention机制基于预训练模型的文本分类Transformer模型是谷歌团队2017年在一篇《AttentionisAllYouNeed》论文中提出的。Transformer从本质上说是一个seq2seq模型,也就是前面介绍过的Encoder-Decoder模型在Transformer中使用了多层编码器和多层解码器,各层编码器结构相同,但参数不同,分别独自训练。各层编码器将输入序列编码后的结果进行拼接,相当于对各编码器的结果进行综合计算,计算结果输入各层解码器分别进行解码,最后将各解码器的输出综合处理,得到输出序列。Transformer的基本概念BERT的全称为BidirectionalEncoderRepresentationfromTransformers,是一个预训练的语言表征模型。它强调了不再像以往一样采用传统的单向语言模型或者把两个单向语言模型进行浅层拼接的方法进行预训练,而是采用新的maskedlanguagemodel(MLM),以致能生成深度的双向语言表征。所谓预训练模型,就是在确定特定使用场景之前,使用大量的数据进行训练BERT的目的是预训练Transformer的Encoder网络,从而大幅度提高准确率。BERT的基本概念感谢欣赏机器阅读理解概述应用场景评估指标MRC系统目录01020304机器阅读理解概述机器阅读理解(MachineReadingComprehension,MRC)的概念来源于人类对文本的理解。测试一个人是否能完全理解一篇文章的最常见方法就是要求他回答关于这篇文章的问题。就像人类语言测试一样,MRC是评估计算机语言理解能力的自然方式。机器阅读理解应用机器阅读理解中的四大任务:完形填空多项选择片段抽取(答案抽取)生成式(自由问答)机器阅读理解评估MRC模型最常用的评估指标:Accuracy:代表MRC系统准确回答的问题的百分比ExactMatch:系统生成的答案与正确答案完全匹配的问题的百分比Precision:正确答案中的单词和预测答案中的单词之间的单词重叠百分比Recall:正确答案中的单词被正确预测的百分比机器阅读理解系统阅读理解模型的网络结构主要包括:嵌入层:嵌入层是将文字与问题映射为向量的表达形式编码层:词向量模块得到的是每个单词的独立表示,并不包含上下文语义信息信息交互层:信息交互层将文本和问题的编码信息、语义信息进行融合答案预测层:答案预测层根据上一层的交互向量抽取出答案边界,最终得到预测答案感谢欣赏信息检索概述应用场景模型案例检索式文本生成目录01020304信息检索概述信息检索(InformationRetrieval)是从信息系统资源集合中获取与信息需求相关的信息系统资源的过程。信息检索可以定义为一个对文档数据库中信息进行组织、存储和检索的程序,特别是对于文本信息进行处理,检索对象是由内容集合或数据库中的信息表示的实体。信息检索应用信息检索系统最初是为了帮助管理大量信息而开发的:数字图书馆:一种特殊的图书馆,其存储的数字对象的资源可以包括文本、图片、音频、视频等,以电子媒体格式存储(与印刷或其他媒体不同),以及组织、存储和检索图书馆集合中包含的文件和媒体的方法信息过滤系统:该系统使用自动化或计算机化的方法,在将信息流呈现给用户之前,从信息流中删除多余或不需要的信息。媒体搜索:这涉及用于博客和新闻搜索以及图像、3D、音乐、语音和视频检索过程的计算机系统搜索引擎:信息检索系统用户通过搜索引擎获取他们的所需的信息。搜索引擎包括网站、桌面、企业、移动、社交和网络搜索信息检索案例模型信息检索的三个基本模型是∶布尔模型(BooleanModel):布尔检索是根据关键词检索包含该词的所有文档。并且支持多个关键词之间的“AND”,“OR”,"NOT"操作向量空间模型(VectorSpaceModel,VSM):向量空间模型是一种文档表示和相似性计算的工具,不仅在搜索领域,在自然语言处理、文本挖掘等领域也是普遍采用的工具。概率模型(ProbabilisticModel):概率检索模型是利用概率论原理来理解和解决信息检索问题,直接对文档与提问的相关性进行计算的一种检索模型检索式文本生成文本生成是一个产生自然语言输出的过程,通过向文本生成模型中输入少量关键性信息文本生成输出的另外的文本。文本到文本的生成又可根据不同的任务分为(包括但不限于):文本摘要、古诗生成、文本复述等,文本摘要又可以分为抽取式摘要和生成式摘要。感谢欣赏自然语言处理项目8AI自动写诗MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304认识文本生成什么是文本生成文本生成问题是以文本、图像、数据等作为输入,通过计算机处理输出文本的过程。在自然语言生成系统中,定义为接受语言或非语言形式的信息作为输入,生成可读的文字表述。文本生成是自然语言处理领域的一个重要研究方向,实现文本自动生成是衡量人工智能走向成熟的一个重要标志。许多针对文本生成技术的研究是在具体任务中进行,典型的任务包括机器翻译、对话系统、故事生成、诗歌生成、文本摘要等。在具体任务中,文本生成模型往往以通用的文本生成模型作为框架或基础,根据不同任务进行相应的模型设计。文本生成有多种划分方法,按照输入数据的区别,可以将文本生成大致分为以下三类:文本到文本的生成、数据到文本的生成、图像到文本的生成。010203文本生成方法包含:模板生成方法、模式生成方法、修辞结构理论方法、属性生成方法、神经网络生成方法模板生成方法:是最早应用于自然语言生成领域的一种方法。该技术通过将词汇和短句在模板库中进行匹配,匹配后将词汇和短语填入固定模板,从而生成自然语言文本,其本质是系统根据可能出现的几种语言情况,事先设计并构造相应的模板,每个模板都包括一些不变的常量和可变的变量,用户输入信息之后,文本生成器将输入的信息作为字符串嵌入到模板中替代变量模式生成是一种基于修辞谓语来描述文本结果的方法。这种方法通过语言学中修辞谓词来描述文本结构的规律,构建文本的骨架,从而明确句子中各个主体的表达顺序。修辞结构理论(RhetoricalStructureTheory,RST)方法来源于修辞结构理论的引申,是关于自然语言文本组织的描述性理论。属性生成是一项较复杂的自然语言生成方法,其通过属性特征来反映自然语言的细微变化。神经网络文本生成方法:使用神经网络模型进行文本生成,是针对文本序列数据进行训练,提取到序列数据特征,序列当前的输出与前面的输出相关,生成后续字符,能够有效地捕捉到文本数据中内在的相关性。文本摘要文本摘要(TextSummarization)是文本生成的一个重要应用,文本摘要是对文本内容的总结和归纳,在信息检索、舆情分析、内容审查等领域具有较高的研究价值。学术界涌现出大量围绕文本摘要算法、数据集、评价指标和系统的相关研究工作,这些工作在一定程度上取得了较好的效果,快速应用到金融、新闻、医学、媒体等各个领域,已经在智能写作、社交媒体摘要、新闻摘要以及学术文献摘要等多个方面进行应用。文本摘要的分类按照提供的上下文语境,可以分为查询无关摘要(Generic)和查询相关摘要(Queryfocused);按照不同的用途,可以分为指示性文摘和报道性文摘等;按照摘要面向的文档类型,可以分为单文档摘要和多文档摘要;根据需要产生摘要的文档长度,可以分为长文摘要、短文摘要;按照摘要生成方法的区别,可以分为抽取式摘要和生成式摘要抽取式摘要主要思想是:首先通过句子的各种特征给每个句子进行打分,得到句子的权重,然后计算每个句子与其他句子的相似度,根据计算得到的每个句子的得分和其与其他句子的相似度进行句子选择和句子排序。生成式摘要是根据对输入原始文本的理解来形成摘要,模型试图去理解文本的内容,自行组织语言,对源文档进行概括。文本摘要抽取分类生成式文本摘要生成式文本摘要在神经网络和深度学习被广泛使用之前,大部分摘要类实现方法都是以抽取的方式。而在实践中,人类理解文本,其摘要更多的是生成式过程,即阅读一段、一篇或多篇文段后,经过脑内抽象分析得到一个抽象理解,结合自己的知识结构输出为一段高度概括的内容。相比于抽取式自动文摘,生成式自动文摘在思想上更接近人工摘要的过程,具有重要研究意义。生成式摘要不是来自原文中句子拼接,而是利用生成技术通过对原文语义的理解后生成的基于深度学习的Seq2Seq模型,是在神经机器翻译(Neuralmachinetranslation,NMT)的Seq2Seq应用开始,逐步引入注意力机制、CNN、Transformer等作为编码器或解码器的基本模型。生成式文本摘要发展历程文本生成评价指标常用文本生成的评价方法,分为内在评价和外在评价方法。其中内在评价关注文本的正确性、流畅度和易理解性。内在评价方法又可分为两类:第一类是采用BLEU、NIST和ROUGE等进行自动化评价,评估生成文本和参考文本间相似度来衡量生成质量。第二类是通过人工评价,从有用性等对文本进行打分。外在评价则关注生成文本在实际应用中的可用性,内在评价方法是最为流行的评价方法。ROUGE自动文摘评价方法(Recall-OrientedUnderstudyforGistingEvaluation),被广泛用于自动文摘模型性能的评价。基本思想是将模型产生的系统摘要和参考摘要进行对比,通过计算它们之间重叠的基本单元数目来评价系统摘要的质量。METEOR度量方法是对BLUE的改进,同时考虑了对整个语料库上的准确率和召回率,因此可信度更高。早期经常用作机器翻译的评价方法,后也被研究人员用作自动文摘任务的评价。感谢欣赏自然语言处理MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录:01020304认识机器翻译什么是机器翻译whatisMT?机器翻译(machinetranslation,MT)是使用计算机将一种待翻译语言(源语言)翻译成另一种语言(目标语言)的过程、技术和方法,是通过句法分析得到某种内部的结果化表达。机器翻译的发展历程走过六十年的风风雨雨,机器翻译经历了一条曲折而漫长的发展道路,学术界一般将其划分为以下几个阶段:基于规则的机器翻译采用了一种基于转换的方法,其翻译过程主要包括分析、转换、生成三部分。基于规则的机器翻译01机器翻译的第二代技术路线,是基于统计的机器翻译,其核心在于设计概率模型对翻译过程建模。基于统计的机器翻译02端到端神经机器翻译(End-to-EndNeuralMachineTranslation)是从2013年兴起的一种全新机器翻译方法,其基本思想是使用神经网络直接将源语言文本映射成目标语言文本。基于端到端的机器翻译03感谢欣赏问答系统概述发展历程应用场景问答系统分类目录01020304问答系统概述

问答系统(QuestionAnsweringSystem,QA)是信息检索系统的一种高级形式,它能用准确、简洁的自然语言回答用户用自然语言提出的问题。问答系统是信息检索和自然语言处理(NLP)领域内的一门计算机科学学科,是自然语言处理(NLP)和计算机科学的一个子领域,其目的是建立能够自动理解和回答人类自然语言问题的系统。问答系统发展历程早期的问答系统可以追溯到1950年,著名的英国数学家、人工智能之父艾伦·图灵发表了里程碑式的论文’ComputingMachineryandIntelligence(计算机和智能)’,策划了被广泛称为"图灵测试"的"模仿游戏"第一个公认的QA系统出现在1961年,Green等人的设计的BASEBALL系统回答了与美国棒球联盟比赛有关的简单问题20世纪70年代,出现了阅读理解系统:耶鲁大学人工智能实验室开发的SAM20世纪90年代,问答系统的研究和开发热点转向基于大规模文档集的问答问答系统应用场景问答系统可以为教育和学习提供辅助,系统会提示正确的答案以理解这些概念问答系统可以应用于搜索引擎。例如谷歌使用此类系统来提出问题和答案问答系统可以应用到数据分析,HyperVerge是一家令人兴奋的公司,致力于根据用户以自然语言输入的查询生成分析报告问答系统分类FAQ(FrequentlyAskedQuestions)问答系统:目前应用最广泛的问答系统,基于FAQ的QA的核心是计算问题之间的语义相似性闲聊型对话系统:聊天机器人、Siri、微软小冰、小度等。它能模仿人的语言习惯,给出的答案较为人性化任务型对话系统:常被称为多轮对话系统,目前工业界有两种实现方式,一种是基于规则的实现方式,另一种则是基于End-to-End的实现方式知识图谱问答:又称Knowledge-basedQA或KBQA,是一种基于结构化知识库(即知识图谱)的智能问答方法。阅读理解的问答(MachineReadingComprehensionQuestionAnswering,MRCQA)是指给定文档库,通过理解用户的问题,从文档中找到能够回答用户问题的满足需求的细粒度的片段(如段落、句子)的过程感谢欣赏聊天机器人概述发展历程聊天机器人分类聊天机器人的未来目录01020304聊天机器人概述

聊天机器人是AI系统的典型示例,也是智能人机交互(HCI)的最基本和最广泛的示例之一。这是一种计算机程序,当通过文本或语音与人交谈时,它会像智能实体一样做出反应,并通过自然语言处理(NLP)理解一种或多种人类语言。聊天机器人发展历程第一个已知的聊天机器人是1966年开发的Eliza,其目的是充当心理治疗师,以问题的形式回复用户的话语对Eliza的一个改进是1972年开发的名为PARRY的聊天机器人1995年,聊天机器人ALICE被开发出来,并在2000年、2001年和2004年获得年度图灵测试Loebner奖近年,微软小冰、微软Cortana、阿里小蜜、京东JIMI、网易七鱼等各类聊天机器人层出不穷,并且这些聊天机器人逐渐渗透进人们生活的各个领域聊天机器人分类任务式聊天机器人是指专注于执行特定任务的单用途聊天机

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论