自然语言处理 课件 项目3、4 词性标注与命名实体识别、文本信息抽取_第1页
自然语言处理 课件 项目3、4 词性标注与命名实体识别、文本信息抽取_第2页
自然语言处理 课件 项目3、4 词性标注与命名实体识别、文本信息抽取_第3页
自然语言处理 课件 项目3、4 词性标注与命名实体识别、文本信息抽取_第4页
自然语言处理 课件 项目3、4 词性标注与命名实体识别、文本信息抽取_第5页
已阅读5页,还剩15页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

自然语言处理项目3词性标注与命名实体识别

MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304词性标注什么是词性标注词性(part-of-speech,POS)是指词的语法分类,又称为词类。不同的语言都有基本的词性,在英语中有10种,包括名词、动词、形容词、数词、代词、副词、介词、连词、冠词、感叹词,汉语中有12种,比英语多了量词、助词和拟声词,少了冠词。词性标注就是把分词结果中的每一个词,标注出它的词性,也就是确定每一个词是名词、动词、形容词还是其它什么词性。词性标注对于自然语言处理来说非常重要。通过词性标注,我们可以发现和识别短语及句子的组合结构,归纳出组词造句的规则。词性标注,是重要的基础性工作,为后续的句法分析等进一步工作提供基础。分词、命名实体识别、词性标注并称汉语词法分析“三姐妹”。010203词性标注规范词性标注是在给定句子中,判定每个词的词性并加以标注的过程。词性标注需要有一定的标注规范,如将词分为名词、形容词、动词,然后用n、adj、v等来进行表示。一个中文句子中包含各种各样的词性,所有词性的集合叫做词性标注集。词性标注集中的词性用词性标签来表示,如用r表示代词,用ns表示地名,用v表示动词等等。词性标注算法2基于规则的词性标注方法:基于规则的词性标注方法,就是由人来制定规则,然后依据规则编写词性标注算法。3基于统计的词性标注方法:基于最大熵的词性标注基于统计最大概率输出词性基于HMM的词性标注1基于词典的词性标注方法:事先准备好一个词典,这个词典包含了词和词性信息,将分词结果逐一到词典中去查询词性,然后标注词性。命名实体识别命名实体识别概述命名实体识别(NamedEntityRecognition,NER)是各种自然语言处理任务中必不可少的一个预处理步骤。只要文本中出现人名、地名、组织机构名及各类学术专名等等,就必须使用命名实体识别技术。命名实体,是指文本中具有特别意义或指代性非常强的实体。通用的命名实体一般分为三大类和七小类。命名实体识别既要识别出实体的边界,又要识别出实体的类别,而中文中又缺少向英文中的各种大写字母、空格之类的提示信息,这使得中文命名实体识别更具挑战性。基于以上种种困难,在识别方法上,还是以基于统计方法为主,基于规则方法为辅。命名实体识别的工具LTP:哈工大社会计算与信息检索研究中心11年研发和推广的中文处理基础平台。LTP提供包括中文分词、词性标注、命名实体识别、依存句法分析、语义角色标注等自然语言处理技术。在国内外具有很大影响力。1HanLP是由一系列模型和算法组成的Java工具包。目标是普及自然语言处理在生产环境中的应用。它不仅支持分词,还提供了词法分析、句法分析、语义理解命名实体识别等完整的功能。2LAC:是百度自然语言处理部研发的一款联合的词法分析工具,实现中文分词、词性标注、专名识别等功能。3BosonNLP:实体识别引擎基于自主研发的结构化信息抽取算法,F1分数达到81%,相比于StanfordNER高出7个百分点。通过对行业语料的进一步学习,可以达到更高的准确率。4命名实体识别的方法基于规则和词典的方法:是早期使用的方法,该方法的核心思想是关注规则和词典。深度学习方法的核心思想是关注整体,并且能够避免大量的人工特征工程,经常采用的架构包括BiLSTM-CNN-CRF、IDCNN-CRF、CAN-NER、LatticeLSTM、BERT-BiLSTM-CRF等,识别效果良好。基于统计的方法把命名实体识别问题当作是序列的标注问题,当前标签的预测不仅与当前的输入特征有关,还与前面的标签预测有关,预测标签之间的相互依赖关系非常密切。010302感谢欣赏项目4文本信息抽取

MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304关系抽取什么是关系抽取关系抽取(RelationExtraction,RE)是就是从非结构化文本中提取实体之间的关系。是从自然语言文本中抽取实体及其之间关系的信息技术,是信息检索、智能问答、智能对话等人工智能应用的重要基础,一直受到业界的广泛关注。关系抽取是信息抽取领域的重要分支,是构建知识图谱的重要技术环节。构建知识图谱必须进行知识抽取,知识抽取包括三个要素:命名实体识别(NER)、实体关系抽取(RE)和属性抽取。而命名实体识别(NER)和实体关系抽取(RE)是知识抽取中非常重要的部分,也是自然语言处理的研究问题之一。命名实体识别任务是在一个句子中找出具有可描述意义的实体,而关系抽取则是对两个实体的关系进行抽取。命名实体识别是关系抽取的前提,关系抽取是建立在实体识别之后。010203whatisRelationExtraction?关系抽取算法:按照发展历程可以划分为三种类别:基于规则的关系抽取算法、基于机器学习的关系抽取算法、基于深度学习的关系抽取算法。其中机器学习又包括监督学习,无监督学习,半监督学习。深度学习主要是监督学习和远程监督学习。基于规则的关系抽取主要是通过人工定义一些抽取规则,从文章中抽取出实体-关系-实体三元组信息。其目标是找出尽可能多的拥有关系的实体对。bananaisafruit基于规则的关系抽取算法有监督学习的关系抽取半监督学习的关系抽取:基于半监督学习的关系抽取方法主要有Bootstrap算法和snowball算法。无监督学习的关系抽取无监督学习是对于没有标记的样本,学习算法直接对输入数据集进行建模,例如聚类基于机器学习的关系抽取算法随着深度学习以及词向量的发展,近年来大多的关系抽取模型都采用词向量做为关系抽取的主要特征,且均取得了很是好的效果。有监督的关系抽取方法:远程监督的关系抽取方法基于深度学习的关系抽取算法事件抽取什么是事件抽取事件(Event)指的是发生在某个特定的时间段、某个特定的地域范围内,由一个或者多个角色参与的一个或者多个动作组成的事件或者状态的改变。事件抽取是把含有事件信息的非结构化文本以结构化的形式呈现出来。命名实体识别、关系抽取、事件抽取是NLP中信息抽取的主要任务。ACE定义中的事件由事件触发词和描述事件结构的元素构成。事件触发词是能够触动事件发生的词,是决定事件类型最重要的特征词,决定了事件类别或子类别。元素用于填充事件模版,两者完整的描述了事件本身。010203whatisEventExtraction?EE事件抽取算法:事件抽取任务总体可以分为两大类:限定域事件抽取和开放域事件抽取。限定域事件抽取在进行抽取之前,预先定义好目标事件的类型及包含哪些具体的事件元素,通常会给出一定数量的标注数据。开放域事件抽取在进行事件识别之前,可能的事件类型以及事件的结构都是未知的,因此该任务通常没有标注数据。。限定域事件抽取算法限定域关系抽取是指系统所抽取的关系类别是预先定义好的,通过人工定义或者从现有知识图谱中自动获取。限定域事件抽取方法包括基于模式匹配的方法基于机器学习的方法两种。开放域事件抽取算法开放域事件抽取在进行事件识别之前,可能的事件类型以及

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论