版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
自然语言处理项目2中文分词与关键词提取MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304基于词典的中文分词简单来说,中文分词是指将汉字序列按照一定规范、逐个切分为词序列的过程。例如:南京市长江大桥,分词结果:南京市/长江大桥。不同于中文分词,英文分词就简单许多,因为英文单词之间以空格隔开,所以进行分词时可以利用空格作为切分单位。而中文是以字为基本单位,不像英文那样依靠天然的空格作为分隔符,因此中文分词一直是中文信息处理中比较困难的问题并且是一个尚未完全有效解决的问题。中文分词的关键问题:歧义切分字段处理、未登录词的处理什么是中文分词基于词典的分词方法
正向最大匹配法01逆向最大匹配法02双向最大匹配法03基于词典的分词方法又叫机械分词方法,是目前使用最为广泛的一类按照一定的策略将待分析的字符串和一个已建立好的“大机器词典”中的词进行匹配的分词算法,若在词典中找到某个词条,则说明匹配成功,其优点在于识别速度快,方法简单,不过也存在严重依赖词典,无法很好的处理分词歧义和未登录词等问题。基于统计的中文分词N元文法模型如果认为一个词的出现仅仅与它左边的N-1个词有关,那么此时的语言模型就称为N元文法(N-gram)。当N=1时,出现在第i个位置的词wi与左边的词无关,也就是说独立于历史,称为一元文法(uni-gram)。当N=2时,出现在第i个位置的词wi与左边的一个词有关,称为二元文法(bi-gram)。此时,每个词的出现要受左边相邻词的约束,因此比起无约束的一元文法,二元文法的效果明显要好很多。当N=3时,出现在第i个位置的词wi与左边的两个词有关,称为三元文法(tri-gram)。此时,每个词的出现要受左边相邻两个词的约束,因此比起二元文法,三元文法的效果明显要好很多。很显然,N越大,语言模型越精确,效果越好,但是随之而来的问题就是句子概率的计算量过大。所以在实际使用时要权衡精度与计算量之间的平衡关系。隐马尔可夫模型隐马尔科夫模型与马尔科夫模型有密切的关系,是一个双重的随机过程,这里存在一个我们不知道的状态序列,只知道状态转移的概率,也就是说,模型的状态转换过程是不可观察的,但是状态之间转移的可能性是知道的。隐马尔可夫模型的组成:隐马尔可夫模型的组成主要由状态转移概率矩阵、观测状态生成矩阵、隐状态初识概率分布组成,主要解决观测序列概率、模型参数学习、解码问题隐马尔可夫模型的两个基本假设:隐马尔可夫模型的两个基本假设分别是齐次马尔科夫性假设与观测独立性假设。关键词提取关键词提取是自然语言处理中非常核心、非常基础的技术。关键词是一组词,它们能够代表文章的主要内容。当我们面对海量文档的时候,我们不可能阅读所有内容,通常我们只会去关注哪些我们感兴趣的文档。那么如何才能找到我们感兴趣的文档呢?如果把每篇文档的关键词都提取出来,我们就可以根据关键词快速选择我们需要的文档内容了。关键词提取算法主要还是机器学习算法,并且分为两大类,一类是有监督机器学习算法,另一类是无监督机器学习算法。什么是关键词提取基于统计特征的关键词提取算法(TF,TF-IDF词频-逆文档频次算法)基本思想是评估在一个文档集中某一个词对于某一份文档的重要程度。重要程度越高,越有可能是关键字。在基于统计特征的关键词提取算法中,需要准备一个语料库,语料库的覆盖程度决定了关键词提取算法的质量。TF-IDF算法:TF和IDF从两个方面衡量一个词在文档中的重要程度,单独使用都不全面,如果将两个方法结合起来,就会得到一个比较完美的结果,这就是TF-IDF算法,也就是将TF与IDF相乘,即TF-IDF=TF*IDF(相乘),TF-IDF与一个词在文档中的出现次数成正比,与该词在整个语料中的出现次数成反比。基于统计特征的关键词提取主题模型(TopicModel)属于隐含语义分析技术,目的是找出潜在的主题或分类。LDA模型概述:LDA是LatentDirichletAllocation的缩写,意思是潜在狄利克雷分布。LDA算法使用非常广泛,涉及检索、文本分类、主题词抽取等领域。基于主题模型的关键词提取基于词图模型的关键词提取算法基本思路是:首先构建语言网络图,然后对网络图进行分析,在网络图中寻找最重要的词,这些词就是文档的关键词。语言网络的形式主要有四种:共现网络图、语法网络图、语义网络图和其它网络图。TextRank算法:TextRank算法完全采用PageRank的思路,所不同的是将网页换成了词语,网页重要性排序变成了词语重要性排序,排在前面的词语当然就是关键词。现在的关键问题是如何为词语构建一张网络图。基于词图模型的关键词提取感谢欣赏自然语言处理项目12推荐系统MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304认识推荐系统什么是推荐系统推荐系统(RecommenderSystem)是一种在大数据时代背景下,为了解决信息过载问题,根据用户需求、兴趣等,使用计算机方法从海量数据中提取用户感兴趣的项目(如信息、服务、物品等),并将结果以个性化列表的形式推荐给用户的计算机方法。推荐系统根据用户历史行为信息来构建用户兴趣模型并向用户推荐其可能感兴趣的信息,被广泛用于个性化服务领域,在推荐者和寻求推荐者之间做出良好匹配的能力。一个推荐系统在进行推荐时有3个要素:用户、物品、推荐算法。推荐系统的分类非个性化推荐系统是基于热度、流行度等向用户推荐最受欢迎的项目,如近期最受欢迎的前10部电影、最畅销的书籍、最常购买的产品。个性化推荐系统的研究与应用越来越多,最早是由Malone等研究者于1987年提出,最初个性化推荐系统应用于电子商务中,通过分析其他用户的评价信息向当前用户进行推荐。个性化推荐系统主要分为基于关联规则的推荐系统、基于内容的推荐系统、协同过滤的推荐系统等。协同过滤的推荐系统又分为基于用户的协同过滤的推荐系统和基于任务的协同过滤的推荐系统。推荐系统可分为非个性化推荐系统(NonPersonalizedRecommendationSystem)与个性化推荐系统(PersonalizedRecommenderSystem)两大类推荐系统中的技术介绍基于规则的推荐算法属于基于知识推荐中的一种,通过将待推荐项目的属性与用户属行进行匹配进行推荐,或者是根据数据挖掘中的规则进行推荐,这些规则可以通过关联计算得到,也可以由领域的专家事先定义好。规则的形式一般都是IF-THEN语句,规则通过将用户的属性、购买历史记录和待推荐项匹配起来,获得推荐列表,因此这种算法要求用户的属性结构特征必须与规则中的属性完全一致才能够精准匹配,只有成功匹配出一系列的规则,才能完成推荐。基于规则的推荐系统基于内容的推荐算法的应用场景基于内容的推荐是使用用户的历史记录,将用户已经选择过的项目内容和用户提供的个人信息进行相似度计算,建立用户的档案,分析用户的兴趣所在。在基于内容的推荐中,计算对象的特征与用户兴趣的相似度是推荐系统的核心,一般采用特征加权的方法。这种方法建立用户档案的关键词向量,并计算每个关键词的权重,之后对新的对象进行计算评分。基于内容过滤推荐系统协同过滤推荐系统协同过滤是目前推荐系统中应用最为普遍的技术之一。协同过滤的基本思想是项目评分相似的用户的兴趣爱好也比较相似,通过相似用户对某一待推荐项目的评分来预测指定使用者对某一候选待推荐项目的评分。根据问题解决方式,可以将协同过滤分为基于领域近邻和基于模型等两类不同的算法领域近邻又可分为用户近邻和物品近邻,基于用户近邻被称为基于用户的协同过滤,是统计用户共同交互物品的数量定义用户之间的相似度,寻找用户的近邻,然后为用户推荐近邻喜欢的但此用户未交互过的物品。基于物品近邻,是统计两两物品被多少相同用户购买,以共同用户在购买俩物品的所有用户中的占比作为物品之间的相似度,寻找物品的近邻,然后为用户挑选历史交互物品的近邻作为推荐结果01020304基于深度学习的文本分类深度学习工具在使用深度学习方法的过程中,需要编写大量的代码,在这些代码中,有很多是具有共性的代码,任何一个使用深度学习方法的人都需要写这些代码,所以实际上有很多代码是重复代码。为了提高工作效率,有人将这些重复代码抽取出来,写成一个框架放到互联网上,供学习和研究者使用。随着时间的推移,一些性能优良的框架逐渐流行起来。比较主流的框架:TensorFlow、Keras、PaddlePaddle、PyTorch、Caffe循环神经网络(RecurrentNeuralNetwork,RNN)是最早运用到自然语言处理中的神经网络。RNN处理的输入数据为离散序列数据,并以离散序列的形式输出,在RNN内部通过结构设计捕捉输出与输入之间的关系特征LSTM是RNN的一种变体形式,在RNN原有的结构上引入了几道门:遗忘门、输入门和输出门。循环神经网络TextRNN模型TextRNN是专门用于处理文本数据的RNN,最典型的是处理文本的分类问题。前面说过,N对1的RNN特别适合处理文本分类问题,因此可以把N对1的RNN作为TextRNN的基本结构基于Attention机制的文本分类Encoder-Decoder结构Encoder-Decoder结构又称Seq2Seq模型。深度学习中SequencetoSequence(Seq2Seq)模型的目标是将一个序列转换成另一个序列。包括机器翻译(machinetranslate)、语音识别(speechrecognition)和时间序列预测(timeseriesforcasting)等
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 层间侧向刚度、新建建筑层间极限受剪承载力计算、底部配筋小砌块砌体抗震墙抗震设计要求、砌体、混凝土、钢筋材料性能设计指标
- 2026年实验室废物处置规范课件
- 2025-2026学年统编版三年级上册语文第三单元测试卷及答案
- 2026 年水资源危机现状科普警示课件
- 2026 年国庆同心筑梦新征程爱国主义思想教育课件
- 2026 年春节拜年文化礼仪科普课件
- 医院感染防控知识考核试卷及答案
- 家用纺织品设计师创新意识模拟考核试卷含答案
- 模特操作测试考核试卷含答案
- 农产品食品检验员岗后水平考核试卷含答案
- 第6课 全球航路的开辟 授课课件(共26张)
- RTO焚烧炉日常巡检操作规程
- 2026秋新教材人教版小学数学四年级上册教学计划及进度表
- 2026腰椎间盘突出症患者术后护理
- 2026年四川高考化学试卷答案详解及复习备考指导
- 2026年秋季学期中小学1530安全教育记录
- 2026年中级银行从业资格《银行管理》考试真题(后附解析)
- 历年中考英语高频词汇汇编(真题800词版)
- 资阳空港私募基金管理有限责任公司市场化招聘(10人)笔试参考题库及答案详解
- 餐厅收银员操作规范
- (2026版)《中华人民共和国民族团结进步促进法》解读
评论
0/150
提交评论