版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第六章词嵌入与词向量本课目标了解什么是文本向量化掌握One-Hot编码的作用及方法掌握词嵌入的概念和意义掌握Word2Vec的概念、作用和应用了解Doc2Vec的概念和作用Coursecatalogue课程目录文本向量化1One-Hot编码23Word2Vec4词嵌入Doc2Vec5文本向量化文本向量化所谓文本向量化,即将文本表示成计算机可识别的实数向量,方便计算机处理。文本向量化的方法主要分为离散表示和分布式表示。Coursecatalogue课程目录文本向量化1One-Hot编码23Word2Vec4词嵌入Doc2Vec5One-Hot编码One-Hot编码One-Hot编码的每一个维度都代表了语料库中一个独立的词汇,然后用1代表某个位置对应的词是存在的,0代表不存在的,这是向量化最简单的一种方法。常规操作是先将语料库内所有的词依照出现的顺序排序,然后将每个词语对应到相应的下标。One-Hot编码One-Hot编码例1有以下三个句子:1)我爱人工智能2)我在学习人工智能3)NLP是人工智能的重要研究方向步骤1 分词。使用分词工具对三句话进行分词,得到如下结果:1)我爱人工智能2)我在学习人工智能3)NLP是人工智能的重要研究方向步骤2 构建词典。将出现过的词构建成一个词典,这个词典依次包含10个词,如下:{我,爱,人工智能,在,学习,NLP,是,的,重要,研究方向}One-Hot编码One-Hot编码步骤3 编码。根据编码规则,每个词对应的One-Hot编码如表所示步骤4 生成特征向量。一句话的特征向量即是该样本中的每个单词的One-Hot向量直接相加,这样,本例中的3句话表示成如下:1)我爱人工智能:[1,1,1,0,0,0,0,0,0,0]2)我在学习人工智能:[1,0,1,1,1,0,0,0,0,0]3)NLP是人工智能的重要研究方向:[0,0,1,0,0,1,1,1,1,1]One-Hot编码One-Hot编码由于One-Hot表征单词的方法每个单词都是独立的、正交的,这就导致了无法通过One-Hot编码计算不同单词之间的相似程度。例2假设在文本样本中包含有北京、上海、天津和重庆四个词,它们的One-Hot编码形式如图所示。Coursecatalogue课程目录文本向量化1One-Hot编码23Word2Vec4词嵌入Doc2Vec5词嵌入什么是词嵌入词嵌入实际上是一类技术,单个词在预定义的向量空间中被表示为实数向量,每个单词都映射到一个向量。例如,在一个文本中包含“queen”、“king”、“man”、“woman”等若干词,而这若干单词映射到向量空间中,这些向量在一定意义上可以代表这个词的语义信息,从而达到让计算机像计算数值一样去计算自然语言的目的。词嵌入词嵌入的实现例3假设词典的词汇表中有5000个词,要将句子“我爱人工智能”表示为一个128维的词向量,进行词嵌入的流程如下:步骤1One-Hot编码。根据词汇表的大小,将“我”、“爱”、“人工智能”以One-Hot方式进行编码,每个词都会转换为一个5000维的向量,那么整个句子被转换成为一个维度为3×5000的矩阵,记为V。这个矩阵有3行5000列,从上到下分别代表“我”、“爱”和“人工智能”三个词的One-Hot编码。步骤2确定嵌入矩阵。根据词汇表的大小(5000)和指定的词向量的维度(128),通过某种方法(具体方法将在后续小节中介绍),确定一个维度为5000×128维的嵌入矩阵,记为E。步骤3词嵌入。将矩阵V和E相乘,可以得到一个3×128维的矩阵,这个矩阵就是“我爱人工智能”这句话的嵌入向量。词嵌入语义信息在自然语言处理领域,使用上下文描述一个词语或者元素的语义是一个常见且有效的做法。我们可以使用同样的方式训练词向量,让这些词向量具备表示语义信息的能力。Coursecatalogue课程目录文本向量化1One-Hot编码23Word2Vec4词嵌入Doc2Vec5Word2VecWord2Vec概述作为Google的开源项目,Word2Vec以词嵌入为基础,利用深度学习思想对上下文环境中的词进行预测,经过Word2Vec训练后的词向量可以很好地度量词与词之间的相似性。Word2Vec包含两个经典的训练模型:连续词袋(ContinuousBag-of-Words,CBOW),通过上下文(输入)预测中心词(输出),可以理解为将一句话中的某个词扣掉,需要根据其它词来预测这个词是什么;Skip-gram,通过中心词(输入)预测上下文(输出),可以理解为给定一个词,预测这个词的前、后可能出现什么词。Word2VecWord2Vec模型:CBOW在CBOW中,先在句子中选定一个中心词,例如选取“natural”。选定好中心词后,将“I、love、language、processing”作为中心词的上下文。在训练的过程中,使用上下文的词向量推理中心词,这样中心词的语义就被传递到上下文的词向量中,从而达到学习语义信息的目的。Word2VecWord2Vec模型:Skip-gram在Skip-gram中,我们同样选定“natural”作为中心词,将“I、love、language、processing”作为中心词的上下文。与CBOW正好相反,在训练过程中,使用中心词的词向量去推理上下文,这样上下文定义的语义被传入中心词的表示中,从而达到学习语义信息的目的。Word2VecWord2Vec应用:相似度计算当用Word2Vec得到词向量后,一般我们会用余弦相似度来比较两个词的相似程度,定义为:Word2VecWord2Vec应用:类比推理词向量除了在语义上相近会被编码到临近区域,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025-2026年黑龙江省人教版初中历史第10章古代经济制度同步练习题
- 2025-2026年四川省人教版初中物理上册第6章知识点巩固习题
- 初中七年级历史交互动画课件教学设计-从出土文物中获取信息
- 统编版初中道德与法治七年级下册 7.2 做中华人文精神的弘扬者 教学设计
- 初中物理八年级上册2.2声音的特性教学设计
- 七年级地理《多变的天气》第二课时锋面天气系统与天气图判读教学设计
- 七年级语文《猫》教案
- 小学四年级英语Unit 5玩具主题教学设计
- 小学四年级劳动教学设计:沏茶中的统筹智慧-合理安排时间实践课
- 小学四年级道德与法治教学设计:探源物品来历 感悟中国创造智慧
- 危险货物运输车辆安全作业活动风险分析培训
- 《耳科学》全册配套教学课件3
- 文言文二则之《曹冲称象》教案(2课时)-2026-2027学年统编版六年级语文上册
- 2026南开大学校友工作办公室招聘劳务派遣人员1人考前冲刺试卷附参考答案详解【达标题】
- 2026秋译林版八年级英语上册【Unit1-8】全册语法专项练习(含参考答案)
- 2026年甘肃省酒泉矿业投资集团有限公司招聘考试备考试题及答案详解
- 初高中语文衔接第一课
- 高中常见不规则动词的过去式及过去分词背诵版
- 新版2026年秋教科版(新教材)小学科学四年级上册(全册)教学设计
- 清水混凝土模板设计施工方案及工艺方法
- 博士毕业生求职简历参考模板
评论
0/150
提交评论