版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
本申请提供了一种面向用户定位的地理词体包括将地理实体以及和地理实体相关联的文地理词向量对BiLSTM_CRF模型进行训练,利用训练后的BiLSTM_CRF模型进行地名识别与提2将所述地理语料库输入至BERT模型进行训练,获得所述地理语基于所述地理词向量对BiLSTM_CRF模型进行训练,利用训练后的所述BiL通过网络爬虫技术获取网站中关于旅游和美食话题的文本以及新闻将预处理后的所述生语料文本与人民日报标注语料库进行整合,获得所述地理语料模型的训练包括预训练阶段和微调阶段,所述预训练阶段用于对无标注的生语料进行训使用Kashgari库文件的evaluate函数对训练后的所述BiLSTM_CRF模型进行模型质量34地理词向量模型的研究主要有one_hot、Word2Vec等模型,但是它们均存在着以下几个问[0003]基于神经网络的深度学习技术在文本地理信息识别中引入了词向量来表示词种前后文关系转换成数学向量的形式。深度学习将地理词向量利用神经网络学习出特征,模型成为NER的主流技术,而GuillaumeLample等人借鉴其思想提出了双方向的长短期记忆网络模型(BiLSTM)和条件随机场模型(CRF)相结合的神经网络模型,能够获得双向的上来用于具有相关性的机器学习任务中去,基于这种重用思想,迁移学习(Transferlearning)将一个完整的训练任务划分为两个步骤:预训练(pre_train)和微调训练(fine[0006]预训练阶段:这个阶段的训练目标是生成包含可重用知识的模型——预训练模5深度学习方法的F1值为2.3高于On_分解决现有技术中存在的地理词向量特征单一以及对于特殊6[0027]使用Kashgari库文件的evaluate函数对训练后的所述BiLSTM_CRF模型进行模型[0028]根据本申请实施例的一种具体实现方式,所述模型质量的评估指标包括精准率、准率比通用地理语料库精准率高8个百分点,比单独的自制语料库精准率高4因此本申7了本文中所阐述的方面中的一或多者之外的其它结构及/或功能性实施此设备及/或实践个地理词语的地理词向量,所述地理词向量中包含了所述地理词语在句子中的上下文信[0051]步骤3、基于所述地理词向量对BiLSTM_CRF模型进行训练,利用训练后的所述8[0062]本申请所构建的地理语料库为1998年版的人民日报标注语料库以及自制地理文本语料库的结合体。1998年版的人民日报数据集是由中国Fujitsu有限公司和北大计算机然语言处理(NLP)任务的基础,分词的好坏甚至能够直接决定后续语义分析工作结果的精9以得到该语料中的每一个地理词语的地理词向量。本实施例利用BidirectionalEncoderRepresentationfromTransformers(BERT)模型作为语言模型来获得语言环境化的地理[0076]BERT模型的输入由三个部分的相加而来,这三个部分分别是TokenEmbedding,SegmentEmbedding和PositionEmbedding。其中,TokenEmbedding表示词的向量;SegmentEmbedding用来区分某一个单词属于哪一个句子;PositionEmbedding指示词在SentencePrediction,NSP)。在掩码语言模型任务中,输入文本中的一部分词语会用[0078]BERT模型在经过预训练阶段之后,就可以进入对特定应用任务的微调阶段了。CRF模型网络主体结构由双向的长期记忆网络模型(BiLSTM,BidiractionalLongShort[0080]双向长短时记忆网络模型,对每个单位序列都进行前向LSTM并且将它们同一时刻的输出合并起来作为最终的输出。这样对于每个时刻而言,每个词序来获取一个最佳的预测结果,这正好弥补了BiLSTM模型的不足之处。因此釆用CRF模型对[0092]使用Kashgari库文件的evaluate函数对训练后的所述BiLSTM_CRF模型进行模型计工作方法已经比较成熟,本实施例主要研究的语料库是专用于地理领域的地理语料库,[0107]本申请所构建的语料库为1998年版的人民日报标注语料库以及自制地理文本语料库的结合体。1998年版的人民日报数据集是由中国Fujitsu有限公司和北大计算机研究[0110]为避免被微博网站反爬机制干扰,首先需要设置HTTP请求头(主要设置Host、[0121]本次爬虫要抓取2020年全年的新闻,需要利用pandas库生成一个从20200101到[0122]通过分析发现新闻节目网页HTML代码中各条新闻的链接即为<li>标签中<a>标签的href属性内容,因此利用GET请求方式获取该标签下的内容即某日期当天新闻节目各条自然语言处理领域中称之为序列标注(Sequencelabeling)问题。一般常见的标注体系包进入微调阶段基于具体应用调整模型参数训练标[0142]BERT模型的输入由三个部分的相加而来,这三个部分分别是TokenEmbedding,SegmentEmbedding和PositionEmbedding。其中,TokenEmbedding表示词的向量;SegmentEmbedding用来区分某一个单词属于哪一个句子;PositionEmbedding指示词在[0144]BERT模型在经过预训练阶段之后,就可以进入对特定应用任务的微调阶段了。的是由google公司公开的一款中文BERT模型,下载后的文件路径应设置为BERTEmbedding结构由双向的长期记忆网络模型(Bi_LSTM)和随机条件场[0149]条件随机场(CRF,conditionalrandomfield)模型主要被应用来计算并确定某[0158]训
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 锅炉作业证考试理论会不会很难?备考怎么处理容易混淆的压力、水位、温度考点
- 心脏康复科普健康宣教
- 2021年度护理工作计划
- 2026年临床检验专项训练
- 转变教育思想大讨论总结报告(3篇)
- 2026年LNG船运市场发展预测
- 腰痛问题解析
- 2026及未来5年中国城市公路治安卡口视频监测系统数据监测研究报告
- 2026及未来5年中国叶绿素铜钠数据监测研究报告
- 2026事业单位工勤技能-江苏-江苏水工监测工二级(技师)历年参考题库含答案详解3套试卷
- 铝单板雨棚施工方案(3篇)
- 无缝钢管基础知识培训课件
- 实验实训三 叠加定理及戴维南定理验证
- 老旧小区下水井施工方案
- T-CSPSTC 72-2021 隧道衬砌脱空注浆治理技术规程
- 30HXY110A螺杆冷水机组开机、运行维护手册
- 大学学院智能制造工程专业教学大纲
- 卫生院“服务基层行”支撑材料(3.3.5患者参与医疗安全)
- 铝合金门窗安装施工工艺详解
- 三年级语文 综合性学习:中华传统节日公开课
- 高一语文起始课课件
评论
0/150
提交评论