付费下载
下载本文档
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、题目:基于知识的智能问答技术(PDF)作者:许坤,冯岩松(北京大学)作者简介:许坤,北京大学计算机科学技术研究所博士生,研究方向为基于知识库的智能问答技术,已连续三年在面向结构化知识库的知识问答评测 QALD-4, 5, 6 中获得第一名。冯岩松,北京大学计算机科学与技术研究所讲师。 2011 年毕业于英国爱丁堡大学,获得信息科学博士学位。主要研究方向包括自然语言处理、信息抽取、智能问答以及机器学习在自然语言处理中的应用; 研究小组已连续三年在面向结构化知识库的知识问答评测 QALD 中获得第一名;相关工作已发表在 TPAMI 、ACL 、 EMNLP 等主流期刊与会议上。作为项目负责人或课题
2、骨干已承担多项国家自然科学基金及科技部 863 计划项目。分别在 2014 和 2015 年获得 IBM Faculty Award。引言近年来,信息抽取技术的快速发展使得快速构建大规模结构化、半结构化知识库成为可能。一大批结构化知识库如雨后春笋般涌现出来,如Google KnolwedgeGraph (Freebase)、Yago,DBpedia、微软 ProBase、搜狗知立方及百度等企业内部的知识图谱等。同时,这些大规模知识库也被应用于关联检索、 个性化推荐、知识问答等任务中。相比于传统基于文本检索的问答系统, 利用知识库回答自然语言问题可以为用户提供更精确、简洁的答案,因此一直受到学术
3、界和工业界的广泛关注。精选文库目前基于知识库的问答技术可以大致分为两类。 第一类基于语义解析的方法。 这类方法通过学习相关语法将自然语言转问题转换成可以用来描述语义的形式化语言,如逻辑表达式等。构建这样的语义解析器需要大量的标注数据,例如,自然语言问题及其对应的语义描述形式。 然而,针对 Freebase这样大规模的结构化知识库,在实际中很难收集到足够多的高质量训练数据。 另外,语义描述形式与知识库的结构之间的不匹配也是这类方法普遍遇到的一个问题,例如,在Freebase中并没有 “爸爸 ”或 “妈妈 ”这样的谓词关系,只有 “父母 ”,因此,如果想表示 “A是 B 的母亲 ”这样的关系,则需
4、明确表示为 “<B,父母 ,A>” 并且 “<A, 性别 , 女性 >”。另一类知识问答技术是传统的基于信息检索的方法。 这类方法不会将自然语言问题完全转换成形式化的语义描述, 而是首先利用实体链接技术从知识库中收集候选答案集合, 然后构建排序模型对候选答案进行排序。 因为不需要完整地解析自然语言问题的语义结构, 因此,这类方法构造训练数据的过程相对简单, 只需收集问题答案对即可。实验表明 ,基于检索的方法对语义简单的自然语言问题比较有效,但是难以处理语义结构复杂的问题, 尤其是包含多个实体和关系的自然语言问题。例如,对于自然语言问题 “What mountain is
5、 the highest in North America ?”,检索类的方法由于缺乏对 highest 的正确解析,通常会将所有坐落在北美的山脉返回给用户。 事实上,为了得到正确的答案, 问答系统还需要根据山脉高度对候选答案进行排序, 并选择海拔最高的山脉返回给用户。 该过程通常需要人工编写解析规则对答案进行筛选, 费时费力。此外,由于自然语言描述的多样性,人们也无法事先穷举所有这样的规则。然而事实上, Freebase这样的结构化知识库希望存储关于真实世界的知识条目,而像维基百科页面这样的文本百科资源则存储支持这些事实的文本描述。 例如,在维基百科页面中,我们可以找到一段与候选答案有关的文
6、本Denali (also known as Mount McKinley, its former official name) is the highest mountain peak in North America, with a summit elevation of 20,310 feet (6,190 m) above sea level。-2精选文库很明显可以看出,这段文本描述可以帮助我们提升Denali 或者 MountMcKinley作为正确答案的置信度,并过滤掉候选集中的错误答案。正是受到这个发现的启发, 我们提出同时利用结构化知识库与可信的文本百科资源,如维基百科页面,来
7、回答知识类自然语言问题。基于多种知识资源的问答技术框架-3精选文库图 1:针对问题 who did shaq first play for 的流程图-4精选文库以样例问题 who did shaq first play for 的处理流程为例,图 1 展示了融合多种知识资源的问答框架。该问答系统框架主要包含基于结构化知识库 Freebase的问题求解和基于非结构化知识资源 Wikipedia 文本的浅层推理。? 基于结构化知识库的问题求解基于结构化知识资源的问题求解部分只需给出候选答案集合即可, 因此既可采用基于语义解析的方法, 也可以直接采用基于检索的方法来实现。 这里我们采用的是基于检索的
8、方案, 主要包括实体链接, 关系抽取,以及这两部分的联合消解三大部分。1) 实体链接实体链接在知识类问题解析中扮演着十分重要的角色。我们采用词性POS 序列来筛选问题中的所有实体候选,以前面的问题为例, 我们可以利用 POS 序列 NN识别出实体 shaq。对于识别出来的实体候选,我们使用实体链接工具 S-MART 获取可以潜在链接到 Freebase的 5 个候选实体。具体而言,对给定的实体候选, S-MART 首先根据字符串相似度从 Freebase中获取一些候选实体, 然后利用统计模型根据知识库实体与实体候选之间的共现频率计算出一个得分并排序, 最终给出实体链接结果。2) 关系抽取关系抽
9、取用于识别问句中的实体与答案 (疑问词) 之间的语义关系。 我们使用多通道卷积神经网络来确定自然语言问题中实体与答案之间存在的关系。 具体地讲,我们使用两个通道, 一个通道捕捉句法信息, 另一个通道捕捉上下文信息。 每个通道的卷积层接受一个长度不固定的输入, 但是返回一个固定长度的向量 (我们使用最大采样法)。这些固定长度的向量被拼接在一起形成最后 softmax 分类器的输入,该分类器的输出向量维度等于关系类别的总数, 每一维的值等于映射到对应知识库谓词的置信度。3) 实体和关系的联合消歧-5精选文库通常情况下的实体链接与实体关系抽取都是独立预测的, 因而不可避免的会存在流水线框架下常见的错
10、误传递现象。 因此,我们提出了一种联合优化模型从实体链接和关系抽取的候选结果中选择一个全局最优的 “实体 -关系 ”配置。这个挑选全局最优配置的过程本质上可以被视作一个排序问题,即, “合理 ”的实体 -关系配置在知识库中应更常见, 应该有更高的得分。 我们主要依赖从知识库中抽取的三类特征,即实体特征、关系特征和答案的特别特征。? 基于 Wikipedia 文本描述的浅层推理基于结构化知识库求解的候选答案集, 我们从维基百科文本资源中收集候选答案的支持文本,并训练答案过滤器对候选答案集进行筛选,以得到更准确的答案。1) 数据预处理具体地讲,我们首先从维基百科中找出描述自然语言问题中实体的页面。
11、 我们抽取维基百科页面的内容,并利用 Wikifier 识别句子中的维基百科实体,再利用 Freebae API 将这些实体映射到 Freebase中的实体。最后在页面中寻找包含候选答案的句子当做支持文本。2) 答案过滤模型我们将浅层推理的过程抽象为一个面向候选答案的二分类任务。在实验中,我们使用 LibSVM 来训练该二分类器。该分类器主要使用的特征是词级别配对特征,其中第一个部分来自给定的问题, 而第二个部分来自维基百科中的支持文本。更形式化地,给定一个问题 q = <q1 n和一个作为支持文本的句子s =,q><s , ,s >,其中记 q 和 s 中的单词分别为
12、q 和 s 。对每个问题与支持文本对(q,1mijs),我们可以生成词级别配对特征集合(q i , sj) ,这些词对出现的次数作为特征用来训练分类器。 需要指出的是, 这里仅尝试了最简单的二分类方式,主要目的是检验附加文本资源的作用; 而使用线性优化、 或神经网络等更精巧的融合方式可能会带来更明显的准确率提升。实验-6精选文库我们使用 WebQuestions数据集进行相关实验。 该数据集一共包含 5810 个自然语言问题以及答案。其中训练集包含 3778 个问题( 65%),测试集包含 2032 个问题( 35%)。我们使用答案的平均 F1 值来评测本框架。表 1 给出了不同方法在WebQ
13、uestions数据集上的结果。方法平均 F1(Bast et al. 2015)49.4(Berant et al. 2015)49.7(Reddy et al. 2016)50.3(Yih et al.2015)52.5本研究工作Structured44.1Structured + Joint47.1Structured + Unstructured47.0Structured + Joint + Unstructured53.3表 1 基于关系抽取问答技术在WebQuestions数据集上的结果为了确定所提出框架中不同模块的重要性,我们详细比较了以下几种模型变种的结果。Structure
14、d该方法只包含基于结构化知识库Freebase的问题求解。具体地讲,我们首先进行实体链接, 将自然语言问题中包含的实体名词映射到 Freebase中的实体,其中得分最高的实体被当做结果。 然后我们进行关系抽取并从候选关系中选择与实体最匹配的关系当做最终的实体 -关系配置。最后,我们使用这个实体 - 关系配置来预测问题的答案。Structured + Joint 与上面的方法略有不同,这个方法使用联合消歧的方法去选择全局最优的实体 -关系组合,并进行基于结构化知识库的问题解答。-7精选文库Structured + Unstructured 这个方法里,我们使用流水线的实体链接和关系抽取结果进行基
15、于结构化知识库的问题求解, 进而,利用基于维基百科的浅层推理来筛选答案。Structured + Joint + Unstructured 这是我们所提出的融合多种知识资源的完整的问答框架。 我们首先在结构化知识库 Freebase上进行问题求解, 即,进行实体链接和关系抽取的联合优化, 并在 Freebase上获得候选答案集合; 在此基础上进行基于文本的浅层推理, 即,从维基百科中抽取答案支持文本, 并对候选答案进行筛选,获得最终答案。从表 1 中的结果,我们可以发现实体链接和关系抽取的联合推理结果会优于流水线方法,整体效果提高了 3%,并且比大部分语义解析的方法要好。另一方面,与(Yih
16、et al. 2015)利用人工编写规则的工作相比,融合结构化知识库与文本知识资源的方法在问答准确率上整体提高了 0.8%,这进一步说明了恰当的使用非结构化的文本知识资源可以在很大程度上代替人工编写规则来辅助回答自然语言问题。本文提出的融合不同知识资源的问题解答框架具有较好的可扩展性, 无论在结构化知识库求解部分, 还是多种资源的融合利用方面都可进一步改进, 以更大限度的发挥不同资源之间的互补作用,提高知识类问题的解答精度。参考文献? Hannah Bast, Elmar Haussmann. More Accurate Question Answering on Freebase. CIKM
17、. 2015, 1431-1440? Jonathan Berant, Percy Liang. Imitation Learning of Agenda-based Semantic ParsersJ. Transactions of the Association for Computational Linguistics. 2015, 3:545558? Siva Reddy, Oscar T?ckstr?m, Michael Collins, Tom Kwiatkowski, Dipanjan Das, Mark Steedman, Mirella Lapata. Transformi
18、ng Dependency Structures to-8精选文库Logical Forms for Semantic ParsingJ. Transactions of the Association for Computational Linguistics. 2016, 4: 127-140? Kun Xu; Siva Reddy; Yansong Feng; Songfang Huang; Dongyan Zhao Question Answering on Freebase via Relation Extraction and Textual Evidence. ACL 2016,? Kun Xu; Yansong Feng; Songfang Huang; Dongyan Zhao, Hybrid Question Answering over Knowledge Base and Free Text, COLING 2016? Yi Yang; Mi
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 电影娱乐行业数字化内容制作与推广方案
- 口是心非游戏讲解
- 2025 高中语文必修上册《 青蒿素 人类征服疾病的一小步》青蒿素研究的产学研合作模式课件
- 沈阳工学院近期考试题及答案
- 客运值班员英语考试题及答案
- 血透室火灾应急预案
- 2025年临床执业医师《实践技能》考核卷
- 医保定点医药机构日常稽核迎检培训试题及答案
- 核酸检测护士试题及答案
- 医疗器械不良事件报告制度与流程
- 2026年安徽城市管理职业学院单招职业适应性测试题库带答案详解(新)
- 应急管理干部警示教育以案促改心得体会
- 冀教版八年级英语下册Lesson28 Ms Lius Great Idea 核心素养教案
- 2026年小学六年级下册劳动教育教学计划
- 2026春小学科学青岛版(五四制2024)三年级下册教学计划、教案及每课教学反思(附目录)
- 2026年内蒙古化工职业学院单招综合素质考试题库及一套参考答案详解
- 2026上海交通大学医学院招聘91人考试备考题库及答案解析
- 2026年南京铁道职业技术学院单招职业适应性考试题库附答案详解(夺分金卷)
- 2026年春季人教PEP版五年级下册英语教学计划含教学进度表
- (2026年)海姆立克法急救培训课件
- 湖北2025年湖北科技学院招聘19人笔试历年参考题库附带答案详解
评论
0/150
提交评论