(教育技术学专业论文)智能答疑系统的设计与实现.pdf_第1页
(教育技术学专业论文)智能答疑系统的设计与实现.pdf_第2页
(教育技术学专业论文)智能答疑系统的设计与实现.pdf_第3页
(教育技术学专业论文)智能答疑系统的设计与实现.pdf_第4页
(教育技术学专业论文)智能答疑系统的设计与实现.pdf_第5页
已阅读5页,还剩79页未读 继续免费阅读

(教育技术学专业论文)智能答疑系统的设计与实现.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 智能答疑系统的设计与实现 摘要: 随着人们开始越来越多的利用教学平台进行自学,如何从浩如烟海 的平台资源中快速定位对自己学习有帮助的信息就成为一个急待解决 的问题,智能答疑系统( i a s ) 正是致力于解决这样一个问题而产生的。 尽管当前对答疑系统的研究和实现比较多,但真正相对独立且能令教 学双方满意的答疑系统并不多见。本文尝试就在教学平台中如何开发 与实现智能答疑系统做出解答。 文章在详细分析了教学平台中实现答疑系统需求和特点的基础上, 对答疑系统进行了统一的设计和开发,提出以三种答疑机制相互协作 来构建一个高效且相对智能、安全的答疑系统,并以全文检索技术来 实现自动答疑模块。 随后,文章对全文检索理论作了深入的研究,结合答疑系统的需求, 依托不同检索理论的优点,在详细设计检索算法和流程并定义了索g f 文件的数据结构的基础上构建了一个相对独立的全文检索包,用以实 现对系统支持的多种答疑材料( 不同文件格式) 的全文检索。 通过对该全文检索包的调用,论文还给出了自动答疑及不良信息评 定的具体实现,并结合北京交通大学教学支撑平台的使用特点对自动 答疑在平台中的管理机制作了探索和具体实现。 论文最后,给出了系统的实验结果及分析总结,并就迸步完善和 改进提出了意见。 【关键词】智能答疑系统,全文检索,中文信息检索 a b s t r a c t d e s i g n a n d i m p l e m e n t a t i o n o fa n i n t e l l i g e n t a n s w e r s y s t e m a b s t r a c t w i t hm o r ea n dm o r ep e o p l eb e g i n n i n gt ol e a r nb yt h et e a c h i n gp l a t f o r m , h o wt of i n du s e f u li n f o r m a t i o nf r o ml e a r n i n gm a t e r i a li nt h e t e a c h i n g p l a t f o r mh a sb e c a m ea ne m e r g e n tp r o b l e m i n t e l l i g e n ta t l s w e rs y s t e mi s d e v e l o p e dt os e t t l et h i sp r o b l e m a l t h o u g hn o w t h e r ea r eal o to fr e s e a r c h a n di m p l e m e n t a t i o na b o u ta n s w e rs y s t e m ,f e wo ft h e ma r ec o m p a r a t i v e l y i n d e p e n d e n ta n ds a t i s f a c t o r yf o rb o t hs i d e so ft e a c h i n g t h i sp a p e rt r yt o s o l v et h ep r o b l e mo fh o wt od e v e l o pa n di m p l e m e n tt h ei n t e l l i g e n ta n s w e r s y s t e m ( i a s ) i no u r t e a c h i n g p l a t f o r m f i r s t ,w ea n a l y z e dt h er e q u i r e m e n to fh o wt oi m p l e m e n ti a s i no n r t e a c h i n gp l a t f o r m ,o nt h eb a s eo f t h a t ,w ed e s i g n e da n dd e v e l o p e dt h ei a s i nt h i ss y s t e m ,w ep r o p o s e dt h r e eq u e s t i o na n s w e r i n gm e t h o d sb yw o r k i n g t o g e t h e rt oc o n s t r u c ta l le f f e c t i v e ,s m a r ta n d s a f ei a s ,a n di m p l e m e n t e dt h e a u t o m a t i ca n s w e r s y s t e m w i t ht h e t e c h n o l o g y o f f u l l t e x ts e a r c h s e c o n d l y , t h et e c h n o l o g yo f f u l l t e x tw a sg i v e na ni n - d e p t hs t u d y w i t ht h e a d v a n t a g e st h a tc o m ef r o md i f f e r e n tt h e o r yo ff u l l t e x ts e a r c h ,w eh a v e d e s i g n e di nd e t a i lt h es e a r c ha r i t h m e t i ca n d d e f i n e dt h e p r o c e s so f i t b a s e d o nt h a t ,w ec o n s t r u c t e das e a r c hs o f t w a r ep a c k a g e ,w h i c hi su s e dt of i n i s h t h ef u l l t e x ts e a r c hi nd i f f e r e n tf o r m a tf i l e s b yc a l l i n gt h es e a r c hs o f t w a r ep a c k a g e a na u t o m a t i ca n s w e rm o d u l ea n d t h ea s s e s s m e n to fi l li n f o r m a t i o na r ei m p l e m e n t e d m e a n w h i l e ,w i t ht h e p e c u l i a r i t i e so ft e a c h i n gp l a t f o r mi nb e r i n gj i a o t o n gu n i v e r s i t y , w eh a v e a b s t r a c t e x p l o r e dt h em a n a g e m e n tm e c h a n i s mo f a u t o m a t i ca n s w e rm o d u l ei nt h e p l a t f o r ma n di m p l e m e n t e d i t f i n a l l y , w eb o u g h tf o r w a r dt h er e s u l t so f o u rt e s t sa n da n a l y z i n g m o r e o v e r , w ep r e s e n tt h es u g g e s t i o no fh o wt or e s e a r c hi nt h i sf i e l do fi a si nt h e f u t u r e 【k e yw o r d s 】i n t e l l i g e n t a n s w e r s y s t e m ,f u l l - t e x ts e a r c h ,c h i n e s e i n f o r m a t i o n r e t r i e v a l 独创性声明 y 7 4 1 9 5 0 本人声明,所呈交的学位论文是我个人在导师指 导下进行的研究工作及取得的研究成果。尽本人所 知,除了文中特别加以标注和致谢的地方外,论文中 不包含其他人已经发表或撰写过的研究成果,也不包 含为获得北京交通大学或其他教学机构的学位或证 二辟而使用过的材料。与我一起工作的同志对本研究所 做的任何贡献已在沦文中作了明确的说明并表示了 谢意。 本人签名: 日期:年一月一日 关于论文使用授权的说明 本人完全了解北京交通大学有关保留、使用学 位论文的规定,即:学校有权保留送交论文的复印件, 允许论文被查阅和借阅;学校可以公布论文的全部或 部分内容,可以采用影印、缩印或其他复制手段保存 论文。论文中所有创新和成果归北京交通大学计1 算机 与信息技术学院所有。未经许可,任何单位和个人不 得拷贝。版权所有,违者必究。 本人签名: 日期:年一月一曰 绪论 1 绪论 现代远程教育作为一种打破传统大学围墙、推行终生教育的一种传 播知识的方式正被广泛的接受。中共中央国务院关于全面推进素质教 育的决定以及教育部制定的面向2 1 世纪教育振兴行动计划也都 把实施现代远程教育工程作为一项十分重要和紧迫的任务来抓。作为 保障远程教育的高质量推行、维护教育双方满意度的因素之一,如何 使受教育者在短时问内比较准确的得到学习指导和帮助是远程教育系 统的一项重要组成,答疑系统正是基于这一方面进行了一些积极的探 索。 1 1 研究背景及意义 1 1 1 研究背景 当前,现代远程教育呈献出蓬勃发展的势头。一方面信息技术的高 速发展和普及为远程教育的知识传播奠定了坚实的物质基础;另一方 面,知识本身的价值提升和更新速度加快、终生学习理念的深入人心 使得越来越多的人开始利用这种时空不受限的学习方式。 但是,当大量的受教育者通过远程方式接受教育时,这种自主学习 方式让他们徘徊在浩如烟海的教育资源前面时不知所措,毕竟当他们 进入到一个全新的知识层面进行学习时,他们还缺少必要且高效的学 习途径。所以如何帮助受教育者能够在短时间内从海量的教育资源中 选择出对自己学习有帮助的信息也就自然的成为了保障远程学习高效 进行的一个重要环节它直接影响着教育双方对学习效果和学习工 北京交通大学硕士学位论文 具的满意度,因此也就有了对解决这样一个问题而设计的系统一一答 疑系统的需求。 从现有的答疑系统来看,国外由于在这方面的研究起步较早,且由 于西文浯系的特点,使得国外研究出的答疑系统产品智能性相对较高, 系统的查全率和查准率都很高。而汉语由于其分词的复杂性和语义识 别等方面的限制,国内对这方面的研究相对较落后,能被广泛使用且 深受好评的答疑系统也非常少见。 1 1 2 研究的必要陛及意义 在知识爆炸的今天,社会对个人的学习能力提出了更高的要求,通 过自学在短时间内掌握一些技能,已是社会对个人提出的新要求。既 然通过自学,肯定在自学中会遇到这样那样的问题,也就必然希望能 在短时划旱得到这些问题的答案,智能答疑系统正是基于这样一个事 实在这些方面作了一些有益的探索。 从更高的层面上来讲,学习型社会的需要和人们对终身学习理念的 认同以及我们国家远程教育的蓬勃发展,都迫切需要一个这么一个平 台,能够为使用者快速查找到问题的答案,也为指导者减轻工作强度。 1 2 答疑系统的研究现状 1 2 1 国外现状 由于西文语系的特点,国外对答疑的研究相对较早,因而成型产品 也比较多。如a s kj e e v e s 公司的a s k j e e v e sf o rk i d s ,m r r 人工智能实 验室的s t a r t ( s y n t a c t i c a n a l y s i s u s i n g r e v e r s i b l e t r a n s f o r m a t i o n ) ,美 国m i c h i g a n 大学的a n s w e rb u s 等。这些系统共同的特点是:( 1 ) 、国 绪论 外的智能答疑系统相对来讲独立性较强;基本上可将其视作单独模块 来满足对不同类型答疑材料的检索。( 2 ) 智能性方面,由于西方语系 的特点和分词技术研究相对较早,所以在处理机器理解自然语言方面 明显准确得多。另外,国外的智能答疑系统设计了对问题的确认交互, 从而使系统能更精确地理解用户意图,为更准确的获取答案提供了另 外一层保障。( 3 ) 开放性方面。这里的开放性主要体现在系统的资源 库方面。一方面,资源库的内容采用的是主题式或专业领域式,其范 围相对扩大了很多,也因此能容纳对更多问题的回答;另一方顽,系 统的资源库还具备一定的学习功能,能从网上其它网站中收集到问题 的回答并纳入库中。 1 2 2 国内现状 国内早期基本上没有专门的答疑系统,一般都是通过电子邮件、 留言板、b b s 等手段来回答学生提出的问题,基本上回避了人工智能、 专家系统等技术的应用。近几年,由于教学平台的需求以及中文语言 处理领域取得的突破,不少科研院所也加大了对答疑系统的研究和开 发,已经丌发出来的系统如上海交大的a n s w e rw e b 答疑系统,北师大 v c l a s s 教学平台中的a s k m e ! 答疑部件等。 a n s w e rw e b 自动答疑系统是一个基于动态的问题及答案的数据库。 在用户成功登录系统并选择课程后,用户就可以看到以本课程章节形 式呈现的已有的问题和答案。用户输入要询问的问题中的关键词进行 查询,系统将在问题与答案数据库中查找。如果找到了答案则将答案 呈现给用户,否则将问题存储在数据库中并自动转发给专家请求解答。 所有答案的呈现都是纯文本的形式。 北京交通大学硕士学位论文 这早重点研究一下a s k m e ! 答疑系统。这个系统主要由三部分组成, 分别是:对答疑材料的预处理、对问题文本的处理和结果的匹配查找 及处理。 1 、答疑材料的预处理主要是从材料中提取出一系列有效的关键词 组合( 记为s e t ( i ) ) 来表达文档i ,同时将材料和关键词的对应关系写 入系统的索引数据库; 2 、对问题文本的处理,即对使用者输入的内容进行切分词处理, 所用切词词典为记为k e y l ,处理的结果是要得到一个关键词组合( 记 为k e y 2 ) 来表达这个问题文本,这里的关键字组合都是k e y l 的子集: 3 、最后一部分是对结果的匹配查找及处理,实际上也就是以k e y 2 为条件用s q l 语句从索引库中查到所有含有这些关键词的材料编号, 按出现频率或时间先后按序显示查到的结果,当然这部分还应该包括 对其它一些材料的处理,如对要显示的材料进行统一截长、对其中所 含关键字进行高亮标示等。 a s k m e ! 答疑系统的重点就是对答疑材料的预处理,即提取出尽可 能有效的关键词来表达答疑材料,忽略其它不重要的关键词,这里面 不但涉及到对汉语文本的分词,还涉及如何从汉语文本中提取出新词 的问题,前者可以用现在即有的汉语分词算法( 如:二元分词法、最 大匹配分词算法等) 和基本词典实现汉语分词,后者则需要借助数理 统讨的知识将文本中出现多次,且又未曾在基本词典中出现的词辨别 出来,对于这一步系统的主要做法如下:首先读入答疑材料a 并计算 其中各汉字短字符串的所有子串在全文中出现的次数,并以此进行加 权计算( w = f + l 3 ,f 为子串出现的次数,l 为子串长) ,将大于阀门 的子串作为新词并存入临时词库:再对a 进行三级分词,即先用材料 本身指定的关键词对a 进行切分,之后再对结果用临时词库中的关键 4 绪论 词切分,最后利用基本词典切词,再对切完后的所有结果进行统计, 挑选出那些字串的 o ( = 子串a i 出现次数答疑材料a 中所有字 串数e t , o 为系统给定的阀值) 的串作为表达答疑材料的关键词并将 其存入系统的索引数据库。 可以看出,a s k m e ! 答疑系统由于利用了分词及新词统计等技术,因 而显得更具智能性。另外由于它的答案库并不是基于某个课程的,而 是建立在某个领域上,所以答案的选择范围就更广;而且存入其中的 不再是纯文本,而是h t m l 格式的文件,使答疑表现形式不再单一, 再加上在对答案的搜索上,该系统引入了权重这个概念,从而使得搜 索更加准确。但是也正是系统对分词的依赖,所以对分词的词典提出 了很高的要求,对于分词的不确定也需要更多的人工干预,这对于用 户来说,并不一定是件容易的事情。 最近,台湾学者在i n t e r n a t i o n a lc o n f e r e n c eo nw e bi n t e l l i g e n c e ( w i 0 3 ) 上发表了一篇文章as y s t e mf o rc h i n e s eq u e s t i o na n s w e r i n g ( i e e e c o m p u t e rs c i e n c e ) 介绍他们所做的答疑系统,也是我所找到的中文智 能答疑方面的最新的一篇文章。在这篇文章中作者描述了他们所做的 一个答疑系统,这个系统能自动从网上获取信息并利用他们对中文写 作习惯及中文句法等研究成果将信息作处理( 这也是它的两个特色之 一) 后纳入系统资源库,最终实现按相关度、相似度等权重指标来抽 取和显示答案。 综述分析国内答疑系统,我们得出以下结论: a 、系统的独立性、可移植性较差。答疑系统都是内嵌在教学平台 上,有的甚至是专门对某一课件的智能答疑。 b 、功能方面。国内已经开发出的智能答疑系统在功能上取得了一 定的进步,如北师大的答疑系统还将邮件的部分功能溶入了自己的系 北京交通大学硕士学位论文 统中,增强了系统的可用性,方便了用户的使用。 c 、系统的智能性。主要体现在机器对人类自然语言的理解上,与 其它领域,如图书检索等中文信息检索系统相比,国内现有的答疑系 统在这方面还比较落后。 d 、资源库的局限性。如上海交大的a n s w e rw e b 的资源库是以学 科章节为单位作为库的基本内容,这种方式虽然可以提高检索的效率 和切词的准确度,但不可避免的降低了系统的适用性,割裂了备课程 知识之剧的横向联系,不利于学生有效地进行基于知识的高层次学习 ( 如探究式学习、研究性学习) 。 e 、答案遗漏( 查全率) 。系统并不是能将所有相关答案返回,而是 对弱相关的答案进行了剔除,所返回的都是具有相对较强相关性的答 案。这在某些情况下显得并不是很合适,如答疑材料不是很丰富时的 情况。 当然事物的发展肯定是要经历一个过程,不可否认以上述两个系统 为代表的答疑系统的系统结构及特点都对后来者无疑具有深刻的启迪 意义。 1 3 论文的主要内容 依托北京交通大学教学支撑平台,我完成了自己的论文。论文主要 围绕以下三部分来进行的: 1 、介绍了当前中文答疑系统的研究现状,并结合北京交通大学教 学支撑平台,对如何在平台上进行答疑作了深入的探讨并给出了详细 的设计; 2 、对全文检索理论作了深入的研究,并结合答疑系统的需求,依 托不同检索理论的优点,构建了一个相对独立的全文检索包,用以实 6 绪论 现对系统支持的多种答疑材料( 文件格式不同) 的全文进行检索: 3 、结合教学平台的特点和运行环境对答疑系统的运行、管理机制 进行了一些探索和尝试,以此保证答疑及整个平台运转的稳定、高效。 北京交通大学硕士学位论文 2 在教学平台中实现智能答疑 2 1 答疑系统依附的教学平台的说明 本文中提到的答疑系统是基于我们的一个教学平台而开发 的,属于教学平台的子模块。所以要开发这样一个模块,必须是 基于教学平台现有的结构和实现方式的基础上,因此在这一节中 将简单介绍一下教学平台的功能结构和实现的方式。 2 1 1 教学平台概述 北京交通大学教学支撑平台是一套易用、高效的网上教学支撑 平台,主要是为了满足学生对大学计算机文化基础等公共课的学 习、辅导的需要,其主要功能如网上作业提交和批改、答疑、讨 论组、聊天、网上课堂和自主学习等。使用该平台的用户主要包 括三大类:教师及教辅人员、平台管理员、学生。教师通过网上 教学添加网络课程、电子教案并指定或添加教辅人员等;师生可 以在讨论区中发表文章、回复文章,还可以在聊天室内自由谈论 学习相关内容,甚至可以组织全部同学展开讨论。 平台统一采用b s 系统结构。客户端使用浏览器登陆系统进行相 关操作,服务器端使用j s p 开发w e b 站点,w e b 服务器使用r e s i n6 0 数据库使用s q ls e r v e r 2 0 0 0 企业版,操作系统使用w i n d o w s2 0 0 0 a d v a n c e ds e r v e r 。考虑到平台以后可能移植到不同操作系统的需 要,我们采用j s p + j a v a g e a n 的方式来实现整个应用,因为j s p 本身 具有跨平台的特性,可以很方便地根据需要将w e b 服务器端移植到 在教学平台中实现智能答疑 其它操作系统,如l i n u x 等。 由于教学平台有可能面临大量学生同时访问的情况,如果仅靠 j d b c 来完成对数据库的链接,显然将影响到整个平台的运行效率。 为了解决访问关系数据库所占资源过大的问题,这里采用了连接 池技术来管理访问关系数据库时的链接,即系统运行初期初始化 几个数据库链接,用于满足客户端频繁访问数据库的需要,当客 户端访问所需链接过多时则将其排成队列等待一定的时间,待初 始时所建立的链接中有空闲时,再将其中可用链接按顺序分配给 等待队列。 2 1 2 教学平台的功能描述 整个教学支撑平台也是基于b s 模式所开发的,用户只要在 连网的p c 机器上就能登录到平台进行学习。教学平台按模块划 分如下图所示。 图2 1 教学平台模块分类示意图 2 2 智能答疑系统需求分析 2 2 1 答疑系统的需求分析 构建答疑系统的根本目的就是要让学习过程中遇到疑问的学 生能尽快找到对该问题的解答,所以答疑系统最基本的需求应该 北京交通大学硕士学位论文 是学生能提问,任课老师或教辅人员能就这些问题进行回答,这 也就是要实现“一问一答”这种最基本形式的答疑。 另外,由于远程教学中学生较多,以及远程教学以学为主的 特点,在利用教学平台进行远程教学的过程中往往会遇到大量学 生提问的情况,让老师去回答每一个学生的提问显然是不现实的。 根据以往学科的教学经验,由于课程的内容具有经典和普遍的意 义,再加上学习者的认知规律存在一定范围的共性,学生对课程 的理解往往具有很多相似之处,所以他们所提出的问题中有6 0 一7 0 是相同的,因此要实现相对智能的答疑还必须建立一个检 索系统,当学生提出问题时应该先从答疑库中搜索匹配,如果发 现类似问题且已经被解答过,则可以直接将找到的问题和答案返 回给学生;而对于没有找到相似问题的情况,答疑系统应将该问 题的内容及链接发送到相关教师或教辅人员手中,以提醒他们及 h 寸回答问题,所以这一部分需求也是非常明确的,即要构建一个 检索系统,不仅能检索出相关问题,还能检索出与问题相匹配的 答案,同时当问题未被检索到时,还需要有能将问题转发给相关 教辅人员的电子邮件中的功能,以此来保证学生的提问能及时传 递给教师。 2 2 2 答疑材料需求分析 为了丰富答疑材料的类型,支持多种文件格式的答疑,我们 对常用的文件进行了分析,并把t x t 、d o c 、h u n 、h t m l 以及数据 库中存储的文本型字段中的内容作为答疑材料的固定形式纳入到 答疑子系统中,以丰富答疑文件的表现形式,从支持的答疑文件 来看,目前其它答疑系统都没有对以上不同文件格式的答疑材料 l o 在教学平台中实现智能答疑 提供支持,而且不同的文件格式,如h t m 文件,不但能在b o d y 中存储主要信息,还能通过文件本身的特点( 如标题信息、m e t a 等内容的增加) 来扩充原有信息内容,所以在进行答疑系统设计 时应考虑利用多种格式的答疑文件,以保证系统答疑的需要。 由于是对课程中遇到问题的文本解答,所以就答疑所用文件 火小而言,通常不需要很大的文件就能满足系统答疑的需求。同 时又由于可能需要对文件中内容进行检索,文件过大显然也不是 很合适,所蚍当这些文件在上载到答疑系统中时需要对其大小进 行限制。 2 2 ,3 用全文检索技术实现答疑系统中的检索模块 对于教学平台中存放在数据库中的答疑材料,当平台对答疑 的效率要求不高,且考虑简便的实现的情况下,如果对其内容的 检索的话,通常会用如下两种解决方案: 1 、直接使用s q l 语句的l i k e ”k e y w o r d ”来实现对数据库 中数据的查询。由于数据库索引不是为全文索引设计的,因此, 使用l i k e ”k e y w o r d ”时,数据库本身建立的索引是不起作用的, 搜索过程又变成类似于一页页翻书的遍历过程了,因此对于含有 模糊查询的数据库服务来说,l i k e 对性能的危害是极大的。而一 旦需要对多个关键词进行模糊匹配时则需使用: l i k e ”k e y w o r d l ”a n dl i k e ”k e y w o r d 2 ”一其查询效率也就 可想而知了。将如此效率的查询系统来提供给学习者,一旦数据 量非常大时,学习者是很难忍受如此的服务的。 2 、另外一种比较简便的方式就是直接利用数据库本身的全文 检索功能。常用的数据库都提供了全文检索模块,教学平台的后 北京交通大学硕士学位论文 台数据库使用的s q l s e r v e r ,也提供了全文检索。由于商业上 的原因,数据库系统提供商对其产品是如何实现全文检索视作其 商业机密之一,而对中文系统实现全文检索更是如此。 由于以上原因,加之大部分答疑材料还存放在不同类型的文 件中,而不仅仅是作为数据表的某个字段存储,所以要实现真正 全面的内容检索,就必须考虑其它方式,这里考虑使用全文检索 技术来实现答疑系统中检索模块。有关全文检索技术及其理论的 介绍将在下一章中阐述,这里就不再累述。 2 3 智能答疑系统的设计 2 3 1智能答疑系统的设计 一个功能完整而强大的智能答疑系统,能够很容易将来自 i n t e m e t i n t r a n e t 的学生的问题和老师的解答组织起来存放至相应 的答疑库中,同时提供多种答疑方式,从而尽可能地保证学生的 各种疑问方便地被解答。随着问题与解答资源的逐步积累,自动 答疑命中率将不断提高,并可以通过各种方式进行查询统计,使 答疑活动集中、高效。 基于以上的设计原则,我们在设计系统时考虑了三种答疑方 式,即:同步、异步和自动答疑相结合来满足智能答疑系统的需 求。图2 2 描述的是系统中三种答疑方式的协作机制: 1 2 在教学平台中实现智能答疑 图2 2 三种答疑方式的协作机制示意幽 以上答疑方式中,同、异步答疑方式的实现相对简单,基本 上是围绕数据( 问题及其答案) 的存取及维护而展开的,数据的 存放可以考虑在关系数据库中构建一个答疑库来保存这些数据。 而自动答疑部分,由于涉及到对答疑材料的全文检索,所以考虑 通过构建全文检索子系统来实现这部分功能,即对答疑库中的相 应数据构建索引数据库,然后依据该索引库再进行查询及定位, 最终实现对已存在答疑记录的检索。整个智能答疑系统的模型可 构建如图2 3 所示: 图2 - 3 答疑系统模型示意图 从以上模型中可以看出,系统主要结构包括两大部分,即全 文检索模块和同异步答疑模块,后者所产生的答疑材料主要存放 北京交通大学硕士学位论文 在答疑数据库中( 对于非字段方式存储内容即以文件形式存 在的答疑材料存放在指定目录下,同时将文件名存放在相应字段 中) ,同时为支持对即有问题及答疑材料的全文检索,就需要将答 疑库中的相关数据构建成单独的索引文件,以方便系统的快速查 找。 2 32 智能答疑系统中答疑数据库的设计 为实现答疑子系统,这里在关系数据库中增设了下面两个表, 详细说明如下: l 、问题表( 表名:k e t a n g _ q u e s t i o n ) ,主要存放学生所提问题及 问题的一些属性信息,如生成时间、是否已回复、不良信息等 级等: 2 、问题答疑表( 表名:k e t a n gd a y i ) ,主要用于教师对问题的答 复、答疑生成时问、是否为精华、信息不良等级等信息。这个 表中教师对问题的答复可以直接存放文本信息,也可以存放文 件名( 所对应的文件则存放在指定的文件夹下) ,当其中内容 被修改后都需要将其对应的生成时间进行更新。 2 3 3 智能系统功能模块划分 在仔细分析了答疑系统的需求并作了详细的设计后,我们将 答疑系统整个划分如图2 - 4 所示: 4 在教学平台中实现智能答疑 醺 学生 教师 尔 管理员 答疑浏览 提问 答疑全文检索 问题解答 答疑材料的管理 答疑统计 答疑全文检索管理 删除答疑材料 审核答疑材料 答疑精华管理 开启关闭自 动索引服务 索引重建 即时更新索引 管理 图2 4 答疑系统功能模块划分 答疑系统各模块功能说赐如下: 1 、答疑浏览主要负责的是将答疑材料及问题列出,其风格可 能类似b b s 。答疑浏览又分为两类,即对普通答疑材料方式的浏 览和对答疑中置为“精华”的材料的浏览。 2 、提问模块负责将学生提出的问题写入数据库,并依据全文 检索模块对其进行不良程度的判断,对问题文本中没有出现不良 词汇的,在存入数据库时将其标志位置换为“通过”,否则,将其 置换为“待审核”。提问模块还有个任务就是当问题没有被回答 时,需要获取到该问题所属课程的相关人员的e m a i l 地址,并将 问题及其相应链接按固定格式发送到该地址中; 3 、答疑的全文检索即对问题从索引文件中进行搜索匹配,并 按相关程度返回满足条件的答疑材料。 4 、问题解答是老师对学生提出问题发布相应答案的一个模 块。 北京交通大学硕士学位论文 5 、答疑全文检索管理模块负责的内容比较多,主要负责系统 后台所运行的索引服务的开关,自动索引时全文索引服务自动运 行的i i 白j 隔时间的设置,以及索引的即时更新和当索引文件出现问 题时必须用到的索引重建两项功能的提供。 6 、对于答疑材料的管理,主要是将系统中一些不确定的答疑 材料交由人工来进行审核、删除的操作,并允许相关教师对其所 属于的答疑材料标志为精华内容,以引起学生对经常遇到的问题 的注意,避免重复性提问。 2 3 4 智能答疑系统工作流程 在清楚了各模块及其功能后,有必要对整个答疑系统的工作流 程作个介绍,图2 。5 给出其工作的流程。 图2 5 智能答疑系统工作流程图 6 全文检索理论及方法 3 全文检索理论及方法 在教学平台中实现答疑系统的难点是如何实现系统的自动答 疑,尽可能减少人工的干预。自动答疑的本质上就是就学生提出 的问题从即有的答疑材料中匹配出尽可能精确的答案,并返回给 学习者,在上一章中我们提出用全文检索技术来实现这个功能, 本章将就全文检索技术理论及其模型作深入探讨。 3 1 全文检索技术简介 所谓全文检索( f u nt e x tr e t r i e v a l ) ,简单说来,就是以各类数 据诸如文字、声音、图像等为主要处理对象,根据数据资料的内 容,而不是外在特征来实现的信息检索手段。通过提供快捷的数 据管理工具和强大的数据查询手段,帮助人们进行大量文档资料 的整理和管理工作,使人们能快速方便地查到他们想要的任何信 息。 作为一种检索技术,全文检索还扩展了用户查询的自由度, 使用户能对原文的所有内容进行检索,打破了主题词对检索的限 制,使检索更直接、更彻底。作为基于全文标引的检索系统,它 本身不仅可以记录着二次情报,如题目、作者、出版日期、关键 字以及摘要等等,还记录大量的一次文献,即全文文本,所以它 可以把文献中出现的每一个词或短语都看作一个检索入口,允许 用户以自然语言检索而直接获得原文中的有关章节、段和句子, 参照和引用全文,这使得人们能迅速准确地从浩如烟海的文档中 获取有用信息,也正是由于全文检索在这方面的优点,使得这项 技术在信息处理领域获得了广泛的应用。 1 7 北京交通大学硕士学位论文 一个典型的全文检索系统的框架如下。在这个框架中,中心 部分是处理器,主要包括两个环节:第一,文档与查询如何进行 表示,第二,文档与查询的匹配方法,可以说,各种检索理论及 模型都是围绕这两个环节进行的。 图3 1 典型全文检索系统框架图 3 2 全文索引模型 全文检索的首要问题是全文索引模型的选择。在本节中介绍 了三种主流的全文索引模型( 即倒排表模型、p a t 数组模型、签 名文件模型) ,这些模型成型较早,各自在具备自身优势的同时也 存在一定的缺陷。如倒排表模型相对空间效率较差、检索效率低 下;而p a t 数组无论是创建过程,还是检索过程都严重依赖源文 本。所以目前针对这几种模型的改进也非常多,但基本的主要还 是这三类。 3 2 1 倒排表模型 倒排表( i n v e r t e df i l e ) 模型是目前比较通用的一种模型,其思想 也较简单,即在索引创建过程中对文本集进行顺序扫描并记下位 置信息,然后将其顺序写入索引中。由于倒排表模型结构和创建 过程本身联系比较紧密,并不需要进行一系列变化,且准动态的 倒排表模型的动态性能相对其它模型也比较好,因此该模型在商 业产品中应用较广泛。 全文检索理论及方法 l 、倒排表模型结构 完整的倒排表模型的索引由索引头指针和索引体两部分组 成。 索引头指针实际上就是一个一维数组,它以字符内码为下标, 记录各个字符的索引在索引体中的开始位置,记为n o d e i 。 索引体( 见图3 2 ) 可以看成是各行数据依次首尾连接形成 的一维数据流。图中每一行存放一个字符a i ( i 0 , n ) 的索引数 据,其结构为: ,町i 。,ni 。, o 。,o 。b 。这里tu ( j 【1 , m ) 表示含有字符a i 的文本的内 部代号,n i 表示文本t i 中a i 出现的次数, o ,oi m b 指出 了文本t ,i 中a i 出现的具体位置。由于每个字符的索引数据存储 的长度是不同的,因此需要索引头指针中的指针来指出开始位置。 索日i 头指针索引结构体 图3 2 倒排表模型结构图 2 、倒排表模型工作原理 设查询串为a i a 2 a 。查询时,首先通过索引头指针定位各 字符的索引数据,然后对数据进行分析;若a l a 2 a ,的索引数据 均含有文本s l 、s 2 s j 的索引记录,在r 个索引记录中仅有 s l 、s m ( m - j ) 的索引记录都仅仅含有o l ,0 2 ,o 。( o i 是属于字符a i 的索引数据) ,且o l 和o 的差值刚好是字符a 所占字节数,则文本s 。、s 。为一个命中文本集。找到所有 北京交通大学硕士学位论文 命中文本后( 或分析完毕后仍找不到命中文本) ,检索完成。 结合以上结构和原理,可以看出倒排模型其主要缺陷表现在 空间效率较差,倒排索引文件创建过程繁琐。 3 2 2 p a t 数组模型 p a t 数组模型将文本看成一组字符串的有序叠合,用户输入的 检索字符串就不会被分解成单个字符的集合,而是直接检索字符 串。举个简单的例子来说明这个模型的表示形式和使用方法。 例:设有一个简单文本见表3 - 1 。表中第1 行表示文本的位置号, 第2 行表示简单文本,两行进行对照,能够方便地得到每个字符 在文本中的位置( 文本的起始位置为o ) 。 iol23456789l oi l | a bdbdb 表3 - 1 一个简单文本 对于p a t 数组模型,从每个字符到文本尾字符形成一个字符 串( 这种字符串有时称为半无限串) 。如,表3 一l 中的简化文本包含 了1 2 个字符,也包含了1 2 个字符串,如下所示: ( o ) a b c d e a b d e a b c ;( 1 ) b c d e a b d e a b c ;( 2 ) c d e a b d e a b e ;( 3 ) d e a b d e a b c ;( 4 ) e a b d e a b c ;( 5 ) a b d e a b c ;( 6 ) b d e a b c ;( 7 ) d e a b e ;( 8 ) e a b e ;( 9 ) a b c ;( 1 0 ) b e ;( 1 1 ) c 我们用字符串中首字符的位置标记该字符串,对这些字符串做字 典排序,排序结果是( 9 ) ( 0 ) ( 5 ) ( 1 0 ) ( 1 ) ( 6 ) ( 1 1 ) ( 2 ) ( 7 ) ( 3 ) ( 8 ) ( 4 ) 。将排序 结果保存在一个数组中就得到了文本p a t 数组,见表3 2 。 表3 - 2 简单文本的p a t 数组模型表达形式 全文检索理论及方法 表第一行表示p a t 数组的下标,第二行则表示p a t 数组值。 每个值记录一个文本位置。将这个排序结果表示成树的形式后, 有利于检索速度的提高。但是该模型的缺点也非常明显,即空间 丌销大,而且创建过程中的空间开销更大,创建效率也非常低, 无论创建过程还是检索过程都严重依赖源文本。 3 2 3 签名文件模型 签名文件( s i g n a t u r ef i l e ) 有时也称散列函数法。在该模型中, 每个文档都通过h a s h 函数及重叠编碉j ( s u p e r i m p o s e dc o d i n g ) 产生 一个称为签名( s i g n a t u r e ) 的位串。文档的签名结果顺序存入一个单 独的签名文件中,由于签名文件比原文件小得多,因此可以提供 更快速的搜索。 。 总的来说,这种模型同倒排表模型从实质上将是同一基本观 念的变体,它能提供比倒排表更迅速的查询处理,还能够支持不 断增长的文件,增加了以及对键入和拼写错误的容错性,但需要 大量的存储空间,且当索引文档很大时反应时间较长。由于索引 空间的大小是影响动态性能的一个主要因素,因此它们的动态性 能比不上倒排表模型。虽然这种模型往往配合压缩技术,但由于 数据压缩工作往往在索引生成之后进行,且开销也很大,因此压 缩技术提高了索引的空间效率,但却降低了动态性能。 3 3 全文检索系统理论及模型 设四元组 d ,q ,f r ( q i ,d j ) 】,d :文档集的机内表示;q :用 户需求的机内表示;f :文档表示、查询表示和它们之间的关系 2 l 北京交通大学硕士学位论文 的模型框架( f r a m e ) :r ( q i ,d j ) :给q u e r yq i 和d o c u m e n td j 评分, 则全文检索模型决定于: ( 1 ) 、从什么样的视角去看待查询式和文档: ( 2 ) 、基于什么样的理论去看待查询式和文档的关系: ( 3 ) 、如何计算查询式和文档之间的相似度。 目前这一领域主要存在三种模型,即布尔检索模型、概论推 理模型、向量空间模型,这一节将对这几个模型作简要的介绍。 佰尔( b o o l e a n ) 信息检索模型是基于集合论和布尔代数的一 种简单检索模型,它将用户所提交的问题表示成以语义精确的布 尔表达式,检索系统根据表达式在索引文件中检索匹配,得出命 中文献集合为检索结果。标准的布尔逻辑模型为二元逻辑,所搜 索的文档要么与查询相关,要么与查询无关。查询结果一般不进 行相关性排序。如查询“操作系统”,只要文档中出现关键词“操 作系统”,则全部包含在查询结果中。为了克服布尔型信息检索模 型查询结果的无序性,在查询结果处理中引进了模糊逻辑运算, 将所检索的数据库文档信息与用户的查询要求进行模糊逻辑比 较,按照相关的优先次序排列查询结果。例如,查询“操作系统”, 那么出现“操作系统”较多的文档将排列在较前的位置。 概论推理模型是著名的b a y e s 判别法则在信息检索理论中的 应用。这里我们先简单介绍一下概率模型的基本理论。给定一个 用户的查询串,相对于该串存在一个包含所有相关文档的集合。 把这样的集合看作是一个理想的结果文档集,在给出理想结果集 后,很容易得到结果文档。这样就可以把查询处理看作是对理想 结果文档集属性的处理。问题是我们并不能确切地知道这些属性, 所知道的是存在索引术语来表示这些属性。由于在查询期间这些 全文检索理论及方法 属性都是不可见的,这就需要在初始阶段来估计这些属性。这种 初始阶段的估计允许对首次检索的文档集合返回理想的结果集, 并产生一个初步的概率描述。为了提高理想结果集的描述概率, 系统需要与用户进行反馈( f e e d b a c k ) 操作。具体处理过程如下: 用户大致浏览一下结果文档,决定哪些是相关的,哪些是不相关 的;然后系统利用该信息重新定义理想结果集的概率描述;重复 以上操作,就会越来越接近真正的结果文档集。 向量空间模型是由c o m e l l 大学的s a l t o n 教授提出的,它的 基本思想是用检索项的高维向量空间来表示用户的提问和文本集 信息,其中每一维为一个特征。一个用户提问向量或文本向量的 第1 个元素表示用户提问或文本的第1 个特征的重要度,或称权 值。用户提问向量的权值由用户指定;文本向量的权值则根据特 征在文本或文本集中的出现频率决定。提问向量与文本向量问余 弦角夹角的值通常被用来界定该文本与该用户提问词之间的匹配 程度。 以上模型中,第一种是完全依赖字符串的匹配结果,第二种 和第三种则从统计的角度理解用户的检索请求和文本语义。目前, 越来越多的人开始参与基于语料库的研究之中,将语料库的研究 渗透到自然语言处理的各个环节,与基于规则的自然语言处理方 法相结合,从而进一步促进基于自然语言处理的信息检索的发展, 加深对被检索文档和用户提问的理解和知识表示,实现信息检索 的智能化,提高查全率和查准率,这也将是中文全文检索未来的 发展方向。 3 4 中文全文检索技术 中文全文检索技术由于中文语系的特点,在实际处理过程中 北京交通大学硕士学位论文 往往与西文语系的方法不同。中文的这种特点主要体现在以下几 个方面: 1 、汉语的基本构成单位是汉字

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论