探讨农业知识库的系统设计与实现_第1页
探讨农业知识库的系统设计与实现_第2页
探讨农业知识库的系统设计与实现_第3页
探讨农业知识库的系统设计与实现_第4页
探讨农业知识库的系统设计与实现_第5页
免费预览已结束,剩余1页可下载查看

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、探讨农业知识库的系统设计与实现 摘要:农业由原来的小农经济模式向现代集成化迈进,不断产生农业系统知识,通过农业集成化,提出了农业知识库系统的架构设计这一个新型概念。同时,以农业知识库的设计为基础、引入新型的具有农业系统知识的人才,注重中文农业专业分词器以及查重器设计与实现,结合现代农业具体特点;并给出了中文农业专业分词算法评估和查重算法评估。 关键词:中文分词器 农业网络 知识库 算法评估 引言:农村科技信息综合服务平台是农业科技者创新出来在集成星火科技(12396)和农村远程教育网的基础上,依托互联网的强大的功能,实现互联互通,避免重复建设,融合科技特派工作网络,达到了信息资源共享的目的,这

2、也符合了中国农业摆脱传统的模式向现代化和信息化的拓展。在网络互联的基础上构建了四位一体的农村信息立体网络综合服务体系,即“电话、短信、电视、广播(及时向农业生产者传递信息),网络互动、现场解答(有效的让农业科技者与广大的农业生产者进行及时,可视,更加专业的指导)。 一、系统的结构 在农业知识系统架构设计中,主要考虑可靠性、可维护性、稳定性以及可移植性,主要采用框架中分层结构体系和模块化设计。层间关系的形成需遵循一定的规则,就是分层结构可以将子系统从逻辑上划分成许多集合,通过集合有效减少子系统之间的依赖关系,达到易于维护的目的,有利于系统耦合方式更加松散与稳定。 该系统重要解决下面4项的技术要点

3、: 1、由于农业词汇过于生僻,一般的中文词典较少收集关键词这类词汇,在中文分词过程中,只有准确提取农业关键词,才能进一步提取有效信息。 2、查重器。需要对知识库的知识查重,数据录入时,通过相关软件减少数据冗余。 3、查重速率。在检索过程中,通过对农业知识库中相关条目进行甄别,通过软件计算得到相关度。这是一个复杂的过程,而且对于软件的时间复杂度非常大,要求软件的维护性高。 4、处理方言词汇。一个方言较多的省份,必须考虑方言词汇的转换。系统在分词时,需快速、准确地对方言词进行切分和翻译。 二、中文农业专业分词器设计 分词器的功能是提取关键词,对生僻的农业专业词汇和农业方言词汇,比较有效地提取关键词

4、对增强查重的准确性和系统检索相当重要。用一般的农业词典无法准确地区分,分词器准确率自然很低。系统专门设计了农业专业分词器,以避免生僻的农业专业词汇和农业方言词汇。 分词器对词典的频繁操作比如改、增、删的操作对于词典设计,通过使用汉字gb码来设计词典。方言要先翻译成书面语,所以在数据库里要建立方言词和农业专业词一对多的对应关系。将gb码中6 763个汉字的开头与6 763个区位建立一一相对的联系。 中文农业专业分词算法评估。本系统实现了链表以及数组、树等分词方式,并将其与农业分词算法通过查插入、找、删的3个方面的时间复杂度和操作速率比上进行比较。通过比较表明:本文算法在以上3个方面的时间复杂度均

5、为o(1),其它算法为o(n)或o(n)?o(n)。笔者自行设计了一个哈希函数。其设计过程是:假设有一个词条word,如去掉首字后还剩n个字,用ij0和ij1分别表示第j个字的gb码高位和低位,和其他算法相比,hash算法最有优势。 三、专业设计农业知识库 农业知识库主要包括棉花、水稻、玉米、油料等12个数据库。每个数据库根据常见的类型分为两个表:特色类型表和加工类型表。构建农业知识库时,需综合考虑知识的可扩展以及数据的安全和负载均衡。另外农产品实时价格数据,还增加了综合管理数据库信息数据库等。 农业知识库中的每条记录由知识组成,而知识的信息主要包括问题的标题、标题分词组、关键词、方言关键词和

6、成因等18个字段。 1、对问答知识定位时,采用二叉树结构。这样可以确保知识库中每条记录有一个字段记录该二叉树的编码。 2、在数据库的设计和使用时,需建立视图来确保数据库使用的稳定性。 3、对每个产业,需构建知识问答、产业专家以及方言词汇转换等6大基本数据库。若该产业需要拓展6个数据库以外的信息,则可以增加一个该产业的子数据库。 四、查重器的设计和实现功能 查重器又名查重机,是用于数据查重的机器。在农业知识库的建立中,查重机担任减少知识库的知识冗余的重担,它控制着知识的入口,对于农业知识库至关重要。在系统中,知识库负责整个平台的咽喉知识的“出”和“进”,是其核心部分。在知识库系统中,如果想录入知

7、识,系统会对知识库内容查重。通过与库中相关记录的相似度比较,低于或高于某阈值时,该知识将被系统拒绝入库。 1、匹配度的计算公式 问句的问题与知识库记录的标题是否匹配是至关重要的,反向匹配度:设nd为记录词集中的特征项个数,则pd=n/nd。成为记录词集的匹配度。而匹配度为p=apc+bpd。其中,a+b=l,a0,b0。所以应先定义正向和反向匹配度。正向匹配度:设nc为问题词集中特征项个数,n表示问题词集与记录词集相匹配的特征项个数,则pd=n/nd,成为问题词集的正向匹配度。 最后,通过归一化算法查重。 2、查重算法评估 评估查重算法的准确率和召回率。在知识输入时,从知识库中检索到的记录个数

8、与库中已有相关记录总个数的比率称为召回率,从知识库中快速查找数据的精确程度成为准确率。系统用现有常见问题数据库进行查重,结果为 归一化查重:召回率0.024,准确率0.88 向量间模型:召回率0.083 准确率0.72, 五、实例列举莆田农村科技信息网 莆田市农村科技信息网是在农村、农资信息匮乏,农村信息不畅通的情况下应运而生的。它是以科技信息服务三农的信息平台,以网络信息作为基础,更大的宣传农技,农资,农市场情况,以便用最小的成本达到最大的宣传效果。它提供了六条途径供人们咨询农产品、农市场的基本情况,依次是快速查询,专家咨询,视频点播,信息发布,远程培训,短信订制。它从人们可能接触到的日常生

9、活的几个途径入手,将短信,电话,网络等咨询途径集合在一起。而提供咨询的农作物品种多达十几种,有枇杷、荔枝、文旦柚、莆田黑猪、南江黄羊、莆田黑鸭、龙眼、乌骨鸡、黒鲍、皱纹盘鲍、九孔鲍等等。网站还联系本省的实际,加上了本省的相关的农资资讯和相关农产品的介绍。这些农产品的资讯不是想当然贴上去的,而是切合当地的农业特色。莆田地处福建沿海,当地的气候条件以及地域条件适合以上农产品的生长和发展,所以当地政府才在信息网上着重关注。莆田农村科技信息网在网页设计上有首页、远程教育、成果推荐、科普知识、农情信息、致富信息、科技特派员、政策法规、供求信息、市场行情、莆田特产几个板块。结合当地特色创建适合当地的农村科技信息网络平台才是建立农业知识库的基础。所以,农业知识库的系统的设计一定要结合实际,在技术的支持上实现适合当地特色的农业知识库的建立。 结语:通过反复测试和实际应用,表明该农业系统的知识库设计合理、分词器和查重器使用效果良好。该系统的研究与开发为农业科技信息服务在深入农业改革的发展中,提供了大力的支持,具有广阔的应用前景。 参考文献 1吴胜远.一种

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论