知识管理系统Data Solution研发日记之三 文档解决方案.doc_第1页
知识管理系统Data Solution研发日记之三 文档解决方案.doc_第2页
知识管理系统Data Solution研发日记之三 文档解决方案.doc_第3页
知识管理系统Data Solution研发日记之三 文档解决方案.doc_第4页
知识管理系统Data Solution研发日记之三 文档解决方案.doc_第5页
已阅读5页,还剩2页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

知识管理系统Data Solution研发日记之三 文档解决方案 本机磁盘的文件格式通常是doc/docx,pdf,pst/ost/emlhtm/mht,txt/rtf这几种格式是电脑中常用的格式要达到在同一个编辑器Editor中可以对它们进行编辑再整理需要选择一种通用的格式把其它的格式转化为这种通用格式对这种格式进行编辑DOC/DOCX格式功能强大有很多开源类型库对它进行读写RTF格式也包含了丰富数据资料重要的一点是RTF格式是一种开放的格式可以到微软的网站上下载MicrosoftOfficeWordxxRichTextFormat(RTF)Specification以熟悉这种文件格式开放格式的好处之一是在后续的进一步开发中可以找到很多现有的功能和代码包括开放的源码所以DataSolution选择RTF格式作为文件存储的标准格式 下一个目标就是要找到RTF格式的编辑工具通过Google可以找到很多RTF格式的编辑器对RTF格式进行直接编辑存储和转换因为是开放格式微软的.NETFramework自带了RichTextBox可用于RTF格式的编辑不过这个控件还需要强化可以到CodeProject.上找到一些工具和文章 这两个关键的步骤解决了下面就是设计数据库和设计数据读写代码创建Document数据库文档表的脚本如下CREATETABLEdbo.DOCUMENT(RECNUMintIDENTITY(1,1)NOTNULL,SUBJECTnvarchar(2000)NULL,BODYTYPEnvarchar(50)NULL,BODYnvarchar(max)NULL,CREATEDATEdatetimeNULL,CREATEBYnvarchar(50)NULL,REVISEDDatedatetimeNULL,REVISEDBYnvarchar(50)NULL,CATEGORYintNULL,PUTERnvarchar(200)NULL,PATHnvarchar(2000)NULL,CONSTRAINTPKDOCUMENTPRIMARYKEYCLUSTERED(RECNUMASC)WITH(PADINDEX=OFF,STATISTICSNOREPUTE=OFF,IGNOREDUPKEY=OFF,ALLOWROWLOCKS=ON,ALLOWPAGELOCKS=ON)ONPRIMARY)ONPRIMARY Body就是存储文档的表字段设计它为NVARCHAR(MAX)类型CATEGORY用于文档的分类查找SUBJECT可存放关键字或是标题BODYTYPE用于全文搜索存储文档类型扩展名PUTER和PATH用于在本机扫描中指定原始文档的路径可用于追踪 DataSolution系统选择LLBLGenFramework作为数据库访问层的代码生成器生成解决方案的代码如下图 来看一下对文档进行保存的一段代码它是标准的LLBLGenFramework的routine代码publicDocumentEntitySaveDocument(DocumentEntitydoc)using(DataAccessAdapteradapter=GetDataAccessAdapter()tryadapter.StartTransaction(IsolationLevel.ReadCommitted,SaveDocument);adapter.SaveEntity(doc,true,false);adapter.Commit();catchadapter.Rollback();throw;returndoc; 所谓routine代码就是代码可以由模板生成的就好比上下班打卡一样是很平常的简单的行为 注意这里的throw代码它没有写成这样catch(Exceptionex)adapter.Rollback();throwex; 在.NET框架程序设计一书中解释了这两个throw的区别它们会产生不同的stacktrace异常的起始点不同 基础层面的问题解决了下面的应用程序就水到渠成以不同的方式导入文档到数据库中 BatchImport批次导入指定目录的文件到数据库中 DocScanner批次导入指定格式的文件到数据库中 PDFWatcher专用于PDF文件格式的转换导入因为是Watcher所以你肯定会想到是个FileSystemWatcher DocLoader适用于单个文档的转换导入一次只处理一个文档 再来看数据库中的文档的展示DocumentExplorer会展现导入进数据库的原始文件在这里可以进行预览删除分类分类之后这个文档就好比打上了合格的标签一样可以在以后的程序中进一步使用否则不分类的文件都会只停留在这里后继的步骤无法处理这是个文档流程上的的Policy如果不喜欢这个步骤可以去掉 DocumentBrowser分类查看文档 左边是树型结构右边是从属于这个分类的文档如果要对扫描进数据库中的文件进行分类可以这样操作 在DocumentExplorer中选中一个或多个文件点击右键CategoryDocument 在DocumentBrowser的左边的树中右键PasteDocument 之后就看到了效果在.NET结点下面展示了所Paste的文档及其属性 DocumentBrowser左边的树是文档的分类可对它对进新增子节点新增加一个分类的效果如下图 Category是取自数据库中的类别表它的脚本定义如下CREATETABLEdbo.CATEGORY(RECNUMintIDENTITY(1,1)NOTNULL,NAMEnvarchar(200)NULL,CONSTRAINTPKCATEGORYPRIMARYKEYCLUSTERED(RECNUMASC)WITH(PADINDEX=OFF,STATISTICSNOREPUTE=OFF,IGNOREDUPKEY=OFF,ALLOWROWLOCKS=ON,ALLOWPAGELOCKS=ON)ONPRIMARY)ONPRIMARY 这颗文档分类树它的结构定义是放到本地的XML文件中上图中所看到的树的格式定义如下 如上图所示tag就是从数据库中获取的分类定义依据这个标识以检索分类的文档在DocumentBrowser窗体的打开与关闭时它会持久化树的结构定义代码如下protectedoverridevoidOnClosed(EventArgse)base.OnClosed(e);TreeViewSerializerserializer=newTreeViewSerializer();serializer.SerializeTreeView(this.treeView,treeFile);protectedoverridevoidOnLoad(EventArgse)treeView.ImageList=this.imageList;TreeNoderoot=treeView.Nodes0;if(File.Exists(treeFile)treeView.Nodes.Clear();TreeViewSerializerserializer=newTreeViewSerializer();serializer.DeserializeTreeView(this.treeView,treeFile);treeView.ExpandAll(); 如果你对如何把树节点定义保存到文件系统中感兴趣可以用关键字TreeViewSerializer在CodeProject中查找这里的代码就是取自其中一篇文章的代码 还有另一个地方会用到树型结构分类在Editor编辑器的打开文件对话框中如下图所示 这里的效果与DocumentBrowser的效果是完全一样的原来以为是可以用CustomOpenFileDialog来解决OpenFile对话框的PlaceBar的问题也就是上图中看到的左边的树的分类也是如下图中红色边框包围的地方 要达到重写红色区域Windows有规定的路径并且会验证这个路径这个办法没有通过无奈之下才用的自定义对话框之前见到过的软件SharePointDesigner重写过这个PlaceBar区域可惜没有领悟它的实现原理 写到这里还没有完成这里还需要一点OFFICE二次开发的知识在OFFICE软件中写入一个插件可以把正在浏览的文档直接导入到我的文档数据库中如下图所示 这里已经安装了两个插件NitroPDFProfessional和Acrobat用于把当前DOC/DOCX文档转换为PDF文件所以还需要写一个把当前的DOC/DOCX文档转存到文档数据库中的插件 在把PDF转化为可以编辑的RTF格式过程中遇到了不少的麻烦把DOC/DOCX转换成PDF这个行为有很多开源代码可以借用但是倒过来把PDF转换成DOC/DOCX这个组件却不好找有一种方案是把PDF转化为TIFF,然后再用OCR软件系统(ABBYYFineReader9)来转成DOC/DOCX文件我们做程序员的穷没有那么多银子买昂贵的SDKLicense,转向寻找Crack或是Patch之类的也没有结果这些业界领先的技术连Trial版本都不会出现在网上根本没有机会Trial一把或是把它放到虚拟机里面永远以Trial的方式来使用有的组件比如PDFFocus.NET可以试用一把可是转换出来的文件要么加上了Trial的水

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论