CN119049066B 基于智能图像增强与自动分类的档案数字化方法和系统 (南京宇东科技发展有限公司)_第1页
CN119049066B 基于智能图像增强与自动分类的档案数字化方法和系统 (南京宇东科技发展有限公司)_第2页
CN119049066B 基于智能图像增强与自动分类的档案数字化方法和系统 (南京宇东科技发展有限公司)_第3页
CN119049066B 基于智能图像增强与自动分类的档案数字化方法和系统 (南京宇东科技发展有限公司)_第4页
CN119049066B 基于智能图像增强与自动分类的档案数字化方法和系统 (南京宇东科技发展有限公司)_第5页
已阅读5页,还剩54页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于智能图像增强与自动分类的档案数字本发明公开了一种基于智能图像增强与自232.根据权利要求1所述的基于智能图像增强与自动分类的档案数字化方法,其特征在3.根据权利要求2所述的基于智能图像增强与自动分类的档案数字化方法,其特征在44.根据权利要求3所述的基于智能图像增强与自动分类的档案数字化方法,其特征在S35、使用预先训练好的支持向量机分类器对特征向量集合中的每个特征向量进行分5.根据权利要求4所述的基于智能图像增强与自动分类的档案数字化方法,其特征在6.根据权利要求4所述的基于智能图像增强与自动分类的档案数字化方法,其特征在S121、使用滑动窗口法将原始档案图像划分为预57.根据权利要求4所述的基于智能图像增强与自动分类的档案数字化方法,其特征在所述存储器存储有可被所述处理器执行的指令,所述指令用于被所现权利要求1~7任一项所述的基于智能图像增强与自动分类的6朴素贝叶斯等机器学习算法被用于自动分类。一些研究还尝试运用深度学习模型如BERT来进行文本语义分析和主题提取。在档案检索方面,倒排索引和向量空间模型等技术被广泛面,现有算法对于严重褪色或局部损坏的历史档案图像处理效果不佳,难以有效平衡细节外,现有的知识提取技术往往局限于表层文本信息,难以理解档案中的深层次语义和上下78胀和细化操作,得到优化后的边缘图像Ie9[0043]读取直方图列表H,对每个直方图Hi进行累积分布函数(CDF)计算:从灰度级0开[0044]读取区域列表R和映射列表M,对原始图像数据Iraw中的每个像素进行灰度值重映图像数据Icontrast保存为文件或存入内[0046]本实施例通过自适应直方图均衡化处理技术,提升了档案图像的对比度和清晰[0051]本实施例通过Hough变换和图像分析技术,精确检测和校正了档案图像的倾斜角[0052]在本申请的另一个实施例中,对校正图像数据应用Canny边缘检测算法提取图像θ=arctan(Gy/Gx)。[0061]在本申请的一个实施例中,读取预处理图像数据Ipreprocessed。对预处理图像数据Ipreprocessed应用离散小波变换:首先对图像的每一行进行一维小波变换,得到行变换结果垂直高频系数HL和对角高频系数HH。将这四个子带系数集合记为Cwavelet={LL,LH,HL,系数集合Cadjusted={LL',LH',HL',HH'}。[0063]提取系数集合Cadjusted中的高频子带系数LH',HL',HH'。对数与子带系数LL'一起构成新的系数集合Csharpened={LL',LH'',HL'',HH''}。[0064]对新的系数集合Csharpened应用逆离散小波变换进行图像重建。首先对新的系数集变换结果Icolreconstructed的每一体而言,小波变换的应用实现了图像的多尺度分解,使得能够在不同的频率域分别进行增强处理。引入了基于局部统计特征的自适应系数调整方法,根据图像局部的均值和方差动态调整增强强度,有效避免了传统全局增强方法容易导致的过增强或欠增强问题。非线性锐化算子的应用,特别是其中的边缘保护机制,在增强图像细节的同时有效抑制了噪声放大,这对于提高文字的清晰度和可读性至关重要。局部对比度受限自适应直方图均衡化施例不仅提高了图像的整体质量,还特别增强了文字区域的清晰度和可辨识度,为后续的文字识别和内容分析提供了高质量的输入。对于档案数字化工作而言,这意味着能够处理[0069]S223、读取特征图Flocal和Fglobal,计算每个系数的自适应增益因{LL',LH',HL',HH'}中。的高频子带LH'',HL'',HH''中。带系数存储在新的系数集合{LL',LH''',HL''',HH'''}中。[0084]S32、基于文本区域集合,计算每个文本区域的灰度直方图;对灰度直方图应用[0087]S35、使用预先训练好的支持向量机分类器对特征向量集合中的每个特征向量进[0090]对文本区域集合T中的每个文本区域Ti进行处理。首先计算每个文本区域Ti的灰色)。对文本区域集合T中的所有文本区域Ti完成处理后,得到二值化文本图像集合B={B1,B2,,Bn}。[0091]对二值化文本图像集合B中的每个二值化图像Bi应用改进的连通组件分析算法。[0093]使用预先训练好的支持向量机(SVM)分类器对特征向量集合F中的每个特征向量降采样,直到图像最小边长小于64像素。将得到的多尺度图像序列存储为图像金字塔P=将其标记为候选MSER区域。将所有尺度检测到的候选区域集合存储为R={R0,R1,...,[0104]本实施例实现了对档案图像中文本区域的高精度提取,特别是在处理复杂背景、到单位圆内,计算不同阶数和重复度的Zernike多项式,然后计算图像与这些多项式的投影矩阵。将F中的每个特征向量投影到这个k维空间。将降维后的特征向量集合存储为字符图像的尺寸归一化预处理确保了特征提取的一致性,提高了后续识别的稳定性。[0118]在本申请的另一个实施例中,对SVM分类器进行优化,具体为:使用主成分分析集上表现最好的核函数;使用网格搜索和5折交叉验证优化字符图像集并重复上述步骤。[0123]S44、在概念图中识别出带有语义标签集合中的标签的节点对;基于预设路径阈 ,Xk}。使用预训练的条件随机场(CRF)模型处理特征序列X,得到对应的标签序列Y={Y1,Y2,,Yk}。根据标签序列Y识别出文本中的命名实体,形成命名实体集合E=[0126]读取实体集合E和关键词集合K。将实体集合E和关键词集合K中的元素作为节如果两个元素在识别结果字符串S中的一定窗口大小内共同出现,则在概念图G'中它径上的节点和边的特征,使用预定义的模式或机器学习模型判断其是否表示某种语义关和停用词,将所有单词转换为小写。将处理后的句子列表存储为Spreprocessed={s1,s2,...,或达到最大迭代次数。将最终的rank值存储在每个节点的属性中,更新后的图存储为[0140]根据本申请的一个方面,步骤S43中使用PageRank算法计算概念图中节点的重要重复此过程直到所有节点的分数变化小于预设阈值ε或达到最大迭代次数。将最终的重要Vstruct将实体关系集合R中的实体关系表示为关系类型和关系强度的数值对,形成关系特征向量访问。将噪声点分配到最近的簇或形成新的簇。得到动态类别集合D={D1,D2,,[0157]计算动态类别集合D中每个类别Di的中心点Ci。使用层次聚类(UnweightedPair[0159]将多维索引Imulti中的每个叶节点与分类树Tclass中的相应类别关联。在分类树索。具体而言,局部敏感哈希(LSH)算法的应用在保持数据相似性的同时实现了高效的降[0161]在本申请的另一个实施例中,步骤S53中应用改进的密度聚类(DBSCAN)算法进行中的每个点p,利用k_d树Tkd查找p的ε_邻域内的点。如果邻域内点的数量大于最小点数[0171]S541、计算最终低维表示中每个维度的方差,选择方差最大的k个维度作为索引 [0196]在本申请的另一个实施例中,基于智能图像增强与自动HL,HH}。[0210]S31、使用改进的MSER算法从最终增强图像Ifinal中提取文本区域集合T={T1,征向量集F={F1,F2,,Fm}。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论