CN119404232A 用于从图像生成文本输出的方法和系统 (马士基有限公司)_第1页
CN119404232A 用于从图像生成文本输出的方法和系统 (马士基有限公司)_第2页
CN119404232A 用于从图像生成文本输出的方法和系统 (马士基有限公司)_第3页
CN119404232A 用于从图像生成文本输出的方法和系统 (马士基有限公司)_第4页
CN119404232A 用于从图像生成文本输出的方法和系统 (马士基有限公司)_第5页
已阅读5页,还剩79页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

PA2022703192022.06.2024.12.13PCT/EP2023/0656582023.06.12WO2023/242123EN2023.12.21本公开的实施方案提供了用于从包括文本器执行的方法包括从图像中提取机器可读文本方法包括将一个或多个词中的每个词与包括领域词汇数据库和语言词典数据库的数据集进行二词集合是与数据集中可用的词未成功匹配的个词拆分为两个或更多个词以确定第三词集合2由所述处理器将所述一个或多个词中的每个词与包括领域词汇数据库和语言词典数由所述处理器将所述第二词集合中的至少一个词拆分为两个或更多个词以确定与所由所述处理器至少基于所述第一词集合和所述第三词集合生成与所述图像相关联的2.如权利要求1所述的计算机实现的方法,其中将所述一个或多个词中的每个词进行计算所述第二词集合中的每个词与所述数据集中可用的在确定所述最高相似度分数至少等于阈值相似度分数时至少部分地基于预定义文本解析规则将所述第二词集合中的所述至少一个词拆分为将所述两个或更多个词与所述数据集进行比较以确定所述两个或更多个词在所述数4.如前述权利要求中任一项所述的计算机实现的方法,置为根据至少一个语言的句法规则和语义规5.如前述权利要求中任一项所述的计算机6.如前述权利要求中任一项所述的计算机实现的方法8.如权利要求7所述的计算机实现的方法,其中所述至少一个图像预处理操作包括以9.如权利要求8所述的计算机实现的方法,其中所述自适应阈值化方法包括消除所述3处理器,所述处理器可通信地耦合到所述存储器,所述处理器被配将所述一个或多个词中的每个词与包括领域词汇数据库和语言词典数据库中的至少将所述第二词集合中的至少一个词拆分为两个或更多个词以确定与所述数据集中可至少基于所述第一词集合和所述第三词集合生成与所述图13.如权利要求12所述的计算装置,其中为了将所述一个或多个词中的每个词进行比计算所述第二词集合中的每个词与所述数据集中可用的在确定所述最高相似度分数至少等于阈值相似度分数时14.如权利要求12至13中任一项所述的计算装置,其中还致使所述计算装置至少部分至少部分地基于预定义文本解析规则将所述第二词集合中的所述至少一个词拆分为将所述两个或更多个词与所述数据集进行比较以确定所述两个或更多个词在所述数15.如权利要求12所述的计算装置,其中所述语言词典数据库被配置为根据至少一个16.如权利要求12所述的计算装置,其中在从所述图像中提取所述机器可读文本数据17.如权利要求16所述的计算装置,其中所述至少一个图像预处理操作包括以下中的4将所述一个或多个词中的每个词与包括领域词汇数据库和语言词典数据库中的至少将所述第二词集合中的至少一个词拆分为两个或更多个词以确定与所述数据集中可至少基于所述第一词集合和所述第三词集合生成与所述图19.如权利要求18所述的非暂时性计算机可读存储介质,其中将所述一个或多个词中计算所述第二词集合中的每个词与所述数据集中可用的在确定所述最高相似度分数至少等于阈值相似度分数时,至少部分地基于预定义文本解析规则将所述第二词集合中的所述至少一个词拆分为将所述两个或更多个词与所述数据集进行比较以确定所述两个或更多个词在所述数21.如权利要求18所述的非暂时性计算机可读存储介质,其中在从所述图像中提取所22.如权利要求21所述的非暂时性计算机可读存储介质,其中所述至少一个图像预处5案描述了一种使得能够对从图像中提取的文本进行文本处理并减少处置错误文本的时间、多个词中的每个词与包括领域词汇数据库和语言词典数据库中的至少一者的数据集进行比较以确定第一词集合和第二词集合。第一词集合是与数据集中可用的词成功匹配的词,方法还包括至少基于第一词集合和第三词集合生成与图像相关联的6个词在数据集中具有成功匹配而将两个或更多个词分类到第三[0010]一些实施方案的优势是即使在计算最高相似度分数之后未被校正的那些第二词7的每个词与包括领域词汇数据库和语言词典数据库中的至少一者的数据集进行比较以确置还被致使至少基于第一词集合和第三词集合生成与图像相个词中的每个词与包括领域词汇数据库和语言词典数据库中的至少一者的数据集进行比法还包括至少基于第一词集合和第三词集合生成与图像相关联的[0021]图3是根据本公开的实施方案的用于执行智能文本输出生成的过程流的示意表[0023]图5是根据本公开的实施方案的用于准确地从图像生成文本输出的计算机实现的[0024]图6表示根据本公开的实施方案的用于从图像中提取词并根据所提取的词确定第8[0025]图7A是根据本公开的实施方案的用于对第二词集合执行附加文本处理的简化数[0027]图8表示根据本公开的另一个实施方案的用于准确地从图像生成文本输出的简化定特征、结构或特性包括在本技术的至少一个实施方案中。说明书中各个地方出现的短语词与一个或多个领域词汇数据库和/或语言词典数据库中可用的词进行比较,对具有变化9[0036]根据本公开,公开了一种用于以增大的准确度从图像中执行文本提取的计算装[0038]图1A示出了与本公开的至少一些实施方案有关的环境100的示例性图示。尽管环[0042]在一个示例中,用户106可以经由计算装置104通过网络114访问文本输出生成应用户106可以启动该web浏览器以导览到用于执行智能文本提取的网站。在另一个示例[0043]在一种形式中,文本提取应用116检测图像的包含文本或有可能包含文本的一个据应用文本处理操作来生成与图像相关联的文本输出。下文参考图2详细解释对提取的机[0046]在一个实施方案中,服务器系统102是被配置为执行本文进一步描述的过程的计实施方案中,服务器系统102被配置为应用自适应阈值化方法(adaptivethresholding[0047]一旦图像质量得到改进,服务器系统102就被配置为执行文本提取以从图像中提在数据集118中未找到的词)被视为拼写错误较。如果与单独的拼写错误的词相关联的最高领域相似度分数不大于第一阈值相似度分102被配置为针对一些拼写错误的词确定经校正的词,并且这些经校正的词被包括在第一[0049]此外,服务器系统102被配置为根据本说明书后面解释的某些文本解析规则将第据库112被配置为根据至少一个语言的句法规则和语义规则来集合(例如,一个或多个装置)可以执行被描述为由环[0054]图1B示出了与本公开的至少一些实施方案有关的另一种环境120的示例性图示。案可以包括以其他方式布置的环境120的部分(或其他部分)。环境120通常包括与用户124[0056]外围装置126与计算装置122连接。外围装置126的示例包括但不限于相机和扫描[0057]领域词汇数据库110和语言词典数据库112与计算装置122连接或以电子方式存储取应用116被配置为应用图像处理和文本处理方法来获得与图像相关联的文本数据。在一应用116可以分析图像以确定是否需要预处理操作。替代地,每个图像都由文本提取应用[0060]文本提取应用116还对提取的机器可读文本数据应用文本处理操作,以提高机器应用文本处理操作来生成与图像相关联的文本输出。下文参考图2详细解释对提取的机器[0061]在一个实施方案中,计算装置122是被配置为执行本文进一步描述的过程的计算机系统。计算装置122通过利用领域词汇数据库110和语言词典数据库112促进从低质量图集合(例如,一个或多个装置)可以执行被描述为由环[0063]图2是根据本公开的实施方案的计算装置200的简化框图。计算装置200的示例可像中执行智能文本提取的操作。处理器202的示例包括但不限于专用集成电路(ASIC)处理盘)、DVD(数字多功能光盘)和BD(BLU-RAY良光盘)。[0069]应当注意,如图所示且下文描述的计算装置200仅仅说明可从本公开的实施方案比图2中描绘的那些部件更少或更多的部件。应当注意,本文描述的部件可以多种方式配[0070]图像预处理引擎216包括合适的逻辑和/或接口以用于对图像执行至少一个图像[0072]图像预处理引擎216被配置为在从图像中提取机器可读文本数据之前,对图像执[0074]图像预处理引擎216被配置为应用自适应阈值化方法来消除图像中的灰色区域。化方法使多个窗口中的比该多个窗口中的其他窗口更暗的那些窗口变亮。通过这种方式,自适应阈值化方法通过使图像变亮并使图像中的字符更清晰来消除图像中的灰[0075]此外,图像预处理引擎216被配置为应用图像增强方法来更新图像的一个或多个[0077]图像预处理引擎216还被配置为应用去倾斜方法来改变图像的倾斜角度。一般来[0079]一旦将图像预处理操作应用于图像以增强质量,图像预处理引擎216就被配置为[0080]字符辨识引擎218包括合适的逻辑和/或接口以用于从图像中提取机器可读文本汇数据库110被配置为存储与货运和物流相关的关键词。在一个示例中,语言词典数据库[0087]文本处理引擎220包括合适的逻辑和/或接口以用于从字符辨识引擎218接收机器可读文本数据。文本处理引擎220被配置为将一个或多个词中的每个词与包括领域词汇数据库110和语言词典数据库112中的至少一者的数据集118中的词进行比较,以从一个或多一个或多个词中所包括的每个单独的词与领域词汇数据库110和语言词典数据库112中可的技术确定了一个或多个词的对应语言,文本处理引擎220就被配置为将一个或多个词中可读文本数据的一个或多个词。文本处理引擎220运行查询以确定来自一个或多个词中的[0093]文本处理引擎220还被配置为对拼写错误的词(即,第二词集合)执行校正以确定文本处理引擎220被配置为从数据集118中检测与最高相似度分数相对应的词作为第二词相似度分数小于阈值相似度分数,则文本处理引擎220认为第二词集合中的此类拼写错误之间的Levenshtein距离为三,则这意味着将拼写错误的字符串A转换为正确的字符串B需要至少三次编辑。在该示例中,字符串A是从机器可读文本数据中提取的拼写错误的字符[0098]在另一个实施方案中,文本处理引擎220被配置为通过初始地计算第二词集合中的每个词与领域词汇数据库110中可用的词的最高领域相似度分数来确定经校正的词和残本处理引擎220被配置为检测来自数据集118的与最高领域相似度分数相对应的词作为第[0099]在确定最高领域相似度分数小于第一阈值相似度分数时,文本处理引擎220还被配置为计算第二词集合中的其余词与语言词典数据库112中可用的词的最高语言相似度分处理引擎220被配置为检测与最高语言相似度分数相对应的词作为第二词集合中的对应词[0100]在确定最高语言相似度分数小于第二阈值相似度分数时,文本处理引擎220被配于自然语言处理(NLP)的技术等的方法计算最高语言相似度分数。在一个示例中,对于可以基于需要修改第一阈值相似度分数和第二阈以根据需要以任何顺序执行最高领域相似度分数和最高语言相似度[0103]文本处理引擎220还被配置为处理其余的第二词集合(即,残留词)以确定对应的个词拆分为两个或更多个词,以确定与数据集118中可用的词匹配的第三词集合。更具体[0104]词可能因错误(在手写文本的情况下)或系统错误(在打印文本的情况下)而被连在数据集118中是否成功匹配。响应于确定两个或更多个词在数据集118中具有成功匹配,文本处理引擎220被配置为将两个或更多个词归类到第三词本处理引擎220能够确定是否将残留词拆分为两个词或更多个置为保留对应的残留词(即,即使在词拆分步骤之后仍之后仍未匹配的残留词)和第三词集合来生成与图像相关联的文本输出。在一个实施方案合以相同的布局对齐到图像的文本输出中。文本输出可以进一步显示在计算装置200的显储器(例如,存储器204)等上的软件和/或固件)控[0111]通信模块208可以包括通信电路系统,例如诸如包括天线和其他通信介质接口以可以使得能够从包括例如存储器204的图像数据源[0113]通信模块208被配置为将图像转发到处理器202。处理器202的模块结合存储在存储器204中的指令212可以被配置为对图像执行操作以智能地从图像中提取文本输出,即,[0114]计算装置200还包括存储模块210,该存储模块可以被体现为适合存储和/或检索[0115]存储模块210可以包括多个存储单元,诸如廉价磁盘冗余阵列(RAID)配置中的硬口(图2中未示出)来访问。存储接口是能够为处中式电路系统214可以是被配置为提供或实现计算装置200的部件之间的通信等的各种装[0117]图3是根据本公开的实施方案的用于执行智能文本输出生成的过程流的示意表示源108可以指代存储图像305的非易失性存储器。图像305包括文本数据。在一些实施方案外,图像预处理引擎216被配置为对图像305执行至少一个图像预处理操作以增强其质量。更具体地,图像预处理引擎216被配置为对图像执行至少一个图像预处理操作以增加图像[0121]在实施方案中,图像预处理引擎216可以对图像305仅执行一个图像预处理操在另一个实施方案中,图像预处理引擎216可以对图像305执行任何两个图像预处理操作。一些实施方案中,图像预处理引擎216分析图像305的质量以确定增强图像305的质量所需符辨识引擎218被配置为从图像305中提取机器可读文本数据。字符辨识引擎218被配置为[0123]此外,字符辨识引擎218被配置为将机器可读文本数据传递到文本处理引擎220112来智能地执行文本提取(参见310)。文本处理引擎220进一步显示对机器可读文本数据[0124]在一个示例中,针对具有不同图像质量级别的各种图像来评估文本提取应用116面(UI)以将图像402上传到文本提取应[0131]图4B示出了根据本公开的实施方案的在执行图像预处理操作之后获得的图像415 适税款之后应支付给货物发件人的总金额。第四部分描绘了应支付给货物发件人的总制性示例中,处理器202被配置为基于本领域中已知的OCR引擎从图像415中提取机器可读文本数据包括在应用字符辨识引擎之后提取的[0135]图4C示出了根据本公开的实施方案的描绘从图像415中提取的一个或多个词的表[0136]处理器202还被配置为将一个或多个词中的每个词与数据集118(即,领域词汇数据库110和语言词典数据库112)进行比较,以确定来自一个或多个词的第一词集合和第二[0137]如上文解释的,第一词集合对应于与存储在数据集118中的词成功匹配的词。另[0138]图4D示出了根据本公开的实施方案的描绘来自从图像415中提取的一个或多个词[0139]如上文解释的,第二词集合包括拼写错误的词(即,与数据集118不成功匹配的个拼写错误的词与存储在数据集118中的词的比较来计算最[0140]在一些实施方案中,处理器202初始地被配置为基于最高领域相似度分数来校正度分数是基于每个拼写错误的词与存储在领域词汇数据库110中的词的比较来计算的。如果未基于最高领域相似度分数校正拼写错误的词,则处理器202还被配置为基于最高语言[0141]图4E示出了根据本公开的实施方案的描绘拼写错误的词和对应的经校正的词的言数据库两者)中存在的词的最高相似度分数的计算来校正拼写错误的词。在另一个实施方案中,处理器202被配置为基于最高领域相似度分数的计算以及该分数与第一阈值分数处理器202被配置为基于数据集118中可用的词来计算最高相似度分数。在一个示例中,拼处理器202被配置为至少基于最高领域相似度分数或最高语言相似度分数将拼写错误的词[0145]通过这种方式,拼写错误的词(参见442)被校正为其对应的经校正的词(参见[0146]图4F示出了根据本公开的实施方案的描绘残留词和对应的经校正的词的表格二词集合(残留词)是在计算最高相似度分数或最高领域相似度分数和最高语言相似度分[0149]处理器202被配置为逐个字符地拆分残留词,然后以迭代方式连接所述字符以检该处理器还被配置为以迭代方式连接字符,并进一步检查字符的连接是否与数据集118中已经存储的任何词450包括残留词(参见452)和第三词集合(参见454)的列表。如果第二词集合中的任何词[0152]图4G示出了根据本公开的实施方案的在对图像415执行文本处理操作之后图像[0153]图5是根据本公开的实施方案的用于准确地从图像生成文本输出的计算机实现的理器202)、电路系统和/或与包括一个或多个计算机程序指令的软件的执行相关联的不同[0156]在操作506处,方法500包括由处理器202将一个或多个词中的每个词与包括领域词汇数据库110和语言词典数据库112中的至少一者的数据集118进行比较以确定第一词集[0157]在操作508处,方法500包括由处理器202将第二词集合中的至少一个词拆分为两个或更多个词以确定与数据集118中可用的词匹配的[0158]在操作510处,方法500包括由处理器202至少基于第一词集合和第三词集合生成[0159]图6表示根据本公开的实施方案的用于从图像中提取词并从所提取的词确定第一取应用116执行。表示600的操作序列可能不一定按照与它们被呈现的顺序相同的顺序执应用116以使用移动电话的相机来扫描文档,或者用户可使用移动电话的相机来捕获文档应用116应用图像增强方法来更新图像的一个或多个图像参数。一个或多个图像参数可以取应用116可以基于图像的质量自动更新一个或多个图像参数中的任一者或全部。在604c描,这导致所扫描的图像的角度朝向一个方向拉伸太多或所扫描的图像的取向变得不正[0163]在606处,文本提取应用116基于字符辨识引擎从图像中提取机器可读文本数对一个或多个词中的每个词以迭代方式运行多[0164]在608处,文本提取应用116可以将所提取的词中的第i个词与存储在与领域词汇数据库110和语言词典数据库112相关联的数据集118中或在该数据集中可用的词进行比[0166]当文本提取应用116识别出第i个词与数据集118中可用的词中的至少一者完全匹[0167]当文本提取应用116识别出第i个词与数据集118中可用的词中的至少一者不完全二词集合是与数据集118中可用的词未成功匹配[0168]在616处,文本提取应用116将第i个值递增(i→i+1)并对照所提取的词的数量检[0169]在从一个或多个词中识别出第二词集合之后,文本提取应用116可以针对第二词[0170]图7A(结合图6)是根据本公开的实施方案的用于针对第二词集合执行附加文本处理的简化数据流图表示700。应当理解,表示700中解释的每个操作由文本提取应用116执第j个词与数据集118中可用的词的相似度分数来识别第j个词的群组以确定经校正的词并生成图像的文本输出的简化数据流图表示720。应当理解,表示720中解释的每个操作由文本提取应用116执行。表示720的操作序列可能不一定按照与它骤730。[0185]图8表示根据本公开的另一个实施方案的用于准确地从图像生成文本输出的简化词典数据库112相关联的数据集118中[0191]在808处,文本提取应用116检查第n个词的最高领域相似度分数是否至少等于用116检测与最高领域相似度分数相对应的领域词(即,在领域词汇数据库110中找到的匹应用116计算第n个拼写错误的词与语言词典数据库112中可用的词的最高语言相似度分[0194]在814处,文本提取应用116检查第n个词的最高语言相似度分数是否至少等于用116检测与最高语言相似度分数相对应的语言词(即,在语言词典数据库112中找到的匹[0197]在820处,文本提取应用116将两个或更多个词与和领域词汇数据库110和语言词典数据库112相关联的数据集118中可用的词进行比较,以确定两个或更多个词在数据集[0199]在824处,文本提取应用116将第n个值递增(n→n+1)并对照拼写错误的词的数量置900可以对应于图1的用户106的计算装置104。电子装置900被描绘为包括一个或多个应是由计算装置200托管和管理的应用的实例。电子装置900上的一个或多个应用906中的一些部件可以是可选的,并且因此在实施方案中可以包括比结合图9的实施方案描述的那些[0204]所示的电子装置900包括一个或多个存储器部件,例如不可移除存储器908和/或用户身份模块(R_UIM)或任何其他智能卡。UIM912通常存储与移动用户有关的信息元素。的或因第三代(3G)无线通信协议(诸如通用移动通信系统(UMTS)、CDMA9000、宽带CDMA(WCDMA)和时分同步CDMA(TD_SCDMA))触摸屏922和显示器934可被组合成单个输入部配备蓝牙的装置或本地无线数据网络或路由器进行短程通信的Wi_Fi兼容调制解调器络通信,诸如用于在单个蜂窝网络内、蜂窝网络之间或电子装置900与公共交换电话网络传输模拟或数字信号)和/或物理连接器960,该物理连接器可以是USB端口、IEEE1294(ASIC)电路系统和/或数字信号处理器(DSP)电路系统机程序或类似语言的非暂时性计算机可读存储介质可以被体现为存储一个或多个软件程中,计算机程序可以使用任何类型的非暂时性计算机可读介质来存储并被提供给计算机。BLU-RAYQ光盘)和半导体存储器(诸如掩模ROM、PROM(可编程ROM)、EPROM(可擦除或多个易失性存储器装置、一个或多个非易失性存储器装置和/或一个或多个易失性存储[0212]尽管本文中以结构特征和/或方法动作所特有的语言描述了本公开的各种示例性上文所述的具体特征和动作被公开为实现权利[0217]由所述处理器将所述一个或多个词中的每个词与包括领域词汇数据库和语言词[0218]由所述处理器将所述第二词集合中的至少一个词拆分为两个或更多个词以确定[0219]由所述处理器至少基于所述第一词集合和所述第三词集合生成与所述图像相关[0220]条款2.如条款1所述的计算机实现的方法,[0221]计算所述第二词集合中的每个词与所述数据集中可用的所述词的最高相似度分[0225]至少部分地基于预定义文本解析规则将所述第二词集合中的所述至少一个词拆[0226]将所述两个或更多个词与所述数据集进行比较以确定所述两个或更多个词在所[0228]条款4.如条款1所述的计算机实现[0230]条款6.如条款1所述的计算机实现[0231]条款7.如条款5所述的计算机[0232]条款8.如条款7所述的计算机实现[0233]条款9.如条款7所述的计算机实现[0239]从所述图像中提取机器可读文本数据,所述机器可读文本数据包括一个或多个[0240]将所述一个或多个词中的每个词与包括领域词汇数据库和语言词典数据库中的[0241]将所述第二词集合中的至少一个词拆分为两个或更多个词以确定与所述数据集[0243]条

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论