CalliReader草书识别AI系统中文介绍_第1页
CalliReader草书识别AI系统中文介绍_第2页
CalliReader草书识别AI系统中文介绍_第3页
CalliReader草书识别AI系统中文介绍_第4页
CalliReader草书识别AI系统中文介绍_第5页
已阅读5页,还剩8页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

CalliReader:基于嵌入对齐视觉语言模型的中国书法语境化理解罗宇轩1*,唐佳琪1*,黄晨祎1,郝飞扬2,连宙辉1††1北京大学王选计算机技术研究所2西安交通大学摘要中国书法作为联合国教科文组织认定的非物质文化遗产,由于视觉模糊性和文化复杂性,在计算处理上仍面临巨大挑战。现有人工智能系统难以对其复杂的文字进行语境化理解,原因在于标注数据有限以及视觉语义对齐不足。本文提出CalliReader,一种视觉语言模型(VLM),通过三项创新解决中国书法语境化(CC²)问题:(1)逐字切片实现精确的字符提取与排序;(2)CalliAlign实现视觉文本标记压缩与对齐;(3)嵌入指令微调(e-IT)提升对齐效果并解决数据稀缺问题。我们还构建了CalliBench,首个面向全页书法语境化的评测基准,针对现有OCR和VQA方法中的三大关键问题:上下文碎片化、推理浅层化和幻觉现象。大量实验包括用户研究表明,CalliReader在全页书法识别与解释任务中优于其他最先进方法甚至人类专业人士,在提高准确率的同时减少了幻觉现象。与推理模型的对比凸显了准确识别作为可靠理解前提的重要性。定量分析验证了CalliReader的效率;在文档和真实场景基准上的评估证明了其强大的泛化能力。1.引言中国书法被联合国教科文组织认定为非物质文化遗产。它具有复杂的文字、任意布局和历史字形变化,即使是母语为汉语的人也难以阅读和理解。然而,书法蕴含着巨大的文化和历史意义。因此,通过有效的中国书法语境化(CC²)方法来解锁其丰富内涵至关重要。现有系统难以实现这一目标,需要精确识别、深入理解和多语言解释。现有的光学字符识别(OCR)工具[22,58]在面对书法的风格细微差别时表现不佳。视觉语言模型(VLM)提供了一种有前景的替代方案,在图像理解和解释方面展现出强大能力[81,85,86]。然而,VLM通常缺乏针对书法的专门训练数据。此外,中国书法中微妙的字符变化,如近似相同的字符,需要高分辨率输入。在本文中,我们旨在利用基于预训练视觉Transformer(ViT)的编码器[19]所带来的丰富视觉语义。通过引入即插即用模块,我们重新组织视觉输入表示并执行语义压缩与对齐。通过这种方式,我们在减少训练负担的同时保持了VLM的能力。为此,我们提出CalliReader,一个旨在增强CC²能力的框架。它将两个模块插入到基础VLM(如InternVL2-8B[10])中:逐字切片和CalliAlign。切片过程从页面中提取单个字符,简化了识别任务同时保留了字符语义。CalliAlign压缩字符视觉标记并将其与归一化文本嵌入对齐,使得在大型单字符数据集上实现性能扩展。该设计保留了ViT的原始表示。先导实验验证了字符切片的有效性以及CalliAlign在CC²任务上改进视觉到知识推理的潜力。我们进一步设计了嵌入指令微调(e-IT)来应对数据稀缺问题。它将真实数据和合成数据统一在同一嵌入表示中。这允许数据增强并实现通过LoRA[25]对LLM的高效适配。经过全页识别指令训练后,配备e-IT的CalliReader在理解和解释任务上超越了LoRA微调的VLM。这凸显了e-IT在挖掘上下文信息方面的有效性。我们还构建了一个高质量的页面级书法数据集,包含7,357个训练样本和3,192个测试样本。利用测试集,我们开发了CalliBench,一个以CC²为核心的综合性评测基准。它包含全页识别、区域幻觉检测和上下文VQA,用于知识grounded、双语解释和意图分析。CalliBench为社区提供了一个以文本为中心的识别和以文化轴为核心的多模态推理基准,解决了OCR和VQA基准中上下文碎片化和推理浅层化的问题。与CalliBench上具有代表性的微调VLM和主流OCR模型的对比证明了CalliReader的优越性。它还超越了最先进的推理模型,启发我们认识到通用推理必须建立在精确识别的基础之上。令人惊讶的是,我们的用户研究表明,CalliReader不仅显著超越了普通人的平均水平,甚至超过了书法专家的水平。在文档、手写体和真实场景文本中心视觉基准上的进一步应用验证了其泛化能力,为广泛的下游应用铺平了道路。2.相关工作视觉语言模型(VLM)。scalinglaws[24,33]和新型训练技术[5,14,57,62]的提出推动了仅解码器语言模型的快速发展,展现出卓越的指令遵循和少样本学习能力[1,13,20,31,53,70,71,87]。同时,在大规模高质量数据上训练的较小基础模型也备受关注[6,26,78]。ViT[19]和CLIP[63]的出现使VLM能够在统一嵌入空间内处理多模态输入[3,37,42,43,45,73,77]。当前研究强调高分辨率任务,其中扩展的视觉骨干网络提高了视觉分辨率和任务泛化能力[11,21,30,36,79]。此外,切片策略将模型处理能力扩展到4K分辨率[10,42,77]。然而,尽管在OCR基准上取得了显著成功[44,49-51,66],VLM在视觉语境化方面仍存在严重的幻觉问题,尤其是在中国书法等低资源场景中。对于CC²,当前的VLM严重依赖记忆而非理解,因此饱受幻觉困扰。从视觉到知识。传统的OCR方法专注于提取和检测[39,40,47,59,69,74,91],但在知识提取方面缺乏深度。用于文档VQA的基于OCR的LLM[45,46,75]难以应对风格布局变化,尤其是在中国书法中。现代推理模型尽管具备CoT能力[29,56,67],但由于识别模糊而经常产生幻觉。现有以文本为中心的视觉基准[48,50,66,84]主要关注标准文本识别或浅层问答。大多数视觉推理基准[9,12]强调空间和因果关系,忽略了历史和文化分析。CalliBench强调全上下文识别和解释。通过准确识别风格内容和多层面分析,CalliBench为评估VLM在文化丰富场景中执行灵活、知识密集型推理的能力树立了新标准。视觉压缩、增强和对齐。多模态融合带来了额外的计算开销和对齐困难,强调了有效压缩、增强和跨模态对齐的重要性。MLP变体[18,35,41-43,85,86]被广泛使用。基于可学习查询的Transformer[2,3,26,27,37,38,45,73,82]从目标检测[8]中汲取灵感,可以满足上述需求。非参数聚类[32,76]、二分图[4]、标记替换[27,65]和自适应池化[80]保留了多粒度视觉语义。受这些方法的启发[88,89],我们开发了参数化的逐字切片并采用了感知器重采样器[2]架构。3.先导实验两项先导实验考察:(1)识别视觉字符的最优切片策略,(2)VLM对噪声输入的容忍度。第一项引导我们采用保留语义的逐字切片,第二项确保LLM兼容来自CalliAlign的伪文本标记。3.1最优切片策略VLM使用切片来分解高分辨率图像,但暴力裁剪可能会分割字符部首。逐字切片增强了模型在CC²任务中的识别和推理能力。我们评估了各种切片策略及其对识别准确率的影响。图2展示了四种布局:(1)多字符切片:每片多个字符,(2)单字符切片:每片一个字符,(3)交叉切片:字符跨越两片,(4)四分切片:字符被分为四个象限。我们为每种布局生成200张图像,每张包含6个以宋体渲染的随机字符。使用InternVL2及其448×448ViT,我们对图像进行嵌入并要求识别所有书写字符。我们计算平均精度、召回率和宏F1分数。图2(b)显示单字符布局实现了最高的召回率和F1分数。3.2LLM的模糊嵌入扰动先前的VLM在嵌入空间内集成多模态输入,但很少有研究对其语义信息提供定量分析,以及它们对模糊输入的容忍度。为验证CalliAlign从字符图像生成伪文本嵌入的能力,我们引入高斯噪声来扰动嵌入并分析基础LLM的偏差。在图2(c)中,模型被要求重复100句来自《尔雅》数据集[23]的经典中文句子,对层归一化文本嵌入应用高斯噪声N(μ,σ²),其中μ∈[-2,2],σ∈[0,2]。输出保真度使用ROUGE-L分数衡量。图2(d)显示当μ∈[-1,1]且σ∈[0,1.2]时LLM输出稳定,超出这些范围则显著退化。这些发现刻画了LLM的容忍度并指导了CalliAlign的训练。4.方法图3展示了我们的方法,包含三项核心创新:(1)逐字切片使用检测和排序模块,将页面级分析简化为有序字符级识别;(2)CalliAlign处理ViT提取的字符特征并将其映射到伪文本嵌入,在单字符数据集上训练和扩展,实现准确对齐并减少序列长度;(3)嵌入指令微调(e-IT)应对数据稀缺问题,将真实数据和合成数据统一在同一嵌入表示中。4.1逐字切片受第3.1节启发,我们开发逐字切片以保留布局信息。它识别字符区域、提取有序图像块并保留语义。与自适应切片[10]搜索最优宽高比不同,我们微调YOLOv10[72]进行边界框检测并开发OrderFormer编码器进行排序。图4(左)展示了训练细节。两个模块都在页面级数据上使用YOLOv10的默认检测损失L_detect和均方误差损失L_order进行训练。这些模块总共包含0.31B参数,实现细节见补充材料。在推理过程中(图3),高分辨率图像I∈R^(H×W×3)由检测和排序模块处理。YOLOv10首先识别字符边界框B,然后OrderFormer恢复阅读顺序S:B=f_y(I)={B_i},S=f_o(B)={S_i},B_i=(x_i1,y_i1,x_i2,y_i2),i=1,2...n.图像字符序列X∈R^(n×h×w×3)通过裁剪、填充和调整大小获得:X=Resize(Pad(Crop(S,I)),h×w).上述过程保留了顺序和语义,增强了后续以中国书法为中心的推理能力。4.2CalliAlign图像字符序列X编码了语义和顺序信息。然而,过长的序列可能超出LLM的处理能力。CalliAlign不使用ViT直接作为标记序列,而是将视觉标记映射到文本标记的"标签",增强推理能力和效率。基于感知器重采样器[2,82],0.57B的CalliAlign将256个视觉标记投影为3个伪文本嵌入(每个字符),保留真实、归一化的中文字符嵌入。这实现了98.8%的压缩率,扩展了序列限制,并减少了LLM训练和推理开销:T'_c=CalliAlign(f_ViT(X))∈R^(n×q×d),其中ViTf_ViT从X提取特征,CalliAlign生成伪文本嵌入T'_c(图3)。此外,为减少嵌入方差[54,83]并稳定训练,我们对VLM的文本嵌入T进行层归一化得到T'作为真实值:T'=(T-μ)/σ,其中μ和σ分别代表均值和标准差。CalliAlign简化了训练过程同时保留了原始视觉骨干网络。在训练期间(如图4所示),我们对(X,T')应用L2损失L_align。这允许使用充足的单字符图像数据集进行有效扩展。在推理中,T'_c在集成到LLM之前去归一化。4.3嵌入指令微调传统的LLM微调方法修改融合层[3,41]、LLM[18,82]或两者[38,77,90],需要大量数据,因此不适用于有限的页面级数据场景。为解决这一问题,我们提出嵌入指令微调(e-IT),利用丰富的单字符图像来增强训练数据。e-IT将合成数据和真实指令微调数据统一在共享嵌入空间中。格式连接嵌入:分词后的用户查询+CalliAlign伪文本嵌入。当可用时,页面级图像的全局视觉特征被附加。这种统一嵌入格式允许使用单字符图像和文本语料库进行增强,减少对大量页面级标注的依赖。对于增强,我们从中国诗歌[60]内容创建单字符序列查询,切片页面级图像并使用CalliAlign编码(图4,右)。只有LLM被微调以遵循用户指令,识别、解释和推断原始内容中的知识。e-IT使LLM适应CalliAlign,利用内部知识进行错误纠正和发现。e-IT支持可扩展的LoRA微调,减少内存需求同时提升性能。这些即插即用模块仅增加了0.88B额外参数(8BVLM的10%),即可提升CC²准确率。5.数据集与评测基准本节详细介绍我们收集的单字符和页面级数据集。从后者中,我们开发了一个全面的CC²评测基准,名为CalliBench。5.1单字符数据集我们从书法字典网站[92]收集了742,975张风格化书法字符图像,涵盖6,763个GB2312标准字符。我们将520,083张用于训练,111,446张用于验证,111,446张用于测试,以训练CalliAlign。5.2页面级数据集我们从雅昌艺术网[52]和中国艺术开放数据[7]精选了10,549张密集标注的页面级书法图像,具有多样的风格和布局。7,357个样本用于训练,3,192个构成CalliBench。字符边界框和内容使用LabelMe格式手动标注。该数据集训练逐字切片并微调LLM。对于e-IT,我们随机选择6,000首诗歌用于增强。数据集的详细信息见补充材料。5.3CalliBench:多层级CC²评测CalliBench在多个粒度上评估书法语境化。它通过OCR、多项选择和开放式问题评估全页识别、区域幻觉检测和上下文VQA。表1和图5提供了视觉格式和示例。全页识别评估模型的精确视觉OCR能力。测试集包含三个难度层级:简单(727个样本;常规字体;字符较少)、中等(2,212个样本)和困难(253个样本;草书;多样布局)。我们使用八个以内容为中心的问题评估模型,测量平均精度(P)、召回率(R)和归一化编辑距离(NED)。区域幻觉检测评估模型抵抗幻觉的能力。不完整内容可能导致VLM生成冗余关联或输出,猜测或背诵而非真正识别。我们通过随机裁剪简单级图像以包含部分内容区域,生成727个测试样本。上下文VQA评估模型对书法背景知识的理解和解释能力。多轮视觉问答格式以全页识别查询开始,随后是知识型问题。问题探查对书法风格、布局、作者、双语解释和意图分析的理解:•多项选择题评估风格、布局和作者身份。模型需从三个选项中选择一个正确答案,回答通过准确率(Acc)评估。对于风格和布局,我们分别选择750和806张图像,涵盖所有层级。此外,我们手动标注了1,194张归属于139位作者的图像用于作者身份问题。•双语解释评估内容重述能力。在第二阶段(如表1所示),我们评估英文解释能力。使用SentenceTransformer[64]验证输出与真实值的余弦相似度(STSim)。测试集包含500对人工标注的书法翻译对。•意图分析旨在辨别书法作品背后的动机(如纪念、归档或装饰目的)。这有助于揭示书法段落的历史和文化意义,提供更深入的背景洞察。我们随机选择500个样本,使用DeepSeek-V3[17]和Qwen2.5-Max[61]等顶尖LLM评估模型回答,依据精心设计的提示。书法意图分数(CIS)范围为0到10,然后乘以10。评估框架的详细信息见补充材料。6.实验6.1实现细节CalliReader基于InternVL2-8B[10]构建,结合InternViT-300M-448px和InternLM2.5-7b-chat,实现最先进的识别和理解能力。我们使用YOLOv10[72]进行边界框检测,在8×RTX4080GPU上训练1,000个轮次,学习率1e-2,批量大小80,SGD优化器。OrderFormer是一个仅编码器的4层Transformer,最大序列长度50,8个注意力头每层,256维特征,4/1输入/输出维度。我们增强57,627个列排序样本,使用批量大小4、AdamW优化器(1e-2学习率)和余弦退火预热调度器在RTX4080GPU上训练1,000个轮次。CalliAlign包含4层、3个可学习查询、64个注意力头和4096维特征空间。训练使用4×A6000GPU进行50,000步,学习率1e-4,批量大小256,AdamW优化器和余弦退火调度器。切片和对齐模块在集成前分别训练以增强VLM的CC²能力。YOLOv10[72]模型也作为强基线进行训练。对于微调,我们以全页识别格式创建指令数据集,因为手动标注意图和解释集成本高昂。我们处理7,357个训练页面并为e-IT额外增强6,000个。我们在2×A6000GPU上使用XTuner[16]对InternLM2.5-7b-chat应用e-IT,批量大小2,使用deepspeedZeRO-1训练1个轮次,遵循第4.3节的嵌入指令微调方案。6.2全页识别我们使用精度(P)、召回率(R)、宏F1和归一化编辑距离(NED)评估全页识别性能。评估包括顶尖开源VLM模型(LlaVA-NEXT[35]、MiniCPM-Vs[81]、Qwen2-VLs[73]、Qwen2.5-VLs[61]、Minimonkey[27]、InternVL2-8B[10]、GOT-OCR2.0[75])、闭源VLM模型(Qwen-VL-max[15]、GPT-4o[55])和开源OCR模型(EasyOCR[28]、PP-OCRv4[58]、Ali-OCRAPI[22])。如表2所示,仅使用逐字切片和CalliAlign,我们的方法就超越了所有候选模型,包括领先的闭源模型GPT-4o和Qwen2.5-VL-Max,在简单层级实现超过16%的F1提升,在困难层级实现9%的提升。CalliReader在应用e-IT后进一步扩大了优势,尤其在困难层级,相比最佳竞争者(微调InternVL2-8B)F1分数领先超过9%,NED降低6%。6.3区域幻觉识别书法片段可能导致VLM因内容不一致而产生幻觉。这凸显了验证方法鲁棒性的必要性。图6显示所有VLM在从全页转向区域输入时性能下降。值得注意的是,CalliReader(绿色柱状图)保持了最高性能,F1和NED下降最少。与传统图像文本微调不同,e-IT提高了LLM对伪文本嵌入的兼容性,输出忠实于视觉内容并减少幻觉。6.4上下文VQA我们评估CalliReader在知识选择、双语解释和意图分析方面的性能。对比方法包括MiniCPM2.6、Qwen2.5-VL-7B、InternVL2-8B、GPT-4o-mini[56]以及特定的微调变体(见表3)。LoRA和e-IT在页面级识别上进行调整,隔离CC²推理相关任务的影响。上下文VQA呈现了一个具有挑战性的基准。InternVL2和Qwen2.5-VL的微调前后结果在风格、布局和作者识别方面变化甚微,但在双语解释和意图分析方面显著下降(第3-4行vs.第6-7行)。这种退化源于单任务LoRA微调削弱了指令遵循能力。相比之下,具备逐字切片和CalliAlign的CalliReader超越了其骨干模型(第5行vs.第3行)。应用e-IT后,在所有指标上实现显著提升(第5行vs.第8行),作者识别准确率达到95%。即插即用模块增强了视觉知识的提取,而e-IT通过页面级识别(类似于重建任务)提炼伪文本标记对齐。在不损害模型原始知识和推理能力的前提下,这种方法通过建立更精确的视觉线索强化了上下文理解。6.5识别促进理解表8将CalliReader与最先进的多模态推理模型(DeepSeek-Align[29]、QvQ-72B-Preview[67])在上下文VQA多项选择任务上进行对比。没有逐字切片和CalliAlign,这些模型struggled,尤其是从碑刻中识别作者身份。不充分的视觉内容可能导致长链式思维(CoT)VLM产生错误推理。因此,对于CC²任务,精确的内容识别是有效知识grounded和上下文理解的前提。6.6泛化评估我们在三个中文基准上评估泛化能力:SCUT-HCCDoc[84](手写体)、MTHV2[48](文档)和OCRBench-cn[44](真实场景)。表4显示CalliReader在这些数据集上均取得强劲性能,保持基础VLM能力。为公平起见,所有模型均未在这些数据集上训练。与InternVL2-8B+ft相比,我们的方法在通用文本中心场景中提升了性能。微调PP-OCR在MTHV2上精度更好,但无法泛化到其他场景,EasyOCR完全无法理解这些任务,证明了传统OCR工具在多样场景中的脆弱性。6.7消融实验CalliAlign架构。我们消融CalliAlign的实现,比较块大小(B4:四个块,B2:两个块)、归一化方法(LN:层归一化,GN:全局归一化)和损失组合,包括比率损失L_rat和对比蒸馏损失L_crd[34,68],两者详见附录。我们在所有设置中使用L2损失,使用标签预测准确率评估。表5显示四层、层归一化的重采样器配合L2损失取得了最优性能,最适合伪文本嵌入。推理效率。我们评估CalliReader及其骨干的识别延迟(每页秒数)以解决效率问题。表7显示,使用逐字切片和CalliAlign,CalliReader通过减少幻觉和重复输出降低了中等和困难层级的延迟。相比之下,InternVL2骨干频繁为草书书法生成重复的最大长度输出。这也发生在其他对比模型上。e-IT与其他微调方法。我们在InternLM2.5-7b-chat上对比嵌入指令微调(e-IT)和图像文本微调(img),使用困难层级F1和NED评估全页OCR性能。表6显示e-IT与伪文本嵌入的兼容性更好,优于没有CalliAlign的e-IT和图像文本微调。扩展合成数据(e-IT+scale)进一步改善识别指标,证明其在低资源场景中的有效性。6.8用户研究我们开展用户研究以证明CC²任务的难度。142名志愿者,包括18位书法专家,被要求识别30张随机选择的CalliBench页面。测试者取得较低F1分数(0.512)和较高NED(0.590),而CalliReader超越了人类,F1分数提高40%(0.918),NED降低50%(0.092)。实验设置和统计详情见补充材料。6.9定性结果图7(a)展示了CalliReader在语境化丰富知识、艺术性和情感方面的更多示例。它准确识别草书(第一行)、不同尺寸和布局(第二行作者识别),通过自由形式交互(第三行)实现"从视觉到知识"。它还提供书法家和作者的生平见解,在遵循用户指令的同时

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论