CN119415546A 一种基于大语言模型的文本到结构化查询语言转换方法 (清华大学深圳国际研究生院)_第1页
CN119415546A 一种基于大语言模型的文本到结构化查询语言转换方法 (清华大学深圳国际研究生院)_第2页
CN119415546A 一种基于大语言模型的文本到结构化查询语言转换方法 (清华大学深圳国际研究生院)_第3页
CN119415546A 一种基于大语言模型的文本到结构化查询语言转换方法 (清华大学深圳国际研究生院)_第4页
CN119415546A 一种基于大语言模型的文本到结构化查询语言转换方法 (清华大学深圳国际研究生院)_第5页
已阅读5页,还剩20页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于大语言模型的文本到结构化查询一种基于大语言模型的文本到结构化查询构化查询语言SQL查询所需的表和列;筛选上下构化查询语言Text_to_SQL相似性得分,选出与使用大语言模型生成SQL查询语句。本发明可用于优化自然语言到SQL的自动转换过程,提高其转换准确率,用于为非SQL使用者提供快捷方便成RAG等机制提供更广泛形式的数据接入方式等2Z2:筛选上下文样例,利用交叉编码器语言模型预测文本到结构Z3:将裁剪后的数据库表和列信息及筛选出的上下文2.如权利要求1所述的基于大语言模型的文本到结构化查询语言转换方法,其特征在Text_to_SQL场景下的自然语言查询问题_SQL样例对进行训练,面对给定的自然语言问题3.如权利要求1或2所述的基于大语言模型接收数据库模式和自然语言查询作为输入,其中数据库模式包括表集在训练阶段,分类器学习预测数据库中的表和列与给定自然语言查询问题的相关性,在推理阶段,分类器为每个表和列提供相关性评分,并将评分超过设定通过提取对应于自然语言查询问题的SQL样例中的表和列,来确定数据库模式中每个4.如权利要求1至3任一项所述的基于大语言模型的文本到结构化查询语言转换方法,将数据库模式转化为图表示,其中节点集合代表数据库中的表将表列裁剪任务建模为斯坦纳树问题,目标是提取包含所有待保留表的最小连通子对于相关性评分低于设定阈值的表,检查其是否与已识别的连通对于每个被保留的表,保留其评分超过阈值的列及其主键,确保35.如权利要求1至4任一项所述的基于大语言模型的文本到结构化查询语言转换方法,SQL样例集和裁剪后的数据库纲要,使用该模型应用于Text_to_SQL样例集中的每一个6.如权利要求1至5任一项所述的基于大语言模型的文本到结构化查询语言转换方法,给定当前自然语言查询问题和数据库纲要,在样例集中找到与当前问损失函数采用基于模型输出与标签值差异的函数,以优化模型在预测阶段,使用训练好的模型和当前自然语言查询问题,对7.如权利要求1至6任一项所述的基于大语言模型的文本到结构化查询语言转换方法,其特征在于,步骤Z3中,使用一个针对代码生成任务微调过的预训练大语言模型如Qwen_器执行时实现如权利要求1至7任一项所述的基于大语言模型的文本到结构化查询语言转4求(Text)转化为关系型数据库检索时所使用的结构化数据语言(StructuredQuery方法为使用大语言模型(LargeLanguageModel,LLM,下文或简称大模型)针对Text2SQL任将实际生产应用所用数据库表信息和表中的列信息等问题关联信息有效引入大模型的生Information,而引入纲要信息的这一过程称为模式链接(SchemaLinking)或者是纲要链过程中于模型提示词部分加入合适的SQL生成样例参考将有助于有效激发模型的SQL生成上下文学习过程主要分为零样本学习(Zero_ShotLearning)与少样本学习(Few_Shot表及其列描述信息并入大模型提示词,提示词长度将超过大模型窗口长度(ContextLength)限制而影响生成,同时提示词中大量问题无关的库表和列描述信息的充斥将降低[0003]需要说明的是,在上述背景技术部分公开的信息仅用于5[0016]通过提取对应于自然语言查询问题的SQL样例中的表和列,来确定数据库模式中6to_SQL样例集和裁剪后的数据库纲要,使用该模型应用于Text_to_SQL样例集中的每一个[0028]训练交叉编码器语言模型,该模型用于预测问题对之间的Text_to_SQL相似性得[0029]在训练阶段,模型的输入包括数据库纲要和一对问题,输出为该问题对的Text_合纲要信息裁剪与上下文样例筛选的大语言模型Text_to_SQL优化方法,可用于优化自然方便的数据库检索机制,及为大语言模型检索增强生成(Retrieval_AugmentedGeneration,RAG)等机制提供更广泛形式的数据接入方式等[0038]本发明提出的结合纲要信息裁剪与上下文样例筛选的大语言模型Text_to_SQL优语言模型上下文学习特性激发效果的同时改善大语言模型因对领域特定数据库数据内容文样例筛选方法对Text_to_SQL特性兼容不足的问题提出了针对Text_to_SQL上下文样例7型上下文学习特性激发效果的同时改善大语言模型因对领域特定数据库数据内容与组成快捷方便的数据库检索机制,及为大语言模型检索增强生成(RAG)机制提供更广泛形式的[0041]图1是本发明优选实施例的基于大语言模型的文本到结构化查询语言转换Text_[0042]图2是本发明优选实施例的一种数据库纲要信息裁剪(SchemaPruning)方法流程[0043]图3是本发明优选实施例的一种针对Text_to_SQL任务的上下文样例筛选方法流[0045]Text_to_SQL问题可以定义如下:一个关系型数据库可以被形式化表示为其中T=ft1,ta…,t是数据库中关于表的集合,是关于列的集合,是关于单元格值的集合,主键对。对与数据库D的数据库纲要S={J,C,F即为由表列外键关系F组成的集y'=LLM(P(X,D,E)),LLM代表所选用的大语言模型,P代表提供给大模型的对应提示发明提出一种结合纲要信息裁剪与上下文样例筛选的大语言模型Text_to_SQL优化方法,8型上下文学习特性激发效果的同时改善大语言模型因对领域特定数据库数据内容与组成快捷方便的数据库检索机制,及为大语言模型检索增强生成(RAG)机制提供更广泛形式的[0047]参阅图1,本发明实施例提供一种基于大语言模型的文本到结构化查询语言转换对给定的自然语言问题x,使用所述分类器为每个表和每个表中的列给出关于该自然语言的连通子图中的节点存在外键_主键连接;如果是,则将这些表包含在最终保留的表集合9的每一个Text_to_SQL样例得到评分最高的k个样例,即为与自然语言查询最相关的k个[0054]参阅图3,在优选的实施例中,步骤Z2中,上下文样例筛选方法具体包括:接收问题的余弦相似度与对应SQL表达式结构相似度的组合;损失函数采用基于模型输出与标[0057]本发明实施例提出了一种结合纲要信息裁剪与上下文样例筛选的大语言模型言模型因对领域特定数据库数据内容与组成感知不足而导致生成SQL产生偏差的问题,提非SQL使用者提供了一种快捷方便的数据库检索机制,并为大语言模型检索增强生成等机制提供了更广泛形式的数据接入方式,从而在实际应用中表现出更高的SQL生成准确率和[0060]一种结合纲要信息裁剪与上下文学习筛选的大语言模型Text_to_SQL优化方法,[0064]图1所示为本发明优选实施例的结合纲要信息裁剪与上下文样例筛选的大语言模法,用于消除目标SQL查询过程中不需要的表和列。该方法有助于缩短每个示例的输入长于每个表ti,其列由表示;P=代表主键,[0067]分类器通过大量Text_to_SQL场景下的自然语言查询问题_SQL样例对进行训练,模式裁剪任务建模为斯坦纳树问题(SteinerTreeProblem)。数据库模式被表示为图G=标是从图G中提取包含所有表的最小连通子图G’。由于斯坦纳树问题是p的列只有与目标SQL相关的数据库表和列信息得以保留。任何与表和列无关的主键和外Dn={J,C,P,F}。前自然语言查询问题x和数据库D,上下文样例选择问题需要在E中找到topk个与x最“相关”的样例子集Esub=该问题关键在于给出相似度库纲要以及对应问题的SQL结构,因为问题的轻微表述差异可能带来SQL结构的巨大变化;以llama_1.3B为基础模型,用于预测一对问题之间的Text_to_SQL相似性得其中sim1为针对自然语言查询x1和x2的余弦相似度函数,sim2为z为(x,x1)的Text_to_SQL相似性得分。最后,对训练所得模型,和当前自然语言查询x和Dn={T,C,P,PF,使用该模型应用于E中的每一个Text_to_SQL样例(x1,y1),得到评分数据库表描述以及使用Z2的样例筛选方法选出若干个自然语言问题相关的上下文样中,非易失性存储器可以是只读存储器(ROM,ReadOnlyMemory)、可编程只读存储器(PROM,ProgrammableRead_OnlyMemory)、可擦

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论