基于大语言模型的常识推理中的思维链与自我一致性增强方法研究综述_第1页
基于大语言模型的常识推理中的思维链与自我一致性增强方法研究综述_第2页
基于大语言模型的常识推理中的思维链与自我一致性增强方法研究综述_第3页
基于大语言模型的常识推理中的思维链与自我一致性增强方法研究综述_第4页
基于大语言模型的常识推理中的思维链与自我一致性增强方法研究综述_第5页
已阅读5页,还剩2页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于大语言模型的常识推理中的思维链与自我一致性增强方法研究综述常识推理是人工智能领域长期追求的核心能力之一,要求模型在缺乏明确背景信息的前提下,利用人类普遍知晓的日常知识完成逻辑推导。近年来,大语言模型(LargeLanguageModel,LLM)凭借万亿级参数的知识存储能力与上下文学习能力,在常识问答、因果推断、社会常识判断等任务上实现了性能突破,但依然存在hallucination(幻觉)、逻辑链条断裂、多步推理一致性不足等问题。思维链(ChainofThought,CoT)与自我一致性(Self-Consistency,SC)作为两类代表性的推理增强技术,为解决上述痛点提供了可行路径,相关研究在近两年呈现爆发式增长,已经成为LLM常识推理方向的核心研究热点。一、常识推理的任务特性与LLM的原生缺陷常识推理与传统特定领域推理的核心差异在于其知识的开放性、逻辑的隐式性与场景的多样性。从任务类型划分,现有常识推理基准可分为四类:一是通用常识问答,如CommonsenseQA、ARC挑战集,要求模型回答包含日常物理、社会文化知识的问题;二是因果推理任务,如COPA、WinogradSchemaChallenge,需要识别事件之间的因果关联或指代关系;三是社会常识推理,如SocialIQA、MoralChoice,考察模型对人类社会规范、情绪动机的理解;四是多模态常识推理,如VCR、OK-VQA,要求模型结合视觉信息与常识知识完成推导。LLM在常识推理任务中暴露的原生缺陷主要体现在三个层面:第一,知识的准确性与完整性问题。LLM的知识来源于预训练语料,对于低频常识、地域文化特异性常识、新兴领域常识的覆盖度不足,且容易出现事实性错误,例如会错误认为“鸡蛋放在微波炉里加热不会爆炸”,这类错误本质是预训练数据中相关知识的分布偏差导致。第二,多步推理的累积误差问题。常识推理往往需要2-5步的隐式逻辑推导,例如问题“小明在冬天的户外忘了戴手套,他摸了一下铁门,为什么会缩回手?”需要依次推导“冬天户外温度低于零度→铁的导热性远高于空气→手接触铁门时热量快速流失→温度骤降引发痛觉反射”,LLM在单步推导中出现的微小错误会在后续步骤中被放大,最终导致结论错误。第三,推理的一致性问题。对于同一个常识问题,LLM在不同提问方式、不同上下文语境下可能给出互相矛盾的答案,例如当问题表述从“鸽子是不是哺乳动物”变为“鸽子属于哺乳动物吗?请给出理由”时,部分小参数LLM会出现答案反转的现象,反映出模型并未真正掌握常识背后的逻辑,只是基于模式匹配输出结果。二、思维链技术在常识推理中的优化路径思维链技术的核心思想是引导LLM在输出最终答案前,先生成类似人类思考过程的中间推理步骤,将复杂的多步推理任务拆解为多个简单子问题,从而降低推理难度。原始CoT采用“Few-shot示例+推理步骤”的提示方式,即在输入中提供数个“问题-推理链-答案”的示例,引导模型模仿示例的格式输出推理过程,但这类方法在常识推理场景中存在示例依赖、推理步骤质量不稳定等问题,后续研究从四个方向实现了优化:(一)零样本与少样本思维链的泛化改进针对Few-shotCoT需要人工设计示例的痛点,零样本思维链(Zero-shotCoT)通过在问题末尾追加“让我们一步一步思考”的提示词,即可触发模型的推理能力,但其在常识推理任务中的性能波动较大,尤其对需要专业常识的问题效果不佳。后续研究通过改进提示模板实现了性能提升,例如常识感知的提示模板会针对不同常识推理任务类型定制引导语,对于因果推理任务追加“请先说明事件的前因,再推导可能的后果”,对于社会常识任务追加“请站在当事人的角度,结合社会规范分析其行为动机”,这类定制化提示能让模型的推理步骤更贴合任务特性。此外,动态示例选择技术被广泛应用于少样本CoT,其核心思路是从训练集中选择与当前问题语义最相似的示例作为上下文,而非随机选择示例,通过语义检索匹配相似问题的推理链,能让模型学习到更适配当前问题的推理模式,在CommonsenseQA数据集上相比随机示例选择方法准确率提升了8%-12%。(二)结构化思维链的逻辑约束传统CoT生成的推理步骤往往是自然语言形式的自由文本,存在逻辑跳跃、冗余信息过多、步骤关系不明确等问题,结构化思维链通过引入符号化表示、逻辑图等形式对推理过程进行约束。例如有研究提出将常识推理的思维链表示为“前提-假设-验证”的三元组结构,要求模型每生成一个推理步骤,都要明确该步骤的已知前提是什么、提出了什么假设、如何验证假设的合理性,这类结构能有效减少推理过程中的无依据跳跃。还有研究将外部常识知识库与思维链生成结合,在模型生成每个推理步骤时,自动检索ConceptNet、ATOMIC等常识知识库中的相关三元组,判断步骤是否符合常识知识,若出现冲突则要求模型重新生成该步骤,这类“检索-生成”结合的方式能将外部知识库的结构化知识注入思维链,大幅降低幻觉出现的概率,在WinogradSchemaChallenge上的错误率降低了15%以上。(三)多模态思维链的跨模态信息融合随着多模态大语言模型的发展,思维链技术开始向多模态常识推理场景延伸。多模态思维链的核心挑战是如何实现视觉信息与语言推理步骤的对齐,现有方法主要分为两类:一类是先将视觉内容转换为文本描述,再基于文本生成思维链,例如先通过目标检测模型识别图片中的物体、场景、物体间的空间关系,将其转换为“图片中有一个玻璃杯、一张桌子,玻璃杯放在桌子边缘”的文本描述,再输入LLM生成推理链;另一类是端到端的多模态思维链,模型直接接收图片与问题输入,在推理过程中同时处理视觉特征与文本特征,例如在VCR任务中,模型会在推理步骤中明确指出“从图片中可以看到人物的左手拿着雨伞,地面是湿的,说明刚刚下过雨”,这类方法能避免视觉信息到文本转换过程中的信息丢失,更适合复杂的多模态常识推理场景。(四)思维链的自我修正机制现有研究发现,即使生成了完整的思维链,其中依然可能存在逻辑错误,因此思维链的自我修正机制成为研究热点。这类方法的核心流程是“生成推理链→错误检测→修正推理链”,错误检测可以通过两种方式实现:一是规则检测,针对常识推理中的常见错误类型制定规则,例如因果倒置、时间线矛盾、常识知识冲突等,对生成的推理步骤进行规则匹配;二是模型自我检测,让LLM自身作为判别器,输入推理链后输出“是否存在错误+错误位置+错误类型”的判断结果。检测到错误后,模型会针对错误步骤进行重新生成,迭代多次直到推理链不存在明显错误,有研究表明引入2-3次的自我修正迭代,能让常识推理的准确率提升10%左右,且推理链的逻辑性与可读性显著提升。三、自我一致性技术的原理与常识推理适配方案自我一致性技术由GoogleDeepMind团队在2022年提出,核心思想是通过采样多个不同的推理路径,再采用多数投票的方式选择出现次数最多的答案,本质是利用模型输出的多样性提升推理的鲁棒性。原始SC方法在算术推理任务中取得了显著效果,但直接应用于常识推理场景时存在投票策略不合理、低质量推理路径干扰、答案多样性不足等问题,后续研究从三个方向进行了适配优化:(一)自适应采样策略的设计原始SC方法采用温度系数固定的随机采样,容易出现大量重复的推理路径,或者生成质量极低的无效路径。自适应采样策略会根据问题的难度动态调整采样参数,对于简单常识问题,仅采样3-5条推理路径即可获得稳定的结果,对于复杂的多步推理问题,则将采样数量提升至10-20条,同时动态调整温度系数,初始阶段采用较高的温度系数保证路径多样性,当出现3条以上相同答案的路径时,降低温度系数提升路径质量。此外,有研究提出多样性引导的采样策略,在每次采样时,要求新生成的推理路径与已有的路径语义相似度低于预设阈值,避免生成重复的推理路径,在保证答案覆盖度的前提下减少采样数量,降低推理成本。(二)加权投票机制的优化原始SC采用“一人一票”的多数投票机制,默认所有推理路径的可靠性相同,但实际上不同推理路径的逻辑完整性、常识符合度差异很大,低质量路径的投票会干扰最终结果。加权投票机制为每条推理路径分配不同的权重,权重的计算主要参考三类指标:一是推理路径的困惑度,LLM生成推理路径时的困惑度越低,说明路径的流畅性与合理性越高,权重越高;二是推理步骤的完整性,包含的中间步骤越多、逻辑链条越完整的路径权重越高;三是常识符合度,推理步骤与外部常识知识库的匹配度越高,权重越高。还有研究引入了置信度校准的投票机制,让模型在输出每条推理路径的同时,给出该路径的自身置信度评分,将置信度作为权重的核心参考指标,相比原始多数投票,加权投票在常识推理任务上的准确率提升了5%-9%,尤其在歧义性较高的社会常识推理任务上效果更明显。(三)一致性与多样性的平衡策略自我一致性技术的核心矛盾是推理路径多样性与答案一致性的平衡,若采样路径的多样性过高,会出现答案分散、无法形成多数共识的情况;若多样性不足,则难以覆盖正确的推理路径。现有研究主要通过两阶段采样解决该问题:第一阶段为探索阶段,采用高温度系数采样10-15条推理路径,获得初步的答案分布,若某一答案的占比超过60%,则直接输出该答案;若答案分布较为分散,则进入第二阶段的聚焦阶段,针对占比最高的2-3个候选答案,分别采样更多的推理路径,判断每个候选答案下推理路径的平均质量,选择平均质量最高的答案作为最终结果。还有研究引入了辩论机制,针对不同答案的推理路径,让模型互相指出对方路径中的错误,通过多轮辩论淘汰存在逻辑缺陷的路径,最终剩下的路径所属的答案即为最优结果,这类方法能在减少采样数量的同时提升结果可靠性。四、思维链与自我一致性的融合框架与前沿进展思维链技术侧重提升单条推理路径的质量,自我一致性技术侧重通过多路径投票提升鲁棒性,两类技术具有天然的互补性,近年来融合两类技术的方法成为常识推理领域的主流研究方向,已经形成了三类典型的融合框架:(一)“多思维链生成-一致性校验”基础框架这是目前应用最广泛的融合框架,核心流程为:针对输入的常识问题,首先采样生成多条不同的思维链,每条思维链对应一个候选答案,然后对所有思维链进行质量评估与一致性校验,最终输出一致性最高且质量最优的答案。在这个框架中,思维链的生成质量直接决定了后续一致性校验的效果,因此现有研究多聚焦于提升多思维链的多样性与质量,例如有研究提出基于提示扰动的多思维链生成方法,通过对问题提示进行同义词替换、句式改写等微小扰动,生成多个不同的输入提示,每个提示对应生成一条思维链,既能保证思维链的多样性,又能避免生成偏离问题本身的无效路径。还有研究在一致性校验阶段引入路径聚类,先将语义相似、推理逻辑相近的思维链聚为一类,再以类为单位进行投票,避免大量相似路径的重复投票干扰结果。(二)分层一致性增强框架针对复杂常识推理问题的多步特性,分层一致性增强框架将一致性校验从最终答案层面下沉到推理步骤层面,要求不仅最终答案要一致,中间的推理步骤也要具有一致性。其核心流程为:生成多条思维链后,将每条思维链拆解为独立的推理步骤,对所有步骤进行跨路径的一致性校验,若某一步骤在超过80%的思维链中出现,则判定为共识步骤,对于非共识步骤,要求模型重新生成,直到所有步骤都达到较高的一致性,最终基于共识步骤生成最终答案。这类框架能有效避免“正确答案+错误推理过程”的情况,提升推理过程的可解释性,有研究在医疗常识推理任务中应用该框架,不仅提升了答案准确率,还让推理过程的临床符合度提升了20%以上,更适合对推理可靠性要求较高的领域场景。(三)小参数模型的知识蒸馏框架大参数LLM的思维链与自我一致性能力突出,但推理成本高、延迟大,难以落地到边缘设备,知识蒸馏框架将大模型的推理能力迁移到小参数模型中。其核心思路是:用大模型基于思维链与自我一致性技术生成大量高质量的“问题-推理链-答案”三元组数据,作为蒸馏数据集,然后用该数据集微调小参数模型,让小模型学习大模型的推理模式。为了提升蒸馏效果,现有研究提出了一致性蒸馏的思路,不仅让小模型学习单条推理链的输出,还让小模型学习多条推理路径的分布特征,训练小模型输出的答案分布与大模型多路径采样的答案分布一致,在7B参数模型上实现了接近70B参数模型的常识推理性能,推理速度提升了10倍以上,为技术的落地应用提供了可行路径。五、现有研究的局限与未来发展方向尽管思维链与自我一致性技术已经大幅提升了LLM的常识推理能力,但现有研究依然存在三个核心局限:一是常识知识的边界问题,现有方法主要依赖预训练数据与外部知识库中的常识,对于未见过的长尾常识、反事实常识、个性化常识的推理能力依然不足;二是推理的可解释性问题,虽然思维链提供了中间推理步骤,但依然无法明确模型的决策逻辑,难以判断推理步骤到底是模型真实的推导过程还是为了匹配答案而生成的“伪解释”;三是效率与性能的平衡问题,多路径采样与多次迭代修正会带来推理成本的指数级上升,如何在保证性能的前提下降低推理开销,是技术落地需要解决的核心问题。未来研究的发展方向主要集中在四个方面:第一,动态常识知识库的实时融合,将互联网实时更新的常识知识与思维链生成过

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论