智能体开发实战(Dify)(微课版)课件 项目七 智慧校园智能体深研-深度研究工作流开发_第1页
智能体开发实战(Dify)(微课版)课件 项目七 智慧校园智能体深研-深度研究工作流开发_第2页
智能体开发实战(Dify)(微课版)课件 项目七 智慧校园智能体深研-深度研究工作流开发_第3页
智能体开发实战(Dify)(微课版)课件 项目七 智慧校园智能体深研-深度研究工作流开发_第4页
智能体开发实战(Dify)(微课版)课件 项目七 智慧校园智能体深研-深度研究工作流开发_第5页
已阅读5页,还剩88页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

项目七

智慧校园智能体深研--深度研究工作流开发项目背景与目标CONTENTS目录【教学目标】【项目背景】【项目目标】【项目分析】【教学目标】01技能目标(1)具备高级工作流编排能力,能够使用Dify等平台设计包含循环迭代、条件判断及参数提取的复杂工作流,解决非线性业务问题。(2)能够开发深度研究智能体,能够利用搜索工具与大语言模型(LLM)协同,构建具备自主上网检索、信息筛选与整合能力的深度研究应用。(3)熟练运用代码扩展功能,能够编写Python或JavaScript代码片段,在工作流中实现自定义的数据清洗、格式转换或数学运算功能。(4)掌握调试与优化技巧,能够运用断点调试、日志分析等手段,定位并修复复杂工作流中的逻辑错误,能够利用自我反思机制优化智能体的输出质量。【教学目标】(1)掌握复杂任务推理机制,深入理解思维链(ChainofThought,CoT)的原理及其在提升大语言模型逻辑推理能力中的作用,熟悉TOT(思维树)等主流智能体规划算法的运行逻辑。(2)理解高级工作流编排技术,掌握工作流中的迭代控制结构、条件分支判断及动态变量管理方法;理解代码扩展节点在处理复杂数据逻辑中的必要性。(3)认知深度研究架构,了解深度研究智能体的工作范式,包括多源信息检索、长文本综合处理及结构化报告生成的规范与流程。(4)熟悉人机协同模式,掌握异步任务处理架构在长耗时场景下的应用价值。【教学目标】素质目标(1)培养系统工程思维,在面对复杂任务时,养成拆解问题、模块化设计与流程化治理的系统工程意识。(2)树立严谨的逻辑思维,通过设计思维链与规划算法,锻炼逻辑推理的严密性与条理性,提升解决抽象问题的能力。(3)增强技术伦理意识,在深度研究与信息抓取过程中,自觉遵守网络爬虫协议与数据隐私保护规范,养成合法合规的开发习惯。(4)提升创新与协作精神,鼓励探索人机协同的新模式,激发利用AI技术解决实际问题的创新热情,并在项目实践中培养团队协作能力。【教学目标】【项目背景】随着智慧校园建设的不断深入,师生对人工智能应用的需求已从基础的单轮问答、简单的工具调用,逐渐升级为对复杂问题的深度挖掘、逻辑分析与综合研判。例如,在开展“特定学科前沿文献综述”、“校园节能减排方案可行性调研”或“跨学科交叉创新趋势分析”等开放性任务时,传统的基础智能体往往受限于单次生成能力的边界、知识更新的滞后性以及逻辑推理深度的不足,容易产生“幻觉”或给出缺乏深度、表面化的回答。为了应对此类需要多步规划、海量信息检索、复杂数据清洗及长文本生成的综合性任务,必须打破线性任务处理的局限。引入“深度研究(DeepResearch)”架构与高级工作流(Workflow)编排技术,赋予智能体自主拆解任务、迭代反思以及人机协同的能力,已成为当前复杂智能体应用演进的必然趋势。【项目背景】项目目标03本项目旨在综合运用大模型复杂推理机制与高级工作流编排技术,开发一款适用于智慧校园场景的“深度研究智能体”。通过本项目的实施,要求实现以下核心目标:1.构建具备自我反思与任务规划能力的认知架构,使智能体能够自主拆解复杂的调研需求。2.搭建包含循环迭代、条件分支与自定义代码扩展的高级工作流,实现对多源异构数据的高效处理与动态管理。3.深度集成互联网搜索引擎,规范信息检索、校验与融合的全流程,最终自动生成结构化、具有高参考价值的深度研究报告。4.设计并实现长耗时任务的异步处理架构,引入人机协同机制,在关键决策节点实现人机协同审查,保障研究成果的安全性与可靠性。【项目目标】项目分析04深度研究智能体的开发是一个高度综合的系统性工程,涉及认知架构设计、流程控制逻辑、信息处理机制与人机交互模式四个维度的技术深度整合。具体分析如下:1.认知架构层面(对应推理与规划机制)突破模型单次生成的推理瓶颈,需要引入思维链(CoT)与智能体规划算法(如ReAct等),使智能体在面对宏大课题时,能够进行任务拆解与自我反思。这是确保智能体在冗长的研究过程中不偏离主题、逻辑连贯的核心驱动力。2.流程控制层面(对应高级工作流编排)深度研究通常面临海量数据与多分支逻辑,基础的线性工作流无法胜任。必须运用高级编排技术,通过迭代控制结构(如循环节点)处理批量检索结果,并结合代码扩展能力(Python/JavaScript节点)与动态变量提取技术,实现定制化的数据格式转换与信息过滤。3.信息处理层面(对应深度研究架构)构建深度研究的闭环,关键在于连接广域网获取实时信息。需要设计针对搜索引擎工具的高级调用策略,实现多信源数据的交叉验证、信息去重与逻辑梳理,最终依托严格的提示词工程,输出符合学术或商业规范的深度研究报告。4.交互模式层面(对应异步与人机协同)与毫秒级响应的问答系统不同,深度研究往往需要数分钟甚至更长的执行时间。因此,系统必须采用异步处理架构,避免前端阻塞;同时,由于研究方向的开放性与结果的重要性,必须在工作流的关键节点引入人机协同设计,允许人类用户进行中期审核、方向纠偏或结果确认,实现机器算力与人类智慧的优势互补。【项目分析】知识准备在复杂任务场景中,智能体需要具备类似人类的“慢思考”能力,即在给出最终结果前,进行深度的逻辑推演、步骤规划与错误验证。本节将深入剖析思维链、规划算法及自我反思三大核心机制。7.1复杂任务推理与规划机制1.大语言模型的逻辑推理能力力边界大语言模型(LLM)的底层运行机制是基于统计概率的自回归文本生成(即预测下一个词)。这种机制在处理语言翻译、文本摘要等模式匹配任务时表现优异,但在面对多步骤数学计算、复杂逻辑推演或因果关系分析时,往往暴露出明显的局限性。由于缺乏显式的计算过程,模型试图一步跨越从“复杂问题”到“最终答案”的巨大语义鸿沟,极易导致逻辑断裂、信息遗漏或产生“幻觉”。这种现象被称为系统性推理缺陷,是限制大模型处理复杂任务的核心边界。2.CoT提示范式:中间推理步骤的生成机制为了突破上述能力边界,研究人员提出了思维链(ChainofThought,CoT)提示范式。CoT的核心逻辑在于强制模型在输出最终答案之前,先生成一段连贯的、结构化的中间推理过程。通过将隐式的思考过程显式化,大模型能够将一个复杂的庞大问题转化为一系列简单的、可线性求解的子问题。在生成每一步推理内容时,模型都可以将前一步的输出作为当前步的上下文依赖,从而大幅降低了逻辑偏误的概率。在深度研究任务中,CoT是智能体分析文献关联性、梳理研究脉络的基础。7.1.1思维链(ChainofThought,CoT)原理3.零样本(Zero-Shot)与少样本(Few-Shot)CoT的应用差异在实际开发中,触发思维链机制主要有以下2种方式:(1)零样本思维链(Zero-ShotCoT)无需提供任何推理示例,仅在提示词末尾附加一句特定的触发指令(例如最经典“请一步步进行逻辑推演”)。这种方式通用性极强,开发成本低,适用于通用领域的开放性问题。(2)少样本思维链(Few-ShotCoT)在系统提示词中,人为提供若干个包含“问题-推理过程-答案”的完整范例。模型通过上下文学习(In-ContextLearning)机制,精准模仿范例中的推理逻辑与输出格式。在特定垂直领域,如严格的学术文献分析、严谨的财务报表解读中,少样本思维链能够提供更稳定、格式更规范的推理表现。7.1.1思维链(ChainofThought,CoT)原理如果说思维链解决了“如何思考”的问题,那么规划算法则解决了“如何行动”的问题。规划算法赋予了智能体宏观的战略调度能力,使其能够在动态环境中管理多步任务。1.任务拆解策略:将复杂目标分解为可执行子任务面对一个宏观的深度研究课题,例如“撰写一份2025年新能源汽车固态电池技术趋势报告”,智能体无法一次性完成资料收集与撰写。此时,规划算法首先启动任务拆解(TaskDecomposition)机制。系统会将宏大的原始目标拆解为一棵多层级的任务树。例如,主任务被拆分为:获取基础概念、检索头部企业动态、查找最新学术论文、汇总数据、撰写摘要等子任务。任务拆解不仅降低了单次执行的复杂度,还为后续的并行计算、工具调度与节点重试提供了可操作的基本单元。2.TOT(TreeofThoughts)与GOT(GraphofThoughts)思维结构简述针对需要极高容错率与复杂探索空间的任务,学术界进一步演化出了非线性的高级思维结构:(1)TOT(思维树):允许智能体在推理时探索多条不同的路径。智能体能够评估每条分支的有效性,若某条思路被证明无效(如搜索方向错误),算法支持执行回溯(Backtracking),退回上一节点并尝试新的分支。(2)GOT(思维图):打破了树状结构的层级限制,允许将多条独立的思维路径进行合并(Synergy)与交叉验证。在深度研究中,这意味着智能体可以将独立检索到的技术数据与市场数据进行融合分析,形成网络化的综合认知。7.1.2智能体规划算法在长时间无人干预的深度研究流程中,错误的产生是不可避免的。自我反思机制赋予了智能体类似人类的“元认知(Meta-Cognition)”能力,使其能够进行结果核验与自我纠偏。1.结果评估:智能体对生成内容的自我审查自我反思机制通常引入“行动者-批评者(Actor-Critic)”架构。当“行动者”模型生成一份阶段性报告或检索总结后,“批评者”模型(或专门的评估节点)将对内容进行严格的打分与审查。评估的维度通常包括:(1)事实一致性:生成的论点是否有真实的检索数据作为支撑,是否存在模型幻觉。(2)任务对齐度:当前产出是否解答了原始任务拆解时的核心诉求。(3)规范性:格式、字数、引用规范是否符合预设要求。2.错误纠正:基于反馈的迭代优化流程若结果评估未通过,系统将触发错误纠正流程(Reflexion)。智能体会自动提取“批评者”的反馈意见,并将其作为新的上下文背景附加到下一轮的提示词中。基于这些反馈,智能体会重新规划搜索关键词、调整逻辑框架或重写文本段落。这种“生成-评估-反馈-修正”的闭环迭代,有效模拟了人类撰写深度报告时“起草-审阅-修改”的过程,大幅提升了最终输出的可靠性。7.1.3自我反思与修正机制(Self-Reflection)3.记忆与上下文管理在长程任务中的作用深度研究往往会产生数十次搜索与大量中间文本,极易突破大语言模型固有的上下文窗口(ContextWindow)长度限制。因此,自我反思机制必须依赖科学的记忆管理策略,主要包括2种记忆管理策略。(1)短期记忆(工作记忆):仅保存当前子任务的即时推理步骤与最新观测数据,保证高频响应。(2)长期记忆管理:将完成评估的历史数据、关键事实或文档切片,通过向量化存储至外部数据库,或使用模型将其压缩为精简的摘要状态。通过记忆的动态加载与擦除,智能体不仅能在反思时精准调取历史经验,还能避免因上下文过载导致的推理能力下降或系统崩溃。7.1.3自我反思与修正机制(Self-Reflection)在深度研究等复杂业务场景中,智能体面对的不再是单一的线性问答,而是涉及多源数据获取、批量信息处理与非标准数据清洗的综合性系统工程。基础的链式工作流(如节点A连接节点B)已无法承载此类需求。因此,必须引入高级工作流编排技术,通过迭代控制、代码扩展与动态变量调度,赋予工作流图灵完备的逻辑表达能力,从而实现对复杂业务流程的精准刻画。7.2高级工作流编排技术深度研究通常需要处理批量数据,例如对搜索返回的数十个网页链接进行逐一摘要,或对长篇文献的多个段落进行分块翻译。迭代控制结构(即循环节点)是解决此类批量化处理任务的核心组件。1.循环逻辑在工作流中的定义与实现在Dify等工作流引擎中,迭代控制结构被封装为迭代节点。它接收一个数组(Array)类型的数据作为输入,例如从知识库检索到的多段文本列表,并在其内部嵌套一段子工作流。引擎会自动遍历输入数组,将数组中的每一个元素依次传入子工作流中执行,例如依次调用大模型进行总结,最终将每次执行的输出结果自动聚合为一个新的数组。这种机制使得工作流能够动态适应不同规模的数据量,避免了为固定数量的数据编写冗余的节点。2.列表处理模式:对数组数据的批量化操作迭代控制本质上是对经典编程范式中“Map(映射)”操作的可视化实现。在深度研究应用中,典型的列表处理模式包括:(1)批量搜索:输入包含多个研究关键词的数组,循环调用搜索引擎工具,输出包含所有检索结果的二维数组。(2)批量信息抽取:输入包含多篇长文本的数组,循环调用大模型节点进行关键信息提取,输出结构化的事实清单。这种模式极大地提升了工作流处理非结构化异构数据的吞吐能力。迭代节点配置界面,在迭代节点内部,可以配置大模型节点,配置输入变量为多个文档大纲,输出变量为大模型根据文档大纲编写每个章节内容。7.2.1迭代控制结构并发执行与顺序执行的效率对比在Dify中配置迭代节点时,开发者可以根据业务需求选择执行模式,包括2种执行模式。顺序执行:数组元素按照索引顺序逐一被处理。优势在于逻辑稳定、调试容易,且对有速率限制的第三方API非常友好。并发执行:系统同时调度多个线程并行处理数组中的元素。对于深度研究中常见的“多网页并发爬取”或“多文档并发总结”任务,开启并发模式可将整体耗时缩短数倍,是提升用户体验的关键手段。大语言模型在自然语言理解和生成方面表现卓越,但在处理确定性逻辑(如精确的数学计算、复杂的字符串解析、数据格式转换)时,极易产生偏差。代码执行节点的引入,有效弥补了这一短板。1.代码节点(CodeNode)的功能定位与应用场景Dify提供了内置的代码(Code)节点,允许开发者直接嵌入Python3或JavaScript/Node.js脚本。它是一个安全的沙箱环境,其核心定位是处理确定性、规则性极强的数据转换任务。在深度研究工作流中,代码节点常用于以下场景:(1)数据清洗:对搜索引擎返回的原始JSON数据进行解析,去除HTML标签、广告链接或无用字段。(2)格式转换:将大模型输出的非标准文本转换为严格的JSON对象,或将多个字符串拼接为Markdown报表格式。(3)数学运算:计算统计数据的平均值、增长率等指标。7.2.2代码扩展能力2.数据清洗与转换算法的Python/JavaScript实现在实际开发中,外部工具返回的数据往往包含大量冗余信息。通过在代码节点中编写清洗算法,可以实现数据的高效“瘦身”。例如,搜索工具返回的结果可能包含“title”“snippet”“link”“thumbnail”“rank”等多个字段。在Dify的代码节点中,可以编写代码7-1所示的Python代码,仅提取标题和摘要并重新组合。这段代码将复杂的对象数组转换为简洁的字符串列表,不仅减少了Token消耗,还降低了大模型处理时的噪声干扰。3.结构化数据的逻辑处理与校验代码节点的另一重要功能是对大模型的输出进行后置校验。尽管可以通过提示词约束大模型输出JSON格式,但在复杂任务中仍可能出现格式错误。在工作流中,将代码节点紧接在大模型节点之后,可编写代码尝试解析大模型的输出(如json.loads())。若解析失败,代码节点可以返回特定的错误标识,触发工作流进入“重试”或“错误处理”分支。若解析成功,则验证关键字段的数据类型,确保只有合规的数据才能流向下一个节点。7.2.2代码扩展能力defmain(arg1:list)->dict:return{"result":[f"标题:{item.get('title')}\n摘要:{item.get('content')}"foriteminarg1ifitem.get('content')#过滤掉空内容

]}高级工作流本质上是一个基于数据流驱动的图结构。节点与节点之间的协同,依赖于动态变量在全局的高效传递与精准更新。1.复杂文本中的关键信息抽取技术在深度研究的入口端,用户输入的往往是一段冗长且意图模糊的自然语言。为了驱动后续的精准搜索,必须进行参数提取(ParameterExtraction)。Dify提供了“参数提取器”节点。它利用LLM的推理能力,自动从用户查询中识别并抽取出特定类型的实体结构,例如包括如下3个实体结构。(1)研究主题(String):如“固态电池技术”。(2)时间范围(String):如“2023年至2025年”。(3)目标格式(Enum):如“简报”、“详细论文”或“表格”。这些被抽取的实体将转化为结构化变量,作为后续节点的输入参数。7.2.3参数提取与动态变量管理2.动态变量在多节点间的传递与更新机制在Dify的可视化编排界面中,变量管理遵循引用机制,具体包括如下2个。(1)上游传递:任何节点的输出都会自动注册为可被下游引用的变量。例如,我们在“搜索节点”中,可以直接通过“{{#context.query#}}”引用上游“参数提取节点”输出的查询词。(2)变量更新:在循环或复杂逻辑中,我们可以利用变量赋值器(VariableAssigner)节点。它允许用户定义一个可写的会话变量,并在工作流的不同阶段对其进行写入或追加操作。例如,在深度研究中,可以创建一个空的“report_content”变量,随着每轮搜索和总结的进行,不断将新的内容追加进去,最终形成完整的报告。7.2.3参数提取与动态变量管理3.上下文窗口的优化策略大语言模型具有严格的上下文长度限制。在深度研究场景下,数十个网页的全文若直接拼接传递,极易造成Token溢出或“中间信息丢失”。在Dify工作流中,变量管理必须结合优化策略,具体包括下面3个。(1)分块处理:对于长文档,先使用“文档分割”功能将其切分为多个片段(Chunks)。(2)中间摘要:在获取长文本后,不直接传递原文变量,而是立即接入一个大模型节点生成摘要,仅向下游传递精简后的摘要变量。(3)选择性引用:在配置大模型节点的提示词时,只引用必要的变量(如“{{#search_result_summary#}}”),而非将整个历史对话记录(即“{{#sys.query#}}”)全部填入,以节省Token并提高模型的注意力集中度。7.2.3参数提取与动态变量管理在传统的问答系统中,智能体通常仅进行单次的知识检索或工具调用,其输出受限于单次搜索的广度与模型自身的上下文窗口。而“深度研究(DeepResearch)”是一种更为高阶的智能体架构,旨在模拟人类研究员的治学过程:从模糊的命题出发,自主规划搜索方向,泛读大量文献,进行交叉比对,最终输出结构化的长篇综述报告。本节将结合Dify工作流框架,系统剖析深度研究架构的设计范式与核心技术。7.3深度研究(DeepResearch)架构设计深度研究的核心在于赋予智能体“主动探索”与“海量信息压缩”的能力,打破传统信息获取的被动性。1.主动搜索与被动检索的区别(1)被动检索(如基础RAG):依赖于预先构建的本地知识库(向量数据库)。当用户提问时,系统在封闭的资料库中寻找相似片段。其局限性在于知识无法实时更新,且受限于本地数据的丰富度。(2)主动搜索(深度研究核心):将整个广域网(或大型学术数据库)作为动态知识库。智能体能够根据任务需求,主动生成未知的搜索关键词,实时调用搜索引擎获取最新数据,并根据初步结果决定是否需要改变搜索策略进行“二次深挖”。7.3.1深度研究智能体的工作范式2.深度研究的标准流程在Dify工作流中,深度研究通常被编排为一条多阶段的流水线。包括如下4个步骤:(1)意图分析:接收用户的原始课题,利用大模型节点拆解研究子维度(如“技术原理”、“市场规模”、“主要竞品”)。(2)多源信息搜集:针对每个子维度生成多个独立的搜索关键词,并发调用外部搜索工具获取数十篇网页链接。(3)交叉验证:利用网页抓取工具读取正文,通过代码节点清洗冗余数据,并利用LLM比对不同来源的信息,剔除不可靠或过时的数据。(4)综合报告:将验证后的核心事实片段汇总,基于预设的提示词模板,生成长篇的最终研究报告。7.3.1深度研究智能体的工作范式3.Map-Reduce模式在长文本处理中的应用在深度研究中,智能体往往需要阅读数十万字的网络资料,这远超任何单一大模型的处理上限。此时需要引入分布式计算中的经典范式—Map-Reduce模式。(1)Map(映射/分而治之):在Dify中,通过配置迭代节点,将长文本切片或多个网页的原始文本分别送入模型,要求模型针对每个切片提取出与课题相关的核心事实,即生成局部摘要。(2)Reduce(归约/汇总):将所有局部摘要拼接成一个高密度的“事实清单”,再由最终的大模型节点统一阅读这份清单,撰写具有全局视角的最终报告。这种模式有效解决了长文本的“注意力分散”与“上下文溢出”问题。7.3.1深度研究智能体的工作范式7.3.2搜索引擎工具的高级应用互联网是深度研究的数据源泉。高质量的搜索结果直接决定了研究报告的深度与广度。1.搜索API的技术选型在开发深度研究智能体时,需根据具体业务场景选择合适的搜索接口集成到工作流的“工具节点”中。表中列出了常用的搜索引擎API技术选型。表6-1常见搜索引擎API对比表技术选型核心特点与工作原理适用场景在Dify中的集成方式Tavily搜索Tavily是一款专为大语言模型(LLM)与智能体原生设计的搜索引擎。自动执行多源搜索、网页抓取、去重与格式清洗,直接向大模型返回高信噪比、经过压缩的纯文本摘要或结构化数据。适合深度研究智能体的数据采集、RAG(检索增强生成)系统中的实时知识补充、全网行业竞品分析追踪,以及任何需要让大模型“连网阅读”长篇文献与新闻的自动化工作流。Dify平台已将其作为原生插件进行深度集成。开发者无需编写代码,只需在Tavily官方控制台申请专属的APIKey,随后在Dify的“工具(Tools)”管理面板中找到Tavily供应商并填入密钥完成鉴权。官方API直连(百度、搜狗等)稳定与合规:通过官方开发者平台申请的正式搜索接口(如百度搜索API)。数据完全合法合规,无被封禁风险。适合商业化运行、对系统稳定性与合法合规性要求极高的智慧校园或政企项目。国内中文检索精准度最高。需在官方平台完成企业认证并获取APIKey,在Dify中通过HTTP请求节点或自定义工具接入。WebScraper网页抓取深度与定制:不依赖搜索引擎API,而是利用无头浏览器或爬虫脚本,直接向目标垂直网站(如知网、特定高校官网、政务平台)发起请求并解析HTML。适合特定领域或深网(DeepWeb)数据的定向挖掘。能够突破官方API通常只返回摘要的限制,直接获取全文,但需应对反爬虫机制(如验证码)。可利用Dify内置的网页抓取工具,或集成JinaReader、Firecrawl等专为大模型优化的抓取服务,结合代码节点清洗数据。7.3.2搜索引擎工具的高级应用2.搜索查询优化关键词生成与多轮追问普通用户输入的课题通常较为宽泛,如“分析低空经济”。为了提高检索召回率,必须在搜索前置入“查询优化”节点。利用LLM将单一问题扩展为多个具象化的长尾关键词(例如:“低空经济政策补贴2024”、“低空经济eVTOL技术瓶颈”、“低空经济头部企业融资情况”)。此外,在高级架构中,智能体会基于第一轮检索的反馈,自动判断信息是否充分。若发现某一维度的信息缺失,会自动生成新的关键词进行多轮追问。3.网页内容抓取与解析技术传统搜索API通常只返回网页的标题和简短摘要,无法满足“深度”研究的需求。因此,必须结合网页抓取工具获取全文。在工作流中,可引入JinaReader、Firecrawl等专门为大模型优化的网页解析工具。这些工具能够将复杂的HTML页面(包含侧边栏、广告、弹窗)自动剥离,提取出纯粹的Markdown格式正文。获取正文后,再通过代码节点切除超长文本或无关字符,保障输入数据的信噪比。获取海量碎片化信息后,深度研究的最后一步是将“数据”转化为“知识”,这就要求智能体具备强大的信息综合与排版能力。1.多源信息的去重、融合与矛盾处理从不同网站抓取的信息往往存在大量重复,甚至在核心数据上相互矛盾(例如两家新闻网站对同一事件的报道数据不一致)。在Dify的综合生成节点中,需在系统提示词中设定严格的融合规则。例如,要求模型优先采纳官方网站或权威学术机构的数据;面对不可调和的矛盾数据时,不应盲目取平均值,而应在报告中如实列出多种说法及各自的信息来源,交由最终用户研判。2.引用溯源机制与真实性校验为了消除大模型的“幻觉”,深度研究报告必须具备严谨的可追溯性。在工作流的变量传递过程中,需始终将“事实内容”与其“来源URL”进行绑定。在最终生成报告时,提示词应强制模型采用学术界的引用规范,并在报告末尾自动生成带有超链接的“参考文献”列表。这不仅提升了报告的专业度,也便于用户进行二次真实性校验。7.3.3信息综合与报告生成规范3.结构化研究报告的生成标准与Markdown排版优秀的深度研究不仅在于内容详实,还在于排版的清晰度。在工作流的末端,需通过提示词模板规定报告的标准结构。(1)执行摘要:用最简练的语言概括核心结论。(2)研究背景与方法:说明本次研究搜索的核心维度与数据时间范围。(3)主体分析论述:要求模型使用多级标题、对比表格、加粗列表等格式对信息进行分块展示。(4)结论与展望:给出具有洞察力的总结。(5)参考资料库:列出所有引用的数据源链接。通过严格要求模型使用Markdown标记语言输出,系统能够确保生成的报告直接适配各种前端渲染组件或导出为标准PDF文档,完成从原始数据到最终价值交付的完整闭环。7.3.3信息综合与报告生成规范在“深度研究”等复杂业务场景中,智能体不仅需要处理庞大的数据量,还要进行多轮次的逻辑推理与外部工具调用。这类任务往往耗时数分钟甚至数小时,且结果的准确性直接影响业务决策。传统的“即问即答”模式已无法适用。因此,必须在系统架构层面引入异步处理机制,并在交互设计层面深度融入“人机协同”理念,实现机器算力与人类智慧的高效协同。7.4异步处理与人机协同长耗时任务对后端的计算资源与前端的用户体验都提出了严峻挑战,必须通过系统架构的升级来保障服务的稳定性。1.同步交互与异步任务的系统设计差异(1)同步交互:客户端发起请求后,必须持续等待服务器处理完毕并返回结果。这种模式适用于毫秒级响应的基础问答。但在深度研究中,极易因处理时间过长而触发HTTP请求超时,导致连接断开、任务失败。(2)异步任务:采用“非阻塞”设计。客户端提交任务后,服务器立即返回一个任务凭证,并在后台消息队列(如Redis、RabbitMQ)中默默执行计算。客户端随后可以通过轮询(Polling)或Webhook机制,凭任务凭证查询任务进度或接收完成通知。这种架构彻底解耦了请求与处理过程,保障了长耗时任务的可靠运行。对比了同步与异步系统架构,左侧为同步处理架构,右侧为异步处理架构。7.4.1长耗时任务的异步架构2.流式输出(Streaming)技术与状态反馈机制在异步架构下,为了避免用户在漫长的等待过程中产生“系统卡死”的错觉,必须建立完善的状态反馈机制。流式输出(Streaming)技术(如Server-SentEventsm,SSE)是解决这一问题的核心。服务器在后台执行深度研究时,并非等完整报告生成后才一次性返回,而是通过长连接持续向前端推送中间状态。例如,前端界面会依次显示“正在生成搜索关键词…”、“已抓取15篇网页文献…”、“正在进行交叉比对…”以及最终报告的逐字生成过程。这种“过程透明化”设计极大缓解了用户的等待焦虑。3.任务进度监控与断点续传 面对极其复杂的多步骤工作流,任务执行中断(如服务器重启、第三方API限流熔断)是常见风险。高健壮性的异步架构需要引入持久化的状态机机制。系统会将工作流的每一步执行结果(如步骤1的搜索结果、步骤2的网页正文)实时存入数据库。一旦任务意外中断,系统能够从数据库中读取最后一次成功的状态,实现“断点续传”,避免从头开始消耗不必要的算力与时间成本。7.4.1长耗时任务的异步架构尽管大语言模型的推理能力不断提升,但在面临关键数据核验、价值观对齐或重大业务决策时,完全自动化的智能体仍存在不可控风险。人机协同机制将人类专家作为工作流中的一个特殊“节点”接入系统,确保研究结果的准确性与安全性。1.关键决策点的用户介入机制深度研究工作流的设计阶段,开发者需要识别并设定“关键决策点”。当工作流运行至这些节点时,系统会自动挂起,等待人类用户的介入。常见的介入场景包括:(1)大纲确认:智能体在正式撰写万字长文前,先生成一份研究大纲。系统暂停,等待用户审查大纲结构,用户可修改二级标题或补充被遗漏的分析维度。(2)敏感信息拦截:在调用外部API发送企业内部数据前,系统暂停,要求人类审核即将发送的数据是否包含隐私泄露风险。7.4.2人机协同交互设计1.审批工作流(ReviewWorkflow)的设计实现人机介入需要一套规范的审批工作流机制。当智能体触发审批节点时,其状态将由“运行中”变更为“待审批”。在前端界面上,系统会为用户提供一个结构化的审批表单,包含三个核心操作:(1)批准:用户确认当前阶段成果无误,系统解除挂起,继续执行后续节点。(2)修改:用户直接对智能体生成的中间数据(如修改错误的搜索关键词)进行人工干预后,再提交继续运行。(3)驳回:用户认为当前方向完全错误,可附带修改意见将任务打回上一节点,要求智能体基于新的指导意见重新生成。2.智能体执行结果的人工确认与反馈闭环深度研究的最终报告生成后,并不意味着工作流的彻底结束。最后一步的人工确认是构建系统反馈闭环的关键。用户在阅读最终报告后,可对报告的质量进行结构化打分,或圈出存在“幻觉”的具体段落。系统会将这些人工修改记录作为高质量的监督信号存入向量数据库或日志系统。在未来的同类任务中,智能体能够通过上下文机制检索这些历史错误与人工修正方案,实现系统能力的持续自我进化。7.4.2人机协同交互设计项目实施CONTENTS目录任务7.1意图解析与研究路径规划任务7.2引入人机协同审批机制任务7.3批量数据检索与代码级深度清洗任务7.4交叉验证与结构化报告模板配置05任务7.5生成《人工智能对大学生学习生活的影响》研究报告任务7.1意图解析与研究路径规划01【任务描述】本任务旨在构建深度研究工作流的“入口”与“大脑”。针对用户输入的宏观、模糊的研究课题,要求通过Dify工作流编排技术,实现对初始意图的精准解析,提取核心实体与时间范围,并利用大语言模型的逻辑推理能力,将主课题自动拆解为多个具象化、可执行的子研究方向,最终输出一个标准化的搜索关键词数组,为后续的自动化全网检索提供精确的数据驱动参数。任务7.1意图解析与研究路径规划【任务分析】深度研究有别于基础问答,其核心难点在于如何将一个宽泛的问题转化为机器可执行的多步搜索指令。本任务涉及3个关键技术环节:1.数据接口定义需要搭建对话型工作流(Chatflow)框架,并定义全局输入变量,建立人机交互的入口。2.结构化参数提取长段的自然语言难以直接用于严谨的逻辑规划,需引入“参数提取节点”,利用模型能力剥离出“研究主体”与“时间跨度”等关键元数据。3.思维链与格式约束大语言模型在直接输出多个研究方向时容易发散。必须采用少样本思维链(Few-ShotCoT)提示词约束其思考路径,并强制大语言模型输出合法的JSON数组格式。这一步是确保工作流能够顺利进入后续“迭代(循环)节点”的先决条件。任务7.1意图解析与研究路径规划【任务实现】1.创建工作流应用与配置启动节点(1)创建应用登录Dify工作室(Studio),单击“创建空白应用”。在应用类型中选择“Chatflow”,即对话工作流,此模式支持后续引入人机交互审批环节,并将其命名为“项目7-深度研究智能体”。任务7.1意图解析与研究路径规划(2)进入编排画布进入工作流编排画布,选中系统默认生成的“开始(Start)”节点。(3)开始节点属性配置在节点右侧的属性配置面板中,添加自定义输入字段。设定变量名称为“research_topic”,表示研究课题,变量类型选择“字符串(String)”,勾选“必填”属性,并在显示名称中填入“研究课题名称”。该变量将作为驱动整个工作流运行的初始动力。任务7.1意图解析与研究路径规划2.利用参数提取节点抽取核心实体用户的原始输入往往是口语化的一段长文本。为了提升后续搜索的精准度,需通过Dify专用的参数提取节点进行数据结构化处理。该节点支持分别配置“提取参数”与“指令”,以实现更精确的上下文理解。(1)在“开始”节点后,点击“+”号添加一个“参数提取”节点。(2)将该节点的输入变量绑定为前置节点输出的“research_topic”。(3)在参数列表中,定义系统需要从文本中剥离的具体字段。任务7.1意图解析与研究路径规划1

参数一:名称设为“core_entity”,类型选择“String”,勾选“必填”,在描述中填入“提取出的核心研究对象或技术名词”。2

参数二:名称设为“time_range”,类型选择“String”,取消勾选“必填”,在描述中填入“课题涉及的时间跨度”。(4)编写提取指令在节点的指令配置区,利用自然语言为内置的大模型提供清晰的提取规则与边界条件。优良的指令能够大幅降低提取错误或数据留白的概率。指令参考如提示词7-1所示。(5)在节点顶部的模型选择区,配置一个具备良好逻辑理解与指令遵循能力的推理模型,如qwen3-max,以保障实体抽取的准确率。任务7.1意图解析与研究路径规划任务目标:分析用户的研究课题输入,精准提取出核心的“研究实体”和“时间范围”。提取规则:1.针对core_entity(核心实体):必须提取出课题中最核心的技术名词、行业名称或具体研究对象。请剔除“帮我分析”、“我想了解”等冗余的口语化修饰词,保留高信息密度的名词短语。2.针对time_range(时间范围):仔细识别输入中包含的具体年份或时间段(如“2023年”、“近五年”)。若用户输入中未明确提及任何时间概念,请务必输出默认值:“当前最新”。要求:严格遵循上述规则,确保提取结果准确、简练。3.配置大模型节点与思维链提示词设计(1)在“参数提取”节点之后,接入一个大模型节点,此节点将承担任务拆解与规划的核心职能。(2)在大模型节点的提示词编辑区,插入前置节点的变量,包含原始的“research_topic”,以及提取出的“core_entity”和“time_range”。(3)编写系统提示词。通过引入思维链(CoT)范式与严格的输出约束,控制模型的生成行为。任务7.1意图解析与研究路径规划#角色作为一名严谨的学术研究员,请将用户提供的宏观研究课题拆解为3至5个具体的子研究维度,并生成对应的搜索引擎查询关键词。

##思考过程(CoT)在生成关键词前,请严格按照以下步骤进行隐式思考:1.分析核心实体{{#core_entity#}}的技术边界、发展历史与核心应用场景。2.结合限定时间范围{{#time_range#}},识别该课题当前最具研究价值的痛点或争议点。3.将上述多维度的分析结果,转化为高信息密度、适合搜索引擎查询的短语组合。

##输出规范(极度重要)必须严格将最终的搜索关键词输出为合法的

JSON数组(Array)格式。严禁包含任何

Markdown代码块标记(如```json),严禁输出任何解释性或引导性文字。

##格式示例["关键词1发展现状与市场规模","关键词2核心技术瓶颈解决方案","关键词3政策法规行业限制"]

用户原始课题:{{#research_topic#}}(4)在大模型节点的参数设置面板中,找到并开启“回复格式”选项,并选择“json_object”选项。该设置能够从底层强制模型输出标准JSON字符串,彻底杜绝包含自然语言解释的错误输出。任务7.1意图解析与研究路径规划【任务小结】本任务完成了深度研究工作流的第一阶段开发。通过综合运用参数提取与大模型提示词工程,系统成功将非结构化的用户自然语言输入,转化为了结构化的机器指令(JSON数组)。其中,思维链(CoT)的应用保证了研究方向拆解的逻辑深度,而JSON格式的严格约束则打通了系统的数据流,为下一阶段构建并发搜索和自动化循环处理奠定了坚实的数据基础。任务7.1意图解析与研究路径规划任务7.2引入人机协同审批机制02【任务描述】在生成搜索关键词后,若直接进入全网批量数据抓取阶段,一旦初始课题解析发生方向性偏移,将导致后续消耗大量算力(Token)与API额度,且产出的报告毫无价值。本任务旨在工作流中引入“人机协同”审批机制。通过配置Dify的会话变量、问题分类器与条件路由,实现系统在生成研究路径后的“挂起(暂停)”状态;等待人类用户对关键词进行审查、修改或确认后,再决定是否放行至下一检索环节,从而保障研究方向的绝对准确。任务7.2引入人机协同审批机制【任务分析】在Dify的对话型工作流(Chatflow)中实现“挂起与审批”,无法依赖单次线性执行,必须利用多轮对话状态机进行设计。本任务涉及以下3个关键技术点:1.状态保持工作流在单次运行结束后会清空局部变量。需使用“会话变量”将任务7.1生成的关键词数组缓存下来,以便在用户下一轮回复时进行调用。2.意图路由当接收到用户的新输入时,系统必须具备判断能力—这是开启了一项“新研究课题”,还是对上一轮关键词的“修改意见”,抑或是“同意放行”的确认指令,这就需要用到问题分类器节点。3.反馈闭环构建针对“修改意见”分支,需建立重生成逻辑,利用大语言模型吸收人类专家的修改建议,动态更新关键词数组,并再次发起审批请求。任务7.2引入人机协同审批机制【任务实现】1.配置全局会话变量与变量赋值器为了在多轮交互中传递数据,需在全局层面声明存储介质,并在任务7.1的末尾执行写入操作。(1)在Dify编排画布的右上方“会话变量”管理面板中,单击“+添加变量”按钮,如图7-11所示。新建一个“会话变量”,命名为“cached_keywords”,数据类型选择“string”,用于暂存经过序列化的JSON数组,并进行保存。任务7.2引入人机协同审批机制(2)回到任务7.1的画布末端,在LLM节点之后添加一个“变量赋值”节点,将其配置为将任务7.1中LLM节点输出的文本(text),即生成的JSON数组,赋值给会话变量“cached_keywords”。任务7.2引入人机协同审批机制(3)在变量赋值器后接入一个直接回复节点,输出固定文本“{{#cached_keywords}}已为您生成初始搜索路径,请审查上述关键词。回复‘同意’开始深度检索,或直接输入修改建议。”。(4)单击预览按钮,输入研究课题名称进行研究测试,如“AI与教育”,在对话框中输入“根据研究课题生成内容”,并提交,对话流运行并输出结果。任务7.2引入人机协同审批机制2.利用问题分类器重构流程入口为实现意图分流,需对起始流程进行重构,在“开始”节点后第一时间拦截并分析用户的输入意图。(1)断开原有的“开始”节点与“参数提取器”节点之间的连线。在“开始”节点后,插入一个“问题分类器”节点。任务7.2引入人机协同审批机制(2)绑定输入变量为系统的默认对话输入“sys.query”,即用户当前轮次的输入文本。(3)在分类器中设定3个意图类别。分类1描述为“用户输入了一个全新的长句或段落,要求开展一项新的课题调研。例如:‘帮我分析一下人工智能在教育领域的应用’。”;分类2描述为“用户对系统刚刚输出的搜索关键词提出了修改、补充或删除等干预意见。例如:‘把第三个关键词去掉’、‘加上隐私保护方面的搜索’、‘方向不对,重点查国外的数据’。”;分类3描述为“用户给出了明确的确认、同意或放行指令,表示无需修改当前状态。例如:‘同意’、‘没问题’、‘可以开始搜索了’、‘就按这个来’。”。任务7.2引入人机协同审批机制3.构建意图路由与反馈闭环分支针对问题分类器输出的3种不同类别,分别连线至对应的处理逻辑。(1)连接“新课题”分支:将“分类1”端口连接至任务7.1中的“参数提取”节点。当判定为新课题时,系统将重新执行实体提取与关键词生成逻辑。(2)构建“修改建议”分支:将“分类2”端口连接至一个全新的LLM节点,命名为“关键词修正节点”,在该节点中引入会话变量“cached_keywords”和用户的当前输入“query”。在新的LLM节点的系统提示词框中编写提示词“根据用户的修改建议:{{#sys.query#}},请对现有的搜索关键词列表:{{cached_keywords}}进行修正。严格输出修改后的JSON数组格式”。在该LLM节点后,再次接入“变量赋值器”用于更新“cached_keywords”,并接入“直接回复”节点。任务7.2引入人机协同审批机制(3)预留“同意放行”分支:将“分类3”端口暂时连接至一个直接回复节点,该节点负责读取“cached_keywords”的最终值,准备将其传递给下一任务(批量检索与清洗)中的迭代节点。任务7.2引入人机协同审批机制【任务小结】本任务通过巧妙结合Dify的“会话变量”与“问题分类器”,成功打破了传统工作流的线性死板结构。这种状态机式的编排方式,使得智能体在执行高成本、不可逆的深度检索前,能够主动“停下脚步”倾听人类的指导。该机制不仅大幅提升了长耗时任务的容错率与最终交付质量,也生动诠释了“人机协同”作为保障人工智能安全与可控性核心手段的工程价值。任务7.2引入人机协同审批机制任务7.3批量数据检索与代码级深度清洗03【任务描述】在完成研究路径的人机协同审批后,系统已获得了一组方向明确且经过人工确认的搜索关键词。本任务旨在接续“同意放行(Approve)”分支,利用Dify的迭代节点(Iteration)对关键词数组进行批量并发检索;同时,针对外部搜索引擎返回的冗杂JSON数据,引入代码节点(CodeNode)编写清洗算法,剔除无效信息,提取高密度的核心内容,为最终的深度推理提供高质量的干净上下文。任务7.3批量数据检索与代码级深度清洗【任务分析】长文本与海量数据处理是深度研究的核心壁垒,本任务涉及以下3个关键技术难点:1.数据类型转换:由于上一任务中缓存的“cached_keywords”变量本质上是一段格式化字符串(String),而迭代节点要求输入必须是数组(Array)类型,因此需要在进入循环前进行严格的反序列化操作。2.并发迭代控制:面对多个子研究方向,基础的单次工具调用效率极低。必须利用“迭代节点”封装搜索逻辑,实现对数组元素的遍历查询,极大提升信息获取的吞吐量。3.上下文窗口优化(瘦身):搜索引擎API返回的原始结果往往包含大量冗余字段(如广告标识、缩略图链接、HTML标签等)。若直接传入大语言模型,极易导致Token溢出或中间信息丢失。必须通过代码扩展能力实施确定性的数据切片与清洗。任务7.3批量数据检索与代码级深度清洗【任务实现】1.格式反序列化(字符串转数组)(1)从任务7.2问题分类器的“条件3”分支引出连线,添加一个代码执行节点,命名为“代码执行—格式转换”。(2)在该节点中定义输入变量“keywords_str”,并将其值映射为会话变量“cached_keywords”。任务7.3批量数据检索与代码级深度清洗(3)选择Python3作为运行环境,编写如代码7-2所示反序列化代码,将JSON字符串转化为真正的Python列表,并输出为数组格式。(4)在节点的“输出变量”中,配置一个名为“keyword_array”的变量,类型严格选择为“Array[String]”。任务7.3批量数据检索与代码级深度清洗importjsondefmain(keywords_str:str)->dict:try:#将字符串反序列化为列表keyword_list=json.loads(keywords_str)return{"keyword_array":keyword_list}exceptExceptionase:#异常处理,返回空列表以防工作流崩溃return{"keyword_array":[]}2.配置迭代节点实现批量检索(1)在“格式转换”代码节点之后,接入一个“迭代”节点。(2)在迭代节点的输入面板中,将“输入”配置为上一步输出的“keyword_array”变量。此时,迭代节点内部会自动生成一个名为“item”的局部变量,代表当前正在遍历的单个搜索关键词。(3)在迭代节点内部,嵌入一个“工具”节点,选择一款支持互联网检索的工具,本教材选用的是Tavily搜索工具,如图7-25所示。需提前配置好APIKey,具体参考Dify插件市场中的Tavily文档。读者也可以根据实际情况选择其他搜索工具,如自定义的检索工具。任务7.3批量数据检索与代码级深度清洗(4)将该搜索工具的“查询”参数绑定为迭代变量“item”,确保每次循环都能针对不同的关键词发起独立请求。任务7.3批量数据检索与代码级深度清洗3.代码级深度清洗与数据组装搜索工具执行完毕后,其输出的是一段庞大的JSON结构数据,必须在迭代节点内部立即进行清洗。(1)在迭代节点内部、搜索工具的后方,紧接着添加第2个“代码执行”节点,命名为“数据清洗”。(2)配置输入变量“raw_search_result”,将其映射为前置搜索工具的输出结果,通常是一个包含多条网页信息的JSON字符串或对象数组。任务7.3批量数据检索与代码级深度清洗(3)编写Python提取算法。提取逻辑的核心在于仅保留大模型推理所必需的“标题(Title)”、“正文(Content)”以及用于溯源的“网址(URL)”。任务7.3批量数据检索与代码级深度清洗importjson

defmain(raw_search_result)->dict:clean_text=""try:ifnotraw_search_result:return{"cleaned_data":"当前关键词未检索到有效数据"}

results=raw_search_result[0].get("results",[])

#遍历搜索结果

foridx,resinenumerate(results):title=res.get("title","无标题")url=res.get("url","无链接")content=res.get("content","")

clean_text+=f"[{idx+1}]标题:{title}\n来源:{url}\n内容:{content}\n---\n"

return{"cleaned_data":clean_text}exceptExceptionase:return{"cleaned_data":f"数据解析失败:{str(e)}"}(4)将该代码节点的输出变量设为

cleaned_data(String类型)。此时,该变量仅代表单次循环(即单一搜索关键词)中产生并经过洗净的一组网页数据。任务7.3批量数据检索与代码级深度清洗4.验证测试(1)单击右上角的“预览”按钮,在研究课题名称的输入框中输入“AI与教育”,在下方聊天窗口中输入“根据研究课题名称生成报告”,单击提交按钮。(2)由于是新课题研究,工作流会走分类1分支,执行结束后,工作流会输出符合预期的结果。(3)在输入框中输入“同意”,工作流继续走分类3分支,执行结束后,工作流会输出符合预期的结果。任务7.3批量数据检索与代码级深度清洗【任务小结】本任务是深度研究智能体获取外部知识的核心枢纽。通过工作流引擎的“迭代节点”,系统实现了传统线性对话难以完成的并发检索任务;同时,通过合理应用“代码节点”作为数据过滤器,成功将大段冗杂的互联网数据“瘦身”为高密度的纯文本知识切片。最后利用迭代节点的输出聚合机制,完成了数据的收集与打包。这种“大模型主管逻辑规划,代码节点处理确定性数据清洗”的混合架构,是开发工业级高可用智能体的最佳实践。任务7.3批量数据检索与代码级深度清洗任务7.4交叉验证与结构化报告模板配置04【任务描述】经过多轮次的自动化检索与代码级清洗,工作流已收集到大量与课题相关的互联网知识切片。本任务旨在对这些碎片化数据进行逻辑汇总与价值提炼。通过配置双大语言模型节点架构,首先完成多源信息的交叉验证与去重(生成核心事实清单),随后基于严格的提示词模板,自动撰写包含引用溯源机制的结构化Markdown研究报告,并利用流式输出技术完成最终的高质量交付。任务7.4交叉验证与结构化报告模板配置【任务分析】本任务是深度研究智能体Map-Reduce架构中极其关键的Reduce环节,涉及以下3个核心技术要求:1.数据降噪与防幻觉直接将数十个网页的摘要拼接生成报告,极易引发模型“幻觉”或逻辑冲突。必须引入独立的“审查节点”,对多源数据进行交叉验证,剔除自相矛盾或不可靠的信息。2.引用溯源机制严谨的研究报告必须做到“字字有出处”。需要通过提示词工程,强制模型在输出观点时与上游获取的URL链接进行绑定。3.流式前端响应万字长文的生成耗时较长,通过配置非阻塞的流式输出节点,实现“边思考边打印”的效果,可彻底避免请求超时并极大提升交互体验。任务7.4交叉验证与结构化报告模板配置【任务实现】1.构建交叉验证与事实提取节点为了保证报告的严谨性,首先需要一个具备批判性思维的LLM节点来提纯数据。(1)从任务7.3迭代节点的外部输出端引出连线,添加一个LLM节点,将其命名为“交叉验证与事实提取”。(2)在节点的上下文配置区,引入迭代节点输出的聚合数组变量“output”,系统会自动将其转换为模型可读的文本格式。任务7.4交叉验证与结构化报告模板配置(3)配置该LLM节点的系统提示词,设定其扮演“学术审查员”的角色。提示词参考提示词7-3,其中“{{#1772967281424.output#}}”需要替换成读者的变量名。任务7.4交叉验证与结构化报告模板配置【任务目标】作为严谨的学术审查员,请阅读以下从全网抓取的多源数据切片。你需要进行交叉验证,去伪存真,提取出核心事实。

【处理规则】1.信息去重:将表达相同观点的信息进行合并。2.矛盾处理:若不同来源的数据存在冲突(如数据统计不一致),请同时保留双方说法,并标注各自的来源。3.剔除无效信息:丢弃与原课题无关的营销话术或碎片化乱码。

【输出格式】请输出一份高密度的“核心事实清单(FactList)”。每一条事实必须在末尾严格保留其对应的原始来源格式(如:[1]来源:https://...)。

参考资料集合:{{#1772967281424.output#}}2.配置结构化报告生成节点基于清洗后的事实清单,驱动最终的报告撰写。(1)在“交叉验证与事实提取”LLM节点之后,再次添加一个“LLM”节点,命名为“最终报告生成”。如图7-33所示。(2)编写长文本综合提示词,强制约束Markdown排版与引用规范,在提示词中引用“research_topic”(原始研究课题)以及前置LLM节点输出的事实清单文本(LLM节点的text参数)。如提示词7-4所示。其中,“{{#1772698919122.research_topic#}}”与“{{#1773047253108.text#}}”要替换成读者当前环境的变量名。任务7.4交叉验证与结构化报告模板配置【任务目标】基于提供的《核心事实清单》,撰写一份关于{{#1772698919122.research_topic#}}的深度研究报告。

【排版与结构规范】必须使用清晰的Markdown格式,包含以下四个标准模块:#一、执行摘要(简明扼要地概括核心发现与结论,字数控制在300字以内)#二、核心论述(使用二级标题H2和三级标题H3进行分块论述,可适度使用加粗、列表等排版元素)#三、结论与建议(基于事实给出客观的预测或建议)#四、参考文献(汇总文中引用的所有链接)

【引用溯源要求】在“核心论述”中,每一段陈述客观事实的文字末尾,必须使用上标[编号]标注出处,并在文末的“参考文献”模块中给出完整的URL链接。严禁捏造不存在的链接(防幻觉)。事实清单素材:{{#1773047253108.text#}}3.配置回复节点并验证(1)在“最终报告生成”LLM节点之后,接入一个直接回复节点。在Chatflow模式下用于向用户界面输出最终信息。(2)将直接回复节点的输出内容绑定为上一步生成的完整报告文本。(3)单击右上角的“预览”按钮,在研究课题名称的输入框中输入“AI与教育”,在下方聊天窗口中输入“根据研究课题名称生成报告”,单击提交按钮。待生成了初始搜索路径后,继续生成报告。任务7.4交叉验证与结构化报告模

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论