CN119443200A 基于强化学习的智能体优化方法和装置、系统、存储介质 (胡奇)_第1页
CN119443200A 基于强化学习的智能体优化方法和装置、系统、存储介质 (胡奇)_第2页
CN119443200A 基于强化学习的智能体优化方法和装置、系统、存储介质 (胡奇)_第3页
CN119443200A 基于强化学习的智能体优化方法和装置、系统、存储介质 (胡奇)_第4页
CN119443200A 基于强化学习的智能体优化方法和装置、系统、存储介质 (胡奇)_第5页
已阅读5页,还剩30页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本发明公开一种基于强化学习的智能体优洗与分析、API调用、数据库检索和异常处理任2强化学习驱动的智能体引擎,用于使用强化学习智能任务执行与数据处理引擎,用于将任务指令转数据充分性评估模块,用于评估智能体所收集的数据是否执行如权利要求1_3中的任一项所述的基于强化学习的智运行时执行如权利要求1_3中的任一项所述的基于强化学习的智能3[0005]现有技术中的大多数智能体任务执行系统依赖于预定义的任务指令和执行路4任务复杂环境时,现有的强化学习方法往往难以充分利用实时反馈来调整任务执行路径。[0017]本发明要解决的技术问题是,提供一种基于强化学习的智能体优化方法和装置、56[0060]Q值是强化学习中用于表示特定状态下执行某个动作的预期累积奖励的值。在本[0062]这是强化学习中的一种常用探索策略,在选择动作时,有一定概率ε作,以促进探索,其余情况下选择当前Q值最大的动作进行执行。在本发明中,epsilon_7[0075]步骤S4、通过智能任务执行与数据处理引擎将任务指令作为系统的起点。8和维度选项一一对应,使智能体在决策时可以精确地选择深化哪个维度的哪个具体选项,[0085]使用行业分析中常见的分析维度和约束条件作为指令深化策略和指令拓展策略[0101]本发明实施例使用自研基于大语言模型的改进奖励函数(RewardFunction)的深9本嵌入模型(本发明实施例使用Sentence_BERT[0161]为了优化智能体的决策行为,系统设计了基于数据充分性评估结果的奖励函[0178]在奖励函数设计中,本发明引入了微调后的大语言模型来实现奖励信号的生强化学习在行业分析场景中的应用瓶颈,显著提升了智能体的决策效率和任务优化能力。微调大模型的方法和应用将在数据充分性评估模块具[0180]本发明使用深度强化学习算法——深度Q网络负责智能体的决策,通过估算在不[0204]作为本发明实施例的一种实施方式,智能任务执行与数据处理引擎的工作过程[0205]智能任务执行与数据处理引擎负责将智能体模块接收到的任务指令转化为具体[0232]数据处理与聚合模块的核心目的是通过从多种数据源收集并处理相关的文本数[0240]该模块的核心功能是评估智能体所收集的数据是否足够支持当前任务的分析要[0244]专利数据:如技术专利摘要与说明文档,来自专利数据库(如GooglePatents、[0261]分析结果输出模块的主要功能是基于智能体此前进行指令深化与拓展获取的优[0274]通过引入数据充分性评估模块,并将评估结果作为强化[02

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论