版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于知识与有模型强化学习的雷达抗干扰本发明涉及一种基于知识与有模型强化学干扰策略分解为先验信息库中已知干扰策略的2S1、使雷达与已知多种干扰策略的第一干S2、使所述雷达依据当前策略选择动作与未知干扰策略S4、利用权系数将未知干扰策略分解为所述先验信息库中已知干扰策略的加权求和,S5、利用更新后的学习模型测量未知干扰策略与所S6、利用所述模型近似损失评估未知干扰策略2.根据权利要求1所述的基于知识与有模型强化学习的雷达抗干扰策略学习方法,其使所述雷达依据当前策略选择动作与未知干扰策略的第二干扰机进行交互以收集真3.根据权利要求1所述的基于知识与有模型强化学习的雷达抗干扰策略学习方法,其其中,φd表示学习模型的网络参数,D,表示每个已知先验信息M生成的训练样本,表达学习模型。4.根据权利要求1所述的基于知识与有模型强化学习的雷达抗干扰策略学习方法,其3,λd表示每个已知干扰策略的权重;基于雷达的所述先验信息库,结合所述未知干扰策略的分解公5.根据权利要求1所述的基于知识与有模型强化学习的雷达抗干扰策略学习方法,其利用所述更新后的学习模型计算所述未知干扰策略引起的转移概率和所述已知干扰利用所述未知干扰策略引起的转移概率与所述已知干扰策略引起的转移概率之间的6.根据权利要求1所述的基于知识与有模型强化学习的雷达抗干扰策略学习方法,其7.根据权利要求1所述的基于知识与有模型强化学习的雷达抗干扰策略学习方法,其*4[0004]目前基于强化学习的雷达抗干扰策略设计方法主要集中在频率捷变(FA)雷达载[0006]本发明实施例提供了一种基于知识与有模型强化学习的雷达抗干扰策略学习方[0012]S6、利用所述模型近似损失评估未知干扰策略与已知干5[0016]使所述雷达依据当前策略选择动作与未知干扰策略的第二干扰机进行交互以收能雷达在当前状态下采取的行动,表示智能雷达在当前状态采取行动后收到的回报,[0023]其中,φd表示学习模型的网络参数,D,表示每个已知先验信息M生成的训练0,d=1,2,...,D且λd表示每个已知[0032]利用所述更新后的学习模型计算所述未知干扰策略引起的转移概率和所述已知6[0033]利用所述未知干扰策略引起的转移概率与所述已知干扰策略引起的转移概率之[0036]其中,表示模型近似损失,表示第d个已知干扰策略,d=1,表示模型近似损失。未知干扰策略最大化的抗干扰性能等同于对已知干扰策略加权组合最大化的抗干扰性能,[0045]图1为本发明实施例提供的一种基于知识与有模型强化学习的雷达抗干扰策略学7[0046]图2为本发明实施例提供的基于知识与有模型强化学习的雷达抗干扰策略学习方[0048]图4a图4d为本发明实施例提供的无模型强化学习方法对四种不同干扰策略的抗[0049]图5a图5b为本发明实施例提供的不同相互作用样本量下每一轮的收敛检测概率[0050]图6a图6d为本发明实施例提供的未知干扰策略包含在雷达先验信息库中的情况[0051]图7a图7d为本发明实施例提供的雷达先验信息中包含未知干扰策略时,学习过[0052]图8a图8d为本发明实施例提供的未知干扰策略不包含在雷达先验信息库中的情[0053]图9a图9d为雷达先验信息中不包含未知干扰策略时,学习过程中λ的权值示意[0056]请参见图1和图2,图1为本发明实施例提供的一种基于知识与有模型强化学习的雷达抗干扰策略学习方法的流程示意图,图2为本发明实施例提供的基于知识与有模型强已知干扰策略可以用来搭建雷先验信息库,可记为M,={S,,R,P},d=[1,D1,其d表示转移概率。本实施例将雷达抗干扰策略学习建模为马尔可夫决策(MDP)过程,因此,不同的干扰策略会导致不同的转移概率。进一步的,基于已知先验信息8M,={S,A,R,P},d=[1,D],可以辅助雷达进行抗干扰策略学习。能雷达在当前状态下采取的行动,表示智能雷达在当前状态采取行动后收到的回报,个已知先验信息M,生成的足够多的训练样本记为:9表达学习模型。[0077]S5、利用权系数将未知干扰策略分解为先验信息库中已[0078]首先,利用权系数将未知干扰策略分解为先验信息库中已知干扰策略的加权求干扰策略M,本实施例将它分解成几个部分,其中每个部分用一个已知的来自先验信息的0,d=1,2,...,D且λd表示每个已知[0091]其中,表示模型近似损失,表示第d个已知干扰策略,d=1,[0093]具体的,利用模型近似损失评估未知干扰策略与已知干表示模型近似损失。未知干扰策略最大化的抗干扰性能等同于对已知干扰策略加权组合最大化的抗干扰性能,不同的存储器用不同的颜色来区分),如果干扰器的动作是针对给定的子脉冲发送干扰信号,则该存储器的收集信息为空,记为存储模式2只有一个存储器用于存储拦截的信[0108]本实施例利用常用的干扰策略作为FA雷达的先验信息加速雷达抗干扰策略的学123456789111111222222222112233111222333121212345345345[0112]图4a图4d为本发明实施例提供的无模型强化学习方法(modelfreeRL)对四种[0113]图5a图5b为本发明实施例提供的不同相互作用样本量下每一轮的收敛检测概率表示线上线下交互轮,纵轴表示雷达检测概率。每轮实际交互样本量总和可乘以2000、继续增加实际相互作用样本量并不能明显提高[0114]图6a图6d为本发明实施例提供的未知干扰策略包含在雷达先验信息库中的情况检测概率与无模型强化学习方法(PPO)进行比较的示意图,横轴表示当前轮之前的实际交[0115]图7a图7d为本发明实施例提供的雷达先验信息中包含未知干扰策略时,学习过[0116]图8a图8d为本发明实施例提供的未知干扰策略不包含在雷达先验信息库中的情敛检测概率与无模型强化学习方法(PPO)进行比较的示意图。四种未知干扰策略由表2给干扰策略存储模式1121记忆长度1224截获模型[0119]图9a图9d为雷达先验信息中不包含未知干扰策略时,学习过程中λ的权值示意策略具有不同的特征,先验信息中的每种干扰策略在表达未知干扰策略时所起的作用不
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 科学预防传染病守护每个生命五年级主题班会课件
- 孕期营养风险筛查评分表
- 信息化项目进度反馈函7篇
- 关于2026年财务对账流程更新的通知函(8篇)
- 安全教育:小学生交通安全主题班会课件
- 文化旅游合作意向书回函2026(6篇)
- 感恩父母师长回报社会真情小学主题班会课件
- 2026中国PLC光分路器芯片波导工艺改进与G前传需求
- 纺织品交货周期商议通知函(5篇)
- 业务推广费用报销审核通报3篇范文
- GB 47834-2026晶体硅光伏组件和逆变器能效限定值及能效等级
- 工程常见质量问题监理实施细则
- 2026水务集团面试题目及答案
- 2026年本溪市明山区事业编单位人员招聘考试备考试题及答案详解
- 2026年广西公需科目全套1卷《人工智能国家战略与政策通识》
- 2026年云南省中考语文试卷(含答案及解析)
- 2026年山东省医疗卫生事业单位招聘护士笔试试卷
- 脑卒中康复护理中的家庭护理指导
- (2026年)内蒙古赤峰市公务员遴选考试题及答案
- 2026年PID控制器的原理与应用实例
- 教育强国建设三年行动计划(2025-2027年)
评论
0/150
提交评论