版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
一种面向天地一体化场景的智能时隙分配本发明公开了一种面向天地一体化场景的收到所有用户的时隙请求信息和当前网络的时发明在满足不同业务的灵活需求的条件下最大2不同用户根据业务需求实时向基站发送时隙请求信息,所述基站基于收到所有用户的时隙请求信息和当前网络的时隙状态信习的智能时隙分配法对所有用户的时隙请求信息进行时隙分配,得到用户的时隙分配策所述基于强化学习的智能时隙分配法对所有用户的时隙请求信息进行时隙分配的具策模型MDP中以基站作为实体自主地收集环境状态信息,并根据用户的时隙请求信息决定在马尔可夫决策模型MDP中搭建基于强化学习的时隙分配算法,搜索使全局回报函数所述马尔可夫决策模型MDP的状态为用户的时隙请求信息和目前可用时隙状态信息,所述马尔可夫决策模型MDP的动作为每种业务被分配的时隙个数;所述马尔可夫决策模型π*采用Actor_Critic算法对所述目标函数在马尔可夫决策模型MDP中搭建基于强化学习的时隙分配算法,搜索使全局回报函数3根据所述马尔可夫决策模型MDP和所有用户的时隙状态请求信息,收集网络中时隙的使用模型训练数据训练所述基于深度强化学习的智能时隙分配神AC算法搜索全局动作空间,输出使回报函数最大的时隙分配策略作为最优的时隙分配策根据所述最优的时隙分配策略,提取出每种业务被分配的总基站周期性地更新与维护基站目前所属范围内所有用户的时隙状态信息和时隙请求学习的时隙分配算法中得到分配给的某种业务类型的时隙数,t为传输该业务所需的固定基站端,用于基于收到所有用户的时隙请求信息和当前网络的时隙期性地更新与维护基站目前所属范围内所有用户的时隙在初始建网完成后,未入网的用户在随机接入时隙中发送入网请求信4根据当前业务负载情况,用户在对应的控制时隙中向基站发送时隙5在高动态、复杂异构的空地一体化网络中,通过对有限的MAC资源进行智能高效的灵活分6[0008]本发明所要解决的技术问题是现有技术中的时隙分配方法普遍存在着接入时延[0013]基站(空中基站或地面基站)基于收到所有用户的时隙请求信息和当前网络的时[0015]基站(空中基站或地面基站)周期性地更新与维护基站目前所属范围内所有用户[0017]搭建基于时隙分配的马尔可夫决策模型MDP,定义马尔可夫决策模型MDP的状态、可夫决策模型MDP中以基站作为实体自主地收集环境状态信息,并根据用户的时隙请求信[0018]在马尔可夫决策模型MDP中搭建基于强化学习的时隙分配算法,搜索使全局回报[0019]进一步地,所述马尔可夫决策模型MDP的状态为用户的时隙请求信息和目前可用7[0022]根据所述马尔可夫决策模型MDP和所有用户的时隙状态请求信息,收集网络中时数为=Z/t,Z为根据基于强化学习的时隙分配算法中得到分配给的某种业务类型的时隙[0029]进一步地,所述基于强化学习的智能时隙分配法中的帧结构包括随机接入时隙、站(空中基站或地面基站)周期性地更新与维护基站目前所属范围内所有用户的时隙状态8景下的复杂多变环境和多样化业务需求,以及不同的业务的传输时延和接入率的严格需[0042]此处所说明的附图用来提供对本发明实施例的进一步理解,构成本申请的一部(空中基站或地面基站)发送时隙请求信息;其次基站则根据所有用户收到的时隙请求信此时隙分配策略下发给具体的用户。为了使时隙分配更加灵活以满足差异化业务的QoS需9[0068]本发明方案希望可以通过灵活分配和动态调整空地一体化通信系统TDMA时隙资[0073]在TDMA时隙分配算法中,基站端需要基于目前收到的所习获取知识经验并进一步改进行动方案从而适应环境。强化学习的三个关键因素是状态,[0082]本发明方案考虑将空地一体化场景下的TDMA时隙分配建模为马尔科夫决策过程[0083]马尔科夫决策过程是由智能体(Agent)采取行动(Action)从而改变自己的状态算剩余时间restdelay从而确定其需要持续的帧数flamenum。最后再通过业务总共需要的时隙数slotsum从而得到业务在一帧中最少需要传输的业务时隙数slot。其具体的计算方23M*Z11/t1则为申请固定语音时隙的用户接入成功数,或为申请固定时隙语音业务的接入成[0096]其中α11,α12取决于申请固定时隙的语音业务与申请紧急时隙的语音业务之间的[0119]本发明方案考虑基于Actor_Critic(AC)算法搜索上述MDP模型中的最佳动作。具ttt+1段时间t到t+T的累积回报值由于即时回报的定义与业务接入相关,因而累计基于价值(Value_Based)和策略(Policy_Based)的两种强化学习算法优势的一种算法,其算法框架如图7所示。其主要分为执行器(Actor)部分和评价器(Critic)部分。Actor_Critic学习是对值函数和策略函数进行逼近,其中策略估计由Actor部分通过策略梯度估[0122]在AC的强化学习模型中,需要对执行器(Actor)进行策略梯度更新。其核心思想[0126]其中β∈R表示正的步长参数,是性能指标函数相对于策略权向量的梯[0128]其中表示在初始状态S0的情况下,策略为π[0132]为了对参数θ进行有效更新,引入对状态值的估计值与真实值的TD(temporal[0140]基于上述讨论,本方案基于强化学习的智能时隙分配法如图8所示,具体流程如[0143](3)使用模型训练数据训练所述基于深度强化学习的智能时隙分配神经网络模[0149]基站(空中基站或地面基站)基于收到所有用户的时隙请求信息和当前网络的时[0150]以及基站(空中基站或地面基站)周期性地更新与维护基站目前所属范围内所有行为值函数;其中,所述马尔可夫决策模型MDP中以基站作为实体自主地收集环境状态信[0153]所述马尔可夫决策模型MDP的状态为用户的时隙请求信息和目前可用时隙状态信[0157](3)使用模型训练数据训练所述基于深度强化学习的智能时隙分配神经网络模数为=Z/t,Z为根据基于强化学习的时隙分配算法中得到分配给的某种业务类型的时隙体化场景的智能时隙分配系统,该系统支持实施例1所述的一种面向天地一体化场景的智站(空中基站或地面基站)周期性地更新与维护基站目前所属范围内所有用户的时隙状态现在流程图一个流程或多个流程和/或方框图一个方框或多个方框中指定[0174]这些计算机程序指令也可存储在能引导计算机或其他可编程数据处理设备以特令装置的制造品,该指令装置实现在流程图一个流程或多个流程和/或方框图一个方框或其他可编程设备上执行的指令提供用于实现在流程图一个流程或多个流程和/或方框图一
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 成都市2026-2027学年高考物理三模试卷(含答案解析)
- 2026 年秋季开学初中军训班级评比课件
- 危化品夏季储存安全实操培训
- 企业季度安全培训体系优化
- 校园暑期消防安全教育主题
- 跨境智算中心电算协同中跨国算力负载绿电调度碳成本传导-基于国际电力市场碳成本传导机制与算力调度电价联动模型规范分析
- 2026 年秋季开学初中军训校园安全主题课件
- 肩袖损伤术后康复训练
- 小学生健康教育诺如病毒
- 患者自身对PICC导管的维护
- 2026江西上饶市广信区住建局招聘编外人员8人考试备考题库及答案详解
- 2026年老年三力车辆考试模拟电子试卷(难度基础)附答案
- 2026贵州元豪铝业有限公司社会公开招聘4人笔试参考题库及答案详解
- 元音音标测试卷及答案
- 居住证寄宿证明范本及申办流程
- 2026海南农村商业银行招聘备考题库(202605)及参考答案详解一套
- 2026教育社群运营模式与商业价值转化分析报告
- GJB3206B-2022技术状态管理
- QC工作流程图模板
- 路灯维护服务方案完整
- 凝血功能报告解读2
评论
0/150
提交评论