CN119402453A 一种纠删码失效块修复混合加速方法及装置 (中国人民解放军国防科技大学)_第1页
CN119402453A 一种纠删码失效块修复混合加速方法及装置 (中国人民解放军国防科技大学)_第2页
CN119402453A 一种纠删码失效块修复混合加速方法及装置 (中国人民解放军国防科技大学)_第3页
CN119402453A 一种纠删码失效块修复混合加速方法及装置 (中国人民解放军国防科技大学)_第4页
CN119402453A 一种纠删码失效块修复混合加速方法及装置 (中国人民解放军国防科技大学)_第5页
已阅读5页,还剩43页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种纠删码失效块修复混合加速方法及装置本发明公开一种纠删码失效块修复混合加S02.查询存储数据的元数据信息并根据当前的相关存储节点中确定参与修复的Helper节点信2步骤S02.修复策略确定:查询存储数据的元数据交换机的可用聚合器数量,从k+m-1个存储节点中确定参与修复的k个Helper节点信各Helper节点分别根据本地块及编码系数计算出编码块,并分配给对应的发送队列,每个发送队列在对应的路由路径上以确定的吞吐量发送数据并按照发送顺序对发送数据对具有相同标识的数据包载荷在可编程交换机在失效修复节点N,根据接收到的数据包修复失效数据块。3.根据权利要求1或2所述的纠删码失效块修复混合加速方法,其特征在于,步骤S02输抽象为上层网络到ToR交换机的上下行链路带宽,在数据聚合过程中可编程交换机以最maximizex,s.t.,RP,=(1-z,)·x,vr3行链路带宽,cfow表示从ToR交换机到存储节点N,的下行链路带宽,z,表示机架r内的聚合示机架r的服务器聚合吞吐量,ay"表示第r个机架对应的ToR交换机s,的上行链路带宽,MixAgg表示所有机架的聚合吞吐量,表示失效修复节点N,所在链路的下行带宽,输入各存储节点N,的上下行链路带宽cy"和以及ToR交换机s,的最大数据包聚合吞吐量PAT,及各ToR交换机S,的上下行链路带宽df"和;根据节点与ToR交换机的上行链路带宽从失效块的所有相关存储节点中选取出目标在同一机架内的服务器统一使用网内聚合或者服务器聚合模吞吐量为Helper节点与ToR交换机的上行链路带宽、交换机聚合器数量以及交换机与上层聚合的最大吞吐量为Helper节点与ToR交换机的上下行链路带宽的最小值,则对应的各个Helper节点以最小值的吞吐量发送数据以将各个机架间的数据逐一聚合并在交换机处修复失效块,聚合之后的数据最小值的式下机架r的最大聚合吞吐量定义为confine_RP_r=min(,cfowT(r),df")。4修复控制启动模块,用于监控被控网络中数据损坏状态,当接修复策略确定模块,用于查询存储数据的元数据信息并交换机的可用聚合器数量,从k+m-1个存储节点中确定参与修复的k个Helper节点信修复策略执行模块,用于按照确定的修复策略控制各Helper节点建模单元,用于对失效块修复加速问题进行建模,建模过程中间的数据传输抽象为上层网络到ToR交换机的上下行链路带宽,在数据聚合过程中可编程理器执行时实现如权利要求1~6中任意一项所5错性和模型训练平稳进行的关键技术。当前通常是通过设定模型训练的检查点(check大模型状态通常在数百GB到TB不等,对模型状态进行多副本容错又会占用大量的存储资[0003]纠删码存储系统可以以较低的存储开销实现对大模型状态的频繁备份。如Reed_失效时,这k+r个单元中的任何k个可以[0004]然而,纠删码存储系统的复杂编码和解码过程可能会降低失效数据块的修复效术中通常是采用高效的编码方法以提高编码效率,并通过GPU硬件资源进一步加速修复过程,或者通过构建均衡的数据布局以提高修复吞吐量或通过聚合操作减少网络带宽消耗,6各Helper节点分别根据本地块D:及编码系数ai计算出编码块a,B;,并分配给对应对具有相同标识的数据包载荷在可编程交换机在失效修复节点N,根据接收到的数据包修复失效数据块。过最大数据包聚合吞吐量PAT的其余数据直接转发到目的修复节点N,,同一机架内统一使maximizex,s.t.,RP,=(1-z,)·x,vr(4)Z,zn=k(8)7RP,表示机架r的服务器聚合吞吐量,ay"表示第r个机架对应的ToR交换机s,的上行链路带输入各存储节点N,的上下行链路带宽和以及交换机s,的最大数据包聚合吞吐量PAT,及各ToR交换机S,的上下行链路带宽和;根据节点与ToR交换机的上行链路带宽从失效块的各存储节点中选取出目标最大吞吐量为Helper节点与ToR交换机的上行链路带宽、交换机聚合器数量以及交换机与务器聚合的最大吞吐量为Helper节点与ToR交换机的上下行链路带宽的最小值,则对应的择当前聚合器数量最为充足的ToR交换机S定为服务器聚合,且数据发送速率将设定为、confine_RP_r中的最小值,=min(PAT,c"(r),df"),服务器聚合模式下机架r的最大聚合吞吐量限制定义为confine_8当前的网络带宽和可编程交换机的可用聚合器数量,从k+m-1个相关存储节点中确定机架间的数据传输抽象为上层网络到ToR交换机的上下行链路带宽,在数据聚合过程中可量和链路带宽资源受限等情况最大化失效数据块[0023]图6是具体应用实施例中交换机聚合器数量对修复吞吐量影响的测试结果示意9通过对其他任意个块的伽罗华域加法来组合计算。编码数据块的伽罗华域加法是通过按[0032]特性2:编解码操作符合结合率。伽罗华域加法的顺序不会改变结果,例如,过程也同样符合结合律。减网络流量。基于特性2可以使得网内修复模式能够灵活地以任何顺序执行数据块的编解BarefootTofino是可编程交换机的代表性产品。可编程交换机能够以线速处理数百万个发给下游设备。通过上述方式可以将来自多个工作节点的梯度数据流聚合为一个数据流,硬件以提高修复性能。例如,一类是局部可修复[0041]在提高数据并行性方面,一种解决方案是使用部分并行修复机制来避免拥塞传编程交换机聚合器资源的限制,当交换机资源不足时,部分流量可能会退化到传统的[0042]检查点技术可以将大模型的训练状态定期从GPU显存备份到磁盘以避免训练状态存能力。为了加速大模型分布式训练,一种解决方法是采用网内聚合(In_NetworkAggregation,INA通过在可[0045]本发明通过提出一种面向大模型状态容错的纠删码失效块修复混合加速方法种模式以提升失效块的修复吞吐量。网内修复模式具有理论最优的带宽开销和修复速度,并发的incast传输流量,但是其理论上界会额外受到相关链路下行带宽的影响。本发明换机聚合器数量计算出失效块最优的修复策略,采用网内修复和服务器组合的修复模式,以根据异构的网络带宽资源和交换机聚合器数量进行修复模式的选择和路由路径的配置色数字表示,各链路的上下行带宽分别用红色和绿色数字表示。数据采用RS(5,3)进行编步骤S02.查询存储数据的元数据信息并根据当前的网络带宽和可编程交换机的可编程交换机聚合器数量计算出失效块最优的修复策略,修复策略包括失效块的修复模k+m-1个相关存储节点中确定参与修复的k个Helper节点信息②,并计算出失效块的修步骤S301.当参与修复的Helper节点接收到修复指令时,Helper节点按照指定下步骤S302.各Helper节点分别根据其本地块D:及其编码系数直接计算出编码块a,B;,并分配给对应的发送队列,每个发送队列在对应的路由路数据并按照发送顺序对发送数据进行标识;步骤S303.对具有相同标识的数据包载荷在步骤S304.在失效修复节点N,根据接收到的数据包修复失效数据块。迟,Helper根据其本地块D:及其编码系数直接计算出编码块a,B;,并分配给相应发送队包载荷在可编程交换机处执行聚合操作⑤,聚合吞吐量与该失效块修复任务所分配的聚合传输进行规划设计,而只将上层网络与各机架间的数据传输抽象为上层网络到ToR交换机换机S1与上层网络的上下行带宽资源分别被抽象为1maximizex,s.t.,RP,=(1-z,)·x,vr(4)Z,zn=k(8)合流量,ay"表示第r个机架对应的ToR交换机s,的上行链路带宽,MixAgg表示所有机架的分别为决策变量,机架r内的聚合模式为网内聚合时zr为1,聚合模式为服务器聚合时zr为0,机架r内的节点被选为Helper节点时为1,未选为Helper节点时为0。上述各参数的点N,所对应的ToR交换机s.,其流量总和不超过上层网络拓扑到s.的下行链路带宽dfown。量MixAgg(INA,UINA,,RP,PAT,)不得高于失效修复节点N,所在链路的下行带宽。[0065]基于上述优化目标和约束条件式(1)~(9),即便不考虑交换机聚合器数量的限[0066]本实施例中使用失效块修复加速启发式算法实现失效块修复加速问题求解的具步骤S201.获取失效块各相关的存储节点N=(N,N2…Nxn-1}、失效修复节点N,,输入各存储节点N,的上下行链路带宽和cfow以及ToR交换机s,的聚合能力(最大数据包步骤S202.根据节点与ToR交换机的上行链路带宽从失效块的所有相关存储节点步骤S203.在同一机架内的服务器统一使用网内聚合或者服务器聚合模式,其中将网内聚合模式下机架的最大聚合吞吐量限制定义为confine_INA_r=min(PAT,cp(r),df"),服务器聚合模式下机架r的最大聚合吞吐量限制定义为confine_RP_r=min(c"r),cfowT(r),df"),如果网内修复的最大吞吐量为Helper节点与ToR交换机的上行应的Helper节点选择网内聚合模式;如果服务器聚合的最大吞吐量为Helper节点与ToR交步骤S204.各个Helper节点以最小值的吞吐量发送数据以协调各机架的最大聚合步骤S205.经过步骤S201~步骤S204两轮聚合后的流量MixAgg_f被最大程度约③confine_INA_r=min();⑤ifconfine_INA_r≥confine_RP_r;changemode_rfromINAtoRPwiththeminimum(confine_INA_r_choosethesecond_layeraggregationswitchwiththemaximumpAT;andxmin();的复杂度,如对于RS(k=9,m=6)编码,会出现种组合方式。对每种组较低上行带宽对整体失效修复速率的影响。cup(r)和cdownr)分别表示机架r内选为Helper网内聚合模式受到各个Helper节点与ToR交换机的上行链路带宽、交换机聚合器数量以及示;而服务器聚合模式受到Helper节点与ToR交换机的上下行链路带宽限制,如约束(4)式的时间复杂度为O(|r|)。即便当PAT,=mincp"(r)时,网内聚合模式允许各Helper节点这种转发模式会带来较大的并发流量,受到下游交换机和修复节点的聚合能力和链路带宽为了避免算法的多轮次迭代,上述算法1是直接通过各机架内的最大聚合吞吐量来确定聚|2修复吞吐量为6。生码等并可以方便地扩展为并行的修复模式以进一步提高修复吞吐量。络接口。本实施例在这些FPGA设备上实现了ATP的网内聚合逻辑,并将其用作可编程交换和一块500GB固态硬盘的工作站上,其余的7台工作站对应H1_H7的7台主机,每个配有2个IntelXeonPlatinum8124M处理器、128GB内存、500GB固态硬盘和一块Intel82599[0075]使用一个GPT2_ML大模型在15GB清洗后文本上训练22万步后的模型状态,并利用(9,3)和RS(12,4)五种纠删码编码方式来进行实验。所有编码块的存储节点和修复节点轮聚合。原型系统测试结果均为10次运行的平均值,大规模仿真结果为100次运行的平均方法始终采用左侧机架网内聚合、右侧机架服务器聚合的方式,使得其吞吐量保持在如图6中(b)将S2和S3的聚合器数量调整为30和30,其趋势与图7中(a)大致相同,但是本发明HFRA相较于INA方法的优势变小,这是由于在本发明HFRA方法在左右侧机架分[0080]本实施例进一步采用大规模仿真实验来评估本发明HFRA及其他对比方法的性此外,INA和Conv方法受纠删码参数的影响较大,因为二者都会产生一些跨机架的转发流宽开销约是INA方法的两倍。RS(12,4)编码下的RP机架间带宽开销甚至达到了5.93发明HFRA方法的机架间带宽开销略低于RP方法,这是由于部分机架采用了网内聚合模

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论