TCCIASC00542026人工智能芯片面向芯粒的卡间互联接口技术要求_第1页
TCCIASC00542026人工智能芯片面向芯粒的卡间互联接口技术要求_第2页
TCCIASC00542026人工智能芯片面向芯粒的卡间互联接口技术要求_第3页
TCCIASC00542026人工智能芯片面向芯粒的卡间互联接口技术要求_第4页
TCCIASC00542026人工智能芯片面向芯粒的卡间互联接口技术要求_第5页
已阅读5页,还剩59页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

ICSCCSLCCIASC中国计算机行业协会团体标准T/CCIASC0054—Artificialintelligencechips-technicalrequirementsofinter-cardinterfacefor2026-02-27发 2026-03-06实 发T/CCIASCT/CCIASC0054— (资料性)先进封 (资料性)标准封 T/CCIASCT/CCIASC0054—GB/T9178GB/T14113UCIeUCIe规范v2.0(SpecificationRevision2.0)AXI协议规范(AXIProtocolSpecification)AXI-Stream(AXI-StreamProtocolGB/T9178、GB/T14113和GB/T46280.1 AdvancedBitErrorErrorCheckingandEndOfEndOfGeneralPurposeInputInputfromGPUMulti-ChipOutputtoGPUPowerRawDataSignalStartOfStartOf5概述Unpacking/PackingMAC123456AXIAXIAXI实现GPU和通信芯AXI-StreamAXI-StreamGPU卡基7AXI8UMAC通信芯粒在初始化时,应配置本GPUID信息,用于通信芯粒网络通信标识,如:发送时本GPUIDGPUUMCGPUIDPORTIIPG头,该笔事务包含的其他控制信息打包到相应类型的AXI报文头上,如果有数据要传输,则以Paload形式附加在AXI报文头之后传递。打包好的报文如下图9所示。通信芯粒通过IGPH的目的GPUID和目的PORTIGPUI在通信芯粒到GPU方向上,网络报文头会携带目的GPUID和源GPUID信息,在经过通信芯粒向GPU9AXIAXIAW+W通信芯粒侧发起AW请求主接口侧信号定义见表,接收AW请求从接口侧信号定义见表2,用于和GPUAW AW主接AWIDtoAWLENtoAWUSERto1bit:indicatesneedtopackonly51bitsvalidforADDR,other13bitsoptional:10bits:SourceGPUID3bits:SourcePORT表 AW从接AWIDfromAWLENfromAWUSERfrom1bit:indicatesneedtopackAWADDRfromNOC10bits:DestinationGPU3bits:DestinationPORT,用于和表 W主接WVALIDtoWREADYfromDATA_WIDTH/WSTRBtoWLASTtoReserved,notusedinAXI表 W从接WVALIDfromWREADYtoDATA_WIDTH/WSTRBfromWLASTfromReserved,notusedinAXIpaddingWDATA10AW+W(如图11。由于Unalignedtransfer的存在,有效的WDATA可能来自一拍也能来自两拍。11AW+W(121314AW+W(15AXIB B主接BREADYtoBIDfrom10bits:DestinationGPUID3bits:DestinationPORTidBRESPfromBUSERfrom B从接BVALIDtoBREADYfromBIDto10bits:DestinationGPUID3bits:DestinationPORTidBRESPtoBUSERtoAXIAR通信芯粒侧发起AR请求主接口侧信号定义见表7,接收AR请求从接口侧信号定义见表8,用于和GPUAR AR主接ARVALIDtoARREADYfromARIDtoARLENtoARUSERtoARCACHEtoARADDRtoonly51bitsvalidforADDR,other13bitsoptional:10bits:SourceGPU3bits:SourcePORTARLOCKto AR从接ARREADYtoARIDfromARLENfromARUSERfromARCACHEfromARADDRfrom10bits:DestinationGPUID3bits:DestinationPORTARLOCKfromAXIR通信芯粒侧发起R通道应答主接口侧信号定义见表9,通道应答从接口侧信号定义见表10,用于和 R主接RREADYtoRLASTfromRUSERfromKeepsamevalueinoneRRESPfromKeepsamevalueinoneRIDfromKeepsamevalueinonetransaction10bits:DestinationGPUID3bits:DestinationPORT R从接RVALIDtoRREADYfromRLASTtoRUSERtoKeepsamevalueinoneRRESPfromKeepsamevalueinoneRIDtoKeepsamevalueinonetransaction10bits:DestinationGPUID3bits:DestinationPORT16R GPUIOIOGPU GPU侧仍然使用当前私有互联协议报文格式,协议层提供AXIStram模式。源GPU采用AXIStramAXIStramGPGPAXIStraGP18UMACUMAC一端连接AXIStream接口,AXIStream接口均为双向通信;另一端连接链路层FDI接口,AXIStream模式应提供报文路由信息,包括目的GPUID、目的PORTID、报文类型(请求/响应),每组AXIStream接口每拍只能传输一个包的数据,要求EOP之外的所有拍数据均为满64B,EOP当拍12AXIStreamAXIStream0tvalidforAXIStream0tdataforUSER_AXIStream0tuserforTX1bit:SOP,startofpacket1bit:EOP,endofpacket1bit:ERR,haserrorindata.6bit:SIZE,(validbytecount-1)intdata,usedonly10bits:GPUID,endpointGPUIDforthispackettobetransmittedto,usedonlySOP=11bit:TYPE,thispacketisresp(0)/req(1),usedAXIStream0treadyforAXIStream0tvalidforAXIStream0tdataforUSER_AXIStream0tuserfor1bit:SOP,startofpacket1bit:EOP,endofpacket1bit:ERR,haserrorindata.6bit:SIZE,(validbytecount-1)intdata,regardlessofresp/req,usedonlyEOP=110bits:GPUID,startpointGPUIDforthispackettransmittedfrom,usedonlyAXIStream0treadyfor137.1.2.5AXIStream端口上立即停发 FDI工作时钟,1GHz15FDIFDIFDIFDIlp_valid值完全一FDIFDIFDI该APB接口工作在clk时钟域。读写对端寄存器需要操作本端的寄存器序列间接完成。其中predy116APBAPBAPBAPBAPBAPBAPB17比如发送时本端GPUID用于生成源GPUID信息使用,目的端通信芯粒接收到网络传输的源GPUID,用来生成OGPH头中源GPUID域段信息。PORTID信息提供通信芯粒进行网络路由转发使用。表19所示OGPH头需要携带信息:单播/组播指示,流分类(区分请求/响应),源GPUID和源PORTID18IGPHTYPE=TrafficGPUTYPE=Traffic19OGPHTYPE=TrafficGPUTYPE=GPUFlit格式宜采用Format6:Latency-Optimized256BwithOptionalBytesFlitFormatforStreamingProtocol。在payload空间中,放置端口0和1各一半数据、以及对应的报文头。报文头中承19FlitNOPFlit,AW&W、AR通道)},其余Bit保留作未来规划用途,tie0。AXIStream模式下的分通道反压,其中分别提供{响应反压,请求反压},由GPU侧响应,其余Bit保留作未来规划用途,tie0。要求两侧FDI工作在512bit@1GHz或512bit@1.5GHz,具体频率可根据PHY的datarate,参考IP供应应采用Latency-Optimized256BwithOptionalBytesFlitFormatforStreamingProtocol格CR2CR128CRCFli的前12Fli头、Chuk0Chuk1CR计0)CRC00C0B20CRC在FliChuk2与Chnk3CRCRC1B0C1BCRCR20Flit20FlitDescription(StreamingProtocol00b:D2DNOPRemainingencodingsarepermittedtobeusedbyProtocolLayerinavendordefinedmanner.ProtocolLayermustneversetthisto00bforFlitssentacrossFDI.StackIdentifier0:Stack01:StackFlit00b:CXL/PCIe/StreamingFlit/D2DNOPFlit01b:TestFlit10b:Management21FlitDescription(StreamingProtocol00b:D2DNOPRemainingencodingsarepermittedtobeusedbyProtocolLayerinavendordefinedmanner.ProtocolLayermustneversetthisto00bforFlitssentacrossFDI.StackIdentifier0:Stack01:StackTheupperfourbitsofSequencenumber“S”(i.e.,Flit00b:CXL/PCIe/StreamingFlit/D2DNOPFlit01b:TestFlit10b:ManagementAckorNak00b:ExplicitSequencenumber”S”ofthecurrentFlitispresent.01b:Ack.Thesequencenumber“S”carriestheAck’edsequencenumber.NistheNak’edsequencenumber.ThelowerfourbitsofSequencenumber“S”(i.e.,Sequencenumber0isreservedandifpresent,itimpliesnoAckorNakis式为,此公式为随机位错误提供了3bit检测的保证:2bit检测保护是因为原始多项式,另外的1bit检测保护是因为多项式中的,21CRC以上的速率,除非当前协商模式为RawMode。Ack/Nak机制与PCIe6.0FlitMode8bit的Flit序列号,位于Flit头中。另Ack/Nak机制内部发送端由NTS计数器(NextTransmitSeqNumber)CRC生成器,重传缓存,Retry_timer计数,Retry_num计数,Ackd_seq寄存器,FlitCRC校验等元素构成,其中NTS计数器用于Retry_num计数是一个计数器用来记录Flit发送失败的次数,当达到阈值时,强制PHY进行LinkCRCNRS(NextReceiveSeqNum),NAK_ScheduledACK/NAK生成器产生ACK/NAKFlitRDISM是提供给上层的抽象的物理层接口状态,RDISM状态转换使用{LinkMgmt.RDI*}边带消2222链路状态管理接口(FDIlinkerrFlit23链路状态管理接口(RDIRDIActive物理层请求在FlitFlit23(SBINIT主带初始化(MBINIT主带训练完毕后进行RDIBringUp,最后PHYLSM进入激活状态,完成链路初始化及训练。24RDIRDI完成。图2为RDI当RDPHYLinkconroStatLinktrinig”bi)25RDIBringUp26FDIBringUp此为触发协议层请求转换到激活状态。允许协议层在请求转换到激活状态前等待当采样到lp_state_req=Active后,链路层需要在边带上向对端发送{LinkMgmt.链路层{LikMgt.Rs.Acive{LikMgt.Re.Acive{{LnkMmt.链路层0.Rp.Ativ}需要在链路层采样到pl_x_ativ_re=lprx_ctie_ss=1时。如前面所述,pl_lk_eqpl_x_ativ_reBrigUppl_lk_eqplinbnd_resARB/MUX,当链路层收到并发送了边带信号{LinkMgmt.0.Rsp.Active}之pl_state_stsFlit。如果使用了ARB/MUX{LinkMgmt0.Rsp.Active}的发送与接收将会使得ARB/MUXALMPvLSMPowr(PwerMangemnt,PMPCI、CXL、LFDPM状态。L1L2PL。FD、RD都支持L、L2电源L、L状态下,RD控链路是否正常,链路层会根据触发事件,协调链路状态,比如进入Linerrr/lnkrsetDisbled24Versus(FDI边带:在协议层与链路层之间传递边带信息。FDIpl_cfg*27(CfgRd/Wr(MRd/WrComleton(pl/pld):一般对应寄存器访问请求的响应。根据是否携带数据及返回数据的cplcplcpl32bt/6bit数据访问有几点不同:Staus,表明当前Comleton的状态,包括Sucess、UR、CA、Stal四Comleto在FDdstdtagRequscpl没有add9;2829Completion30Msg31MsgD25PacketOpcodePacket32bMemory32bMemory32bConfiguration32bConfiguration64bMemory64bMemory64bConfiguration64bConfigurationCompletionwithoutCompletionwith32bCompletionwith64bMessagewithoutMessagewith64bOther1.1.1.1否携带数据、不论数据位宽多少(32、64bit),同一个边带头信息消耗的就是一笔信处于超时状态。若寄存器访问请求超时,边带会上报超时中断并返回UR(unsupportedrequest)完成26PHY持续一个或多个时钟周期的脉冲信号,且仅当RDI物理层允许在内部对损坏数据的pl_validpl_error被不应断言pl_valid(除非在同一时钟周期内断言pl_error)。pl_error=1pl_valid=1Flit(pl_errorFlit)在Flit模式下,当启用重传时,链路层负责确保转发到FDI的Flit的数pl_flit_cancelFlit。对于68BFlitFlit;但在256B需要跟踪并相应地处理未来的Flit。另一个示例是,如果链路层未执行存储/转发操作,并且仅接收到128B中的64B,而pl_error64BFlit另一半发送虚拟数据,并执行pl_flit_cancel。在Flit模式下,当链路层启用重传时,重新训练退出将自然导致任何部分接FlitFlitpl_error配器必须将pl_error和pl_cerror信号进行逻辑或运算,以用于可纠正内FlitRawMode运行时,链路层只能使用pl_cerror信号进行可纠正内部错误日志记录。RDI适配器完成时钟门控退出握手。一旦pl_cerror取消断言,并且满足所有其RDI适配器完成时钟门控退出握手。一旦pl_nferror取消断言,并且满足所有其指示来自物理层的致命错误。如果物理层尚未处于LinkErrorpl_state_stsLinkError这是一个电平信号,可以在任何RDIRDILinkError27FDIrdi_pl_state_stsLinkError状态。此错误必须上报至更高的协议层以进信号可由以下来源驱动:初始化完成(非致命)CRC(非致命)、重传超时(致命)、28FDIRDICRCRDIRDIRDI如图3TX方向FDRDRDRD的R到FDI的Rx。数据通路与正常通路基本一致区别在于正常数据由RDI口发送给对端,RDI内测环回由RDIMUXR。图32RDITX图33FDI3429Bump25um-<=RawBitError1e-271e-1530TX/RX加了TX/RXRD[3:0]和TX/RXCKRD,TX/RXVLDRTX/RXDATASBRDBump为PHY实施提供一组参考64位bumpMap,以包含指定的最大速度。这些bumpmap采用的模式,间距31BumpBumpBumpMax16108BumpMap采用8列的bumpPattern,以追求最好的实施要求和最大的性能目标。基于业内大多数先 35Bump PHY面宽33Phy建议对16GT/s进行发射机均衡,并且必须在24GT/s和32GT/s数据速率下支持,以减轻通道ISI24GT/s和32GT/s的Tx均衡系数基于下图输出去加重所示的FIR滤波器。均衡系数受最大单位摆动3637343835VTF4-1624-32VTFLossL(fN)>-L(fN)>-VTFCrosstalkXT(fN)<1.5L(fN)-21.5andXT(fN)<-XT(fN)<1.5L(fN)-19andXT(fN)<-抖动行为TX和RX模型,如图39所示。363937PHYcoreAnalogIOPLLAnalog4038Bump5mm–RawBitError1e-271e-15Bump标准封装的bumpMap如图41所示,建议bump间距控制在150um,可方便信号在有机基板上无障碍互41Bump39Phy7.3.2.37.3.2.45-PHY面宽PHY深度*PHYbumppitch40Phy41Phy4-812-1624-32VTFLoss4-812-1624-32VTFLossL(0)>-L(fN)>-L(0)>-L(fN)>-L(0)>-L(fN)>-XT(fN)<3*L(fN)-andXT(fN)<-XT(fN)<3*L(fN)-andXT(fN)<-XT(fN)<2.5*L(fN)-andXT(fN)<-声和无抖动行为TX和RX模型。427.3.2.543PHYcoreAnalogIOAnalogAnalogPLLAnalog24GT/s32GT/s在16GT/s及以下使用,见表44。4

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论