计算机体系结构_第1页
计算机体系结构_第2页
计算机体系结构_第3页
计算机体系结构_第4页
计算机体系结构_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

计算机体系结构PAGE2计算机体系结构的基本概念计算机体系结构是指机器语言程序的设计者或是编译程序设计者所看到的计算机系统的概念性结构和功能特性。Amdahl所定义的体现结构是指程序员面对的是硬件的系统。所关心的是如何合理的进行软硬件功能的分配。计算机系统结构是指机器语言级的程序员所了解的计算机的属性,即外特性。可以包含数据表示,寄存器定义、数量、使用方式,指令系统,中断系统,存存储系统,IO系统等。计算机组成是计算机结构的逻辑实现。可以包含数据通路宽度,专用部件设置,缓冲技术,优化处理等。计算机的实现是指其计算机组成的物理实现。包括处理机,主存部件的物理结构,器件的集成度,速度的选择,模块、硬件、插件底板的划分和连接。从使用语言的角度,可以把计算机系统按功能从高到低分为7级:0应用语言机器级、1高级程序语言机器级、2汇编语言机器级、3操作系统机器级、4传统机器语言机器级、5微程序机器级和6电子线路级。3~6级为虚拟机,其语言功能均由软件实现。硬件功能分配的基本原则:(1)功能要求。首先是应用领域对应的功能要求,其次是对软件兼容性的要求;(2)性能要求。如运算速度,存储容量,可靠性,可维护性和人机交互能力等;(3)成本要求。体系结构设计的方法有三种:由上而下-从考虑如何满足应用要求开始设计;由下而上-基于硬件技术所具有的条件;由中间开始的方法。体系设计的步骤:需求分析、需求说明、概念性设计、具体设计、优化和评价。计算机体系结构的分类:(1)弗林FLYNN分类法:按指令流和数据流将计算机分为4类:①单指令流、单数据流-SingleInstructionStreamSingleDataStream,SISD。计算机,即传统的单处理机,通常用的计算机多为此类,如脉动阵列计算机systolicarray;②单指令流、多数据流-Multiple,SIMD。典型代表是并行处理机。其并行性在于指令一级。如ILLIAC、PEPE、STARAN、MPP等;③MISD计算机;④MIMD计算机。多处理机系统,实现全面并行的理想结构。可以通过共享存储器和消息传递来耦合系统,每个处理器分别执行系统分配的程序,同时执行多个指令流对多个数据流不同的处理,如IBM3081/3084,Cray-2等。//弗林分类法基本上是对除流水线处理机外的诺衣曼型控制流计算机进行分类,而不包括对像数据流计算机这种非诺衣曼型机器进行分类;(2)冯氏分类法。依据是并行度-即计算机在单位时间内能够处理的最大二进制位数。据此分为4类:①字串位串WordSerialandBitSerial。WSBS计算机。只有一个串行的处理部件,每字长1位;②字并位串Parallel。WPBS计算机。只有一个处理部件。该部件处理字长n位;③字串位并WSBP计算机。有多个处理部件。每个处理部件字长1位;④字并位并WPBP计算机。有多个处理部件,各部件字长也并行,如ILLICA2计算机具有64个字长64位的处理单元。冯.诺衣曼型计算机体系结构及其发展(1)是存储程序计算机的别称。在体系结构有着如下特点:①机器以运算器位中心,使用单一处理部件来完成计算、存储及通信工作;②采用存储程序的原理,使用线性组织的定长存储单元来存储程序,存储时对指令和数据不加区别;③存储空间的单元是直接寻址的,每个单元位数固定;④使用二进制机器语言,其指令完成基本操作码的简单操作;⑤对计算机进行集中的顺序控制。(2)两个最主要的特征:一是计算机内部信息流动是由指令驱动的,而指令执行顺序由指令计数器决定;二是计算机的应用仍主要面向数值计算和数据处理。(3)发展:①数据流计算机DFM。只要所需的操作数齐备就可以执行,这时只取决于执行部件的并行处理能力;②智能计算机。主要处理一些非数值化信息。体系结构并行技术的发展(1)并行性是指在同一时刻或同一时间间隔内完成两种或两种以上性质相同或不同的工作的特性。具有同时性和并发性二重性。(2)等级划分:(由低到高):①按执行程序的等级划分:指令内部、指令之间、任务或进程之间、作业或程序之间;②处理数据等级划分:字串位串、字串位并、字并位串、字并位并;③按信息加工的等级划分:存储器操作并行、处理器操作并行、指令任务作业并行;(2)并行性的技术途径:①时间重叠。多个处理过程在时间上错开,如流水线处理机;②资源重复。重复设置硬件资源来提高计算机的性能。如阵列处理机;③资源共享。用软件方法让多个用户按一定时间顺序轮流使用同一套件资源,以提高计算机设备利用率。如多道程序分时系统。题目:高级语言经编译程序的翻译形成汇编语言程序;传统机器语言机器级,是用微指令程序来解释机器指令;微指令由硬件直接执行;Amdahl加速比定律:加速比:Sp=1/(1-Fe+Fe/Se),其中Fe为被改进部分的执行时间所占的百分比的大小;Se是其性能提高的倍数。//局部性原理:程序趋向于重用它当前已经在使用的指令和数据。包括时间局部性和空间局部性。时间局部性是指当前访问的项目在最近的将来还会被访问;空间局部性是指某个项目及其附近地址的其他项目会同时被引用。实现软件移植的基本技术有:统一的高级语言、采用阵列机、模拟和仿真;仿真是指用微程序直接解释另一台计算机的机器指令系统;模拟指用机器语言解释实现软件移植的方法;多机系统的耦合度可分为:最低耦合、松散耦合和紧密耦合三种类型;指令系统指令系统又称指令集InstructionSet,它对计算机系统有全剧性影响,即指令的功能将直接反映系统功能。指令集发展有两个趋势:CISC和RISC;指令集体系结构的分类(1)分类依据,可以有5种:操作数在CPU中的存储方式;显示操作数的数量;操作数的位置;指令的操作;操作数的类型和大小。(2)按暂存机制分类:依据在CPU内部存储操作数的区别,可以把指令集体系结构分为3类:堆栈stack、累加器accumulator、寄存器即asetofregisters。①堆栈机。主要操作是压入和弹出,其他操作还有加、减、比较等;优点是:表示数值的模型简单、指令长度短。②累加器类机器是有一个隐含操作数的机器。例如PDP-8、Motorola6809;优点是机器的内部状态很少,指令也比较短。③寄存器为基础的指令系统优点是:速度更快、数值表示上有很强的适应性。例如IBM360、DECVAX。(3)通用寄存器general-purposeresistermachine,简称GPR机。其关键性优点起因于编译程序能有效的使用寄存器,无论是计算表达式的值,还是从更为全局的角度使用寄存器来保存变量的值。可以分为3类:①寄存器-寄存器resister-resister。只能对存储器有存取指令,所有操作在两个寄存器之间进行,操作结果送入第三个寄存器中;优点是:速度快、指令具有良好的正交编码模型;如RISC和Cray计算机;②寄存器-存储器类register-memory。在指令中,由寄存器内容加上存储器内容寻址构成寻址技术。如VAX、IBM360、Motorola68000、PDP11等。优点是:数据不需要寄存器装入就能存取、指令大小适中;③存储器-存储器memory-memory。如VAX2和IBM370,优点是紧凑、不需要消耗临时寄存器。指令格式(1)指令编码方法,通常有3种:①正交法orthogonalmethod。对流水线计算机特别适应,采用微程序控制时微程序数量可以较少;②整体法integrated。可以把使用频率高的操作数通操作数地址码组合起来,加以缩短优化,而使用频率低的操作码可以较长些,从而节省存储容量,但需要较大的微程序存储器;③混合法mixed。把以上两个方法优点结合。(2)指令格式。最普通的是:操作码opcode-操作数operand/地址。操作码字段表明操作类型;操作数/地址字段指明具体的操作数,也可以指明操作数地址,通常是和寻址方式相配合形成的。(3)寻址技术。即指令按什么方式寻找所需的操作数或信息,它影响主存规模速度和存取方式。寻址方式对于应用程序是透明的。①编址方式:统一编址-把各个不部件统一编成从0开始的一维线性地址空间;局部编址-指导这些部件适当分类,各自从0开始单独编址,形成多个一维的线性地址空间;隐含编址-地址隐含于操作码中;②程序定位方式。程序定位是把指令和数据中的逻辑地址转变成主存物理地址的过程,有三种方法:直接定位方式、静态定位方式、动态定位方式;③寻址方式。大多计算机都将主存、通用寄存器、堆栈分类编址,因此就有分别面向寄存器、堆栈和主存的寻址方式。指令的优化(1)指令格式的优化。就是从整个指令系统的利用率角度出发,尽量设法减少指令中冗余信息量,以便用最少的位数提供足够的操作信息和地址信息。包括操作码的优化和操作数的优化;(2)哈夫曼编码。左1右0。(3)理论码长-信息源熵。任意随机事件的出现概率为Pi,则它的信息量Ii=-log2(Pi),则平均信息量为H=-和(Pi*log2(Pi)),由此式的结果H即为理论码长。信息冗余量=1-理论码长/操作码的平均长度。(4)等长扩展码。哈夫曼编码方法形成的指令码很不规则,长度不一。事实上计算机采用等长扩展码,介于等长二进制编码和全哈夫曼编码之间的一种编码方式,仍利用哈夫曼思想,对概论高的指令用短码,概率低的用长码,但在整体上只采用了有限的几种码长。如下表:指令频度哈夫曼码等长码等长扩展码I10.40000000I20.301000101I30.1511001010I40.05111000111100I50.04111011001101I60.03111101011110I70.03111111101111平均码长2.2032.30理论码长为2.17。 指令系统的复杂化(1)CISC和RISC的目标是相同的,都是为了提高性能,减少语义差距,改善性能价格比。目前多用CISC类型,如IBM360/370和4300系列等;(2)指令系统复杂化的实现措施:①面向目标代码的优化。按静态使用频度(程序中出现的百分比)改进可以减少存储空间;按动态使用频率(执行过程中出现的百分比)改进可以减少目标程序运行的执行时间;②面向高级语言的优化,就是尽可能缩小高级语言和机器语言之间的语义差异,以利于支持高级语言的编译系统,左端编译程序的长度和编译所需时间;③面向操作系统的优化。就是进一步缩小操作系统和体系结构之间的语义差异,减少辅助时间,节省操作系统软件占用空间;(3)CISC的主要弊端:指令集过于庞杂;微程序技术是其重要支柱,这降低了处理速度;难以优化编译使之生成真正的目标代码;强调完善的中断机制,导致动作的烦杂;给芯片设计带来很多困难,出错几率增大,不利于大批量生产。RISC技术-精简指令集计算机ReducedInstructionSetComputer。(1)基本特征:精简指令数量-一般在100条左右;简化指令格式-在1~2种之内并让全部指令具有相同长度;采用单周期指令-几乎所有指令在一个机器周期内完成;采用寄存器操作-尽量减少访存操作;硬件控制逻辑-大多指令采用硬件控制实现,少数用微程序实现;优化编译程序。(2)RISC体系结构:①数据类型。有2种表示方法,一是用操作码编码表示,一是通过操作数内部标志位表示,即自定义数据表示;字长64位,包括整型数据和浮点数据,支持附加数据类型;②寻址方式,有:立即寻址方式、寄存器直接寻址方式、寄存器间接寻址、相对寻址方式、变址值方式和位移量方式。③寄存器模型和寄存器管理。有三种模型:窗口模型Windows、Cache模型、矩阵Matrix模型;④存储器管理。(3)RISC的主要技术:①重叠寄存器窗口技术。有利于合理利用有限的芯片面积,特别是支持最费时的过程调用和返回操作;伯克利设计的重叠窗口有8个,每个共有32个32位的寄存器,其中10个全局性寄存器,10个局部性寄存器,6个高位寄存器,6个地位寄存器,其典型调用时间是2微秒;②优化编译技术。可以合理分配寄存器,提高寄存器的使用效率,减少访存次数等。③超流水线及超标量技术。超流水线superpipeline技术是一种并行处理技术,通过细化流水,增加级数和提高主频,使得在每个机器周期内能完成一个甚至两个浮点操作,实质是以时间换取空间;超标量superscalar技术也是并行处理技术,通过内装多条流水线来同时执行多个处理,实质是以空间换取时间;④硬线逻辑与微程序相结合。MIPS和MFLOPS(1)MIPS每秒执行的百万次指令数。(2)MFLOPS,每秒浮点运算的百万次数。存储系统存储器的层次结构(1)存储器以存取速度为主要标准依次排列:最快的是与CPU同在一块芯片上的寄存器resister,其次是高速缓冲存储器cache-memory,然后是主存储器main-memory,接着是辅助存储器auxiliary-storage,最低层是海量存储器mass-storage。(2)有两个重要的存储层次,一是主-辅层次,以扩大存储容量位宗旨,多用软件管理来实现。另一个Cache-主存层次,以提高存取速度为宗旨,均用硬件方法实现;(3)实现存储体系的依据正是局部性原理,包括时间局部性和空间局部性。存储体系的性能参数有:①平均字节价格C=(C1S1+C2S2)/(S1+S2);为了使得存储系统的字节价格接近辅存的字节价格,要求主存容量远小于辅存容量;②命中率H=N1/(N1+N2);③存取时间T=HT1+(1-H)T2;④存储器利用率u=Sa/S,Sa是程序“活跃”部分所占用的存储空间,S是可利用的存储空间总容量。并行存储器(1)并行存储技术也是存储器中的体系结构问题,它既能扩大存储容量,又能提高访问速度。把存储器分成多个模块,在一次访问的时间内,就能并行的读出更多信息量,具有这样组织形式的存储器称为并行存储器Parallelmemory。又称为存储器的多体交叉访问multiplemoduleinterleavedmemory;(2)访问控制方法:①同时访问。可以一次提供多个数据或多条指令,适合对多数据流或多指令流进行并行处理。应注意频带宽度的问题,保证处理单元接收/处理数据的速率要和并行存储器同时读写数据的速率相匹配;采用交叉开关总线;②轮流访问。在对并行多体存储器访问时,各模块按一定的顺序轮流启动各自的访问周期。降低了对带宽匹配的要求。采用分时共享总线。虚拟存储器(1)虚拟存储器的管理方式。决定于主存与虚存间不同的地址影响方式,分别是段式管理、页式管理和段页式管理3种方式。①段式管理。地址映象-将虚存空间分段,主存的空间按这种段来分配和管理。段是按程序的逻辑功能来划分的。当程序从辅存调入主存时,是按段分配主存空间,需要建立一个包括段长度和主存起始地址的段表,存放在主存中;地址转换-在段式管理中,主存地址格式包括段号和段内地址,虚存地址格式包括用户号、段号和段内地址。②页式管理。将主存空间和虚存空间按固定大小划分成块,每块称为一页。页的大小和划分与程序逻辑功能无关。③段页式管理。将虚拟存储空间按段式管理,主存空间则按页式管理。存在虚拟空间的程序按逻辑关系分段,每一段又可分成固定大小的页。主存则只分成若干大小相同的页。许多大型机都采取该管理方式;(2)页面替换算法。在虚拟存储器中,由于虚拟空间比主存空间大得多,会出现当主存中所有页已经全部被占用,而CPU需要的指令却在主存中找不到,从而产生页面失效Pagefault。这是需要从辅存中调入新页,并把主存中已经不用的旧页替换出去。常用的替换算法有:①随机算法RAND。算法简单,易于实现;②先进先出FIFO;③近期最少使用算法LRU;④优化替换算法OPT-预先知道将要使用哪些页面,替换时把下次调用该页时的时间间隔最大的页面调出去。这是一种理想算法。高速缓冲存储器Cache(1)为弥补主存速度不足,在处理机和主存之间设置一个高速小容量的Cache,构成“Cache-主存”层次,其在本质上是一个两级的“页”式系统;(2)“Cache-主存”和“主存-辅存”的比较:前者目的是提高存储系统速度,后者是扩大容量;两者工作原理相同,都需要地址变换,但失效时,后者采取页面替换,前者采用块block替换;前者通过硬件实现地址变换和块替换,后者则是由操作系统来管理的;主辅层次的两种存储介质有很大区别,不易匹配,而前者则便于匹配;Cache对应用程序员和系统程序员都是透明的,而主辅层次则对系统程序员不完全透明。(3)在有Cache的系统中,访问主存请求的优先级安排次序是Cache-通道-写数-读数-取指令。(4)地址映象和变换。地址映象是指每个主存按什么规则装入Cache中。有全相联映象、直接映象、组相联映象。(5)Cache的块替换算法。有RAND、FIFO、LRU等;LRU替换算法的硬件实现有:①堆栈法。从栈底到栈顶的几何位置反映了各块近期最久未被访问的次序。②比较对法。让各块成对组合,用触发器状态表示每个比较对内的访问次序,从而找出被替换的块。综上所述,设计替换算法实现应考虑到:如何对每次访问进行记录和符合根据所记录信息来判定哪个块是近期内最久未被访问的。(6)Cache的块表示。在级相联或直接映象Cache中,地址的数据结构由3个部分组成:标志tag-给出块帧地址;索引index-组相联中通过它选择组号;块内位移blockoffset-给出在一个块内所找数据的地址。(7)Cache的写策略,即更新主存内容的算法。①写直达法writethrough:只要CPU有写操作,在写入Cache同时,也通过“Cache-主存”通路直接写入主存;②写回法writeback。在CPU执行写操作时,信息只写入Cache,仅当某块被替换时,才把曾被写入过的Cache块先送回主存,然后再调入新块。//写直达法的可靠性高,但增加了访问主存的流量,写回法则相反,减少了不必要的访存,但可靠性受影响,常需要在Cache中增加更多的冗余信息位来提高其内容可靠性。题目:衡量一个存储层次体系性能主要从平均字节价格、命中率、存取时间等三个方面考虑;选择存储映象方式时最基本的考虑因素是易于实现。在多级存储层次中,根据时间局部性,层次M1不必存入整个程序,只需将近期用过的块或页存入;根据空间局部性,当M2将所要访问的字送到M1时,一并把该字所在块或页整个取来。I/O通道和新型总线` IO子系统概述(1)它包括IO设备、响应控制器以及为IO操作而设计的软件。根据其操作的控制方式,IO控制可以分为三类:程序控制IO、DMA和IO处理机方式。①程序控制IO方式,是大多计算机具有的简单控制方式。在该方式下,IO设备、主存和CPU通过共享总线进行通信,IO设备可以和主存统一编址;优点是控制简单,编程容易,缺点是大量时间被花于IO操作上,外设和CPU不能同时工作;②DMA和中断控制方式。DMA方式是直接存储器访问方式。它要求外设和主存之间有直接数据通路。优点是它把部分IO控制交给设备控制部分,实现CPU和IO设备的部分并行。缺点是CPU仍需要启动每个信息块的传输,增加了成本;中断控制方式优点是初步解决了CPU、主存和外设之间的速度匹配问题。缺点是中断所需辅助操作很多;③通道控制方式是在DMA基础上发展起来的。一个IO过程CPU只参与两次工作。优点是并行操作能力强,提高设备利用率;缺点是不能完全独立于主机;④IO处理机IOP专门负责IO操作,具有更强的处理功能,不必借助于CPU。优点是CPU几乎移交了对IO的全部控制,完全独立于主机;缺点是提高系统成本。这方式广泛应用于IBM360、370系统。通道的工作原理(1)通道的功能:接受CPU发来的IO指令,按指令要求和指定的IO设备进行联系;从主存取出属于该通道程序的通道指令,对指令进行译码,向IO设备及控制器发出多种操作命令;为主存和外设装配和拆卸信息;从IO设备获得设备状态信息形成并保存通道信息,并根据需要将这些信息送往主存指定单元;将IO设备的中断请求及通道本身的中断请求发送给CPU;(2)通道种类:字节多路通道bytemultiplexerchannel-适合于连接大量低速设备,其工作模式有字节交叉模式和突发模式;数组多路通道blockmultiplexerchannel适于为高速设备服务;选择通道selectorchannel也是为多台高速设备服务的,但在数据传送期间,通道只能为某一台高速设备服务,只能执行一道通道程序。(3)通道字和通道程序。①通道命令字CCW是通道能够执行的一组指令,又称通道控制字。由命令码、数据地址、标志码、保留位、计数字段组成,共64位;②通道地址字CAW指明要执行的第一个通道命令字的地址,即通道程序首地址,共32位,主要由存储保护字段和地址字段组成;③通道状态字CSW用来记录通道和外设执行通道程序的状态,存放在内存储器的固定单元中,共64位。④通道程序,由若干个通道命令可组成一个通道程序。(4)通道的工作原理。IO操作过程可分为5个阶段:准备、启动、数据传输、结束传输、结束中断。通道分担了CPU对输入输出操作的控制,基本上实现了CPU和外部设备之间的并行执行,减少了外设向CPU请求中断的次数,提高了CPU运行效率。(5)通道流量设计。通道流量是指在数据传送期间单位时间内传送的字节数。EISA和MCA(1)微机总线的演变:第一代PC总线:8位/16位总线-内部总线16位,外部总线8位;第二代PC总线:16位总线-另一名称是ISA,即工业标准体系结构总线;第三代PC总线:32位总线-可提供多达4GB的寻址空间,能自动配置系统及扩充插卡,微机的32位总线主要有3大类,分别是Compaq等公司的EISA总线,IBM公司的MCA总线,Apple公司的NuBus总线。(2)MCA微通道体系结构。MCA是MicroChannelArchitecture微通道体系结构的缩写,其主要的特点可概括为:①是32位的高速微通道,可支持8、16、32位的数据转换与传送,改善了数据完整性;②MCA是完异步的总线结构,支持各总线主控器以及CPU公平地分享总线;③MCA采用了可编程任选POS,能识别用户安装地MCA插卡类型,并自动地给他分配系统资源;④电磁兼容性好,可靠性高;⑤支持多处理和并行处理系统,支持0等待状态,能提高处理效率。(3)EISA扩展工业标准体系结构。特点为:①它是32位地扩展工业标准总线,即ISA总线扩充;②EISA基本上是一个同步总线,它和CPU协同工作;③仲裁方案以轮流服务为基础;④采用了精致的双排扩展插槽;⑤和MCA都采用共享地中断线路。VESA和PCI局部总线(1)VESA是视频电子标准协会开发地局部总线标准,又称VL总线,基于该标准的4类产品是:VESA局部总线主板、VESA硬盘卡、VESA显示卡、多功能卡;(2)PCI局部总线,PCI,PeripheralComponentInterface,是外部部件接口的缩写。PCI是32位的总线,在33MHz的时钟频率下所提供的最大数据传输速率是132Mbps。PCI还采取32位数据总线和64位地址总线,把带宽透明的扩充到264Mbps。PCI局部总线能显著提高网络服务器的性能。其优点有:能大幅度提高数据吞吐率-测试表明,ISA总线的CPU占有率46%,EISA总线CPU占有率12%,而PCI局部总线CPU占有率不到6%;具有较低的访问延迟。流水技术和向量处理机指令的流水处理(1)指令控制方式有三种:①顺序方式。即各机器指令之间顺序串行的执行;优点是控制简单,缺点是速度上不去,机器的利用率低;②重叠方式。在前一条指令操作完成之前,开始解释下一条指令。优点是速度提高,缺点是会出现冲突、转移和相关等问题;③流水方式。把并行性或并发性镶嵌到计算机系统里的形式。通常用时空图描述流水线工作。(2)流水线的分级:按处理级别可分为3级:①操作部件级-也叫运算操作流水线ArithmeticPipelines,是将复杂算术、逻辑运算组成流水线工作方式;②指令级流水InstructionPipelines,把指令解释过程分成多个子过程;③处理机级流水,是一种宏流水线MecroPipelines,其中每个处理机完成某一专门任务,各个处理机所得到的结果需要存放在与下一个处理机所共享的存储器中。(3)流水线性能分析。①吞吐率Throughputrate。指在单位时间内流水线所完成的任务数或输出结果的数量;最大吞吐率TPmax=1/max(dt),即最大吞吐率取决于流水线中最慢的一段的时间;实际吞吐率TP=TPmax/(1+(m-1)/n),其中m为流水线段数,n为任务数;②加速比Speedupratio。指m段流水线的速度和等效的非流水线的速度之比。S=T0/Tl=n*m*dt/[m*dt+(n-1)*dt]=m/[1+(m-1)/n];③效率Efficiency。是流水线的设备利用率。E=n个任务占用的时空区/m个段总的时空区。(4)流水的相关处理。①局部性相关原理。流水线同时解释的指令可能出现相关。解决的办法有两种:一是推后法,即推后对相关单元的读;二是通路法,即设置相关专用通路而不必使用存储单元的写读;②全局性相关原理。转移指令和它后面的指令之间存在关联,不能同时解释,执行时可能会改动指令缓冲器中预取到的指令内容,从而造成流水线吞吐率和效率下降;解决办法有3种:一是猜测转移分支;二是加快和提前形成条件码;三是加快短循环程序的处理;③流水的中断处理。中断也会引起流水线断流。但出现概率比条件转移的要低。其处理关键在于如何处理好断点和中断后的恢复问题。(5)时钟周期和流水线调度。①时钟周期直接决定流水线的最大吞吐率。其越小?,流水线分段越多,寄存器延迟时间救越长,降低了流水线的实际吞吐率。时钟周期越小,TPmax越高;②流水线为避免功能段的冲突,存在任务的调度问题。通常采用预约表R(Reservationtable)的方法。流水处理指令并行性的开发(1)超级标量计算机,配置了多个功能部件和指令译码器,和多个寄存器端口和总线,能同时执行多个操作。其流水线调度包括指令的发射策略和完成策略。指令发射InstructionIssue是启动指令进入执行段的过程,分为按序发射和无序发射。指令发射策略是指指令发射时所使用的协议或规则。指令的完成也有按序和无序之分。超标量流水线的调度策略共有三种:按序发射按序完成、按序发射无序完成、无序发射无序完成。(2)超长指令字计算机VLIW。是由编译程序在编译时找出指令之间潜在的并行性,进行适当调度安排,把多个能并行执行的操作组合在一起,成为一条具有多个操作段的超长指令,由它控制多个互相独立的功能部件,每个操作段控制一个功能部件,相当于同时执行多条指令。例如Cycra5计算机,其每个操作段的典型格式为:一个操作码、两个源寄存器描述码、一个目的寄存器描述码和一个判定寄存器描述码。(3)超级流水线计算机。结构是把每个流水线分成若干个子流水线,而每个子流水线取出的仍只有一条指令,这样看来在一个周期内便取出了多条指令。例如MIPS公司宣布的64位RISC计算机-R4000机,每个周期可流出2条指令。向量流水处理机(1)向量处理方式:以计算D=A*(B+C)为例,其中ABC均为有n个元素的向量。①横向处理方式。按组成的元素顺序逐个进行计算。即分别求Di=Ai*(Bi+Ci);该方式在速度和效率上都没有提高;②纵向处理方式。先计算向量B+C=E,再计算向量A*E=D.③分组/纵横处理方式。前两种方式的结合。即把原来向量分成几组,每组按纵向处理方式进行。CRAY1超级计算机采取纵横处理方式;CRYER205则采取纵向处理方式。实际上,向量处理机的体系结构有两种基本类型:一是寄存器-寄存器机;另一是存储器-存储器向量机。(2)向量流水处理机。①CRAY1向量流水处理机。属于寄存器-寄存器类型,时钟周期位12.5ns,存储器周期为4个时钟周期,运算速度为160MFLOPS。只有120条指令,指令格式有两种:16位的单字段指令和32位双字段指令。机器字长64位,包括3种数据格式:24位带符号整数、64位带符号整数、64位浮点数。CRAY1采取了大量的寄存器组。并具有4类12种功能流水线(见附);CRAY1解决冲突的方法有链接技术和推迟执行两种。输入输出由24个通道组成。CRAY1使得模拟成为重要的科学研究方法之一。②CRYER205。机器的中心部件是标量部件,包括指令处理部件和标量执行部件。其存储器基本模型是64位的1M存储器,最大容量为4M*64b。时钟周期80ns。提供8个32位的IO通道,传输速率200Mbps。CRYER205性能指标比CRAY1高,单运行上并误多大差别,因为存储器-存储器向量机再体系结构上不及寄存器-寄存器优越。附:CRAY1的寄存器组包括向量寄存器、标量寄存器、A寄存器、B寄存器、T寄存器;CRAY1有4类12种功能流水线:①地址功能流水:包括地址加、地址乘2条流水线;②标量功能流水:标量加、标量位移、标量逻辑、计数4条流水线; ③向量功能流水:向量加、向量位移、向量逻辑3条; ④浮点功能流水:浮点加、浮点乘、求倒数近似3条。并行处理技术和多处理机并行性主要是指同时性或并发性。在进行并行处理时,其每次处理的规模大小可能是不同的,这可用并行性颗粒度来表示:G=所有处理器进行计算的时间总和/所有处理器通信时间总和。并行性从执行程序的角度看,并行性等级可分为5个:作业级、任务级、例行程序/子程序级、循环和迭代级、语句和指令级;从处理数据的角度看,可分为4级:字串位串、字串位并、字并位串、字并位并/全并行。并行处理技术(1)层次越高的并行处理颗粒就越细,粗粒度并行性开发主要采用MIMD方式;开发计算机系统并行性,一般采用资源重复、时间重叠和资源共享三种方法。资源重复是通过使用多功能部件,引入空间重复因素;时间重叠是在并行性概念中引入时间因素,让多个处理过程重叠地使用同一套部件各个部分;资源共享主要是采用软件手段让多个用户按时间片轮流使用同一套硬件资源。(2)并行处理机地结构和特点。以SIMD方式工作,采用资源共享重复的并行性措施的阵列处理机:①基本结构:由一个控制器CU、n个处理单元PE、m个存储模块M和一个互连网络部件IN组成。根据存储器模块是以分布方式还是集中方式存取,可以分为两种基本结构:分布式存储器的阵列机和共享存储器的阵列机;②主要特点:采用资源重复方法引入空间因素;以某一类算法位背景的专用计算机;其研究必须和并行算法研究密切结合,使之具有更强适应性;从处理单元看,可以将其看成一个同构型并行机。SIMD的互连网络(1)基本互连函数:①恒等置换。相同编号的输入输出端一一对应。表达式:;②交换置换。第0位位值不同的输入端和输出端之间的连接。;③方体置换。第k位位值不同的输入端和输出端之间的连接。;④均匀洗牌置换。输入端分成数目相等的两半,再隔一个顺序和输出端相连。,可见洗牌是将输入端二进制地址循环左移一位得到对应的输出端二进制地址;⑤蝶式置换。,即将输入二进制地址的最高位和最低位互换位置取可求得响应输出的地址。⑥位序颠倒置换。。(2)互连网络的特性:网络规模-网络中结点个数;结点度-和结点相连接的边数;距离-量结点之间相连的最少边数;网络直径-网络中结点之间最大距离;等分宽度-当网络被分成两半时,沿切口的最小边数;结点之间的线长-两个结点间的线的长度;对称性-若从任何结点看拓扑结构都一眼则称为对称网络。(3)网络性能参数:频宽bandwidth-传输信息的最大速率,单位为兆位/秒;传输时间transmissiontime-等于消息长度除以频宽;“飞行”时间timeoffly-包括时延;传输时延transportlatency-等于飞行时间+传输时间。发送方开销senderoverhead-处理器把消息放到互联网的时间;接收方开销receiveroverhead-处理器把到达的消息从互联网上取出的时间;//总时延=发送方开销+飞行时间+消息长度/频宽+接受方开销。(4)常用的单级互连网络:①交换互连网络。;②PM2Ⅰ互连网络:,0≤i≤n-1,0≤j≤N-1;其中N是结点数,n=log2N;③混洗交换互连网络。由全混洗和交换两种互连函数词成。④蝶式互连网络(5)关于多级连接。多级连接特性决定因素主要有交换开关、拓扑结构、控制方式3种。常用的多级互连网络有多级立方网络、多级混洗交换网络、多级PM2Ⅰ互连网络。多处理机(1)多处理机具有两台以上的处理机。在操作系统控制下通过共享主存或输入输出子系统或高速通信网络进行通信。属于MIMD系统。特点有:结构灵活性、程序并行性、并行任务派生、进程同步、资源分配和调度。(2)多处理机系统中,机间互连主要采用以下几种方式:总线方式、纵横交叉开关互连方式、多端口存储器互连方式、多级网络互连方式、虫孔互连和寻径技术。(3)多处理机的结构。有两种结构:①共享存储器结构-存储器和IO设备是独立的子系统,为所有处理机共享,处理机间通过共享存储器单元实现通信;②本地存储器结构,每台处理机有自己的存储器和IO设备,处理机间通过点对点信息交换实现通信。//见题目。(4)在并行处理机

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论