并行计算机性能课件_第1页
并行计算机性能课件_第2页
并行计算机性能课件_第3页
并行计算机性能课件_第4页
并行计算机性能课件_第5页
已阅读5页,还剩37页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1

並行電腦性能針對一個並行系統,需討論計算和開銷特徵一、計算特徵下表給出了3種商品化並行電腦系列的性能參數的歷史值23記憶體層次結構:記憶體容量記憶體時延記憶體帶寬1996年前後電腦中這3個參數的典型值45二、並行性和通信開銷

並行程式中的開銷可分為3類負載不平衡開銷;並行性開銷;通信開銷(包括同步、通信和聚集)。

T=Tcomp+Tpar+Tinteract6說明:有3種類型的並行性操作。它們是並行性開銷的來源:進程管理;分組操作進程查詢操作7通信開銷的來源有3種類型的操作同步聚集通信8巨大開銷:注意有關並行性和通信開銷的兩個要點:通常比基本計算時間要大得多,在不同系統上變化很大。91011三、開銷定量化1.問題的提出應對計算的並行性和通信開銷進行量化。122.開銷測量條件進行測量實驗的確切條件必須清楚地加以說明。以下是部分列表:所使用的數據結構。所使用的編程語言、庫以及編譯器選擇。一般地,開銷測量應以批處理方式進行,都會被執行。13所使用的通信硬體和協議。因為在這種方式下大多數生成路徑(productionrun)測量掛鐘時間或是CPU時間。一般來講,掛鐘時間更有用。143.開銷測量方法雖然測量開銷粗看起來非常簡單,但要獲得精確測量結果卻是很具挑戰性的任務主要的原因有3種15乒乓方案:是測量點對點通信常用的方法:結點0執行一個發送操作向結點1發送一個m位元組的消息,後者執行一個接收操作收到此消息結點1立即發送相同消息給結點016例題:測量時延的乒乓方案:

for(i=0;i<Runs;i++)

if(my_node_id==0){/*發送方*/

Tmp=Second();

start_time=Second();向結點1發送一個m位元組消息;從結點1接收一個m位元組消息;

end_time=Second();17timer_overhead=start_time-tmp;total_time=end_time-start_time-timer_overhead;communication_time[i]=total_time/2;}elseif(my_node_id==1){/*接收方*/從結點0接收一個m位元組消息;向結點0發送一個m位元組消息;}}18熱土豆(hot_potato)方法(也稱為救火隊方法)。該方法面向n個結點;方法是個迴圈的發送接收。

19集合通信條件:設分佈式記憶體多電腦中n個結點中的每一個均執行以下的SPMD程式。使用路障來同步測量進程中的非同步操作。20for(i=0;i<Runs;i++){

Barriersynchronization;Tmp=Second();start_time=Second();for(j=0;j<Iterations;j++)The_collective_routine_being_measured;End_time=Second();21Timer_overhead=start_time-tmp;Total_time=end_time-start_time–timer_overhead;Local_time=total_time/Iterations;Communication_time[i]=maximumOfallnlocaltimevalues;}22改用集合操作的通用化乒乓方法:for(i=0;i<Runs;i++){if(my_node_id==0){tmp=Second();start_time=Second();結點0向所有n個結點廣播一個空消息;For(j=0;i<Iterations;j++)23thecollective_routine_being_measured;所有結點向結點0完成一個空歸約;

if(my_node_id=0){end_time=Second();timer_overhead=start_time-tmp;Communication_time[i]=end_time-start_time-

timer_overhead}244.開銷運算式經測量獲得開銷數據,有3種表示方法:用表格來表示數據。例如,下表給出了在SP2上運行專有MPL通信庫所測得的點對點通信的定時結果。2526以曲線來表示數據如下圖所示。其優點是曲線可示出通信開銷增長趨向。

2728運算式表示例如,將所測得的定時數據用最小二乘法適當地加以擬合。就可將SP2上的點對點通信開銷表示成消息長度的線性函數:t=46+0.035mμs如果加以擬合,它與曲線之間的誤差是很小的,如上圖所表明的那樣。295.點對點通信運算式Hockney提出操作通信時間(以μs表示)特徵的1個模型,其中的通信開銷t(m)是消息長度m(以位元組表示)的線性函數:

t(m)=t0+m/r∞式中t0是以μs表示的啟動時間,而r∞是漸近帶寬,單位MB/s。30Hockney還引入了兩個附加的參數。半峰值長度記為m1/2位元組,是達到半漸近帶寬所需的消息長度。特殊性能,記為

0MB/s,用來表明短消息帶寬。314個參數t0、r∞

m1/2、

0MB中的兩個是獨立的。另兩個可用以下關係推得:t0=m1/2

/r∞=1/

0其中m1/2是表示系統支持短消息通信好壞程式的參數。

32例如:SP2的t(m)=46+0.035m。啟動開銷為t0=46μs;漸近帶寬為:r∞=1/0.035=28.57MB/s,以及半峰值消息長度為:m1/2

=t0×r∞=1314位元組。336.集合通信

將式Hockney運算式擴展成如下:通信開銷T(m,n)現改為是m和n兩者的函數。但啟動時延仍只依賴於n。漸近帶寬變為r∞(n)。

T(m,n)=t0(n)+m/r∞(n)34在將測得的定時數據與不同的t0(n)和r∞(n)形式擬合可推得如表中所示的4個集合操作的公式35367.集合計算測量了3種代表性的集合計算操作:路障、歸約和掃描。它們擬合曲線開銷運算式如下表所示。注意當處理器數超過256時,路障開銷為762μs,相當於執行762x266=202,692flop所需的時間。現在可以回答這樣問題,是否應使用同步演算法?3738短消息

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论