《TigerSHARC处理器技术及其应用》课件第1章_第1页
《TigerSHARC处理器技术及其应用》课件第1章_第2页
《TigerSHARC处理器技术及其应用》课件第1章_第3页
《TigerSHARC处理器技术及其应用》课件第1章_第4页
《TigerSHARC处理器技术及其应用》课件第1章_第5页
已阅读5页,还剩46页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第1章概述1.1数字信号处理器的基本概念和特点1.2数字信号处理器的发展历史和应用1.3ADI公司的DSP系列简介1.1数字信号处理器的基本概念和特点

1.1.1数字信号处理器的基本概念

数字信号处理器(DigitalSignalProcessor,DSP)是一种专门用来实现各种数字信号处理算法的专用处理器,可以分成专用DSP和通用DSP两类。专用DSP用来实现某些特定的数字信号处理功能,如数字滤波、FFT等。它不需要编程,使用方便,处理速度快,但是缺乏灵活性。通用DSP则有完整的指令系统,通过编程可实现各种复杂的数字信号处理功能,具有适应性强、灵活性高、应用范围广、开发成本低、开发周期短等显著优点,得到了广泛的应用。

通用DSP(以下简称DSP)实际上是一种专门针对数字信号处理应用而设计的专门的处理器。按照其指令系统可以分为定点处理器和浮点处理器。定点处理器算术逻辑单元(ALU)的运算针对定点数(整数或者小数)设计,一般可以直接进行定点数的运算,不能直接进行浮点数(实数)的运算。当利用定点处理器进行浮点数运算时,其运算时间会增加,从而导致运行效率急剧下降。而浮点处理器通常设计有专门的浮点数加法和乘法硬件运算单元,它既可进行浮点数的运算,也可进行定点数的运算,并且完成浮点数运算和定点数运算的时间或者指令周期数相同。因此,浮点处理器运算精度高,可以完成各种复杂的数字信号处理算法。

定点处理器DSP可以胜任大多数数字信号处理应用,但其可处理的数据的动态范围有限,如16bit定点DSP的动态范围仅96dB。在某些数据动态范围很大的场合,按定点数处理可能会发生数据溢出,在编程时需要使用移位定标措施或者用定点指令模拟浮点数运算,使程序执行速度大大降低。浮点DSP的出现解决了这些问题,它拓展了数据动态范围。浮点DSP的综合性能优于定点DSP,在相同的指令周期内,它既可完成32位定点数运算,也可完成浮点数运算,而且其汇编源程序容易编写,可读性好,调试方便。

DSP主要用于满足各类通信设备、雷达、数字电视、数码照相机、数码摄像机、DVD、VCD、音响设备等各种应用对数字信号处理的需要。DSP的特点之一是适合于数学计算密集的应用,如快速傅立叶变换(FFT)、卷积、相关、数字滤波、谱估计等数学计算密集类算法。DSP在其体系结构上采取了一系列措施,使其在数学计算方面具有优越的性能。DSP的另一个特点是运算速度快,可以实现实时计算,这在调制和解调、雷达信号检测等应用中非常重要。1.1.2数字信号处理器的特点

1)运算单元

DSP具有硬件乘法器和多功能运算单元。硬件乘法器可以在单个指令周期内完成乘法操作,这是DSP区别于通用微处理器的一个重要标志。DSP的多功能运算单元可以完成加减、逻辑、移位、数据传送等操作。新一代的DSP内部甚至还包含多个并行的运算单元,大大提高了运算和处理能力。

针对滤波、相关、矩阵运算等需要大量乘及累加运算的特点,DSP算术单元中的乘法器和加法器可以在一个时钟周期内完成相乘、累加两个运算。近年出现的许多DSP还可以同时进行乘、加、减运算,大大提高了完成FFT运算和数字滤波等典型数字信号处理算法的速度。

2)总线结构

传统的通用处理器采用统一的程序和数据空间、共享的程序和数据总线结构,即所谓的冯·诺依曼结构。DSP普遍采用了数据总线和程序总线分离的多总线结构,即哈佛结构或者改进的哈佛结构,极大地提高了指令执行速度。片内的多套总线可以同时进行取指令和多个数据存取操作,许多DSP片内嵌有DMA控制器,配合片内多总线结构,可使数据块传送速度大大提高。如TI公司的C6000系列的DSP采用改进的哈佛结构,内部有一套256位宽度的程序总线、两套32位的数据总线和一套32位的DMA总线。ADI公司的SHARC和TigerSHARC系列DSP采用超级哈佛结构(SuperHarvaredArchitectureComputer),内部集成了3套甚至4套总线,即程序存储器总线、数据存储器总线和输入输出总线。

3)专用寻址单元

DSP面向数据密集型应用,伴随着频繁的数据访问,数据地址的计算也需要大量时间。DSP内部配置了专用的寻址单元,用于地址的修改和更新,它们可以在寻址访问前或访问后自动修改内容,以指向下一个要访问的地址。地址的修改和更新与算术单元并行工作,不需要额外的时间。

DSP的地址产生器支持直接寻址、间接寻址操作,大部分DSP还支持位反转寻址(用于FFT算法的数据次序整理)和循环寻址(用于数字滤波算法)。

4)片内存储器

针对数字信号处理的数据密集运算的需要,DSP对程序和数据访问的时间要求很高,为了减小指令和数据的传送时间,许多DSP内部集成了高速程序存储器和数据存储器,以提高程序和数据访问存储器的速度。

如TI公司的C6000系列的DSP内部集成有1~7MB的程序和数据RAM;ADI公司的SHARC系列的DSP内部集成有0.5~5MB的程序和数据RAM,TigerSHARC系列的DSP内部集成有6~24MB的程序和数据RAM。

5)流水处理技术

DSP大多采用流水技术,即将一条指令的执行过程分解成取指、译码、取数、执行等若干个阶段,每个阶段称为一级流水。每条指令都由片内多个功能单元分别完成取指、译码、取数、执行等操作,从而在不提高时钟频率的条件下减少了每条指令的执行时间。

6) DSP与其他处理器的差别

数字信号处理器(DSP)、通用微处理器(MPU)、微控制器(MCU)三者的区别在于:

● DSP面向高性能、重复性、数值运算密集型的实时处理;

● MPU大量应用于个人计算机;

● MCU适用于以控制为主的处理过程。

DSP的运算速度要比其他处理器高得多,以FFT、相关为例,高性能DSP不仅处理速度是MPU的4~10倍,而且可以连续不断地完成数据的实时输入/输出。DSP的结构相对单一,普遍采用汇编语言编程,其任务完成时间的可预测性相对于结构和指令复杂(超标量指令)且严重依赖于编译系统的MPU强得多。以一个FIR滤波器的实现为例,每输入一个数据,对应每阶滤波器系数需要一次乘、一次加、一次取指、二次取数,还需要专门的数据移动操作。DSP可以单周期完成乘加并行操作以及2~4次数据存取操作,而普通MPU完成同样的操作至少需要4个指令周期。因此,在相同的指令周期和片内指令缓存条件下,DSP的运算速度是MPU运算速度的4倍以上。

1.2数字信号处理器的发展历史和应用

1.2.1数字信号处理器的发展历史

世界上第一个单片DSP芯片是1978年AMI公司发布的S2811。1979年,美国Intel公司发布的商用可编程器件2920是DSP芯片发展史中的一个里程碑。1980年,日本NEC公司推出的μPD7720是第一个具有乘法器的商用DSP芯片。1.2.2数字信号处理器的应用

随着DSP性能的迅速提高和成本的大幅度下降,DSP的应用范围不断扩大,其已成为当前产量和销售量增长最快的电子产品之一。DSP应用几乎遍及整个电子领域,常见的典型应用领域包括:

1)通用数字信号处理技术

通用数字信号处理技术是数字信号处理中最常使用的,包括数字滤波、卷积、相关、FFT、希尔伯特变换、自适应滤波、窗函数产生和波形发生等。

2)通信技术

数字信号处理器在通信技术中应用广泛,如应用于高速调制解调器、编/译码器、自适应均衡器、程控交换机、蜂窝移动电话、数字基站等设备以及电视会议、保密通信、卫星通信等技术领域。随着互联网络的迅猛发展,DSP又在网络管理/服务、信息转发、IP电话等新领域扮演着重要角色,而软件无线电的提出和发展则进一步增强了DSP在无线通信领域的作用。

3)语音处理

语音处理是通信领域中最活跃的技术之一。数字信号处理器在语音识别、语音合成、矢量编码、语音信箱中有着广阔的应用。

4)图形和图像处理

图形和图像处理是数字信号处理器的重要应用领域之一,在三维图像变换、模式识别、图像增强、动画处理、图形显示加速、电子出版、电子地图等方面都有其用武之地。

5)自动控制

专用的数字信号处理器可以用于磁盘、光盘和打印机的伺服控制及发动机控制、电机驱动等技术领域。

6)仪器仪表

在测量数据谱分析、自动监测及分析、暂态分析、勘探、模拟试验等仪器仪表中,数字信号处理器可以作为嵌入式处理器,提供更强的处理能力,提升仪器的性能。

7)医用电子仪器

在医用电子仪器如助听器、CT扫描、超声波、心脑电图、核磁共振、医疗监护等领域,数字信号处理器也发挥着越来越大的作用。

8)军事与尖端科技

数字信号处理器在雷达和声纳信号处理、雷达成像、自适应波束合成、阵列天线信号处理、导弹制导、火控系统、战场C3I系统、导航、全球定位GPS、目标搜索跟踪、尖端武器试验、航空航天试验、宇宙飞船、侦察卫星中有着广泛的应用。

9)计算机与工作站

数字信号处理器在阵列处理机、计算加速卡、图形加速卡、多媒体计算机中也得到了应用。

10)消费电子

在消费电子设备中,数字信号处理器作为嵌入式处理器得到了广泛的应用,如数字电视、高清晰度电视、图像/声音压缩解压器、VCD/DVD/CD播放机、电子玩具、游戏机、数字留言/应答机、汽车电子装置、音响合成、住宅电子安全系统和家电电脑控制装置。

1.3ADI公司的DSP系列简介

1.3.1Blackfin系列定点处理器

Blackfin系列定点处理器是高性能和低成本的嵌入式处理器,它针对嵌入式音频、视频和通信应用的计算和功耗要求设计,是一种新型16/32位嵌入式处理器。Blackfin处理器基于由ADI和Intel公司联合开发的微信号架构(MSA),将一个32位RISC型指令集和双

16位乘法累加(MAC)信号处理功能与通用型微控制器所具有的易用性组合在了一起。这种处理特征的组合使得Blackfin处理器能够在信号处理和控制处理应用中发挥上佳的作用,极大地简化了硬件和软件设计过程。

Blackfin系列处理器目前的最高内核时钟频率达到756MHz,提供了高达1512MMACS的运算能力,其相应的功耗低于0.15mW/MMAC(0.8V电源)。这类DSP综合了高性能和低功耗的特点,并且具有丰富的接口资源,因此非常适合于嵌入式应用的场合,如无线宽带网络、移动通信、音频和视频处理、工业控制、车载设备、消费电子设备等。Blackfin系列处理器具有以下基本特点:

1)高性能处理器内核

Blackfin处理器内核采用了一个10级RISCMCU/DSP流水线,一个专为实现最佳代码密度而设计的混合16/32位指令集。Blackfin处理器支持SIMD(单指令多数据)操作,并提供了加速视频和图像处理的指令。该架构很适合于信号处理/分析能力,还可在单内核器件或双内核器件上提供高效RISCMCU控制任务执行能力。

2)高带宽DMA能力

所有的Blackfin处理器均具有多个独立的DMA控制器,这些控制器支持自动数据传输,而所需的处理器内核开销极少。DMA传输可出现于内部存储器和诸多具有DMA功能的外设之间,也有可能出现于外设和与外部存储器接口相连的外部器件(包括SDRAM控制器和异步存储器控制器)之间。

3)视频指令

除了具有对8位数据以及许多像素处理算法所常用的字长的支持之外,Blackfin处理器还包括专为增强视频处理应用中的性能而定义的指令。比如,离散余弦变换(DCT)通过一个IEEE1180舍入操作得到支持,而“SUMABSOLUTEDIFFERENCE”指令则支持在诸如MPEG2、MPEG4和JPEG等视频压缩算法中所使用的运动估计算法。

4)高效控制处理

Blackfin处理器提供了各种在RISC控制处理器中才具有的特性。这些特性包括:功能强大且灵活的分层存储器架构、出众的代码密度以及各种外设接口,包括10/100以太网MAC、UART、SPI、CAN控制器、支持PWM的定时器、看门狗定时器、实时时钟和一个无缝同步和异步存储器控制器。所有这些特点为设计师提供了巨大的设计灵活性,并最大限度地降低了最终系统的成本。

5)分层存储器

Blackfin处理器存储器架构在器件实现中提供了L1和L2两级存储模块。L1存储器直接与处理器内核相连,以全系统时钟频率运行并为实时算法程序段提供了最大的系统性能。L2存储器是一种大容量存储模块,其性能虽略有下降,但运行速度仍然高于片外存储器。

6)易用性

如今,在许多过去需要同时采用一个高性能信号处理器和一个单独的高效控制处理器的应用中,只需采用一个Blackfin处理器就足够了。这种好处极大地缩减了开发时间和成本,并最终加快了产品的开发进程。

7)丰富的内嵌接口资源

Blackfin处理器提供了丰富的内嵌接口资源,包括各类串行接口如SPI、SPORTS、UART、I2S、CAN、USB等,并行接口如PFX、GPIO等,存储器接口如SDRAM、SRAM、FLASH等,数字音频接口,以太网接口等接口资源。

8)电源管理功能

Blackfin处理器为了减小功耗,提供了动态电源管理功能。它可以通过设置内核时钟频率工作在全速模式或者正常模式,还可以工作在休眠模式、深度休眠模式、冬眠模式、节能模式等工作模式。1.3.2SHARC系列DSP的基本特点

SHARC系列是采用超级哈佛结构(SuperHarvardArchitecture,SHARC)的32位浮点DSP。超级哈佛结构是指处理器内部拥有独立的一套程序总线、两套数据总线和一套IO总线。SHRAC系列的内核中设置了专门的算术逻辑单元(ALU)、乘法器和桶形移位寄存器,构成其基本处理模块;设置了专门的数据/程序地址发生器和程序序列控制器,进行程序和数据地址的计算和产生。为了适应实时处理的要求,其内部集成了大容量存储器和专用接口,可以简化系统设计和降低研发成本。

SHARC系列DSP的共同技术特征包括:支持IEEE32/40位浮点格式数的运算(加、乘和乘累加),具有32位定点乘法器和80位累加器,所有的运算都是单周期的,硬件设计支持循环寻指方式,支持6层循环嵌套,采用代数化汇编编程语言,提供了位操作、除法和开方指令。SHARC全系列在汇编语言级别是兼容的,它们有公共的指令集,可以在各种处理器之间共享。

SHARC系列DSP中的音频处理系列,提供了丰富的专业的数字音频接口,其片内的掩膜ROM包含了多声道的音频解码器以及流水处理算法,支持多种音频数据处理应用。SHARC系列DSP提供的音频接口包括数字音频接口(DigitalAudioInterface,DAI)、音频解码器(AudioDecoder)、S/PDIP兼容的音频收发器、采样速率转换(SampleRateConvert,SRC)等。这些音频接口通过其信号路由分配单元(SignalRoutingUnit,SRU)由用户指定到可编程的IO引脚,并且支持多种音频传输协议,可以简化硬件设计,缩短产品开发周期,具有广泛的应用前景。除了专门的音频数据接口外,SHARC系列DSP还提供了常用的串行接口、并行接口以及高速链路口(LINK)。其中串行接口包括同步串行口(SPORT)、串行设备接口(SPI)、异步串行接口(UART)、2线串行接口(TWI)等,它们可以方便地与各种串行器件互连。其数字并行接口(DPI)中包含了通用输入输出(GPIO)功能和复用功能,高速LINK口可以实现处理器之间的高速数据传输。

SHARC系列支持多种DMA传输方式,包括内部存储器与外部存储器之间、存储器与各种接口之间的数据传送。它内部的DMA控制器可以与内核同时工作,大大节省了内核的运算时间,提高了运行效率。

SHARC系列DSP提供了极高的I/O数据吞吐率、功能优异的内核和大容量内部存储器。它目前主要的应用方向包括家庭和汽车音响、医用、仪器仪表、测试仪器等领域,为这些应用提供浮点处理的低成本解决方案。

目前SHARC系列DSP有4代产品。第一代产品为ADSP—2106X系列,采用单内核(包括ALU、乘法器、移位器和寄存器组)和单指令单数据(SISD)结构,具有66MHz/198MFLOPS的运算能力,可以完成32位定点或者32/40位浮点计算,其片内集成了大容量的高速存储器。第一代产品包括ADSP—21060/061/062/065L等几款芯片,具有6个8位高速链路口,可以十分方便地构成矩阵式并行多处理器系统,可以适应各种大运算量应用。

SHARC系列的第二代产品为ADSP—2116X系列,采用双处理模块(即两套ALU、乘法器、移位器和寄存器组)和单指令多数据(SIMD)结构,具有100MHz/600MFLOPS的运算能力,提高了其处理能力和运算性能,其片内集成了大容量的存储器,同时还提供了丰富的外部接口。

SHARC系列的第三代产品为ADSP—2126X和ADSP—2136X系列,仍然采用双运算模块和单指令多数据(SIMD)结构,具有高达400MHz/2400MFLOPS的运算能力,保持了前两代的特点,提高了其处理能力。为了扩展其用途,片内集成了各种接口,包括多通道音频解码器、S/PDIF收发器、异步采样速率转换、PWM通道、代码加密等专用接口资源,可以适应大多数音频信号处理应用。为了降低成本和减小引脚数目,第三代产品的外部地址和数据总线引脚采用复用方式,并且其大部分产品的引脚是兼容的。

SHARC系列的第四代产品为ADSP—2146X系列,仍然采用双处理模块和单指令多数据(SIMD)结构,具有高达450MHz/2700MFLOPS的运算能力,并且附加了专门的硬件FIR滤波器加速逻辑,内部RAM最高达5Mb,提高了其处理能力。其片内集成了各种接口,包括串行接口、SPI接口、多通道音频解码器、S/PDIF收发器、多通道异步采样速率转换、代码加密等专用接口资源,可以适应大多数音频信号处理应用。它们也具有2个8位高速链路口,也可以十分方便地构成并行多处理器系统,以适应各种大运算量的应用。1.3.3TigerSHARC系列DSP的特点

1)指令并行性和SIMD操作

作为一款静态超标量DSP,TS系列处理器内核在单个指令行中能够同时执行1~4条32位的指令码。除少数情况外,无论一个指令行包含1条、2条、3条还是4条32位指令,其执行都将以一个周期完成。

TS系列处理器还通过并行使用两个运算模块以及SIMD专用计算而拥有了对单指令、多数据SIMD运算提供支持的能力。编程人员可以命令两个运算模块用相同的数据(广播分发)或不同的数据(合并分发)来操作。此外,每个运算模块还能够并行执行4项16位计算或8项8位SIMD计算。

2)独立和并行运算模块

TS系列处理器具有两个运算模块,这两个模块可以独立操作、并行操作,也可以作为一个SIMD引擎来操作。DSP在每个运算模块、每个周期中能够发出多达两条计算指令,用于指示ALU、乘法器或移位器执行单独而同时的操作。每个运算模块包含4个计算单元、一个ALU、一个乘法器、一个64位移位器、一个CLU(仅ADSP—TS201S有)和一个32位寄存器文件。该32位字、多端口寄存器文件用来在计算单元和数据总线之间传输数据并存储中间结果。指令能够对寄存器文件中的寄存器进行单独存取(字对齐)、两个一组的存取(双字对齐)或四个一组的存取(四字对齐)。ALU以定点和浮点格式来执行一组标准的算术运算,并同时执行逻辑运算。乘法器执行定点和浮点的乘法运算以及定点的乘法-累加运算。64位移位器执行逻辑和算术移位、位和位流处理以及位域存放和提取。

3)整数ALU

TS系列处理器具有两个整数ALU(IALU),它们提供强大的地址产生能力,并执行各种通用的整数运算。每个IALU具有一个多端口32字寄存器文件。作为地址生成器,这些IALU可执行直接或间接(提前和滞后修改)寻址。IALU可以执行模运算和位反序运算,且未对用于数据缓冲器布局的存储器地址加以约束。每个IALU都可指定从存储器进行单、双或四字存取。

TS系列处理器IALU支持循环寻址操作的循环缓冲器,循环寻址方式为数字信号处理中经常出现的如滤波、相关、卷积、FFT等提供了高效的编程手段。每个IALU提供了用于4个循环缓冲器的寄存器,因此在应用中总共能够设立8个循环缓冲器。IALU能够自动处理地址指针回绕,因而减少了开销,提高了性能并简化了编程过程。

4)程序控制器

TS系列处理器的程序控制器通过向存储器提供地址的方法来管理程序结构和程序流程。包含于程序控制器之内的指令对齐缓冲器(IAB)存储了多达5个等待执行的读取指令行。该程序控制器从IAB中抽取一个指令行,并将其分配至适当的内核元件以便执行。程序控制器的其他功能包括:根据诸如JUMP、CALL、RTI和RTS等指令来决定流程、递减循环计数器、处理硬件中断,并采用分支预测和128入口的分支目标缓冲器(BTB)来缩短分支延时,以有效实现条件和无条件跳转指令的有效执行。

5) DMA控制器

具有14个DMA通道的TS处理器片上DMA控制器可在无需处理器内核干预的情况下实现零开销数据传输。DMA控制器能单独工作,且不为DSP内核所察觉,从而使得DMA操作能够在内核继续执行程序指令的同时正常进行。

6)链路口

ADSP—TS20XS具有4个全双工链路口,采用低

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论