版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能素养导论暨南大学第5章人工智能核心技术基础设施我高考方面目录01相关概念02算力03存储04网络05框架与平台章节导图5.1相关概念什么是人工智能基础设施?人工智能基础设施是指为支持人工智能应用和服务提供所需硬件、软件、网络、数据等资源的综合系统。硬件
软件网络数据5.1.1人工智能核心驱动力人工智能的三大核心驱动力算力算法算力AI学习的原材料。包含文本、图像及传感器数据,提供训练模型所需的模式和知识。底层硬件支撑。GPU与AI加速器提供的超大规模计算能力,决定了进化的速度。神经网络的数学架构。定义了信息处理的路径,将原始数据转化为有意义的洞察。5.1.1人工智能核心驱动力驱动力一:数据(AI的燃料)人类通过观察世界积累经验,人工智能则通过分析数据学习规律。当前主流AI技术的本质是“从数据中找规律”。数据是模型的燃料,高质量的数据能够帮助AI模型更好地学习和理解世界。5.1.1人工智能核心驱动力驱动力二:算力(AI的体力)算力指计算机处理数据、运行算法的速度和能力,相当于AI的“体力”。
没有足够的算力,再优质的数据和算法也无法发挥作用。
2024年显卡算力排行5.1.1人工智能核心驱动力驱动力三:算法(AI的食谱)如果数据是原料,算法就是加工原料的“食谱”。
它定义了AI如何处理数据、学习规律、做出决策。
不同算法适用于不同问题,如分类问题中决策树易于理解,推荐系统中协同过滤更有效。
经典ai算法5.1.1人工智能核心驱动力数据、算力、算法的协同进化人工智能的发展不仅是技术的竞赛,更是数据、算力、算法的协同进化。海量高质量+隐私保护高性能高效+公平+可解释高投入绿色+共享数据算法算力5.1.1人工智能核心驱动力以GPT-4为例数据Data13万亿训练Token总量包含多个Epoch的海量文本数据,构筑了模型庞大的世界知识库。~60%CommonCrawl占比主要数据来源为经过严格过滤的互联网网页爬取数据,辅以书籍、论文和代码。算力Compute2.15×10²⁵总训练算力(FLOPS)史无前例的算力投入,预训练硬件成本估计高达6300万美元。25,000张NVIDIAA100GPU庞大的计算集群,耗时约90-100天完成模型的预训练过程。算法Algorithm1.8万亿总参数量(Parameters)采用混合专家(MoE)架构,包含16个专家网络,每个专家约111B参数。MoE+RLHF核心算法创新每次推理仅激活2个专家(~280B参数),结合人类反馈强化学习提升对齐度。5.1.1人工智能核心驱动力AI基础设施与传统IT的区别AI基础设施是支撑AI技术创新和产业落地的核心底座。
其本质在于对传统信息基础设施的深度升级和专用化。
传统IT专为通用计算、存储和网络任务而设计,侧重于广泛的兼容性。
AI基础设施专为处理训练和推理工作负载的高吞吐量、低延迟需求而构建。5.2算力算力(CP)的定义算力定义为计算机系统在单位时间内可完成的浮点运算次数。
计量单位是每秒浮点运算次数FLOPS。
算力是驱动人工智能、大数据分析、云计算等前沿技术发展的核心动力。5.2.1算力的概念算力在AI中的应用环节人工智能的算力主要应用于大模型的训练及推理。
训练:大模型的学习方式,例如让AI知道图像是什么及其特点。
推理:大模型的输出过程,例如按照要求识别或者生成图像。训练(Training)推理(Inference)5.2.1算力的概念算力的核心性能指标算力计算性能指标一般使用运算速度表示。
包括百万指令数每秒(MIPS)、浮点操作数每秒(FLOPS)等。
例如一台超级计算机的算力是1EFLOPS。5.2.1算力的概念常见算力指标详览表MIPS:每秒钟执行的百万指令数。
FLOPS:每秒浮点运算次数。
OPS:每秒运算次数。
Hash/s:每秒哈希运算次数。5.2.2算力硬件算力硬件的四大流派CPU传统中央处理器GPU并行加速计算的图形处理器FPGA半定制化的现场可编程门阵列ASIC全定制化的特定应用集成电路目前常用的算力芯片旨在加速硬件计算能力。5.2.2算力硬件中央处理器(CPU)在AI中的角色CPU在AI系统中负责数据预处理、任务调度和模型控制。
相比普通CPU,AI专用CPU核心更多、缓存更大、内存带宽更高。
CPU能够与GPU/TPU协同,加速深度学习训练与推理。CPU架构控制单元(ControlUnit)算术逻辑单元(ALU)缓存(Cache)5.2.2算力硬件CPU关键性能指标解析核心数量:核心越多并发处理能力越强(常见4-24核心)。
主频:频率越高单核性能越强(一般2.0~5.8GHz)。
缓存:缓存越大数据访问越快。
内存支持:影响整体数据传输效率(如支持DDR5)。5.2.2算力硬件主流AI服务器CPU参数对比这些CPU拥有极高的核心数(64-96)和巨大缓存,专为数据中心和超算设计。表5.2主流CPU型号与参数对比5.2.2算力硬件国内外头部公司CPU(代表产品)应用场景广泛应用于个人电脑与笔记本、企业服务器与数据中心、智能手机SoC以及各类嵌入式控制系统。作为所有通用计算的核心,负责逻辑控制与系统调度。服务器CPU市场份额(2024)•桌面/笔记本:Intel~55%,AMD~45%•移动SoC:ARM架构主导•国产替代:鲲鹏/龙芯等合计约5-8%代表性型号与参数公司代表型号年份核心参数IntelXeon6(至强)2024最高128核,DDR5,PCIe5.0AMDEPYC9654202296核192线程,5nm,360WAppleM4Pro202414核CPU+20核GPU,3nm华为海思鲲鹏920201964核ARMv8.2,7nm,2.6GHz龙芯中科龙芯3A600020234核,LoongArch架构,12nm海光信息海光7285202232核,x86兼容,7nm5.2.2算力硬件图形处理器(GPU)简介GPU是一种拥有大量并行计算核心的处理器。
专为高速处理图形渲染和海量数据计算任务设计。
它能够同时执行成千上万个简单操作,是目前AI训练和推理的主流硬件。5.2.2算力硬件GPU的关键参数显存容量:决定能直接处理和存储的数据量。
显存带宽:决定数据吞吐效率。
浮点运算能力(FLOPS):数值越高,计算能力越强。
专用加速单元:如Tensor核心,大幅提升特定计算场景效率。5.2.2算力硬件GPU内部架构探秘GPU包含指令单元、共享内存、多处理器等组件。
其设计使得众多处理核心能够并行执行计算指令。5.2.2算力硬件CUDA并行计算生态CUDA是NVIDIA推出的并行计算平台和编程模型。
使开发者可以用高级语言(如C、C++)为GPU编写并行程序。
它让原本由CPU承担的密集型任务在GPU上批量并行处理。5.2.2算力硬件国内外头部公司GPU(代表产品)应用场景(APPLICATIONSCENARIOS)核心应用于游戏渲染与专业图形、大模型AI训练与推理、科学仿真计算以及自动驾驶感知。AI训练GPU市场份额(2024)•游戏离散GPU:NVIDIA~88%,AMD~12%•国内AI芯片:华为昇腾~60%,寒武纪~15%代表性型号与参数公司代表型号年份核心参数NVIDIAH100SXM5202280GBHBM3,989TFLOPS(FP16),700WNVIDIAB200(Blackwell)2024192GBHBM3e,FP4最高约20PFLOPS,1000WAMDInstinctMI300X2023192GBHBM3,1307TFLOPS(FP16),750W华为海思昇腾910B202364GBHBM,约320TFLOPS(FP16),7nm级工艺寒武纪思元MLU3702022AI训练/推理加速器,最高64GB显存壁仞科技BR100202277GBHBM2e,1000+TOPS,550W5.2.2算力硬件CPU、GPU与内存的协同处理流程数据在主存储器、CPU与GPU内存之间交互。CPU发出指示处理数据复制到GPU,GPU多核心并行执行后再将结果返回比喻:CPU像资深教授(处理复杂独立问题),GPU像小学生群体(同时完成大量简单任务)。5.2.2算力硬件现场可编程门阵列(FPGA)FPGA是一种可编程芯片,用户可根据需求定制其功能。
特点是可以通过编程反复改变其内部硬件结构。
它像一块“可重塑的积木”,常用于低延迟、低功耗的AI场景。5.2.2算力硬件FPGA与单片机(MCU)的区别可变积木固定模具FPGAASIC可编程硬件芯片,直接定义物理电路逻辑,实现高度并行计算,适合低延迟任务。固定架构的软件设备,通过软件编程控制按顺序执行,适合通用控制类任务。5.2.2算力硬件国内外头部公司FPGA(代表产品)应用场景广泛应用于5G通信基站、工业控制与机器视觉、航空航天与军工、数据中心网络加速以及芯片原型验证。全球FPGA市场份额(2024)•市场格局:AMD与Intel双寡头垄断•国内FPGA:安路科技、复旦微电、紫光国微等合计约10-15%,国产替代加速推进代表性型号与参数公司代表型号年份核心参数AMD(Xilinx)VersalAICore20217nm,集成AIEngine自适应计算平台AMD(Xilinx)VirtexUltraScale+201916nm,最高900万逻辑单元Intel(Altera)Agilex92023Intel7工艺,集成HBM2eLatticeECP52015低功耗FPGA,工业与边缘计算安路科技ELF2系列2022国产FPGA,22nm紫光国微LOGOS2系列2022国产FPGA,高可靠应用5.2.2算力硬件特定应用集成电路(ASIC)ASIC是专为人工智能应用设计的定制集成电路。
具有高性能、低功耗、定制化、低成本等特点。
去除了冗余设计,在AI边缘推理、深度学习训练等领域表现卓越。5.2.2算力硬件常见的ASIC架构分类(上)TPU(张量处理单元):Google开发,专为大规模深度学习的张量计算优化。
NPU(神经网络处理单元):针对神经网络算法进行电路级优化,常见于终端设备。
DPU(数据处理单元):用于加速数据中心中的网络、存储等数据密集型任务。5.2.2算力硬件常见的ASIC架构分类(下)VPU(视觉处理单元):针对视频、图像识别优化,应用于自动驾驶、AR/VR。
IPU(智能处理单元):针对大规模机器学习和图神经网络任务优化。
这些架构本质上是面向AI不同需求进行硬件电路的专门定制。5.2.2算力硬件国内外头部公司ASIC(代表产品)应用场景广泛应用于云端AI推理加速(如TPU)、自动驾驶感知芯片、加密货币挖矿、数据中心网络交换以及多媒体编解码SoC。自动驾驶芯片市场份额(2024)•矿机ASIC:比特大陆~65%,MicroBT~25%•网络交换ASIC:Broadcom~80%,Marvell~12%代表性型号与参数公司代表型号年份核心参数GoogleTPUv5e2023393TFLOPS,7nm,云端推理TeslaFSDD12021362TOPS,7nm,自动驾驶BroadcomTomahawk5202251.2Tbps,5nm,网络交换BitmainBH/s,矿机算力百度昆仑昆仑芯22022256TOPS,搜索/自动驾驶瑞芯微RK358820226TOPSNPU,8K编解码5.2.3算力的分类算力的三大层级分类通算:执行日常办公、网页等基础任务,依赖CPU。
智算:利用人工智能技术进行计算(如大模型训练),依赖GPU/NPU等。
超算:解决复杂的科学工程问题(如气象模拟),依赖异构众核芯片。5.2.3算力的分类AI算力的场景双雄训练算力:处理海量数据,运算精度要求高,运行时间长。
推理算力:在推理阶段工作,更注重延迟和能效,常部署在边缘端。5.2.4算力平台云计算与边缘计算的互补云计算:依赖远程数据中心,为大模型训练提供弹性强、算力足的资源,但存在网络延迟。
边缘计算:将处理能力下沉到靠近设备端,减少延迟,适合对实时性要求极高的应用。5.3存储存储:AI智能化的底座数据是智能化的核心驱动力,存储系统承担着存放海量训练数据与模型文件的任务。
它支持高吞吐离线分析与低延迟在线查询。
存储效率直接关系到AI应用的性能与稳定性。5.3.1主内存主内存(RAM)的高速使命在AI系统中,RAM承担大规模训练数据、模型参数和中间计算结果的高速缓存。
AI系统的主内存容量更大、带宽更高,保证数据流畅无阻。
分为多级结构:Cache(SRAM)和主内存(DRAM)。5.3.1主内存RAM核心指标:容量与带宽存储容量:制约能同时加载多少训练样本。大模型训练节点的内存常以1TB起步。
带宽:内存每秒可实现的数据传输总量。AI任务高度依赖带宽,HBM能提供上百GB/s的带宽。5.3.1主内存RAM核心指标:延迟与速度访问延迟:内存响应读写操作的时间。低延迟有助于减少AI推理的等待时间。
读写速度:RAM的核心优势在于比硬盘快2-3个数量级。高读写速度能大幅提升训练与推理效率。5.3.1主内存RAM的物理部署维度安装在主板插槽中,受限于系统寻址能力。多个节点组合,总内存规模可达数百TB。如GPU上的HBM2e,提供极大带宽,专用于AI模型参数的高速存取。单机环境集群/超算环境专用内存5.3.2本地存储本地存储的三驾马车高容量低成本,适合冷数据存储。无机械部件,延迟低,适合热数据和模型权重加载。带宽更高,非常适合AI中的高并发数据加载。HDD(机械硬盘)SSD(固态硬盘)NVMeSSD5.3.2本地存储本地存储在AI任务中的协同大模型需短时间读取几十GB权重,SSD可降低时延。
NVMe在并行训练的高频写入(如CheckPoint保存)中效率极高。
合理组合不同类型存储资源,是提升AI效率的基础。5.3.2本地存储存储性能全面PK5.3.2本地存储持久内存vs本地存储持久内存:位于内存层级,处理器直接访问,延迟极低,适合快速访问并需持久化的数据。
本地存储:典型块存储,通过文件系统访问,强调大容量高吞吐,适合长期保存。
共同点:断电后数据不丢失。IntelOptanePersistentMemory200SeriesKioxiaCD9PNVMeSSDTopAngled25.3.3分布式存储分布式存储系统:破解海量难题分布式存储将数据分布在多个机器或云节点上。
满足AI集群中对“大容量、高并发、高可用、高效率”的需求。
核心组件包含客户端、元数据服务器与存储节点。5.3.3分布式存储分布式对象存储架构一览客户通过元数据服务器获取访问权限和位置。
客户直接向底层对象存储设备进行数据读取/写入。5.3.3分布式存储分布式存储在AI的关键价值支撑多GPU/多节点训练共享数据,避免重复拷贝。
通过多级缓存机制平衡性能与成本,实现冷热数据分级。
提供多副本冗余保证高可用性,保障长时间训练不中断。5.4网络网络在AI时代的使命网络是连接数据源、计算资源与智能终端的“神经通路”。
高速、稳定的网络连接确保数据在各节点间的快速传输。
为分布式计算和协同创新提供支持。5.4.1数据中心通信网络数据中心通信网:突破瓶颈大模型(如GPT)需要海量数据快速在多个节点间传递。
数据中心网络以超高带宽、微秒级极低延迟为核心特征。
对于AI承载业务,强烈建议引入RDMA技术以实现极低延迟和高吞吐。5.4.1数据中心通信网络主流RDMA方案:IB与RoCEIB(InfiniBand):专为RDMA设计,硬件专用,性能卓越但生态较为封闭。
RoCE:通过以太网实现RDMA,降低CPU利用率与成本,生态开放,分v1和v2版本。对比维度InfiniBand(IB)RoCE(以太网)性能极高高延迟极低低成本极高中等运维难度简单(封闭生态)复杂(需要调优)5.4.1数据中心通信网络主流RDMA方案:iWARPiWARP基于TCP使用RDMA技术。
大型组网时TCP连接仍占用大量内存,性能不及IB和RoCE,目前较少使用。5.4.2移动通信网络移动通信网络:向6G演进6G预计将比5G指标提升10至100倍。
致力于融合物理、生物与数字世界,重塑交互方式。
具备Tbps级速率和亚毫秒级低时延。5.4.2移动通信网络6G:空天地海一体化网络6G将提供真正的全球立体无缝覆盖。
包含天基网络(卫星)、空基网络、地基网络。
人工智能将深度融入6G各层,实现智能调度与感知。5.4.3边缘网络边缘网络与物联网(IoT)边缘网络将计算任务转移至边缘设备就近处理数据。
物联网通过边缘设备采集环境数据并与云端AI结合。
此模式降低了延迟、减轻了中心枢纽负担,极大改善用户体验。5.4.3边缘网络边缘计算vs云计算云计算:集中资源在远程数据中心,按需弹性扩展。
边缘计算:将计算和存储推向边缘设备,强调实时性和本地化。5.5框架与平台AI框架技术概览AI框架是一套支持开发AI应用的库、工具和规范。
它提供标准化方法,对下调用硬件资源,对上支撑算法模型搭建。
它是整个人工智能技术体系的核心。5.5.1AI框架技术AI框架的核心技术体系体系包含三大层:基础层、组件层、生态层。
基础层提供算力与底层支持;组件层聚焦工程化;生态层集成行业应用。5.5.1AI框架技术AI数据处理框架链路AI数据处理框架覆盖数据生命周期的全链路系统化架构。
核心目标是高效、可靠地处理海量数据,并为AI模型训练和业务应用提供高质量的数据支持。5.5.1AI框架技术主流深度学习框架:TensorFlow与PyTorchTensorFlow(Google开发):适合大规模深度网络与工业级生产环境部署。
适用于图像识别、NLP、生成模型等深度学习任务。PyTorch(Meta推出):采用动态计算图,适合学术界快速原型开发,对大语言模型极友好。广泛用于研究和产业落地。5.5.2运维平台MLOps机器学习运维MLOps旨在为构建和运行机器学习模型创建自动化装配线。
它帮助企业自动执行任务并快速、稳定地部署模型。5.6本章小节
02算力是本章最核心且体量最大的内容。重点是建立完整的算力硬件知识图谱:从通用CPU到并行GPU,再到可编程FPGA和定制化ASIC(细分为TPU、NPU、DPU、VPU、IPU),需理解每种硬件的适用场景和性能指标(FLOPS、显存带宽、核心数等)。
03存储与网络是支撑AI系统高效运转的底层支柱,也是学习时容易被忽视的重难点。存储方面,需掌握三层级体系:主内存→本地存储→分布式存储。01本章开篇厘清了人工智能的三大核心要素:数据、算法、算力。重点在于理解三者缺一不可、相互制约的协同进化关系——片面追求任一要素都无法实现突破。难点在于把握三要素的演进方向:同时需区分AI基础设施与传统IT基础设施的本质差异。
04本章最后一节聚焦AI工程化落地的软件支撑。重点是AI框架在技术体系中的"承上启下"角色:向下屏蔽硬件差异调用算力,向上为算法工程化提供标准环境。需区分三类框架——深度学习框架、传统机器学习库、数据处理框架。谢谢!1.在人工智能技术体系中,其三个核心要素通常包括数据、算法和算力,但并不包含()这一项,这一点需要明确区分。网络A数据B算法C算力D提交单选题1分单选题1分2.在人工智能系统中,算力扮演着至关重要的角色,它通常被比喻为(),因为算力提供了处理数据、运行算法所需的计算能力,如同人体的力量支撑。大脑A眼睛B体力C心脏D提交单选题1分3.与传统IT基础设施相比,AI基础设施具有许多独特特点,但()并不属于AI基础设施的特点,它更多体现传统IT的特征。以CPU为中心,通用型AGPU/TPU/NPU,专用加速B大数据,多源,实时C分布式,弹性,协作D提交单选题1分4.在人工智能系统中,CPU承担着多种重要任务,但()通常不是CPU的主要职责,这部分工作更多由GPU等加速器完成。数据预处理A大规模矩阵运算B任务调度C部分推理工作D提交单选题1分5.在专用集成电路芯片中,由Google开发并专为大规模深度学习的张量计算(A如矩阵运算)优化的芯片是(),它已成为AI加速的重要代表。TPUANPUBDPUCVPUD提交此题未设置答案,请点击右侧设置按钮单选题1分6.在算力分类中,主要用于大模型训练、自动辅助驾驶实时推理等高强度AI任务的算力类型是(),它依赖于GPU、NPU等专用加速器。通用算力A智能算力B超算算力C以上都不是D提交单选题1分7.现代算力平台通常基于云计算和虚拟化技术构建,具有弹性伸缩、自动化管理等特点,但()并不是其特点,相反,平台支持动态资源分配。基于云计算和虚拟化技术A可根据用户需求动态分配计算资源B只能提供固定的计算资源C提供自动化管理工具D提交单选题1分8.在计算机体系结构中,主内存(B通常由RAM实现)的主要特点是(),即断电后存储的数据会丢失,这与辅助存储器不同。大容量A易失性B
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年缙云县教师招聘考试参考题库及答案解析
- 2026年灵丘县教师招聘笔试模拟试题及答案解析
- 2026山东烟台大学法学院黄海学者岗位 (正高级)招聘4人考试备考试题及答案解析
- 2026陕西通运铁建人力资源服务有限公司招聘(30人)笔试模拟试题及答案解析
- 中国工商银行2027届校园招聘考试备考题库及答案解析
- 2026年福州市劳动就业中心就业辅助员公益性岗位招聘笔试参考题库及答案解析
- 2026年合肥国家实验室某研究室社会用工招聘笔试备考题库及答案解析
- 武汉市中心城区公立中学招聘初中英语教师笔试参考题库及答案解析
- 2026宝鸡老实人商业发展有限公司招聘笔试备考试题及答案解析
- 2026年安徽省国有资本运营控股集团有限公司就业见习招募65人笔试参考题库及答案解析
- 高三化学一轮复习“钠及其化合物”教学设计
- 2026年湖南水利水电职业技术学院单招职业技能考试题库附答案
- 2025-2026 学年七年级上期末语文试卷
- 2026-2027学年浙教版数学九上 第3章 圆的基本性质 单元综合知识梳理卷
- 2026年三力测试考试题库及答案
- 修订一单一库质量手册和程序文件参考文件
- 中考英语-阅读理解之推断题专题讲义
- 公路水运试验检测师《水运结构与地基》考试真题(2026年新版)
- HSK1 标准汉语教程 L2 第二课 谢谢你
- 招聘实用手册
- 2023年北京高考语文答题卡(北京卷)word版可编辑kh
评论
0/150
提交评论