2024飞桨框架技术创新之路_第1页
2024飞桨框架技术创新之路_第2页
2024飞桨框架技术创新之路_第3页
2024飞桨框架技术创新之路_第4页
2024飞桨框架技术创新之路_第5页
已阅读5页,还剩38页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

应用 New

深度学习框架核心功能避免了解硬件底层开发接口,如CudaCcuDNNcuBlas隔离硬件差异,如CudaConeAPIXTDKBangC可扩展,如硬件后端、算子、Pass、Dialect模型和框架代码规模对比Llama32Tensorflow420298307

自动微分功能深度学习框架发展历程PaddlePaddle

Theano

Caffe

TensorFlow

PyTorchv0.1

TensorFlow+EagerPyTorch

飞桨CINN

PyTorch

+Graph

DeepBelief

大模型技术发展趋势 Mamba:Linear-TimeSequenceModelingSelectiveStateSwitchTransformers:ScalingtoSelectiveState

人工智能引发科学发现和模式创新变革 2021年DeepMind公司提出AlphaFold2模型

2022年英伟达&西门子基于AI和物理的风电场数字孪生4,000倍

大模型时代的深度学习框架AIforScience

飞桨框架架构图PHI神经网络编译器TensorPaddleSSAGraphProgram寒武纪昇腾海光昆仑英伟达各模块之间的关系(含自动并行飞桨新一代框架动转 拆动态 静态 框架基础算 编译defy=conv2d(x,z=batch_norm(y,…)returnMax(x,

新IR自动微

自动并行组合算子 静态图和动态图开发模式(编译期(编译期 动静转换技术动静转换技术飞桨动转静P飞桨动转静Python语法支持率94%,领先PyTorch的59%飞桨模型整图导出成功率95%,领先PyTorch的62%通过比较官网文档说明的Python语法34PaddleSOT动静转换

解决深度学习模型下Python语言与框架IR之间差异性,实现转静训练100%的成功率,极致化用户体验

中间表示IR静态 中间表 运行

IR中间表示IR应用示例

DeclarativeRewriteRule机制(即DRR)三段式Pass开发范式,让开发者更聚焦于Pass逻辑的处理,无需关心底层IRSourceSourcePass样例:移除冗余连续的CastDeclarativeRewriteRule机制(即DRR)DRR应用广泛,在算子Fuse融合类Pass开发上,简洁易用,有效降低60FlashAttenFlashAttenConv2d+Add+Act算子融合高扩展中间表示PIR高扩展性

PIR 功能完善的Pass功能完善的Pass多层级的多层级的OperatorKernelCINNControlFlowShape提升 提升 下降 下降 持通过使用PIR,Pass开发成本降低60%,推理性能提升超过提前静态选Kernel常量折叠PassInplacePass大模型对算力的挑战 带宽瓶计算量vs摩尔定 参数量vs显 算力vs带GPUTensor31210002250多多 面临问题 解决思 技术方 BatchSize=1都跑不起 进一步提高Batch飞桨分布式技术架构演进路线手动并行代码示例(TP&PP)

修改TP修改PP分布式标记(DistAttr)sum,动静统一自动并行DataDataDataDataData

动静统一自动并行Llama2以Llama模型为例,无需考虑通信逻辑,核心代码可减少50%,Llama232*A100

Llama232*A100同类开源产品飞桨手动并行飞桨自动并行动静统一自动并行架构高阶自动微分2D (

62)(

62 ∇w

6x2+

6x2+

w=Dx∈[0, y∈[0,在x=0和x=�两条边上,有挠度�和力矩��为在x=0和x=�两条边上,有挠度�和力矩��为 qx=−D6x(6x2

6y2 qy=−D6y(6x2

6y2 Mx=−D(6x2+v6y2 My=−D(6y2+v6x2

=D(1−v)组合算子机制PythonPythonC++前向算子组合规 基础算子微分规基础算子体 注动态图基础算 静态图基础算动态图:拆解N+1面向组合算子模型精度和显存优化耗 耗 单位微 算子组合手动融合编译深度学习编译器

LLVMIR

CINNDialect的Fusion

动态shape

(Operator(Operator

HostLaunchCUDAKernel(CINN&Shape

CUDAC

LLVMShapeDialect解读飞桨对框架内150+基础算子和典型算子新增支持了动态ShapeIneSymbocShap可动态地随计算图Pass的应用,自适应且Lazy动态Shape下Kernel生成在CodeGen阶段,自动关联动态Shape符号,控制流分支自适应基于飞桨高阶自动微分及编译优化技术,NVIDAIModulu上44个飞桨为后端的案例科学计算模型优化构建飞桨AIforScience基于飞桨高阶自动微分及编译优化技术,NVIDAIModulu上44个飞桨为后端的案例科学计算模型优化构建飞桨AIforSciencePyTorchPyTorchPaddlePaddleNVIDIANVIDIAoPaddlePaddleVSPyTorchA100GPU硬件适配方案计算 计算

深度学习框架(飞桨等

PHI

TorchInductor

TritonIR

如cuBLAS,

码如CudaC高级编程语言编译器如

码如CudaC

LLVMIR

LLVMIRLLVM

芯片软件栈提供汇编编程语言及优化接口,如NVID

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论