版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
ICS35.240CCSL77团 体 标 准T/ZSA164—2023Artificialintelligenceapplicationinnovation—Technicalspecificationofintelligentcloudcomputinginfrastructure2023-10-20发布 2023-10-21实施中关村标准化协会 发布T/ZSA164T/ZSA164—2023PAGE\*ROMANPAGE\*ROMANII目 次前 言 II范围 3规范性引用文件 3术语和定义 3缩略语 5总体技术架构 5技术要求 6智能云资源层 7基础资源整合 7基础资源服务 8智能云中台层 10部署管理 10训练管理 10推理管理 11数据管理 12算法管理 13模型管理 14开发管理 15运营运维管理 16监控管理 16告警管理 16租户管理 17服务目录管理 17计量计费管理 17配额管理 17安全能力 17智能云资源层安全能力 17智能云中台层安全能力 17前 言本文件按照GB/T1.1—2020《标准化工作导则 第1部分:标准化文件的结构和起草规则》的规定起草。请注意本文件的某些内容可能涉及专利。本文件的发布机构不承担识别专利的责任。本文件由中关村数智人工智能产业联盟提出并归口。本文件起草单位:赛迪检测认证中心有限公司、中关村数智人工智能产业联盟、中国软件评测中心(工业和信息化部软件与集成电路促进中心(北京科(北京(北京T/ZSA164T/ZSA164—2023PAGEPAGE10人工智能应用创新 智能云基础设施技术规范范围(以下简称本文件适用于AI云服务提供商及第三方机构开展业务活动时,为产品及服务的设计、开发、测试、评估、维护及运营等提供参考依据。规范性引用文件(包括所有的修改单适用于本文件。GB18030 信息技术 中文编码字符集GB/T20272—2019 信息安全技术 操作系统安全技术要JR/T0166—2020 云计算技术金融应用规范 技术架构术语和定义GB/T35295—2017界定的以及下列术语和定义适用于本文件。智能云中台 artificialintelligencemiddleendbasedcloudcomputing将人工智能领域的技术组件、框架、工具、平台、环境等的公共能力抽取出来,构建成基于云计算技术的可复用的服务,支撑数据服务或者业务逻辑服务的软件系统。推理 inference推断从已知前提导出结论的推理方法。注1:在人工智能领域中,前提是事实或规则。注2:术语“推理”既指过程也指结果。[来源:GB/T5271.28—2001,28.03.01]数据管理 datamanagement在数据处理系统中,提供对数据的访问,执行或监视数据的存储,以及控制输入输出操作等功能。[来源:GB/T5271.1—2000,01.08.02]框架(用于人工智能) frame(inartificialintelligence)的专用区域内。[来源:GB/T5271.28—2001,28.02.13]数据集 dataset数据记录汇聚的数据形式。注:它可以具有大数据的体量、速度、多样性和易变性特征。数据集的特征表征的是数据本身或静态数据,而数据的特征,当其在网络上传输时或暂时驻留于计算机存储器中以备读出或更新时,表征的是动态数据。[来源:GB/T35295—2017,2.1.46]可用区 availabilityzone在智能云基础设施中,基于空调、电力设施、主机、网络、存储等物理资源的容灾因素划分出来的物理区域。虚拟机 virtualmachine通过各种虚拟化技术,为用户提供的与原有物理服务器相同的操作系统和应用程序运行环境的统称。注:虚拟机通常使用物理服务器的资源,在用户看来它与物理服务器的使用方式完全相同。[来源:JR/T0166—2020,3.22]容器组 pod一个或多个共享存储、网络、命名空间及运行规范的容器组合。访问服务 service一组容器及其外部访问入口。机器学习 machinelearning从数据中自动分析获得规律,并利用规律对未知数据进行预测的方法。通过获取、重组新知识或技能提升功能单元效能的过程。[来源:ISO/IEC2382:2015(en),2123789,有修改]深度学习 deeplearning通过训练具有许多隐层的神经网络创建丰富层次表示的方法。训练神经网络构建含多个(≥1)隐藏层的层次化表达的方法。ISO/IEC23053:2020CD,3.13,有修改]云原生 cloudnative基于分布部署和统一运管的,以容器、微服务等技术为基础建立的一套云技术产品体系。注:云原生具有容器化、模块化、持续交付、弹性分布式等特点。网页集成开发环境 WebIDE隐私保护计算 privacy-preservingcomputation隐私计算[来源:联合国隐私保护计算技术手册.大数据联合国全球工作组,©2019]注:隐私计算是一个技术范畴和集合。可信执行环境、多方安全计算、联邦学习等都属于隐私计算技术。缩略语下列缩略语适用于本文件。AI:人工智能(ArtificialIntelligence)API:应用程序编程接口(ApplicationProgrammingInterface)ARM:微处理器(AdvancedRISCMachine)ASIC:专用集成电路(ApplicationSpecificIntegratedCircuit)CPU:中央处理器(CentralProcessingUnit)CV:计算机视觉(ComputerVision)DHCP:动态主机配置协议(DynamicHostConfigurationProtocol)DNS:域名系统(DomainNameSystem)GPU:图形处理器(GraphicsProcessingUnit)HBA:主机总线适配器(HostBusAdapter)HCA:主机通道适配器(HostChannelAdapter)HDFS:Hadoop分布式文件系统(HadoopDistributedFileSystem)H5:分层数据格式的第5代版本(TheHierarchicalDataFormatVersion5)IaaS:基础设施即服务(InfrastructureasaService)I/O:输入/输出(Input/Output)IP:网际协议(InternetProtocol)JDBC:Java语言连接数据库(JavaDatabaseConnectivity)JSON:JS对象简谱(JavaScriptObjectNotation)MIG:多实例GPU(Multi-InstanceGPU)MIPS:无内部互锁流水级的微处理器(MicroprocessorwithoutInterlockedPipelineStages)NFS:网络文件系统(NetworkFileSystem)NLP:自然语言处理(NaturalLanguageProcessing)ONNX:开放神经网络交换(OpenNeuralNetworkExchange)PKL:一种由Python的Pickle模块创建的文件格式(Pickle)PMML:预测模型标记语言(PredictiveModelMarkupLanguage)SDK:软件开发工具包(SoftwareDevelopmentKit)SDN:软件定义网络(SoftwareDefinedNetwork)USB:通用串行总线(UniversalSerialBus)VPC:虚拟私有云(VirtualPrivateCloud)VPN:虚拟专用网络(VirtualPrivateNetwork)XML:可扩展标记语言(ExtensibleMarkupLanguage)总体技术架构1总体技术架构包括智能云资源和智能云中台两个层次。同时以运营运维管理和安全能力贯穿各个层次。图1 智能云基础设施总体技术架构图智能云资源层由基础资源整合模块、基础资源服务模块组成。该层利用云计算技术,将底层服务基础资源整合模块应包括计算资源池、存储资源池、网络资源池。该模块是实现基础硬件设施与设备池化能力的基础,为云服务提供支撑;基础资源服务模块应包括云主机服务、备份服务、镜像服务、弹性伸缩服务、裸金属服务、VPCIaaS智能云中台层由部署管理模块、训练管理模块、推理管理模块、数据管理模块、算法管理模块、AI部署管理,应包括算力部署管理、AI训练管理,应包括分布式训练、可视化建模、自动学习;推理管理,应包括推理框架、推理部署、任务管理;数据管理,应包括数据采集、数据探索、数据预处理、数据标注、数据集管理、特征工程;算法管理;模型管理,应包括模型定义管理、模型可回溯管理、模型配置项管理、模型分类进退管理、模型校准管理、模型可解释性管理、模型运行条件管理、模型偏差管理、模型全生命周期管理;开发管理,应包括集成式开发环境管理、开发环境资源调度、开发方式管理、开发环境管理、开发配置管理、开发任务管理。运营运维管理包括监控管理、告警管理、租户管理、服务目录管理、计量计费管理、配额管理。运营运维管理面向智能云基础设施各层的服务运营及技术运维的需求,提供技术、管理等方面的支撑。安全能力提供智能云基础设施各层的安全防护与安全加固的技术能力,保障智能云基础设施的安全性。技术要求智能云资源层基础资源整合计算资源池应至少支持两种国产处理器架构;GPU应支持不同国产处理器架构的服务器的统一管理;CPU、内存、I/O应支持物理机和虚拟机的全生命周期管理;应支持单物理服务器上多虚拟机管理与配置;应支持不同虚拟机之间资源逻辑隔离;应支持虚拟机的克隆、快照和备份管理;应支持系统镜像或虚拟机模版的全生命周期管理;应至少支持两种国产操作系统;操作系统应满足:GB18030操作系统基础运行库或开发环境向前兼容,系统版本应支持以增量升级包的方式升级,升级后兼容上一版本所运行的软件与设备;C、C++、Java、Python、Perl操作系统虚拟化要求如下:qemu、libvirt、virt-manager应支持虚拟机的统一管理,每个虚拟机拥有独立的计算能力、存储资源、网络吞吐能力等,且各个虚拟机之间隔离运行;应支持虚拟机应用的负载均衡;应支持虚拟机的在线迁移和离线迁移;应支持虚拟机的备份恢复,提供高可用保护;应支持虚拟机的远程管理,包括启停、迁移、暂停、创建快照等。操作系统容器化要求如下:podman、docker、isulad应支持容器镜像管理,包括容器镜像的导入、导出、创建、启动、挂载、卸载等;应至少支持两种容器镜像架构;应支持容器网络隔离、容器资源的监控和弹性伸缩、日志、审核等;应支持容器化应用的全生命周期管理,管理可伸缩的容器应用;应支持对容器的工作负载部署、配置、扩展、负载均衡、数据持久化。驱动的具体要求如下:AI宜兼容主流的显卡、声卡。宜支持创建虚拟机时指定亲和反亲和策略;CPUCPU、内存的配置,满足业务运行需求;宜支持运行状态下虚拟机动态迁移,并维持业务正常运行;CPUASIC操作系统容器化可支持沙箱安全等组件扩展;FPGA存储资源池存储资源池应统一管理存储的系统资源,为上层应用提供存储资源,具体要求如下:a)、j)的要求;JR∕T0166—20RaidUSBd) JR∕T0166—20c)的要求。网络资源池网络资源池应对网络设备进行逻辑抽象和集中管理,具体要求如下:a) 应符合JR∕T0166—2020中a)、b)、c)、e)的要求;10GbE应支持链路聚合、负载均衡技术,突破单个网络设备或节点的性能瓶颈,满足业务所需的网络处理能力;驱动的具体要求如下:应兼容主流的网卡;HBAHCA宜支持基于国产芯片的服务器,组建网络虚拟化集群;SDNVPC宜支持常用的容calicoflannel、OpenvSwitch;宜支持基础网络和虚拟网络的互相通信;VPCVPC宜支持单个虚拟机挂载多块虚拟网卡。基础资源服务云主机服务云主机服务的具体要求如下:CPU、内存、磁盘、操作系统、网络、可用区等参数创建单台或多台云主机;应支持云主机的启动、重启、关闭、删除等;宜支持回收站功能。备份服务备份服务的具体要求如下:应支持云主机整机备份,如云主机快照、备份或克隆;宜支持通过备份恢复到原云主机、云硬盘或其它云主机、云硬盘;宜支持备份策略的创建、修改、删除等;宜支持通过设置备份策略周期性地自动备份。镜像服务镜像服务的具体要求如下:应支持镜像的管理,包括镜像的新建、删除、导入等;宜支持镜像信息的查看和修改,包括镜像的名称、操作系统、文件大小等。弹性伸缩服务弹性伸缩服务的具体要求如下:CPU、内存资源的使用情况配置伸缩策略;应支持向弹性伸缩组动态添加或移除云主机;应支持配置弹性伸缩服务的最大、最小可支持的云主机数量;宜支持查看特定伸缩组内的云主机数量、伸缩日志。裸金属服务裸金属服务的具体要求如下:宜支持申请选择裸金属服务器规格的裸机;宜支持不再使用裸金属服务器时,将其释放给平台;宜支持远程启动、关闭裸金属服务器;宜支持获取单个裸金属服务器的详细信息;宜支持在裸金属服务器上自动安装操作系统;宜支持从控制页面登录裸金属服务器;宜支持裸金属服务器挂载存储服务中提供的块存储。容器服务容器服务包括容器组管理、访问服务管理、应用管理,具体要求如下:容器组管理符合:应支持容器组的创建、删除;应支持对容器组资源(CPU、内存)进行配置;应支持动态为容器组分配资源。访问服务管理符合:应支持访问服务的创建;宜支持查看服务注册信息,包括但不限于服务的标识、名称、地址等。应用管理符合:应支持容器应用的部署、查询、更新、启动、停止、删除、自动扩缩容;宜支持容器应用一键部署能力,包括服务的自动创建、IP宜支持容器应用的滚动升级,升级过程中服务不中断;宜支持容器镜像仓库,实现容器镜像的统一管理;可支持容器镜像漏洞扫描,防止不安全的容器镜像被加载运行。存储资源服务存储资源服务应包括但不限于块存储服务、对象存储服务、文件存储服务等,具体要求如下:块存储服务符合:应提供卷管理,包括卷的创建、删除、查询、挂载、卸载、修改、扩容等;宜支持卷的备份、快照;宜支持对卷的批量操作,包括卷的批量创建、批量删除等;宜支持块存储安全删除,能擦除云硬盘内的数据,防止被恶意恢复;可支持创建加密云硬盘。对象存储服务符合:宜提供对象存储管理,包括桶的创建、删除、查询等;宜支持在桶创建目录、查询目录、删除空目录;宜支持对象的上传、下载、删除。文件存储服务,宜支持文件系统存储管理,包括文件系统的创建、挂载、删除、查询、扩容以及存储类型选择等。VPCVPC服务的具体要求如下:VPC,包括指定名称、IPVPCVPCIPDNSDHCPIP宜支持创建虚拟私有网络子网,包括但不限于支持指定虚拟私有网络子网的名称、可用区、IPv6IPIP宜支持查看用户私有网络的网络拓扑关系;IP负载均衡服务负载均衡服务的具体要求包括:应支持负载均衡器的创建、删除、修改、查询等;应支持负载均衡器对后端资源的挂载、卸载;应支持实时监控负载均衡器的运行状态;宜提供多种负载均衡策略;可支持负载均衡或网卡设置流量阈值。智能云中台层部署管理算力部署管理算力部署的具体要求如下:CPUGPUFPGA、NPU、ASICX86、ARM、MIPS、Alpha、LoongarchCPU;GPUAINPU、FPGA支持对算力资源的集群部署管理。CPUGPUAIAI运行环境部署管理的具体要求如下:应支持智能云中台组件在裸金属服务器、云服务器、容器等资源上进行集群化部署管理,同时符合水平弹性扩展算力的要求;AIPaddlePaddle、MindSpore、Pytorch、TensorFlow、MXNet、Caffe云边端统一调度云边端统一调度的具体要求如下:应根据云边端节点资源情况确定适合的云边端节点;应支持将调度信息通知给调度的目标边端节点;应在云边端计算服务结束后或根据资源释放申请,发送资源释放通知给云边端节点,云边端节点接收资源释放通知,相应资源设备应具备资源释放能力;应保证业务处理时效性,敏感实时的任务处理可下沉到边缘;应保证云边端数据协同分析和处理,提升数据使用效率。监控审计监控审计的具体要求如下:应监控当前节点中的实例状态、资源用量、智能云基础设施状态等;应将监控信息上报给统一的管控设备;应根据监控信息对各个节点进行远程运维及日志管理;应对全网链路(如集中管控节点间的网络链路等)的质量进行监控;应支持节点故障上报。训练管理分布式训练分布式训练的具体要求如下:PaddlePaddle、MindSpore、Pytorch、TensorFlow、MXNet、CaffeAI调度训练任务时,应支持识别集群节点配置;应支持在集群内自动调度训练任务到不同节点;PaddlePaddle、MindSpore、Pytorch、TensorFlow、MXNet、CaffeAIIP可视化建模可视化建模的具体要求如下:应支持图片、文本等数据的可视化;应支持以拖拽的方式进行工作流可视化建模;TensorBoardVisdom、Netscope宜支持训练过程中,对服务器资源使用率进行可视化监控;宜支持对超参数调整后模型的优化效果可视化;宜支持对已部署模型的全生命周期进行可视化监控。自动学习数据处理自动化,符合以下要求:宜支持对数据按照不同组合方式(如不同逻辑存储路径内的数据组合形成样本数据集;宜支持对数据集进行不同比例的训练集、验证集、测试集的拆分;CVNLP宜自动验证数据集的数据完整性;宜支持自动数据清洗,包括自动空值补全、离群点检测等;宜支持自动特征工程,包括特征筛选、特征衍生等;宜支持数据集自动平衡分类、降采样、上采样,对不平衡数据进行需求分类;宜支持数据漂移的自动检测和处理;宜支持具有横向伸缩能力的自动化分布式数据处理。模型超参数自动调优,符合以下要求:应支持通过预置模型简化模型构建过程;应支持通过预置模型自动调优工具、算法、算子,进行模型参数自动调优;宜支持通过超参数自动调优工具对模型进行超参数调优;宜支持超参数自动调优工具与开发环境、训练任务的算力调度协同,提升训练速度;宜支持对超参数自动调优任务的统一管理;宜支持对超参数自动调优任务的进度与结果可视化。神经网络结构自动搜索,符合以下要求:宜支持通过神经网络结构搜索工具自动构建模型结构;宜支持通过神经网络结构搜索工具批量建模;宜支持对神经网络结构搜索任务的统一管理;宜支持对神经网络结构搜索任务进度与结果的可视化;宜支持根据神经网络结构在验证集上的推理性能,自动选择模型;宜支持自动模型融合,通过套袋、增强等方法组合多个模型形成融合模型。推理管理推理框架可支持适配不同的推理部署硬件运行环境的第三方推理框架,如TensorRT、OpenVINO等。推理部署推理部署的具体要求如下:应根据规则自动选择模型发布功能,支持手动发布;AIPMML、PKL、H5、ONNXRESTful、gRPCSDK;应支持模型上线和审核;应支持多种模型上线策略,包括一次性上线、灰度上线(A/Btest)、影子上线(复制已上线模型的全部流量)等;应支持已上线模型版本回滚;应支持以容器镜像的方式进行推理部署;应支持用户自定义推理环境所需计算资源类型和实例数量;(CPU进行动态扩容和缩容,最大化集群中计算资源的利用效率;应支持推理服务的负载均衡和服务限流;宜支持推理所需资源的细粒度切分,包括显存隔离等。任务管理任务管理的具体要求如下:应支持推理任务的全生命周期管理,包括推理任务的创建、启动、停止、销毁等;应支持推理任务定时或周期性的自动容器化调度;应监控线上模型,包括容器级监控和服务监控等;应通过定时任务自动评估模型,跟踪模型评价指标的变化趋势;应统计模型上线信息;应查询和展示推理服务的接口信息、状态信息,包括模型调用次数、平均响应时间、成功率等;应支持记录和查看模型服务操作日志。数据管理数据采集数据采集的具体要求如下:应支持接入和采集多种数据源(NFS、HDFS、HIVE、JDBC(包括数据库表;xlscvs);应支持数据源配置及测试连接。数据探索数据探索的具体要求如下:应支持通过交互式数据探索数据基本信息,在不改变数据的前提下了解添加算子后数据集产生的变化;应支持数据属性(包括有效性、唯一性、空值率、最大/最小、均值、中位数等)和统计分析(洛伦兹曲线、卡方校验、相关系数、协方差、累计分布函数、离散分析、正态检验、经验密度图等)的可视化;应支持查看和分析数据集的引用关系。数据预处理数据预处理主要包括:数据清洗,应支持缺失值填充、无效值处理、数据去重、特殊空字符处理、列类型校正、常量列清洗、非法值替换等;数据转换,应支持格式转换、数据排序、数据合并、数据过滤等;数据扩充,应支持数据扩充,包括数据增强、数据合成、新数据生成等;数据预处理自动化,应支持数据预处理过程以及数据的清洗、转换、扩充等的自动化。数据标注数据标注的具体要求如下:应支持标注多种数据类型,包括但不限于文本、图像、音频、视频等;应支持多种标注方式,包括但不限于线框标注、关键点标注、线标注、多边形标注、分类标注等;应支持标注信息在原始数据上直观展示的可视化标注;应支持对数据源内容新建标签,并根据标签类别进行数据可视化展示;应支持以项目为单位管理标注的资产对象,支持项目状态管理,如待标注状态、已封版状态;应支持数据标注的质检、验收。数据集管理数据集管理的具体要求如下:应支持以数据集为单位进行版本管理、权限管理、标签管理;应支持数据集的导入、导出、修改、删除等全生命周期操作;应支持在已有数据集上进行数据处理并派生成新数据集,支持在外部数据源变化时自动更新其派生的数据集。特征工程特征工程的具体要求如下:应支持特征选择功能,包括但不限于过滤式选择、包裹式选择、嵌入式选择等;应支持特征分析功能,包括但不限于特征重要性分析等;应支持特征转换功能,包括但不限于标准化、归一化、正则化等;应支持特征衍生功能,包括但不限于特征扩展、特征组合、合成特征等;应支持特征降维功能,包括但不限于主成分分析、因子分析、奇异值分解等;应支持异常特征检测功能,包括但不限于单特征异常值分析等;支持自动特征工程功能,包括:应支持自动特征筛选功能,如通过使用模型的方式,基于特征重要性进行自动化特征筛选;应支持自动特征衍生功能,支持对连续型、类别型、文本型、时间型、地理位置(经纬度)等特征进行自动特征衍生;宜支持自动共线性特征检测和处理,减少特征偏移的影响;宜支持自动二阶段特征筛选,支持对一阶段表现较好的模型进行二阶段搜索和重要特征筛选;宜支持自动伪标签功能,通过半监督学习技术,对测试集中无标签列进行标签预测后,将置信度高于一定阈值的样本添加到训练数据中重新训练模型。算法管理算法管理应包括如下要求:支持多种预置公共算法,包括数据预处理、特征工程、模型训练、模型评估、模型对比、模型发布等,涵盖模型生产全流程;至少支持三类传统机器学习算法,如分类、回归、聚类、关联等;至少支持两类深度学习算法,如卷积神经网络、循环神经网络等;至少支持两类计算机视觉类算法,如目标检测、图像分类、文字识别等;至少支持两类语音类算法,如语音识别、语音合成等;至少支持两类自然语言处理类算法,如词法分析、序列标注、语义匹配等;自定义算法开发,如自定义名称、唯一标识、算法组件等;支持算法的基本管理操作,包括信息的查询、增加、删除、分类、检索等;支持算法的全过程管理,包括:算法创建管理,应支持算法名称管理、算法输入输出定义管理;算法评估与优化管理,应支持算法功能的评估,以及算法性能的优化评定,评定规则可包括时间复杂度、空间复杂度、正确性、容错性、泛化能力等;算法退出管理,应支持算法的退出或下架。支持算法的版本管理,包括版本号管理、版本发布说明等;支持基于容器技术进行算法封装、集成、发布;平台算法封装支持多语言模式,允许在同一个工作流中调用不同开发语言算法,支持工作流程嵌套;支持算法共享;支持迁移学习算法;支持强化学习算法;支持增量学习算法;支持自定义算法与预置算法的混合使用,算法间支持数据接口、模型格式接口的兼容性;所有公共算子的源代码对用户开放;支持算法执行管理,包括算法执行的效率管理、安全管理、目标管理等;支持算法目标管理,配置和管理算法实现的功能和性能要求。模型管理模型定义管理模型定义管理的具体要求如下:应支持模型定义管理,统一各类模型的定义管理和命名约定;应支持模型约束管理,支撑模型间的约束检查;应支持模型目标管理,包括功能目标、性能目标、业务目标;应支持服务与模型映射管理,明确各类模型与支撑服务的映射关系。模型可回溯管理模型可回溯管理的具体要求如下:应支持模型本体及变体的可回溯;宜支持模型数据可回溯,建立模型族谱关系图,存储和保留模型的创建信息、修订信息、引用信息、版本信息、执行数据等,评估模型的复用能力、可信度、准确性、权威性等指标。模型配置项管理应支持对配置项及模型基线的管理,区分可变配置及不可变配置,支持对可变配置的追溯。模型分类进退管理模型分类进退管理的具体要求如下:应支持模型类别和级别的管理;应支持对模型准入准出、升降级、优化以及停用启用等策略和规则的配置。模型校准管理应支持对触发模型自动校准或人工升级的规则进行管理和配置。模型可解释性管理宜支持对模型可解释性的程度、规则等进行管理。模型运行条件管理模型偏差管理宜支持对模型偏差(如样本偏差、算法偏差、意识形态偏差等)的溯因分析及容忍度配置。模型全生命周期管理模型全生命周期管理的具体要求如下:应支持统一的模型全生命周期管理,包括在平台上通过编码方式训练的模型、基于工作流训练的模型、自动建模训练的模型,以及第三方导入的模型;应提供模型仓库,衔接模型训练和模型服务,简化模型生命周期;应支持从模型训练任务中接收模型,支持模型文件校验、可视化解释等,支持将具有最佳性能的冠军模型部署到模型服务中;SDK,SDK开发管理集成式开发环境管理集成式开发环境的具体要求如下:Docker、KubernetesCPU、GPUCPU、GPU、内存等性能信息;应支持将开发环境保存为容器镜像;FPGAI/OI/O开发环境资源调度开发环境资源调度的具体要求如下:CPU、GPUGPUGPUMIGGPUCPU、GPU开发方式管理开发方式管理的具体要求如下:jupyternotebook、jupyterlabsshpython/R/PysparkwebshellVSCode、PyCharmAI开发环境管理开发环境管理的具体要求如下:应支持查看开发环境使用的运行设备、CPU、GPU、内存用量等资源配置信息;应支持查看开发环境使用的镜像信息、版本信息;应支持监控开发环境的运行状态、运行时长等;应支持普通用户、管理员对开发环境的关停;宜支持对硬件异常导致开发环境关停情况的自动恢复。开发配置管理开发配置管理的具体要求如下:WebIDEJupyterWebIDEJupyter之间双向切换。允许客户根据自身需要定制私有开发环境,开发环境应具备代码高亮显示、自动完成等基本代码开发功能。支持算子运行空间维护、远程调试/测试、算子发布等;应支持在开发环境中操作工作空间中的各类文件,可直接使用数据集、算子等对象进行数据处理、模型开发和验证;应支持编码模型开发、低代码模型开发和无编码模型开发,如通过配置数据和目标实现拖拽式工作流开发和自动建模开发,支持不同开发模式下开发结果的转换;AI应提供面向云开发资源的管理控制台,支持自助开通、释放资源;应提供面向开发库的管理控制台,支持自助调度及编排任务;可提供面向模型开发和训练管理的能力,包括深度学习库/框架、算法管理、建模数据管理、自动化建模等;可支持图形化方式配置开发模型,包括模型参数修改和快速构建等。开发任务管理开发任务管理的具体要求如下:可提供一个数据驱动的并行计算框架,兼容业界主流的多种编程模型;可提供并行任务调度能力,且具备高可扩展性;Hadoop、Spark可支持团队不同角色(专家级数据科学家、数据分析师、编码人员、业务人员等)之间协同开发。运营运维管理监控管理监控管理的具体要求如下:应支持集群监控,包括监控集群内主机/云主机/容器的运行状态等;应支持对主机/云主机/(CPU应支持实时监控或历史监控结果的可视化展现;应收集智能云基础设施设备、资源及服务的状态数据等,提供数据访问接口;应支持智能云基础设施的日志服务,统一管理日志采集、存储、导出等,兼容常用日志管理服务;宜支持基于业务规则的资源与服务使用情况分析,为资源与服务的规划、调整提供依据;
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 八年级数学下册 25.3 一次函数(第1课时)(原卷版)
- 智能养生壶2.0时代:从加热工具到健康管理中枢转型
- 药物临床试验质量管理规范(GCP)解读
- 2026年浙江单招电子商务运营策划题库含答案
- 十五五数据要素市场化:家庭服务机器人隐私保护与合规挑战
- 知乎盐选专栏创作与知识付费变现
- 数字对讲机:公共安全升级与产业数字化推动下的专业通信增长市场
- 2026年汽车4S店数字化转型与客户体验优化方案
- 2025年山东海阳职业学院单招综合素质考试模拟试卷【考试直接用】附答案详解
- 2024年河南固始职业学院高职单招职业适应性测试考试题库含答案详解【典型题】
- 2026年湖北武汉警务辅助人员招聘考试试卷-含答案解析
- 2026工会社会化工作者综合能力测试题库及答案
- (正式版)DB22∕T 2522-2016 《北方精养池塘鱼菜共生操作技术规程》
- 2026届重庆市八中中考语文模试卷含解析
- 中华财险四川分公司招聘笔试题库2026
- 2026年物业管理机器人应用创新报告
- 2026年高二数学寒假自学课(沪教版)专题02 数列难点总结(原卷版)
- 民宿入住须知与安全告知指导手册
- 电梯安全知识课件教学
- 2024年长春金融高等专科学校辅导员考试笔试真题汇编附答案
- 2026年国企内部审计笔试题目及详细解析
评论
0/150
提交评论