【华为】2025混合云现代化运维体系核心能力及最佳实践报告_第1页
【华为】2025混合云现代化运维体系核心能力及最佳实践报告_第2页
【华为】2025混合云现代化运维体系核心能力及最佳实践报告_第3页
【华为】2025混合云现代化运维体系核心能力及最佳实践报告_第4页
【华为】2025混合云现代化运维体系核心能力及最佳实践报告_第5页
已阅读5页,还剩100页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

编制委员会编制委员会COMMITTEE华为混合云副总裁,SRE部部长政企而言,IT架构建设作为组织战略目标实现和业务创新发展的核心引擎,是一项战略性、系统性工程,然而IT架构的建设往往不会一蹴而就,而是会随着技术革新逐渐引入新的平台、新的产品和技术。因此,政企IT架构的发展演进进程中普遍存在不同架构、不同代际、不同厂商平台并存的情况。运维人员需要全面了解部署、升级、维护等操作,这不仅增加了运维人员的工作难平台解决方案,已逐渐成为政企用户数智化转型的首选IT随着云上业务需求不断增加,云服务资源类型日益丰富,传统的IT运维华为混合云基于自身云平台运维经验,以及服务数千家政化转型实践,持续积累面向现代化的核心运维能力,并沉全面构建稳定可靠的现代化运维能力的路径和方法。通过心能力,期望能够帮助政企客户从传统架构运维到云化架其中,运维体系作为混合云运维能力建设的基础性、系着对技术、组织、制度进行系统性重构的巨大挑战,其核智化的运维体系实现“效益”、“效能”、“效率”、“效益:指经济效益,包括可盈利或其他与盈利相关的要素。运维要以效益为目标,对准业务价值匹配业务发展和架构演进,实施运维效能:指服务能力,是支撑运维活动顺利进行并达到预期效果和效率的保障。在运维活动中不断提升服务能力,包括对新技术的掌握、新工具效率:指在运维活动中,得到的结果与所使用资源之间的关系。在运维效果:指运维活动达成的结果,衡量是否达到需求或者预期的目标。运围绕这“四效”目标,政企客户需要围绕运维制度规范、运维组织、运维业务、运维知识库、运维平台和运维安全这六大维度进行核心能力的演进本文将对如上六大核心能力领域的建设路径和方法进行详细阐述,并通过某集团客户的实际建设案例向读者提供可落地的最佳实践参考,期望对广CONTENTS08-1011-152.2混合云现代化运维体系建设思路2.3316-3933.2运维组织设计3.3运维业务设计3.4运维知识库设计3.5运维平台设计3.6运维安全设计440-5444.1建设背景4.2运维痛点分析4.3运维体系规划设计4.4建设成效09华为基于三千多家混合云用户的运维场景和诉求,结合多年来累积的政企客户运维服务实践,提出了混合云现代化运维顶层设计参考架构,将混合云运维划分为四大领域,分别为“运维体系现代化”、“平台运维现代高可用SLA规划运维体系现代化定义了在混合云进入深度用云阶段,应该建设什么样的运维体系适配业务的发展,包含运维流程规范、运维组织、运维业务、运维知识库、运维平台、运维安全等多个方面,帮助政企云平台技术栈的快速增长给云平台运维带来了巨大挑战,这些挑战涉及日常运维、主动预防以及故障恢复等方方面面。华为在每个领域都提出了运维现云运维投入人力有限的场景,提升混合云运维效率;预见性风险治理帮助政企实现风险的提前感知与预防;确定性故障恢复则给出了在云与业务耦合度日益加深背景下如何实现故障快速恢复的最佳答当前,越来越多的用户将关注点从云与设备的运维转向应用的运维,尤其是承载着经济乃至国计民生核心应用的运维受到运维管理者格外的重视,将应用的可靠性保障前置到设计阶段,通过高可用设计种多样的工具与技术,工具之间数据割裂无法形成全局的视野,直接影响了应用运维的效率与效果。只有打破各个工具间的数据孤岛才能统筹洞察应用的完整运行态势,对应用进行全方位的监控与分运维安全是保障业务可靠性的基石,也是运维现代理,事中实现运维操作的严格管控,事后实现对运维操作的审计与分析,减少因运维误操作带来的风险。在租户安全维度,通过构建完整的安全防护体上述能力均建立在将混合云运维的数字资产不断迭代和衍化的基础之上,通过将运维经验数字化、智能化和服务化,不断将新的运维能力孵化出来,注入到运维工具、运维脚本和运维服务中,持续赋能2.1混合云现代化运维体系建设背景政企客户在云化转型过程中,传统基础设施与云原生平台长期共存,运维部门要长期面向混合架构建立多云多数据中心的协同管理能力,包括组织、流程、工具、平台等,因此构建面向混合架构的统一运维管理体系势在政企存量IT架构混合云现代化架构ERP智慧应用ERP智慧应用FusionSphere/VMware/…FusionSphere/VMware/…根据华为混合云过往几千家客户的运维服务经验,政企客户在运维体系建设落地过程中,普遍面临如运维流程如何适配:业务运维和平台运维的流程运维组织如何规划:缺乏运维岗位设置、职责分运维能力如何构建:需要什么样的人员,怎样快运维平台如何建设:运维工具、平台怎样整合,运维知识库如何管理:如何建设行之有效的运维运维安全如何保证:如何建设全面、高效的运维这些问题并非孤立存在,而是相互交织构成了政企数智化转型道路上的系统性瓶颈。面对上述挑战,单点零散的改进显然已力不从心,因此,突破单点瓶颈,构建一个具备持续演进能力的现代化运维体系,已成为支撑政企业务可持续发展、实现战略目标的关键系统性工程。这就要求政企用户跳出“救火式”思维,以体系化、工程化的视角,重新审视和规划适配业务智能化发展的现代化运维体系建设2.2混合云现代化运维体系建设思路混合云现代化运维体系建设应当设置明确的目标,聚焦运维带来的价值以及能够沉淀的运维能力两个方面进行考量,使得运维产生的收益最大化。基于目标设计运维体系的成熟度模型,设置不同维度的“实践是检验真理的唯一标准”,一个好的运维体系最关键的衡量标准就是可落地性。运维体系在落地过程中,需要各个部门密切配合,相互磨合并且持续改进,最终形成最符合政企现状的运维体系,$效益+×÷+×÷图2.2现代化运维体系建设目标、成熟度评估维度与落地建设思路首先,针对混合云运维体系,华为云提出以“四效”为目标,不断提升运维价值和运维能力。“四效”分别是其次,针对设定的运维体系目标,从业务感知能力、分析决策能力和自动化能力、可视化能力四个维度设置合通过云上业务系统经营指标、运维指标、服务可用性指标等指标判断业务感知通过资源使用率、运维人效比、运维投资收益率等一系列指标为分析决策提供通过运维自动化率、变更成功率等指标判断自动化能力,指标越高,说明自动通过对平台、应用、运维事件进行多维度统计判断可视化能力,指标覆盖越全表2.3运维体系成熟度评估标准最后,通过对目标用户的战略意图、业务现状、技术演进等方面进行全面的调研,作为统一的业务输入,对运另外,运维体系的实施也不是一蹴而就的,而是在试行过程中,综合各个方面的反馈持续优化改良,从而逐渐2.3运维体系建设目标和成熟度评估模型建立之后,需要着手设计运维体系架构。传统的运维体系一般包含组织、流程、工具等几个组成部分,华为混合云结合自身实践及数千家客户服务经验,在传统运维体系基础上,围绕组织架构岗位职责人员绩效组织架构岗位职责人员绩效IT安全IT安全EOX管理、版本变更统一统一CMDB运维数据接入统一故障处理运维可视化运维自动化图2.4通过“因地制宜”制定运维规范,树立运维制度和典型的运维规范包含业务故障等级定义、业务上典型的运维流程包含故障处理流程、应急恢复流典型的指标度量体系包含告警响应及时率、事故2、运维组织治理根据用户实际情况定义运维组织架构,识别关键运维岗位,明确岗位职责,按照岗位承担的职责和定义的人效比,为岗位配置预期数量的人员以及人员的绩效考核条目。涉及周边组织协同配合场景,需3、运维业务管理运维业务管理主要是针对服务内容进行定义,可以分为服务请求、故障修复、业务变更及主动运维这4、运维知识库管理运维知识库管理主要面向对运维资产积累有一定诉求的中大型政企客户。基于云平台或业务运维过程中产生的运维数据,如问题单、案例库、变更方案等进行数据治理,生成运维知识库,对运维风险进5、运维平台治理运维平台治理按照业务属性划分一般涵盖两部分能力:平台运维和应用运维。平台运维管理对象是不同架构、不同代际的云平台,应用运维管理对象是客户业务系统,通过构建统一运维平台实现运维数据的统一接入、数据汇聚治理、运维可视化呈现,6、运维安全管控运维安全体系主要包含数据安全、IT安全、人员安全、物理安全、作业可信等几个方面,通过法律法规、业界安全标准、用户安全要求的约束,系统化3.1运维规范与流程设计随着政企客户业务全面快速上云,面向传统数据中心的运维规范和流程已经无法适配业务的发展要求,比如业务上云规范、业务转维规范、数据治理规范等等,都是传统运维规范中缺失的内容,因此面向云上业务的规范、流程、度量指标的建设是政3.1.1运维规范典型的混合云运维规范包含业务故障等级定义、业务上线规范、业务转维规范、运维数据治理等规范。通过标准化的规范和流程来提升系统的稳定在故障处理过程中,可以根据不同的故障等级,调集相应的资源处理问题,有效提高故障处理效率。按照故障影响,故障划分为四个等级,即P1/P2/P3/P4。出现严重故障,对客户网络和业务运营造成严重影响。涵盖最终用户在使用过P2故障对业务运营造成显著影响,有可能导致业务中断,或产品部分操作不可用但仍能使用,对用户P3P4咨询类问题,包括在日常运营和维护过程中关于产品的功能、说明书、运作和构成业务上线规范定义了新业务或系统功能上线时所需遵循的一系列标准和流程。这些规范旨在确保上线过程的顺上线标准上线评审上线评审checklist图3.2业务上线规范核心要素业务转维规范主要明确站点转维标准动作及交付件,以及网络安全责任边界和转维关键角色职责,从而确保转维各流程顺利进行,转维人力按时到位。通过完善项目转维流程,可以更好地降低站点转维总体分为转维准备、转维自检和转维交接三个阶段,每个阶段对应关键的转维动作和标准交付智能运维是运维发展的高级阶段,亦是必经之路。落地智能运维需要三个要素:数据是基础,场景是难点,例如数据分布分散,数据标准化比例低,缺乏成熟的方法等。运维数据治理贯穿于数据生命周期,从规划设计到实现和维护,再到应用和变现,3.1.2运维流程运维流程按照不同运维动作属性分为故障修复线、故障处理流程:故障处理流程主要是规范各类事件的受理、处理、升级工作,尽快恢复云平台正常工作,界定客户运维团队、云服务厂商、及厂商驻场运维工程师等角色的职责边界,高效处理 45事件申请单重大事件处理流程是否631、服务台接收事件信息进行记录,包括事件时间、位置、影响等关键事件信2、根据事件等级定义,对发生事件进行分级确认:一般事件进行事件分派操3、根据业务类型进行事件分类,根据事件类型进行事件派单,不同的事件类型4、事件处理人认领、诊断和处理事件,并形成解决方案。如果不5、云服务厂商远程协助现场进行事件处理。如无法处理,及时接收事件并给出6、确认事件、故障或请求是否处理完成。如已完成,关闭事件工单,如未完图3.3故障处理流程示例应急恢复流程:应急恢复流程主要规范了业务紧急恢复、安全攻击事件及重要漏洞处理等场景下的操作要求。通过应急恢复流程,集中运维研发资源快速恢复客户业务,达成业务运行SLA。变更流程一般由日常运维、事件管理和问题管理三个外部流程触发。按照变更阶段可分为变更前,变更中和变更后三个子阶段,变更前主要包括需求收集、方案评审、变更申请等,变更中主要包括故障处理、平台监测、变更回退等,变更86是5否是是 否439274、确定变更类型,分派实施人或提交审核。标准或常规变更,指派实施人安排5、主管部门负责人对紧急/重大变更进行变更方案评审,对变更方案的可实施图3.4变更管理流程示例漏洞管理:漏洞管理主要是通过漏洞发现、漏洞处置和结果验证三个活动,在不影响业务的情况下,尽可能版本演进:通过定期版本升级演进解决云平台版本问题,整深度巡检:在运维流程设计时应制定完善的风险防控机制,对云平台日常维护期内各云服务关键配置、健康20 23456786、分析和评估巡检报告,以识别故障和异常;根据需要触发事件或变更流程对图3.5深度巡检流程示例3.1.3运维度量指标体系运维指标度量体系是量化运维质量是否达标、运维组织是否合理、运维流程是否高效的关键数据,同可用性指标定义IT系统或服务在一定时间段内可正常使用的时间比例。例如,对于企业核心业务系统,设定年度可用性目标为99.9%,即全年停机时间不超过8.76小时(365天*24小时*0.1%)。这就要求运维团队具备完善的监控体系,能及时发现并解决潜在的系统故障隐患,同时制定冗余和灾备策略,确保在出现硬件故障、网络中断或软件错误时,系统能快速切换到备用环境,维持业务连续告警响应及时率:规定运维团队针对告警的响应速度。例如,对于影响业务正常开展的关键告警,要求运维人员在15分钟内做出响应,初步确定故障原技术咨询问题,响应时间可设定为2小时内,通过电故障恢复及时率:明确各类问题从发现到彻底解决的最长时间限制。如对于常见的服务器硬件故障,设定解决时间为4小时,包括故障诊断、备件更换、系统恢复和测试等环节;对于复杂的应用程序漏洞修复,根据漏洞严重程度和修复难度,解决时间可在1至5个工作日不等,确保问题得到有效、彻底的事故数量:衡量在运维过程中发生的故障或事故数量。这类指标一般用于监控和评估系统的可靠性、稳定性和运维团队的工作效率,推动产品质量及运变更成功率:衡量组织在进行系统变更、版本升级或其他类型变更时,成功实施这些变更的比例。这个指标对于评估运维和开发团队的能力、效率以及 (事件)WarRoom及时性WarRoom及时性 进展通报规范性应急方案覆盖率9应急方案 静默变更比率服务中断时长9生产环境变更指标设计过程:指标设计需要充分考虑流程中的各个角色,设计明确的指标,每个角色对各自的细化指标负责图3.6指标度量体系示例3.2运维组织设计传统数据中心的运维组织比较简单,主要是面向IT设备的运维,但业务云化之后,运维的对象发生了巨大的变化,因此政企客户要求从现代化运维角度出发,结合业务目标、运维对象和资产,设计对应的运维组织架构,明确组织内各个团队之间、组织内部与外部之间的工作界面以及工作开展所需的岗位角色、工作职责、技能模型、人员配置数量等,给3.2.1运维对象发生到解决的时间,提升运维团队效率。主要运维数据库服务:云数据库、文档数据库、分布式数据智能数据:数据湖、数据仓库、智能中枢、AI平22安全服务:计算安全、漏洞扫描、日志审计、堡垒云管系统:统一资源管理、用户和账号管理、日志运维工具:如网络拨测、巡检、部署/升级、数据3.2.2运维组织标准化运维组织架构围绕“统一一线、共建二线、集中管理”的原则展开设计,较大规模的局点可参照如下原则设置适配自身业务特性的运维组织结客服、技服、操作中心、监控中心统一,确保所有1、7*24小时服务台接听服务热线电话,记录用户反馈的问题或咨受理来自于内部的被动服务请求、任务分派、变更申请等,创建工单分派给不同领域运维人员处2、监控组实时监控业务应用系统、云平台、云服务以及硬遵照各产品提供的告警处理指南,对告警信息进行处理,针对需要上升处理的告警,创建工单分针对可能或已经造成业务应用系统中断的告警,视为重大事件,发现后立即上报给运维服务经3、监督审计组负责制定监督审计计划,明确审计的范围和目标,监督运维管理制度与流程在运维活动中的执对运维人员的违规行为进行审计,分析操作日志,向管理层和相关部门提供审计结果和建议,负责对云平台的安全性进行审计,包括网络安由不同技能领域的运维专家共同构筑并统一建设运数据中心设施的运行状态检查及应急事件响应,服务器、存储、网络等硬件设备的配置管理、资产管理、备件管理、补丁升级、故障恢复、告警受理一线服务台所派发的工单,对工单反馈的内容进行调查处理,并配合其他运维小组进行硬件2、云平台运维组负责云平台和云服务的日常配置管理、变更实施、例行巡检、日常维护、问题处理、数据备份对计算存储资源池利用率和容量进行监控,输出配合云厂商完成云平台版本演进、补丁升级、信23业务部门业务部门3.应用运维组负责业务应用系统或功能模块的可用性维护、日常调优、例行巡检、问题处理、数据备份等工完成业务应用系统或功能模块的资源监控纳管操制定运维管理规范,构建运维流程体系和对应组织结构,确保运维工作的有序开展和日常运维动作的1.运维组长跟踪并管理对应领域上升的技术支持请求,快速处理对应领域的疑难问题和技术攻关,对潜在风对组内人员进行管理和调配,并负责与上级管理2.运维经理运维团队的日常工作安排、考核管理、资源协调应急管理、重大故障恢复、重大事件保障和上升组织输出主动运维服务报告并完成报告的分析和讲解,包括深度巡检报告、运行月报、看网讲网一线服务台7*24监控组监督审计组运维中心运维中心管理角色 PAAS应用B运维应用A运维硬件变更及更换硬件设备巡检机房资产管理网络运维云安全运维数据库运维大数据运维基础云服务运维PAAS应用B运维应用A运维硬件变更及更换硬件设备巡检机房资产管理网络运维云安全运维数据库运维大数据运维基础云服务运维服务运维服务运维云平台运维组长安全运维组长网络运维组长云平台运维组长安全运维组长网络运维组长基础设施运维组长应用运维组长 图3.7运维组织结构全景示例243.2.3人力配置结合日常运维、主动运维和被动问题处理工作的开展设计现场运维人力配置基线,在满足日常运维需求的同1服务器规模大于400台时,配置1人25*8H配置1-2人37*24H配置4-6人4每增加300-400台配置1人5每增加100-150台配置1人6根据项目所使用产品的VCPU数VCPU每5000VCPU配置1人78根据项目所使用产品的VCPU数VCPU每5000VCPU配置1人表3.8人员配置参考3.3运维业务设计传统的IT运维模式难以适应云计算时代的需求,运维人员需要不断学习新的技术和知识以实现运维模式的转变。为了有效应对云运维的挑战,现代化运维体系应采用分层防御、周密部署、主动出击等多种战术构建运维WarroomWarroom图3.9运维业务战线设计示例25服务请求线:是现代化运维业务体系的“救火队”、“排头兵”,担负着和现网直接交互、监控现网风险、为用户排忧解难的任务。因涉及业务面广,请求频繁,因此需要承压能力强综合素质高的故障修复线:是现代化运维业务体系的“作战参谋”,负责故障分析、方案制定、问题复盘、恢复业务变更线:是现代化运维业务体系的“工兵”,聚焦于具体的升级、变更、整改事务,基于时间窗主动运维线:是现代化运维业务体系的“巡逻队”、“诊疗组”,聚焦于风险预防、看网讲网等3.3.1服务请求线服务请求线主要任务为在线保障、告警监控、需求管理,以及问题答疑,现网稳定性保障和满意度提升主要依赖该组织,下面介绍如何做好各项请求线人员构成:在线保障通常分为多种类型多个层级,在各个云厂商中叫法也不尽相同,有些叫做OnCall有些叫做SRE。根据保障团队所处的位置不同,一部分工作由驻场人员完成,对于一些能接受远程连线的局点为了便于资源高效利用,集约化管理,在主要工作事项:作为客户单点沟通接口,快速响应受理客户投诉、建议及问题咨询等,协助定位定界、问题跟踪、对简单问题进行解答,复杂问题按人员构成:监控人员即从事系统监控的人。从人员所属组织的不同分为:客户运维团队监控小组、厂商驻场监控团队、及厂商远程运维中心监控团队。通常监控团队负责看护的范围在监控实施前已明确,例如客户自己的业务系统通常由客户运维团队负责看护,一般处于业务保密等原因不会假手于人。厂商驻场人员通常对各自负责的产品、平台进行监控,也有一部分人对云平台整体的告警进行监控。远程运维中心通过大屏、接入设备远程查看平1、通过监控工具对云平台及各类云服务进行7*24小时(部分场景要求5*8小时)实时监控,对发现的告警及问题进行分类,并将告警按重要等级反馈给现2、配合厂商驻场团队进行告警处理,或自行建单,按工单处理流程处理告警和问题,通常监控不涉及智能问答本质上不属于任何一种人力安排层面的运维事务,但智能问答机器人通过模拟人类对话在无需人为干预的情况下可以实现7*24小时不间断地为用户提供咨询服务,其低成本、高智能等特点当前已经被广泛用在各类在线服务行业,可有效降低人虽然对于一些复杂问题和场景机器人可能会影响客户满意度,有经验的用户会直接跳过进入人工服务环节,但在服务请求线,智能问答系统的构建仍具有重要的意义。未来,随着问答机器人语义理解能力和自主学习能力的增强和多模态交互技术的发展,会给用户提供更准确、更全面的支撑,以极大人员构成:理论上智能问答机器人可以分模块、分单元各自灵活构建,任何想减少重复性工作、提升运维效率的组织和个人都可以建立自己的智能问答主要工作事项:构建智能问答机器人大致需要机器人或者智能问答服务器搭建、语料和案例导入、模型选取、对话体验及其优化、问答统计和运营分3.3.2故障修复线故障修复线以现网业务恢复、问题修复为第一要务,其核心度量指标为MTTR(MeanTimetoRepair),即系统或服务从故障发生到修复完成的平均时间,主要任务是致力于MTTR指标的降低,人员构成:应急恢复的责任人是云平台运维工程师,在人员组织构建时通常建议分层级构筑,因此1、判断问题局点的软件版本,根据问题描述查阅问题库快速给出相应的修复措施,通常修复措施可以是短期措施,也可以是长期措施,根据修复代价和2、对于问题库中未收录的问题,组织快速定位定界,按领域矩阵卷积相应专家分析,涉及到严重问WarRoom为保障重大故障的高效管理,实现统一指挥、快速响应和资源协同,WarRoom机制通过集中决策、实时协调和闭环跟踪,成为重大风险处置的核心管WarRoom成员:由固定成员及故障产品相关成员组成,例如首席运维工程师、各产品运维经理/运维为了从根本上解决问题,根因分析在故障修复线中具有重要意义。当根本原因被纠正后,将有效防止人员构成:根因分析通常由维护人员主导,产品技术开发人员重点投入,质量人员(QA)参与指导。主要工作事项:通常根因分析需要有一个开工会,组织相关参与人员对齐工作安排和计划,各自收集材料进行分析,可参考如下步骤和方法进行根因分27根因分析步骤推荐的工程方法根因分析步骤推荐的工程方法SIPOC图还原过程、5W2H5WHY确定根因表3.10根因分析步骤和推荐方法故障复盘是一种对故障发生及处理过程进行重新审视、思考和探究的方法,旨在确定故障的根本原因并落实改进措施,以提升业务系统的稳定性和连续性。故障复盘的步骤包括梳理故障过程、确定参会人员、准备复盘材料、复盘中讨论、复盘后落实。升级演进需基于客户对云平台升级演进的需求,提供满足业务需求的升级方案设计,并快速、高质量配置变更评估是软件配置管理中的一个重要环节,它涉及对软件配置变更请求的审查、分析和决策,主要事务:评估变更指导书是否完整,原因分析是否准确,变更步骤是否详实能够支撑操作人员执行,以及综合评估变更执行的影响,包含业务影软件漏洞修复旨在确保漏洞得到及时、有效的修主要事务:漏洞识别与评估、影响分析、制定修复方案、实施修复与验证。当漏洞无法通过配置文件和三方件版本替换修复时,需要及时规划补丁解关键指标:漏洞在官方披露以后有两个关键指标,一个是漏洞修补SLA,一个是漏洞修复SLA,前者要求提供方案或者补丁,后者需要在现网实施完3.3.3业务变更线随着业务数量和业务规模的持续扩大,现网的变更数量和变更频次不断增长。根据统计数据,70%以上的现网事故都源自于变更,因此业务变更线作为风险整改是一个系统性的过程,旨在识别、评估并消除或降低潜在的安全风险,并通过整改的形式在整改,从严重程度上看整改严重性要高于预警,并且整改通常会匹配人力基线和成本预算,推动其在3.3.4主动运维线主动运维线是对现网局点进行主动管理,通过对现网局点环境的运行状态进行分析、深度巡检提前发运行分析:包括云资源容量分析、云平台运行状况分析、云服务告警分析、云平台健康分析、月度服深度巡检:旨在从云服务运行时状态、资源容量、服务配置、预警风险、版本管理和许可管理6个维度对云平台的健康状态进行全方位的深度评估,识别应急演练是针对云平台可能出现的潜在故障风险,制定基于场景化的应急预案,开展应急演练,保障云服务出现问题后能尽快恢复。主要包括演练准备、演练执行、演练复盘、优化建议四个步骤确保3.4运维知识库设计伴随政企数字化转型加速,运维系统规模与复杂度剧增,运维人员需应对多领域问题,却因缺少有效方法和协同,解决问题效率低、周期长。而且,运维知识仅存于个人记忆,难以复用。此外,现网历史问题数据未保存,后续运维无法借鉴分析,致使在这个背景下,迫切需要优化运维知识库管理,整合知识与数据,提升运维效率和质量,保障业务稳3.4.1运维知识库问题录入:所有运维问题通过标准化的工单系统进行记录,作为基础数据进行统一管理,有助于问题总结:运维人员在解决问题后补充总结经案例发布:问题可以总结共性并转化为案例,提2829·知识库平台:建立统一的知识库平台,整合问·检索与推荐:案例库支持全文检索和基于相似度推荐,系统可以根据问题自动推荐相关的案·经验推送:创建问题时系统根据问题类型、影响级别、解决方法等信息,自动推送相关的案否为重大问题、是否影响业务、是否为产品问题、是否为共性问题等。通过对相似问题进行合2、变更单变更单资产包括变更模型库和变更checklist等,通过变更经验持续沉淀和效率提升构建现网数字化变变更模型库:通过变更单和变更checklist创建变变更申请创建:所有变更通过标准化的变更系统进效率提升变更单变更单变更模型库变更checklist经验沉淀子变更场景)和变更单(单个变更场景)。变更单内容需包含实施方案、风险评估、回滚方案变更范围确认:生成待收集的列表和人工检查项组织变更评审:通过上传收集的环境信息,由专·风险自动匹配:基于收集的环境信息和预设规则,系统自动匹配存在的风险并输出风险检查结果,例如依赖冲突、配置错误、安全漏洞等。变更实施复盘:通过对变更过程打点,在变更完成后重新收集信息并上传系统,会自动总结升级变更经验推送:系统对历史变更问题和经验进行精准推送,实现知识经验复用,提升现网变更风险闭环效率。在创建新变更单时,系统会自动推送历史上同类变更发生过的问题列表、发生局点、问题工步、处理人员及解决方案,帮助变更3.4.2运维风险库运维风险库旨在通过系统化地识别、评估、管控,持续监控潜在风险,降低运维事故发生率,最大限度地减少业务损失和安全隐患。结合历史事件分析、技术监控预警以及风险评估模型,建立一个动态更新的风险库,为运维提供数据支撑,并通过风险预警和响应机制,确保业务系统的稳定性和安全力,增强应对突发事件的响应速度和效率,最终保风险数据来源:包括历史故障记录、整改单等在处理方案等信息。通过不断完善风险库,提高风风险自动识别:基于风险识别算法,对现网环境信息进行分析,自动识别潜在风险。识别出的风险将根据严重程度进行分级,并进行相应的处理。风险自动推送:将识别出的风险通过邮件、平台通知等方式,及时推送给相关责任人,确保能及时响应和处理。推送信息包含风险等级、影响范围、处理建议等关键信息。支持自定义推送规风险后续跟踪:对风险规避、处理的全过程进行记录,包括风险发现、预警、处理、验证等各个环节。跟踪记录将被用于风险评估、改进措施制定以及后续风险预防。平台提供可视化的风险跟踪3.5运维平台设计传统数据中心中,部署有IT管理、虚拟化管理、应用管理等平台,各个平台之间相互割裂,数据极难汇聚,在执行运维操作时,需要在各个平台上进行操作,导致运维业务效率低下。现代化运维平台是一个统一的运维平运维场景运维场景容灾备份管理系统(灾备切换)容灾备份管理系统(灾备切换)(数据运营,大屏展示)统一采控Agent(日志、调用链)(指标,告警,日志,工单)统一CMDB(资源信息,资源配置)(作业管理,作业调度)(依赖拓扑,调用链)运维平台数据采集(指标)(网络链路)(告警)(指标)运维大数据服务平台(北向)IT服务管理系统(流程)指标指标链路告警日志传统数据中心云数据中心传统数据中心云数据中心基础设施运维管理平台视角包含如下组件和功能:统一CMDB、统一运维数据、统一故障处理、统一自运维场景视角覆盖应用可观测性、应用故障诊断、应用变更发布、应用应急处置、应用运营分CMDB的主要作用是确保企业IT环境中的所有资产和配置得到有效管理和控制,从而提高IT服务的可靠性、稳定性和安全性。随着企业越来越依赖云计算服务,CMDB需要能够管理和跟踪云环境中的资源和配置,确保云部署的透明性和可控性。此外,CMDB还应与其他IT管理工具和系统(监控、部署、自动化运维、巡检等)进行集成,以实现更全面的IT服务管理。3.5.1统一CMDBCMDB(ConfigurationManagementData-base)即配置管理数据库,是一种用于管理企业IT资产和配置信息的数据库,主要用于存储、管理和跟踪企业内各种IT资源的配置信息,如:服务器、CMDB通常包含以下信息:资产清单:记录企业拥有的所有的IT资产,如:配置信息:包括硬件配置、软件版本、网络设32关系映射:展示IT资产之间的关联和依赖关系,变更历史:追踪IT资产的变更记录,包括:时合规性信息:满足法规和政策要求的相关信息,3.5.2统一运维数据运维数据是指业务平台或者业务系统在运行过程中产生的告警、事件、监控指标、日志文件等数据,通常作为表征系统性能、网络状态、设备健康状况的关键指标。通常可分为运维运行数据和运维流程CPU占用率超过阈值CPU占用率、内存占用率、业务运行日志、Tomcat运行日志表3.13运维运行数据举例表3.14运维流程数据举例API对接简单易用,适用性广泛,通用的方式可用于各种类型的.可自定义模块和属性字段,获取想要的模型信息.大量数据通过API传输,需要考虑并发请求管理和.需要定制开发适配层推送或接收APIKafka推送.高吞吐量,分布式消息队列支持大规模数据推送.可持久化存储信息,即使消费者离线也能保证数据可靠地传输.Kafka需要额外资源进行部署,同时需要维护团队SNMP对接.SNMP接口通过SNMP协议向第三方系统发送告警Trap,同时接收并响应第三方系统发过来的命令。标准的.自定义能力稍弱,需要具备定制化配置表3.15告警事件对接方式33(如Zabbix).架构比较简单,只要知道服务端地址和协议就可以推.监控平台作为数据被动接收方,接收数据的组件无状.如果数据一开始未推上来,从监控平台视角较.需要事先知道监控服务端地址才能接入,如果某个组件是先于监控系统部署的,可能就需要重启这(如Prometheus).很容易感知目标监控对象是否存活,拉不到数据就说明.被监控的服务可以先部署,后面再部署监控系统,不重.需要一个注册中心,拿到目标地址列表,架.监控系统要提供Agent,会带来管理上的复杂度API对接.简单易用,适用性广泛,通用的方式可用于各种类型的.可自定义模块和属性字段,获取想要的模型信息.目标系统的数据类型和数据格式强依赖API接口的完备Kafka推送.高吞吐量,分布式消息队列支持大规模数据推送.可持久化存储信息,即使消费者离线也能保证数据可靠.Kafka需要额外资源进行部署,同时需要维护团队表3.16监控指标对接方式.在数据量大时,通过文件传输不会超时,且不占用网络带宽.方案简单,避免了网络传输和网络协议相关的复杂性.不适合做实时类业务,因为文件传输存在延迟.需要共同的文件服务器,存在文件被篡改、删除或泄密.当改变文件格式时,需要各个系统都同步做修改,增加.提供了分布式日志收集、数据解析、实时分析等功能,适应云.能够统一收集、存储和分析日志数据,提高运维效率.部署和配置相对复杂,需要一定的技术储备和.对于大规模日志数据,可能需要较高的硬件资源和成本API对接.跨平台、跨语言,易于集成到不同的系统中.提供了标准的接口规范,方便不同系统之间的通信和数据交换.依赖于网络传输,可能存在网络延迟和不稳定的问题.接口的维护和更新需要各个系统同步进行,增加了协调表3.17运行日志对接方式34API对接.简单易用,适用性广泛,通用的方式可用于各种类型的.可自定义模块和属性字段,获取想要的模型信息.目标系统的数据类型和数据格式强依赖API接口的完备.不依赖API,通过ETL数据抽取工具直接从数据库抽取.数据对接效率高.数据安全性较差,需要将数据库暴露给运维管理平台运维数据治理是确保信息系统稳定运行和业务连续性的重要手段,通过统一管理和分析运维数据,可以提高运维效率和质量,降低运维成本,为企业的运维数据治理需要依赖大数据、数据仓库、数据库等数据处理软件,将数据进行集成后,进行数据抽取、数据湖处理,录入数据仓库进行分库分表,最终通过数据应用进行统一权限控制,典型数据处理1.数据集成:这些数据并非全部是结构化的数据,因此需要有完备的数据集成平台支持多种运维数据接入(如消息队列、API集成、SFTP集成等)。2.数据抽取:数据接入之后由ETL对单条数据进行过滤、切分、扩展、格式化等操作,统一放到消息3.数据湖处理:不同的数据主体消费消息队列中的数据,完成不同的数据存储,如原始日志或者指标存放到OBS中、单条粒度数据直接入库或者通过格式定义存放到ClickHouse中、时序多维度量数据需要依据一定的数据治理规则分多个表保存在MPPDB中。表3.18运维流程数据对接方式4.数据应用:所有运维数据治理完成之后,由数据应用对数据进行API封装,提供对外统一查询接口。3.5.3统一故障处理运维管理平台构建统一CMDB对所有的运维对象进行统一管理,当故障发生时,可以针对应用系统的异常指标进行全链路观测、故障诊断以及故障恢全链路观测是现代政企运维中的一项核心能力,它综合利用多种运维数据,如调用链、日志、指标、配置、网络等,构建以业务为观测视角的端到端链路,旨在提升多系统同时告警时的业务影响分析能全链路观测能力可以分为组件可观测、资源可观测资源可观测主要针对平台层,通过打通云服务-微服务-微服务实例-虚拟机/容器-宿主机关联关组件可观测和网络可观测主要针对应用层面,通35在拓扑视图中直观呈现,运维人员可以从多个维度快速感知故障影响范围,并对故障进行简单定·组件可观测视图:基于APM调用链能力,追踪应用进程内部的函数调用路径,用于跨线程和·网络可观测视图:基于eBPF内核组件和网络报文染色能力,无侵入式覆盖网关、基础服务、故障诊断的核心在于其强大的数据采集与分析能力。通过部署在运维平台上的监控工具,系统能够实时采集各类数据,包括系统日志、性能指标、网络流量、异常告警等。这些数据经过清洗、整合后,形成运维数据仓库,为后续的智能分析提供基础。利用机器学习、深度学习等算法,故障诊断系当故障发生时,系统能够迅速启动故障诊断流程,通过关联分析、模式匹配等方法,精准定位故障源头,并提供修复建议,从而大大缩短故障排查与恢以华为混合云为例,主要通过纵向物理拓扑辅助定界、专业运维工具辅助定位、基于故障模式的确定性故障诊断等方式,三位一体确保“确定性故障分纵向物理拓扑辅助定界:以CMDB为核心,构建云服务、微服务、微服务实例、虚拟机、容器、宿主机5层物理拓扑,叠加监控、告警、日志等可专业运维工具辅助定位:通过数据集成、页面集成、快速链接等方式提供丰富、连贯的云平台运确定性故障分钟级诊断:基于故障模式的故障诊断项,运维治理包和基线版本解耦,快速迭代,持续完善故障模式库,提升云服务确定性故障定故障恢复需要综合考虑故障识别、诊断、恢复、根源消除和预防等多个方面,通过科学的方法和有效的策略,确保业务系统能够快速、稳定地恢复运以华为混合云为例,主要通过确定性故障分钟级恢复、未知故障快速切换的方式进行故障快速恢复能确定性故障分钟级恢复:常见云服务100+恢复操云服务360:集中节点诊断、远程操作等能力,实现在线故障处理,同时提供全量告警帮助支撑故云平台高可用:支持跨AZ高可用、跨region高可用、两地三中心高可用方案,故障发生时可快速3.5.4统一自动化传统运维人员做运维时大多基于技术文档手工到设备上执行相关的运维命令,存在运维操作繁琐,运维经验不能固化,运维操作缺乏审计等问题。通过自动化运维平台可以将运维操作单元标准化,运维操作流程可编排,运维操作自动化,运维记录可审业界自动化运维平台也有很多开源的项目,包括Ansible、Saltstack、puppet、chef等,普遍具36设备管理:支持查询待运维设备列表,并支持向设备批量安装/卸载Agent并支持查询安装卸载Agent日志。操作管理:单个原子的运维脚本封装成一个运维操作,一个运维脚本完成一个明确的运维动作,系统支持内置操作库和自定义操作库,内置操作库内置丰富的日常运维操作,自定义操作库方便编排管理:提供编排管理功能,编排管理支持将原子的操作或子编排通过统一的工作流引擎编排起来,灵活的组装出各种运维场景。可以支持图度操作或编排到指定的设备上执行,作业参数可安全策略:为了便于控制自动化运维平台的使用,自动化作业平台应该具备安全策略功能,管理员可以定义什么时间,什么人,对哪些设备可以执行哪些操作或编排,以实现对敏感操作的控3.5.5统一运维展示运维管理平台中的运维展示功能是现代运维工作的重要工具,它提高了运维工作的可视化程度和透明度,为运维人员提供了全面、准确的数据支持。运维展示功能主要包含统计报表、监控大屏、资源池VDC资源详情统一OLAP数据模型图3.19运维展示功能示例37用户可以自定义可视化部件,将性能、容量、资源等不同维度的数据通过曲线图、饼图、柱状图多种样式组合展示在不同的Dashboard中,也支持卡片、地图、文字、表、树、图片等多种方式,帮助支持创建、编辑、删除、预览、移动分组、收藏提供丰富的展示控件和灵活强大的拖拽式自定义组件自定义数据集、维度和指标,数据展示灵活运维管理平台应建设标准的容量视图、容量阈值管容量视图:用户通过容量视图可以了解计算、存储、网络等基础资源的容量信息和容量使用的历容量阈值管理:用户可根据需要设置指定Region的各项阈值规则,当容量消耗达到指定阈值时,产生容量风险告警,提醒用户及时发现容量风容量趋势分析和预测:通过历史容量指标给出容量预测,以便管理员对资源容量做好规划和扩3.6运维安全设计传统数据中心的运维安全并未引起广泛重视,但业务上云之后,任何一个安全事件都可能导致数以万计的系统受到影响,因此面向云数据中心的运维安全体系至关重要。运维团队需要加强安全意识,在云运维的领域内建设运维安全体系,利用自动化工具和先进的监控技术,确保系统的安全性、稳定性在运维安全体系建设过程中,需要聚焦1个目标、2个认证、5个安全。1个目标是指要以构筑安全合规的管理体系,提供可信可控的运维服务为目标,基于ISO27001认证、网络安全三级等保认证2个认证,从数据安全、IT安全、人员安全、物理安全、作业可信5个方面系统化构建运维安全体系,有效防范IT安全·安全意识培训·网络安全认证·持证上岗·背景调查·方案审核·人员管理IT安全·安全意识培训·网络安全认证·持证上岗·背景调查·方案审核·人员管理·高危命令校验/拦截·安全审计·IT安全策略·IT安全操作·客户端认证·客户授权·CCTV、7*24H安保·电源保障·火灾检测与消防·门禁与安全区域设置ISO27001认证网络安全三级等保认证·数据分类和保护·数据处理安全·风险分析和事故响应·安全合规审计3.6.1安全目标安全合规的管理体系为组织提供了宏观的安全框架和政策保障,而可信可控的运维服务则是确保这一框架和政策在具体实践中的有效落实,二者相辅相成,共同保障信息系统的安全性、稳定性和合规1、构筑安全合规的管理体系是指在组织内部建立起一套系统化的、符合国家和行业安全标准的管理框架,确保信息安全政策、流程和措施的实施符合相关的法律法规要求。这一体系不仅要保障信息的机密性、完整性和可用性,还要遵循外部和内部的合规要求,防止合规风险、法律风险以及安全漏洞带2、提供可信可控的运维服务目标是指在云平台、数据中心、网络环境等IT基础设施上,通过完善的技术手段和管理机制,确保系统、应用及数据的运维过程安全、可靠,并且能够对整个过程进行有效的监控、审计和控制。运维服务是企业IT环境中至关重要的部分,尤其是在信息安全要求较高的环境下,如何实现运维服务的可信性和可控性是非常重要的目38383.6.2安全认证1、ISO27001认证:信息安全管理体系符合ISO/IEC27001标准要求能够有效保护组织的信息资产,降低信息安全风险。获得ISO27001认证的组织会被认可为符合国际公认的信息安全标准,能够2、网络安全三级等保认证:信息安全等级保护制度将信息系统按照其对国家安全、社会稳定、经济发展和人民生活的影响程度,划分为五个安全保护等级。三级等保主要面向对社会秩序、经济和人民群众利益有重大影响,对国家安全和社会稳定可能会造成较大损害的关键信息系统。三级等保认证适用于政府、金融、能源、运营商、互联网等行业。认证的主要目的是保护信息系统的机密性、完整性和可用性,保障信息系统抵御外部威胁和内部风险的说明:ISO27001与三级等保的区别ISO27001是国际标准,侧重于信息安全管理体系的建设,适用于各种规模的企业,并且适用的范三级等保是国内特有的等级保护体系,主要针对中国境内的信息系统,特别是关键信息基础设施,具有强制性和地域性要求。其标准更为细化,涵盖了技术、管理、法律等多个方面的内393.6.3安全保障1、数据安全:是云运维中的核心内容,面向数据提供多层数据保护机制,保障客户数据全生命周期可靠可用。如下图所示,基于访问-传输-存储-删除的运维数据全流程对数据实施全方位保护。有限采集安全传输可靠存储管控使用HTTPS,数据防泄露安全传输:采用专网/IPSecVPN隧道作为传输通道,使用HTTPS安全传输协议,在存储和传输过程中对敏感数据进行加密,使用强加密算法(如AES-256)保障数据的机密性,互相验证对方身份并进行加密传输,数据防泄露可靠存储:运维数据仅运维中心存储,不出运维管控使用:实施最小权限原则,确保只有授权用户和应用可以访问敏感数据,并定期审核权限设置。客户授予运维人员最小使用权限,防恶意使用。对敏感数据进行去标识化或匿名化处理,降安全销毁:历史数据销户时安全擦除,数据防恢复2、IT安全:涵盖了云平台及其资源、应用、网络和服务的全面保护,提供完善IT安全策略与措施,实现运维操作可审计,确保云环境不受恶意攻击、滥用3、人员安全:侧重于保障云平台中所有人员(包括管理员、运维人员、开发人员和终端用户)不因人4、物理安全:防止数据中心被物理破坏、盗窃或遭受其他自然灾害的影响,运维中心根据业界物理与5、作业可信:确保所有与云平台相关的操作、部署、维护和更新工作都能在安全的环境下进行,防止因操作失误、配置错误或滥用权限导致安全事件。通过运维平台接入授权机制和堡垒机操作监控,严格遵守变更作业流程,落地运维中心作业可4.1建设背景为深入践行“十四五”战略规划,全面推动企业高质量发展,某集团启动数字化转型核心工程,构建新一代数字平台。该平台以云底座为基石,以云服务为引擎,构建起双轮驱动的创新架构,深度赋能集团总部及21家二级单位,助力业务模型创新升级面对旗下28家数据中心管理分散、技术路线多元的复杂局面,该集团携手华为,充分发挥华为在数字化领域的技术优势与实践经验,共同打造统一的运维体系,构建标准化、规范化的管理模式。通过资源整合与流程再造,全面提升数字化运维效率,加云底座运维(包括硬件设备运维与云平台运维)ITSM平台(IT服务管理平台)未实现SLA跟踪与日常运维活动、主动运维活动、变更通报机制等以上问题的出现,归结起来主要源于该集团在组织岗责、工具平台、流程规范及度量体系方面的能力组织岗责:岗位职责不明确,组织之间边界不清晰,缺失协同机制导致团队协作不畅。人员技能弱,缺少系统性赋能培训,无法满足业务高速增4.2运维痛点分析业务出现问题后找不到对应的支撑运维人员或运维人员认为不属于自己职责范围,需要反复沟通协2、云相关故障定位问题慢,恢复周期长重大故障定位时没有构建WarRoom,各模块之间缺乏协同,各自为战,无SLA跟踪,影响故障处理3、运维以被动响应为主,缺乏主动运维动作管理日常巡检、数据备份、容量风险管理、看网讲网等主动运维动作未进行规范化管理,导致隐患和风险4、变更管控不严,导致变更失败或影响上层业务变更方案准备不充分,未充分考虑变更对上层业务5、运维平台工具不完备工具平台:服务申请和需求审批等功能线下流转,效率低下,体验不佳。平台注重故障监控和资源管理,工单功能比较单薄,且无在线度量与流程规范:流程未进行体系化梳理,相关流程模板不完备,无法支撑流程高效流转;流程设计缺乏系统性审视,导致部分环节缺少关键管控节度量体系:缺乏运维相关度量评价指标,运维工作质量难以衡量;未建立考核激励体系,运维人4.3运维体系规划设计42搭建全新的运维组织架构,明确岗位职责,建立人2、流程规范建立立体化运维管理机制,健全云平台相关运维流程和规范,以流程规范驱动运维活动标准化、规范3、度量体系建立评价度量机制,完善运维SLA,确保运维活动可落地、可衡量,以此牵引高效运维服务能力的构4、工具平台构建集“监、管、控、营、服”于一体的现代化运维服务管理平台,覆盖机房动环、基础设施、网络、数据、应用、安全六大领域,打造全链路、一运维价值运维价值运维能力日常巡检看网讲网日常巡检看网讲网···运维活动运维体系√√岗位指责√变更管理流程√租户管理办法√服务履行时长√技能模型√技能模型√问题管理流程√机房管理制度√资源使用率√组织架构√组织架构√事件管理流程√配额管理制度√内存分配率···············云管平台自动化运维工具巡检工具云管平台自动化运维工具巡检工具···平台工具4.3.1组织岗责设计原则432、层次分明:建立分层运维体系,一线负责日常监控与基础故障处理,二线解决复杂技术问题,三线对接厂3、高效协同:建立跨团队协作机制,利用工单系统、即时通讯工具实现信息实时共享,制定标准化流程,明4、冗余配置:关键岗位采用AB角或多人协作机制,避免单点依赖。5、弹性扩展:组织架构应具备弹性,能够快速适配6、安全合规:设置安全运维岗位,负责安全策略制定、执行和监控,确保符合相关法组织架构设计针对运维体系存在的管理分散、响应滞后等痛点,通过设立运维经理、服务台、云底座运维、网络运维、安全运维等关键运维岗位,形成“集中调度、专业支撑、协同保障”的运维架构,为该集团数字平台的安全稳定运PMO能力支撑组上云拓展组经营管理组品牌运营组工具平台运维工具平台运维安全运维网络运维云底座运维安全运维网络运维云底座运维服务台PaaS运维···············图4.2集团运营中心组织架构4岗位职责云平台安全稳定与运维服务满意度第一责任人,负责运维团队的日常管理,看护运维团队对外统一服务窗口,提供7*24小时服务。负责云平台告警监控、业务咨询、事件受理、问题的初步定负责云底座相关的问题处理、紧急恢复、变更支持、风险清理、日常巡检、版本升级、负责数据中心网络、集团园区网络、骨干网运维的运维工作,包括网络维护与故障处理负责云平台安全相关的问题处理、紧急恢复、变更支持、风险清理、日常巡检、PaaS运维负责云平台PaaS服务的问题处理、紧急恢复、变更支持、风险清理、日常巡检、版本升级等工作。4.3.2流程规范设计原则以职责清晰、简单易懂、实用高效为原则,借鉴DevOps理念、IT4IT参考架构,ITIL4最佳实践以及ITSS国提升流程效率可以通过缩短时间、降低人工干预占比流程可视化促进IT运维活动透明,信息共享提升效率与体验。运维活动45包括变更受理、变更准备、变更方案制定与评审、变更实施、变更结作。配置变更仅涉及日常的变更,如配置文件修改、补丁包升级、扩《现场技术服务报告》云平台发生紧急故障造成业务中断时,运维工程《紧急故障恢复报告》对云平台的日常问题进行处理。主要包括问题受理、问题定位、问题解等运维活动。当无法解决时,可通过厂商提供技术《基础运维工作周报》对云平台开展日常健康检查,并对巡检中发现的设备异常和云平台告警《基础运维工作周报》7*24小时《基础运维工作周报》对云平台管理面数据进行备份和恢复,以确保因操作不当或网络环境异《数据备份记录表》识别、评估和清理现网的潜在风险,降低潜在风险造成的突发性事件《风险跟踪记录表》2、主动预防为避免同类故障再次发生而进行的事后总结工作,包括故障回《故障复盘报告》对云平台开展健康分析和总结,输出月度总结和优化建议报告,包括:量分析、云平台运行状况分析、云服务告警分析、云平台健康分析、《运行分析月报》对云平台开展深度健康检查,评估是否存在安全隐患以及是否需要进行《隐患排查报告》对云平台组网架构的可靠性、冗余性、性能瓶颈进行评估分析,输出云架构、配置项、版本兼容性、资源性能、云服务性能、风险评估、预《看网讲网报告》3、运维管理识别云平台风险,提出合理优化建议,提前规避风险的发生。针对厂《运行分析月报》《运行分析月报》对问题进行种类分析、问题量趋势分析、共性问题根因分析,同时提出《运行分析月报》464、版本升级《升级报告》《升级报告》为保证云平台处于最佳运行状态而进行的维护行为,包括升级流程设计为该集团构建了一套覆盖全生命周期的标准化运维流程体系,通过明确权责边界、优化流程节点、建立跨部门联动机制,实现运维工作的规范化、透明化与高效化,全面提升运维服务质量与响应效率。由于篇幅有限,此指非紧急的,能通过正常程序化的申请、评估、批准、排序、计划、测试、实施和回顾的变更,如常规的版指非紧急的,能通过正常程序化的申请、评估、批准、排序、计划、测试、实施和回顾的变更,如常规的版分为A级变更、B级变更、C级变更和D级变更。为了处理生产环境不可用、即将不可用或紧急满足业务需求而提出的计划外变更。如新暴露出来的(包括现网用户和各系统平台的使用者)使用过程中出现直接影响操作的问题、需要满足用户业务紧急需求的交付或者新产品上线需求等。分为A级变更、B级变更和C级变更。2、变更级别A级变更指将导致系统不可用,用户业务工作无法进行或重大IT基础设施的变更可能影响到现网服务,如:升级导致用户不能创建虚拟机和新业务不能正常下发;升级导致用户不能下订单,续订,或对订单进行操作;网络变更导机房基础设施类重大变更等。管理面中断5分钟及以上或业务平面中断5秒及以上的变更,判定为A级变更。B级变更1、管理面中断5分钟以内或业务平面中断5秒以内的变更,判定为B级变更。2、业务无中断,但是无法标准化、工具化、自C级变更标准化或工具化,不能全流程自动化的变更场景。通过重大变更评审会评审发布的白名单化管理(C级白名单)。通过重大变更评审会评审发布的白名单化管理(D3、变更结果定义成功:变更按既定方案正常实施,且24小时内未引起任何现网问题。失败:变更回退(包括回退成功和回退失败);24小时内变更引起计划外的业务中断;变更引起事件等。474、角色与职责作为变更责任人,负责按规范要求提交变更申请,确保变更提交信息正确,包括变更负责按照评审变更方案的准确性,与变更方案输出人1.负责对变更申请进行沟通及排期,并且针对2.负责对重大变更进行预审,并且组织重大变更评审会。3.负责通过变更数据的持续分析提出产品变更能力改进方向及变更流程的持续优化。4.对变更的流程遵从度负责。1.负责对A/B/C级变更的方案、计划和变更相关人员资质进行评审和决策。2.对整体的变更规范性和质量负责,包括对变更版本质量、变更方案、变更计划和变更相关人员负责对A级变更、其他申报重大变更评审的变更方案、计划和变更相关人员资质做出审1.负责按最终批准后的实施方案实施变更,验证变更结果。2.对变更实施结果负责,对变更单中实施信息记录的准确性负责。1.变更过程中配合变更实施人进行辅助变更操作、变更操作1+1check2.与变更实施人共同对变更实施结果负责,对变更单中实施信息记录的准确性负责。3.A/B级变更必须有变更配合人;C级变更通过白名单管理是否需要变更配合人;D级变更不强制5、变更流程常规变更流程:常规变更指非紧急的,能通过正常程序化的申请、评估、批准、排序、计划、测试、实施和回48A级变更是是PMO审批是B级、C级变更是是PMO审批人会是变更失败PMO是否否否否否否否12变更指导书及测试报告(如需)试报告(如需)3测试报告(如需)(如需)4告(如需)49562.明确变更对现网、用户可能带来的策略及方式(如需)3.审批变更申请单通过单7等2.明确变更对现网、用户带来的风3.审批变更申请单通过893.若变更失败引起现网故障,需申紧急变更流程:紧急变更是指为了处理生产环境不可用、即将不可用或紧急满足业务需求而提出的计划外变更。流程要求如下:50A级变更变更申请→数管中心主管审核→系统处审核→变更评审人评审(运维经理)→评审B级

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论