故障处置实施细则_第1页
故障处置实施细则_第2页
故障处置实施细则_第3页
故障处置实施细则_第4页
故障处置实施细则_第5页
已阅读5页,还剩9页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

故障处置实施细则第一章总则1.1目的本细则用于规范××公司信息通信系统(以下简称“系统”)故障处置全过程,确保故障在最小时间窗内定位、隔离、修复并闭环,保障业务连续性,降低经济损失与合规风险。1.2适用范围适用于××公司生产环境、灾备环境、测试环境内所有软硬件、网络、安全、动力环境故障。外包团队、第三方厂商、云服务商驻场人员同步执行。1.3法规与制度依据《网络安全法》第21、22条,《数据安全法》第27条,《关键信息基础设施安全保护条例》第15条,ISO22301:2019,GB/T20988-2007,××公司《信息安全管理办法》《变更管理办法》《值班管理办法》。1.4术语定义MTTR:故障平均修复时间,从告警发生到业务恢复≤30min。MTTI:故障平均定位时间,从告警发生到根因定位≤15min。P1故障:核心业务不可用≥5min或影响金额≥100万元/小时。P2故障:非核心业务不可用≥30min或影响金额≥10万元/小时。P3、P4故障:一般与轻微故障,按SLA降级处理。1.5处置原则先恢复、后修复;先核心、后边缘;先隔离、后定位;全过程留痕;信息最小化披露;双人复核;一事一复盘。第二章组织与职责2.1应急指挥组(EC)由CTO任总指挥,运维总监任副总指挥,成员包括网络、系统、数据库、安全、业务、客服、供应链、财务、公关负责人。职责:启动Ⅰ、Ⅱ级响应,决策降级、切换、回滚、媒体通报,30min内发布应急公告。2.2现场处置组(OT)一线值班工程师(L1)、二线技术专家(L2)、三线架构师/厂商专家(L3)组成。职责:故障定位、隔离、修复、验证、提交RCA。2.3支持保障组采购部:10min内响应备件采购需求。行政部:提供交通、住宿、餐饮、临时通行证。法务部:审核对外公告,规避措辞风险。财务部:预拨应急资金100万元,先付款后补合同。2.4监督审计组风控与审计部独立记录处置时效、操作合规性,24h内出具《应急审计快报》,对违规操作一票否决,直接上报董事会。第三章故障分级与响应矩阵3.1分级标准P1:支付、订单、库存、物流、认证任一模块不可用。P2:报表、BI、消息推送、OSS不可用。P3:内部OA、培训系统不可用。P4:非生产环境单点故障。3.2响应矩阵P1:5min内电话+钉钉+短信通知EC,15min内L1、L2、L3到岗,30min内业务恢复,6h内提交RCA。P2:10min内通知,30min内L1、L2到岗,2h内恢复,24h内提交RCA。P3、P4:30min内通知,4h内恢复,72h内提交RCA。3.3升级规则同一故障多系统联动影响金额累加升级;连续3次同类故障自动升一级;客户投诉量>50件/小时直接升P1。第四章故障发现与报告4.1发现渠道监控系统:Prometheus、Zabbix、Grafana、Falcon、AliCloudCloudMonitor、自研日志中心。客户渠道:400热线、在线客服、微博、公众号、邮件。内部渠道:员工报障、业务部门群、运营值班日报。4.2报告模板必填字段:故障现象、发生时间、发现人、影响范围、初步等级、已采取措施。模板固化在Jira字段,未填写完整无法流转。4.3首报时效L1值班工程师须在3min内完成首报,超时未报视为瞒报,按《员工手册》第3.2.4条记大过一次,扣当月绩效50%。第五章故障定位与隔离5.1定位三板斧1.看监控:检查最近5min内CPU、内存、IO、网络、错误日志曲线。2.抓现场:立即dump线程、保存GC日志、抓网络包(tcpdump-iany-s0-w/tmp/`date+%s`.pcap)。3.比变更:查询CMDB最近72h内变更记录,含代码发布、配置变更、补丁、重启、拓扑调整。5.2隔离策略网络层:关闭端口、黑洞路由、ACL拒绝、DNS摘除。应用层:降级开关、限流熔断、关闭非核心接口、切流至只读副本。数据层:主库挂起写、从库提升、暂停同步、关闭批处理。物理层:下电、关机、拔掉光纤、关闭PDU。5.3定位工具Arthas:快速诊断Java方法耗时、火焰图。Wireshark:分析TCP重传、RST、异常报文。strace/dtrace:跟踪系统调用耗时。blktrace:定位磁盘IOhang。chkrootkit、rkhunter:排查rootkit。5.4定位完成标志在Jira中填写“根因分类”字段:代码缺陷、配置错误、基础设施、网络、安全攻击、第三方、人为误操作、不可抗力。未填写视为未定位,不得进入“修复”阶段。第六章故障修复与验证6.1修复权限P1:由EC总指挥口头授权,可跳过变更评审,但须事后24h内补单。P2:运维总监书面或钉钉“已读”授权。P3、P4:按正常变更流程执行。6.2修复方案三选一1.回滚:代码、配置、数据能在10min内回退到上一版本。2.热修:通过配置中心、开关、脚本、补丁在线修复,无需重启。3.重启:强制释放句柄、内存碎片、锁资源,需提前保存现场。6.3验证checklist功能验证:调用主流程接口100次,错误率<0.1%。性能验证:峰值TPS恢复到故障前90%。日志验证:ERROR、WARN级别日志归零。监控验证:所有告警项恢复绿色>10min。业务验证:财务、运营、客服在《业务验收单》签字。6.4灰度与全量支付、订单类系统必须灰度5%流量15min,无异常再全量。灰度失败一键回滚时限3min。第七章信息发布与舆情管控7.1对内口径统一由EC指定“信息官”在“应急作战群”发布,禁止个人截图外泄。违规者按《保密制度》第5条解除劳动合同并追偿。7.2对外口径P1故障:2h内由公关部在微博、公众号、短信、邮件发布《服务异常公告》,含现象、影响范围、预计恢复时间、致歉。P2故障:4h内发布公告。P3、P4:不主动公告,用户问起可私下解释。7.3舆情监控采用“舆情雷达”系统,每5min爬取微博、知乎、脉脉、黑猫投诉,负面情绪>100条/小时,自动升级至P1。第八章数据备份与恢复8.1备份策略数据库:全量每日02:00,binlog实时;保留30天,跨地域复制至阿里云OSS深度归档。对象存储:版本控制开启,多AZ冗余。虚拟机:CBT备份,RPO≤15min,保留7天。Kubernetes:ETCD快照每6h,保留3天。8.2恢复演练每月最后一个周五凌晨进行“混沌演练”,随机抽选1套核心系统,注入数据损坏故障,要求30min内完成Point-in-Time恢复,演练报告提交EC。8.3备份可用性校验每日14:00自动拉起备份副本到隔离网段,启动应用并跑200笔测试交易,校验数据一致性,失败立即发起告警。第九章应急切换与容灾9.1双活架构南北两个可用区,延迟≤30ms,采用MySQLGroupReplication+MHA,应用层无状态,流量通过GlobalLoadBalance按权重50/50分发。9.2切换阈值主可用区P1故障>5min或数据库延迟>60s或网络丢包>1%,自动触发DNS切换,TTL30s。9.3切换流程1.监控系统自动发送“切换事件”至钉钉群。2.值班工程师1min内确认,输入“确认切换”口令。3.阿里云DNSAPI自动修改A记录,权重0:100。4.数据库提升从库为主库,应用重连池刷新。5.客服公告切换完成。9.4回切条件故障根因修复且稳定运行>24h,数据库延迟<1s,经EC书面批准执行回切,回切窗口为业务低峰期00:00-05:00。第十章故障关闭与复盘10.1关闭标准业务指标恢复并持续稳定>2h,监控告警清零,客户投诉归零,RCA报告评审通过,改进措施录入Jira且责任人+完成时间明确。10.2RCA模板1.故障标题2.故障时间线(精确到秒)3.影响范围(系统、金额、客户数)4.根因分析(5Why+鱼骨图)5.处置过程评价(MTTI、MTTR、沟通、协作)6.整改措施(技术、流程、管理、工具)7.责任划分(直接、间接、管理)8.经验总结10.3复盘会议P1:故障关闭后24h内,EC组织,时长≤90min,会议录音保存3年。P2:48h内,运维部组织。P3、P4:1周内,模块团队自行复盘,抄送运维部。10.4改进跟踪所有改进措施纳入“故障改进Backlog”,采用KPI+OKR双轨:KPI为“下月同类故障再现0次”,OKR为“自动化覆盖率提升20%”。未达成扣减责任团队季度奖金10%。第十一章培训与演练11.1培训周期新员工入职1周内必须通过“故障处置沙盘”线上考试≥90分,否则延期转正。11.2演练类型1.桌面推演:每季度一次,模拟P1场景,用Miro画泳道图。2.实战演练:每半年一次,真实注入故障,采用ChaosBlade。3.跨部门演练:与银行通道、物流承运商联合演练,确保接口级SLA。11.3演练评估从“检测、通报、定位、隔离、恢复、复盘”六维度打分,<80分需重新演练,费用计入部门成本。第十二章工具链与资产12.1监控告警Prometheus+Alertmanager+Webhook至钉钉,告警分级标签:severity=“P1/P2/P3/P4”。告警降噪:同指标5min内≥3次才触发,自动抑制夜间非核心告警。12.2CMDB采用自研系统,字段≥120项,与阿里云API、K8s、Jenkins、Terraform实时同步,每日自动巡检差异>1%即告警。12.3自动化平台基于AnsibleTower、Jenkins、ArgoCD,故障场景剧本化:剧本“mysql_slave_lag”:自动提升从库、修改配置、重启应用,平均耗时180s。剧本“cdn_502”:自动刷新全站缓存,耗时90s。12.4知识库使用Confluence,故障案例>800篇,搜索响应<500ms,每月PV>1万次。新增案例须在故障关闭后3个工作日内完成,逾期扣0.5分绩效。第十三章合规与审计13.1等级保护所有处置操作必须留痕,日志保存≥180天,符合等保2.0三级要求。13.2审计抽样风控部每月随机抽取10%故障单,核对操作日志、录屏、会议纪要一致性,发现差异>1项即启动问责。13.3外包管理外包人员须签订《故障处置保密协议》,操作须本公司员工双人旁站,违规一次扣除外包服务费10%,累计三次终止合同。第十四章奖惩与绩效14.1奖励P1故障在30min内恢复,团队奖励5万元,个人视贡献奖励5000-20000元,并通报表扬。14.2惩罚瞒报、迟报、误操作导致故障升级,直接责任人记大过一次,扣季度绩效50%,情节严重者解除劳动合同。14.3绩效挂钩运维部KPI中“故障处置”权重占40%,计算公式

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论