信息化系统运维管理办法_第1页
信息化系统运维管理办法_第2页
信息化系统运维管理办法_第3页
信息化系统运维管理办法_第4页
信息化系统运维管理办法_第5页
已阅读5页,还剩17页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

信息化系统运维管理办法一、第一章总则第一条目的为规范本单位信息化系统运维工作,保障系统稳定、安全、连续运行,明确运维职责、工作流程与服务标准,实现运维活动可度量、可追溯、可改进,制定本办法。第二条编制依据本办法依据《中华人民共和国网络安全法》《中华人民共和国数据安全法》《中华人民共和国个人信息保护法》《信息安全技术网络安全等级保护基本要求》(GB/T22239)及本单位信息化管理相关制度编制。第三条适用范围本办法适用于本单位建设、使用或托管的全部信息化系统,包括业务应用系统、数据库、中间件、服务器、存储、网络设备、安全设备、机房环境、终端及云平台资源的运维活动。第三方供应商、外包运维人员在本单位从事运维作业,必须遵守本办法,并在合同与保密协议中予以明确。第四条管理原则•安全优先:当运维效率与安全要求冲突时,以安全为底线,任何变更不得绕过安全控制。•分级保障:按系统重要程度分配运维资源,核心系统实行7×24小时保障。•流程闭环:事件、问题、变更、发布均须经历登记、审批、执行、验证、归档全过程。•最小授权:运维权限按岗位授予,默认最小权限,定期复核,离岗即收回。•可审计:所有生产环境操作必须留痕,日志保存期限不少于6个月,等级保护第三级系统不少于1年。二、第二章组织与职责运维组织采用"决策层—管理层—执行层"三级架构,职责不清是运维事件扩大的首要原因,因此每个角色必须对到具体岗位而非部门。第五条信息化工作领导小组由分管信息化工作的单位负责人任组长,负责审定运维年度规划、年度预算、重大运维事件定级及追责结论。每季度召开1次运维工作专题会议,会议纪要于会后2个工作日内下发。第六条信息化管理部门作为运维主管部门,履行下列职责:1.制定并修订运维制度、标准操作流程(SOP)与应急预案;2.统筹日常运维、值班排班、监控告警与事件处置;3.组织变更评审、发布窗口管理与应急演练;4.管理运维供应商,组织服务考核;5.按月编制运维服务报告,按年度组织运维能力评估。第七条业务部门业务部门是系统使用与需求提出方,设系统联络员1名,负责:•报送本部门业务运行异常与用户故障;•参与用户验收测试(UAT)并对业务功能确认签字;•在系统切换、数据订正等涉及业务数据的操作前进行业务核实。第八条运维岗位设置运维执行层至少设置下列岗位,可一人多岗,但系统开发人员不得担任同一系统的生产环境管理员:岗位核心职责不得兼任运维负责人统筹排班、变更审批、事件指挥具体操作执行人系统管理员操作系统、虚拟化、服务器运维数据库管理员(核心系统)数据库管理员数据库安装、备份、性能调优、数据订正业务应用管理员网络管理员网络设备、链路、负载均衡运维安全策略审批人安全管理员安全设备、漏洞、基线、审计管理系统管理员(同设备)应用管理员应用部署、配置、日常巡检生产数据库直接写权限服务台专员工单受理、一线处置、用户回访二线技术处置三、第三章运维对象分级系统分级决定响应时限、备份频率与保障级别,未分级系统按最低配保障,由此导致的资源不足由系统归属部门承担。第九条分级标准级别判定标准(满足其一即归入)保障要求一级(核心)支撑单位核心业务,中断2小时内造成重大经济损失或严重社会影响;等级保护第三级及以上系统7×24监控,15分钟内响应,RPO≤15分钟,RTO≤2小时二级(重要)支撑重要业务,中断4小时内影响较大范围业务办理7×24监控,30分钟内响应,RPO≤1小时,RTO≤4小时三级(一般)内部管理类系统,中断1个工作日内可承受工作时间监控,1小时内响应,RPO≤24小时,RTO≤1个工作日RPO指故障发生后允许丢失的数据时间长度,RTO指系统恢复运行允许的最长时间。系统级别每年复核1次,由信息化管理部门提出、业务部门确认、领导小组审定。四、第四章日常运维管理4.1第一节监控与告警第十条监控覆盖要求一级、二级系统必须实现下列层面监控,监控覆盖率以可采集指标的设备/组件数量占比计算,每月通报,一级系统不得低于98%:•基础设施层:CPU、内存、磁盘、网络流量、电源、温湿度;•系统软件层:数据库连接数、表空间、慢SQL、中间件线程池、消息队列堆积;•应用层:服务可用率、接口成功率、交易响应时间、业务积压量;•安全层:异常登录、病毒告警、Web攻击、流量异常。第十一条告警分级与处置告警级别判定示例通知方式响应要求紧急生产系统宕机、数据库不可用、核心业务全量中断电话+短信+即时消息值班人员15分钟内进入处置,同步通知运维负责人重要双机中单机故障、磁盘使用率≥85%、接口错误率≥5%短信+即时消息30分钟内响应,2小时内给出处置方案一般磁盘使用率70%~85%、单节点负载偏高工单1个工作日内处置同一告警30分钟内重复触发3次以上,自动升级为上一级别。严禁随意关闭告警;确需调整阈值的,须在监控平台提交变更并经运维负责人审批。4.2第二节巡检第十二条巡检频次与内容•一级系统:每日现场或远程巡检1次,每周深度巡检1次;•二级系统:每周巡检不少于2次;•三级系统:每周巡检1次;•机房环境:每日2次(含节假日),重点检查温湿度(温度22~24℃、相对湿度45%~65%)、UPS、精密空调、消防、漏水检测。巡检必须填写《巡检记录表》,记录具体数值而非"正常"二字。巡检发现的异常须立即转工单,不得仅作记录。4.3第三节事件管理第十三条事件受理渠道与时限用户通过服务台电话、工单系统、即时消息群三种渠道报障。服务台执行7×24小时(一、二级系统)或工作时间(三级系统)受理,电话响铃3声内接听,工单15分钟内确认受理。第十四条事件分级事件等级判定标准处置主体上报对象重大(Ⅰ级)一级系统整体中断或核心业务全部不可用;数据泄露、被勒索等安全事件应急指挥组领导小组、单位负责人,30分钟内较大(Ⅱ级)二级系统中断或一级系统部分功能不可用,影响多部门二线运维+厂商信息化管理部门负责人,1小时内一般(Ⅲ级)单用户故障、三级系统故障、有临时绕行方案的故障服务台/一线班组内记录第十五条事件处置要求处置过程中每30分钟向受影响用户通报1次进展;恢复后24小时内由事件责任人编写《事件报告》,包含时间线、影响范围、根因、处置措施、遗留问题。事件关闭前必须由报修人或业务联络员验证确认,严禁运维人员自行关闭用户报修工单。4.4第四节问题管理第十六条问题识别与根因分析同类事件30天内发生3次以上,或重大、较大事件,必须转为问题管理,由信息化管理部门指定问题经理。问题经理须在5个工作日内组织根因分析,优先采用"五个为什么"或鱼骨图方法,定位技术、流程、人员三类根因,禁止以"操作失误"作为最终根因。第十七条已知错误与根治根因明确但暂无法修复的,登记为"已知错误"并向服务台提供临时绕行方案。问题根治措施纳入变更流程,问题经理跟踪至闭环。问题超期30天未解决的,提报信息化工作领导小组协调资源。4.5第五节变更与发布管理第十八条变更分类•标准变更:低风险、已有成熟操作手册的变更,如常规补丁、账号增删,预授权后按SOP执行;•常规变更:须提交变更申请,含变更内容、影响范围、回退方案、实施窗口,经技术审核与负责人审批;•重大变更:涉及一级系统架构调整、数据库版本升级、网络割接、跨系统接口改造,须经变更评审会(CAB)评审,分管领导批准。第十九条变更窗口与禁止窗口常规变更安排在每周二、周四20:00—24:00;重大变更安排在周末或法定节假日。月末最后2个工作日、季末、年末结算期间及重要业务保障期(具体日期由年度保障日历明确)为禁止变更窗口,仅允许为修复正在发生的故障而实施的紧急变更。第二十条变更实施纪律实施人必须严格按已审批方案操作,执行前备份配置与数据;操作过程中由1名复核人现场或远程对照命令逐条确认,严禁一人独立完成核心系统变更。变更后须完成功能验证与性能观察(一级系统观察不少于2小时),失败或偏离预期时立即按回退方案恢复,回退决策由现场指挥在30分钟内做出,严禁带着故障过夜尝试。紧急变更可先处置后补审,但必须在恢复后1个工作日内补齐《变更申请单》并说明紧急原因。4.6第六节配置管理第二十一条配置项管理建立配置管理数据库(CMDB),记录服务器、网络设备、软件实例、接口、供应商及其关联关系。新增、下线配置项须在3个工作日内更新CMDB;每月开展1次配置审计,CMDB与实物一致率不低于95%。设备下线前必须完成数据清除、资产注销与权限回收。五、第五章安全运维管理安全运维的核心是阻断"漏洞被利用→权限获取→横向移动→数据外泄"的攻击链,任何单点措施失效时须有第二道控制兜底。第二十二条账号与权限管理1.生产环境账号实行实名制,禁止多人共用账号;确需共享的应急账号须封存密码、双人拆封、单次使用后立即改密。2.特权账号(root、Administrator、数据库sysdba)纳入堡垒机管理,禁止直接登录。3.权限变更通过工单审批;岗位调动1个工作日内调整权限,离岗当日注销全部账号。4.每季度开展1次权限复核,由账号使用人、部门负责人双签字,休眠超过90天的账号一律停用。第二十三条身份认证一级、二级系统必须启用双因素认证;密码长度不少于12位,包含大小写字母、数字、特殊字符中至少3类,90天更换一次,最近5次密码不得重复。连续5次认证失败锁定账号30分钟。第二十四条远程接入运维远程接入必须通过VPN加堡垒机,禁止将数据库、管理后台端口直接映射互联网。堡垒机会话全程录像,命令留痕。供应商临时接入须申请时效账号,有效期最长7天,到期自动失效。第二十五条漏洞与补丁•高危漏洞:收到通报或扫描发现后24小时内完成风险评估,72小时内完成修复或采取访问控制、虚拟补丁等缓解措施;•中危漏洞:15个工作日内修复;•低危漏洞:纳入月度补丁计划。补丁安装前必须在测试环境验证,重点验证业务功能、接口与性能;无法停机修复的,采用热补丁或流量隔离,并在漏洞台账中注明补偿措施与整改期限。第二十六条恶意代码防范与基线所有服务器、终端必须安装防病毒软件并保持病毒库每日更新,病毒感染事件按安全事件处置。每年至少开展1次安全基线核查,覆盖操作系统、数据库、中间件、网络设备,高危配置不符合项30日内整改。第二十七条安全审计安全管理员每月审计特权账号操作、异常时段登录、批量数据导出、权限变更四类日志,审计记录留档。发现数据批量导出行为(单次导出超过1万条客户信息或超过表总量10%)须在24小时内核实并报告。六、第六章数据运维与备份恢复备份的有效性不取决于备份成功率,而取决于恢复演练成功率;从未演练过的备份视为无效备份。第二十八条备份策略系统级别备份方式频率保留周期一级本地实时复制+异地备份日志每15分钟,全量每日本地30天,异地180天二级全量+增量全量每周,增量每日90天三级全量每周30天备份数据必须加密存储,异地备份场所与主机房距离不少于30公里(采用同城双活架构的按设计要求执行)。第二十九条恢复演练一级系统每半年至少开展1次恢复演练,二级系统每年1次,演练须在隔离环境完整恢复并验证数据可用性与业务功能,记录实际RTO、RPO。演练失败的,10个工作日内整改并重练。第三十条数据订正与销毁生产数据订正必须凭业务部门书面申请、影响评估与审批单执行,订正SQL须由第二人复核,执行前后各导出一次数据快照并保留90天。严禁在生产环境执行无WHERE条件的UPDATE、DELETE语句。存储介质报废或转用前,采用多次覆写或物理销毁方式清除数据,并留存销毁记录与影像资料。七、第七章应急管理第三十一条应急预案体系应急预案包括总体预案与机房故障、网络中断、数据库故障、勒索病毒、数据泄露、网络攻击6个专项预案,每年至少修订1次。每个专项预案须明确启动条件、指挥架构、处置步骤、联络树、外部资源与恢复优先级。第三十二条事件分级响应•Ⅰ级响应:由单位负责人或授权分管领导任总指挥,信息化、业务、宣传、法务等部门到位,每30分钟内部通报,按规定向主管部门和公安机关报告;•Ⅱ级响应:由信息化管理部门负责人指挥,技术处置组、供应商到场,每1小时通报;•Ⅲ级响应:由值班长指挥,按SOP处置。涉及个人信息泄露的,依据《中华人民共和国个人信息保护法》要求,在72小时内向履行个人信息保护职责的部门报告,并告知受影响个人。第三十三条应急演练每年至少组织1次全员参与的综合演练、2次专项演练。演练前2周发布演练方案(含不预先通知时间的突袭式演练安排),演练后5个工作日内召开复盘会,问题整改纳入计划并在下一演练周期验证。应急物资(备用网络链路、备件、应急电源)每季度检查1次。第三十四条典型场景处置要点•勒索病毒:立即断开受感染网段(禁止仅关机,以防内存证据丢失),保留现场,通过带外管理隔离;优先从离线/异地备份恢复,严禁支付赎金;恢复前完成全网查杀与入口封堵。•机房长时间停电:UPS供电期间(按满载后备时间不少于30分钟配置)按优先级有序关停非核心设备,启用备用发电机或切换至灾备机房,恢复后按"基础设施→数据库→应用→网络接入"顺序启动。•数据库故障:先判断实例故障还是存储故障,启用主备切换;切换后核对数据一致性,再开放业务;禁止在未确认备库数据完整性时强制切回。八、第八章服务台与用户支持第三十五条服务级别协议(SLA)服务项响应时间解决时限(一级/二级/三级系统)系统不可用类15分钟2小时/4小时/8小时功能故障类30分钟4小时/8小时/2个工作日服务请求(账号、权限等)1小时1个工作日/2个工作日/3个工作日咨询类2小时1个工作日内答复超过解决时限50%的工单自动升级至运维负责人;因第三方原因延误的,须在工单中记录厂商响应时间并纳入供应商考核。第三十六条用户回访与满意度服务台对已关闭工单按不少于20%的比例回访,重大故障工单100%回访。季度满意度调查结果低于85分时,信息化管理部门须在10个工作日内制定改进计划。九、第九章供应商管理第三十七条准入与合同要求供应商进场前须签署保密协议、数据处理协议与安全承诺书,合同中明确SLA、驻场人员名单、违约责任与退出交接条款。禁止供应商使用个人电脑接入生产网络;确需使用的,须安装本单位指定的终端管理与防病毒软件并登记备案。第三十八条考核与退出每季度从响应及时率、故障解决率、计划交付率、文档质量、安全合规5个维度考核,总分低于80分的限期整改,连续2个季度低于70分的终止合作。供应商更换时须完成知识转移、文档移交、系统权限回收与并行支持期(不少于1个月)。十、第十章文档、知识与培训第三十九条文档管理每个系统须建立"一系统一档案",包含架构图、部署手册、运维手册、接口文档、应急预案、资产清单,系统上线时同步交付,之后每半年核对更新。无运维文档的系统不得通过上线验收。第四十条培训与持证新入职运维人员须完成不少于40学时的岗前培训并通过考核方可独立操作;在岗人员每年培训不少于24学时。从事等级保护第三级系统运维、网络安全管理的岗位须持有相应专业培训证书。每半年组织1次应急预案实操考核,不合格者暂停生产操作权限并补考。十一、第十一章运维度量与持续改进第四十一条关键指标指标计算口径目标值系统可用率(月度总分钟数-故障分钟数)/月度总分钟数一级≥99.95%,二级≥99.9%事件按时解决率按时关闭工单数/工单总数≥95%变更成功率未引发回退或事件的变更数/变更总数≥98%备份恢复成功率演练成功次数/演练总次数100%高危漏洞修复及时率按期修复数/高危漏洞总数100%监控覆盖率已纳管组件数/应纳管组件数≥98%第四十二条报告与评审•日报:值班人员每日9:30前提交,含告警、故障、变更、遗留事项;•月报:每月5日前发布,含SLA指标、事件问题分析、容量趋势、下月计划;•年度评审:每年1月完成上年度运维评审,更新运维计划与预算,输入领导小组决策。第四十三条容量管理CPU峰值持续超过75%、内存使用率超过80%、表空间年增长率超过30%的资源,须提前3个月提出扩容方案。每年第四季度编制下年度容量规划,避免资源耗尽导致突发中断。十二、第十二章考核与责任追究第四十四条考核方式运维工作纳入部门与个人年度考核,指标结果与绩效挂钩。对及时发现重大隐患、成功避免重大事故、应急处置表现突出的个人给予通报表扬与绩效奖励。第四十五条责任追究有下列行为之一的,视情节给予约谈、通报、绩效扣减;造成安全事件或经济损失的,依据本单位人事与纪律规定处理;涉嫌违法的,移送司法机关:1.未经审批擅自变更生产系统或绕过堡垒机操作;2.共用、外借账号,或私自复制、泄露生产数据;3.瞒报、迟报、漏报重大事件与安全漏洞;4.备份与监控弄虚作假,或伪造巡检、演练记录;5.在禁止变更窗口擅自实施非紧急变更。十三、第十三章附则第四十六条本办法由信息化管理部门负责解释与修订,出现法律法规、上级制度调整或组织机构重大变化时及时修订,最长修订间隔不超过2年。第四十七条本办法自发布之日起施行,原有相关规定与本办法不一致的,以本办法为准。附件一:事件报告单(样式)字段填写内容事件编号由工单系统自动生成(EV-年月日-序号)报告人/联系方式姓名/138******发生时间/发现时间年-月-日时:分受影响系统及级别系统名称(一级/二级/三级)影响范围用户数、业务量、是否全量中断事件等级Ⅰ/Ⅱ/Ⅲ处置时间线告警时间—响应时间—处置措施—恢复时间根因分析直接原因、深层原因(技术/流程/人员)恢复验证验证人、验证结果遗留问题与计划问题描述、责任人、完成日期附件二:变更申请单(样式)字段内容变更编号/标题CHG-年月日-序号/简述变更类型标准/常规/重大/紧急变更原因与内容业务背景、技术内容、涉及配置项影响评估影响系统、用户、业务时段、风险点实施计划步骤、时间点、实施人、复核人回退方案回退触发条件、步骤、预计耗时、回退负责人备份措施配置备份、数据快照位置审批意见技术审核/部门负责人/CAB/分管领导实施结果成功/回退/部分完成,观察记录附件三:日常巡检检查表(一级系统日巡检)序号检查项标准/阈值实测值结论1主机CPU峰值<75%正常/异常2内存使用率<80%正常/异常3磁盘使用率<85%正常/异常4数据库会话/连接数<最大连接数80%正常/异常5慢SQL数量较7日均值增幅<50%正常/异常6备份任务最

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论