机房服务器运维管理指南_第1页
机房服务器运维管理指南_第2页
机房服务器运维管理指南_第3页
机房服务器运维管理指南_第4页
机房服务器运维管理指南_第5页
已阅读5页,还剩9页未读, 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

机房服务器运维管理指南一、适用范围与岗位权责明确的权责划分是避免运维操作推诿、漏项的核心前提,所有进入机房、接触服务器设备的人员必须严格遵守本章节的权责边界。1.1适用范围本指南适用于企业自建生产机房、同城灾备机房内所有X86服务器、存储设备、配套网络与动力环境设备的日常巡检、上线变更、故障处置、安全管控、数据备份全流程管理,托管在第三方IDC的自有服务器参照本指南核心条款执行。1.2岗位权责•机房运维主管:统筹年度运维计划编制、高危变更审批、故障响应总指挥、每月运维质量复盘,每月5日前产出上月运维质量报告,对机房整体可用率负首要责任。•一线值班运维工程师:执行7*24小时值班制度,负责日常巡检、监控告警响应、一般故障处置、经审批的变更操作、运维台账实时更新,对当班期间的告警响应及时性、操作合规性负责。•安全审计岗:独立于运维执行团队,每季度开展一次全量权限审计、操作日志回溯、漏洞核查,每半年组织一次应急演练,对运维操作的合规性、安全策略有效性负责。•第三方驻场/维保人员:必须持有效审批单进入机房,所有操作必须由内部运维人员全程旁站复核,严禁独立操作核心生产服务器、严禁触碰授权范围外的设备,对自身操作引发的故障承担直接责任。二、日常巡检与监控作业规范标准化日常巡检是提前识别硬件隐患、把故障消灭在萌芽阶段的核心手段,严禁以远程平台监控替代现场人工巡检。2.1巡检频次与覆盖范围•核心设备(承载生产数据库、核心交易系统、用户认证系统的服务器、核心存储、核心网络设备):每日开展1次现场巡检,每2小时远程查看一次性能指标。•非核心设备(内部办公系统、测试环境服务器、边缘应用节点):每3日开展1次现场巡检,每4小时远程查看一次性能指标。•全量设备:每月最后1个工作日开展1次深度巡检,覆盖硬件状态、系统配置、安全基线、动力环境全维度。2.2现场巡检量化标准巡检对象正常指标区间异常处置要求服务器指示灯电源常绿、硬盘常绿/慢闪、风扇无告警橙色告警需15分钟内排查原因;硬盘红色告警需立即标记,确认热备盘同步完成后更换硬件运行参数CPU满载温度≤75℃、内存温度≤65℃、风扇转速3000~6000rpm温度超阈值30分钟内检查空调制冷、机柜风道堵塞情况;风扇转速偏差超20%立即清灰或更换机房环境温度22±2℃、相对湿度40%~60%、无明显积尘、无异味温湿度偏差超阈值30分钟内调整空调参数;出现焦糊味立即逐柜排查设备发热情况动力配套UPS负载率40%~70%、单路PDU电流≤16A、三相不平衡度≤15%UPS负载超80%立即调整负载分配;PDU电流超阈值立即梳理非必要设备下电所有巡检记录必须当场填写《机房日常巡检记录表》(见附件1),异常项标注清楚设备位置、告警现象、初步判断,签字确认后同步至运维工单系统,严禁巡检结束后补记、漏记。2.3远程监控配置要求统一使用Prometheus+Grafana搭建监控平台,告警阈值按以下标准配置:•CPU使用率:持续5分钟超85%触发预警,持续10分钟超95%触发紧急告警•内存使用率:持续5分钟超90%触发紧急告警•磁盘使用率:超80%触发预警,超90%触发紧急告警•网络连通性:核心设备ping丢包率超1%触发告警,连续3个ping包无响应触发紧急告警所有告警1分钟内推送至值班人员企业微信、短信双渠道,值班人员必须10分钟内确认告警,严禁出现告警无人响应情况。三、服务器全生命周期变更规范服务器上线、配置变更、下线操作是运维风险最高的环节,所有操作必须可审批、可留痕、可回退,严禁无审批操作核心生产设备。3.1服务器上线流程1.需求提交:业务部门需提前3个工作日提交《服务器上线/变更/下线审批单》(见附件2),注明配置要求、操作系统版本、IP地址规划、业务归属、责任人、预计上线时间。2.预配置准备:运维工程师提前1个工作日完成机柜U位预留、双路PDU供电核验、网络端口VLAN配置;存储配置优先采用RAID10(数据库、核心存储场景);若不具备RAID10条件,非核心应用场景可采用RAID5;严禁无RAID冗余配置的服务器上线生产环境。操作系统采用最小化安装,关闭非必要端口、禁用默认管理员账号、配置符合安全基线的密码策略。3.烤机验收:设备上架通电后连续烤机24小时,硬件无告警、性能基线达标(CPU/内存/磁盘运行指标稳定在正常区间)后,由申请部门、运维主管双签字确认,24小时内更新资产台账,正式纳入运维监控范围。3.2生产变更操作要求•分级审批:普通变更(非核心业务配置调整、安全补丁更新、非核心节点重启)提前1个工作日提交申请,由运维主管审批;高危变更(核心服务器重启、系统版本升级、存储扩容、网络割接、数据库参数调整)必须提前3个工作日提交完整操作方案、风险评估、回退预案,由IT负责人审批。•操作规则:高危变更原则上安排在业务低峰期(00:00-05:00)执行,操作前必须完成全量数据备份;操作时执行“一人操作、一人旁站复核”机制,每完成一个操作步骤记录执行时间、结果;严禁未经复核直接执行下一个操作步骤。•回退要求:变更操作后连续观测30分钟,若业务未恢复正常、核心指标异常,必须立即启动回退预案,严禁在故障状态下盲目排查超过30分钟不回退,避免故障影响范围扩大。3.3服务器下线流程1.业务确认:下线前必须由业务责任人书面确认业务已全部迁移、无运行中的进程、关联系统已完成解耦。2.数据处理:下线设备的所有数据必须完成3份备份(本地+异地+离线介质),经数据责任人确认备份可恢复后,按照GB/T37988-2019《信息安全技术数据擦除产品安全技术要求》执行数据擦除;承载敏感用户数据的服务器必须对硬盘进行物理消磁,严禁带敏感数据的硬盘直接流入报废流程。3.台账更新:设备下架后24小时内更新资产台账,注明下线时间、数据处置情况、设备去向,更新对应监控、防火墙、域名解析配置,避免残留无效配置引发安全隐患。四、故障分级与应急处置规范故障处置的核心目标是优先恢复业务可用性,其次排查根因,严禁在业务未恢复的情况下优先追责任、找原因。4.1故障分级与响应机制故障等级判定标准启动权限处置原则一级(特别重大)核心业务全量中断、机房大面积断电、核心存储损坏导致30%以上业务不可用、预估恢复时长超30分钟IT负责人5分钟内通知公司管理层、所有业务线负责人,优先切换灾备节点恢复业务,每15分钟同步一次处置进度,恢复后24小时内提交复盘报告二级(重大)单台核心服务器宕机、单条业务线全量中断、单路供电中断、预估恢复时长10~30分钟运维主管10分钟内定位故障点,优先通过备用节点接管流量,恢复后12小时内提交故障分析报告三级(一般)单块硬盘告警、非核心服务器单部件故障、监控单点告警无实际业务影响值班运维工程师当班期间处置完成,记录故障原因与处理结果,纳入每周运维复盘4.2典型场景处置流程1.服务器宕机处置:第一步先ping服务器管理IP,若管理IP可通,通过IPMI远程查看系统日志,尝试远程软重启;若管理IP不通,值班人员5分钟内到达现场,查看电源、硬件指示灯状态,尝试本地冷启动。严禁在无备用节点接管业务的情况下反复冷启动故障机超过2次——多次冷启动的瞬时电流冲击可能导致磁头刮伤盘片,造成不可逆的数据损坏。若两次重启失败,立即将业务流量切换至备用服务器,再开展硬件排查。2.机房断电处置:UPS自动接管供电后,值班人员10分钟内确认UPS剩余续航时间(标准配置满负载续航30分钟),若联系供电部门确认外电30分钟内无法恢复,按“非核心服务器→应用服务器→核心存储→核心网络设备”的优先级依次正常关机,保存设备配置,防止突然掉电损坏硬件。外电恢复后,按“核心网络设备→核心存储→核心服务器→应用服务器”的顺序依次加电,每类设备加电后等待5分钟确认运行状态正常,再启动下一批设备,严禁所有设备同时加电导致启动电流过载触发PDU跳闸。3.硬盘故障处置:单块硬盘亮红色告警时,先查看RAID组状态,确认热备盘已开始自动重构、RAID组无失效风险后,标记故障硬盘位置,等待RAID重构完成(重构进度100%)后再拔出故障硬盘更换。严禁在RAID组处于降级状态时直接拔出告警硬盘——拔出后RAID组将进入完全失效状态,导致整组数据丢失。五、安全与权限管控规范严格的权限管控是防范内部误操作、外部入侵的第一道防线,所有系统权限、物理访问权限必须遵循最小必要原则。5.1系统账号权限•服务器操作系统实行一人一号制,严禁多人共用账号、严禁直接使用root/Administrator默认管理员账号登录生产服务器。•核心服务器必须配置双因子认证(密码+动态令牌),登录密码长度≥12位,包含大小写字母、数字、特殊字符,每90天强制更换,近5次密码不得重复。•安全审计岗每季度开展一次全量权限核查,第一时间清理离职人员账号、超范围授权账号,回溯所有服务器的操作日志,对非工作时间登录、异地登录、连续5次密码错误的异常登录行为立即溯源核实。5.2物理访问管控•机房大门实行门禁卡+指纹双认证,仅在岗值班运维人员拥有日常进入权限,权限每半年复核一次。•其他人员(含业务部门、第三方维保、参观人员)进入机房必须提前1个工作日提交《机房进入申请单》,注明进入事由、停留时间、接触设备范围,经运维主管审批后,由值班人员全程陪同进入;进入人员严禁携带私人U盘、移动硬盘等存储介质(专用运维工具介质必须提前登记、完成病毒查杀后带入),全程在监控覆盖范围内活动,严禁触碰申请范围外的设备(私人存储介质可能携带病毒、引发数据泄露风险)。5.3漏洞与补丁管理•每月最后1周开展一次全量服务器漏洞扫描,高危漏洞(CVSS评分≥7.0)必须在7个工作日内完成补丁修复;补丁安装前必须在测试环境验证兼容性,严禁直接在生产服务器安装未经验证的补丁,避免引发业务崩溃。•服务器防火墙默认关闭所有端口,仅开放业务必需的服务端口,配置IP白名单仅允许授权地址访问,每季度清理一次无效防火墙规则。六、数据备份与恢复验证规范备份的核心价值是可恢复,只做备份不开展周期性恢复验证等于没有备份。6.1备份策略配置•核心业务数据(生产数据库、交易记录、用户敏感信息)执行“三备份”策略:本地实时备份(服务器RAID冗余+每小时增量备份到本地备份节点)、同城异地备份(每日0点全量同步至同城灾备机房,同步带宽≥100Mbps,传输延迟≤50ms)、离线冷备份(每周日全量备份至加密磁带,磁带异地存放在专用防火保险柜),备份数据保存周期≥1年。•非核心业务数据(内部办公系统、测试环境数据)执行每日增量备份、每周全量备份,备份数据保存周期≥3个月。6.2备份验证要求•每月抽取不少于10%的备份集开展恢复演练,核心业务备份每季度开展一次全量恢复验证,记录恢复时长、数据完整性,核心业务RTO(恢复时间目标)≤4小时,RPO(恢复点目标)≤1小时。•若恢复验证发现备份数据损坏、无法正常恢复,必须24小时内排查备份链路故障原因、重新完成全量备份,严禁连续2次出现备份验证不通过情况。•离线备份磁带每6个月开展一次可读性检测,存放环境满足温度18~24℃、相对湿度30%~50%的防磁、防火、防水要求,超过保存期限的磁带按涉密载体销毁流程统一处理。七、台账管理与质量考核完整准确的运维台账是资产追溯、故障复盘、容量规划的基础依据,严禁台账记录与实际情况脱节。7.1运维台账管理所有服务器必须建立全生命周期台账,包含资产编号、机柜U位、硬件配置、IP地址、操作系统版本、上线时间、业务归属、责任人、维保期限、故障历史记录。服务器上线、迁移、硬件更换、下线等变更操作必须在完成后24小时内更新台账,每季度开展一次全量资产盘点,账实相符率必须达到100%。7.2运维质量考核指标每月对运维工作质量进行考核,核心指标要求如下:•生产服务器年可用率≥99.95%(年累计停机时间≤4.38小时)•监控告警响应及时率100%•生产变更成功率≥99%•备份恢复验证通过率100%•日常巡检完成率100%未达标项必须在月度复盘会上明确根因、制定可落地的改进措施,明确整改责任人与完成时限。附件附件1:机房日常巡检记录表巡检日期巡检人机房温度(℃)机房湿度(%)UPS负载率(%)核心设备指示灯状态非核心设备状态PDU电流(A)异常情况记录初步处置措施签字确认附件2:服务器上线/变更/下线审批单申请类型□上线□变更□下线申请部门申请人申请时间涉及设备列表(资产编号、IP、业务归属)操作具体内容与时间窗口风险评估回退预案运维主管审批意见(签字/日期)IT负责人审批意见(高危变更必填)(签字/日期)操作完成确认(操作人/旁站人签字、完成时间、操作结果)附件3:故障分级响应联络表故障等级上报流程联络岗位联系方式响应时限

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论