服务器巡检办法_第1页
服务器巡检办法_第2页
服务器巡检办法_第3页
服务器巡检办法_第4页
服务器巡检办法_第5页
已阅读5页,还剩5页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

服务器巡检办法总述我干运维相关工作快六年了,见过太多因为偷懒跳过巡检、或者巡检走形式最后出大问题的案例:好几年前有个合作的小公司,机房的一块硬盘亮了黄灯半个月没人发现,最后整组RAID阵列崩溃,丢了近十万条用户数据,最后赔了一大笔钱还丢了客户。从那时候我就明白,服务器巡检从来不是应付领导检查的表面功夫,是给业务稳定上的第一道保险,就像人要定期做体检一样,提前找出来小毛病,总比等病倒了再抢救要省钱省力得多。这篇巡检办法是我们行业里摸爬滚打这么多年总结出来的实操规则,覆盖了从日常到专项的所有环节,所有内容都是实打实能用的,没有空洞的套话。1总则1.1巡检的核心目的制定本办法的核心目的一共有四个:第一是提前识别硬件、软件、环境层面的潜在隐患,把问题解决在萌芽状态,避免突发宕机;第二是保障核心业务连续稳定运行,给用户提供持续可靠的服务,不会动不动就出访问故障;第三是延长服务器硬件的使用寿命,通过定期维护调整运行环境,减少不必要的硬件损耗;第四是留下完整的巡检记录,万一真的出了问题,可以快速溯源找到问题根源,不会像无头苍蝇一样乱找。我再啰嗦一句:很多人觉得有自动监控就不用人工巡检了,其实监控不是万能的,有些隐蔽的隐患比如硬件的轻微异响、机房墙角的漏水痕迹,监控根本发现不了,人工巡检才是最后一道防线。1.2适用范围本办法适用于所有类型的服务器设备,不管是企业自建机房的物理服务器、托管在第三方机房的服务器,还是云平台上的云服务器,也不管是承载核心业务的生产服务器、还是用来做测试的测试服务器,以及和服务器配套的存储设备、交换机、UPS电源、机房空调等配套设备,都要按照本办法执行巡检。2巡检的分类与周期安排明确了巡检的核心意义和覆盖范围,接下来就要对巡检做分类划分,不同等级的巡检对应不同的检查密度和内容,既能避免过度巡检浪费人力,也不会漏掉关键隐患。2.1日常巡检日常巡检是每天都要做的基础检查,由当日值班的运维人员负责,一般安排在每天上班后半小时内完成,不需要跑现场,远程操作就能搞定,十几分钟就能做完。2.2每周巡检每周巡检是比日常更深入的检查,安排在每周最后一个工作日的下午完成,需要对核心参数和备份做验证,一般一个十台服务器以内的集群,一个小时左右就能做完。2.3月度巡检月度巡检是全范围的全面检查,安排在每个月最后一个工作日完成,需要覆盖所有服务器和配套设备,本地机房还需要到现场检查环境,规模大的机房可能需要半天到一天的时间。2.4季度与年度专项巡检季度巡检是每三个月做一次的专项隐患排查,年度巡检是年末做的全系统复盘评估,主要针对硬件老化、性能瓶颈做整体排查,属于深度预防性检查。2.5特殊场景巡检除了固定周期的巡检,遇到特殊场景还要额外做巡检:比如极端天气(台风、暴雨、高温寒潮)来临之前和之后,计划性停电之前和恢复供电之后,服务器完成硬件升级、系统迁移、漏洞更新之后,或者刚处理完故障之后,都要做一次针对性的专项巡检,避免留下后遗症。就说夏天南方的台风天,我每次接到预警都要提前去机房绕一圈,把窗户关好,看看墙边有没有渗水的痕迹,测试一下UPS能扛多久,真停电了心里才有底。3各级巡检的具体内容与操作规范清楚了不同巡检的时间安排,接下来就是最核心的内容:每一级巡检具体要做什么,有哪些必须落实的细节,我把实际工作中总结的要点都列出来。3.1日常远程巡检内容日常巡检核心是抓紧急问题,不用太深入,重点查四个方面:3.1.1硬件告警状态检查通过服务器的IPMI管理平台、或者云服务商的后台管理界面,快速扫一遍所有硬件的状态,看看有没有红色、黄色的告警提示,重点看CPU、内存、硬盘、电源、风扇的状态,确认核心硬件温度在正常范围内,只要有告警马上标记,不能放着不管。3.1.2系统资源占用检查远程登录到服务器系统,看一下各个分区的磁盘使用率,CPU和内存的整体占用情况,有没有哪个分区使用率超过80%,有没有异常进程占满了资源。我见过太多次就是日志没清理,把系统盘占满,最后导致网站打不开的小事,就是因为日常没看这一眼,本来几分钟就能解决的事,最后变成了故障。3.1.3核心服务状态检查核对所有核心业务服务的运行状态,看看web服务、数据库、缓存、消息队列这些核心进程是不是正常运行,对应端口是不是能正常访问,不用测性能,只要确认服务在线就行。3.1.4网络连通状态检查测一下服务器和网关、核心交换机的连通性,看看有没有丢包、延迟过高的情况,确认对外带宽没有被异常占满,网络层面没有异常。3.2每周巡检内容日常巡检是快速扫重点,每周巡检就要深入一层,挖一挖日常没注意的小问题:3.2.1系统日志批量排查导出最近一周的系统日志、核心服务日志,搜一下有没有error级别的错误,有没有重复出现的异常提示,哪怕是不影响当前运行的偶发报错,也要记下来跟进,很多大问题就是从偶发报错慢慢变严重的。3.2.2冗余内容清理清理服务器上过期的临时文件、超过保留期限的日志文件,停掉已经不用的闲置进程,释放磁盘和系统资源,避免资源被慢慢耗尽。3.2.3备份有效性抽测这是我反复强调的重点,很多人都觉得备份做了就万事大吉,结果真要恢复的时候才发现备份文件坏了、路径错了、根本没存进去。每周都要抽测至少1/3的备份文件,确认备份文件完整没有损坏,能正常解压恢复,核心业务的备份要每周都测,不能偷懒。3.2.4现场初步排查(本地机房)如果是自建本地机房,每周至少要去现场转一圈,听听服务器运行的声音有没有异常的异响,比如尖锐的噪音、不规则的碰撞声,摸一摸机柜的温度是不是正常,看看机房地面有没有漏水、漏液的痕迹,这些都是远程看不到的细节。3.3月度全面巡检内容月度巡检要覆盖所有细节,不能漏任何一个环节:3.3.1硬件全状态复核除了看告警,还要用工具读取硬盘的SMART健康信息,扫一遍有没有潜在坏道,确认CPU温度在满负载下也在正常范围,风扇转速符合要求,电源的输入输出电压稳定,哪怕没有告警,只要健康度不达标的硬件,也要提前申请更换,别等坏了再换。3.3.2安全隐患排查扫一遍服务器有没有新增的高危漏洞,核对防火墙规则有没有异常变动,查一下系统登录日志有没有陌生IP的非法登录尝试,提醒所有管理员更新过期密码,清理掉已经离职人员的账号,避免留下安全后门。3.3.3业务性能测试实际模拟用户访问,测一下核心页面的访问速度、数据库查询的响应时间,把测出来的结果和上个月的基准值对比,如果性能下降超过10%,就要排查原因,是资源不够了还是哪里有阻塞,提前扩容优化,别等用户投诉了才动手。3.3.4机房环境全面检查本地机房要测一下机房的温度和湿度,确认温度在20-25摄氏度、湿度在40%-60%之间,符合硬件运行要求,检查空调运行是不是正常,出风有没有异常,测一下UPS每一块电池的电压,确认电池容量正常,检查消防设备是不是在位有效,机柜的固定螺丝有没有松动,网线光纤有没有老化破损,这些小事看起来不起眼,出事就是大事:之前有个机房空调过滤网没清,出风不畅,导致机房温度升到四十多度,不到两个小时所有服务器都降频宕机,停了四个小时才恢复,损失不小。3.3.5设备台账更新如果新增或者下架了服务器,修改了硬件配置,要及时更新设备台账,云服务器还要核对一下账单,清理掉闲置不用的云资源,避免浪费钱。3.4季度与年度专项巡检内容3.4.1季度专项巡检季度巡检要做全量的硬盘健康扫描,所有服务器的每一块硬盘都要扫一遍,把有潜在坏道、健康度不达标的硬盘全部换掉,不要舍不得那点硬件钱,真出问题花的钱比换硬盘多十倍都不止。还要统计近三个月的资源使用趋势,看看负载是不是一直在涨,要不要提前扩容,调整业务分布,把负载过高的服务器上的业务迁一部分出来,避免资源不够用突发宕机。3.4.2年度专项巡检年度巡检要做全年度的复盘,把一年的巡检记录都拿出来,统计一下总共发现了多少隐患,问题主要集中在哪些方面,比如某个型号的硬盘故障率特别高,以后采购就避开这个型号。还要对所有服役超过五年的老旧硬件做评估,要不要淘汰更新,UPS电池用了超过三年就要测容量,容量不够了就全部换掉,别等停电了扛不住。3.5特殊场景巡检内容特殊巡检要抓对应场景的重点:极端天气来临前重点查防水、防风、UPS备电,恢复后重点查硬件有没有因为断电、高温出现损坏;升级迁移后重点查所有服务是不是正常,配置有没有错;故障修复后重点查有没有留下衍生问题,确保整个系统回归稳定。4巡检问题处理与记录管理规范查出来问题怎么办,巡检记录怎么留,这也是巡检里非常重要的环节,不能查完就没事了。4.1问题分级处理我们把巡检发现的问题分成三个等级,不同等级对应不同的处理时效:第一级是紧急问题,比如硬盘损坏告警、核心服务宕机、CPU温度超过阈值、机房空调故障,这类问题发现之后,十分钟内就要上报负责人,马上安排人处理,必须当天解决,不能拖。第二级是一般问题,比如磁盘使用率超过80%、非核心服务有偶发报错、单个电池电压略微偏低,这类问题要在三个工作日内安排处理,做好跟进记录,处理完要闭环确认。第三级是观察类问题,比如偶发的一次报错、没有恶化趋势的轻微异常,这类问题不用马上处理,但是要加到后续巡检的重点观察列表里,每次巡检都要看有没有恶化,一旦变严重马上升级处理。我再提醒一句:千万别嫌麻烦把小问题放着不管,我见过太多次就是一个小小的内存偶发报错,放了半个月变成彻底损坏,最后导致宕机,本来几十块钱换个内存就能解决的事,最后变成几十万的损失,太不值了。4.2巡检记录要求每一次巡检不管有没有发现问题,都必须做记录,不能偷懒说没毛病就不写。记录要写清楚巡检的时间、巡检人、检查的所有项目,有没有发现问题,问题的处理情况,处理完成后要签字确认。现在大部分都用电子记录,要做好归档,本地记录和云端备份都要留,至少保留一年以上,方便出问题的时候溯源。4.3定期复盘优化每个月我们都要把当月巡检发现的问题整理一遍,开个十几分钟的小会,总结一下为什么会出现这个问题,是巡检流程有漏洞漏检了,还是设备本身的可靠性问题,然后优化巡检流程,比如之前我们发现很多人容易漏测备份,后来就把备份抽测加到了日常巡检的必勾选项目里,就很少再漏了。5巡检人员职责与监督考核要把巡检落实到位,必须明确职责,奖罚分明,不然很容易变成走形式。5.1人员职责分工日常巡检由当日值班的运维工程师负责,谁值班谁做,对巡检结果负责;每周巡检由运维组长统筹安排,指定专人负责;月度巡检和专项巡检由技术负责人带队,分工落实到每个人,每个人对自己负责的检查内容负责,出了漏检能找到责任人,不会互相推诿。5.2监督考核要求每个月会统一检查所有巡检记录,有没有按时完成,有没有漏项,发现没按时做的或者漏检的,第一次口头提醒,第二次就要扣绩效,要是因为漏检导致出现重大故障,还要承担对应的责任。反过来,如果巡检提前发现了重大隐患,避免了大规模宕机或者数据丢失,也会给对应的巡检人员发奖励,毕竟巡检是个偏幕后的工作,干得好

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论