系统运维工程师年度述职报告_第1页
系统运维工程师年度述职报告_第2页
系统运维工程师年度述职报告_第3页
系统运维工程师年度述职报告_第4页
系统运维工程师年度述职报告_第5页
已阅读5页,还剩6页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

系统运维工程师年度述职报告现将本人202X年度担任系统运维工程师期间的履职情况、核心成果、存在不足及后续工作计划汇报如下:本年度我主要负责公司核心生产区37台物理服务器、129台云主机、2套全闪存存储集群、3台核心万兆交换机、2台UPS不间断供电设备,以及21套核心业务系统、14套非核心支撑系统的全生命周期运维保障工作。全年所管辖的基础设施与业务系统整体运行可用率达到99.987%,累计计划外停机时长仅1小时17分钟,较202X-1年度的3小时42分钟下降65.3%,远高于公司年初设定的99.95%可用性考核指标;全年完成17次重大版本上线的运维侧全流程支撑、23次不同场景的应急演练、12项等保2.0三级合规核心整改项落地,全年未发生二级及以上重大安全生产事故,信息安全事件零发生,核心KPI完成率达到108%,位列部门同期运维人员考核前10%,超额完成年初设定的全部工作目标。核心基础设施7*24小时稳定性运维保障方面,本年度我对原有巡检机制做了分级迭代优化,打破过去“所有设备统一日检”的粗放模式,将运维对象按照业务关联度划分为三级:一级运维对象覆盖交易区物理服务器、核心存储集群、核心网络设备等直接影响核心交易的设施,执行每4小时一次的高频巡检;二级运维对象覆盖办公支撑系统、测试集群等非直接影响营收的设施,执行每日巡检;三级运维对象覆盖线下门店边缘计算节点、边缘网络设备等远端资源,执行每3日一次的巡检。全年累计完成人工巡检1462次,自主开发的自动巡检脚本累计触发10620次,累计提前排查出硬件潜在故障隐患42起,其中包括3台DELLR740服务器硬盘坏道预警、2台华为存储控制器缓存异常告警、1台核心交换机光模块衰耗超标隐患,所有隐患全部在凌晨2点到4点的业务低峰窗口完成替换处置,没有一起触发业务中断,隐患前置处置率达到100%。针对全年收到的17243条各类型运维告警,我牵头完成了告警规则的精细化调优,通过合并重复告警、清理无效阈值规则、关联业务上下文标记告警优先级,将告警误报率从202X-1年度的7.2%下降到1.86%,平均告警响应时长从过去的12分37秒压缩到3分12秒,故障平均恢复时长(MTTR)从过去的47分22秒压缩到11分48秒。本年度6月13日凌晨2点17分,运维平台触发核心存储集群卷容量紧急告警,当时核心交易业务的存储剩余容量仅剩3.2%,如果没有及时处置,早高峰9点到11点的交易峰值时段会出现存储写满、全量业务宕机的重大事故,我接到告警后12分钟内抵达运维操作室,通过年初提前制定的存储容量扩容专项预案,在业务低峰窗口完成2块8T企业级硬盘的热插拔上架、存储池容量在线扩容、卷空间动态分配全流程操作,整个处置过程耗时27分钟,全程无业务感知,预估规避直接交易损失、品牌声誉损失超过120万元。此外本年度我配合运维团队完成3次UPS全流程充放电测试,校准机房核心区域温湿度传感器17个,处置精密空调高温告警9次,确保机房核心区域温度全年稳定在22±2℃,湿度稳定在45%±5%,全年无动环相关故障导致的基础设施停机事件发生。业务系统全生命周期运维与稳定性迭代优化方面,本年度我牵头完成全年所有重大项目的运维侧前置保障,累计支撑电商交易V3.0升级、用户会员体系重构、供应链管理系统三期上线、线下门店POS系统云化改造等21套业务系统的版本迭代上线工作,所有上线流程我全部提前完成四项核心校验:资源冗余度核查、全量数据库备份可用性校验、版本回滚预案全流程验证、灰度切流规则预配置,全年所有上线项目没有出现因运维准备不足导致的上线失败情况,上线后24小时内故障发生率从202X-1年度的17.2%下降到4.7%。针对过去核心系统单可用区部署的容灾短板,我作为核心执行人完成了核心业务系统的跨可用区容灾改造,把原来全部部署在阿里云华东2区可用区A的11套核心系统,完成跨可用区A、B的双活部署,搭建了两条独立的云下专线异步数据同步链路,将核心业务的RPO(恢复点目标)从过去的30分钟压缩到5分钟,RTO(恢复时间目标)从过去的2小时压缩到30分钟,本年度11月配合部门完成了全流程容灾切换演练,在模拟单可用区全部断电、网络完全中断的极端场景下,核心交易系统仅用22分钟就完成全量流量切到备用可用区,业务无数据丢失,核心交易成功率保持100%,演练结果通过了公司技术委员会的验收,达到了国内电商领域中等规模企业的容灾能力一流水平。本年度我针对核心系统的性能瓶颈完成了12次专项优化,比如针对大促期间用户登录接口响应慢、超时率高的问题,我通过调整Redis缓存3分片集群的哈希槽分配策略、清理数据库表中27条冗余索引、新增登录用户名关联查询的联合索引,将用户登录接口的平均响应时长从原来的327ms下降到89ms,峰值并发支撑能力从原来的1200QPS提升到5500QPS,今年618大促期间核心系统峰值并发达到3700QPS,全程系统无卡顿、无超时、无宕机,顺利完成大促保障任务。针对过去本地单点备份的风险,我牵头搭建了“本地全量+异地增量+离线归档”的三级备份机制,全年累计完成业务数据库全量备份365次、增量备份730次,备份成功率100%,全年完成12次随机抽样式备份恢复性测试,全部100%验证通过,本年度9月运营侧工作人员操作失误误删3条历史订单对账数据,我通过离线归档的物理备份文件仅用17分钟就完成数据精准恢复,没有对用户侧交易、运营侧对账工作造成任何影响。信息安全体系落地与等保2.0合规建设方面,本年度是公司核心业务系统需要完成等保2.0三级测评的关键年份,我作为运维侧的核心对接人,牵头完成了运维域127项合规控制点的落地整改,累计关闭服务器不必要的闲置端口142个,下线无人使用的冗余测试服务37个,将所有业务服务器全部接入统一堡垒机登录入口,取消所有服务器的静态密码登录权限,全部替换成SSH密钥+动态验证码的双因子认证模式,所有运维操作全程录像留痕,操作日志存储时长从过去的3个月提升到6个月,完全符合等保2.0的日志留存要求。我还牵头搭建了运维侧的入侵检测联动体系,配置了异地异常IP登录、暴力破解密码、大流量端口扫描等17项异常行为的自动拦截规则,全年累计拦截境外暴力破解登录尝试17.2万次,拦截针对核心业务端口的异常扫描请求427万次,全年没有发生服务器被入侵、用户数据泄露的安全事件。本年度配合第三方合规机构完成年度渗透测试工作,针对测试出的7个运维侧安全漏洞,全部在72小时内完成补丁升级、配置优化的整改闭环,整改完成率100%,今年10月公司核心业务系统顺利通过等保2.0三级测评,拿到合格证书,整个测评过程中我负责的运维域合规项零不合格,得到了测评机构和公司合规部门的公开肯定。针对核心用户数据、交易数据的运维管控,我配置了数据库审计的专属规则,所有敏感数据的查询、导出操作全部触发操作留痕+多级审批流程,全年累计监控到敏感数据访问操作2173次,其中3次非授权访问尝试都被及时拦截处置,没有出现敏感数据外泄的合规风险。运维成本管控与效能提升方面,本年度我对所有云主机、物理服务器资源做了全量盘点清理,下线了闲置超过6个月的测试云主机27台、闲置物理服务器3台,对CPU、内存利用率长期低于20%的19台云主机做了配置降级,对资源利用率长期超过80%的7台业务云主机提前做了配置升级避免性能瓶颈,经过这一轮的资源精细化优化,全年云服务器资源成本较去年下降了21.7%,累计节省成本19.2万元,在本年度业务规模同比上涨28%的前提下,基础设施资源总投入没有出现同比例上涨。我全年自主开发和优化了17个运维自动化脚本,包括服务器自动巡检脚本、备份文件自动校验脚本、服务器资源使用率自动日报生成脚本、临时日志自动清理脚本,把原来需要人工每日花费2.5小时完成的巡检、数据统计、冗余清理工作,压缩到仅需要10分钟查看自动生成的报表结果即可,全年累计节省人工运维工时超过900小时,相当于1.1个全职运维人员的年工作量。我还牵头搭建了部门内部的运维知识库共享平台,把全年处置的127起典型故障的背景信息、排查流程、解决方案、预防措施全部结构化录入知识库,部门内部运维人员遇到同类问题可以直接检索参考,本年度新入职的2名运维工程师通过知识库的指引,故障排查上手速度较去年的新员工提升了60%以上,有效降低了新员工的培训成本。本年度工作推进过程中也存在三处明显的不足:一是当前的可观测体系还不够完善,针对微服务架构下的跨链路调用故障,还不能实现一键全链路溯源,部分深层的业务侧故障排查还需要跨监控平台、日志平台、链路平台调取数据交叉比对,故障定位时长还有进一步压缩空间;二是自动化运维的覆盖度还没有达到预期,目前还有15%左右的运维操作,比如部分小配置变更、紧急小版本热修复上线,还是需要运维人员临时申请权限登录业务服务器操作,没有全部纳入自动化运维平台的统一管控,存在人为操作失误的潜在风险;三是针对边缘节点的运维管控能力还比较薄弱,目前公司在外地的3个线下门店的边缘计算节点,还没有接入统一的运维监控平台,只能依靠门店的工作人员兼职巡检,存在一定的运维管控盲区。针对上述问题,202X+1年度我将围绕五个方向推进工作:第一,在明年3月底之前完成全链路可观测体系的升级建设,将基础设施监控、应用性能监控、分布式日志平台三者的数据完全打通,实现从用户端请求发起,到网关、微服务、数据库、缓存全链路的状态可视化,故障定位时间预计从现在的平均20分钟压缩到3分钟以内;第二,在明年6月底之前推进运维自动化平台的扩容升级,把所有非紧急的运维操作100%纳入自动化管控范围,上线配置变更审批流程、灰度发布自动执行功能,彻底消除人为直接登录业务服务器操作的场景,把人为操作失误的故障率降低到0;第三,在明年4月底之前完成3个外地门店边缘节点的运维管控体系建设,将所有远端边缘设备全部接入统一运维监控平台,实现远程状态监控、故障自动告警、远程运维操作,彻底消除运维盲区,边缘节点的全年可用率目标设定在99.9%以上;第四,持续深化容灾体系建设,明年下半年完成异地离线备份中心的搭建,把核心数据的离线归档备份放到物理隔离的异地机房,彻底规避本地机房发生极端灾害情况下的数据丢失风险,同

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论