Linux服务器运维管理规范_第1页
Linux服务器运维管理规范_第2页
Linux服务器运维管理规范_第3页
Linux服务器运维管理规范_第4页
Linux服务器运维管理规范_第5页
已阅读5页,还剩7页未读, 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Linux服务器运维管理规范一、运维组织与职责划分明确责任边界是避免运维事故推诿和保障处置时效的先决条件,本规范通过定义角色与权限边界,建立“操作有审批、过程有记录、事后可追溯”的闭环机制。1.1角色定义与权限矩阵1.一线值守运维工程师(L1):负责日常巡检、监控告警响应、按既定SOP执行标准化操作。严禁直接在生产环境执行未经审批的非标准化变更命令(后果:人为误操作导致业务中断,且无法快速回退;替代方案:必须在测试环境验证并提交L2审批后执行)。2.系统管理员(L2):负责复杂故障诊断、系统架构调整、制定变更方案及SOP。拥有sudo权限,但必须通过堡垒机执行所有生产环境操作。3.运维主管(L3):负责变更方案终审、应急预案启动决策、故障复盘定责。1.2变更审批红线所有针对生产环境的变更操作,必须提前24小时提交变更申请单(包含:变更目的、影响范围、回退方案、验证步骤)。紧急故障抢修可“先执行后补审”,但必须在操作过程中开启堡垒机全程录像,且操作完成后2小时内补齐审批记录。二、服务器初始化与基础配置规范标准化的初始配置决定了服务器在整个生命周期内安全基线的一致性,是防止“带病上线”的核心关卡。2.1系统安装与分区要求生产环境优先部署minimal版本(仅安装必要组件以减少攻击面);若业务有特殊桌面需求,则单独部署专用工作站,严禁在服务器端安装图形界面(后果:额外消耗约500MB内存及CPU资源,且引入大量无关依赖包增加漏洞风险)。磁盘分区必须采用LVM(逻辑卷管理),以便后续在线扩容。关键挂载点划分要求如下:挂载点大小规划建议文件系统约束要求/boot1GBext4独立标准分区,存放内核与引导文件/50GBxfs系统根目录,只存放系统文件/var100GB起xfs独立LV,避免日志突增撑爆根分区/data剩余空间xfs独立VG,业务数据目录,便于快照备份风险演化说明:若/var未独立分区,恶意攻击者或异常业务进程持续生成日志->系统根分区/磁盘空间达100%->系统无法写入pid文件及日志->导致SSHD、数据库等核心服务崩溃->管理员无法登录救援。2.2网络与内核参数基线初始化后必须调整以下内核参数(写入/etc/sysctl.d/99-prod.conf并执行sysctl-p生效):#开启SYNCookies,防御SYNFlood攻击

net.ipv4.tcp_syncookies=1

#禁用ICMP重定向,防止中间人攻击

net.ipv4.conf.all.accept_redirects=0

#开启反向路径过滤,防范IP欺骗

net.ipv4.conf.all.rp_filter=1

#优化文件描述符上限至65535,防止高并发业务报Toomanyopenfiles错误

fs.file-max=655350三、账号权限与访问控制管理权限的滥用与扩散是导致数据泄露和系统被控的最主要途径,控制权限即控制风险。3.1SSH安全基线配置SSH是Linux服务器唯一的远程管理入口,必须通过修改/etc/ssh/sshd_config实施最小化暴露与强身份认证。1.隐藏端口与网络隔离:优先将SSH端口修改为10000-65535之间的非标准端口(如50022);若负载均衡或堡垒机架构允许,必须绑定内网管理IP,严禁将22端口直接映射至公网(后果:每分钟将遭受数千次自动化爆破,消耗系统资源并极大增加被入侵风险)。2.密钥认证与禁用密码:必须禁用密码登录(PasswordAuthenticationno),仅允许RSA2048位或Ed25519密钥登录。生成密钥时必须添加passphrase保护。严禁使用无密码保护的私钥文件。3.登录失败锁定:应当配置fail2ban或系统级PAM模块,策略设定为:10分钟内同一IP失败5次,封锁该IP访问30分钟。3.2sudo权限收敛严禁在/etc/sudoers中配置userALL=(ALL)NOPASSWD:ALL(后果:相当于直接暴露root账号,一旦该账号被盗用,攻击者可无痕执行任意破坏命令)。应当采用命令级别白名单授权,且指定具体路径:#允许L1运维重启nginx服务,无需输入密码

L1_userALL=(root)NOPASSWD:/usr/sbin/nginx-sreload

#允许L1运维查看系统日志

L1_userALL=(root)NOPASSWD:/usr/bin/journalctl-u*四、软件包与补丁更新规程补丁管理是在安全漏洞曝光后与攻击者抢跑的防御机制,必须兼顾更新时效与业务连续性,严防“修了漏洞、停了业务”。4.1漏洞分级与响应时效依据漏洞利用难易度及业务暴露面,分为三级并设置不同SLA:•一级(严重,CVSS≥9.0)◦响应时效:接报后2小时内启动应急响应。◦处置原则:优先在业务低谷期应用官方补丁;若补丁未发布,必须实施虚拟补丁(如WAF规则)或网络层封堵。•二级(高危,CVSS7.0∼8.9◦响应时效:接报后24小时内完成补丁测试与灰度部署。•三级(中低危,CVSS<7.0)◦响应时效:每月定期统一打包更新。4.2补丁更新PDCA闭环操作1.计划:核对CVE详情,在测试环境拉起与生产同构镜像,下载并校验RPM/DEB包的SHA256哈希值。2.执行:更新前必须对系统进行快照备份。执行更新时,优先使用yumupdate--security或apt-getinstall--only-upgrade<pkg>仅更新受影响包;严禁执行无差别的yumupdate-y(后果:可能意外升级glibc或OpenSSL等底层库,导致依赖其的核心业务进程如MySQL/Nginx崩溃)。3.检查:更新后重启测试环境,验证核心业务接口连通性及系统日志无异常报错。4.改进:若测试失败,通过快照回滚测试环境,并向原厂或社区提报技术工单,直到产出可用补丁重新执行流程。五、监控告警与日志管理监控是运维的“眼睛”,日志是排障的“黑匣子”,缺失这两者意味着系统运行在盲区,故障处置将陷入盲目猜测。5.1核心监控指标与阈值设定监控采集必须覆盖以下核心维度,且告警需配置分级路由:监控维度关键指标警告阈值严重阈值采集频率CPUiowait百分比>20>4015秒内存可用内存<<15秒磁盘根分区使用率>>1分钟网络入站带宽丢包率>>30秒告警抑制机制:为防止告警风暴导致运维人员麻木,必须配置告警收敛规则。同一指标在同一台主机上10分钟内只发送首次告警,恢复时发送恢复通知。5.2系统日志集中化与审计1.日志转发:所有生产服务器的/var/log/messages、/var/log/secure及应用日志,必须通过rsyslog或Filebeat实时转发至集中式日志中心(如ELK)。严禁仅在本地存储日志(后果:一旦主机被入侵,攻击者首要动作即为清理本地日志,导致溯源链路断裂)。2.日志保留策略:审计类日志(如登录、sudo执行记录)必须保留至少180天,业务系统访问日志保留90天。使用logrotate进行轮转,配置参数为daily、rotate180、compress。3.日志完整性校验:每天凌晨自动计算前一天日志文件的SHA256哈希值,并将其发送至独立于业务网络的安全服务器存储,确保事后审计时能检测出日志是否被篡改。六、应急响应与故障处置预案应急处置的核心目标是在最短时间内恢复业务可用性,而非在事故现场寻找根因,所有的操作必须受控且有据可查。6.1故障分级与启动权限•P1级故障(核心业务全面阻断):◦判定标准:主站首页不可访问,或核心交易链路成功率低于50%◦启动权限:L1确认后立即拉响警报,L3直接指挥调度。◦处置时效:5分钟内响应,30分钟内必须恢复或启动备用方案。•P2级故障(局部功能受损):◦判定标准:非核心模块异常,单节点宕机但集群未受实质影响。◦启动权限:L2负责指挥。◦处置时效:15分钟内响应,2小时内恢复。6.2现场处置禁忌与标准动作•禁忌一:盲目重启。严禁在未查明负载状态时对卡死服务器执行硬重启(后果:若此时磁盘正在执行高并发写操作,强制断电将导致文件系统inode损坏,造成不可逆的数据丢失)。替代方案:通过带外管理(IPMI/IDRAC)登录查看死机前屏幕状态,尝试SysRq触发安全重启。•禁忌二:无备份直接修复。严禁在数据丢失或损坏故障中,直接在原盘上执行fsck或xfs_repair(后果:修复操作本身具有破坏性,可能将原本可恢复的数据彻底抹除)。替代方案:必须先对故障磁盘所在的LUN制作LVM快照或存储级快照,在快照卷上进行数据抢救与修复。七、数据备份与恢复管理规程备份是系统遭受勒索攻击或毁灭性破坏后的最后一道防线,未经过恢复验证的备份等同于无备份。7.1备份策略3-2-1原则落地1.保留3份数据副本:1份生产数据,2份备份数据。2.采用2种不同介质:生产环境为SSD阵列,备份环境优先使用对象存储或磁带库;若不具备,则使用独立NAS存储池,严禁将备份文件直接存放在生产主机的本地另一块盘上。3.保留1份异地副本:每日全量备份完成后,通过专线在夜间带宽空闲期异步同步至50公里外的异地灾备中心。备份周期设定:全量备份每周日01:00执行,增量备份每日01:00执行。备份成功率验证:备份任务结束后,必须在10分钟内收到备份系统的成功回调,若未收到,监控系统必须在5分钟内拨打电话告警通知L1值班人员。7.2恢复演练机制应当每季度执行一次真实环境下的数据恢复演练,严禁仅做“文件存在性校验”。恢复演练操作步骤:1.在隔离网段拉起一台空白Linux实例。2.从备份库提取最新的全量与增量备份,按时间线重放数据。3.使用mysqldump或pg_restore恢复数据库,启动业务进程连接测试。4.输出恢复验证报告(包含:备份大小、恢复耗时、数据完整性校验结果如数据表行数对比)。演练失败必须在48小时内复盘并调整备份策略。八、附录:可执行检查表与登记表本附录为日常运维操作提供可直接打印执行的标准化表单,确保动作不变形、不遗漏。8.1附录1:Linux服务器上线安全验收检查表检查类别检查项目判定标准验收结果硬件与系统内核版本满足业务最低要求且无已知高危CVE[]合格[]不合格硬件与系统时钟同步chronyctracking偏差<100[]合格[]不合格账号安全Root登录/etc/ssh/sshd_config中PermitRootLoginno[]合格[]不合格账号安全密码策略/etc/login.defs中PASS_MIN_LEN12[]合格[]不合格账号安全空口令检查执行`awk-F:'($2==""){print$1}'/etc/shadow`无输出[]合格[]不合格网络安全防火墙状态firewall-cmd--state返回running[]合格[]不合格网络安全废弃端口ss-tulnp无非业务必需端口监听[]合格[]不合格监控接入Agent状态Zabbix/Prometheusagent心跳正常[]合格[]不合格日志审计审计服务systemctlstatusauditd状态为active(running)[]合格[]不合格验收人签字:__________日期:__________8.2附录2:运维应急联络通讯录角色姓名手机号码职责说明L1值班工程师张某138******7x24小时一线监控响应、初步排查L2系统管理员李某139******复杂故障定位、变更方案制定与执行L3运维主管王某137******灾难性故障决策、资源协调调度网络组接口人赵某135******防火墙策略调整、专线链路排障业务研发负责人孙某136******业务逻辑级异常判定与热修发布8.3附录3:常规变更操作SOP(示例:Nginx配置更新)1.变更准备(T-30min):从Git仓库拉取最新配置,执行nginx-t语法校验。2.通知公告(T-10min):在运维群发送即将变更通知。3.备份原配置(T-5min):执行cp/etc/nginx/nginx.conf/etc/nginx/nginx.conf.bak_$(date+%F)。4.分发与重载(T+0):分发新配置,执行sudo/usr/sbin/nginx

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论