证通行业ECC运维管理平台方案建议书_第1页
证通行业ECC运维管理平台方案建议书_第2页
证通行业ECC运维管理平台方案建议书_第3页
证通行业ECC运维管理平台方案建议书_第4页
证通行业ECC运维管理平台方案建议书_第5页
已阅读5页,还剩189页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、 证通行业ECC运维管理平台方案建议书目录 TOC o 1-3 h z u HYPERLINK l _Toc517169597 第一章总体概述 PAGEREF _Toc517169597 h 6 HYPERLINK l _Toc517169598 1.1项目背景理解 PAGEREF _Toc517169598 h 6 HYPERLINK l _Toc517169599 1.2项目目标理解 PAGEREF _Toc517169599 h 7 HYPERLINK l _Toc517169600 第二章需求分析 PAGEREF _Toc517169600 h 9 HYPERLINK l _Toc51

2、7169601 2.1概述 PAGEREF _Toc517169601 h 9 HYPERLINK l _Toc517169602 2.2功能性需求分析 PAGEREF _Toc517169602 h 12 HYPERLINK l _Toc517169603 2.2.1ECC大屏系统及统一管理门户平台 PAGEREF _Toc517169603 h 12 HYPERLINK l _Toc517169604 2.2.2统一监控平台(含应用监控) PAGEREF _Toc517169604 h 12 HYPERLINK l _Toc517169605 2.2.3自动化运维平台 PAGEREF _T

3、oc517169605 h 12 HYPERLINK l _Toc517169606 2.2.4IT服务管理流程平台 PAGEREF _Toc517169606 h 13 HYPERLINK l _Toc517169607 2.2.5集中日志分析平台 PAGEREF _Toc517169607 h 13 HYPERLINK l _Toc517169608 第三章需求应答 PAGEREF _Toc517169608 h 14 HYPERLINK l _Toc517169609 3.1集中监控、系统监控及应用监控 PAGEREF _Toc517169609 h 14 HYPERLINK l _To

4、c517169610 3.2ECC集中控制展现平台 PAGEREF _Toc517169610 h 18 HYPERLINK l _Toc517169611 3.3自动化运维 PAGEREF _Toc517169611 h 19 HYPERLINK l _Toc517169612 3.4IT服务管理 PAGEREF _Toc517169612 h 21 HYPERLINK l _Toc517169613 第四章产品原厂商介绍 PAGEREF _Toc517169613 h 25 HYPERLINK l _Toc517169614 4.1概述 PAGEREF _Toc517169614 h 25

5、 HYPERLINK l _Toc517169615 4.2主要的用户 PAGEREF _Toc517169615 h 26 HYPERLINK l _Toc517169616 4.3BSM方案架构 PAGEREF _Toc517169616 h 26 HYPERLINK l _Toc517169617 4.3.1BSM方案介绍 PAGEREF _Toc517169617 h 26 HYPERLINK l _Toc517169618 4.3.2方案组成 PAGEREF _Toc517169618 h 32 HYPERLINK l _Toc517169619 第五章技术方案 PAGEREF _T

6、oc517169619 h 33 HYPERLINK l _Toc517169620 5.1技术方案概述 PAGEREF _Toc517169620 h 33 HYPERLINK l _Toc517169621 5.1.1逻辑架构 PAGEREF _Toc517169621 h 34 HYPERLINK l _Toc517169622 5.1.2部署架构及配置需求 PAGEREF _Toc517169622 h 35 HYPERLINK l _Toc517169623 5.2监控系统设计 PAGEREF _Toc517169623 h 43 HYPERLINK l _Toc517169624

7、5.2.1统一监控平台 PAGEREF _Toc517169624 h 43 HYPERLINK l _Toc517169625 5.2.2系统监控 PAGEREF _Toc517169625 h 55 HYPERLINK l _Toc517169626 5.2.3数据库监控 PAGEREF _Toc517169626 h 59 HYPERLINK l _Toc517169627 5.2.4中间件监控 PAGEREF _Toc517169627 h 63 HYPERLINK l _Toc517169628 5.2.5应用监控 PAGEREF _Toc517169628 h 65 HYPERLI

8、NK l _Toc517169629 5.3自动化运维平台 PAGEREF _Toc517169629 h 68 HYPERLINK l _Toc517169630 5.3.1对象化实现 PAGEREF _Toc517169630 h 68 HYPERLINK l _Toc517169631 5.3.2主要功能实现 PAGEREF _Toc517169631 h 72 HYPERLINK l _Toc517169632 5.3.3平台架构及资源组织建议 PAGEREF _Toc517169632 h 87 HYPERLINK l _Toc517169633 5.3.1安全性考虑及实现 PAGE

9、REF _Toc517169633 h 92 HYPERLINK l _Toc517169634 5.3.2兼容性说明 PAGEREF _Toc517169634 h 95 HYPERLINK l _Toc517169635 5.3.3高可用实现 PAGEREF _Toc517169635 h 96 HYPERLINK l _Toc517169636 5.4IT服务管理流程平台 PAGEREF _Toc517169636 h 99 HYPERLINK l _Toc517169637 5.4.1服务流程平台功能架构 PAGEREF _Toc517169637 h 99 HYPERLINK l _

10、Toc517169638 5.4.2事件管理功能介绍 PAGEREF _Toc517169638 h 102 HYPERLINK l _Toc517169639 5.4.3问题管理功能介绍 PAGEREF _Toc517169639 h 107 HYPERLINK l _Toc517169640 5.4.4变更管理功能介绍 PAGEREF _Toc517169640 h 111 HYPERLINK l _Toc517169641 5.4.5发布管理功能介绍 PAGEREF _Toc517169641 h 116 HYPERLINK l _Toc517169642 5.4.6系统报表 PAGER

11、EF _Toc517169642 h 119 HYPERLINK l _Toc517169643 5.4.7系统管理 PAGEREF _Toc517169643 h 122 HYPERLINK l _Toc517169644 5.4.8流程引擎和工单管理平台BMC Remedy ARS PAGEREF _Toc517169644 h 128 HYPERLINK l _Toc517169645 第六章ECC大屏系统 PAGEREF _Toc517169645 h 147 HYPERLINK l _Toc517169646 6.1综合展现平台概述 PAGEREF _Toc517169646 h 1

12、48 HYPERLINK l _Toc517169647 6.2集中监控大屏展示的范围 PAGEREF _Toc517169647 h 151 HYPERLINK l _Toc517169648 6.3大屏展示内容 PAGEREF _Toc517169648 h 152 HYPERLINK l _Toc517169649 6.4大屏展现效果参考 PAGEREF _Toc517169649 h 154 HYPERLINK l _Toc517169650 第七章咨询方案 PAGEREF _Toc517169650 h 159 HYPERLINK l _Toc517169651 7.1咨询工作的原则

13、 PAGEREF _Toc517169651 h 159 HYPERLINK l _Toc517169652 7.2整体咨询内容 PAGEREF _Toc517169652 h 160 HYPERLINK l _Toc517169653 7.3咨询工作开展模式 PAGEREF _Toc517169653 h 161 HYPERLINK l _Toc517169654 7.4运维服务评价指标及考核体系 PAGEREF _Toc517169654 h 164 HYPERLINK l _Toc517169655 7.4.1设计的原则和方法 PAGEREF _Toc517169655 h 164 HY

14、PERLINK l _Toc517169656 7.4.2流程考核指标示例 PAGEREF _Toc517169656 h 164 HYPERLINK l _Toc517169657 7.4.3KPI考核步骤 PAGEREF _Toc517169657 h 166 HYPERLINK l _Toc517169658 7.4.4管理制度范例 PAGEREF _Toc517169658 h 167 HYPERLINK l _Toc517169659 7.4.5运维服务流程与现有考核制度的关系 PAGEREF _Toc517169659 h 167 HYPERLINK l _Toc517169660

15、 7.5运维服务体系推广 PAGEREF _Toc517169660 h 169 HYPERLINK l _Toc517169661 7.5.1推广工作方法 PAGEREF _Toc517169661 h 169 HYPERLINK l _Toc517169662 7.5.2推广准备和执行 PAGEREF _Toc517169662 h 169 HYPERLINK l _Toc517169663 7.5.3推广试运行示例 PAGEREF _Toc517169663 h 172 HYPERLINK l _Toc517169664 第八章项目实施方案 PAGEREF _Toc517169664 h

16、 175 HYPERLINK l _Toc517169667 8.1实施方法 PAGEREF _Toc517169667 h 175 HYPERLINK l _Toc517169668 8.1.1BMC实施框架 PAGEREF _Toc517169668 h 175 HYPERLINK l _Toc517169669 8.1.2实施流程 PAGEREF _Toc517169669 h 175 HYPERLINK l _Toc517169670 8.2项目实施计划 PAGEREF _Toc517169670 h 179 HYPERLINK l _Toc517169671 8.3项目实施阶段划分

17、PAGEREF _Toc517169671 h 182 HYPERLINK l _Toc517169672 8.3.1计划与准备 PAGEREF _Toc517169672 h 182 HYPERLINK l _Toc517169673 8.3.2分析阶段 PAGEREF _Toc517169673 h 183 HYPERLINK l _Toc517169674 8.3.3设计阶段 PAGEREF _Toc517169674 h 183 HYPERLINK l _Toc517169675 8.3.4构建阶段 PAGEREF _Toc517169675 h 185 HYPERLINK l _To

18、c517169676 8.3.5验证阶段 PAGEREF _Toc517169676 h 186 HYPERLINK l _Toc517169677 8.3.6部署阶段 PAGEREF _Toc517169677 h 187 HYPERLINK l _Toc517169678 8.3.7收尾阶段 PAGEREF _Toc517169678 h 189 HYPERLINK l _Toc517169679 8.3.8项目交付物 PAGEREF _Toc517169679 h 189 HYPERLINK l _Toc517169680 8.3.9培训 PAGEREF _Toc517169680 h

19、191 HYPERLINK l _Toc517169681 8.4售后服务 PAGEREF _Toc517169681 h 192总体概述项目背景理解公司将完成ECC总控中心与同城ECC副中心的建设工作,后续逐步建立异地ECC副中心。为确保多活数据中心的运维管理高效率、高质量和一致性,规划和建设一个集中化、规范化、标准化的统一运维管理平台。通过多个中心、多种信息技术架构、多层次的运维管理人员协同工作,确保公司信息系统安全平稳运行,并高质高效地提供信息服务。在业务系统交付并投入运行时,IT团队相当部分的工作投入到对IT系统的支撑和运维,该工作长期和持续的进行,并与业务系统的更新拓展紧密关联。从对

20、外部客户业务开展的影响看,支撑和运维工作保障业务系统有序、稳定、安全、高效的运行。从对公司内部人员开展日常业务工作的支持看,支撑和运维工作覆盖对各内部业务单位用户的日常IT服务,以支持各业务团队正常、高效的开展工作。从IT组织自我发展的维度看,内部管理及技术创新能力积累等IT治理范畴的工作也是广义支撑和运维的一部分。上述各维度相互交织、相互影响,构成了IT组织除业务应用构建以外的主要工作。为了更有效的开展、管控、治理这些工作,可参照绝大部分IT组织实践的“面向服务”理念:将IT组织定位为企业内部的IT服务供应者;将各种IT能力以服务的方式供用户使用和消费;对各种IT资源以服务的方式进行管理。I

21、T管理的视角需要贯穿服务战略-服务设计-服务移交-服务运营及持续服务优化的整个服务生命周期,综合人员、流程、技术等方面进行管理规划和管理实现。项目目标理解公司IT系统建设将实现多活数据中心的规划和实施,运维体系和ECC的整体设计满足多活数据中心一体化管理的要求,从ECC布局、运维人员配备和运维工具及管理平台建设等方面更好的支撑多中心运维管理的需要。ECC是IT统一运维的外在体现和载体,本项目建设的内在涵盖IT服务管理;其作为持续性的工作不可能一蹴而就,需遵循管理成熟度提升的客观规律;因此,IT管理建设必然是多阶段的、长期的工作。当前的核心任务是尽快构建业务应用系统并提供外部服务,支撑和运维工作

22、的重点也优先着眼于业务系统的运行保障方面。但就总体规划而言,应尽可能明确总体框架,做到有序建设和逐步完善。从广义的业务支撑看,IT团队的支撑和运维工作主要包括以下三个层面:服务于业务系统运转的保障工作(包括业务调度、数据保护、可用性监控、异常干预、日常操作配置等等)。服务于内部各业务单位日常工作的支持(包括沟通协作、服务请求处理、问题处置等等)。支持IT团队内部高效运转的工作(包括IT流程、服务优化等等)。就支撑和运维工作而言,本阶段的重点在于“业务系统运转的保障”,其它层面的建设也以支撑该重点为衡量,将有限的资源投入到最重要的工作中。对近期重点的关注并不意味着对整体体系的忽视,整体IT管理的

23、体系建设和总体框架是支撑和运维工作的蓝图。考虑时间迫切程度和资源投入效用,建议参照业界实践广泛的框架体系构建技术平台,以期获得快速效用;在业务应用初步交付上线后,考虑投入更多资源进行IT管理的个性化梳理和体系裁剪,以期获得长期发展的管理支撑。因此,从ITIL v3对整个IT服务生命周期的角度界定,建议将当前支撑和运维工作的重点在于“服务运营”和“服务移交”阶段的核心要素,后续的工作将通过迭代方式逐步覆盖“持续服务优化”并将“服务战略”及“服务设计”体系化。需求分析概述通过与公司的前期的交流和对本次招标需求的理解,BMC认为本次项目要想成功,必须重视以下四个方面。本次项目的推动力是公司对IT管理

24、能力提升的诉求本次项目的建设内容是“自上至下”一气呵成的,其并不是一个咨询项目+工具落地项目的简单组合。从整个项目的要求来看,公司希望通过本次项目的建设来全面提升自身的IT管理能力,要求很高、着眼面很广,项目建设过程中一定要注意以下两个方面的统筹考量:从规划到体系,再到最后的系统落地,整体思路清晰完整,远近诉求明确,项目实施过程中,项目组必须对各项工作结合时间轴进行分析,找出每个阶段的最有价值诉求,不能眉毛胡子一把抓。本次项目要求的IT能力是综合运维管理能力,潜在的还辐射开发、运维、流程三个方面能力的整合提升,所以在进行规划和体系设计时,要站在更高的高度,用更完整的视角来开展工作。BMC在IT

25、能力管理方面具有丰富的经验,拥有完整的IT部门管理能力模型,从生命周期视角和规划、建设、运维、安全四个维度视角来定义IT管理能力的构成和提升路线。这些方法论和经验可以很好的帮助公司实现本次项目的建设目标。以服务的视角整合管理体系和管理工具,实现真正意义的面向服务公司在提出本次项目的各项建设需求中可以看出,公司是切实希望将自身的IT管理推进到面向服务的成熟度阶段。实现面向服务并不是简单的靠服务目录、服务水平等简单的管理科目就能实现的。本次项目必须在梳理服务目录的基础上,从客户的视角定义客户能够感知的SLA,从梳理内部IT管理活动入手来理清切实支撑SLA的OLA指标,从整合工具角度来实现指标数据提

26、供的客观与准确,只有这样才能实现真正意义的面向服务。构建真正意义的一体化管理工具平台工具实现作为本次项目的近期目标和远期目标实现的技术载体,必须选择成熟的、一体化的工具平台且各个工具平台之间必须能够形成合力。所以在选择工具平台时,必须选择具有一体化工具平台的完整解决方案,而且一体化不是排他化,一体化工具平台必须能够与公司所选择的其它各类工具平台实现共存和联动。项目成果要高标准、高质量公司各相关方对本次项目的交付质量都是高标准、严要求的。项目组在进行项目建设时,要将上述压力有效的转换为动力,要以适当的方式充分利用公司自身的资源,与公司IT团队进行密切合作,形成“One Team”模式,深入了解公

27、司的相关诉求,最终实现高质量的项目成果交付,取得项目的双赢。功能性需求分析ECC大屏系统及统一管理门户平台ECC是统一管理门户平台的重要实体,是管理人员进行数据中心总控的媒介和载体,是各个管理子域技术工具及管理流程支撑特定数据中心管控场景的实现。统一管理门户平台向多角色用户提供IT服务接入、IT运维管理接入及IT管控信息消费等功能。平台从各管理子域及运维分析平台获取管理信息,进行二次加工提炼,以特定形态发布以供消费。本阶段,优先实现ECC的功能,支撑总控能力的达成,为多种管理场景下的有效管理干预、有效信息共享、高效指挥、有序运维操作等提供支撑。统一监控平台(含应用监控)统一监控平台实现对各类基

28、础架构和业务应用的多维度监控,在基础架构要素和业务应用要素发生性能及可用性异常时向管理人员主动发出报警,协助管理人员实现故障的快速定位,并尽可能获取辅助后台进行问题修复的关键信息。本阶段,优先对标准化的基础架构要素、应用运行平台及关键应用进行监控覆盖,实现集中事件管理、基于规则的事件关联分析、和初步的故障定位。自动化运维平台自动化运维平台定位于对运维操作的标准化和自动化,在提高运维标注化程度的同时,降低管控风险,提高运维操作效率。自动化运维平台覆盖重复性的操作,包括健康巡检、合规审计、系统加固、配置基线维护/跟踪、软件部署、补丁管理、批量操作执行并将介质和脚本进行标准化管理;此外,平台还对接I

29、T服务管理流程平台和统一监控平台,实现包括服务自动化交付、工单自动更新、故障自动修复等流程化的自动化操作管理场景。在本阶段建立自动化运维平台能够及早的进行运维规范化的梳理和固化,有效的缓解系统规模大-应用系统复杂与运维人员不足的矛盾。从管理能力积累和配套系统逐步建设的角度出发,本阶段以规范和构建单点对象的自动化操作为主,覆盖系统和网络对象;主要的操作场景覆盖健康巡检、合规审计、标准化配置操作(系统清理、例行重启、配置修改等)、配置备份等。IT服务管理流程平台IT服务管理流程平台是流程化管理的载体,确保IT团队的日常工作有章可循且有据可查,同时对外部业务用户提供集中化的IT服务接入,也实现IT内

30、部的自我管理。在本阶段,IT服务管理流程平台的建设围绕业务支撑进行,以参照最佳实践和同业经验快速构建服务台并实现事件流程、问题流程、变更流程为目标。在建立管理流程平台的过程中,也适宜结合IT团队的发展愿景同步进行管理梳理,科学架构组织并构建运维度量体系,建立初步的持续优化机制。集中日志分析平台需求应答集中监控、系统监控及应用监控项目序号技术要求总体要求1监控信息的采集可支持有代理和无代理的方式2有代理和无代理方式应采用统一的管理架构和相同的管理界面。3具有自身安全性控制,包括用户访问权限、数据安全控制、通信协议安全等,监控信息能够通过SSL加密安全传输。4管理服务器和被管服务器之间通信必须采用

31、安全的协议进行通信,可通过配置方式进行选择。5系统管理必须支持对防火墙内部和防火墙外部主机系统的统一管理,保证数据通信和穿透防火墙时的安全性。6可远程收集第三方监控软件的监控数据7产品支持B/S的管理方式8可以与相关IT服务管理软件产品集成,按照ITIL国际标准,建立一套完整、成熟、可靠的IT服务管理体系9平台部署要求支持多种环境,数据库应支持Oracle, SQL Server等主流品牌10支持通过SMTP和POP3协议和邮件系统对连等。11要求内置性能监控器模板,提供主流商用系统和软件的监控模板12可以通过配置方法定义、修改、部署监控模板。13报警阈值需能支持自定义,能够对多个报警条件进行

32、策略化组合报警14能够设定当性能指标连续多次超过阈值时才产生报警。15提供自学习的动态阈值基线功能,能够自动的对过往性能数据进行学习,以生成有参考性的随时间变动的阈值条带16支持通过Telnet/SNMP/WMI/SSH等多种方式综合监控各类主流的操作系统、数据库、中间件17能够采集主机设备、操作系统、数据库、应用程序的性能、日志与事件等以及各种Unix 程序、脚本产生的信息和各种设备发生的SNMP Trap等信息源18能精确定位故障点,特别是多个故障同时发生时,能查找根原因19对采集的事件能按来源、类型、级别等指标进行分析。20需支持操作自动化整合,实现复杂场景告警事件的自动化处置21根据历

33、史数据对被监控资源消耗进行评估和预警22能够基于采集的历史数据对CPU、内存、磁盘等主要性能指标进行预测分析,预测一周、一月、三个月等时间段后的性能状况,为系统容量规划提供数据支持23一个监控策略,应包含多种监控指标24对于不同设备,可分别设置不同的阀值,采样间隔最少可以设置为秒级集中事件管理要求25支持建立高效事件管理平台,保障信息系统的稳定、高效与健康运行。26支持建立统一的告警、性能分析功能,集中处理、统一管理。27支持建立与流程平台、配置管理系统的有效机制,确保告警的闭环处理流程。28与现有的其他监控系统紧密集成,规范处理各类告警、性能数据29须对采集的标准事件、性能事件进行统一处理3

34、0需具有事件过滤、事件压缩、事件关联、智能分析、统计分析等功能31通过对大量重复的事件信息和次要、无意义的事件信息进行过滤32通过对不同时间产生的相同事件,将其合并成一条事件信息33通过内置或扩展定义的关联机制,对相关事件进行分析34通过配置管理数据库提供的配置信息、关系及模型,根据告警事件触发的时间、频度等,对同一业务服务模型中所有对象的告警事件进行智能分析,自动梳理出告警事件间的关联关系,从而智能化事件关联的处理过程35提供丰富的告警通知方式,如手机短信(通过短信平台发送)、弹出窗口、电子邮件、语音画面等36支持分时段告警,不同告警可通知不同告警人,告警动作支持第三方程序;37供方便的排序

35、和不同条件的查找、过滤、导出功能38支持告警级别定义39要求能够对原始事件、标准事件、告警信息实现分别展现40要求能够实现按照内容的告警信息展示41要求在拓扑图中能够通过颜色改变帮助维护人员迅速定位发生告警的网元或应用组件42可以同时管理网络、主机、应用、业务服务等,即所有组件级管理模块都可以将告警信息统一发送到管理平台上43事件需要和IT服务管理系统无缝集成,支持直接生成工单44事件管理能指定条件自动或手动将事件发送到主流ITIL平台产品45事件处理学习能力,提供先进的技术手段降低事件维护的工作量46事件关联能力47能够根据事件之间的关系及影响程度自动分析指出可能的根源事件以及根源事件的优先

36、级别,同时可自动捕捉问题状态场景并提供设置自定义分析手段的功能48对根源故障提供可能性评分,提示根源事件对于目标事件影响的可能性49能够同配置管理数据库(CMDB)紧密关联,使用CMDB中CI的相关信息进行必要的实时事件内容丰富业务影响建模要求50提供业务建模功能,能够建立以业务为中心的综合IT模型51数据模型能真实展现业务系统的架构,能准确地反应数据类型和数据之间的关系52支持多种拓扑图、邻居图。监控平台可以提供灵活的拓扑图,拓扑可以查看各自监控项的关系53可提供被监控IT基础设备、数据库、中间件和应用之间的映射关系54一个完整的、集成的服务模型。它包括整个物理和虚拟的基础架构设施,包括交易

37、、应用、服务器、存储、网络,完整地集成地展示为一个视图55支持自动创建模型。如模拟用户体验管理、真实用户体验管理、应用深层诊断等来自动发现创建56该模型需要能实现动态实时维护,实现准实时的状态更新系统监控要求57 要求支持管理的多种操作系统类型: Windows(2003、2003R2、2008、2008R2)、AIX、Linux(Redhat、Suse等各种主流版本)等58能够集中、全面地监控多种主机、PC服务器的多种操作系统59能采集以下信息:CPU、IO、内存、硬盘、分配的存储资源、网卡、交换空间、文件系统、内核参数、进程、用户会话、系统时间、操作系统版本信息、补丁号、配置参数、配置文件

38、信息等60监控操作系统的单个CPU和整体的利用率61按照CPU使用率可以列出进程列表;能够显示出CPU运行队列的长度62监控内存的使用情况,包括:进程内存使用情况;换入换出情况;63显示本地硬盘及挂载盘的使用率64实时监控系统进程的运行状况,并能在系统进程出现异常时给出告警65可显示进程所占用系统资源的情况;能够显示每个用户所占用的内存、子进程、客户端连接数等66能够对长时间占用CPU的进程进行告警67能够监控僵尸进程68实时显示主机系统网络适配器的输入和输出包情况并报告冲突和错误以及路由和网络流量情况69能够实时监控文件系统的使用情况,并在文件系统达到一定阈值或异常时给出告警70能够监视重要

39、文件的存在、文件大小变化、内容变化情况71可以实现对服务器管理控制台的集成监控72提供IT资源自动发现方式,以保障设备发现准确,同时必须提供设备状态跟踪能力73可根据事件的影响程度进行分级告警,并进行色彩标识数据库监控需求74能够有效检测各主流数据库产品(Oracle、DB2、SQL Server、mysql)的性能状况,并要求提供详细的报告75显示当前数据库服务器的活动状态,包括查询、连接的运行情况,为管理员进行性能诊断、参数配置提供依据76提供报警、预警功能,能够持续监控数据库,对其状态变化、故障及其它关键事件进行采集77并要求支持对监控参数设置阈值,提供用户自定义重要事件及阈值的功能,当

40、监控到重要事件时,能够根据策略报警78监控数据库的数据文件,发现数据空间不够,能及时报警79对数据库关键配置参数和配置文件进行比对,可及时对发生的变更进行告警80可以监控数据库基本情况:包括状态,SGA使用情况,I/O,Cache,Buffer pool,锁,会话,表空间等中间件监控要求81能对应用系统及中间件日志文件进行基于正则表达式的监控,当在日志文件中出现某种形式的字符串时,能产生预定义的触发事件82要求实时动态地检测主流中间件产品(包含jboss 4、jboss 5及以上版本、MQ、Weblogic(Weblogic8及12c等)、Nginx、apache和tomcat、memcach

41、e、redis、IIS、WAS(WebSphere Application server))的性能状况83监控中间件系统的运行情况,监控应用服务器及应用程序对CPU、内存、磁盘等系统资源占用情况84收集各部件的性能数据和测量应用响应时间,出现异常时能够产生告警/事件信息,并可送至控制台处理85提供对功能组件的健康检查,包括: Servlet,JDBC,等组件,并自动发现相关于JVM的环境、配置等,并对JVM使用资源进行监控和管理86主动监控管理中间件服务器的LOG文件内容,能够快速地对日志文件中的问题和故障报告做出快速的响应87当中间件服务器实例或其他被监控组件出现异常事件时报警88集成中间件

42、服务器的管理能力,能够启动、关闭、锁和解锁服务器,具有强制垃圾收集能力,创建、优化和摧毁JDBC 连接池,发布应用等功能89从一个集中的应用类中监控和管理JDBC连接的缓冲区池;监控代表交易逻辑的HTTP和JSP的Servlets90支持监控应用URL的可用性和响应时间,并能做页面内容的匹配检查91对JSP/SERVLET 监控:最大执行时间,平均执行时间,重新加载累计值和累计值比率92对EJB 的监控:事务提交、回滚,事务命中93对交易的详细监控:监控交易的时长,并对交易的详细对象进行监控,包括交易相关联的SQL的响应时间等日志监控要求94可以实现对设备(包含服务器、网络设备等)硬件和操作系

43、统日志、应用系统日志、数据库日志、网络日志等出现的问题和错误进行分析与及时告警95支持读取存放于数据库中的日志96能够自动对系统日志内容进行分析,判断系统中的重要错误、警告以及其他问题,并给出相应的告警97对主机系统及其外设的硬件故障能够通过对其故障日志的分析,做出及时的告警。98可以对系统标准日志中的硬件故障和软件故障进行分类监控99能够自动对系统日志内容进行分析,判断系统中的重要错误、警告以及性能等问题,并给出相应的告警100支持不同来源日志的关联分析101为了实现更加灵活、机动的监控,应该对操作系统、应用系统的日志文件进行监控,实时、主动的监控各关键日志文件,一旦发现问题,及时告警102

44、日志文件加入监控行列后,要求可以匹配特定的关键字,自动过滤关键信息。要求在关键字触发告警时允许配置事件报警信息103要求能够实时监控日志文件的大小,在达到用户给定的条件后,系统将产生告警104对主机系统及其外设的硬件故障能够通过对其相应的故障日志的分析,做出及时的告警105要求能够从日志文件中提取某一时间段或某一特定类型的日志信息,以便于问题分析和统计汇总106要求支持用时间戳作为日志文件名,自动发现和读取当天的正确日志文件107要求可以自定义采样间隔和周期108要求可以通过GUI定义关键字,来分析日志文件的内容存储监控要求109支持对磁盘阵列、NAS设备、带库设备等各类存储的监控应用监控要求

45、110应同时支持主动式应用监控和被动式应用监控111对应用无侵入,监控实现对应用没有性能影响,无需更改和调整应用配置和代码112应支持BS和CS架构的应用监控,应尽可能提供对各类协议的支持能力113支持代理和镜像等方式,获得基于HTTP、HTTPS、卡交易、核心银行、SOA、人行、证券、短信等金融行业常用协议相关交易的服务器端真实用户性能。支持捕获TCP/IP请求/响应及TCP/IP流,获取各类应用使用情况信息。114分解网络响应时间、客户端、服务端、DNS解析等各段响应时间的分布115可对整个交易过程中的网页数据、交易数据、最终用户数据、会话数据进行分析,同时可提供业务流程分布报告116可以

46、根据需要配置数据过滤条件117可以区分主动探测数据和真实客户数据118可提供基于应用、地区及用户组的应用监控范围配置119监控应用服务器主机的响应时间,列出各环节响应慢的服务器主机的IP地址。120查看各个应用的服务状态,当某服务停止响应的时候及时发出告警。121提供真实的用户访问体验监控,通过对HTTP请求响应的持续时间分析,得到每次用户端与服务器端交互的真实时间(通常指中间件获取请求到返回结果的时间)122 能够识别交互过多的应用并测量其性能123基于默认或者可配置的规则,自动发现所有的 URL,特别是页面下的子连接URL,方便配置人员配置124实时掌握应用中的各URL的访问及响应情况12

47、5能够通过SessionID、IP、用户标识对用户的访问进行检索快速找出故障相关的数据从而快速解决故障。并可结合诊断工具下挖到代码层126支持与模拟操作(机器人)类监控工具兼容,可统一展现、使用共同业务模型,并可区分真实用户数据及模拟操作数据127需要提供信息过滤与Mask功能,对Http/https信息中交易敏感信息配置过滤策略,确保敏感数据安全性128可以根据需要配置数据过滤条件129支持与主动业务探测功能集成,对于同一业务定义(交易或者操作页面)实现统一管理业务模型、统一视图展示、统一报告,便于管理员使用,一目了然查看业务状态其他监控集成要求130能够和机房环境,云管理平台,自动备份,作

48、业自动化调度等第三方系统集成满足。详见5.3章节ECC集中控制展现平台项目序号技术要求基本要求1整个ECC大屏由多块单屏组成,集中展示IT系统的整体运行状态。大屏幕展现控制系统从各运维子平台中提取、综合并展现管理信息。2展现信息包含但不限于以下信息:- ECC工作提示- ITSM- 业务指标监控- 业务系统运行状况- 业务影响分析- 系统性能监控- 网络地图- 网络拓扑监控- 告警事件列表- 批处理作业状态监控- 机房环境监控- 业务KPI展示- 安全风险视图技术要求3投标方应结合管理需求和运维经验提供ECC集中控制展现平台的整体设计和实现,应覆盖运维中的各种场景并实现快速切换。4整体框架应保

49、持开放,并支持灵活的内容扩展。5投标方应说明平台的技术架构以及与外部系统交互对接方式。满足。详见5.6章节自动化运维项目序号技术要求跨平台技术要求1系统运维涉及多种系统和平台,自动化平台应实现跨平台的管理支持,实现异构环境的统一管理,需支持AIX、HPUx、SUSE Linux、Redhat Linux、Solaris、Windows等系统的主流版本,识别各系统的特征对象,采用通用性架构实现管理。网络设备应支持包括华为、CISCO等主流设备的支持,应提供接口对特定设备协议进行扩展和定制管理。资源组织要求2运维自动化平台需提供中文的使用界面。3运维自动化平台应允许用户对系统、介质、操作等对象按照

50、自己的规则进行命名和分组,应支持中文命名。4在日常运维中,需要根据服务器对象的多种特性进行分组,并对统一特性分组的多个系统进行批量操作。例如按OS划分、按所属位置划分、按业务类别划分、按所属维护用户划分等等,不同的运维操作可能需要按不同的特性进行(例如对所有机房A内的Windows 2008系统进行批量操作),运维自动化平台应能够友好的应对这种逻辑分组,单一系统应允许属于多个逻辑分组,同时应支持按系统属性进行规则化的自动分组(如将hostname以“app”开头的系统分为一组)。资产信息和配置识别要求5系统对象的配置发现是后续配置操作系统化的基础,系统运维平台应能够对系统及应用对象各个层面的属

51、性配置进行扫描和发现,并实现格式化、对象化的管理。6服务器基础硬件信息:包括处理器(数量、型号等)、网卡(数量、型号、MAC等)、BIOS、磁盘、存储卡等等。7操作系统信息:包括操作系统类型、IP地址/DNS名称、网络设定、开放TCP端口、文件系统、系统补丁、已安装软件包、用户/用户组、内核参数、守护进程/系统服务、注册表项等。8系统-应用配置信息:直接解析操作系统及应用系统的配置文件,如hosts、security、services、group、fstab、ntp.conf、route、web.xml、init.ora等等;对于应用配置文件,提供解析方法和机制,实现字段级配置项的解析,支持包

52、括xml、空格分隔、逗号分隔等主流格式的直接解析;对于通过应用命令获取的stdout及stderr信息,可实现封装和格式化解析,能够针对输出信息的各种格式实现字段级配置项的解析。9应支持实时系统浏览,授权用户应能够通过平台直接查看被管理系统的实时配置信息及文件系统内对象的内容。10对网络设备,应能够自动发现和采集网络设备的配置,比如设备类型、设备型号、硬件信息、操作系统版本、startup config、running config、VLAN等,并在此基础上跟踪它们的变化。批量操作及软件分发要求11系统运维涉及多种软件的多种版本。自动化平台需提供集中的软件版本介质库,实现多应用多层次版本的集中

53、存放和管理,介质文件内容可包含各种文本或二进制文程序、工程文档及各类压缩包。12系统运维操作常涉及多个相关步骤,包括文件传输、解包、命令执行、文件更新等,多步骤的组合经常一同发生,若回退也常需一同回退。自动化运维平台需能整合文件分发、命令执行、配置建立/更新等操作,提供有原子性的封装机制,实现灵活的各类操作组合;封装的操作包需能够进行回滚,对于文件形式对象(文件分发、配置文件更新等)的操作回滚应不依赖脚本开发,对于命令形式(如insert数据库)的操作回滚应提供有效机制供用户嵌入所需逻辑。13系统运维涉及集群和多机环境,各个目标系统的配置在总体一致的同时存在一定的个性化差异化(如不同系统的分发

54、路径按照约定规则不同、配置端口按照约定规则不同)。自动化运维平台需支持操作配置动作的参数化,对于多机操作中的标准化细节差异,可以通过参数规则自动匹配(例如对多机构成的集群系统,批量操作的步骤逻辑相同,但对各系统的端口参数配置分别为8080,8081,8082,自动化运维工具应能够提供简单的非开发、非脚本方式实现参数指定)。14系统运维可能涉及多个网段多个地域的节点,例如对防火墙分隔的A网段5台、B网段10台、C网段8台服务器分发相同文件。自动化运维平台应通过合理的部署架构避免大数据流的重复传输,实现优化的防火墙策略和极小数据冲击。15系统运维可能对单台或多台进行,不同操作场景可能对多台对象顺序

55、发布,也可能对多台对象并行发布。自动化平台的分发过程应能够灵活的设定发布目标,应允许选定对单台系统进行发布,也应允许对多台或某个逻辑组内的对象进行发布;应允许对多个发布作业串行或并行执行。16操作应能够实现自动定时进行。17系统运维执行可设定失败报警。报警应能够实现邮件发送;同时应支持SNMP trap发送,从而实现与监控平台整合。18系统运维过程应保留细致的操作日志,以供操作失败时分析检查并供审计回溯之用。19对网络设备应能进行版本检查,以确认环境一致性;应能批量进行设备的升级和降级。20对网络设备的配置偏移,应能自动创建增量的命令脚本以实现配置变更,而无需重新启动设备(即非破坏性回滚),从

56、而最大限度地提高系统的可用性。巡检要求 21系统变更成功后,需要对环境进行保护和控制,防止非授权的变更或误操作更改了系统及应用依赖的配置。自动化平台应能够定期的对系统-应用环境进行稽核检查,当发现关键配置与期望值不同时,及时报警,并允许强制纠正。22应支持基于配置和规则的稽核规则定义,尽可能降低对脚本开发的技能要求和依赖。23当特定变更操作成功后,应有效的对系统设定和状态进行记录,并作为后续比较的基准,将其作为日常巡检的模板和基线。自动化平台应支持基线的创建,能够在需要时对特定系统的特定范围(如子目录、文件、内核参数、配置范围等)进行快照。24自动化平台应实现针对基线的多方位比对。例如对于文件

57、对象,应包含文件内容(包括二进制文件)、大小、修改日期、用户、属组、权限等;对于关键配置文件,应定位具体字段级配置项内容等;从而实现完整、有效、有针对性的比对稽核。25对于稽核巡检规则的运行,需按系统及按规则显示检查结果,对于不合规的对象,需能逐层展开显示特定稽核失败的细项,包括期望的设定值和当前扫描的实际设定值,从而获取对如何修正提供针对性的指导性信息。26稽核巡检应能设定执行周期和时间,确保定期的触发运行。27稽核巡检应支持异常报警,当巡检发现异常时,主动发出报警。报警应能够实现邮件发送;同时应支持SNMP trap发送,从而实现与监控平台整合。28对于一组服务器中个别特殊的配置设定,可能

58、与基线模板有差异,但合法,对于这种场景,需可设定例外,使后续巡检时,不将该差异作为巡检异常。29稽核巡检结果可以导出为可读文件以供历史存档。30对于稽核内容的异常,应可设定自动修复的动作,并当设定为允许自动修复时,第一时间修复配置,或在管理员干预时完成一键式修复。31自动化平台需自带业界主流合规规范(包括塞班斯、PCI、CIS等)的稽核规则策略,应提供等保合规所需的合规模板。 32应提供直观的合规汇总信息,清晰的展现合规检查结果。33对于网络设备,提供基于国际规范或用户自定义规范的的合规面板;不论是通过平台发出的还是带外发出的操作,应能够主动跟踪变化,并提供细粒度的变化对比;对于发生的配置便宜

59、,应该提供自动的修复逻辑生成功能,方便管理员进行快速修复。补丁部署要求34自动化平台需支持SUSE Linux、Redhat Linux、Windows、AIX等系统的补丁管理,可以实现系统补丁和应用软件补丁的检查、部署、安装和管理。35对于Linux和Windows平台,同时应支持补丁的分析,即基于厂商发布的补丁更新列表进行系统扫描比对,列出有补丁缺失的服务器,并允许人工确认后执行批量分发。36补丁列表应支持安全的离线方式,即用户在internet环境获取特征文件,随后手工倒入管理平台;同时也应支持在线方式,以直接便捷的获取最新补丁更新列表。37对于官方的补丁列表,允许用户进行选取裁剪,以避

60、免补丁部署的无序。38补丁的分析和部署结果可以定期导出,以供历史归档。裸机部署要求39自动化平台需支持跨平台的操作系统部署,包括AIX、HPUx、Solaris、SUSE Linux、Redhat Linux、Windows、ESX等等。40对包括AIX在内的主流Unix系统的裸机部署,应支持图形化的配置,应涵盖分区创建和OS部署功能,为快速部署和部署逻辑重用提供便利。41自动化平台需支持对主流虚拟化平台的操作,如VMWare等,能实现各类虚机操作(如虚机克隆、配置更改等等)。42系统部署应包括个性化的系统加固内容,如内核参数修改、用户配置、安全策略配置等等。批量作业执行控制要求43自动化任务

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论