集团公司IT运行监控平台方案设计_第1页
集团公司IT运行监控平台方案设计_第2页
集团公司IT运行监控平台方案设计_第3页
集团公司IT运行监控平台方案设计_第4页
集团公司IT运行监控平台方案设计_第5页
已阅读5页,还剩140页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、PAGE 集团公司IT运行监控平台方案设计目 录 TOC o 1-4 h z u HYPERLINK l _Toc528139795 1.目标及范围 PAGEREF _Toc528139795 h 3 HYPERLINK l _Toc528139796 1.1 项目目标 PAGEREF _Toc528139796 h 3 HYPERLINK l _Toc528139797 1.2 项目范围 PAGEREF _Toc528139797 h 4 HYPERLINK l _Toc528139798 2.技术方案 PAGEREF _Toc528139798 h 5 HYPERLINK l _Toc52

2、8139799 2.1 系统总体架构及部署 PAGEREF _Toc528139799 h 5 HYPERLINK l _Toc528139800 2.1.1 总体架构 PAGEREF _Toc528139800 h 5 HYPERLINK l _Toc528139801 2.1.2 系统组成及系统体系结构 PAGEREF _Toc528139801 h 5 HYPERLINK l _Toc528139802 2.1.3 平台功能 PAGEREF _Toc528139802 h 7 HYPERLINK l _Toc528139803 运行监控系统 PAGEREF _Toc528139803 h

3、 7目标及范围项目目标集团公司在总部和企业层面已经建立了以综合网管系统和SAP SLM系统为主的运维支持系统,运维支持系统概览如 REF _Ref328568448 h * MERGEFORMAT 图所示。图 运维支持系统概览集团公司总部建立呼叫中心系统实时响应了用户有关门户、OA、基础应用、安全、视频、MES等系统的服务请求;工单系统实现了总部运维人员处理系统故障的工单流转;SAP SLM实现了ERP系统服务请求受理、事件管理、应用监控及变更管理;网管监控系统实现了因特网、主干网、局域网、服务器、安全设备、企业防火墙、基础应用等基础设施的故障和性能监控;资金集中监控系统实现了资金集中系统的网

4、络设备、服务器、安全设备、存储、负载均衡、灾备和应用系统的一体化监控;MES应用监控评价系统对MES应用进行监控,为MES上线达标、验收达标及深化应用提供了报告和依据。在企业,已建成76家企业的综合网管系统,实现了对企业基础设施的监控;基本建成防病毒管理Bigfix系统,截至2012年1月,共安装18.3万台,授权数18万。同时,广州石化、茂名石化、燕山石化、北京石油等部分企业已建设了运维服务管理系统。本次项目的总体目标是整合运维支持系统,建设集中的一体化运维平台,支撑集团公司IT运维共享服务,提高运行效率,降低成本,实现总部和企业运维统一调度和集中管控,达到国内领先、国际一流的水平。(1)建

5、设集团公司IT运维平台,实现运行监控、配置管理数据库、IT服务管理、运维门户与大屏展示;实现与SAP SLM、SSOC、云资源管理平台、资金集中监控系统、加油卡监控等系统的集成。具体实现如下:统一调度运维资源:建成集中的服务管理系统,集成SAP SLM,实现运维支持工作的全过程管控和知识共享,通过在线流程有机协同总部、区域中心和企业之间,运维队伍与项目组之间的运维支持工作。集中监控应用系统:建成集中的运行监控系统,实现对50套应用系统的应用监控,从用户使用的角度进行可用性监控,及时发现和处理问题,缩短系统不可用时间。集中管理配置信息:建成集中的配置管理数据库系统,实现50套应用系统与总部管理的

6、基础设施的统一管理,为运维支持、变更风险分析、重大问题处理决策等及时地提供真实数据。大屏展示运维情况:提升运维门户和大屏展示,通过系统集成大屏展示应用监控指标、信息安全状况、服务受理情况、重大问题处理情况等运维服务信息。(2)制定集团公司IT运维标准与规范。包括运行监控规范、服务管理规范、 配置管理规范等。项目范围项目范围包含总部基础设施和总部统建的50套应用系统,以及与两家试点企业已有运维系统的集成。基础设施的范围主要包括总部4个数据中心,11个区域中心,涵盖服务器、存储、安全设备、网络设备、数据库、中间件等,当前共有各类设备7000台左右,具体数量以实际为准。应用系统的范围主要包括ERP、

7、MES、资金集中管理、总部生产营运指挥、电子商务、合同管理、综合办公、加油卡(区外)、APC等50套应用系统,主要涵盖了SAP、.NET、JAVA、Domino等技术平台。技术方案系统总体架构及部署总体架构集团公司IT运维平台项目(一期)的总体架构如下:集团公司IT运维平台项目(一期)包括呼叫中心、运行监控、服务管理、配置管理、安全管理、运维门户和大屏展示7个子系统,其中呼叫中心和安全管理在另外项目中建设。本期项目重点完成运行监控、服务管理、配置管理、运维门户和大屏展示系统的建设。系统组成及系统体系结构根据本次集团公司IT运维平台项目(一期)需求的认真分析,推出自有的“CUBA”(立方体架构)

8、的整体解决方案。系统体系结构如下:针对本次项目的产品整体解决方案包括:“三个支撑”:以运行监控系统、CMDB配置管理系统、SOC安全监控系统(本期项目通过集成方式接入)为整个平台系统的支撑功能,打造系统功能基础。“一个导向”:以IT服务管理系统为导向,强调为用户提供一站式服务和服务级别管理。“两个贯穿”:以统一数据采集和ESB数据总线技术方案贯穿整个平台的建设。“两个体现”:以运维门户和大屏综合展示系统作为整体IT运维平台的最终体现。整体解决方案中的产品选型全部为获得国家版权认证、具备自主产权的软件产品,在电信、能源、金融、政府中获得广泛运用,拥有众多的成功项目案例。平台功能运行监控系统运行监

9、控系统特点根据集团公司IT运维平台项目的建设需求,我们建议采用“BrightView企业网络管理系统V7.0” (登记号:2010SR051711)和“统一采集云平台软件V7.0”(登记号:2014SR030244,详见.1统一数据采集)作为运行监控系统的软件方案,该软件拥有完全自有知识产权,灵活支持物理分级、虚拟分级、混合分级的部署架构,集成贯通的一体化整体方案,以网络监控、服务器监控、数据库监控、存储监控、中间件监控、终端监控、备份管理、虚拟化监控等为支撑,以业务服务管理和应用监控等为导向,以故障中心、故障定位、系统自检、信息资源监控库为核心,以综合监控、报表管理、集中展现为体现,方案架构

10、合理、产品功能完善、产品性能优秀,辅以适应性的二次开发,可以完全匹配集团公司运行监控系统需求。同时具有以下特点优势:(1)成熟性运行监控系统各软件模块均为成熟产品,至少已有上百家以上成功案例。已经成功应用于中国移动(OSS/BOSS/MIS等)、中国联通(OSS/BOSS/MIS等)、公安部“金盾工程”、水利部“金水工程”、质检总局“金质工程”、民政部、国土资源部、新疆财政“金财工程”、航天一院、航天五院、中国人保、集团公司、中国石油、国家电网等众多政府/企业的中大型IT运维监控管理项目。(2)系统化运行监控系统的建设,着眼于从总体上规划、设计,以项目建设的总目标作为系统的整体目标,即规范管理

11、制度,强化管理工作、提供管理决策支持。非单纯设备层面的普通管理,是业务层面的综合监控平台,站在业务应用的可用性视角,以重要业务应用系统为中心,更高、更深、更全面地监控IT资源运行监控平台方案将IT资源与业务应用系统进行映射并有机结合,可实现业务关系模型、业务拓扑、业务故障、业务影响分析等内容,同时通过主动式用户模拟体验和被动式真实业务性能分析相结合,帮助业务部门和IT运维人员从业务可用性的角度,监控应用系统的运行情况,分析影响业务应用系统对外服务的根本原因。(3)可靠性运行监控系统在系统结构、设计方案、设备选择、技术服务等方面综合考虑,保证系统能够7*24安全无故障运行,系统有很好的容错功能;

12、对IT资源的监测应保证不影响相关设备和系统的正常良好运行,并实现最好的响应效率及最小的资源占用。(4)安全性运行监控系统注重安全方面的设计,确保IT运维监控管理平台的稳定、安全运行。系统要保证数据的安全,不会增加现有应用系统的复杂性,更不会降低现有应用系统的稳定性。(5)开放性采用符合国际国内标准的通用协议,为实现与其他系统监控软硬件互联或接入本系统进行监控提供接口,支持各种主流计算机平台、操作系统以及数据库厂商的各类软硬件产品。(6)可扩展、易集成系统需具备很好的扩展性,能适应不断发展的业务需求。随着IT资源种类和数量的扩大,系统也能适应新的系统的对IT运维管理的需求。系统具备高度集成性,可

13、以和第三方产品进行集成,进行功能扩展。系统提供开发工具和接口,方便其他监控系统集成和统一管理。(7)实用性运行监控系统是根据用户的当前情况以及未来的发展建设需求提供具有针对性的、可行的、可实施的技术解决方案,追求实效,方便运维管理人员的实际需要。系统支持指标运行监系统的监控指标涵盖了影响被管理对象的各重要方面,并可根据提供的数据接口接入新的监控指标。网络设备监控指标设备类别监控对象监控指标网络设备(路由器、交换机、防火墙、VPN设备等)配置信息设备名称IP地址接口名称接口IP链路名称链路类型设备厂商设备类型设备描述通断通断状态网络连通率(%)宕机时间(分钟)时延平均时延(ms)最小时延(ms)

14、最大时延(ms)接口接口索引接口描述接口带宽(Kb/s)总包数(个)总流量(MB)带宽利用率(%)接口流量(byte)入流量(MB)出流量(MB)平均流入带宽利用率(%)平均流出带宽利用率(%)端口状态端口速率(b/s)平均入端口速率(Kb/s)平均出端口速率(Kb/s)峰值入端口速率(Kb/s)峰值出端口速率(Kb/s)峰值流入带宽利用率(%)峰值流出带宽利用率(%)峰值端口速率时间峰值带宽利用率时间端口丢包数(个)输入丢包数(个)输出丢包数(个)广播包数(个)组播包数(个)输入丢包率(%)输出丢包率(%)总的丢包率(%)输入错误包数(个)输出错误包数(个)错包数(个)输入错包率(%)输出错

15、包率(%)错包率(%)冲突数(个)输入总包数(个)输出总包数(个)总包数(个)单播包数(个)会话数链路链路名称链路带宽(bit/s)链路入流量(byte)链路入速率(bit/s)链路入带宽利用率(%)链路出流量(byte)链路出速率(bit/s)链路出带宽利用率(%)链路流量(byte)链路速率(bit/s)链路带宽利用率(%)链路入总包数链路出总包数链路入错包数链路出错包数链路入丢包数链路出丢包数链路输入错包率(%)链路输出错包率(%)链路输入丢包率(%)链路输出丢包率(%)链路状态CPUCPU号CPU利用率(%)CPU平均利用率(%)内存内存名称内存利用率(%)内存平均利用率(%)已使用的

16、内存(BYTE)剩余的内存(BYTE)内存总大小(BYTE)温度板卡序号温度VPN设备用户数管理最大用户数当前用户数防火墙连接数管理最大连接数当前连接数当前未连接数负载均衡器WEB虚拟服务虚拟服务端口虚拟服务协议接收流量(bit)发送流量(bit)当前TCP连接数最大TCP连接数接收请求数丢弃连接数连接超时数后台服务IP地址后台节点IP节点端口端口连接状态接收流量(BYTE)发送流量(BYTE)当前连接数最小响应时间(ms)最大响应时间(ms)平均响应时间(ms)服务器监控指标监控对象监控指标CPU性能主机IP地址CPU IDCPU空闲率(%)CPU利用率(%)CPU系统利用率(%)CPU用户

17、利用率(%)CPU等待率(%)全局CPU当前运行队列中的进程数(个)内存主机IP地址内存总大小(MB)内存利用率(%)系统内存使用率(%)用户内存使用率(%)虚拟内存使用率(%)虚拟内存大小(MB)主机磁盘主机IP地址磁盘名称磁盘忙率(%)平均等待队列长度磁盘IO速度(KB/秒)磁盘读速度(KB/秒)磁盘写速度(KB/秒)磁盘IO率(次/秒)磁盘读率(次/秒)磁盘写率(次/秒)主机文件系统主机IP地址文件系统名称文件系统挂载点文件系统空间大小(MB)文件系统可用空间(MB)文件系统空间利用率(%)文件系统已用空间(MB)I节点使用率(%)I节点已用数目(个)I节点可用数目(个)主机进程主机IP

18、地址进程号进程状态进程用户名父进程ID进程占用虚拟内存大小(KB)进程占有的CPU大小进程占有的内存大小(KB)进程开始时间进程累积的执行时间进程名称进程对应的命令行进程CPU利用率主机接口接口名称流入包数流出包数流入速率(包/秒)流出速率(包/秒)错误包(个)冲突包(个)错误率(次/秒)冲突率(次/秒)全局CPU性能主机IP地址全局CPU空闲率(%)全局CPU利用率(%)全局CPU系统利用率(%)全局CPU用户利用率(%)全局CPU 等待率(%)全局CPU当前运行队列中的进程数(个)应用主机IP地址应用组名称应用CPU使用率(%)应用内存使用率(只有OVPA支持)应用内存大小应用进程个数数据

19、库监控指标数据库类别监控对象监控指标Oracle 基本监控服务器时钟同步情况磁盘空间使用率数据库是否可以连接表空间运行状态使用率无效对象无效对象数量数据文件数据文件状态数据文件是否自动扩展数据文件总数量JOB监控数据库中Job的状态SGAShared pool 命中率Data buffer 命中率redo log buffer命中率PGAPGA命中率SESSIONSession TOP 10及对应SQL 备份备份结果Sybase 状态引擎的状态当前数据库服务开启状态相关对象的状态空间数据库空间使用情况性能数据库读写的I/O信息数据库内存及缓存的大小信息耗时比较长的SQL语句锁显示当前锁的情况以

20、及当前执行的命令日志是否有报错信息备份备份是否成功MS-SQL Server状态数据库是否可连接关键进程和服务是否存在相关对象(含数据文件)的状态空间数据文件空闲比率性能TOP 10 及对应SQL锁发生死锁的次数日志是否有报错信息DB2实例分配的总排序堆数据库管理器的远程连接数数据库管理器中正在执行的远程连接数/本地连接数DB2 Connect 的当前连接基本信息使用的最大辅助日志空间使用的最大总日志空间目前分配的辅助日志数使用的总日志空间可用的总日志量缓冲池数据页逻辑读取数数据页物理读取数数据页写入数索引逻辑读取数索引物理读取数索引写入数物理读总时间物理写总时间应用锁等待锁定等待数等待锁定的

21、时间检测到的死锁数等待锁定的当前代理程序数数据库锁信息锁定方式锁定状态锁定对象名称节点号锁定升级sql语句执行语句所耗用的时间语句的总系统 CPU 语句的总用户 CPU 表空间表空间的页大小表空间的扩展数据块大小表空间中的可用页数表空间中的已使用页数表空间中的空闲页数表空间中的容器数目中间件监控指标中间件类别监控对象监控指标MQ队列管理器主机IP地址队列管理器名称队列管理器状态命令服务器状态通道初始化者状态通道主机IP地址队列管理器名称通道名词通道状态通道类型远程队列管理器的名字通道中的消息数目当前的序列值通道启动的日期通道启动的时间队列主机IP地址队列管理器名称队列的名字最后读取的日期最后读

22、取的时间最后写入的日期格式最后写入的时间格式当前队列的长度打开这个队列读的进程数目打开这个队列写的进程数目WeblogicWeblogic Server监听地址运行状态Server的版本weblogic 部署应用应用名称应用的状态JVM信息Jvm名称内存堆空闲量(bytes)内存堆总量(bytes)JVM内存堆使用率JDBC连接池当前活动连接数当前等待连接数JDBC pool最大容量平均连接时延泄漏的连接数JDBC pool的当前容量POOL中的可用连接数POOL中的不可用连接数未关闭的SQL操作JDBC连接池利用率WeblogicWeb应用WEB应用组件的名称当前会话数最大会话数总会话数JM

23、S消息目的端当前访问目的地端用户数量当前消息数Pending消息数当前在目的端存储的字节数当前目的端pending的字节数线程池当前线程数队列长度Pending的用户请求数阻塞线程数吞吐率Webspherejvm 情况Jvm名称内存堆空闲量(bytes)内存堆总量(bytes)已用内存 会话管理器CreateCountInvalidateCountLifeTimeActiveCountLiveCountNoRoomForNewSessionCountCacheDiscardCountExternalReadTimeExternalReadSizeExternalWriteTimeExterna

24、lWriteSizeAffinityBreakCountTimeSinceLastActivatedTimeoutInvalidationCountActivateNonExistSessionCountSessionObjectSizewebsphere线程池CreateCountDestroyCountActiveCountPoolSizePercentMaxedJDBC连接池当前活动连接数当前等待连接数JDBC pool最大容量平均活动连接数平均连接时延泄漏的连接数LEAKED连接数POOL中的可用连接数POOL中的不可用连接数TomcatCPUCPU利用率内存使用率JVM空闲内存最大内

25、存内存总数连接池当前等待的连接数当前活动的连接总数等待连接中的最长时间等待者的时间最大活动连接数连接池的最大能力数线程threadsthreads最大数http请求当前threads数当前http请求数允许的最大请求数IISWEB服务器应用服务器运行状态FTP服务登录情况ASP错误率ASP请求队列数量WEB站点WEB站点IP地址传输速率整体请求率存储监控指标监控类型监控指标描述配置管理存储阵列数目各种类型存储阵列的数目存储阵列标识每个存储阵列设定的唯一标识名存储阵列类型存储阵列的类型,包括是生产厂家、所属系列以及规格等存储微码版本存储阵列当前安装的微码版本号存储配置容量存储阵列当前配置的磁盘总

26、容量存储采用RAID方式存储阵列各逻辑卷采用哪种RAID 数据保护方式存储CACHE容量存储阵列内配置的CACHE内存容量磁盘标识每个磁盘在存储中的标识名磁盘的规格存储阵列配置的磁盘规格,包括:单盘容量及转速主机通道卡标识主机通道卡在存储中的标识名主机通道卡类型存储配置主机通道卡的类型,例如:光纤、SCSI、UltralSCSI、ESCON 等类型的通道卡主机通道卡数目存储配置的各种通道卡数目磁盘适配卡标识磁盘适配卡在存储中的标识名磁盘适配卡类型存储配置的磁盘适配卡的类型,例如:光纤、SCSI、UltralSCSI、SSA 等类型的适配卡LUN标识存储中划分的每个逻辑卷的标识热备盘配置数存储阵

27、列当前配置的热备盘数目性能监控CACHE 读命中率采样区间内从存储中读取的数据中,能直接从CACHE中读取的字节数占总读取数据字节数的百分率CACHE 写命中率采样区间内写入存储中的数据中,写CACHE空间未满情况下写入的字节数占总写入数据字节的百分率磁盘IO速率存储阵列各硬盘每秒钟读写数据的字节数LUN的IO速率(STRIP)存储阵列划分的逻辑卷(在光纤通道上的映射为LUN)每秒钟读写数据的字节数磁盘IO读写频率存储阵列各硬盘每秒钟读写次数LUN的IO读写频率存储阵列划分的逻辑卷(在光纤通道上的映射为LUN)每秒钟读写次数故障监控存储阵列状态存储阵列是否处于运作状态,即UP/DOWN状态硬盘

28、物理状态硬盘是否出现物理损坏硬盘逻辑状态硬盘是否出现逻辑损坏热备盘接管状态热备盘是否已接管存储CACHE状态企业级存储内部用作数据读写CACHE 的内存硬件是否出现异常磁盘适配卡状态存储内的磁盘适配卡是否出现异常磁盘通道状态磁盘适配卡上每个磁盘通道是否有异常主机通道卡状态存储内的主机通道卡是否出现异常主机通道状态主机通道卡上每个主机通道是否有异常其它部件状态其它可被监控部件是否有异常;如:风扇、电源模块等光纤交换机状态(可选)SAN 环境中的光纤交换机是否处于正常工作状态电源模块状态存储的电源模块是否处于正常工作状态应用监控指标类别监控指标业务应用响应监控成功率平均响应时间(毫秒)最大响应时间

29、(毫秒)最小响应时间(毫秒)拨测次数失败开始时间失败结束时间恢复时间持续时长连接时间DNS时间SSL时间客户端时间第一次缓冲网络时间第一次缓冲服务器时间重试时间应用服务端口响应监控成功率(%)平均响应时间(毫秒)最大响应时间(毫秒)最小响应时间(毫秒)拨测次数失败开始时间失败结束时间恢复时间持续时长连接时间DNS时间SSL时间客户端时间第一次缓冲网络时间第一次缓冲服务器时间重试时间J2EE并发响应内存泄露活跃用户.NET并发响应内存泄露活跃用户Domino应用名应用状态总请求数成功请求数失败请求数请求类型请求的错误率请求响应时间请求完成率平均负载应用情况监控在线用户数注册用户数交易处理总量交易

30、成功数量网络管理拓扑发现一、网络设备自动发现在进行网络管理之前首先需要开启各个被监控网元的SNMP协议,并设置好SNMP Community。支持批量/单个设备发现功能,按照网元类型进行设备发现,通过输入设备的IP地址或IP地址范围以及SNMP Community进行向导式发现:1.首先通过向导的方式,一步一步提示用户配置网元类型、自动发现需要的SNMP参数、IP地址或IP地址范围等参数。设备发现参数配置2.参数配置完后,IT集中运行监控平台根据设置的参数对指定的网段与网元进行搜索,将所有符合要求的网元自动显示在拓扑图上,同时自动采集下载网元的基本配置信息。设备发现结果显示3.在发现过程中可以

31、随时中止自动发现过程,也可以查看没有成功发现的原因。发现完成之后,显示该设备的详细配置信息。设备发现结果显示二、拓扑发现方式拓扑图是网络设备监控常见的一种方式,具有全面整体、直观实时等特点。通过自动或手动发现机制能够发现网络节点、检测网络节点间的连接关系。 自动发现方式:根据拓扑发现结果自动生成网络拓扑图,在客户端界面实时生成展现拓扑,生成内容包括对应网元、链路关系等;在拓扑图上不同厂商不同型号的设备对应不同的图标。网络监控支持但不仅限于对下列品牌产品的监控:CISCO、华为、中兴、H3C;设备类型包括路由器、交换机、防火墙、VPN、负载均衡等。网络管理模块通过ICMP、SNMP、ARP等协议

32、自动发现设备基本信息、设备接口配置信息、设备之间物理连接关系等,对于不同厂商不同型号的设备,系统可自动标识不同的图标。对于无法自动识别生产厂家及产品类型的网络,提供手工方式加以定义。对于网络设备提供设备面板视图的管理。系统支持SNMP V1、V2、V3的拓扑自动发现功能,对于不支持SNMP的设备提供通过手工添加方式进行拓扑发现。系统支持自动发现新设备,并根据发现的设备类型进行自动匹配选择,自动将新设备纳入监控范围并通知系统管理员。拓扑发现模块可对不同的网络节点所处网络层次及影响程度不同设置不同的轮询时间。系统能够对某一网段、IP地址等限定条件进行拓扑发现,并且可以设定更新周期,自动排列生成网元

33、设备图及网元设备之间的连线,自动定期发现网络中的拓扑更新情况。手工定制方式:支持通过设备或链路的拖拽方式,所见即所得进行拓扑定制,最终形成地理视图、层次视图等不同管理视角的逻辑视图。三、拓扑类型发现1)基本拓扑关系:能够发现路由器与路由器,路由器与交换机、交换机与交换机之间的网络层或链路层连接关系;2)服务器拓扑关系:能够发现服务器等主机与交换机之间的拓扑连接关系;3)VLAN拓扑关系:能够发现局域网内的VLAN信息以及交换机端口的VLAN划分情况,支持基于VLAN或基于交换机端口的不同信息组织和展示;4)HSRP/VRRP拓扑关系:支持 HYPERLINK /view/1231806.htm

34、 t _blank 热备份 HYPERLINK /view/1360.htm t _blank 路由器协议(Hot Standby Router Protocol),虚拟路由冗余协议(Virtual Router Redundancy Protocol)网络中路由器备份或冗余关系的发现和处理,能识别HSRP/VRRP设备组以及组内设备状态等。状态监控网络故障监控,通过ICMP探测、snmp轮询、接收Trap和syslog等方式,采集设备状态、接口状态、链路状态等故障信息。系统提供友好界面对各类不同对象,不同方式的告警进行不同的分组、描述以及不同告警级别的定制。设备状态监控对于客户关注的设备接口

35、通断可采用接收Trap方式主动进行故障事件的发送和接收,提高了告警的实时性,通过关键字匹配方式发出预设告警或告警恢复信息,方便后续的处理和展示。配置设备将syslog发往运行监控系统服务器,运行监控系统服务器通过文件转存syslog信息。告警分析程序可以扫描syslog文件,针对异常信息通过关键字匹配方式发出预设告警。设置相应的时间对网络设备进行主动探测、轮询监控。对不同的网络设备可以指定不同的轮询时间间隔。定时轮询能够通过ping方式看设备是否可达,通过SNMP去检索网络设备相关指标,形成各种报表数据。同时还可对不同采集指标进行阈值比对,当超过阈值后就会产生报警信息,转发到邮箱或在上层界面呈

36、现。日常运维工作中,设备接口状态的告警一般控制在10秒钟之内。接口状态监控设备接口通断采用接收Trap方式主动进行故障事件的发送和接收,此方式大大的提高了告警的实时性,告警分析程序通过关键字匹配的方式定位到具体设备接口,发出预设告警,并进行相关的展示和处理。设置相应的时间对网络设备进行SNMP轮询监控,获取接口状态信息。对不同的网络设备可以指定不同的轮询时间间隔。同时还可对采集到的不同的接口指标,进行阈值比对,当超过阈值后就会产生报警信息,转发到邮箱或在上层界面呈现。链路状态监控根据拓扑发现结果自动生成网络拓扑图,在客户端界面实时生成展现拓扑,生成内容包括对应网元、链路关系等,并可获取设备的相

37、关信息,自动生成设备面板视图;设备面板视图能够直观的表现每一台设备的端口和链路的连接情况,动态表现端口及线路连通及断开情况,对状态异常情况预警,并能够精确判断线路故障所处位置,便于及时排除故障。网络日志监控采集和监控网络设备的系统日志,分析网络设备故障或状态异常并进行告警;分析网络设备之间的关系,结合用户定义的告警规则,实现业务影响分析告警和展示。其他状态监控通过SNMP Trap/轮询、Syslog日志、日志审计集成等方式,还可以监控网络设备其它故障,如电源异常、输出电压异常、CPU温度异常、风扇异常、板卡异常等故障。设备管理(1)性能采集根据设备类型自动匹配选择不同的默认监控策略,系统不需

38、要人工干预就可以将设备纳入监控范围,同时支持新策略管理和应用,以满足不同设备的监控要求。系统周期性地监控设备的运行情况,周期性地自动采集性能数据,默认采集周期是5分钟,对于重点设备、重点性能指标可以为1分钟。数据采集可按照不同的厂商,不同的地理位置,不同的职能部门、所处的网络层次进行批量的停止和启动。采集指标包括网络设备的CPU利用率、内存利用率、网络端口的吞吐量和丢包率、链路流量、接收和发送的ICMP包率,单播包率、出入带宽利用率、出入丢包率、出入错包率、出入速率、防火墙会话数、广播包率、组播包率等;性能监控指标支持自学习的动态基线管理和性能预警。通过对性能指标告警阀值动态范围的设定,系统可

39、根据动态范围限定给出告警信息。动态基线管理和性能预警是一种自动基准功能,将性能指标同比上周、上月或者去年的性能基线,根据实际值与历史基线值的偏移设置告警阀值。当实际值超过标准值,将会产生一个事件,从而在发生故障前发出警告,达到预警管理的目的。对用户所关心的主干链路流量,可生成流量、流速、包数、会话数变化曲线表,并通过设定阀值产生告警消息。按照应用流量、端到端流量、主机流量、目标流量进行统计,生成日、周、月统计报告等。(2)设备单点一站式监控管理可以按照部门、设备类型、厂商、城市等熟悉的组织方式对网元进行分类,以灵活多样的树图进行分组管理,对所有网络设备进行检索导航,提供类似配置管理系统器的树型

40、视图。并对单台网络设备进行相关故障的检查和性能统计、历史分析。能够在一个综合页面以柱状图、线型图、仪表盘等组合方式显示实时、最近12小时的设备状态、性能、告警信息等KPI指标;能够呈现设备软硬件版本型号、开机时间、设备各端口配置信息;能够设置设备中文名称、厂商、部门、设备类型、设备位置等基本信息;提供设备接口一览表,图形化显示网络设备接口的流量信息;提供ping、telnet等管理工具;交换机关联设备下连PC列表并提供PC使用人、使用部门、联系电话、最后上线时间、是否在线、IP地址、MAC地址等信息,这些关联信息可根据客户需要进行扩展。设备的通断、性能、端口信息等可关联到小时、日、周、月的对比

41、图表,进行趋势分析,并有层层深入钻取功能。支持主要性能KPI指标可关联到小时、日、周、月的对比图表,进行趋势分析,并有层层深入钻取功能。支持关联设备下连PC列表并提供PC使用人、使用部门、联系电话、最后上线时间、是否在线、IP地址、MAC地址等信息,这些关联信息可根据需要进行扩展。系统提供统一的网元管理页面,支持跨字段搜索,根据设置的参数对指定的网段进行搜索,将所有符合要求的网元自动显示在网元管理列表中,查询结果按网元类型分组展示。点击某个网元名称,自动切换到对应网元管理模块,并展示相应的详细信息,包括网元和网元之间的关联关系、网元对应的性能策略、告警策略等;支持手工修改CMDB等接口或同步网

42、元信息,如部门、型号等。主机设备和网络设备根据输入的IP发现单个网元并对发现的结果进行回显,用户确定后完成网元的修改入库。支持单个或者批量删除网元;支持启动或停止单个或批量网元的监控策略;支持批量修改网元属性,增加超链接跳转到原有的功能页面。流量监控通过SNMP获取、监控接口或链路的整体流量信息,支持Snmp、Cisco Netflow、华为/H3C NetStream及IPFIX等多种流量采集方式监控网络流量的来源、目标和应用等各种数据的比例分布和尖离峰差异,在网络性能和带宽成本之间,取得最优化的平衡;通过对网络流量的短期的实时分析、中期的流量分析到长期的流量统计,获取网络的流量流向信息,帮

43、助整个网络资源状况评估。(1)接口流量,与网络拓扑关系关联1)网络拓扑链路流量监控基于自动生成的网络拓扑图,根据网络带宽利用率(单位时间流量/带宽*100%)不断地修改连接符号的填充百分比,使连接符号以不同粗细代表和数字标注方式显示当前时刻的流量情况,使用户对网络链路流量的了解变得更为方便和直观。当用户点击选中某连接符号后,可以显示该条链路的详细流量情况。包括:在拓扑图的线上(链路)可以标注对应的入带宽利用率、出带宽利用率、出流量、出流速、入流量、入流速、总流量、总流速等内容;在拓扑图的线上,以线条粗细直观显示链路的流量大小,以线条的颜色直观显示链路的告警状态等;流量阀值或者带宽利用率阀值设置

44、,进行不断闪烁,生成阀值告警消息。2)链路流量统计支持按5分钟、小时、天、月、年等不同时间粒度对链路流量进行统计;根据选择条件如链路、时间粒度、时间段生成报表或图表。生成的报表包括统计时间、链路名、链路带宽(Kb/s)、入流量(MB)、入速率(Kb/s)、入带宽利用率(%)、出流量(MB)、出速率(Kb/s)、出带宽利用率(%)、总流量(MB)、总速率(Kb/s)、总带宽利用率(%)、源节点名、源接口IP地址、目的节点名、目的接口IP地址。点击每个名称,可进行相应的排序功能。图标可以把当前报表生成excel格式,图标可以把当前报表生成PDF格式保存,图表可以对当前报表进行订阅。3)网络设备接口

45、流量监控在拓扑图上,网络设备右键支持有关设备的相关信息的呈现或操作。通过性能展示功能,可以在一个综合页面以柱状图、线型图、仪表盘等组合方式显示实时、最近12小时的设备状态、性能、告警信息等KPI指标;能够呈现设备软硬件版本型号、开机时间、设备各端口配置信息;能够设置设备中文名称、厂商、部门、设备类型、设备位置等基本信息;提供设备接口一览表,图形化显示网络设备接口的流量信息;提供ping、telnet等管理工具。交换机关联设备下连PC列表并提供PC使用人、使用部门、联系电话、最后上线时间、是否在线、IP地址、MAC地址等信息,这些关联信息可根据客户需要进行扩展。设备的通断、性能、端口信息等可关联

46、到小时、日、周、月的对比图表,进行趋势分析,并有层层深入钻取功能。在接口信息中的可以分析具体某个接口的接口速率、接口流量、接口带宽利用率等指标的运行情况,并可按不同时间粒度小时日周月展现;4)网络设备接口流量统计支持按5分钟、小时、天、月、年等不同时间粒度对网络设备接口流量进行统计;根据选择条件如设备、接口、指标、时间粒度、时间段生成报表或图表。生成的报表包括统计时间、设备名称、接口名称(索引)、接口IP地址、接口带宽(Kb/s)、入流量(MB)、端口输入速率(Kb/s)、入带宽利用率(%)、出流量(MB)、端口输出速率(Kb/s)、出带宽利用率(%)、流量(MB)、平均端口速率(Kb/s)、

47、平均带宽利用率(%)、丢包数、总包数、丢包率(%)、所在部门。点击每个名称,可进行相应的排序功能。图标可以把当前报表生成excel格式,图标可以把当前报表生成PDF格式保存,图表可以对当前报表进行订阅。(2)实时监控主要链路流量可通过MRTG等方式按不同时间粒度展示主干网络、外联网络等关键链路的流量情况。生成的报表包括统计时间、链路名、链路带宽(Kb/s)、入流量(MB)、入速率(Kb/s)、入带宽利用率(%)、出流量(MB)、出速率(Kb/s)、出带宽利用率(%)、总流量(MB)、总速率(Kb/s)、总带宽利用率(%)、源节点名、源接口IP地址、目的节点名、目的接口IP地址。点击每个名称,可

48、进行相应的排序功能。图标可以把当前报表生成excel格式,图标可以把当前报表生成PDF格式保存,图表可以对当前报表进行订阅。(3)特征流量监控支持Cisco Netflow、H3C NetStream及Sflow 等主流网络流量协议信息采集;对重点网络的流量、流向、应用类型等进行精细化分析,完整整合了多项流量分析功能,从短期实时监控、中期趋势分析到长期综合统计,统一集成在一个单一系统,具体功能包括网络流量监控、流量排名、流量快照、流量统计报告、流量分析等。监控主要链路上各应用流量的分布情况和排名情况;能够对主要链路上不同的应用如http、telnet等网络应用的流量情况监控和排名;在流量分析中

49、,设置相关条件如分析类型、链路或设备、开始结束时间、排名数等生成报表。可查看具体某个应用的流量在时间段内的分布趋势。应用流量的深入分析入口点是报表的相关区域或者数据报表端口的超链接。应用流量报表的深入分析只有前十名才可以进入。点击统计图的相关区域或者数据表格中的IP地址超链接,可以对此相关应用下,特定IP的原始流量查看。具体的展现形式与监控及排名等样式一致,唯一不同的是,当查看应用报表的时候选择全部设备,原始记录页面查看时,需要选择不同的设备(只能选一个)进行不同的具体设备原始流量查看。监控用户访问主要业务系统产生的流量情况;业务拓扑可将各种业务集中呈现和管理,体现业务系统之间及内部的逻辑拓扑

50、结构。业务系统维护人员通过查看业务拓扑,了解业务系统的应用情况及可用性。以监控OA系统为例,根据报表设置的查询条件,可以查看用户访问该业务系统所产生的流量的排名情况。监控网络中的异常流量,如病毒、非法攻击等。及时的对威胁网络安全的流量进行实时监控和分析,并且能对病毒、网络攻击以及网络非法应用产生的网络流量进行监控。例如,蠕虫病毒发作的时候,利用此功能可以在短时间内查找出网络中存在的攻击的源、或攻击的目的、攻击所采用的应用端口、攻击的包类型等信息,为采取隔离应对措施提供数据。当发现网络设备某个接口有异常的时候,可以对该接口进行深入分析,得到流量来源、目的ip、加载应用的具体分布情况;还可分析出:

51、最高的来源或目标地址分析(Top10源流量, Top10目的流量)、Top10 ip组对流量、分析某个应用的最高流量的来源地址。上述特征流量的监控结果能够通过饼图、趋势图或柱状图等图表方式呈现当前或一段时间内的流量对比和流量趋势。(4)对用户所关心的主干链路流量、重要业务的流量,可生成按不同时间粒度生成统计报告,并通过设定流量阀值产生告警消息。服务器管理主机管理特点服务器Agent作为监控系统中服务器设备的数据来源,支撑着整个系统对主机设备的监控和分析,其重要性不言而喻。经过对石化服务器现状的了解和分析,对石化服务器的监控采集方式提供:有代理(Agent)、无代理和与微软Scom集成三种方式。

52、Agent监控方式通过在被管主机上安装agent采集被管主机的配置、性能和告警信息。根据用户的配置自动轮询网络中各被管主机的系统参数,包括:CPU、内存、交换区、文件系统、磁盘I/O、日志文件等。自主开发的服务器agent具备如下特点:成熟度高,运行稳定agent产品成熟度高,可长期稳定运行。agent内部存在数据缓冲机制,数据缓冲时间可以设定,当网络中断的时候不会完全丢失数据,当网络正常后,系统能进行智能的判断对缺失数据进行补采,保证上层展现层数据的完整性;具备主动数据上传能力,并在与监控系统上层模块通讯中断的情况下,主动尝试重连,并提供断点续传能力。采集指标丰富,采集效率高,采集周期灵活可

53、配能够根据用户的配置自动轮询网络中各被管主机的系统参数,包括:CPU、内存、交换区、文件系统、磁盘I/O、日志文件等,涵盖影响服务器系统的各重要方面;系统能够周期性地自动采集性能数据,采集周期和采集时间可按照一天内的采集时间,和每周内的采集天数进行配置,最小的数据采集时间周期为1分钟,默认时间是5分钟。对被管设备资源占用小,影响低主机监控代理正常情况下CPU占用不超过5%,内存占用不超过13M,具备根据系统繁忙程度,自动调整数据采集频率的功能。支持自动安装、批量安装,支持自动升级,维护简单易行支持在管理端对单台或批量以可视化的方式自动安装agent,部署简单易行;支持agent主程序自动升级,

54、只需要Manager端下发程序更新url,Agent能根据url自动比对文件并更新文件,更新完成后重新启动Agent服务;当增加指标组采集或者采集的需求发生改变,开发人员根据需求增加或者修改采集脚本,Manager端通知Agent更新脚本,Agent将自动更新。填写服务器信息,实现自动安装:服务器agent自动安装可视化的安装过程:支持批量安装。编辑excel,选择需要导入的agent并输入用户名,密码等信息,选择导入网元按钮,选择excel文件路径,点击确定即可安装:支持可视化管控agent,交互性、易用性强可以对agent进行集中的可视化管控,支持实时、整体检查各个服务器Agent的基本信

55、息、运行状态及占用被管服务器资源情况,可对Agent进行集中停止、启动和升级控制。Agent管控界面:无Agent监控方式无Agent的监控方式,主要是通过Telnet(主要针对Unix小型机、Linux服务器)、WMI(主要针对Windows服务器)等通用的接口来实现对系统小机服务器的监控管理。下面主要针对WMI通信接口进行简要介绍WMI作为Windows操作系统的一部分提供了可伸缩的,可扩展的管理架构.公共信息模型(CIM)是由分布式管理任务标准协会(DMTF)设计的一种可扩展的、面向对象的架构,用于管理系统、网络、应用程序、数据库和设备。Windows管理规范也称作CIM for Win

56、dows,提供了统一的访问管理信息的方式。利用WMI,可以监视、跟踪和控制有关软件应用程序、硬件组件和网络的系统事件,将来自不同来源的数据用通用、标准且逻辑上有组织的方式映像出去,以便在管理数据之间建立相互关系和关联,而不必考虑这些数据的类型、内容或来源。WMI由以下几部分组成:(1)管理架构:这部分包括CIM对象管理器和CIM对象储存库,主要用于储存模式定义和提供者绑定信息,数据是动态的从提供者命令获取的。(2)WMI提供者:WMI提供者使用系统提供的任何管理接口提取系统的管理信息,它作为操作系统、服务、应用程序、或者设备驱动程序等与 CIMOM 之间的中间代理程序。通过各种 COM 接口,

57、提供程序可向 WMI 提供数据,处理来自系统管理应用程序的请求,并生成事件通知。提供程序还将管理信息和接口映射到 CIM 储存库中定义和存储的对象类。(3)WMI使用者:使用者组件和应用程序通过CIMOM监视WMI事件,允许您在事件收到的时候执行动作,“使用者”是系统管理应用程序(如 Microsoft Systems Management Server (SMS))或第三方应用程序或脚本。使用者只需要知道它们打算获取其信息的对象的类。信息的来源以及实际获取信息的方式无关紧要,它们被隐藏起来。使用者可以获取有关计算机、操作系统、应用程序和设备的信息,以及获取可通过其他管理协议得到的信息。(4)

58、公共信息模型 (Common Information Model, CIM) 储存库:“CIM 储存库”是一个对象数据库,用于存储定义的对象,如用于访问和操作系统管理信息的静态类定义和实例。(5)公共信息模型对象管理器 (Common Information Model object manager, CIMOM) :CIM 储存库由 CIMOM 管理,它形同对象请求的代理程序。CIMOM 跟踪可用的类并决定由哪一个提供程序负责提供这些类的实例。CIMOM 和 CIM 储存库由称为 WinMgmt 的系统服务表示,可通过一组 COM 接口访问。微软SCOM集成方式系统支持与微软Scom的集成接

59、口,实现对PCserver主机和X86平台虚拟机的监控管理。虚拟机管理虚拟机监控主要内容包括:资源映射发现、CPU、内存、硬盘及I/O、网络、虚拟机变化等;支持的版本包括并不限于:Hyper-V、Citrix、Vmware4.X、Vmware5.X、AIX HMC、AIX LPAR等,支持对所有实体机和虚拟机进行统一监控。一、虚拟机资源管理集中展示虚拟机的配置信息及其相关的资源(CPU、内存、存储、网络)的分配、利用情况及状态。具体包括虚拟机基本信息和资源分配使用情况:基本信息包括虚拟机本身的配置摘要信息、主要资源的状态信息和对虚拟机对象进行管理控制入口。配置摘要信息部分展示本虚拟主机相关的操

60、作系统、CPU、内存、IP地址,所在物理机。主要资源状态信息部分展示了虚拟机的CPU、内存、存储器、网口等的主要性能和状态信息。管理控制入口部分提供比如创建虚拟机等管理控制入口/链接,比如,关闭/挂起/启动虚拟机,克隆、迁移等。资源分配主要展示虚拟机上的资源分配情况,以及所在主机的资源分配情况。可以查看虚拟机当前的资源总体情况,如,CPU、内存、存储器等的总资源情况,已分配情况,以及当前资源分配的策略等信息。信息展示提供文字和图表形式,直观易懂。虚拟机所在主机的资源分配部分,展示当前该虚拟机所在主机的资源分配信息,可提供必要的图形、文字和表格展示。图 虚拟机管理信息卡片二、虚拟机监控性能监控突

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论