灾难恢复计划_第1页
灾难恢复计划_第2页
灾难恢复计划_第3页
灾难恢复计划_第4页
灾难恢复计划_第5页
已阅读5页,还剩6页未读, 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

损失减少公司劫难恢复计划七步曲正如现实生活中其它事物的不可预料性同样,公司很难预先知道其网络、数据中心运作过程中何时会受到威胁。但减轻劫难的后果并不是一个轻松的过程。下面笔者给出可以帮助公司提供实用指南并实现高效的业务连续性和劫难恢复计划的七个环节:第一步:认可劫难的也许性业务连续性及劫难恢复的第一步是认可自己的单位会碰到可以损害公司发展的现实性威胁。假如公司没有在一个高级的层次上采用这一步,其它的环节就免谈。第二步:列表并分类公司面临的威胁公司及其社会环境的性质可以影响一个单位所面临的威胁类型。在列示了威胁之后,单位应当根据这些威胁对不同系统的也许影响对其分类。应当在劫难的响应成本和可容忍的“宕机时间”之间实现平衡,可容忍的“宕机时间”越少,则公司就需要越多的成本来创建恰当的响应。比如,一些系统必须在几分钟或几秒内实现功能恢复,尚有一些系统可容忍的“宕机时间”为几小时,尚有其它系统即使“宕机时间”多达几天也不会产生严重的后果。第三步:概要描述单位的业务连续性和劫难恢复技术的基础结构业务连续性和劫难恢复技术基础结构的关键技术要素由以下几部分组成:关键数据中心、一个可以备份重要数据中心资源的远程站点、高带宽的网络连接等部分组成。在整个数据中心,业务连续性和劫难恢复的最佳策略都要遵循所有要素成分都保持冗余性的观点。在生产性和备份数据设施中都应当运营多台主机和服务器。假如一个生产性系统的一个组件碰到了一个问题,此系统组件就立即将其功能转移给本地的备份系统,这可以作为对付劫难的第一道防线。在业务连续性和劫难恢复策略中,最关键的要素之一就是电源。根据调查,电力故障是最为常见的也是可防止的中断性故障。不管公司的网络带宽多么大,假如一个粗心大意的施工人员偶尔弄断了光纤,其作用也就寿终正寝了。网络的连接不仅要足够,还要在一个更宽广的WAN技术范围内遵循不同的途径,避免业务限于停顿。第四步:清查单位的IT资产一旦单位已经草拟了其业务连续性和劫难恢复基础结构的拓扑,下一步就是要制定IT资产的一个精确而具体的目录。这就使得单位可以理解需要保护的资源和业务过程。现在有不少业务管理工具有助于制定和维护IT资源的精确目录。这些工具的厂商都提供了一些依靠软件代理来优化IT基础结构的工具模块,并可将硬件和软件资产的细节及其配置参数存储到配置管理数据库中(CMDB)。第五步:设立服务水平盼望并定义意外事故策略配置管理数据库中(CMDB)不仅存储着单位软件和硬件资产的细节信息,还包含着服务水平的约定规定信息,这些约定规定可以定义正常运营时间及这些资源的恢复参数。回想前面的第二步,高级管理部门对服务水平盼望作出规定是很重要的,由于这些可以决定在某次故障中的5分钟内或5小时之内某种特定的资产是否必须启动和运营。这种决定可以直接影响高级管理部门日后会寻求支持的业务连续性和劫难恢复的成本支出。根据对IT资产及配置和服务水平约定的清楚理解,单位就可以定义意外事故的应对策略。这些策略必须得到主管人员的支持,因而需要将IT资产的性能直接与公司需求联系起来。为了形成这种重要的联系,单位需要执行业务影响分析来充实系统需求、过程、系统交互关系的细节。主管人员必须理解系统瘫痪的后果,以便于支持意外事故的应对策略。第六步:制定一个业务连续性和劫难恢复的计划意外事故的应对计划应当直接根据意外事故的应对策略,具体表述不同部门和个人的角色和责任,以保持技术系统的可用性,并阐明紧急情况下恢复IT系统的过程。意外事故的应对计划的关键元素还涉及资源需求、培训需要、培训练习和测试的频率、维护时间表、数据库备份的时间表等。意外事故的应对计划的阶段涉及以下几个方面,一是劫难降临时的告知过程,二是应急团队动员后的恢复过程,三是回归正常运作过程。第七步:测试业务连续性和劫难恢复计划在定制了正式的策略和过程之后,最为重要然而却最容易被忽略的一个方面是劫难恢复计划。公司必须从一开始就测试其计划的完整性和有效性,然后再在运作过程中重新测试,以保证对IT基础结构和业务过程的日后改变不会产生策略改变的需要。此外,单位应当创建测试平台,以精确地反映平常的业务条件,以使演练可以模拟真实的条件。在当今复杂的条件下,要让公司防御每一种劫难事故的确有点儿困难。但是,在无法预料的事情发生后,假如公司采用了恰当的技术、清楚的服务水平盼望、实用的恢复策略,再通过劫难恢复计划和严格的测试方法,单位就可以将劫难对业务的影响降至最低。公司业务连续性和劫难恢复规划实行公司部署了全面的劫难恢复规划,而不到10%的中小公司拥有危机管理、应急措施、业务重组和业务恢复计划。对于中小公司来说,部署劫难恢复计划是十分重要的。根据Gartner调查显示,五分之二的公司在五年内都经历过至少一次严重劫难。此外,劫难的发生频率比我们想象中的还要高,由于大约80%的应用程序停工是人为的或者进程犯错导致的,而不是由于劫难或者技术故障。设立一个停机时间限制当我们在部署劫难恢复计划时,最开始的目的应当是拟定恢复点目的和恢复时间目的。劫难恢复点目的(RPO)指明了可以允许的数据丢失范围,而恢复时间目的(RTO)则是应用程序可以允许的停工时间范围,即根据可承受的最长停电时间来拟定。假如劫难真的发生了,那么你的公司可以承受多长时间呢?一个小时?一天?还是一个星期?那些需要立即恢复运营的公司必须投入更多的资金来进行劫难恢复部署,而那些几天内仍然可以继续运营的公司则可以投入较少的资金。同样来说,较高的劫难恢复点目的相对来说更加昂贵,但是中小公司必须权衡防止性支出与重要数据丢失带来的潜在高额费用之间的关系。认真拟定劫难恢复点目的和恢复时间目的可以帮助你合理分派资源,而不会浪费成本。假如你的公司对于拟定劫难恢复点目的和恢复时间目的,那么就可以使用业务影响分析(BIA)。业务影响分析方法依据的基本假设条件就是,公司的每一个因素都依赖于任何其他因素的连续运营,但是有些因素比其他因素要更加重要。业务影响分析优先考虑了关键任务数据和系统,它可以帮助公司在考虑劫难性事件时将资源进行合理分派。BIA可以让IT经理和中小公司业主清楚地看到,假如他们不部署劫难恢复计划,他们将也许损失的成本价值。建立劫难恢复计划当拟定了RPO和RTO之后,你就可以正式建立劫难恢复计划了。当你在建立劫难恢复计划时,要牢记以下这些最佳做法:要让公司所有的利益相关者参与进来,而不只是IT部门。举例来说,人力资源部在对员工进行劫难恢复计划培训以及计划沟通中时将发挥重要的作用,所以人力资源部应当参与进来;首席执行官和其他高级管理人员对于保证劫难恢复计划的资金和公司性购买方面是必不可少的角色;假如你的公司场合是租赁的,那么物业管理也应当了解你的计划;此外,最佳还要告知本地的执法部门你所要实行的计划。将所有的利益相关者参与到规划和部署中是十分重要的。防止数据仓库的产生:也许你会认为将文献保存到桌面是很方便的事情,但是这却是个不好的习惯。员工的个人电脑硬盘通常没有得到IT部门的备份支持,所以最佳部署一个中央服务器来解决这种令人头疼的问题,让所有的员工可以规范地使用电脑。优先备份:拟定需要保存的数据以及保存时间,然后执行存储策略来优先备份关键数据和应用程序,一方面要备份最关键的部分。现场备份和非现场备份:我们现在拥有各种备份技术,从在线备份服务到磁盘和磁带解决方案等。在考虑选择何种备份服务时,最佳选择既可以进行现场备份又可以进行非现场备份的备份服务,那样当你的重要业务场合无法使用时也可以对数据和应用程序进行备份。举例来说,有了磁盘镜像,至少会有两个硬盘同时进行复制和存储数据,那么,假如其中有一个磁盘出现故障,系统就可以自动切换至另一台磁盘,不管这两个磁盘在同一数据中心或是分布在不同城市,这样就可以减少数据和服务的损失。保证远程访问:数据保存期限和网络访问同样重要。假如实体办公室不能避免劫难的发生,员工还是需要接入网络基础设施来保持业务运营。假如让所有员工实现远程访问不现实,至少密钥持有者应当可以进行远程访问。拟定了停工时间限制以及部署了劫难恢复计划后,有必要进行定期测试。当然,测试需要花费一定的时间和金钱,所以公司的测试频率可以根据预算来设立。作为一个基准来说,中小公司至少每年进行两次测试。假如每年对整个系统进行两侧测试不能实现,至少也应当定期地对最关键的应用程序和系统进行测试。此外,在公司旺季的时候也应当进行测试,并且不需要告知所有的员工,除了必要的几个工作人员外,这样做是为了模拟真正的劫难。最后,IT经理在每次测试后都应当对劫难恢复系统进行审查,看看哪些地方容易出现故障,以及时纠正错误。有效的劫难恢复计划对于公司生存发展力是至关重要的,根据McGladrey和Pullen事务所记录,每年每500个数据中心就会发生一次劫难事故,其中43%的劫难事故导致无法挽回的损失。而此外的29%公司将会被迫关闭两年。劫难恢复相称于公司保险,是你的公司不可缺少的部分保证劫难恢复(DR)计划的实行在今年早些时候提出的一份劫难恢复(DR)报告中,Forrester研究公司建议,在制定劫难恢复计划时,要采用以下七个环节来保证争取到新的、额外的、正在运营的基金:1.实行一套连续性的管理流程。技术支持劫难恢复的准备工作;这并不是一个连续的策略或者计划。在能争取到技术和服务的基金之前,你应当将劫难恢复的准备工作看作是一个连续性的流程,而不是一个一时的事件,并且为此制定一个总体的框架。2.进行业务影响分析(BIA)和风险评估。在IT部门争取到资金之前,IT部门的人员必须坐下来与业务部门人员进行交流,共同拟定哪些是公司里最关键的流程,哪些依赖于IT资源并计算出由于发生故障而引发的成本。然后,你还需要制定出一份风险评估,以拟定特定风险的概率和频率。3.计算出停机所产生的成本。理解停工成本是非常重要的,这有助于帮助业务人员和IT部门拟定在每一个业务流程中可接受的停机时间和数据丢失,指导将来的技术和服务投资。4.发展影响的情况,不只是解决“劫难”,要解决所有的风险。业务部门和IT部门必须要同风险管理专家合作一起评估那些真正的破坏性事件的风险,例如,电力故障、IT故障、人为错误、设备故障、自然灾害和人为灾害。当管理者考虑劫难恢复的准备计划时,他们通常是先考虑为那些反常的事件做准备,例如,飓风、地震和恐怖主义事件等等。现实情况是,那些发生的劫难或重要业务的中断最常见的因素通常是人为事件,例如,停电和IT故障。劫难恢复计划者和IT运营专家必须要是管理人员明白劫难恢复的准备工作不仅仅是应对“劫难”而是应对那些像公司停工这样的事故的发生。5.将劫难恢复(DR)看作是竞争的必要手段。假如你的公司停工,这就有也许为你的竞争对手提供机会扩大他们的市场份额。同样,正常开工就可以与竞争对手有平等的机会竞争市场份额。这有助于重新提起关于劫难恢复的讨论,要制定一份保险策略保证劫难恢复(劫难复原),将它作为一个竞争的必要手段。大多数公司,不只是金融服务公司都有一个备用的站点,并且运用先进的复制技术来保护数据。公司应当与同行或竞争对手保持一致。6.制定一个劫难恢复(DR)服务目录。正如你与业务部

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论