Jira Service Management 作为 Service Collection 的一部分,如今比以往任何时候都更强大。借助 Rovo、资产及全新的 Customer Service Management 应用,打造卓越的服务体验。立即试用
IT 业务连续性计划工具包
关键要点
IT 业务连续性计划可确保关键系统和服务在中断期间持续运行
ITSCM、灾难恢复与更广泛的业务连续性管理服务于不同的目的和时间线,但协同一致时效果最佳
业务影响分析、RTO/RPO 跟踪、运行手册和沟通规划模板能够助力团队快速搭建完善的连续性计划
自动化与人工智能有助于简化风险监控、警报触发及恢复就绪状态核验工作,大幅降低人工负担
当系统宕机或遭受网络攻击时,仅有计划远远不够,还需要适配的计划,并提前配备相应工具与人员。IT 业务连续性计划 (ITBCP) 决定团队是仓促处置,还是从容应对。
Jira Service Management 的 服务管理模板集合为 IT 团队提供可直接使用的连续性规划、事件响应等框架,让您减少从零搭建方案的时间,将更多精力投入落地执行。
继续阅读,以了解相关定义、模板详解、框架对比,以及运用自动化完善连续性计划的指导内容,无论您是初次制定 ITBCP,还是对现有计划开展审核。
什么是 IT 业务连续性计划?
IT 业务连续性计划是一份成文策略,用于明确组织在中断期间及中断后维持关键技术系统与服务持续运行的实施方案。此类中断可能是网络攻击、自然灾害、电力中断或重大系统故障。目标不仅仅是恢复,而是保障业务持续运转,避免业务运营陷入停滞。
有三个经常被混用的术语需要加以区分:
IT 业务连续性规划:侧重在中断期间维持系统与服务可用,属于主动性工作,涵盖预防、准备及响应。
灾难恢复 (DR):属于连续性规划的子集,专门明确故障发生后如何还原 IT 系统与数据。DR 具有被动属性,在事件出现后启动。
业务连续性管理 (BCM):三者中覆盖范围最广。BCM 涵盖整个组织,不限于 IT 范畴,除技术外,还涵盖人员、流程、设施及沟通工作。
核心 ITSCM 模板与工具
完善的连续性规划依赖于事件发生前准备完备的文档。以下模板涵盖 IT 业务连续性计划最重要的组成部分。Atlassian 的服务管理模板集合是理想起点,而 IT 服务管理模板专为协助 IT 团队从初期搭建服务及连续性工作流而设计。
以下是所有 IT 团队均应具备的模板:
政策与范围模板
用于明确连续性计划的目标、覆盖范围和治理。若无该模板,团队在危机发生时往往会对业务覆盖范围产生分歧。
业务影响分析 (BIA)
用于评估关键系统、应用及其依赖关系。通过 BIA,可明确最先失效的环节、造成的损失以及需最快恢复的对象。
RTO/RPO 表格
跟踪各系统的恢复时间目标(系统最长可中断时长)与恢复点目标(可接受的数据丢失量)。
沟通计划
包含预定义的联系人、上报路径和消息传递协议。在中断期间,清晰的事件通信可减少混乱并加快解决速度。
灾难恢复测试计划/桌面推演议程
包含结构化测试框架,用于验证恢复就绪度。定期测试能让您在真正事件发生之前发现漏洞。
运行手册框架
用于应对各类事件、中断及系统故障的实操手册。完善的运行手册能够让响应者无需在压力之下从零梳理应对思路。
ITSCM、DR、BCM 与重大事件管理
这四类框架存在内容交叉,可能引发混淆,尤其是危机发生时,各团队难以厘清职责归属。下文将说明彼此差异及各自适用场景:
框架 | Focus | 范围 | 时机 | 目标 | 适用场景/内容交叉 |
IT 服务连续性管理 (ITSCM) | 维护与恢复 IT 服务 | IT 系统与服务 | 持续性、主动性 | 确保 IT 服务能够经受住中断,并将影响降至最低 | 用作您的 IT 连续性计划的基础。在恢复规划方面与 DR 存在交叉,在风险评估方面与 BCM 存在交叉。 |
灾难恢复 (DR) | 故障发生后还原 IT 系统与数据 | 基础架构、应用与数据 | 被动响应;由事件触发 | 尽快让系统恢复上线 | 在发生故障且需要还原系统时使用。DR 计划依据 ITSCM 制定,并在发生重大事件期间启动。 |
业务连续性管理 (BCM) | 保障整个组织持续运转 | 人员、设施、流程与技术 | 战略性、长期 | 确保整体业务在不利环境下持续运营 | 当中断影响不止 IT 层面时,在组织层面使用。BCM 将 ITSCM 和 DR 纳入其中,作为整体战略的组成部分。 |
重大事件管理 | 实时处置高影响的 IT 故障 | 特定事件 | 立即执行 | 快速恢复正常服务,并与利益相关者清晰同步信息 | 在严重事件正在发生时使用。触发 DR 运行手册,并为事后回顾提供信息,从而优化 ITSCM 规划。 |
在实践中,这些框架并非独立运作。ITSCM 为 DR 规划提供依据。DR 为 BCM 提供输入。并且,当重大事件发生时,事件管理会启动 DR 运行手册。交叉是有意为之。关键在于厘清任一阶段应以哪套框架为主导。
如何借助自动化与人工智能实现 IT 业务连续性现代化
依靠人工开展的连续性流程存在上限。此类流程速度缓慢、缺乏一致性,并且在出现故障时高度依赖碰巧有空的人员。自动化与人工智能正在改变各种可能性,而积极采用它们的 IT 团队能够以更低投入搭建韧性更强的计划。
以下是自动化能够创造最大价值的领域:
自动化监控与警报:搭建针对系统运行状况、性能阈值和异常的实时监控。自动化警报可让团队在潜在故障演变为全面中断之前提前察觉。
备份自动化:定时自动备份可降低人为失误风险,保障恢复点目标真正达成。将其与自动化验证检查相搭配,以便备份可用。
人工智能驱动的影响分析:人工智能工具能够分析系统依赖关系,并模拟故障引发的下游影响,效率远超人工开展的任何 BIA 流程。该功能在存在大量相互依赖关系的复杂环境中尤为实用。
预测性测试:无需等待按季度开展桌面演练,人工智能可持续模拟各类故障场景,并标记恢复计划中的薄弱环节。这使得测试由定期事件转变为持续性实践。
更快的恢复自动化:运行手册可实现部分或完全自动化。一旦事件触发,系统能够立即执行首批恢复步骤,无需等待人工启动流程。
自动化无法取代完善的规划,而是放大规划的价值。成效最为突出的团队,会先搭建可靠的模板与流程,再逐步引入自动化以减轻人工负担。持续改进已内置于此模式中。每次自动化测试与警报都会增加数据,助力您持续优化计划。
将您的 IT 连续性工具包付诸实施
Jira Service Management 为 IT 团队提供了一个统一的平台,用于协调桌面演练、跟踪恢复进度以及管理连续性活动的整个生命周期。借助内置的事件管理工具与可自定义的工作流,JSM 可作为您的 IT 业务连续性计划的运营支柱,串联业务连续性计划所依托的人员、流程与文档。
可将此页面作为搭建或更新连续性计划的参考依据。此页面中的模板、框架和指南可协同使用。可优先推进最紧迫的工作,无论是 BIA、沟通计划,还是 RTO/RPO 表格,并在此基础上进行拓展。目标是打造一个在最关键时刻能经受住考验的计划。