ONEPSOFT | 软考学习知识库
2021年8月,我作为系统规划与管理师主持了某地铁集团综合监控系统运维服务项目。该地铁集团已开通运营多条线路,综合监控系统承担着全线机电设备监控、电力监控、视频监控、门禁控制和乘客信息发布等重要职能,是保障行车安全和车站秩序的关键支撑。本项目合同金额为134.6万元,合同工期1年,主要工作包括综合监控系统各子系统的现场和远程故障处置、异常操作处理、服务器与网络的日常维护、系统进程检测、数据库运行检查与日常备份,以及各车站终端设备的日常监控与维护,同时对各项维护工作定期形成巡检报告和维护日志,确保综合监控系统日常运维作业的有序开展,其中驻场人员2人,提供2×8小时服务,并依托公司二线专家团队提供7×24小时电话和远程技术支持。为保障运维工作最大程度满足客户需求,我和团队根据公司的投标书深入项目所在单位,了解运维过程中项目运维的关键。运维工作启动后,我按照ITSS的要求,除了努力做好运维服务生命周期各阶段的IT服务工作、加强团队建设和管理以外,还特别注重对整个过程的监督管理,尤其是IT服务风险的管控,主要从制定风险管理计划、风险识别、定性风险分析、定量风险分析、制定风险处置计划、风险监控和风险跟踪七个方面加强了风险管理。
一、制定风险管理计划
任何项目的运维管理活动、过程如需保质保量完成,计划都是先决条件,风险管理也不例外。在项目启动之初,我和运维团队对照运维服务范围说明书,召开相关干系人参与的会议,讨论了风险的类别,明确了每月1日和16日举行风险评估会议,研究了风险管理的预算并将其纳入项目成本基准,初步定义了风险概率和影响力。例如,集团运营管理部门对综合监控系统的建设成效期待值最高,风险容忍度最低,暂定为0.1;该项目运维成功与否,对我们公司的效益和口碑都存在很大影响,暂定为0.3;集团信息中心作为长期从事信息技术支持的部门,对信息系统项目的风险有一定认识,暂定为0.5;各车站业务科室对风险承受度较高,暂定为0.7;项目成效一般、短时期内对运营影响不大时风险承受程度最高,暂定为0.9。通过分级定义,为后续的风险分析和应对提供了量化依据。
二、识别IT服务风险
确定哪种风险会产生哪种影响,并记录风险特征形成文档,是风险识别的重要内容。我们组织集团运营管理部门、信息中心IT人员、运维技术人员、销售人员、质量人员等相关干系人参与的专题会议,对照服务级别协议和有关计划,分别利用头脑风暴、德尔菲、分析假设等方法进行了研讨,制定了初步的风险记录表。我们分析出风险主要来自技术风险、人力资源风险、费用风险、工期风险和法律风险等类别,又通过风险分解结构,细化出不同建设阶段的50多条风险,逐一登记了风险描述、发生阶段和责任人。在技术风险中,重点关注了监控采集终端老化、骨干网络链路单点故障、数据库容量不足等;在人力资源风险中,重点关注了关键工程师离职、二线专家支持不足等;在外部风险中,则关注了线路延长施工期间现场环境变化带来的影响。
三、进行定性风险分析
对识别出的不同风险进行优先级排序,是定性风险分析的主要工作。针对不同风险对服务质量、进度、费用等方面的影响,我们仍然以会议方式开展分析,除了有关项目干系人以外,还邀请了公司有过类似项目运维管理经验的同行参与,以提高分析的准确性。经过分析认为,车站机电设备状态数据上传的实时性和有效性直接关系到行车调度和客流安全,一旦数据中断或失真,可能导致调度误判乃至引发安全事故,因此我们把车站机电设备状态数据上传的实时性和有效性列为第一级风险,优先投入资源进行管控。
四、定量风险分析
定量风险分析是对定性风险分析结果按照优先级先后顺序进行量化的过程,其结果主要用于编制应对计划、供决策使用。这个过程中,我们还是邀请公司有过类似项目运维管理经验的人员参与,采用模拟估算和偏差分析等方法,对第一级风险的数据传输中断概率、影响时长和可能造成的损失进行了量化测算。通过测算,我们评估出高峰期单站数据中断超过30分钟即可能对调度作业造成明显影响,据此把监控采集终端备件的储备数量提高了三成,并明确了故障替换的响应时限。根据分析结果,我们对备件库进行了特别维护,加强了机电监控采集终端设备备件的应急管理,确保故障后能够快速更换,缩短数据中断时间。
五、制定风险处置计划
经过上述一系列工作后,风险管理便进入到编制风险应对计划的阶段。我们根据已完善的风险记录表,针对不同类型的风险采取威胁和机遇的应对措施,主要通过预留资源的方式应对突发事件。例如,我们预留了20天的运维服务改进、完善期,以保证尽量避免带着问题交付;对熟悉地铁综合监控业务的关键技术人员实行AB角色管理,防范关键人员离职风险;对于专业性较强的监控终端维保服务,在取得客户同意后实行了外包,以防范单项风险给整体带来不良影响。
六、风险监控
风险监控要与运营管理和持续改进等各个阶段有机结合、相得益彰。我们在开展风险监控工作时,注重日常工作和里程碑事件的结合,按照不同类型、不同优先级的风险采用不同频率和程度的监控:对第一级风险每日检查数据上传链路和采集终端在线率,对一般风险则按月抽查,认真做好监测与控制,根据绩效情况及时向各干系人反馈、报告,并在每月1日、16日的评估会议上集中研讨、发布风险监控的得失,更新相关计划,提报相关变更,使得整个项目各个环节的进展始终处于掌握之中。
七、风险跟踪
风险跟踪是对已识别风险和事先未能识别的突发风险进行观察、记录的过程。针对该运维项目的风险,我建立了风险跟踪台账,实行闭环管理。在运维服务过程中,风险管理员采用偏差分析的方法,定期与IT服务规划比对,分析时间、成本等方面存在的偏差,及时向运维团队报告风险的管理情况,提高整个团队对风险的警惕性。例如,在一次夜间检修中监控平台出现告警误报,虽然未造成实际影响,但我们仍将其记录在案并排查了告警规则配置,杜绝了类似问题再次发生。
2022年8月,本运维合同到期,通过我和团队的不懈努力,圆满完成项目的各项运维工作,完成全年考核任务。系统各模块运行稳定,事件响应、反馈、跟踪及时,系统巡检按时完成,发现问题及时处理,全年未出现用户主动投诉,系统运行可靠率达到100%。当然,在合同履行过程中也存在一些小问题,比如前期服务需求识别不够充分、中途有运维人员离职,这些问题给运维服务带来了一定压力,但经过我的努力,这些问题都得到了解决。该项目使我深刻认识到IT服务风险管理对运维项目的重要性:风险管理不是一次性活动,而是贯穿服务始终的持续过程,只有把风险意识融入日常运维的每一个环节,才能把不确定性对服务质量的影响降到最低。在后期的工作和学习中,我将继续学习ITSS、ITIL等相关标准知识,不断提升自己的系统规划与管理水平,为用户提供更加专业的IT运维服务,提高用户的满意度。