ONEPSOFT | 软考学习知识库
2022年12月,我作为系统规划与管理师主持了某省广播电视局发射台站运行状态远程监测网运维项目。该运维项目合同金额为138.7万元,合同工期为一年。本运维项目主要工作包括发射台站动力环境监控系统、信号监测系统、覆盖效果测试系统、告警联动平台等子系统的现场和远程故障处置及异常操作处理,服务器、网络的日常维护,系统进程检测,数据库的运行检查与日常备份,以及各台站终端设备的日常监控与维护,同时对各维护项目定期形成巡检报告和维护日志,以确保全省广播电视安全播出监测作业的有序开展,其中驻场人员2人,提供2×8小时服务。为保障运维工作最大程度满足客户需求,我和我的团队根据公司的投标书深入项目所在单位,了解运维过程中存在的问题。如何保障业务的连续性和信息系统的高可用,满足关键业务7×24小时不间断运行的要求,是我们项目运维的关键。运维工作启动后,我按照ITSS的要求,除了努力做好运维服务生命周期各阶段的IT服务工作、加强团队建设和管理以外,还特别注重对整个过程的监督管理,特别是IT服务风险的管控,主要从制定风险管理计划、风险识别、定性风险分析、定量风险分析、制定风险处置计划、风险监控和风险跟踪等七个方面加强了风险管理。
一、制定风险管理计划
任何项目的运维管理活动、过程如需保质保量完成,计划都是先决条件,风险管理也是如此。在项目启动之初,我和我的运维团队对照运维服务范围说明书,召开了相关干系人参与的会议,讨论了风险的类别,明确了每月1日和16日举行风险评估会议,研究了风险管理的预算并纳入项目成本基准,初步定义了风险概率和影响力。例如,省广播电视局分管领导、业务科室领导对监测网建设成效期待值最高、风险容忍度最低,暂定为0.1;该运维项目成功与否对我们公司的效益和口碑都有很大影响,暂定为0.3;监测中心作为长期从事技术支持的部门,对信息系统项目的风险有一定认识,暂定为0.5;各台站科室对风险承受度较高,暂定为0.7;项目成效一般、短时期内对安全播出影响不大时,风险承受程度最高,暂定为0.9。通过分级定义,为后续风险分析和应对提供了量化依据。
二、识别IT服务风险
确定哪种风险会产生哪种影响,并记录风险特征形成文档,是风险识别的重要内容。我们组织省广播电视局各业务科室负责人、监测中心技术人员、运维技术人员、销售人员、质量人员等相关干系人参与的专题会议,对照服务级别协议和有关计划,分别利用头脑风暴、德尔菲、分析假设等方法进行了研讨,制定了初步的风险记录表。我们分析出风险主要来自技术风险、人力资源风险、费用风险、工期风险和法律责任风险等类别,又通过风险分解结构,细化出不同建设阶段的50多条风险,逐一登记了风险描述、发生阶段和责任人。技术风险中重点关注了台站回传链路单点故障、发射机监控终端老化、数据库容量不足等;人力资源风险中重点关注了关键工程师离职、二线专家支持不足等。我们特别关注了重要保障期间单条回传链路长时间中断这类小概率但高影响的风险,为其单独建立了处置预案。
三、进行定性风险分析
对识别出的不同风险进行优先级排序,是定性风险分析的主要工作。针对不同的风险种类,我们对其发生的概率利用矩阵表进行了认真评估,评估出各类风险对于IT服务时间、成本、质量和范围等方面的影响。在这个阶段,我们仍然以会议方式开展,除了有关项目干系人以外,还邀请了公司有过类似项目运维管理经验的同行参与,以提高分析的准确性。经过分析认为,发射台站回传数据的实时性和有效性将直接影响安全播出监测的准确性,一旦数据中断或失真,可能导致监测盲区乃至安全播出事故,因此我们把台站回传数据的实时性和有效性列为第一级风险,优先投入资源进行管控。
四、定量风险分析
定量风险分析是对定性风险分析过程的结果按照优先级先后顺序进行量化的过程,其结果主要用于编制应对计划、供决策使用。这个过程中,我们还是邀请公司有过类似项目运维管理经验的同行帮助我们评估出了各类风险的悲观、乐观和最可能值,量化、完善、更新了风险记录优先级表格,并根据这个阶段的分析对备件库进行了特别维护,加强了发射台站监控终端设备备件的应急管理,确保故障后能够快速更换,缩短数据中断时间。
五、制定风险处置计划
经过上述一系列工作过程后,风险管理便到了编制风险应对计划的阶段。我们根据已完善的风险记录表,针对不同类型的风险采取利用威胁和机遇的应对措施,主要是通过预留资源的方式应对突发事件。例如,我们预留了20天的运维服务改进、完善期,以保证尽量避免带着问题交付;对熟悉广播电视监测业务运维的关键技术人员实行了AB角色管理,以防范关键人员离职风险;对于专业性较强的台站动力环境监控运维,在取得客户同意后实行了外包,以防范单项风险给整体带来不良影响。
六、风险监控
风险监控是运维服务全生命周期中持续进行的过程,与IT服务规划设计、部署实施、运营管理和持续改进等各个阶段有机结合、相得益彰。我们在开展风险监控工作时,注重日常工作和里程碑事件的结合,按照对不同类型、不同优先级的风险进行不同频率和程度的监控,认真做好监测、控制,根据绩效情况及时向各干系人反馈、报告。例如,针对列入第一级的台站回传链路风险,我们设置了专门的链路巡检和连通性自动探测,一旦发现抖动即启动核查流程。同时,我们在每月1日、16日的评估会议上集中研讨、发布风险监控的得失,更新相关计划、提报相关变更,使得整个项目各个环节的进展都在掌握之中。
七、风险跟踪
风险跟踪是对已识别风险和事先未能识别的突发风险进行观察、记录的过程。针对该运维服务,我们设计了符合该项目运维实际的风险清单,并保证该清单的唯一性和更新的及时性,由风险管理员进行管理。在运维服务过程中,风险管理员采用偏差分析的方法,定期与IT服务规划比对,分析时间、成本等方面存在的偏差,及时向运维团队报告风险的管理情况,提高整个团队对风险的警惕。对于新出现但未列入清单的突发风险,风险管理员也会第一时间登记入册,补充进下一轮评估。
2023年12月,本运维合同到期,通过我和我的团队的不懈努力,圆满完成项目的各项运维工作,完成全年考核任务。系统各模块应用技术咨询服务包括电话、传真、邮件等方式,保证7×24小时值班及电话接听;日常管理规范符合合同及各项管理规范要求;服务支持达标,事件响应反馈、跟踪及时;系统巡检按时完成,发现问题及时处理,未出现用户主动投诉事件,系统运行可靠率达到100%,尤其在广播电视重要保障期间经受住了考验,保障整个系统不间断运行。当然,在本合同履行过程中,也存在一些小问题,比如前期服务需求识别不够充分、中途有运维人员离职,这些问题给运维服务带来了一定压力,但经过我后期的努力都得到了解决。该项目使我认识到了IT服务的风险管理对运维项目的重要性。另外,在后期的工作和学习中,我将继续学习ITSS、ITIL等相关标准知识,不断提升自己的系统规划与管理水平,为用户提供更加专业的IT运维服务,提高用户满意度。