ONEPSOFT | 软考学习知识库
2021年3月,我作为系统规划与管理师主持了某沿海港口集团生产调度与设备状态监测系统运维项目,该运维项目合同金额为152.4万元,合同工期为1年。本运维项目主要工作包括生产调度系统、设备状态监测系统(覆盖12个泊位、36台岸桥、80台龙门吊及堆取料机等大型装卸机械)、辅助决策系统的现场和远程故障处理及异常操作处置,服务器、网络的日常维护,定期形成巡检报告和维护日志等,以确保港口装卸作业和安全生产的有序开展,其中驻场人员3人,提供5×8小时现场服务和7×24小时远程值守保障。为了保障我们的运维服务最大程度满足客户的需求,我和团队根据公司的投标书,深入项目所在单位,了解运维过程中存在的问题。如何保障业务的连续性和信息系统的高可用,满足关键业务7×24不间断服务运行的要求,是我们项目运维的关键。港口作业具有昼夜连续、班次密集的特点,生产调度系统一旦中断,将直接影响船舶靠离泊计划与装卸效率,因此系统可用性要求极高,运维保障责任重大。运维工作启动后,我按照ITSS的要求,除了努力做好运维服务生命周期阶段的IT服务工作、加强团队建设和管理以外,还特别注重对整个过程的监督管理,特别是IT服务风险的管控,主要从制定风险管理计划、风险识别、定性风险分析、定量风险分析、制定风险处置计划、风险监控和风险跟踪等7个方面加强了风险管理。
1、制定风险管理计划
任何项目的运维管理活动、过程如需保质保量完成,计划都是先决条件,风险管理也是如此。在项目建设之初,我和我的运维团队对照运维服务范围说明书,召开了相关干系人参与的会议,讨论了风险的类别,明确了每月5日、20日举行风险评估会议,研究了风险管理的预算并纳入项目成本基准,初步定义了风险概率和影响力:如港口集团分管生产经营的副总经理对生产调度与设备状态监测系统的建设成效期待值最高,风险容忍度最低,暂定为0.1;该运维项目成功与否,对我们公司的效益和口碑都有很大影响,暂定为0.3;集团信息中心作为长期从事信息技术支持的部门,对信息系统项目的风险有一定认识,暂定为0.5;各作业区班组对风险承受度较高,暂定为0.7;项目成效一般,短时期内对港口运行服务影响不大,风险的承受程度最高,暂定为0.9等。
2、识别IT服务风险
确定哪种风险会产生哪种影响,并记录风险特征形成文档,是风险识别的重要内容。我们组织了港口集团各作业区负责人、信息中心人员、运维技术人员、销售人员、质量人员等相关干系人参与的专题会议,对照服务级别协议和有关计划,分别利用头脑风暴、德尔菲、分析假设等方法进行了研讨,制定了初步的风险记录表。我们分析出了技术风险、人力资源风险、费用风险、工期风险和法律责任风险等类别,又通过风险分解结构,细化出不同建设阶段的50多条风险。在识别过程中,我们还特别关注了数据安全风险,如状态监测数据在传输过程中被篡改或泄露可能引发的安全隐患,将其纳入风险清单一并管理。
3、进行定性风险分析
对风险识别出的不同风险进行优先级排序,是定性风险分析的主要工作。针对不同的风险种类,我们对其发生的概率利用矩阵表进行了认真评估,评估出各类风险对于服务时间、成本、质量和范围等方面的影响。在这个阶段,我们仍然以会议方式开展,除了有关的项目干系人以外,我们还邀请了公司有过类似项目运维管理经验的同行参与,以提高分析的准确性。经过分析认为,岸桥、龙门吊等大型装卸机械状态监测终端数据传输的有效性和实时性,将直接影响生产调度与设备状态监测系统的动态数据监测,这对于减少设备非计划停机以及因此可能导致的装卸作业中断、安全生产事故至关重要,因此我们把状态监测终端数据传输的实时性和有效性作为第一级风险。例如台风季强风天气下,露天作业区的网络终端故障率明显上升,通过分析确认了室外设备防护等级不足的问题,并列为中高风险项。
4、定量风险分析
定量风险分析是对定性风险分析过程的结果按照优先级先后顺序进行量化的过程,定量风险分析的结果主要用于编制应对计划,以供决策。在这个过程中,我们还是邀请公司有过类似项目运维管理经验的同行,帮助我们评估出了各类风险的悲观、乐观和最可能值,量化、完善、更新了风险记录优先级表格,并根据这个阶段的分析,对备件库进行了特别维护,加强了装卸机械状态监测终端备件的应急管理。
5、制定风险处置计划
经过上述一系列的工作过程后,风险管理便到了编制风险应对计划的阶段。我们根据已完善的风险记录表,针对不同类型的风险采取了应对措施,主要是通过预留资源的方式应对突发事件。如我们预留了15天的运维服务改进、完善期,以保证尽量避免带着问题交付;对熟悉港口业务信息化项目运维的关键技术人员实行了AB角色管理,以防范关键人员离职风险;对于专业性较强的装卸机械状态监测终端运维服务,在取得客户同意后,实行了外包,以防范单项风险给整体带来不良影响。针对台风季风险,我们制定了大风来临前的设备巡检加固清单,并在台风期间安排专人驻守,确保第一时间响应处置。
6、风险监控
风险监控是运维服务全生命周期的一个持续进行的过程,与IT服务规划设计、部署实施、运营管理和持续改进等各个阶段有机结合、相得益彰。我们在开展风险监控工作时,注重日常工作和里程碑事件的结合,按照对不同类型、不同优先级的风险进行不同频率和程度的监控,认真做好监测、控制,根据绩效情况及时向各干系人反馈、报告,并在每月5日、20日的评估会议上,集中研讨、发布风险监控的得失,更新相关计划,提报相关变更,使得整个项目各个环节的进展都在掌握中。
7、风险跟踪
风险跟踪是对已识别风险和事先未能识别的突发风险进行观察、记录的过程。针对该运维服务,我们设计了符合该项目运维实际的风险清单,并保证该清单的唯一性和更新的及时性,由风险管理员进行管理。在运维服务过程中,风险管理员采用偏差分析的方法,定期与IT服务规划比对,分析时间、成本等方面存在的偏差,及时向运维团队报告风险的管理情况,提高整个团队对风险的警惕。
2022年3月,本运维合同到期,通过我和团队的不懈努力,圆满完成项目的各项运维工作,完成全年考核任务。系统各个模块应用技术咨询服务包括电话、传真、邮件等方式,保证7×24小时值班及电话接听。日常管理规范符合合同及各项管理规范要求;服务支持达标,事件响应反馈、跟踪及时;系统巡检按时完成,发现问题及时处理,未出现用户主动投诉事件,系统运行可靠率达到99.9%,尤其在夏季台风过境、港口集中作业高峰期间,经受住了考验,保障了整个系统不间断运行。当然,在本合同履行过程中,也存在一些小问题,比如前期服务需求识别不够充分、中途运维人员离职,这些问题给运维服务带来了一定的压力,但经过我后期的努力,这些问题都得到了解决。该项目使我认识到了IT服务风险管理对运维项目的重要性。在后期的工作和学习中,我将继续学习ITSS、ITIL等相关标准知识,不断提升自己的系统规划与管理水平,为用户提供更加专业的IT运维服务,提高用户的满意度。