ONEPSOFT | 软考学习知识库
2020年6月,我作为系统规划与管理师主持了某沿海海事局船舶交通管理系统与智慧航道监管平台运维服务项目。该局辖区水域通航繁忙,承担着船舶交通组织、航道维护监管等重要职责。为了提升辖区动态感知能力和监管效率,局里建成了船舶交通管理(VTS)系统、船舶自动识别(AIS)岸台与船台终端、航道视频监控、电子海图辅助决策系统以及值班信息平台等一系列信息化系统,形成了覆盖重点水域的综合监管网络。项目合同金额128.6万元,服务期一年,主要工作涵盖上述各系统及终端设备的现场和远程故障处理、异常操作处置、服务器与网络日常巡检、数据库检查与备份、终端设备监控维护,并按期形成巡检报告和维护日志,保障船舶航行监管与航道维护作业有序开展。按照合同约定,我方安排两名工程师提供每周五天、每天八小时的驻场服务,其余时段由二线团队远程值守。船舶交通管理直接关系海上人命与航行安全,业务连续性要求极高,关键环节需要全天候稳定运行,这给运维工作带来了不小的压力。
运维工作启动后,我按照ITSS标准在做好服务生命周期各阶段工作的同时,把主要精力放在IT服务风险管控上。因为对这类涉水业务系统而言,一次终端数据缺失、一段链路中断,都可能影响船舶动态的准确掌握,进而危及航行安全。围绕制定风险管理计划、风险识别、定性风险分析、定量风险分析、制定风险处置计划、风险监控、风险跟踪七个方面,我和团队展开了一系列工作。
一、制定风险管理计划
计划是风险管理的前提。项目伊始,我对照运维服务范围说明书,组织相关干系人召开风险评估会议,讨论风险类别,确定每月6日、21日召开例行风险评估会,并将风险管理预算纳入成本基准,保证应对措施有资源支撑。会上初步定义了各方对风险的容忍程度,为后续的优先级排序提供统一尺度:
| 干系人 | 风险容忍度 | 说明 |
|---|---|---|
| 局分管领导、业务部门领导 | 0.1 | 对系统建设成效期待最高,不容有失 |
| 我方公司层面 | 0.3 | 项目成败关系公司口碑与收益 |
| 信息中心 | 0.5 | 长期从事信息技术支持,对风险有基本认识 |
| 各业务科室 | 0.7 | 对一般性风险承受能力较强 |
| 短期影响类风险 | 0.9 | 短期内不影响航行监管,可承受程度最高 |
这张表统一了干系人对风险的看法,也让之后的优先级排序有了客观依据。
二、识别IT服务风险
确定哪些风险会产生影响、其特征是什么,是风险识别的核心。我组织业务科室负责人、信息中心技术人员、运维工程师、质量人员等干系人召开专题会议,对照服务级别协议和相关计划,综合运用头脑风暴、德尔菲、假设分析等方法,梳理出技术、人力、费用、工期、法律责任五类风险,再通过风险分解结构逐层细化,共识别出五十多条具体风险,形成风险记录表。比如,AIS船台终端长期处于海上环境,设备老化损耗快;核心系统依赖的通信链路存在单点隐患;熟悉海事业务的运维人员流动可能造成服务断层;旺季保障任务集中时,人手和备件可能出现紧张。这些风险都被一一记录下来。风险识别的成果不能停留在会议纪要上,我们把这些风险按类别、描述、可能影响、触发条件整理成规范的风险登记表,纳入项目文档体系,由专人维护,确保每一项风险都有据可查。同时,我们把风险议题固定进每月的值班例会和季度服务回顾中,让风险识别成为一项常规工作,而不是项目初期的一次性动作。随着季节变化和业务调整,新的风险点还会不断浮现,比如台风季节船台终端受损概率上升、重点时段保障任务集中等,都会被及时补录进风险清单。
三、进行定性风险分析
针对识别出的风险,我们借助概率影响矩阵评估其对服务时间、成本、质量和范围的影响程度,按优先级排序。除了项目干系人,我还邀请了公司内做过同类涉水业务系统运维的同事参与讨论,以提高判断的准确性。分析后大家一致认为,AIS船台终端数据传输的有效性和实时性直接决定船舶动态掌握的准确程度,影响面最大,被列为第一级风险;通信链路中断次之;人员流失和备件不足再次之。排序结果让大家对有限资源的投放方向达成了共识。
四、进行定量风险分析
在定性分析基础上,我们请有经验的老员工协助,对高优先级风险给出悲观、乐观和最可能值,量化更新风险记录优先级表。根据量化结果,我们专门加强了AIS终端备件的储备管理,针对船台终端易受海上环境影响、损坏率高的特点,建立了备件快速调拨机制,从源头上降低该类风险造成的停机时间。同时,对链路中断的风险,量化评估了双路由改造的投入与收益,为后续处置决策提供了数据支撑。
五、制定风险处置计划
依据完善后的风险记录表,我们针对不同风险采取了对应的应对策略,总体以预留资源应对突发。比如预留二十天的服务改进完善期,避免带着问题交付;对熟悉海事信息化系统的关键技术人员实行AB角管理,防范人员离职断档;对专业性较强的船台终端现场维修,在取得客户同意后委托第三方实施,避免单项风险波及整体。各项措施都明确了责任人、完成时限和回退方案。
六、风险监控
风险监控贯穿服务全程,与规划设计、部署实施、运营管理、持续改进各阶段相互衔接。我们按风险类型和优先级确定监控频率与深度,对高风险项加密巡检、重点观察,对一般风险按常规节奏监控,结合日常巡检和里程碑节点开展监测控制,并根据绩效情况及时向干系人反馈。在每月6日、21日的评估会上,我们集中研讨监控得失,更新计划、提交变更,确保各环节进展始终处于掌握之中。在监控实践中,我们还摸索出一套与客户协同的方式:每月向局信息中心提交风险监控简报,内容包括风险状态变化、应对措施执行情况、新识别风险提示等,让客户对风险状况心中有数。这种透明化的沟通既增进了信任,也便于在风险升级时快速调动客户资源协同处置。例如有一次主干链路出现隐患,正是依靠提前沟通,局里配合我们在窗口期完成了链路割接,避免了对业务的影响。
七、风险跟踪
风险跟踪关注已识别风险和突发风险的观察记录。我们设计了贴合本项目实际的唯一性风险清单,由专人维护,及时更新。运维过程中,风险管理员采用偏差分析方法,定期将实际进展与IT服务规划比对,分析时间、成本等方面的偏差,及时向团队报告风险动态,保持全员对风险的警觉,让风险意识渗透到日常工作的每个环节。我们还针对风险清单设置了更新频率要求,规定一般风险每月复核一次、高风险每两周复核一次,动态调整处置措施,确保风险管理始终贴合服务实际,而不是停留在纸面上。
2021年6月合同到期时,项目圆满完成全年考核任务,系统各模块运行平稳,事件响应、反馈、跟踪及时,巡检按期完成,全年未出现用户主动投诉,系统运行可靠率达到100%。尤其在年初恶劣天气频发的时段,船舶监管系统经受住了考验,为辖区通航安全提供了有力保障。当然,过程中也有波折,比如前期服务需求识别不够充分、中途有运维人员离职,一度给服务带来压力,但通过及时补充人员和调整安排都妥善化解。这次项目让我深刻体会到风险管理对运维服务的重要性,也让我认识到风险清单的维护是一项持续工作,不能一劳永逸。后续我会继续研读ITSS、ITIL等标准体系,把学到的风险管理方法应用到更多项目中去,为用户提供更专业、更可靠的服务。