ONEPSOFT | 软考学习知识库
风电行业对信息系统的依赖程度很高。某大型风力发电企业旗下拥有3座风电场,分布在省内沿海滩涂和丘陵山区,总装机规模约60万千瓦,在役风机约260台。风电场集控中心通过远程监控平台实时采集风机运行数据、测风塔气象数据和升压站综自信息,生产业务几乎全部依托信息系统运转,因此对各信息系统的可靠性、可用性、连续性等性能要求非常高。由于风电场位置偏远分散,台风、雷暴、冰冻等极端天气频发,系统中断、数据丢失以及各种不确定性和风险随时可能出现,对信息化设备运维工作的应急管理提出了很高要求。
2022年7月,我公司中标了该企业风电场群信息化设备运行维护项目,由于我曾有同类运维项目的成功案例,公司任命我为系统规划与管理师,负责管理该项目的运维工作。本运维项目主要工作包括风机远程监控系统、风功率预测系统、升压站综合自动化系统、测风塔数据采集系统及集控中心网络等生产应用系统的网络维护、设备故障和异常操作处理、设备监控、系统性能优化配置、重大事件现场值守,以及服务器、网络、数据库的日常监控与维护,定期形成巡检报告和维护日志。项目合同金额为208万元,服务期限为一年。由于电力行业特殊性,该公司生产业务流程众多,信息化设备及系统复杂,系统一旦出现大面积中断或数据丢失,将严重影响生产调度和运维决策,进而影响客户对服务的满意度,应急管理在本次运维服务中具有特殊重要的地位。为此,在部署实施阶段,我把应急预案管理作为重中之重,重点从制定应急响应预案、演练启动与执行、演练结束与评估总结、成果运用与文档备案及考核奖惩几个方面开展工作。
一、制定应急响应预案。天有不测风云,对意外提前进行预防,可以减少损失、避免伤害。对信息系统维护来说,对意外和突发事件的提前预防显得更加重要。在IT服务规划设计阶段对服务需求进行识别时,我和团队成员就对客户关于系统可靠性、可用性、连续性的关键需求进行了认真识别和定义,对项目执行中可能出现的各种风险进行了评估。例如,由台风、雷暴等自然灾害引发的风机大面积脱网,通信链路中断导致远程监控失效,升压站及机房供电故障,数据库、存储、中间件故障导致的重大系统性故障,以及计算机病毒传播、网络攻击等引发的重大安全事件,都有可能对IT服务的运营产生严重影响。为了避免这些事件发生,或在发生后及时恢复系统和数据,我们制定了风险评估和应急预案编制计划。
在应急预案中,我们明确了目标和应急演练的原则,要求演练工作紧密结合应急管理工作实际,根据资源条件确定演练方式和规模。同时成立了应急组织体系并划分了职责:应急指挥小组负责启动应急预案、协调行政工作和后勤保障资源,作为与企业管理层和业务部门沟通的接口,决定其他重大事项,并负责组织本预案的维护、演练和管理;IT恢复小组则细分为通信恢复组、风机数据恢复组、升压站与机房保障组、安全恢复组、系统与存储恢复组等,统一由各组组长指挥调度,各组分工明确、协同作战。此外,我们还对突发事件进行了等级划分:系统性故障造成20%至60%的集中基础、核心、关键系统不可用,且在24小时内无法恢复,或者60%以上的系统不可用且在12小时内无法恢复的,定义为特别重大突发事件;同时划分了重大突发事件、较大突发事件以及其他造成区域性业务中断的故障。划分等级后,我们便于界定故障类型,制定不同的应急预案和处理措施。例如,针对台风、冰冻等本地区多发的自然灾害,预案中明确了提前发布预警、加强巡检、备足应急物资等措施;针对风电场地处偏远、抢修路途较远的特点,我们按片区预置了备件和抢修力量,缩短故障恢复时间。
二、演练启动与执行。演练正式启动前,各参演单位按照应急指挥办公室通知的场景进行集合,并由我作为演练总指挥宣布演练开始,正式启动演练活动。在演练过程中,我们开展了通信链路及升压站UPS供电故障的演练:接到演练启动指令后,各负责人立即开始工作,通信恢复组马上查找原因并迅速切换备用链路,机房保障组准备和恢复升压站机房设备与设施,重点保障供电、空调和门禁,确保恢复期间所需通信链路畅通。演练过程紧张有序、有条不紊,这与我们提前进行桌面推演分不开。在演练中,风机数据恢复组模拟了远程监控中断后通过备用通信通道恢复数据接入的过程,系统与存储恢复组核对了数据备份的可用性。我安排人员对预案演练的具体实施做了详细记录,并用相机拍照留存,以便记录和发现整个演练过程中存在的问题,为今后的演练工作积累经验。
三、演练结束与评估总结。按照预先制定的演练方案,所有内容及程序都按要求逐一实施完成后,我宣布演练结束。对于演练过程中的各个场景,评估小组都做了详细的记录和评价,填写了《通信链路及UPS供电故障演练方案实施情况评估表》,并在演练结束后召开简短的评估总结会,由各演练小组组长分别发言,对本次演练中做得好的地方和不好的地方进行评价。针对演练中出现的情况和问题,我作为总指挥做了总结:部分参演人员对演练重视不够,没有把演练故障当成真正的问题对待,缺乏紧迫感和危机感;部分演练人员业务技能不够熟练,比如进行链路切换时对操作顺序和流程不够熟悉,响应速度没有得到提升。这些都是我们在演练过程中需要改进和改善的地方。
四、成果运用、文档备案与奖惩。对各小组提出来的问题,我组织人员进行了汇总和分类,针对各类问题制定了相应的整改措施:修改完善应急预案,有针对性地加强对应急人员的教育和培训,对应急物资储备不完善、配备不齐全的情况进行更新补充,尤其是增加了风机机舱备用通信模块和电源备件的储备。为使后期工作顺畅开展,我组织人员建立了改进任务表,并按照规定时间对改进情况进行跟踪和监督检查。完成所有工作后,按照相关规定,我们将演练计划、演练方案、应急演练评估报告、应急演练总结等资料交由企业安全管理部门备案,并归档保存一份作为备查资料。同时,为了鼓励演练中表现突出的个人和小组,我们给予了适当的物质奖励;对于不按照规定进行演练、影响演练正常开展的小组,严肃提出了批评。
2023年7月,项目如期交付。在满足运维SLA的前提下,项目在质量、成本、进度等方面都达到了预期。由于我和团队成员共同努力,提前对项目进行风险管理,评估各种运行环境,制定灾难恢复计划以及应急响应预案并进行演练,项目的应急管理工作相当到位。项目执行以来,各项绩效完成良好,运维的各个信息系统及设备均运行正常,服务的可靠性、连续性以及可用性均得到了良好保障,特别是成功经受住了当年台风季的考验,汛期雷暴天气下系统数据保持完整,客户对此给予了极高的评价和肯定。项目执行过程中虽然也有一些小问题,但经过我不断的改进和纠正,最终使项目顺利交付。今后,我将继续努力学习相关知识,未雨绸缪、防患于未然,将服务质量从根本上加以提升和改进,为不断提升自己的管理水平继续努力。