ONEPSOFT | 软考学习知识库
2023年3月,我司成功中标某化工园区安全生产智慧监管平台运维服务项目,该项目由园区管理委员会发起,合同金额232万元,服务周期1年,重点工作包括安全监测数据中心机房设备运维、视频监控系统运维、有毒有害气体泄漏监测传感网络运维、应急指挥平台运维、专业技术人员驻场运行维护服务等。该平台自2021年建成以来,覆盖园区入驻化工企业120余家,部署有毒有害气体监测点800余个、视频监控摄像头2000余台,关联各类传感与通信设备超过5000台,且部分企业装置位于滩涂远郊区域,存在网络条件差、交通不便等问题。公司综合考量后任命我为本项目系统规划与管理师,我组建了8人项目型团队,包括系统规划与管理师1人、客户关系经理1人、技术支持工程师4人、高级技术经理1人、质量经理1人,成功统筹相关工作并完成交付,实现客户提升平台稳定性和服务质量的目标诉求,赢得客户一致好评并顺利签署了下一期运维合同。
本文将结合我在该项目中的管理实践,从三个方面重点论述IT服务风险管理对于达成运维目标的重要性:一是重视风险管理并落实各项活动内容;二是围绕人员、资源、技术、过程要素制定风险管理计划;三是偏远区域数据传输风险的管理实践。
一、重视风险管理并落实各项活动内容
风险管理帮助减少风险对于组织资源、收益和现金流造成不利影响,助力团队更可靠地实现项目目标。风险管理活动包括风险管理计划、风险识别、风险定性分析、风险定量分析、风险处置计划、风险监控、风险跟踪。本项目中我和团队严格落实风险管理,促成了SLA目标的顺利达成,例如,通过对偏远区域监测数据传输问题进行重点风险管控,团队成功实现网络优化目标,用户满意度从60%提升至90%,这也印证了风险管理对服务交付质量与客户信任的直接影响。
二、围绕人员、资源、技术、过程要素制定风险管理计划
制定风险管理计划是基于风险角度对服务一个纵观全局的考虑、分析和规划,也是风险管理过程的第一步。初期我和团队依据服务范围说明书、服务预算等资料,联合客户、第三方代表采用头脑风暴等方式,讨论并分析了可能的风险点。人员方面,团队新手成员对于服务工具的错误操作可能导致客户系统数据丢失,例如会上新入职工程师主动提出对于监控工具的使用不太熟练;技术方面,可能存在发现问题的技术与服务对象不匹配的风险,我和团队初定的网络连接稳定性监控指标和阈值为丢包率≥2%、延迟≥200毫秒,经与园区信息中心负责人沟通后发现不能完全满足客户要求;资源方面,可能发生备品备件、服务工具失效风险,我发现团队成员使用的监控工具并不统一,且版本老旧、功能落后;过程方面,根据园区信息中心和监管部门反映,过往平台运维不成体系,例如平台建设过程中发生变更时,仅变更申请审核就要2天。经过内外部讨论并参考专家意见,我和团队最终确认了项目风险管理计划并明确风险分类、概率、后果、责任人等具体内容,下表截取部分重点。
| 风险分类 | 风险概率 | 风险事件 | 风险诱因 | 风险后果 | 责任人 | 职责 |
|---|---|---|---|---|---|---|
| 技术要素 | 高 | 偏远厂区监测数据上传不稳定的风险 | 滩涂区域通信基站少,导致网络不稳定 | 应急指挥大屏经常卡顿,甚至数据中断 | 网络工程师负责、技术经理协助 | 数据传输监控与维护 |
| 人员要素 | 高 | 监测数据处理不当造成数据丢失 | 新手生产爬坡影响、培训不到位 | 影响智慧监管平台可用性和连续性 | 我(规划师) | 团队管理与培训 |
| 资源要素 | 较高 | 备品备件不足的风险 | 低成本限制,传感器老化损坏 | 影响智慧监管平台可用性 | 技术支持工程师 | 备品备件管理 |
| 资源要素 | 高 | 网络和服务监控工具失效的风险 | 工具版本老旧、存在缺陷 | 不能及时发现网络和服务器中断,影响可用性指标 | 我(规划师) | 工具选型与部署 |
| 过程要素 | 高 | 变更与发布过程不完善的风险 | 流程不清晰、管理制度不完善、缺少标准作业流程 | 影响变更发布效率和质量,可能造成质量、进度、成本方面损失 | 高级技术经理 | 流程梳理与SOP制定 |
| 其他 | 较高 | 服务器升级的风险 | 服务器升级会导致运行中断 | 导致服务器可用性和连续性指标降低 | 技术支持工程师 | 服务器等硬件设备运维 |
三、偏远区域数据传输风险的管理实践
本项目偏远区域网络问题较突出,我将结合风险管理过程论述我和团队的具体实践。
制定风险管理计划并识别风险。网络监控工程师是网络运维的关键角色,在初期风险讨论会上,大家用头脑风暴方式围绕预先草拟的风险管理计划进行讨论,计划中委任网络工程师负责数据监测,其主动反馈监控工具使用不够熟练。对此,我组织经验分享会,让高级技术经理重点分享了以往化工园区项目的运维经验,同时与公司技术部门沟通并组织监控工具专项培训,新入职工程师以满分通过了培训测验,我还委任另一名工程师协管数据监控工作,并补充风险管理计划中相应职责内容,使该岗位互备率提升至50%。
结合风险定性、定量分析合理制定风险处置计划。合理的数据传输监控指标是准确识别数据卡顿的关键。起初网络连接稳定性监控指标和阈值设定为丢包率≥2%、延迟≥200毫秒,但结合历史数据分析后,我们发现当丢包率达到3%、延迟超过250毫秒时,用户已经开始感受到监控画面卡顿,我们意识到指标可能过于宽松。为此,我们跟园区信息中心收集了近三个月网络数据,包括丢包率、延迟、投诉率和工作量等,通过定量分析,我们发现当丢包率调整为≥2%、延迟调整为≥150毫秒时,数据卡顿投诉率下降到2%,客户满意度提升至96%,为此我们重新调整网络稳定性监控阈值为丢包率<=2%、延迟<=150毫秒。在设计风险处置计划时,我要求网络工程师7×24小时持续监控,月底集中评估并提交报告,并要求其通过监控插件提供可视化分析报告。
持续风险监控与跟踪。风险监控是跟踪风险清单、监测残留风险和识别新风险的持续性过程。在某月下旬某天,监控系统突发警报并显示某企业监测点数据中断,网络工程师第一时间联系到我,我们通过远程监控确认网络设备无异常后,迅速联系现场人员排查,并在2小时车程后赶至现场。现场反馈近期滩涂区域有重型车辆频繁通过,可能会导致埋地光缆受损,经过检查,我们确实发现一段埋地光缆被车辆碾压受损,立即协调施工恢复光缆并重新熔接,数据延迟迅速降至120毫秒以下,丢包率0.8%,我要求工程师记录该事件日志并加强问题跟踪,并让其与现场人员一周内全面排查区域内光缆敷设情况并提交巡检报告,以防类似事件再次发生。
2024年3月,运维合同到期,我和团队按照SLA约定如期完成交付,赢得了园区客户一致好评,并顺利签署了下一期的运维合同。本项目中风险管理起到了至关重要的作用,尤其是对数据监控环节的风险识别、分析、处理和监控,成功保障了网络优化提升的目标达成。诚然,过程中也发生了一些小问题,例如财务部门出于节约预算考虑,起初不同意建立网络仿真测试环境,耽误三天部署时间,但经过深入沟通,相关负责人认识到网络质量对服务优化的重要作用,同意方案后未产生任何负面影响。我和团队将充分吸取项目有效经验,持续努力提升,争取为更多客户提供更加专业和优质的服务。