ONEP软考智能体 | 软考论文自动生成与批改专家
· 论IT服务的风险管理
1.概要叙述你参与过的或者你所在组织开展过的 IT 服务项目的基本情况(背景、目的、组织结构、周期、服务对象、服务方式、服务内容、交付成果等),并说明你在其中承担的工作。
2.结合项目管理实际情况并围绕以下要点论述你对 IT 服务风险管理的认识。
(1)项目风险管理的主要活动
(2)在人员、过程、技术、资源方面可能会存在哪些风险。
(3)请结合论文中所提到的 IT 服务项目,结合风险管理的过程和识别的风险,介绍你是如何进行风险管理的(可叙述具体做法),并总结你的心得体会。
· 论北方某市智慧工地监管平台IT服务风险管理
2022年9月,我司成功中标北方某高新区智慧工地管理平台运维服务项目,该项目由当地城市建设管理局发起,合同金额122.6万元,服务周期1年,重点内容包括中心机房设备服务、监控指挥中心设备服务、专用光纤组网线路传输服务、专业技术人员驻场运行维护服务等。该平台每年平均管理工地数量超过40个,管理相关劳务人员超过6800人,集成监控设备超过2400台,且部分市政扩建项目位于偏远山区,存在交通不便、网络不畅等问题。公司综合考量后任命我为本项目系统规划与管理师,我组建了7人项目型团队,包括系统规划与管理师1人、客户关系经理1人、技术支持工程师3人、高级技术经理1人、质量经理1人,成功统筹相关工作并完成交付,实现客户提升平台稳定性和平台服务质量的目标诉求,赢得客户一致好评并顺利签署了下一期运维合同。
本文将结合我在该项目中的管理实践,从三方面重点论述IT服务风险管理对于达成运维目标的重要性:1、重视风险管理并落实各项活动内容;2、围绕人员、资源、技术、过程要素制定风险管理计划3、偏远工地网络传输风险的管理实践。
一、重视风险管理并落实各项活动内容
风险管理帮助减少风险对于组织资源、收益和现金流造成不利影响,助力团队更可靠地实现项目目标。风险管理活动包括风险管理计划、风险识别、风险定性分析、风险定量分析、风险处置计划、风险监控、风险跟踪。本项目中我和团队严格落实风险管理,促成了SLA目标的顺利达成,例如,通过对偏远山区网络卡顿问题进行重点风险管控,团队成功实现网络优化目标,用户满意度从60%提升至90%。
二、围绕人员、资源、技术、过程要素制定风险管理计划
制定风险管理计划是基于风险角度对服务一个纵观全局的考虑、分析和规划,也是风险管理过程的第一步。初期我和团队依据服务范围说明书、服务预算等资料,联合客户、第三方代表采用头脑风暴等方式,讨论并分析了可能的风险点:1、人员方面,团队新手成员对于服务工具的错误操作可能导致客户系统数据丢失。例如,会上小管主动提出对于服务监控工具的使用不太熟练;2、技术方面,可能存在发现问题的技术与服务对象不匹配的风险。我和团队初定的网络连接稳定性监控指标和阈值为丢包率>=5%,延迟>=120毫秒,经与徐科沟通后发现不能完全满足客户要求;3、资源方面,可能发生备品备件、服务工具失效风险。我发现团队成员使用的监控工具并不相同,且版本老旧,功能落后;4、过程方面,根据信息科和建管科反应,过往平台运维不成体系。例如平台建设过程中发生变更时,仅变更申请审核就要2天。
经过内外部讨论并参考专家意见,我和团队最终确认了项目风险管理计划并明确风险分类、概率、后果、责任人等具体内容,下表截取部分重点:
|
D |
风险分类 |
风险概率 |
风险事件 |
风险诱因 |
风险后果 |
责任人 |
职责 |
|
101 |
技术要素 |
高 |
偏远山区项目网络不稳定的风险 |
山区运营商网络基站少,导致网络不稳定 |
高清监控展示大屏经常卡顿,甚至中断 |
小管负责、沈工协助 |
网络监控与运维 |
|
201 |
人员要素 |
高 |
网络监控不到位造成数据丢失 |
新手生产爬坡影响/培训不到位 |
影响智慧工地管理平台可用性和连续性 |
我(规划师) |
规划师团队管理 |
|
301 |
资源要素 |
较高 |
备品备件不足的风险 |
低成本限制,摄像头损坏 |
影响智慧工地管理平台可用性 |
小李(技术支持) |
备品备件管理 |
|
302 |
资源要素 |
高 |
网络和服务监控工具失效的风险 |
工具缺陷 |
不能及时发现服务器和网络的中断,影响可用性指标 |
我(规划师) |
规划师团队管理 |
|
401 |
过程要素 |
高 |
变更与发布过程不完善的风险 |
流程不清晰,管理制度不完善,缺少标准操作流程 |
影响变更发布效率和质量,可能造成质量、进度、成本方面损失 |
老卢(高级经理) |
业务流程梳理与SOP制定完善 |
|
501 |
其他 |
较高 |
服务器升级的风险 |
服务器升级会导致服务器运行中断 |
导致服务器可用性和连续性指标降低 |
沈工(技术支持) |
服务器等硬件设备运维 |
三、偏远工地网络传输风险的管理实践
本项目偏远地区网络问题较突出,我将结合风险管理过程论述我和团队的具体实践。
1、制定风险管理计划并识别风险
网络监控工程师是网络运维的关键角色,在初期风险讨论会上,大家用头脑风暴方式围绕预先草拟的风险管理计划进行讨论,计划中委任小管负责网络监控,他主动反馈监控工具使用不够熟练。对此,我组织智慧工地经验分享会,让老卢重点分享了某西南项目运维经验。同时与公司技术部总监William沟通并组织Nagios培训,小管冲劲十足以满分通过了培训测验,我还委任沈工协管网络监控工作,并补充风险管理计划中相应职责内容,使该岗位互备率提升至50%。
2、结合风险定性、定量分析合理制定风险处置计划
合理的网络监控指标是准确识别网络卡顿的关键。起初网络连接稳定性监控指标和阈值设定为丢包率>=5%,延迟>=120毫秒,但结合历史数据分析后,我们发现当丢包率达到3%、延迟超过100毫秒时,用户已经开始感受到网络不畅,我们意识到指标可能过于宽松。为此,我们跟徐科收集了近三个月网络数据,包括丢包率、延迟、投诉率和工作量等,通过定量分析,我们发现当丢包率调整为>=2%、延迟调整为>=100毫秒时,网络卡顿投诉率下降到2%,客户满意度提升至96%,为此我们重新调整网络稳定性监控阈值为丢包率<=2%、延迟<=100ms。在设计风险处置计划时,我要求小管7x24小时持续监控,月底集中评估并提交报告,并要求小管通过StatsD监控插件提供可视化分析报告。
3、持续风险监控与跟踪
风险监控是跟踪风险清单,监测残留风险和识别新风险的持续性过程。在9月中下旬某天,监控系统突发警报并显示某工地网络延迟飙升至200毫秒,小管第一时间联系到我,我们通过远程监控确认网络设备无异常后,迅速联系现场王工排查,并在2小时车程后赶至施工现场。王工反馈8月底的几次强降雨可能会导致网络线路受潮,经过检查,我们确实发现一处网络线路接头因受潮接触不良,我们对接头立刻进行干燥处理并重连,网络延迟迅速降至110毫秒以下,丢包率0.8%,我要求小管记录该事件日志并加强问题跟踪,并让小管和王工一周内全面排查设备线路受潮情况并提交巡检报告,以防类似事件再次发生。
2023年9月,运维合同到期,我和团队按照SLA约定如期完成交付,赢得了集团客户一致好评,并顺利签署了下一期的运维合同。本项目中风险管理起到了至关重要的作用,尤其是对网络监控环节的风险识别、分析、处理和监控,成功保障了网络优化提升的目标达成。诚然,过程中也发生了一些小问题,例如财务科出于节约预算考虑,起初不同意建立网络仿真测试环境,耽误三天部署时间,但经过深入沟通,财务姚科长认识到网络质量对服务优化的重要作用,同意方案后未产生任何负面影响。我和团队将充分吸取项目有效经验,持续努力提升,争取为更多客户提供更加专业和优质的服务。
ONEPSOFT Use AI, Beyond AI