ONEPSOFT | 软考学习知识库
气象业务对信息系统的时效性和可靠性要求极高,任何一次系统中断都可能影响天气预报发布和灾害预警响应。某市气象局承担全市天气预报、灾害性天气预警、公共气象服务等职责,所属气象综合业务系统包括综合观测数据平台、预报预警业务系统、公共气象服务门户、OA等,服务对象覆盖市局及各区县气象局,汛期还要承担防汛气象服务保障任务。2023年6月,我单位中标该局信息系统集中运维管理服务项目,合同金额137.6万元,合同期一年。工作内容包括各系统的故障处理、系统软件版本升级、系统性能优化配置、重大事件现场值守,以及服务器、网络、数据库的日常监控与维护,定期形成巡检报告和维护日志等。运维团队成员包括项目经理1人、系统规划与管理师1人、电话值班及运维人员2人、开发工程师1人,结合远程二线技术支持及三线专家力量,以确保各系统平稳运行。
由于我有过政务信息系统集中运维的成功案例,公司任命我为系统规划与管理师,具体负责该项目的运维管理工作。项目启动后,我通过回访了解到,现场响应不及时、设备监控不准确、支持人员经验不足等问题较为突出。经过调查,我发现团队人员能力参差不齐,造成人均工作负荷较重,无法及时调度响应;监控平台技术落后,难以支撑实际需要,对运维工作正常开展产生了影响。我切实从服务质量、服务风险和信息安全三个方面开展监督管理:通过制定质量方针、质量目标、质量计划,实施质量控制、质量保证和质量改进,确保满足服务级别协议;通过对风险进行评估、分析、制定应对措施,最大限度减少IT服务风险的发生;通过信息安全管理,确保组织资产、信息和数据的保密性、完整性、可用性、可靠性及可追溯性。
一、IT服务质量管理
IT运维服务质量管理是为了保证SLA的完成、提高运维服务水平所做的一系列活动,包括运维服务质量策划、运维服务质量检查、运维服务质量改进,以全面提升服务的安全性、可靠性、响应性、有形性以及友好性。
我通过对服务质量进行整体策划,结合业务实际需要以及当前运维能力水平,设定合理的质量目标,并计划需要采取的质量保证和质量控制活动,包括用户满意度管理、投诉管理、日常回访、内部审计和检查;同时确定了质量管理相关的职责和权限,确保任何过程所涉及的质量职能都清晰并制度化,最后形成质量策划文件,正式发送给相关干系人。例如,我们将汛期重点时段的服务可用性目标设定为不低于99.5%,并围绕该目标明确了值班值守、巡检频次和故障升级时限等具体要求。质量人员根据质量策划文件对运维服务质量进行检查和实施:团队定期与局方开展视频会议进行回访,与相关人员进行满意度调查,对服务级别协议的达成进行评审和回顾,并邀请第三方机构进行内部审计,以提升服务质量;我与客户相关负责人定期关注质量检查活动的执行情况,确保质量工作按计划进行,同时记录检查结果,以便后续质量改进。我结合业务现状和能力水平,对质量问题确定改进方向和目标,之后安排质量人员落实改进任务,如采购升级现有的运维工具,提升工具稳定性,以便更精确地监控网络或设备故障;针对技术人员知识经验不足的情况,开展技能培训,同时建立知识库,达到知识分享的目的。在此过程中,我定期关注改进情况,发现偏差及时纠正。
二、IT服务风险管理
风险管理包括策划、组织、领导、协调和控制等活动,通过风险识别、风险分析、风险评估等,提供事先应对计划,合理使用回避、减轻、分散和转移等方法,对IT服务运维的风险进行有效控制,确保服务目标的实现。
在服务启动初期,我基于风险角度对服务进行纵观全局的考虑、分析与规划,根据SLA、服务范围说明等关键文件,制定风险管理计划,涵盖相关角色与职责、风险类别、概率及影响等,确定了如何采取和计划服务风险管理活动的过程。在服务运维过程中,我不断识别和确定出风险及其基本特性以及影响方面,这是一项循环重复的工作。我根据SLA及风险管理计划等要素,通过头脑风暴等方式,识别出运维风险,并对其进行优先级排序,形成风险清单。通过定性分析,对风险发生的概率和影响程度进行综合分析,并按种类进行分组排序,分析其中的趋势。例如某类观测设备报障率近期大幅提升,经过调查发现,该型号设备已到达使用寿命,需进行更新升级。我根据相应优先级顺序,并结合实际需求,把应对风险所需成本和措施纳入IT服务预算和进度中。针对网络线路故障,团队考虑采取双冗余的应对措施,以减轻单点故障带来的损失,并明确应对计划责任人及职责,减少二级风险与残留风险;通过跟踪已识别风险、监控新风险的发生,保证风险计划的执行,并确保风险应对计划的有效性。团队不断对风险评估、审计和评审,进行差异趋势分析,确保运维风险清单的持续更新。
三、IT服务安全管理
针对服务安全管理,我主要从保密性、完整性、可用性、可靠性以及可追溯性几个方面进行监督管理。
在保密性方面,我建立信息保密机制,将制度贯穿落实于所有运维人员,定期监督实施效果,并在每个月统计泄密事故的发生情况,将服务报告发送给有关各方,并对泄密事件进行惩罚处理;另外,我采用安全U盘等访问受限的移动介质,确保在运维服务过程中,信息不发生非授权的修改、破坏和转移,保证数据完整性;同时还定期与客户回访,了解其对于服务过程中的信息访问是否有障碍,是否与实际需求相匹配。而对于系统及网络的可靠性监督管理是重中之重,我每周统计重大事故发生情况,并对普通事件的发生做趋势分析与调查,对比服务中断时间、服务恢复时间与SLA的匹配程度,还定期优化关键业务功能的应急预案,进行沙盘演练。在服务的可追溯性方面,我建立了完善的流程与机制,确保所有服务记录的可追溯性:客户业务人员必须通过服务台请求服务,服务台进行记录并进行派单,任何支持人员不得直接响应客户服务请求,一方面出于对服务变更质量与安全的考虑,另一方面也利于服务费用的核算与结算。
2024年6月,本运维合同到期。通过我和团队的不懈努力,圆满完成项目的各项运维工作,完成全年考核任务。项目团队的客户响应速度和业务熟练度明显提升,监控平台告警更为及时和准确,服务管理流程也更为规范化和制度化,同时团队内部建立起了运维服务的知识库和各类机具的备件库,以便及时替换、确保业务连续性。尤其在汛期气象服务保障期间,各系统不间断运行,经受住了考验。客户对我们服务团队大加赞赏,服务满意度大幅提升。该项目使我认识到服务监督管理阶段对运维项目的重要性,质量、风险、安全三者相互交织,必须统筹推进:质量是服务的底线,风险是质量的保护网,安全是信息资产的前提,通过践行ITSS标准,不断从这三方面进行监督管理,对于提升IT服务质量、降低成本、提高满意度具有重大意义和深远影响。当然,我也深刻意识到自己的一些工作方式、方法还有需要改进的地方,今后将认真总结经验和不足,注重知识积累和知识转移,促进运维服务管理水平的持续提高。