如何通过AI 全面提升运维效率?选型宝分享AIOps实战案例

李维良:是否可以结合一些行业案例,做一些具体的阐述?

李诚:

应用场景1:异常监测

我们的一家做航空行业的客户,在业务开展过程中,每天600个业务应用系统(包括售票系统、退票系统、进仓系统、订单查询系统等)产生海量日志数据(2个小时产生7TB/10亿条的增量数据)。用户希望能够对海量数据进行实时分析,及时发现业务波动并进行预警。这家客户的需求,具有数据量大、指标复杂度高、实时性要求高(1分钟之内完成数据的采集、分析、呈现)等特点。

云智慧从2016年开始服务这家客户,并为其建立了业务运营实时监控分析平台,实现了业务异常预警、业务基线预警、运营监控分析、日志实时查询等目标。

通过分布式大数据处理、内存计算等技术,我们为该用户实现了10万条/秒的并发数据实时分析处理和秒级告警处理。通过深度学习、时序预测等算法的应用,使预测的准确率得到大幅提升,预测结果与实际情况的偏差仅有3%。

应用场景2 :关联分析

我们的一家金融行业客户是数字化步伐比较快的大型金融机构,在国内拥有3个数据中心,600个业务应用系统,上万台物理设备,系统彼此之间调用关系复杂,并且部分核心业务之间具有强依赖关系。

这些应用系统每天产生海量日志数据和告警信息,对日志报文数据的处理分析时效性差,效率低,IT的整体运维效率已经成为制约企业数字化发展的障碍。

针对这家企业的情况,云智慧基于过去多年在监控宝、透视宝、压测宝等产品上积累的技术和经验,为其建立起了业务与IT的统一视图,厘清了各类指标数据、日志数据和事件数据的内在关联关系,并进行了统一的建模和分析。

在此基础上,云智慧的智能业务运维平台为这家客户实现了关键业务指标和体验指标的预测和异常检测,提升了业务运营和IT管理效率,初步实现了IT运营的数字化和智能化。

金融管控中心大屏效果展示

应用场景3 :智能告警

当IT故障发生时,多个系统会同时发出告警,这为运维人员带来巨大的困扰,使故障处理的效率大幅降低,这种现象就是“告警风暴”。告警风暴是IT运维中的常见场景,也是AIOps的典型应用之一。

我们的一家药企客户,现有近10个面向各类客户的线上产品和办公系统,随着业务的快速发展,他们在全国范围内建设了3个数据中心,拥有上万台物理设备。系统彼此之间调用关系复杂,并且部分核心业务之间具有强依赖关系。

运维团队每天会接收近万条的故障告警通知消息,人均接收量在100-200条,并且漏报、错报情况频发。故障发生时,需要各部门协调才能定位解决问题,平均解决时间需要1个小时以上。用户目前有5套监控系统,并且每个系统会独立的产生告警通知,当出现大规模故障时,运维人员会同时收到来自各个系统的大量告警通知,对正常的工作造成了极大困扰。

针对这家企业的情况,我们为其部署了智能告警平台,利用 restAPI 、agnet 采集等方式,对接各个监控系统,将各个系统的告警消息通过智能告警平台进行统一汇聚和整合,让运维人员可以在一个平台处理所有故障。

智能告警平台正式部署后,我们成功将告警量压缩了93%,即每100条报警数据,可以压缩到7条。同时,系统还可以对报警信息进行科学分类,并及时发送给正确的人。

智能告警平台大幅缩短了整个运维团队的平均响应时间(MTTA),从过去的平均25分23秒降低到了4分16秒。通过动态基线等技术,可以将错报、漏报率分别从22.4%降低到了8.5%;9.3%降低到了3.8%。

在此基础上,我们最近还为用户实现了“故障预测”功能,帮助用户提前了解可能发生的IT问题,最大限度降低IT故障对业务的影响。

部署方式与落地方法论

李维良:AIOps落地,需要怎样的方法?

李诚:

智能运维的落地也不是一蹴而就的,它需要经历三个阶段:

第一阶段是大数据运维,构建统一监控平台,实现IT资源的统一管控。利用大数据的手段,采集、分析基础设施、网络、日志等IT监控数据,通过海量IT数据的实时处理分析,消除数据孤岛,实现统一的告警,提升运维管理效率。

第二阶段是业务运维,全面提升用户体验和业务系统健康,实现业务和IT的双向驱动。用户体验和业务效能是数字化业务的两大核心指标,通过IT和业务双向驱动的业务运维,能够帮助企业发现IT故障对业务造成的影响有多大、IT如何更好地支撑业务转型、如何最大程度地降低业务损失。

第三阶段是智能运维,构建智能化的IT运营管控体系,持续提升业务价值。通过智能告警、异常监测、根因分析、自动处置、故障预测,极大提升IT运维效率、保障业务连续、减少业务损失。

这其中,大数据平台是基础,是整个智能业务运维体系的基座。企业用户可先打好大数据基础、并在此之上,逐步增加应用模块,采用积累经验、小步快跑的方式,让AIOps在自己的企业成功落地。

李维良:云智慧智能业务运维平台支持怎样的部署方式?

李诚:云智慧智能业务运维平台采用混合云架构,支持本地私有化部署和基于公有云的SaaS部署。做为国内第一家实现AIOps跨行业场景化应用的业务运维解决方案提供商,云智慧可以为用户提供从大数据平台,到智能运维模块、再到专家与实施的全方位服务,满足企业的基础需求和个性化需求,促进企业数字化业务的发展。

© 版权声明
THE END
喜欢就支持一下吧
点赞0 分享