AI驱动下的可观测平台架构升级实践_第1页
AI驱动下的可观测平台架构升级实践_第2页
AI驱动下的可观测平台架构升级实践_第3页
AI驱动下的可观测平台架构升级实践_第4页
AI驱动下的可观测平台架构升级实践_第5页
已阅读5页,还剩39页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

AI驱动下的携程可观测平台架构升级实践演讲人:周昕毅

02

可观测数据治理实践

01

携程可观测平台介绍

03

架构升级助力AIOPS

04

案例实践与展望目录携程可观测平台介绍-

为用户提供一站式旅行服务的网站-

应用数量:

1w+-

实例数量(虚拟机+容器):40w+-

每分钟新增Metric数量:10亿+-

每日新增日志存储:1PB+ About

tripLogging-

系统日志-

应用日志-

业务日志-

负载均衡日志-第三方系统日志Tracing-

事件上下文信息-

函数级别调用栈-应用调用关系Metric-

系统性能指标-

应用性能指标-

业务埋点指标-

日志聚合指标网站当前有没有“问题”?

可观测性数据有哪些“问题”在哪里“问题”为什么出

现“问题”的上下文

聚合场景化故障处理-提供“上帝视角”-提升故障处理效率-基于历史经验自动解决故障根因定位-确定故障影响范围-

全链路追踪-

专家系统的数据依赖监控告警-

硬件/OS异常-

应用级别异常-

业务指标异常

可观测性数据有什么用快速发现加速定位根本解决 AIOps&可观测数据可观测数据采集硬件资源基础软件应用软件可观测数据存储大数据处理智能分析AI工具链智能决策AIOps智能化平台管理容量-

容量评分-

HPA/VPA配置推荐-

容量预测&压测分析监控告警-

智能告警-

告警归因-

故障定位-

故障处理管理变更-

变更风险检查-

自动刹车-

智能化发布AIOps辅助决策层

携程AIOps实践数据算法

携程AIOps实践-根因定位根据应用Metric报错数据和应用调用链Trace数据

自动分析当前故障关联关系,提升根因定位效率数据及时性-

海量新增日志秒级写入-

日志丢失率控制-

全链路传输实时性微服务架构-

应用数量快速增长-

应用调用关系复杂可观测系统稳定性-

一站式平台打通多个监控系统-

监控数据延迟导致误告警-

容量规划&指标治理体系云原生技术-

HPA(分钟级交付数千容器)-

时间序列数据库的基数膨胀1-5-10目标-

1分钟发现需要秒级告警-

快速定位依赖可观测体系查询效率-

Metric查询毫秒级响应-1hLogging查询秒级响应-日志平均保留天数>7

可观测平台面临的挑战有哪些携程可观测平台一站式产品入口

携程可观测平台介绍Metric统一查询层日志统一查询层自研Tracing系统Metric

DB1日志归档全局报表Clog系统ClickHouse冷热分层CAT系统多指标联动OTEL接入Metric治理Metric

DB2统一元数据可观测数据治理实践

携程日志系统架构-

新增日志Senario:平均每月50+新增场景-

存量日志场景保留天数持续增加(14->30->90…)-

日志容量峰值日增>

1PB

可观测性数据膨胀-

日志量持续增长的问题

可观测性数据膨胀-

日志量持续增长原因分析-

业务自然增长造成的日志增加

…最理想情况:)-

存量日志需要延长时间应对客诉处理、故障分析、审计和合规需求(Top100日志平均保存时长为98天)-

做加法容易,做减法很费劲,研发普遍采用详尽的日志记录策略、为了确保后续排障时能有效定位-

存储字段不断增加,大量场景需要保存请求报文和访问报文,极端场景下单个报文字段长度超过20万字符-ClickHouse压缩率较高,是平均单价较低的一种存储介质,相对而言容滥用的情况 Logging日志治理实践从分散到统一-

统一查询、统一存储-

统一元数据-

公司内推进日志使用最佳实践Loggig最佳实践-

遵循日志统一规范-

设置合理的保留天数-

设置合理的发送阈值-

超过阈值时有合理的采样策略日志存储治理-

本地磁盘+分布式存储-

冷热分离技术方案-

表级别Quota-

租户级别Quota日志查询治理-

用户SQL智能改写-

查询QPS限制、时间范围限制-

大表扫描限制-

查询历史回顾2024年初2024年底Metric

Insert112million/s150

million/sMetric

Query4000query/s5000query/sTriggerCount15w18w

可观测性数据膨胀-告警数量持续增长的问题-严重的告警信息被低优先级告警信息淹没-“狼每天都来”,工程师对告警敏感性降低

可观测性数据膨胀-

Bigeyes告警中台建设

可观测性数据膨胀-

Bigeyes告警中台建设Oncall机制-

引入Bot协助处理-

告警自愈能力提升-

故障响应及处理方法沉淀告警分级-

P0/P1/P2/P3-

告警定期review-

及时响应率-

P0/P1告警处理时效性要求告警降噪-

告警聚合能力提升-自动抑制和收敛机制-

控制单位时间内告警数量

可观测性数据膨胀-告警治理手段Metric-nameLabel-namesLabel-valuesCardinalityrequest_duration_secondsipaddress10.0.0.1/10.0.0.2/10.0.03…HPA场景下会持续增加hostnameCTN-01,CTN-02,CTN-03…

.containeridaxxxx,bxxxx,cxxxx极端情况:应用有异常每30秒重启一次,containerid数量会持续

累积增加appid10001,10002,1003

可观测性数据膨胀-

Metric高基数问题过滤能力-自动识别无效的维度-

实例维度->应用维度-

不期望单靠Metric解决所有问题Metric指标治理-

高基数指标的识别和检测-

非法写入自动封禁-

tagvalue禁止使用随机数-

字符内容最大值限制容量规划-

Metric存储集群自身的监控-

关注ts数量增长-

尖峰流量应对预案监控工具功能升级-

增加指标聚合能力-

引导用户进行聚合配置-

原始数据降维,收敛指标维度-

MetricFederation建设

可观测性数据膨胀-

Metric高基数问题解决方案平台架构升级助力AIOPSPROMXYMetricFederation查询入口 Metric

Federation架构升级VictoriaMeticsDB1VictoriaMeticsDB2VictoriaMeticsDBnClickHouse统一API元数据管理预聚合管理自动限流

构建日志统一查询层(1)-

基于统计分析的不合理查询过滤-

基于规则的问题查询禁用-

平均每天拦截1.5K+不合理用户查询-自动禁用有问题查询来源

构建日志统一查询层(2)自动封禁日志缓存加速SQL改写

日志跨集群迁移工具-让存量日志“动”起来

日志跨集群迁移工具-

“Clickhouse

Balancer”-

集群内服务器剩余空间趋同-

业务高峰期扩容服务器缩容-

“冷”“热”数据定期搬迁系统级监控指标-

CPU-

内存-

磁盘IO-

网络IO-

其他系统服务日志统一采集-

syslog-

kernel-log-

安全登录日志-

auditlog-

服务启停日志内核级监控指标-

ebpf

metrics-

内核异常-

系统中断情况-

硬件监控-

其他底层服务

携程统一监控Agent实践-采集内容Trip-All-In-One-AGENT网络安全审计操作系统硬件格式和命名统一使用统一的监控Agent可以确保所有采集的数据采用一致的格式和标准,便于后续的存储、处理和分析。统一的命名规范可以减少数据混淆,确保不同来源的数据可以正确关联和对比。集中管控集中配置:通过统一的Agent,可以集中管理和配置监控策略,减少了分散管理带来的复杂性和错误风险。统一策略:可以应用统一的数据采集、存储和处理策略,确保所有数据治理措施的一致性和有效性。安全合规可以实施统一的安全策略,如数据加

密、访问控制和审计日志,确保数据的安全性和合规性。监控Agent在安全审计中是一个重要

的环节,可以确保安全策略的收口,自动化巡检,策略覆盖度的提升落地。

携程统一监控Agent实践-收益分析

携程统一监控Agent运营情况

可观测数据价值深入挖掘-

整体思路Tracing规范治理MetricLogging统一查询统一存储“优质”数据“低效”数据资源回收价值落地定期归档AIOPS平台

可观测数据价值深入挖掘-AI通用智能告警-数据采集-

由可观测平台提供统一的数据抓取和推送消息队列-配置中心-

由AIOPS团队提供规则配置存储-智能引擎训练-AIOPS团队消费消息训练时序曲线。

可观测数据价值深入挖掘-AI通用智能告警案例实践与展望“运维之眼”-监控工具提供基础数据-可观测平台提升数据质量“运维之手”-

自动化运维工具API调用-运维流程workflow

携程AIOps实践思路介绍数据标准化工具接口标准化AIOps小助手问题诊断决策执行运维操作-典型场景包括:故障磁盘自动拉出集群;故障机器自动隔离;发现某类型日志自动重启应用;-规则明确、执行流程固定、影响面可控的情况,接入AIOPS助手可以显著提升工作效率、降低故

障处理时间

日常运维工作中的痛点问题-被动式故障管理发现问题匹配规则自动执行

日常运维工作中的痛点问题-被动式故障管理发现问题智能诊断

日常运维工作中的痛点问题-被动式故障管理

日常运维工作中的痛点问题-被动式故障管理 日常运维工作中的痛点问题-

RCA会议自动总结-

可观测性平台提供基础数据-

借助大模型的能力,进行高效总结流程优化容量管理-典型场景包括:智能告警、智能变更、根因分析、容量管理-被动式

-

>主动式故障管理和故障防御机制

日常运维工作中的痛点问题-主动式故障管理知识积累发现“

冒烟点”

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论