Skip to main content
指标监控回答”系统正不正常”。本小节整理以 Prometheus 为核心的采集、存储、展示与告警体系。

组件分工

监控方法论

  • 黄金四信号:延迟、流量、错误、饱和度,服务监控的通用框架
  • RED 方法:Rate、Errors、Duration,面向请求驱动型服务
  • USE 方法:Utilization、Saturation、Errors,面向资源型组件

落地要点

  • 基数控制:高基数标签(如用户 ID 作 label)是 Prometheus 的内存杀手
  • 告警分级:分 critical / warning,告警要可执行,避免狼来了
  • 与日志联动:指标发现异常,跳到 ELK 查细节

延伸阅读